「Z计划」 是智谱 AI 面向未上市初创企业与优秀独立开发者/团队,提供 Tokens 赞助、投资支持和技术支持等资源的创新加速计划。面向全球,持续招募中!(点击报名)「Z沙龙」是支持该计划的面向大模型领域的线下活动品牌。为鼓励自由发言,人人发言,我们暂时不披露参与者个人信息。本文不代表智谱公司认同文中任何观点。
AI native 硬件:端侧 AI 变革将至。大模型与现有终端融合型态探讨,AI 手机、AIPC、AI XR、AI 可穿戴设备、AloT、AI 座舱 芯片、成本以及数据隐私安全角度,端侧小模型有什么要求? 如何解决端侧硬件能耗、存储、算力在 AI 硬件使用场景需求下的平衡? AI native 硬件头脑风暴,对现有产品吐槽,AI native 硬件杀手级场景会在什么地方? 我要 AI native 硬件创业,供应链+软件+硬件,怎么搭积木?
目录 建议结合要点进行针对性阅读。?
0、AI native产品一览
一、大模型与现有终端融合形态探讨,AI 手机、AIPC、AI XR、AI 可穿戴设备、AloT、AI 座舱,有什么有意思的形态?
1、前创业者分享:2C 端硬件的阻碍与难点,可穿戴及贴近需求的硬件:
2、某手机厂商分析师:AI 生态的理想状态,未来趋势及现有终端设备的作用:
3、另一位手机厂商专家:手机行业的内卷和对于 VR 的探索
4、某大厂 VR 眼镜从业者分享及相关讨论:从几个维度解释为什么 XR 眼镜相对手机来说,更适合 AI 的形态
5、投资人+大厂人:端侧的大模型学习人的手机操作等方向畅想
6、大厂自动驾驶从业者:自动驾驶的类比
7、智能驾驶、整车硬件、座舱从业者与投资人分享:智能座舱讨论
二、芯片、成本以及数据隐私安全角度,端侧小模型有什么要求?
1、某实验室研究人员:科研领域的尝试
2、某创业者:芯片成本和数据隐私安全的角度分享
3、某创业者:未来 AI 模型与硬件的三种部署方式畅想:
4、大厂人+连续创业者:硬件成本问题讨论
5、连续创业者:时延问题讨论
三、如何解决端侧硬件能耗、存储、算力在 AI 硬件使用场景需求下的平衡?
1、主题分享与讨论:关于 AI native 创业观察
2、讨论:端侧硬件能耗、存储算力,在 AI 硬件上的一些基础上的一些平衡
3、AR 使用体验分享
4、科研人员分享
四、AI native 硬件头脑风暴,对现有产品吐槽,AI native 硬件杀手级场景会在什么地方?
1、讨论:VR 究竟能成吗、什么时候能成?
2、讨论:定制化 AR 芯片 or 等技术成熟后组合创新
3、AI 硬件杀手型场景
4、OpenAI 会下场做硬件吗?
5、AI native 创业是更容易了还是更难了?
在开始之前,我们先来看看今年很火的几款AI native 硬件:
1、Rewind Pendant :Rewind Pendant 是一款可穿戴设备,可以捕捉您在现实世界中所说和听到的内容,然后将其转录、加密并完全存储在您的手机本地。
Rewind Pendant可以为你进行:录音转录、数据加密和本地存储。所有这些功能都在你的手机上完成,保障了绝对的安全性和隐私保护。
我们高度重视隐私问题,为此提供了一系列功能,确保不会未经他人同意记录他们的声音。https://www.rewind.ai/pendant
2、Rabbit R1:Rabbit R1 是一款新型人工智能驱动的移动设备,通过高级语音命令简化了应用程序的使用。
售价 199 美元,配备 360 度摄像头、触摸屏和 4G 连接。据其公司介绍,Rabbit OS 是首个建立在 Large Action Model(LAM 大动作模型)上的操作系统。
在 AI 功能层面,LAM 与 LLM 的区别在于,可以处理自然语言并转化为可执行任务。LAM 能与常见应用(如 Apple Music、Uber、eBay 和 Amazon 等)交互;
支持语音命令,代表用户执行复杂任务,如制定旅行行程、订票、购物、发送信息、控制音乐、回答查询等。
这个基础模型据称可以通过学习用户在使用特定应用程序时的意图和行为,来推断和建模人类在计算机界面上的操作,然后模仿和执行它们。
在不久的将来,用户可以教会自己的「rabbit」执行特定任务,比如使用图片编辑软件从照片中去除水印。https://www.rabbit.tech/
3、AI Pin:Humane 是一家由前苹果高管成立的硬件初创公司,他们做的可穿戴设备 AI Pin 于去年 11 月公开亮相。
4、TAB AI:Tab 是一个挂在您脖子上的小冰盘,可以聆听您(以及您周围的人)所说的一切。
5、OpenAI 和 Lovefrom 在软银 10 亿美元融资开发的备受期待的“人工智能 iPhone” 。好,看完现在有的产品,接下来是Z 沙龙 7th 的正文:
#1.
有什么有意思的形态?
编者按:AI 硬件是一个复杂的系统性工程,从最早的设计 PCB 线路板等电子设计流程,到编译后的 ic 烧录,再到通讯及互联设计;
感知环节:可穿戴设备和 always on 设备在监控健康数据和语音数据方面有优势。 决策环节:具有计算能力的终端更适合执行决策任务。 执行环节:手机和 PC 适合执行互联网服务,而车辆和机器人适合物理世界的交互。
规模够大,增长问题不需要重新思考; 小规模的算力足够,现阶段基本能跑 7B 端侧模型; 离互联网服务很近,不需要重新塑造软硬结合的生态。
作为用户,我们应该是幸福的,手机的使用体验会因为 AI 有很明显的提升; 作为大厂,是要保持危机的,手机厂商和应用之间的商业关系可能存在重构的机会; 作为创业者,可能注定要拥抱其中一个,要么选手机助理,给最好的调用服务,做一个小插件;要么选 AI native APP,需面临互联网时代的增长问题,当然也可以押注下一代终端设备。
因为现有的玩家自己就会去做这些 AI 的东西,作为一个创业公司来讲,不仅要打 AI 这张牌,基本功能也要做好,这并不容易,然后还要去打市场,这是非常非常难的。
算力与续航:XR 眼镜使用与手机相同的高通芯片,但由于续航需求较低,可以实现更高的性能,有利于 AI 算法的部署。 always on 问题:always on 状态不仅与技术有关,更与消费者习惯和产品形态有关。XR 眼镜作为日常佩戴设备,更可能实现长时间在线。 消费者习惯与产品形态:眼镜的接受度很高,消费者更习惯佩戴眼镜,这使得 XR 眼镜在长时间使用上具有优势。 沉浸感强:用户一秒进入体验
b. 手机厂商在 XR 领域的潜力:
-
技术储备:手机厂商拥有深厚的技术储备,包括荣耀手机明年即将推出的 Eyes Tracking 技术和 Mate 60 的 Always On 摄像头,这些技术在 XR 领域同样有价值。 (Always On 的黑白摄像头是创新。把手机当扫码枪用,即使手机没唤醒,但对准二维码时,它就知道要扫码。这是在系统和硬件上的创新,能用低功耗的黑白摄像头)。 市场进入时机:手机厂商尚未大规模进入 XR 市场,但预计在未来几年,如谷歌推出 XR OS 后,手机厂商可能会凭借其技术优势进入市场。
编者按:腾讯最近开源了个新的 Agent 项目:AppAgent,它是基于大语言模型构建的多模态 Agent,专门用来模拟人类用户操作智能手机中的各种应用程序。
编者注:PLAUD 致力于成为全球 AI 音频硬件领域的领航者。其旗舰产品 PLAUD NOTE 创新性地融合了双拾音技术,装备了三重麦克风系统:
编者按:2 月 1 日,面壁智能发布了旗舰端侧模型 MiniCPM,它以小博大的性能超越了 Mistral-7B,并在 MT-Bench 等榜单上表现出色。
有没有哪些现有的安卓应用的形态和 iOS 的形态是大模型无法实现的?或者说有些用户的应用场景是无法实现的?
编者按:
从方法的角度,规则驱动和数据驱动是完全不一样的,因为大部分的数据工作现在都在为我服务。所以,第一个关键点就是技术的发展,一个是技术的指数上升的脉络。 第二个关键点是对需求的理解,其实说到底,出行或者是物理世界的移动一定是刚需,所以这个需求是没有任何问题的,只要有人能解决这个问题。 -
第三个关键点是重 AI 的应用,我说的是绝对的重 AI。为什么车必须在车上运行 AI 呢?很简单,因为它是实时的,有危险性,要求高,它是刚需。 相比传统的AI,如人脸识别,并不需要一秒 60 帧识别它,你打开手机或者支付的时候就可以了,甚至是"Hey Siri",这不是最好的吗?那为什么我不能 always on 呢?
目前最重要的 AI 原生应用是自动驾驶,然后以此推断,我看到的是 Vision Pro ,12 个传感器,巨大的算力,以及始终处于开启状态。这是我的第一个观点。 用多模态做感知,和我们今天的专用模型、特斯拉这种端到端模型,肯定比不过特斯拉的最先进的技术。但三五年之后,它们会汇合,这个战略趋势是必然存在的。 -
今天大模型本身在体验和性能上已经过了一定的拐点,它会从算力上迁移到云端和终端,所以算力一定会溢出。 在这个观点之下,重 AI 的 AI 原生硬件会更大规模的普及。普及的关键转折点是要找到使用上的刚需。相当于是有一个代际差异的体验提升,同时又匹配到了这个能力。
芯片、成本以及数据隐私安全角度,
端侧小模型有什么要求?
第一点,区别于传统 yolo 用到的粗类型,我们表达 PoI 的有时候需要用一些多属性词汇,这就需要多模态大模型的优势; 第二点,我们是兼容当前终端的传感器,并在此基础上利用更多的语义信息,特别是在光照和外观变化方面得到比传统基于特征的 SLAM 系统更加鲁棒的框架; 第三点,如能直接从原有航拍图片上计算出结构化特征,并返回到作为地面站的无人车上,比实时传图片到云侧的通信开销更小、也方便做联邦学习技术上的隐私考量。
-
即使在端侧运行模型,成本也是很高的。这实际上是将成本转移到了用户侧,因为移动设备运行大型模型会很快耗尽电源,设备可能会变热、变慢。 因此,如果不能提供非常好的体验,这并不是一个有说服力的方案。可以用实时充电来弥补,但对于移动端设备来说,不能一直插着电源,这也取决于产品定义。 -
对于手机或其他通用设备,测试过程是非常复杂的。如果运行大模型,需要开启各种新功能,手机都有电源模型,都会进行测试。 即使电源消耗在预期范围内,也需要考虑设备的使用体验。目前,据发言人所知,只有 MTK 和高通的芯片能够调试出 7B 模型,但成本还没有调整。(天玑 9000,骁龙 8 Gen1) 如果是嵌入式设备,运行 7B 这种模型的芯片是非常贵的。未来端侧小模型创业形态可能不会是机器人,而是应该是一个基于软件的应用,就是一个手机 APP。
编者按:Rockchip 简称 RK,是一家总部位于福州的 SOC 设计公司。RK 基于 Arm cortex-A 内核设计的一系列 SOC ,在国内外的产业界和极客中很受欢迎。
编者注:DOF 是自由度 degree of free 的缩写是 VR 定位系统中的一部分,指的是物体在三维空间中的方式。目前 VR 中的 DOF 分为 3DOF 和 6DOF 两种。
3DOF 即 3 自由度,只有旋转坐标没有位移坐标,只能以设定好的虚拟头部为中心点,观察的基点源于头部视角,就像固定在电线杆上的摄像头可以任意旋转,但无法上下左右前后离开电线杆。
6DOF 即 6 自由度,在 3DOF 基础上再增加“上下、前后、左右”等 3 个位置相关的自由度。
头部从 3DOF 只能检测到头部转动姿态到 6DOF 伸头缩头等姿态,还可以检测身体移动上下前后左右位移的变化。所以 6DOF 更加符合人体体验,更具沉浸感。
#3.
AI Native:无法脱离 AI 存在,如 ChatGPT,无 AI 就没此产品,无此形态,这无能力。对于 AI native 来说,一个硬件产品如果无 AI 能力,那么它的产品形态跟价值基本上不存在。AI 硬件创业者应选择该类 -
AI Augmented:在没有 AI 的时候也可以用,有了 AI 过后,它的体验和能力是增强的, 但 AI 并不是这个产品,AI 加持不是最大的差异化;例如:车、PC、手机。创业者需避开该类
背景补充-导盲机器人 Glide
-
Glidance 公司开发的导盲机器人 Glide 在 CES 2024 上荣获了机器人创新奖。这款机器人旨在辅助视力受损人士,就像导盲犬一样。 Glide 配备了先进的传感器系统,能够进行精准导航和避障,并通过手柄上的触觉反馈和声音提示向用户传达信息。 -
传统的导盲犬通过牵引来引导视障人士,但这种方法有时会让主人难以掌握牵引绳,可能会引发安全问题。 而 Glide 则采用了更为贴心的设计,它不会强行牵引用户,而是根据用户的行动来调整自己的动作,确保用户在整个导航过程中始终掌握主导权和安全性。 -
值得一提的是,Glide 的售价与一部手机价格相似,这使得导盲机器人成为一种具有很高性价比的机器人设备。 导盲机器人的商品化与普及化,不仅能够提高视障人士的生活质量,同时也具有巨大的经济潜力。
-
创业的门槛似乎已非常高:我曾经拥有一个约 100 人的团队。我们每天都会产生各种创业想法,并开发最小可行产品(MVP),然后进行迭代。 但一位前辈指出,几乎所有能赚钱的点子都已被尝试过。这让我意识到,要在已有方向上创业确实充满挑战,因此我开始考虑转向尚未开发完全的硬件领域。 -
大模型的应用一个主要挑战是知识库的整合:尽管大模型的能力已经非常强大,但在实际应用中遇到困难。 如何将客户的数据库和业务内容与大模型结合,需要进行大量的知识库向量化工作,以及 NL2Sql 等技术的应用,这在工程量上极大,可能与模型本身的成本相当。 -
关于数据库的思考:在 Web 2.0 时代,数据的产生为大模型提供了训练素材。如果你在这个时代有所贡献,那么你的数据就对大模型有价值。 然而,对于那些在上一代互联网时代没有留下痕迹的人,比如我的母亲和外婆,他们在大模型的知识体系中可能没有贡献。 硬件的发展则创造了新的数据来源,比如通过传感器捕捉人眼所见和生活感知,AI 硬件可为大模型提供新的类人感知数据输入。 -
通过一体化能力迅速转化为游戏内容:最近注意到 GTA6 的预告片,它展示了视频内容与游戏的结合,这使我产生联想。 未来在抖音等平台上的内容,可以通过强大的一体化能力迅速转化为游戏内容,反之亦然。内容的创作和消费之间的界限将被打破,跨媒介的内容转换将成为一种趋势。 -
硬件在内容创作和记录方面的潜力:像 Google Glass 这样的硬件产品,以及 Snapchat 的尝试,都表明了硬件在内容创作和记录方面的潜力。 通过新的硬件和大模型的结合,我们可以为新用户群体创造新的内容,同时通过大模型的能力,将这些内容转化为新的数据资产,并定义新的场景
Anki 成立于 2010 年的人工智能机器人公司,由三位卡内基梅隆大学的机器人专家创立。该公司致力于开发能够与人互动、学习和成长的智能机器人产品。
背景补充-Nomi
背景补充-Disney Robot
背景补充-Dyna Bert
#4.
当前可见的AI硬件产品吐槽,
-
第一个节点叫做说这个头显演进到一个重量上,我能够持续佩戴 8 小时的一个节点,在这个时候它可以有 PC 的场景。 相当于不用买显示屏了,它是 PC 一个更大的一个屏幕。那这个场景我说足够了,我一天也只需要用 8 小时,也不需要室外场景,笔记本怎么用它就怎么用,这是第一步 第二个步骤就是它更轻了,之后我带着它出去变成替代手机,变成一个全天显示的场景了,这个更远了,但由于现在各种Micro LED 的技术,成熟时间也很难去判断。
背景补充 - VST 技术
-
文本和语音的互动方面:特别是自然语言的交互,这是与过去不同的一个重要方面;其次,是逻辑推理能力的增强; 最后是 AI 相比原来能够更加创造性的生成一些内容,这是在大模型和新一代 AI 的泛化中大家所观察到的一个趋势 -
在硬件产品形态中应用:我们需要思考的是,如何将这些 AI 的新特性融入到硬件设计中。例如,如果真的使用自然语言模型来进行交互,会有哪些新的差异化体验出现? 过去我们使用电脑和手机时,主要是通过打字来进行交互,而现在我们开始使用语音。但在很多场景下,我们仍然习惯于使用文本交流; 比如在办公室里,我们可能更多地使用飞书等文本通讯工具,像 VR 头显这类的产品,它可能更适合于那些需要频繁使用语音交互的场景。 在家用场景下:比如使用智能音箱,你可以通过说话来进行互动,而不需要触摸屏幕或在安静的环境中说话。我们需要考虑如何将这些点融入到未来的硬件产品设计中。
-
硬件发展到今天,我认为已经没有什么新的东西可以做。但是,我对 AI 的了解可追溯到十几年前,我之前对其持怀疑态度; 但最近我看到了 ChatGPT 和其他 AI 产品的实际应用,我发现 AI 确实有用,它既有吸引力又有实用性,这本身就很难得。 我认为关键在于,无论是大公司还是小公司,都可能会有新的机会。但是,这个机会在哪里?今天我听了一圈,至少可以听出,大家还没有形成共识。 相信大公司的人也不清楚。当然,这样才有机会创新,才有新的突破点。可能会有一些随机的机会出现,或许能出现一个真正理解如何去做 AI 硬件的旗舰公司。
—end—
