TwelveLabs发布Pegasus 1.6:专为第一人称视频优化的机器人训练数据生成模型
TwelveLabs推出Pegasus 1.6,强化对工人第一视角视频的动作分段、手部角色识别与时间戳标注能力,旨在将原始作业录像转化为结构化训练数据,支持机器人开发者自动化标注流程,但不解决运动控制与触觉等执行层问题。

一名组装零部件的工人所展示的,远不止最终完成的任务:哪只手握持零件、另一只手何时伸手取工具,以及当某物滑脱时如何恢复操作。TwelveLabs希望将这些细节转化为可供企业用于训练机器人执行类似工作的可用数据。
这家视频人工智能公司今日 发布Pegasus 1.6,新增对从执行任务者(人或机器)第一视角录制的视频内容的专项支持。
TwelveLabs将目标客户定位于机器人开发者及数据供应商——这些客户需要将此类录像转化为带标签、带时间戳的材料以用于训练;该能力建立在Pegasus 1.5(其上一代模型)已有的视频描述与视频分段功能基础之上。
两者均为专为将原始视频转化为结构化、基于时间的元数据而设计的视频到文本生成与视频分段模型。
与拼接静态图像帧或执行基础片段级问答的通用多模态大语言模型(LLM)不同,Pegasus系列专为原生时序推理(即序列中的因果关系,并随时间变化持续追踪状态变化)及端到端视频理解而构建。
对企业而言,该方案旨在解决自动化进程中一个不那么光鲜却切实存在的障碍:将物理作业的录像转化为开发团队真正可用的数据。探索机器人技术的公司可开始记录并整理选定的工作流程;而正在训练机器人的团队则可将其标注与质量审核流程的部分环节实现自动化。
这一区别至关重要:Pegasus提供的是描述与结构。机器人开发者仍需将这些观察结果与驱动机器可靠执行动作的运动系统、传感器及控制系统相连接。
“当前这些模型对数据的需求量极大,”TwelveLabs联合创始人兼首席执行官Jae Lee在发布前接受VentureBeat采访时说道。
从视频档案到人类示范
Lee表示,TwelveLabs最初聚焦于媒体、娱乐、体育和广告领域,其客户需要搜索大型视频集合并描述其内容。该公司进军机器人领域,是将上述能力应用于一个不同的问题:识别具有实用价值的物理行为范例。
遥操作(teleoperation)——即由人员远程操控机器人——能产生有价值的示范,但既需要专用设备,也需要经过培训的操作员。Lee称,扩大该采集过程的规模会消耗大量资金与时间。
“这就像是一个人加一台机器人,”他说道。
第一人称录像提供了另一种示范来源。工人佩戴的摄像头可在无需机器人在采集阶段逐一执行每个任务的情况下捕获作业过程。但此类录像仍需解读:发生了何种动作、涉及哪个物体、由哪只手执行、动作起止时间为何。
Pegasus 1.5已能将视频划分为带时间标记的片段,并返回结构化描述。TwelveLabs自身 此前已将这些能力认定为机器人标注工作的基础 ,早于本次发布。Pegasus 1.6新增了针对第一人称(即自我中心式,egocentric)录像的专项训练与支持;公司称早期版本对此类视频处理效果不佳。其创新点在于这种专项优化及所宣称的性能提升,而非将视频转化为结构化文本的基本能力。根据Lee及公司技术简报,客户可自行定义所需类别与字段,模型则围绕这些需求组织视频内容。
例如,装配团队可要求分别生成涵盖零部件拾取、定位与紧固的独立片段,并附有每只手所承担角色的描述。这仅是一个说明性工作流程示例,而非已披露的客户实际部署案例。
TwelveLabs描述了 五大核心工作流程:将录像拆解为带标签的动作;生成详细字幕;对录像进行质量筛查;识别异常事件与重复片段;以及在下游使用前标记潜在敏感内容。质量检查可覆盖视野遮挡、摄像机晃动及动作模糊等情况。
此次发布还新增原生图像分析能力,并提升了对人物与物体的识别精度 ,使客户可通过同一API处理静态图像与视频。这些新增功能将其适用范围从机器人领域拓展至现有视频分析应用。理解一个动作仅是教授该动作的一部分
Lee将当前机器人领域的直接机遇描述为训练基础设施。
“眼下,卡尔,我认为我们仍处于‘快快快,赶紧训练’的模式,”他说道。
他表示,当前部署通常集中于有限任务,或收集现场数据以帮助开发者改进其模型。他更长期的假设是:人类视频可提供广泛的行为知识基础,而遥操作示范则有助于将该知识适配至真实机器人。
这仍是一种开发策略,而非经证实的保证——即更多视频必然催生出具备广泛能力的机器人。
Lee称,Pegasus可描述肢体运动并提供对运动轨迹的粗略理解,但并未提供执行这些动作所需的全部信息。压力、触觉与精确控制仍是独立的问题。机器人团队必须将视频衍生信息与其他数据相结合,并开发将信息转化为实际动作的系统。
该公司技术附件描述了涉及动作识别、执行动作之手的识别,以及随时间推移理解动作的内部评估。附件未提供数值评分,亦未给出可复现的竞品对比结果。采访及预发布材料亦未指明任何机器人客户的运营成果可供独立验证。
Lee提供了一个关于处理规模的参考指标:他回忆一次运行在约18小时内处理了相当于约17年时长的第一人称录像,且无一视频失败。他未说明所用计算资源或评估条件,因此该指标仅为轶事性吞吐量声明,而非可复现的基准测试或准确率结果。
TwelveLabs的竞争领域——以及其可能为其他开发者提供的服务领域
竞争问题横跨机器人开发流程的多个环节。部分公司专注于训练数据组织;另一些则侧重于机器人周围环境的推理或动作生成。
Nvidia的Cosmos Curator
通过过滤、标注与去重直接切入数据准备问题。其开源工具为工程团队提供了采购托管式视频理解服务之外的替代方案,尽管他们仍需自行组装并运维所选流水线。 Encord集成Nvidia Cosmos Reason 2与Embed
构成另一项紧密对标。Encord托管这些模型,生成初步视频标签供人工审核,并支持基于动作的搜索。这使其在TwelveLabs所瞄准的标注与策展工作中形成直接竞争。 Google的Gemini Robotics ER 2
谷歌的 Gemini 机器人 ER 2 在视频解读和任务进度跟踪方面存在重叠,但更强调规划与执行协调。它将运动执行交由低层级动作模型或机器人接口完成。
与此同时, Black Forest Labs 与 mimic 公司的 FLUX-mimic 采用视频模型基础架构生成机器人动作。两家公司报告已在奥迪(Audi)开展测试与部署,包括工业级操控作业。该系统展示了可能利用更优质训练数据的下游系统类型,尽管此处尚未确立与 TwelveLabs 的集成。
提供 | 主要角色 | 相关能力 | 企业采购区分 | 已公布定价/成本基准(美元) |
TwelveLabs Pegasus 1.6 | 为训练准备并描述视频 | 第一人称动作分段、详细字幕及可配置输出 | API 服务;客户须自行负责机器人训练与控制 | 已公布费率:每视频小时 1.75 美元;每百万图像输入 token 3 美元;每百万输出 token 7.50 美元。企业版:定制。 |
Nvidia Cosmos Curator | 构建数据处理流水线 | 过滤、标注与去重 | 面向开发自有基础设施团队的开源工具 | 开源软件,Curator 软件本身无授权费;GPU/云资源、存储及工程成本仍需承担。模型授权费用各不相同。 |
Encord 搭配 Cosmos Reason 2 与 Embed | 管理标注与策展 | 自动化初步标注、审核员工作流及基于行为的搜索 | 结合模型与人工审核的托管平台 | 无公开美元费率;需联系 Encord 获取涵盖托管平台及模型使用费用的报价。 |
Google Gemini Robotics ER 2 | 推理并协调机器人任务 | 视频进度评估、规划及工具使用 | 可通过 API 访问的推理能力;动作执行由独立系统完成 | 标准 API 费率:截至 2026 年 12 月 31 日,每百万输入 token 1 美元、每百万输出 token 5 美元(含推理计算);自 2027 年 1 月 1 日起为每百万输入 token 2 美元、每百万输出 token 10 美元。提供免费额度。 |
BFL/mimic FLUX-mimic | 生成操控类动作 | 将源自视频的表征转化为机器人行为 | 机器人部署系统,解决数据准备之外的执行问题 | 在 产品公告中未查到 FLUX-mimic 的公开价格;部署条款需另行咨询。未宣传为免费开源模型。 |
价格核查日期为 2026 年 10 月 6 日。计费单位与产品范围各异,因此这些费率无法确定特定工作负载下的最经济选项。Pegasus 按视频时长及文本输出 token 数量计费;Google 按输入与输出 token 数量计费。TwelveLabs 还会将 Segment 请求中定义的分段数量乘以计费视频时长。开源软件仍需付费基础设施或已有计算资源。
以上功能对比基于供应商描述,并非统一性能排名。所审查证据中,无任何一项表明 Pegasus 1.6 在标注质量、成本或最终机器人成功率方面全面优于上述所有方案。
李(Lee)认为动作生成模型的开发者可能是潜在受益者:“我们在不同技术栈中定位得相当合适,”他表示。
真正的商业检验在于:TwelveLabs 能否使视频准备工作足够精准、经济且易于集成,从而令相关团队更倾向于采购其服务,而非自行开发或另寻替代方案。
定价——以及企业应优先测试的内容
TwelveLabs 为 Pegasus 1.6 保留了与其前代产品大致相同的 输出 token 价格 :每小时输入视频 1.75 美元,每百万输入图像 token 3 美元,每百万输出 token 7.50 美元。
企业级合同采用定制化定价;寻求私有部署或自托管部署的买家必须联系销售部门。
按所列输入速率,一次性处理1000小时视频的费用为1750美元,此金额不包括输出费用及其他适用费用。密集型标注会增加输出成本。TwelveLabs在最初于其公开网站上将Pegasus 1.6的价格标为实际价格的两倍后,向VentureBeat确认了更新后的定价。本文已根据该信息完成修订,目前内容准确无误。
定价常见问题解答(FAQ)还指出,Segment请求中的每个片段定义均单独计费,从而使提交的时长成倍增加——这对请求多个标注类别的团队而言是一项重要考量因素。
Lee表示,该公司还可能与少数大型合作伙伴签署少量长期许可协议及定制化研究协议。
对于机器人领域尚处于早期阶段的企业而言,一个实用的起点是限定范围的工作流,例如对某一特定产品进行装箱,或组装某一特定零部件。试点项目可验证:录制的视频是否包含足够细节、生成的标签是否符合专家判断,以及在机器人合作伙伴能够使用这些标签前还需多少人工修正工作。
这也意味着需就录制员工影像及处理专有流程事宜取得相应授权。敏感影像的自动检测功能有助于审核,但并不构成采集或用于模型训练的影像数据的授权依据。
对于已在机器人领域开展实验的团队而言,更具说服力的检验在于下游效果:添加经Pegasus标注的视频是否能提升预留测试样本的任务完成率、降低数据采集需求,或缩短开发周期?除处理速度外,还应同步测量标注准确率、遗漏的动作边界以及人工修正耗时。
相关经济指标为每个被接受且具有实用价值的训练样本的成本,其次为其对提升机器人行为表现的实际贡献。TwelveLabs提供了一种加速从拍摄活动到从中学习这一过程的方法。企业需自行提供证据,证明由此产生的数据确实改善了其真正希望实现自动化的任务。
JOTO 企业落地观察
- 对企业部署而言,Pegasus 1.6 提供按视频小时与token计费的API服务,但其‘每片段单独计费’机制可能显著抬高复杂工作流成本;企业需实测标注准确率与人工修正耗时,方能判断其是否真正降低整体数据准备成本。
- 对智能体工程而言,该模型聚焦于原生时序推理与动作结构化输出,而非动作生成——这意味着它适合作为感知层组件嵌入机器人智能体Pipeline,但必须与运动规划、传感器融合及低层控制器协同设计,不可替代执行系统。
- 对FDE落地而言,文中明确指出敏感影像自动检测仅用于审核,不构成数据采集或训练授权依据;企业在引入此类工具前,须同步建立员工知情同意、流程脱敏与影像存档合规机制,否则将面临用工与数据安全双重风险。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


