Runway 将 AI 视频模型缺陷转化为前端功能:实时虚拟形象的工程实践
Runway 在开发实时AI视频模型时遭遇角色偏移漏洞,未修复底层模型,而是将其转化为前端‘图像居中优化’功能。文章详述其评估体系、知识蒸馏与对抗后训练流程,以及硬件级调试经验。

Runway 花费数周时间试图通过工程手段解决一个顽固的漏洞:AI 生成的虚拟形象在实时视频生成过程中会偏离画面中心。该问题的修复方案并非后端补丁——而是一个全新的前端功能,仅通过绕过问题的方式就奏效了。Runway ML 企业产品负责人 Ryan Phillips 在 VB Transform 2026大会上分享了这一经验,并指出,即便那些自身并不构建基础模型的公司,也能从 Runway 构建、评估和发布这些模型的方式中获益。
“我认为,即便你们并未全部自行构建模型,了解我们的做法仍大有裨益,因为我认为几乎所有这些经验都适用于你们日常所从事的工作。”Phillips 表示。
Runway 是一家应用型人工智能研究公司,致力于构建通用世界模型,以驱动生成式工具。在其演讲中,Phillips 展示了 Runway Characters——一款实时视频模型,支持零延迟、双向交互式 AI 虚拟形象。他指出,五年前,艺术家需耗费数百小时逐帧拼接,才能制作出文字模糊、帧率偏低的视频;而如今,Runway 的模型可即时生成交互式视频。
“研究我们如何构建这些实时模型,可为你们当前在各自公司中构建与部署实时体验(无论是否具备智能体特性)提供启发。”他说。
评估流程去神秘化
构建稳健的 AI 产品始于高质量的评估数据集。然而,创建该数据集不能仅被视为一项工程任务,它需要产品、设计、研究及销售等职能团队深度协同,共同定义“质量”究竟意味着什么。
Phillips 强调,应开展内部研讨会,让团队成员共同审阅生成样本。其目标是使整个组织就特定失效模式达成一致,从而共享对成功生成的统一定义。
“我们花了大量时间与团队一起,逐一梳理……成功与失败的具体表现,细致到极其琐碎、严苛的程度。”Phillips 表示。
最终形成的评估数据集必须覆盖广泛的客户使用场景,同时兼顾极端边缘案例。例如,Phillips 特别指出,为确保模型在超出标准人类面部结构的条件下仍能稳定运行,他们采用了名为“Tooth”的非人类角色——该角色没有鼻子,牙齿形态极为异常。
在对这些生成结果进行评分时,Runway 团队关注细微的人工痕迹。在一个示例中,某段视频中人物面部保持完整,但背景元素(如一张网)开始发生形变,该输出被严格判定为失败。
尽管产品本身处于前沿水平,Runway 用于追踪这些评估工作的工具却十分简单:一份 Excel 电子表格。团队每日记录测试结果,并依据预设的通过率,将输出归类为“轻微”或“严重”失效。
“我们在启动工作前即设定通过率门槛,一旦达标,便发布模型。”Phillips 表示,“因此这并非什么魔法。”
对于面临自身实时管道中非确定性质量漂移问题的企业开发者而言,大规模人工评估已成为瓶颈。为解决此问题,Phillips 指出,开发者可借助语言模型自动化视觉评分流程。
“大型语言模型(LLM)在充当此类内容的评判者方面已日趋成熟,尤其是针对评估数据集中常见的形变或变化类型。”他表示。团队还可向 LLM 输入幕后上下文(例如手绘草图或广告的结构布局),以指导生成与验证流程,在不增加终端用户认知负荷的前提下保障质量。
模型训练与将漏洞转化为功能
交付实时生成式视频需要高度优化的技术栈。该流程始于对一个庞大的基础模型进行预训练,该过程资源密集且输出生成缓慢。为实现实时延迟,Runway 依赖于 知识蒸馏(distillation)技术,即训练一个更小、更快的“学生”模型来模仿大型“教师”模型。据 Phillips 称,知识蒸馏帮助 Runway 将“生成时间缩短了 80% 至 90%”。
随后,团队对蒸馏后的模型应用对抗性后训练(Adversarial Post-Training, APT)。该技术通过让模型持续接受专为暴露其缺陷而设计的系统测试,促使其不断改进,从而恢复蒸馏过程中损失的视觉锐度。
然而,调整模型架构会引发新问题。知识蒸馏与 APT 阶段引入了一个顽固漏洞:角色在实时生成过程中会左右摇摆或偏离画面中心。
他表示,团队花费数周时间尝试修复核心模型以消除偏移现象。最终发现,若用户初始输入图像完全居中,则生成的视频保持稳定。团队并未继续投入时间开发后端工程补丁,而是转向用户体验解决方案。
“我们所做的,是在评估中注意到这一现象后,随即提出:‘如果我们将此直接作为一项功能提供呢?’当用户提交一张向左偏转的角色图像时,我们知道视频将发生形变。那我们就直接为其修复。”Phillips 表示。
他们推出了一项名为“优化图像质量(Optimize for Image Quality)”的前端功能,该功能在生成开始前自动将用户图像重新居中。通过将后端模型局限性封装为前端工具,用户感知到的是一个有益功能,而非工程缺陷。
“将模型局限性转化为产品功能,从而实际拓展模型能力范围。”Phillips 建议道,“这在内部可能看似一种局限,但只要你将其作为产品功能来构建,你的客户并不会这样看待它。”
魔鬼藏在基础设施细节中
在全球范围内以每秒 24 帧速率交付视频,要求对基础设施栈每一层均进行优化。这涵盖缓存与并行解码,乃至与英伟达(Nvidia)等硬件供应商合作进行深度内核修改。
他称,在 Runway Characters 上线后不久,团队注意到 8% 的 API 调用帧率降至每秒 16 帧,导致客户视频出现卡顿。
定位根本原因需要深度可观测性。团队结合 Claude 驱动的 AI 代理,以及 Datadog 和 Sentry 等监控工具,追踪该异常。调试过程将问题隔离至 us-east-1 区域内的单一数据中心。
“实际上,解决方案并非修复任何代码或更改配置。”Phillips 解释道,“他们真正采取的措施是,亲自前往该数据中心,物理更换了那些 GPU,最终解决了问题。”
对于部署实时应用的企业团队而言,关键启示显而易见:硬件与基础设施异常将直接影响模型性能,因而需要严谨、全栈式的调试能力。
“切勿忽视所有微小细节,因为部署这些模型时,此类细节数量庞大。”Phillips 表示。
挺过‘失败地狱’以及世界构建的未来
开发AI系统很少是一个线性过程。团队常常会在单个问题上卡住数周,且看不到尽头,菲利普斯将这一阶段称为‘失败地狱’(failure hell)。“},{
“我们认为,你必须经历这种痛苦,并真正为这个问题挣扎一段时间,之后才能取得突破,”他说。持续的迭代最终会拉平难度曲线,从而触发突然且呈指数级的改进。
随着底层模型逐步克服这些技术障碍,企业创意人员的角色也在发生根本性变化。传统上,营销和设计团队专注于创建单个资产,例如一则特定广告或一幅插图。而在实时生成与智能体(agentic)工作流时代,这一范式正转向定义参数、美学风格及知识产权。
菲利普斯(Phillips)表示:“你可能不再设计单条广告,而是设计一个世界,随后由智能体(agent)或实时视频模型从中生成广告。”
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


