JOTO
Contact us
← AI 智库
智能创作

OpenArt Arena 发布多任务细分AI模型排行榜:聚焦电影、电商、唇形同步等创意岗位

2026 年 9 月 15 日

OpenArt 推出 Arena 基准测试,按电影制作、平面设计、视频编辑、唇形同步等具体创意任务划分榜单,采用盲态成对比较与 Bradley-Terry 模型排名,首期结果显示 Seedance 2.5 综合领先,Wan 3.0 在视频编辑中反超,GPT Image 2 与 Seedream 5.0 Pro 分占图像任务榜首。

What's the best AI model for graphic design, video ads, lip sync and more? OpenArt's new Arena offers leaderboards for different media jobs

OpenArt这家成立于四年前、总部位于旧金山的创意人工智能工具初创公司,由前谷歌员工毛 Coco Mao 和乔 John Qiaois 联合创立,旨在回答一个对企业及个人用户而言日益关键的问题:当利用人工智能模型创作多媒体内容时,问题不再仅仅是‘哪个模型最好?’,而是‘哪个模型最适合我需要完成的特定 媒体任务?’

正因如此,该公司今日推出一项全新的公开基准测试,用于评估人工智能图像与视频生成能力:全新推出的 OpenArt Arena 将模型排名划分为面向具体用例的榜单,涵盖电影制作、电子商务、平面设计、动态设计、视频剪辑和唇形同步等工种,评估方式采用创意从业者开展的盲态成对比较,以及更广泛的、该公司称之为‘品味塑造者(tastemakers)’的评审人群。

该公司表示,将在发布时公开其方法论及部分提示词(prompt)集,但会保留部分正在使用的评估提示词不公开,以降低模型被针对性调优以适配该基准测试的风险。

这一构想看似简单,却愈发必要。当前图像与视频生成模型的迭代速度已足够快,以至于一支创意团队可能需耗费大量时间,仅用于决定是否采用 OpenAI 的 GPT Image 系列、谷歌的 Nano Banana 系列、字节跳动的 Seedream 以及 Seedance 模型、 阿里巴巴的 Wan、xAI 的 Grok Imagine 或其他选项。

OpenArt AI 增长与运营主管 Stella Guan 在 Arena 最终投票完成前接受 VentureBeat 独家采访时指出:‘我们的目标是让这一基准成为新标准,让越来越多的人知晓并认可它。当创意人士想要挑选最适合其需求的图像或视频模型时,他们会想到 OpenArt Arena,并知道这是他们选择模型时最可信的行业标准。’

OpenArt 自身即围绕这种模型丰裕性构建:其平台允许用户跨主要第三方图像与视频模型开展工作,同时也销售自身开发的更高层级创作产品,包括 Director——一款支持对话式‘氛围指导(vibe directing)’工作流的多场景视频生成工具。

OpenArt 当前的模型目录涵盖来自多家供应商的图像、视频、音频及 3D 系统。

‘我该选用哪个模型?’ 是 Guan 表示 OpenArt 从企业客户处反复收到的问题。

她指出,对于来自传统行业、如今才开始采用生成式人工智能的企业而言,选择模型可能是其‘在采用人工智能过程中面临的首个挑战’。

但目前,人工智能视频创作者与艺术家如何挑选最佳模型?

一位高产且使用化名的创作者 @BLVCKL!GHT通过 X 平台私信向 VentureBeat 表示:‘我选用哪个模型完全取决于所需完成的工作。循环动画与更具动态感的场景需调用不同工具,因此单凭这一点,某个项目就可能选定 Minimax 或 Seedance 2.5。客户通常要求采用最先进模型,这便决定了我的选择;但最终,预算才真正决定了任一特定项目中切实可行的选项。’

围绕具体的创意人工智能媒体任务组织

OpenArt 并未仅发布一个图像得分与一个视频得分,而是围绕各类工作任务与创意学科分别构建独立榜单。

这包括多个独立排行榜,展示人工智能图像与视频模型在完成动画、广告、平面设计、电子商务、电影、动态设计、视频剪辑、唇形同步及整体任务方面的表现(依据 OpenArt 精心遴选的创意专业人士用户及外部专家评分,人数逾 800 人)。

每个榜单均应采用针对相应工作的定制化评判标准。Guan 以电影制作为例说明:摄像机运动、布光、电影质感及皮肤真实感在此类任务中可能更为重要;而广告工作流则可能更看重文字可读性、标识准确性、产品保真度及摆放位置。

这种设计至关重要,因为某模型在某一特定创意任务上表现出色,并不意味着它在另一任务上同样最优。

这一区分对企业而言的影响,远比初听之下更为重大。一家营销部门生成包装图、一家内部工作室为商业广告进行预演可视化、一支后期制作团队修改现有影像素材——三者均可自称‘使用人工智能视频’,却对底层模型提出截然不同的需求。

若将上述各类任务合并为单一偏好得分的排行榜,虽有助于发现通用能力较强的系统,却仍无法为企业团队提供明确指引,以确定究竟应将某项具体制作任务交由哪个模型处理。

OpenArt 表示,其为每个榜单生成经筛选提示词集所对应的输出结果,并在不标注模型名称的情况下提交给评审员。

评审员进行并排对比选择,而非单独打分;OpenArt 则采用 1952 年提出的 Bradley–Terry 统计模型汇总这些偏好——该方程依据某项目与其他竞争者一对一的表现,计算其隐含的胜出概率。

评审团分为两个层级。规模较小的‘创意专家委员会(Creative Expert Council)’包括署名从业者,例如艾美奖获奖动画导演 William Lau、创意技术专家 Willonius ‘King Willonius’ Hatcher、营销领袖 David Shing,以及来自爱德曼(Edelman)和加州大学洛杉矶分校(UCLA)等机构的高管与教育工作者。

Guan 表示,OpenArt 还正从 OpenArt 用户、外部创意社群及广告等领域在职专业人士中招募约 800 至 1,000 名‘品味塑造者(tastemakers)’。

该数字应理解为计划招募人数,而非本次发布评估中实际完成评审人数的经核实统计。OpenArt 未在本报道审阅的材料中提供最终参与投票的评审员人数、成对判断总数,或各发布基准测试所用提示词数量。

Guan 表示,该公司计划公布每套提示词集的部分内容,并可能在后续更新后发布旧版提示词,但不会公开全部现行提示词集。‘我们不在发布时公开全部内容的原因之一,是这将很容易导致模型开发者针对这些数据集进行拟合。’她表示。

这是一个合理的基准测试设计关切点:一套完全公开且静态的测试,最终可能衡量的是模型开发者针对该测试本身优化的有效性,而非其系统在面对未见过的创意任务时的泛化能力。

但扣留测试材料亦带来相应的透明度负担:用户必须信任那些未公开的提示词足以充分代表该职业领域,且模型输出的生成、采样与比较过程保持一致。

首批 OpenArt Arena 排名所呈现的结果

视频结果为 OpenArt Arena 首批排名发布的最清晰头条信息。

字节跳动的 Seedance 2.5 是一款专有模型,通过 API 提供服务,字节跳动尚未公开其权重参数,该模型以 1,081 分位居视频总榜首位;紧随其后的是阿里巴巴的 Wan 3.0(1,004 分),以及同为闭源权重的字节跳动 Seedance 2.0(1,000 分)。

OpenArt Arena video overall leaderboard rankings

OpenArt Arena 视频总榜排名。图片来源:OpenArt

Wan 3.0 在开放性方面属于例外:阿里巴巴将其描述为开源模型,并发布了一个采用 Apache 2.0 许可证的代码仓库,但该仓库目前仅包含文档和许可证信息,而非可下载的模型权重,因此尚不应被视为符合常规定义的开放权重、可自托管发布的模型。

Seedance 2.5 的优势在 OpenArt 评估的大多数更专业的视频类别中均得以体现:在此次发布所附的五项视频排行榜中,它在其中四项位列第一,在第五项排名第二。在电影类排行榜上,Seedance 2.5 以 1,049 分位居榜首,领先于 Seedance 2.0 的 1,000 分和 Wan 3.0 的 958 分。它在动态设计(motion design)类别中同样领先,得分为 1,059,其后依次为 Seedance 2.0(1,000 分)和 Wan 3.0(990 分)。

OpenArt arena video editing leaderboard rankings

OpenArt Arena 视频编辑排行榜排名。图片来源:OpenArt

视频编辑是唯一的例外(勉强算例外)——也是最能说明 OpenArt 论点的实用结果之一,即模型选择应取决于具体任务。

Wan 3.0 以 1,034 分位居第一,Seedance 2.5 以 1,033 分紧随其后,谷歌专有的 Gemini Omni Flash 以 1,021 分位列第三。

谷歌将 Omni Flash 作为其 Gemini 模型系列的一部分进行分发,而非以可下载的开放权重形式提供。在唇形同步(lip sync)类别中,Seedance 2.5 再次登顶,得分为 1,063,领先于 Seedance 2.0 的 1,000 分,以及另一款由字节跳动托管、而非开放权重发布的变体 Seedance 2.0 Mini(994 分)。

换言之,Seedance 2.5 在 OpenArt 此次发布测试中似乎是最强的通用视频模型,但它并未在每一项专业任务中都名义上胜出。

OpenArt 在排行榜上标示了 95% 置信区间,当分数接近时,这一限定条件至关重要。例如视频编辑类别中 Wan 3.0 的 1,034 分与 Seedance 2.5 的 1,033 分之间仅相差一分,单凭这一分差本身不应被解读为存在实质性质量差距的证据。

Seedance 2.5 的主导地位反映在其于 AI 创作者群体中的广泛使用。扎克·伦敦(Zack London),更为人熟知的身份是高质量科幻/奇幻 AI 视频创作者 Gossip Goblin,其一部全长 AI 电影将于今年晚些时候在数百家影院上映,片名为 Gods Don’t Give Gifts他通过 X 平台私信向 VentureBeat 表示:

“一年前,市场还相当多元——Hailuo、Kling 和 Veo 各有优势,此外还有 Sync Labs、Hedra 和 HeyGen 等更小众的唇形同步工具。如今 Seedance 已遥遥领先于其他所有模型,以至于根本无需讨论。我可以自信地说,该领域内所有信誉良好的创作者如今只使用 Seedance。Hailuo 的 H3 被用于大规模垃圾信息发送和自动化任务,但凡涉及严肃创作,唯一的选择就是 Seedance。”

对于企业买家而言,更具参考价值的信号是各排行榜所呈现的整体模式——哪些模型在多项任务中持续表现强劲,更换生产任务如何改变模型排序,以及某模型是否支持自托管,抑或必须依赖供应商或 API 提供方。

图像类排行榜则更为分散,没有任何一款模型包揽本报道所附的三项发布排行榜。

OpenArt Arena graphic design leaderboard rankings

OpenArt Arena 视频编辑排行榜排名。图片来源:OpenArt

OpenArt Arena image editing leaderboard rankings

OpenArt Arena 图像编辑排行榜排名。图片来源:OpenArt

OpenAI 的专有模型 GPT Image 2(通过 OpenAI 的 API 提供,而非以开放权重模型形式发布)在平面设计和图像编辑两项任务中均排名第一,得分均为 1,000。

然而,在面向电影风格的图像生成任务中,Seedream 5.0 Pro 以 1,014 分领先;而谷歌的闭源权重模型 Nano Banana Pro(Gemini 3 Pro Image)与 GPT Image 2 则分别以 1,000 分并列第二和第三。Seedream 5.0 Pro 在电商图像排行榜上也以 1,004 分位居榜首,略微领先于 GPT Image 2 的 1,000 分,以及谷歌同属专有模型的 Nano Banana 2(Gemini 3.1 Flash Image)的 993 分。

总体而言,在涵盖全部图像任务的综合性能方面,OpenArt 的评测人员更青睐阿里巴巴的 Seedream 5.0 Pro,评分为 1,010,比 GPT Image 2 高出 10 分。需注意的是,OpenAI 上周已将该模型更新为 GPT-Images-2.5,这意味着 OpenArt 的排行榜亦需相应更新以反映这一变化。

OpenArt Arena overall image model leaderboard rankings

OpenArt Arena 综合图像模型排行榜排名。图片来源:OpenArt

因此,在 OpenArt 发布的领先模型中,开放性差异十分显著:Wan 3.0 是唯一一款由其开发者明确标称为开源模型且进入前三名的主流模型,尽管其当前公开发布的版本尚未提供实现独立自托管所需的模型权重。

对企业而言,这绝非一个无关紧要的许可注脚:它直接影响部署控制权、数据驻留地、定制化选项、对供应商的依赖程度,以及潜在的总体拥有成本。

在最终排名公布前,关女士表示,OpenArt 的初步投票结果已浮现出一些此前未预料到的情况。“某些领域让我们感到意外,”她说,“有些模型我们原本不认为会在特定用例中排名靠前——但这个排行榜更充分地展现了它们的优势。”

她指出,这正是将任务细分的意义所在。“如果你仅在整体层面竞争,某些模型可能无法成为最佳,”关女士表示,“但它们可能在特定用例或特定标准下表现最优。”

最终排行榜至少为此论点提供了部分佐证,即便它们并未全面颠覆整个市场格局。在 OpenArt 的测试中,Seedance 2.5 看似并非某一狭窄领域的专家,而更像是一位强大的通用视频模型;但 Wan 在视频编辑项目中夺冠,以及图像类各项冠军的更迭,正说明制作团队仍可能希望根据任务在多个模型间分配工作,而非盲目统一采用单一模型。

OpenArt 并非首个或唯一提供分类别排行榜的机构

排行榜/基准测试

由谁评判

排行榜如何细分

评估方法

关键区别

OpenArt Arena

创意专家委员会 + 更广泛的创意“品味引领者”群体

具体创意任务:电影、平面设计、电商、动态设计、视频编辑、唇形同步等

精选的任务特定提示集;盲态成对比较;Bradley-Terry 排名法

最明确地围绕 单个生产任务 展开,覆盖图像与视频两大领域;并与商业创意平台集成

Contra Labs — 人类创造力基准测试

从 Contra 网络招募的在职专业创意人士

创意领域+工作流程阶段:着陆页、广告图像、品牌图像、产品视频等,每类均在构思、线框图和精修三个阶段进行测试

盲态成对比较+标量评分+定性反馈;Bradley-Terry/Elo 方法;公开详细研究方法与数据集

更偏向持续性研究计划,而非纯粹的排行榜;分析 为什么 性能在各阶段的变化,以及专家判断在何处趋同或分歧

Arena.ai

大规模公开/社区投票

图像:商业设计、电影级影像、人像、文本渲染、3D、艺术等;视频则按生成模式进一步细分

盲式成对偏好比较,并从数百万条真实世界提示词中筛选出类别排名;报告不确定性/排名离散度

最强调群体规模与有机用户提示词,其图像排名已与OpenArt的任务特定概念高度重合

Artificial Analysis

众包式盲式偏好投票者

图像应用场景,例如营销、电子商务、实拍电影、UI/UX及创作者内容;视频则更具功能特异性,包括文本到视频、图像到视频、编辑及音频变体

经整理的提示词分类法;盲式成对投票;Bradley-Terry Elo评分;同时追踪价格、速度及开源权重状态

覆盖最广的基准测试/采购视角,将质量与成本、延迟及模型开放性配对评估;图像类别高度任务特定,而视频细分则比OpenArt的创意岗位看板更侧重模态而非任务

然而,OpenArt远非唯一一家提供AI模型在创意任务上性能排名的公司。

例如,Contra Labs目前已将其生成式创意模型评估作为其 人类创造力基准(Human Creativity Benchmark, HCB)的一部分,该基准于2026年4月推出,旨在让创意从业者基于专业创意工作评估AI系统。

Contra并未依赖通用技术指标,而是从其网络中招募在职创意人员,向模型分发真实世界简报,在评估期间隐藏模型身份,并采用成对比较方式,再通过Bradley-Terry模型聚合为类Elo(国际象棋)式排名。

Contra Labs更广泛的HCB框架涵盖着陆页、桌面应用、广告图像、品牌图像及产品视频等领域,并将工作划分为构思、线框图与精修阶段——这种以工作流程阶段为结构的方式,不同于OpenArt Arena针对电影制作、动态设计、视频编辑及唇形同步等具体创意任务所作的更精细排名。

Contra的基准测试设计亦不仅限于简单的胜/负偏好判断。评估者需就提示词遵循度、可用性及视觉吸引力对输出结果打分,并提供定性解释以说明其判断依据。Contra明确区分了‘趋同’(convergence)与‘分歧’(divergence):前者指专业人士通常在可读性或技术正确性等问题上达成一致;后者则反映因审美偏好与创意方向不同而产生的合理分歧。其研究反复发现,没有任何单一模型能在创意工作的所有阶段均占据主导地位——这一结论与OpenArt所主张的‘最佳’模型取决于具体任务的观点高度一致。

除核心HCB外,Contra Labs还持续开展模型对抗赛、模型档案及实地笔记等研究项目,覆盖图像生成、视频、网页设计、字体排印、标志创作、风格迁移及其他专业创意任务。

近期研究在新模型发布或Contra调整评估结构时,会重新审视相同领域;该公司同时公布评估者人数、提示词结构、判断数量,以及部分情况下的开放数据集,随其研究成果一并发布。

这使得Contra成为OpenArt Arena目前最清晰的现有竞争对手之一。关键区别不在于方法论本身,而在于产品组织与呈现方式。

Contra当前运作方式更接近一个持续更新的研究与基准测试项目,常分析模型性能在工作流程各阶段中变化的位置与原因。

OpenArt则将Arena作为持久性的公共模型选择层推出,为电影制作、电子商务、动态设计、视频编辑及唇形同步等特定图像与视频任务分别设立排行榜。换言之,从业者评判、盲式对比及工作流程感知型评估并非OpenArt独有;其差异化更多体现在将这些理念打包为一套广泛、持续可访问的任务特定排行榜,并可将其直接嵌入自身创意平台之中。

Arena.ai 同样已提供类别特定的图像排名。它在分析大量真实图像生成提示词后推出类别排行榜,将提示词归类至产品、品牌与商业设计;逼真与电影级影像;人像;文本渲染;3D成像与建模;艺术及其他领域。Arena.ai表示,某一类别排行榜采用与其整体竞技场相同的底层评估方法,仅将投票范围限定于属于该领域的提示词。

其规模远超经筛选的专家小组。仅Arena.ai于9月7日发布的‘产品、品牌与商业设计’文本到图像排行榜,即已涵盖78个模型、逾190万次投票。其图像编辑竞技场同样提供商业设计、电影级影像、人像、文本渲染及其他任务的类别视图。

作为另一名高产的AI视频创作者, Kiri Margaros(@Kyrannio)——自动化视频制作工作室 No Spoon Studios 创始人——通过X平台私信向VentureBeat表示:

“我通常依靠Arena评估当前市面上有哪些模型,尤其在文本、图像或参考图像到视频(ref-to-video)等维度上,我会特别关注那些在我产品中测试得分更高、并在多个领域崭露头角的指标与模型。不过,若不使用排行榜,则实际操作往往简化为:将新模型陆续集成进我的产品,再观察其在我当前技术栈中的表现,从而评估其优劣。我认为成本与速度也是权衡因素,过度激进的内容审核亦然。倘若某模型运行极慢、耗时极长、成本高昂且对一切内容进行严苛审核,那么排行榜上的位置便不再重要,因为该模型实际上已难以使用;尽管如此,总体而言,Arena仍是极佳且快速的入门工具,能让我迅速了解哪些模型将是[业界领先](SOTA),及其各自优势所在,从而在通过API深入集成前便做到心中有数——如果这说得通的话!!……许多新模型的Arena指标确实直接指导了我的产品路线图,而其中我最关注的正是Arena。”

因此,‘专业人士评判输出结果’并非新概念,‘不同类别拥有不同排行榜’亦非首创。

OpenArt真正体现显著差异之处,在于这些理念的组合与组织方式。Arena.ai的图像类别主要源自大规模社区使用的提示词领域聚类,意味着其专业图像排名是通过对归类至这些领域的提示词所投出的票数进行筛选而得出。

OpenArt则从相反方向出发:首先 定义一项专业应用场景,为其开发专用测试集与评估标准,再邀请其选定的评估者群体依据该标准评判输出结果。

Artificial Analysis是另一项密切可比的方案——而在图像方面,它进一步收窄了OpenArt的差异化空间。其 Image Arena 并未止步于单一的整体文本生成图像(text-to-image)综合排名:Artificial Analysis 表示,它依据一套涵盖现实世界多种用例的分类体系对模型进行排名,这些用例包括市场营销与广告、零售与电子商务、实拍电影、动画与游戏、建筑与房地产、UI/UX 设计、社交媒体与创作者内容等,同时还按能力维度进行细分排名,例如文本渲染、版式布局和人体解剖结构表现。

它发布对应的子类别视图——包括商业类(Commercial)、人物/肖像类(People/Portraits)以及文本与排版类(Text & Typography)——并采用经人工筛选且同时标注了用例与能力标签的提示词(prompt)。输出结果通过盲态成对用户投票方式进行评判,评分采用 Bradley-Terry 最大似然估计法计算,且提示词集每月更新一次。这意味着 OpenArt 的电影与电子商务图像排行榜本身并非一种新型的任务特异性图像排名。

这一区别在视频领域更具意义。Artificial Analysis 维护着独立的 Video Arena Elo 榜单池,分别对应文本生成视频(text-to-video)、图像生成视频(image-to-video)及视频编辑(video editing)三类任务;此外还进一步按是否生成同步音频对模型进行划分,并在排名中一并提供价格与开源权重(open-weight)筛选器。

但这些主要是按生成模态(generation modality)或技术工作流(technical workflow)所做的划分,而非 OpenArt 为电影、动态设计、视频编辑及唇形同步(lip sync)所推出的、更精细的职业用途专属排行榜。因此,Artificial Analysis 在图像任务基准测试方面已与 OpenArt 大量重叠,甚至在视频编辑领域直接构成竞争;而 OpenArt 更显著的差异化优势则体现在其覆盖范围更广的、面向创意岗位的视频排名体系,以及其采用精选专家委员会(expert council)与创意实践者/品味引领者(creative-practitioner/tastemaker)群体进行评判,而非 Artificial Analysis 所依赖的更广泛的众包偏好投票。

Artificial Analysis 还明确将自身定位为独立机构,并声明不接受模型提供商就入选榜单或获得有利结果所支付的任何报酬——这在结构上区别于 OpenArt,后者运营着一个商业化创意平台,许多上榜模型即在此平台上向用户开放使用。

对于企业级创意负责人而言,这些方法论差异会影响如何使用该排行榜。一项广泛社区偏好得分有助于识别具备普遍吸引力的模型,而一项高度聚焦的专业用途基准测试则可能对工作流调度更具实用价值。

但二者均无法替代企业在自身品牌、参考素材、法律约束及制作标准下开展的内部测试。因此,Arena 的实际价值不仅取决于哪个模型最终排名第一,更取决于 OpenArt 对每个排行榜定义的精确程度。

换言之,OpenArt 可持续立足的差异化优势,并非在于它首创了专家评估或类别细分,而在于它正尝试将经过筛选的、职业特异性测试集、由专家主导的评判机制、更广泛的评审员群体,以及一个持续可访问的图像与视频综合排行榜,整合于同一平台之中。

它还将该基准测试更直接地与商业化创意平台内的模型选型绑定。这或许使 Arena 对那些可在同一环境中从查看排名直接切换至使用所排名模型进行生成的用户而言,具备异常高的可操作性;但同时也引出了此次发布所面临的最重要治理问题。

独立性问题

企业采购方还需注意另一项区别:OpenArt 并非一家独立的学术基准测试机构,而是一家商业化 AI 创作平台,其运营市场与其排行榜所评估的市场完全相同。

OpenArt 自身表示,其聚合了逾 100 种模型,当前模型目录中包含 Seedance、Veo、Kling、Wan、GPT Image、Nano Banana、Seedream 和 Grok Imagine 等系统。

这并不意味着本次发布的评测结果存在偏见,且所公布的排名中未见任何带有 OpenArt 品牌标识的基础图像或视频模型。

但 OpenArt 确实 销售 其所比较的众多模型的访问权限,并在其之上运营 Director 等产品。其视频产品明确向用户提供同一工作区内的多种底层模型选项。

Guan 表示,Arena 也将嵌入 OpenArt 自身的模型选型体验中,因此该基准测试可在用户始终停留于 OpenArt 平台的前提下,影响客户对底层模型的选择。

这使得二者关系比传统第三方基准测试更为复杂。OpenArt 有正当的产品动因帮助用户做出正确选择——若用户因选用错误模型而产出不佳结果,可能会归咎于该平台;但 OpenArt 同时也具有商业利益,希望成为客户既作出该决策又执行该决策的唯一场所。

恰当的结论并非应质疑 Arena 结果的有效性,而是其方法论与治理机制理应受到企业客户对任何可能影响采购或工作负载调度决策的供应商生成型基准测试所施加的同等审慎审查。

这也使得治理机制与可复现性变得更为重要,而非相反。在本次发布中,OpenArt 已披露其统计方法、总体招募策略、专家委员会成员名单,以及计划公开部分提示词。但该公司尚未提供提示词总数、完成评审的评委总数或总投票数,而这些数据本可让外部观察者将其首发评测的规模与覆盖范围,与 Contra 已发表的研究或 Arena.ai 庞大的社区投票数据集进行对比。

这一对比使该遗漏更加显眼,因为竞争对手已证明,这些数字可在不必然暴露整个基准测试全部细节的前提下予以披露。例如,Contra 公布了评审员数量、任务结构及成对判断总数,同时仍持续开展重复研究;Arena.ai 则直接在其排名旁公开投票数与置信区间。

OpenArt 计划组建的 800 至 1000 人的品味引领者(tastemaker)群体听来颇具规模,但在 OpenArt 报告某一特定排行榜实际参与人数、所产生的判断总数以及所看到的提示词数量之前,读者无法判断单个首发排名背后究竟有多少实证支撑。

对企业团队而言,这应使 OpenArt Arena 成为模型选型过程中的一个输入项,而非绝对权威。最有用的基准测试,是能最贴近组织实际工作的那一种:例如带精确包装的实物产品图、含特定字体排印的营销活动素材、含摄像机运动的电影级镜头序列,或必须保留客户现有影像素材的剪辑任务。

OpenArt 的任务特异性排行榜正朝此方向迈进,公司还计划纳入更多面向企业的客观模型信息,例如定价、内容审核及知识产权保护特性。Guan 表示,OpenArt 还希望揭示价格与性能之间的权衡关系,而非在不考虑预算约束的前提下单纯对质量进行排名。

该公司称,Arena 将对外公开,并在一定程度上“保持独立”于 OpenArt 其余业务;Guan 表示,OpenArt 未来可能探索与其他平台合作,允许其使用或集成该排名,但这不属于本次首发内容。

OpenArt Arena 在企业 AI 工作流中的定位

OpenArt Arena 在一个恰逢其时的节点推出,因为创意 AI 的采购正日益成为一个路由问题。生成最佳主视觉图像(hero image)的模型,未必能清晰渲染字体;最佳电影风格生成器未必是最佳视频编辑器;而美学上限最高的模型,在规模化应用时可能并不具备经济性。

首批 Arena 测试结果为上述论点提供了具体模型支撑。Seedance 2.5 是 OpenArt 发布视频中展板上的突出表现者,包揽了综合、电影、动态设计及唇形同步(lip-sync)四项排名榜首,仅以一分之差错失视频编辑类别第一。

在图像领域,领导地位则分属 GPT Image 2(平面设计板块)与 Seedream 5.0 Pro(电影与电商板块)。

这些结果作为一张标示各模型优势所在位置的地图,其价值远高于宣告某一个永久胜出者——尤其在这样一个市场中,正如关(Guan)所指出的,另一款模型可能一周后就会面世。

此次发布结果进一步印证了这一点。当前更难的问题在于:OpenArt 能否使其基准测试本身足够透明,从而让创意团队信任它所推荐的路径。

JOTO 企业落地观察

  • 对企业部署而言,Arena 的任务细分逻辑揭示:同一支营销团队若需同时产出包装图、广告预演和唇形同步短视频,必须按任务调度不同模型——这要求企业AI平台支持动态模型路由与API级成本/延迟/合规性元数据集成,而非仅提供统一‘最佳模型’推荐。
  • 对智能体工程而言,OpenArt 将专家委员会评审、品味引领者众包与任务定制提示集三者耦合,为构建面向垂直场景的AI智能体评估模块提供了可复用框架;但其未公开提示词总数与评审基数,使该框架在FDE落地时需额外嵌入内部验证环路以校准外部排名。
  • 对AI安全治理而言,OpenArt 保留部分提示词不公开以防范针对性过拟合,这一做法虽提升泛化性评估可信度,却加重了透明度负担;企业采购方须将其视为‘供应商生成型基准’,在合同中明确要求披露每类任务的最小评审样本量、置信区间计算方式及模型权重开放状态,否则无法满足GDPR/《生成式AI服务管理暂行办法》对评估可追溯性的合规要求。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.