Qwen 3.8-Max与Claude Opus 5评测分歧揭示:模型成本不能只看单价,而要看‘每次成功任务的成本’
本文指出当前大模型评测严重忽视token与时间预算差异,导致Qwen 3.8-Max在不同框架下排名悬殊;提出以“每次成功任务的成本”为核心指标,并强调需明确区分超时、验证失败等失败类型,方能真实评估智能体落地效能。

阿里巴巴发布了Qwen 3.8-Max 本周,并将该预览版宣传为仅次于Claude Fable 5(其) 发布当日的排行榜 结果更为模棱两可:该模型仅在12项编码智能体评测指标中的一项上领先)。但一个独立评测框架得出了几乎相反的结论:一次 基准测试运行apparently使用预览版本,将Qwen 3.8-Max的最佳表现置于中游水平,而其默认设置则垫底。
两项结果均为真实且可辩护。二者之间的差距主要在于token预算和时间预算,而这至关重要,因为这些数值通常不会作为 headline 数字被突出显示。 阿里巴巴的脚注 为其编码评测设定了五小时超时限制,在PaperBench上每轮运行最长可达12小时。而独立评测框架VulcanBench允许 45至60分钟的真实墙钟时间。阿里巴巴一方的时间预算比VulcanBench大5至16倍,这解释了结果的巨大差异。
现在是时候采取两项措施,以在选择模型时开始纳入这些差异考量。第一,应采用的衡量指标是“每次成功任务的成本”:总支出(包括所有失败尝试所花费的全部成本)除以实际通过您验收检查的任务数。第二,您需将时间或token预算明确列为验收标准的一部分,而非隐藏细节。
每token价格已不再能预测账单
Qwen 3.8-Max发布首周,所有人发布的对比均为价格对比,因为这是当时唯一可用的数据。它并非廉价模型。DeepSeek-V4-Flash-0731于7月31日进入公开API测试阶段, 标价为每百万输入token 14美分、输出token 28美分。Qwen 3.8-Max标价为2美元(输入)和6美元(输出)。Kimi K3标价为3美元(输入)和15美元(输出)。
这些价格所能告诉您的信息已不如以往丰富,原因在于Qwen这类推理模型具有特定属性:得出结果需要消耗推理token。若某模型将其大部分token配额用于推理,则可能在写出答案前即达到token上限,从而返回空结果——该结果与完全失败无法区分,却仍需支付整轮运行的全部费用。
Artificial Analysis已提供 目前公开发布的最清晰测量数据 ,说明此现象如何影响真实智能体的实际支出:在其Intelligence Index上以最高努力程度运行DeepSeek-V4-Flash,消耗了2.1亿输出token,远高于同类中位数1亿。尽管绝对成本依然较低(因token单价极低),但冗长性不仅耗费金钱,更耗费时间;而依据您的具体用例,这可能直接导致失败。
您真正需要的是一个数字,它统计您投入的一切成本(包括返回空结果的尝试),再除以在您指定的时间与token预算内实际完成的任务数。这正是“每次成功任务的成本”这一指标助您看清的内容。
您的失败率部分取决于配置设定
产生错误答案的运行与耗尽预算的运行是两类不同事件,需采用不同修复方式。几乎没有任何评测框架对二者加以区分,也几乎没有任何排行榜报告该细分数据。我在构建 自己的智能体基准测试时遭遇此问题:评测框架仅记录失败,未说明失败原因,我不得不自行添加该区分。当您确实将二者分开后,预算耗尽便成为主导因素。
Long-Horizon-Terminal-Bench于7月发布,通过统一评测框架对17个前沿模型在46项任务上各进行一次90分钟尝试。超时占未解决运行的79%,自主终止占19%,评测框架错误仅占3%。作者谨慎说明该数据的含义与局限:超时运行并未接近完成,平均奖励值介于0.10至0.35之间,因此不能假设增加时间即可获得成功。但教训在于:无论是否明示,基准测试实际上都在隐式衡量时间效率。
该机制最清晰的公开案例来自VulcanBench——即支撑Qwen图表的同一开源评测框架。在 一份日期为7月26日的报告中,Claude Opus 5的最低努力程度设置表现最佳,成功解决23项任务中的20项,而高努力程度设置仅解决18项。额外推理并非毫无价值:高努力程度设置返回的错误答案最少(仅1个,对比低努力程度设置的3个)。但它反而耗尽了时间,而超时计分为零。其三项性能退化中有两项发生在低努力程度设置可解决的任务上;若给予无限时间,它仅能与其最廉价设置打平,但成本却是后者的3.1倍。
这对任何构建路由阶梯(routing ladder)者都有直接影响。标准设计是在廉价尝试失败后升级至更高推理层级,假定下一级别性能更优、仅成本更高。但对于相当一部分模型与任务组合而言,该假设并不成立;您将为升级支付更高层级的价格,却最终陷入超时或触达上限。
哪些机构已在测量此项指标
过去数月间,多个团队已各自独立采用“每次成功任务的成本”作为衡量标准,这是该指标正成为行业标准的最强信号。
VulcanBench将“每项已解任务美元成本”列为头条栏目,并 自其最早期报告起即如此。Long-Horizon-Terminal-Bench在准确率旁并列发布每项任务成本,其最具启发性的行是GPT-5.4:每项任务约26美元,但通过率远低于Grok 4.5(每项任务约11美元)。TestEvo-Bench在成本上限约束下运行智能体,Claude Code的测试生成得分在更严格成本上限下从71%降至44%。
供应商已接受按每次成功任务计量的理念。HubSpot已于4月将其Breeze客户智能体迁移至 每次解决对话50美分,此前为每次处理对话1美元。 Zendesk按自动化解决次数计费。Fin按结果收费 每次结果99美分 ,且仅在端到端解决后计费。
本周应做出的改变
将每次智能体运行的失败原因作为必填字段输出,其中“预算耗尽”、“验证器失败”与“评测框架错误”须作为独立取值,而非统一归为单一失败标志。在您能区分超时与错误答案之前,您的通过率实则同时衡量两种不同事物,因而无法判断应修正哪一类问题。
按每种努力程度(effort level)而非仅按模型计算每次成功任务的成本:包含所有失败尝试在内的总支出,除以通过您验收检查的任务数。该排名将不同于价目表,而最廉价设置很可能胜出。
除非延迟确属您的服务等级目标(SLA)核心指标,否则应设定token上限而非真实墙钟时间上限。墙钟上限会将服务商的响应速度计入模型质量评分。
检查您已部署的所有模型的默认努力程度设置。Qwen 3.8-Max默认以最高推理程度运行 当 effort 字段未设置时,且其最高设置在独立测试中表现最差。从未调整该参数的团队所运行的配置,其每解决一项任务的成本最高。
JOTO 企业落地观察
- 对企业部署而言,文章揭示默认高推理设置(如Qwen 3.8-Max)可能推高单任务成本却降低通过率,企业须将‘预算耗尽’设为独立监控维度,并动态调整effort level而非依赖价目表选型。
- 对智能体工程而言,Long-Horizon-Terminal-Bench数据显示79%未解任务源于超时,说明现有框架普遍缺失失败归因能力;工程团队需在自建评测中强制输出失败原因字段,否则无法定位是调优prompt还是收紧预算。
- 对FDE落地而言,HubSpot、Zendesk等已转向按‘解决次数’而非‘调用次数’计费,印证成本计量方式正从模型层下沉至业务结果层;企业AI转型必须将SLA中的延迟目标与token上限绑定,避免将服务商响应波动误判为模型能力缺陷。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


