JOTO
Contact us
← AI 智库
开源模型

GLM-5.3-Flash 将承担约45%的AI工作负载

2026 年 8 月 27 日

Z.ai发布的开源模型GLM-5.3-Flash以极低成本(7.5美分/百万token)进入OpenRouter,智能得分57,显著优于同价位竞品。其纯国产芯片与基础设施支撑能力引发美国企业重估AI支出结构,推动三层模型编排策略落地。

GLM-5.3-Flash will likely handle 45% of your AI workloads

一周前,一款名为 Ox Alpha 的神秘模型出现在 OpenRouter 上 ——这是超过 400 款模型中又一新成员,每周约有 10 款新模型上线。使其脱颖而出的不仅在于其免费价格标签;它还悄然表现出色。业余爱好者与独立开发者迅速注意到这一点,每日通过该模型处理数万亿个 token,社区对该周总用量的估算范围从个位数万亿到逾 20 万亿不等。

接下来六天里,AI 爱好者们展开数字取证并推测谁可能构建了该模型,以及谁拥有能免费服务如此海量 token 的基础设施。最初猜测指向一家美国实验室:久候未至的 Gemini、Anthropic 推出一款性能足够好的中端模型,或埃隆·马斯克坐拥过剩算力而直接发布了 Ox Alpha(注意其命名)。人们运行分词器追踪与网络分析。这真是一周现实版的福尔摩斯探案。

8 月 26 日, Z.ai 为其冠名。Ox Alpha 即 GLM-5.3-Flash。他们本就刻意将其投入公开流量中运行,但真正令人惊讶的并非该模型本身有多优秀(它确实非常优秀),而是其完全依托中国芯片与基础设施提供服务。标价为每百万 token 15 美分 / 50 美分。OpenRouter 的首发促销价为该标价的五折,即 7.5 美分 / 25 美分,优惠期截至 9 月 9 日。模型权重开源(MIT 许可证),推理服务由 Z.ai 以及 GMI Cloud、Cloudflare 和其他美国本土推理服务商共同提供。

Artificial Analysis 当日即将该模型纳入其 智能-成本对比图表 。GLM-5.3-Flash 在该指数中得分为 57,单任务成本约为 9 美分。一款美国中端模型如 GPT-5.6 Sol(max)得分约为 59,单任务成本为 67 美分,意味着为提升 2 分智能得分,你需多支付约 7.4 倍费用。进一步比较,Grok 4.6 得分为 61,单任务成本为 94 美分,即为提升 4 分智能得分需多支付约 10 倍费用。此时 token 经济学已深度影响使用决策。在指数顶端,曲线趋于平缓。若我们接受这一开源权重模型的诱惑,那么此前那些从未将强劲中国推理竞争者纳入考量的重型基础设施循环投资,又将何去何从?

美国企业已切实感受到成本压力。以优步(Uber)为例。首席技术官普拉文·内帕利·纳加(Praveen Neppalli Naga)今年 4 月向《The Information》透露,他正 “回到绘图板重新规划 ,因为原以为所需的预算已被彻底耗尽”:该公司 2026 财年全年编程预算在四个月内即告罄,而纳加本人仅一次两小时演示就烧掉了 1200 美元。至 6 月,优步已实施每人每工具 1500 美元的支出上限。这些工具确有实用价值——但实用性与价值并不等同。优步首席运营官安德鲁·麦克唐纳(Andrew Macdonald)仍无法将那些仪表盘与 每工具每人1500美元的上限 已实施。这些工具确实有用——但有用性与价值并非同一回事。优步(Uber)首席运营官(COO)安德鲁·麦克唐纳(Andrew Macdonald)仍无法将这些仪表板与 “消费者功能提升 25%”

麦肯锡《2026 年人工智能现状调查》 显示,80% 的受访者表示工作效率提升,37% 的企业观察到部分 EBIT(息税前利润)改善,32% 的企业因可借助编码智能体(coding agents)自主构建所需功能而跳过至少一项软件采购。各组织希望削减账单,却无力放弃 AI。当前任务是优化全组织范围内的 AI 使用效率。

我们无法回避智谱(Zhipu)、通义千问(Qwen)、深度求索(DeepSeek)及其他中国模型厂商。他们屡次凭借自身独创性挑战 SOTA 实验室并降低成本。在 OpenRouter 平台上,中国模型于 6 月初即超越美国模型的 token 份额,且该平台榜单前列仍主要由中国实验室占据。独立开发者生态已呈现为 GLM Flash、DeepSeek Flash、MiniMax、Kimi,偶尔穿插 Grok 或 Claude(前提是用户已为其高额订阅付费)。若你已通过公司订阅 Grok 或 OpenAI,则此费用已成为沉没成本。财务部门将开始质疑:若按量付费模式变得如此廉价,这些席位是否仍具合理性?

那么,我们还剩哪些选择?请将你的编码与智能体工作划分为三类,依据每类所承担的任务量与 token 用量占比划分——而非按美元金额划分,因为 GLM-5.3-Flash 的单 token 成本显著更低,即使按相等美元金额分配,大部分流量也已自动流向该模型。最顶层为 Fable 与 Opus。若需分析复杂策略或撰写详尽执行计划,额外的智能得分至关重要,此时应不惜重金,但仅限于那些不容妥协的罕见任务——此类任务约占总任务量的 5%。中层包括 Kimi K3、Gemini 3.7 Flash、GPT-5.6 Sol 与 Grok 4.6,其智能指数均在 60 左右。Kimi 在编码领域实力强劲且广受开发者青睐;Grok 4.6 紧随其后,但其较小的上下文窗口限制了其表现。约 50% 的流量应分配至此层级。剩余 45%,强烈建议采用 GLM-5.3-Flash 作为主力承载大流量任务。你的编排框架、混合使用场景(编码/内容/营销)及评估体系将共同界定你自身的前沿边界。中国开源权重模型将为你节省开支——它们必须纳入你的成本核算体系。

9 月将迎来新一轮模型发布潮——谷歌、xAI、Anthropic、OpenAI 与 DeepSeek 均预计有新品发布。帕累托前沿(Pareto frontier)或将再度移动。但方向已然明确:以更低成本获取更高智能。无法压低服务成本的实验室将失去流量——随之失去流量所催生的用户群体。

9 月之前,请完成以下功课:

  1. 统计你的 token 用量。能否将支出关联至客户增长或营收增长等顶层指标?若不能,至少能否关联至开发速度或生产力等指标?缺乏明确目标,将难以捍卫相关支出。

  2. 重新制定你的 AI 预算。按组织单元划分,计划中的 AI 支出是多少?相关负责人能否提出方案并为之辩护?

  3. 按团队定义你的模型战略。 明确划分三层:高阶层用于不可逆决策与战略制定;中阶层用于付费席位及日常编码;低阶层(GLM-5.3-Flash)用于大流量任务。

下月模型价格将进一步下调。你的团队需求将愈发旺盛。最终胜出的企业将有意图地押注,并且除非任务真正值得,否则绝不会让智能体在 Opus 或 Fable 上运行。

帕尔维兹·赛义德·穆罕默德(Parvez Syed Mohamed)是一位产品高管,曾于 Salesforce(MuleSoft)、Oracle 及 AgentPaaS.ai构建 API 集成与智能体平台。他专注于生产环境下的智能体系统建设。其关于使用智能体构建软件的部分思考见于: https://github.com/parvezsyed


欢迎加入 VentureBeat 社区!

我们的客座投稿计划旨在邀请技术专家分享洞见,提供中立、无利益关联的深度剖析,涵盖人工智能、数据基础设施、网络安全及其他塑造企业未来前沿科技。

阅读更多 来自我们客座投稿计划的内容——若您有意贡献自己的文章,请查阅我们的 投稿指南

JOTO 企业落地观察

  • 对企业部署而言,该模型迫使企业重新划分AI预算层级:5%高价值任务用Opus/Fable,50%中等任务用Kimi/Grok等付费模型,剩余45%大流量常规任务必须转向GLM-5.3-Flash——否则将面临优步式预算四个月耗尽的财务不可持续性。
  • 对智能体工程而言,文章明确要求按token用量而非美元金额划分任务层级,这意味着编排框架需支持细粒度流量路由与实时成本感知调度;GLM-5.3-Flash的MIT许可权重也允许本地化微调与私有化部署,降低智能体链路依赖风险。
  • 对AI安全治理而言,模型完全依托中国芯片与基础设施运行却通过Cloudflare等美国服务商交付,形成跨域推理链路,使传统基于供应商国籍的合规审查失效;企业需将‘推理路径可见性’纳入AI治理清单,而不仅是模型许可证或数据驻留地。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.