JOTO
Contact us
← AI 智库
开源模型

Writer发布Palmyra X6:基于GLM-5.2微调的智能体模型,运营成本直降52%

2026 年 8 月 13 日

Writer推出旗舰模型Palmyra X6,基于中国开源模型GLM-5.2后训练,仅用626条合成轨迹实现7440亿参数模型优化;配套新编排框架与治理工具,使AI智能体成本降52%、速度升48%,并强化令牌支出管控能力。

Writer says its new Palmyra X6 model cuts AI agent costs by 52% as token spending surges

Writer——这家企业级AI智能体平台被包括埃森哲(Accenture)、优步(Uber)和先锋集团(Vanguard)在内的《财富》500强公司所采用——今日发布了其全新旗舰模型 Palmyra X6 ,同时推出重构后的智能体编排“框架”(harness)以及新的治理工具,旨在赋予IT领导者对失控的令牌(token)支出的管控能力。

关键数据十分醒目:Writer称,其智能体产品在搭配Palmyra X6后,平均运营成本降低52%,速度提升48%,质量提升10%。但更值得关注的故事或许是该公司如何实现这一成果——以及其选择所揭示的企业级AI市场走向。

Palmyra X6 并非从零开始训练。它是北京智谱人工智能公司(Z.ai,前身为Zhipu AI)开源权重混合专家模型 GLM-5.2的后训练版本——这一事实Writer在其技术报告中公开披露,也使这家旧金山公司置身于业内最具争议的辩论中心之一:美国企业是否应基于中国开源基础构建。 Z.ai——一家总部位于北京的公司,前身为智谱人工智能(Zhipu AI)——这一事实Writer在其技术报告中公开披露,也使这家旧金山公司置身于业内最具争议的辩论中心之一:美国企业是否应基于中国开源基础构建。

Writer产品管理总监马坦-保罗·谢特里特(Matan-Paul Shetrit)在发布前接受VentureBeat独家采访时指出:“该模型在任何方式、任何形态或任何形式上均未与任何原始开发者产生关联。它完全运行于我们的美国基础设施之上。”

领导Writer人工智能研究的丹·比克尔(Dan Bikel)表述得更为直白:“这本质上是一个Palmyra模型,我们只是恰好以浮点数值作为起点,然后在此基础上进行训练。”

为何AI智能体正以聊天机器人从未有过的方式激增企业预算

Writer此次发布恰逢智能体式AI的经济性问题已上升为企业采购决策的核心时刻。与通常每个用户请求仅生成一个答案的聊天机器人不同,AI智能体将单个请求转化为多轮规划、检索、工具调用、验证及重试——每一轮循环均消耗计量式令牌。用户仅看到一个答案;而账单则反映整个循环的消耗。

问题的规模正日益清晰。高盛预测,令牌消耗量将在2026年至2030年间 增长24倍,达到每月120千万亿(quadrillion)个令牌,驱动因素并非更多人提问,而是始终在线的企业级智能体。同一分析警告称,单个令牌价格下降并不能保证总账单下降:若一项智能体任务消耗的令牌数量增加20倍,而单位价格下降75%,总费用仍将上升五倍。

Writer首席技术官兼联合创始人瓦西姆·阿尔希赫(Waseem AlShikh)在一份声明中表示:“企业希望令牌消耗量激增——这意味着采用正在发生——但他们需要成本趋于平稳。”

谢特里特将成本问题定位为企业AI采用的主要障碍——其重要性甚至超过模型本身的能力。“当前阻碍企业扩展AI应用的最大障碍,在大多数情况下实际上并非模型能力;而恰恰是围绕这些模型的成本,”他指出,“现实情况是,在大多数情况下,AI的替代方案并非另一种AI,而是人工劳动。”

当被问及削减客户令牌消耗是否会侵蚀Writer自身按令牌计费的收入时,谢特里特驳斥了这一前提。“降低成本并未损害我的利润底线;实际上是在扩大它,因为它正在扩大组织内部机会的总体可服务市场(TAM)。”他辩称,每项任务成本降低将释放出企业原本绝不会自动化的业务流程。这一论点呼应了云计算时代熟悉的模式:十年间单位价格持续下降,但随着消耗量扩大,总账单反而上升——Writer明确押注这一动态将在智能体领域重演,并押注自身能从中获利。

Palmyra X6内部解析:仅用626个训练样本微调7440亿参数模型

Palmyra X6 是一个拥有7440亿参数的混合专家模型,每次生成令牌时约有400亿活跃参数,其架构完全继承自GLM-5.2,据Writer技术报告所述。公司的贡献在于一种刻意保守的后训练方法:一种称为 锚定监督微调(ASFT)的技术,应用于一个极为精简的数据集——仅含626条精心筛选的合成智能体轨迹,并以极低学习率进行单轮次训练。

该极小数据集本身就是设计意图所在,而非局限。ASFT结合一种令牌加权方案与KL散度“锚点”,惩罚微调后模型偏离冻结的基础模型过远——在不削弱基础模型已有通用能力的前提下,教授新的工具使用行为。Writer还将其核心权重矩阵的标准Adam优化器替换为 Muon——一种较新方法,将权重矩阵视为几何对象。

比克尔表示:“有一系列论文遵循所谓‘少即是多’(less is more)的哲学”,并援引研究表明,“小型但质量极高的数据集效果非常显著”。他补充道:“这正是我们在构建该模型时所遵循的哲学之一(之一),且已得到验证。它使我们得以以更低的优化成本为客户优化,最终为我们及客户产出成本更低的模型。”

训练数据本身完全为合成数据——所有规划、工具调用及最终答案均由教师模型机器生成,再经结构化质量关卡、基于模型的验证器以及由两个大语言模型组成的评审小组筛选后进入训练。此举延续了Writer长期坚持的做法:该公司 Palmyra X 004 在2024年几乎完全基于合成数据训练,当时据TechCrunch报道耗资约 70万美元 ;而据 Palmyra X5 所需GPU小时数约为100万美元,据 SiliconANGLE报道。

在Writer内部评估中——涵盖九项能力,包括知识 grounding 与检索、工具使用、内容生成、子智能体委派及品牌语调——X6平均得分为1.00分中的0.87分,略高于Anthropic的Claude Opus 4.8 (0.86分)、 Claude Sonnet 4.6 (0.85分)、OpenAI的 GPT-5.5 (0.80分)以及谷歌的 Gemini 3.1 (0.77分)。真正的差异化在于价格差距:Writer对X6的定价为每百万输入令牌2美元、每百万输出令牌8美元,而Opus 4.8的定价为15美元/75美元。该公司称,X6平均可在26秒内完成任务,并可无人值守地持续工作长达八小时以达成单一目标。

Writer 坦率承认,内部基准测试容易招致质疑。当被直接问及公司是否会于自行评估后公布其方法论时,Bikel 表示技术报告涵盖了“我们用于开展公开基准测试的协议,以及我们的内部评估”。他将公开基准测试描述为一种合理性检验,而非目标:“我们开展公开基准测试之类的工作,是为了确认自己正朝着正确的方向攀登,且不存在任何重大缺陷;但我们也不会盲目遵循这些基准,因为那实际上并不能真正服务于我们的客户。”

中国问题:基于 GLM-5.2 构建对企业的安全性与信任意味着什么

Writer 选择的基础模型,若放在两年前,对一家美国企业级供应商而言是不可想象的。而如今,它反映了一种市场现实: GLM-5.2于六月以宽松的 MIT 许可证发布, arguably 是目前全球能力最强的开源可用模型。独立分析机构 Artificial Analysis 在其 Intelligence Index(智能指数) 中为其评分为 51 分——在代理型任务(agentic tasks)上领先于 DeepSeek V4 ProKimi K2.6,甚至部分 Google 的 Gemini 模型;同时其定价远低于美国旗舰 API 定价数倍,欧洲科技媒体 Trending Topics 曾对此予以报道。Writer 的新闻稿称其为“当前最强大的开源权重模型”(the strongest available open-weight model)。

开源权重浪潮确实携带着真实包袱。AI 安全非营利组织 SaferAI 八月发布的一份报告指出, GLM-5.2 通过 Z.ai 的公开 API 接收的所有冒犯性网络或生物学任务请求均未拒绝 ,且 Z.ai 未发布任何安全框架或部署前风险评估——一旦任何人皆可下载并修改该模型权重,这一缺口将进一步扩大。

Writer 的回应是:来源可信度与训练后处理比模型起源更重要。Bikel 强调,该公司“从美国的 Hugging Face平台获取了权重”,并全程在美国基础设施上完成训练;技术报告指出,所有数据集均在美国合成并存储,全部训练硬件亦位于美国。

该公司还开展了其自称“异常严格、预先注册”的模型风险评估,覆盖政治偏见、审查、事实准确性及拒绝行为等维度,共评估 19,674 条响应,并由双盲评审员打分;该评估将 X6 与其 GLM-5.2 基础模型及四个前沿对照模型进行了对比。

在《华盛顿邮报》的 ModelSlant 政治偏见评估中,Writer 表示 X6 在 80% 的热点议题上呈现了双方观点,为所有受测模型中的最高比例;且针对 DeepSeek V4 明确拒绝的政治敏感提示,X6 给出了回应。在 FORTRESS 对抗性安全基准测试中,X6 配合其部署系统消息(deployment system message)在对抗性安全性方面较原始 GLM-5.2 基础模型高出 8.6 分,而对良性有用性的损害微乎其微。

Shetrit 表示:“我们在偏见、审查等方面开展了广泛的基准测试,而 Dan 及其团队所开展的工作已实际证明,该模型不仅显著优于各类开源替代方案,而且在基准测试当时,也优于市场上所有闭源替代方案。” 

该报告在一处值得注意的地方做了保留:尽管英语语境下的行为未显示出统计学上稳健的政治不对称性,但“行为表现因语言而异”——这一坦率承认表明,626 条微调轨迹并未彻底清除基础模型训练所留下的所有痕迹。

编排效应(harness effect):为何编排可能比模型本身更重要

Writer 公告中最具战略意义的主张,或许根本与 Palmyra X6 无关。该公司表示,其重建的 Writer Agent 编排层(Writer Agent harness) ——即负责任务规划、批量处理、委派子智能体及上下文管理的编排层——在所有经测试模型(包括来自 AnthropicOpenAI的第三方模型)上,均可降低 41% 成本并提速 44%,同时维持质量。Writer 已将该发现发表于一篇配套研究论文,题为“The Harness Effect(编排效应)”。

这引发了一个显而易见的问题,VentureBeat 向该公司提出了该问题:如果仅靠编排层即可在任意模型上实现大部分成本节约,那为何还要自建模型?

Shetrit 的回答聚焦于控制权:“我无法控制某家实验室是否弃用其模型,也无法控制他们模型所使用的数据。而当我自建模型时,我便拥有实质性的道德控制权,并能回应企业客户向我提出的棘手问题。”

Bikel 补充道,模型与编排层是协同开发的:“该模型的构建本质上与编排层共同演化……我们清楚自己拥有一款旗舰产品, Writer Agent。我们希望它能与该模型真正、真正地良好协同,而事实的确如此。我们在模型开发过程中就已将这一点纳入考量,而这在不自建模型的情况下是不可能实现的。”

值得注意的是,Writer 同时也在进行风险对冲。借助此次发布,该公司将多模型支持扩展至 Writer Agent,允许管理员启用来自 AnthropicOpenAI,以及包括 Microsoft AzureAWS BedrockNvidia NIM ——甚至包括图像生成模型,而这一类别并非Writer所构建。向首席信息官(CIO)传递的信息出人意料地简单:请使用我们的模型,因为它在您的工作流中成本最低且性能最佳;但无论您选择哪种模型,该平台都能帮您省钱。

新治理工具旨在在意外AI账单产生之前即予以终结

此次发布的第三大支柱针对一个更为隐性的企业痛点:C级高管层无人知晓智能体(agents)的支出情况。新的治理工具为管理员提供全公司范围内智能体使用情况的集中视图、针对公司可共享的“Playbooks”和“Skills”自动化功能的按工作流分析,以及配备警报与支出限额的消耗管控功能。

当被问及支出管控功能的引入是否意味着客户此前曾遭遇意外账单时,Shetrit将其重新定义为一项采用赋能工具,而非事后补救措施。“我们如何构建工具,让您作为企业的CIO或首席信息安全官(CISO),在安全性和支出两方面均感到安心,从而能在组织内扩大AI的使用?”他说道。据他所述,可见性正是让领导者敢于说“是”的关键:拥有清晰成本数据的企业“实际上正寻求将AI采用范围扩展至此前从未涉足的用例。”

该功能集反映了企业AI预算方式的整体转变。正如《福布斯》对token价格战的分析所指出,精明的买家正学会建模 每项成功任务的成本 ——计入重试次数、工具调用次数及升级操作——而非简单地将预期调用次数乘以标称费率表。Writer实质上将这一纪律产品化,将原本仅由财务团队在电子表格中执行的工作,转变为平台原生能力。

此举也完成了该公司历时一年多构建的治理闭环。根据公司早前公告,Writer于去年11月推出具备管理员控制功能的统一智能体体验,随后于今年3月新增智能体“Skills”及工作流分析功能。本周四发布的更新则通过为每个工作流附上价格标签及支出限额,最终完成该闭环。

Writer成立于2020年,创始人为May Habib与Waseem AlShikh, 于2024年末以19亿美元估值募集2亿美元资金,其业务聚焦于受监管、高风险的关键场景部署,而非面向消费者的大规模应用。Shetrit对其专注领域的狭隘性毫无歉意。“专注于企业用例的优势在于,我不需要我的模型具备撰写法语十四行诗的能力,”他表示,“当你不试图包揽一切时,你便能专注于客户的实际问题与需求。” 他对公司身份的表述同样直率:“我们并非一家由研究实验室转型而来、如今偶然涉足企业的消费级产品公司。我们首先且根本上是一家服务企业客户的企业级公司,所有决策均以此为出发点。这意味着,如果我们认为从零开始构建是正确选择,我们便会如此行动;但如果我们认为市场上已有其他方案能更好地服务我们的客户,我们便会采纳那些方案。”

这种务实态度或许是本次发布最重要的信号。一家拥有五年模型构建经验、资金雄厚的美国AI公司已得出结论:价值前沿不再位于预训练阶段,而在于最后一公里——即后训练阶段的开源权重、围绕其构建的工程化封装,以及向首席财务官(CFO)交付的仪表盘。倘若Writer判断正确,则前沿实验室的护城河将收窄至那些质量真正值得七倍价格溢价的工作负载领域;而对于其余所有场景,胜出的模型将是他人已出资完成预训练的那一个。

在一个已耗费三年时间争论谁家模型最聪明的行业中,Writer正押注另一条路径:企业AI竞赛的赢家不会是浮点运算性能最强的公司,而是最清楚如何运用这些性能的公司。

在一个已就‘哪家模型最聪明’争论了三年的行业中,Writer 正押注于一条不同的路径:企业级 AI 竞赛的胜出者,将不是拥有最佳浮点运算性能的公司,而是最懂得如何运用这些浮点运算结果的公司。

JOTO 企业落地观察

  • 对企业部署而言,Writer将GLM-5.2权重在美国基础设施上完成全部训练与数据合成,并开展19,674条响应的双盲风险评估,表明企业可依托可信开源基础构建合规AI系统,但需自主承担全链路安全验证责任。
  • 对智能体工程而言,其‘编排效应’(Harness Effect)显示,重构后的Agent编排层可在任意第三方模型上降低41%成本并提速44%,说明智能体经济性瓶颈正从模型本身转向任务调度、批量处理与上下文管理等工程层设计。
  • 对AI安全治理而言,Writer通过为每个工作流打价格标签、设置支出限额及可视化Playbooks使用情况,将FDE落地从技术能力延伸至财务可控性——这标志着企业AI治理已进入‘成本即策略’阶段,需同步建模重试、工具调用与升级操作的真实任务成本。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.