JOTO
Contact us
← AI 智库
大语言模型

Claude Haiku 5.5 发布:单价降九成

2026 年 10 月 8 日

Anthropic 发布 Claude Haiku 5.5,输入价格从每百万 token $1 降至 $0.10,输出从 $5 降至 $0.50,综合成本降低约 75%。该模型首次支持五档自定义思考程度(Low 至 Max),上下文达 100 万 token,单次输出上限 12.8 万 token。官方推荐其用于摘要生成、上下文压缩、分类等高吞吐、低成本任务,并可作为 Sonnet/Opus 的子代理协同工作。

最便宜最快的小模型

刚刚,Anthropic 发布了 Claude Haiku 5.5,这是 Claude 迄今最便宜、最快也是最能打的小模型。

同时官方还发布了两个更新:一个是对于 Sonnet,缓存的价格降一半;一个是 Claude 的 max 订阅会赠送等量 API 额度。

Haiku 5.5 官方发布图

先说模型,和上一代 Haiku 4.5 比,输入从每百万 token $1 降到 $0.10,输出从 $5 降到 $0.50。电脑操作(OSWorld)从 15.7% 涨到 72.4%,终端编程(Terminal-Bench)从 0.0% 涨到 39.2%。官方算下来,平均跑同样的活,比 Haiku 4.5 便宜约 75%。

另外,这是 Haiku 第一次能调思考档位。模型 ID 是 claude-haiku-5-5,上下文 100 万 token,单次最多输出 12.8 万。

跑分表现

官方拿 Haiku 4.5 和 OpenAI 的 GPT-6 Luna 来比,自家的 Sonnet 5.5 放在最右边作参考。

粉色那列是 Haiku 5.5
粉色那列是 Haiku 5.5

和上一代比,知识工作 GDPval-AA 从 735 分涨到 1620 分,人类最后的考试(HLE,不带工具)从 10.2% 到 45.9%,读图表的 Chartography 从 6.4% 到 46.4%。

那还要 Sonnet 干嘛?按官方的说法,复杂的 agent 编程,Sonnet 5.5 和 Opus 5.5 仍然更合适;Haiku 5.5 适合范围更窄的活,比如压缩上下文、写摘要、当子代理。

第一次有了档位

Haiku 5.5 这次支持了自定义思考程度,一共五档:Low、Med、High、Xhigh、Max。API 里不设的话,默认是 Med。

官方给 OSWorld、GDPval-AA、HLE 三个测试,都画了每一档的分数和花费。

横轴是每次尝试花的钱,对数刻度
横轴是每次尝试花的钱,对数刻度

价格结构

Haiku 5.5 的价格按提示长度分两档:

上下文在 10 万 token 以内,非常便宜,Haiku 便宜 90%;超过 10 万 token 则是便宜 50%。

还得说一下,这个模型换了和 Opus 5.5 一样的分词器,所以真实用下来,token 消耗会比 Haiku 4.5 多大概 30%。

这代模型比之前便宜了 75%。

当然,这模型也支持走批处理(Batch API)再打五折,10 万以内是输入 $0.05、输出 $0.25。

9 月 29 日 Sonnet 5.5 发布、预告 Haiku 5.5 “几周后上线”时,X 上的 Lumina 就说:Haiku 5.5 的价格得能和 Luna 拼,不然一出生就是死的(DOA)。

Lumina 推文截图

许愿成功,精确到美分。

给 Sonnet 打下手

官方建议,Haiku 5.5 适合处理那些是量大、对成本敏感的任务:比如写摘要、压缩上下文、查数据库、做分类。

它也是 Claude 目前最快的模型(Opus 开快速模式时除外),所以官方也推荐拿它做实时客服、操作浏览器。

还有一种用法,是给 Opus 5.5 或 Sonnet 5.5 当子代理:大模型拿主意、拆任务,一群 Haiku 分头去跑。

Claude 开发者账号放了一段跑在 Claude Managed Agents 上的演示:用一套家用杂物,设计一个装鸡蛋的架子,从越来越高的地方扔下去,目标 32 米不碎。左边 Opus 5.5 单干,右边 Opus 5.5 带 10 个 Haiku 5.5 子代理。

两边最后都过了 32 米。单干的用了 3 分 37 秒、试了 25 种方案、花了 $0.47;带队的用了 58 秒、试了 86 种、花了 $0.14。

十一个 AI,护送一颗鸡蛋
十一个 AI,护送一颗鸡蛋

配套的,Claude 的 Python 和 TypeScript SDK 加上了电脑操作和浏览器操作(beta)。

迁移指南

如果你是之前用 Haiku 4.5 的,这里还有份 官方迁移指南(摘要版):

  • 模型 ID 换成 claude-haiku-5-5,不带日期后缀
  • 同样的文字 token 数变多,max_tokens 和成本预估会变化
  • 不再接受固定思考预算(budget_tokens),改用自适应思考加档位
  • temperature、top_p、top_k 这几个采样参数要删掉
  • 不再支持预填助手回复(prefill),格式要求改用结构化输出
  • 电脑操作要换成新的工具集 computer_toolset_20260801
  • 暂不支持 Priority Tier

当然,都 agentic了,你大可以在 Claude Code 里跑一句 /claude-api migrate this project to claude-haiku-5-5,可以让它自己改。

顺手的两件事

一是 Sonnet 5.5 的缓存读取今天起减半,从每百万 token $0.20 降到 $0.10。缓存读取在模型的 token 用量里占了很大一块,官方算下来,Sonnet 5.5 跑多数 agent 任务能便宜约 2 成。

同样的分数,整条线往左挪
同样的分数,整条线往左挪

二是 Max 和 Team 订阅本周陆续开始每月送 API 额度:Max 5x 每月 $100,Max 20x 每月 $200,Team 最多 $500,全队共用。额度用在 Claude Platform 上自由使用。

同时,Haiku 5.5 今天起在 Claude Platform、Claude Code、AWS、Google Cloud 和微软 Azure 上都可以用。

JOTO 企业落地观察

  • Haiku 5.5 的低价与高吞吐特性,使企业可在 RAG 知识工程中大规模部署轻量级重排/摘要节点,替代传统规则引擎或高成本大模型,但需重新评估 token 消耗增长对整体 pipeline 成本的影响。
  • 五档思考控制能力为企业智能体工程提供了新维度:团队可在子代理编排中按任务复杂度动态分配档位,而非统一配置,这对需要平衡响应延迟与推理质量的客服、BI 助手类场景尤为关键。
  • Haiku 5.5 与 Sonnet/Opus 的协同范式,凸显企业 AI 架构正从“单一大模型”转向“异构代理集群”,这对 FDE 驻场共创提出新要求——需同步建模不同模型的能力边界、成本曲线与故障传播路径。
  • 缓存价格减半与 API 额度赠送虽属商业策略,但客观上降低了企业构建长期记忆型智能体的边际成本,尤其利好需高频调用历史会话或知识快照的金融、法律等强合规场景。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.