Claude Haiku 5.5 发布:单价降九成
Anthropic 发布 Claude Haiku 5.5,输入价格从每百万 token $1 降至 $0.10,输出从 $5 降至 $0.50,综合成本降低约 75%。该模型首次支持五档自定义思考程度(Low 至 Max),上下文达 100 万 token,单次输出上限 12.8 万 token。官方推荐其用于摘要生成、上下文压缩、分类等高吞吐、低成本任务,并可作为 Sonnet/Opus 的子代理协同工作。
最便宜最快的小模型
刚刚,Anthropic 发布了 Claude Haiku 5.5,这是 Claude 迄今最便宜、最快也是最能打的小模型。
同时官方还发布了两个更新:一个是对于 Sonnet,缓存的价格降一半;一个是 Claude 的 max 订阅会赠送等量 API 额度。

先说模型,和上一代 Haiku 4.5 比,输入从每百万 token $1 降到 $0.10,输出从 $5 降到 $0.50。电脑操作(OSWorld)从 15.7% 涨到 72.4%,终端编程(Terminal-Bench)从 0.0% 涨到 39.2%。官方算下来,平均跑同样的活,比 Haiku 4.5 便宜约 75%。
另外,这是 Haiku 第一次能调思考档位。模型 ID 是 claude-haiku-5-5,上下文 100 万 token,单次最多输出 12.8 万。
跑分表现
官方拿 Haiku 4.5 和 OpenAI 的 GPT-6 Luna 来比,自家的 Sonnet 5.5 放在最右边作参考。

和上一代比,知识工作 GDPval-AA 从 735 分涨到 1620 分,人类最后的考试(HLE,不带工具)从 10.2% 到 45.9%,读图表的 Chartography 从 6.4% 到 46.4%。
那还要 Sonnet 干嘛?按官方的说法,复杂的 agent 编程,Sonnet 5.5 和 Opus 5.5 仍然更合适;Haiku 5.5 适合范围更窄的活,比如压缩上下文、写摘要、当子代理。
第一次有了档位
Haiku 5.5 这次支持了自定义思考程度,一共五档:Low、Med、High、Xhigh、Max。API 里不设的话,默认是 Med。
官方给 OSWorld、GDPval-AA、HLE 三个测试,都画了每一档的分数和花费。

价格结构
Haiku 5.5 的价格按提示长度分两档:
上下文在 10 万 token 以内,非常便宜,Haiku 便宜 90%;超过 10 万 token 则是便宜 50%。
还得说一下,这个模型换了和 Opus 5.5 一样的分词器,所以真实用下来,token 消耗会比 Haiku 4.5 多大概 30%。
这代模型比之前便宜了 75%。
当然,这模型也支持走批处理(Batch API)再打五折,10 万以内是输入 $0.05、输出 $0.25。
9 月 29 日 Sonnet 5.5 发布、预告 Haiku 5.5 “几周后上线”时,X 上的 Lumina 就说:Haiku 5.5 的价格得能和 Luna 拼,不然一出生就是死的(DOA)。

许愿成功,精确到美分。
给 Sonnet 打下手
官方建议,Haiku 5.5 适合处理那些是量大、对成本敏感的任务:比如写摘要、压缩上下文、查数据库、做分类。
它也是 Claude 目前最快的模型(Opus 开快速模式时除外),所以官方也推荐拿它做实时客服、操作浏览器。
还有一种用法,是给 Opus 5.5 或 Sonnet 5.5 当子代理:大模型拿主意、拆任务,一群 Haiku 分头去跑。
Claude 开发者账号放了一段跑在 Claude Managed Agents 上的演示:用一套家用杂物,设计一个装鸡蛋的架子,从越来越高的地方扔下去,目标 32 米不碎。左边 Opus 5.5 单干,右边 Opus 5.5 带 10 个 Haiku 5.5 子代理。
两边最后都过了 32 米。单干的用了 3 分 37 秒、试了 25 种方案、花了 $0.47;带队的用了 58 秒、试了 86 种、花了 $0.14。

配套的,Claude 的 Python 和 TypeScript SDK 加上了电脑操作和浏览器操作(beta)。
迁移指南
如果你是之前用 Haiku 4.5 的,这里还有份 官方迁移指南(摘要版):
- 模型 ID 换成
claude-haiku-5-5,不带日期后缀 - 同样的文字 token 数变多,
max_tokens和成本预估会变化 - 不再接受固定思考预算(
budget_tokens),改用自适应思考加档位 temperature、top_p、top_k这几个采样参数要删掉- 不再支持预填助手回复(prefill),格式要求改用结构化输出
- 电脑操作要换成新的工具集
computer_toolset_20260801 - 暂不支持 Priority Tier
当然,都 agentic了,你大可以在 Claude Code 里跑一句 /claude-api migrate this project to claude-haiku-5-5,可以让它自己改。
顺手的两件事
一是 Sonnet 5.5 的缓存读取今天起减半,从每百万 token $0.20 降到 $0.10。缓存读取在模型的 token 用量里占了很大一块,官方算下来,Sonnet 5.5 跑多数 agent 任务能便宜约 2 成。

二是 Max 和 Team 订阅本周陆续开始每月送 API 额度:Max 5x 每月 $100,Max 20x 每月 $200,Team 最多 $500,全队共用。额度用在 Claude Platform 上自由使用。
同时,Haiku 5.5 今天起在 Claude Platform、Claude Code、AWS、Google Cloud 和微软 Azure 上都可以用。
JOTO 企业落地观察
- Haiku 5.5 的低价与高吞吐特性,使企业可在 RAG 知识工程中大规模部署轻量级重排/摘要节点,替代传统规则引擎或高成本大模型,但需重新评估 token 消耗增长对整体 pipeline 成本的影响。
- 五档思考控制能力为企业智能体工程提供了新维度:团队可在子代理编排中按任务复杂度动态分配档位,而非统一配置,这对需要平衡响应延迟与推理质量的客服、BI 助手类场景尤为关键。
- Haiku 5.5 与 Sonnet/Opus 的协同范式,凸显企业 AI 架构正从“单一大模型”转向“异构代理集群”,这对 FDE 驻场共创提出新要求——需同步建模不同模型的能力边界、成本曲线与故障传播路径。
- 缓存价格减半与 API 额度赠送虽属商业策略,但客观上降低了企业构建长期记忆型智能体的边际成本,尤其利好需高频调用历史会话或知识快照的金融、法律等强合规场景。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


