JOTO
Contact us
← AI 智库
开源模型

我给阶跃星辰 Step 5 Preview 出了一道工程题

2026 年 9 月 21 日

作者以内测资格测试阶跃星辰新旗舰模型 Step 5 Preview(内测代号 water18-0910),设计一道含双层 Bug、存储重试逻辑与十项硬性验收的 Python 工程题,对比阿里 Qwen 3.8 Max 和月之暗面 Kimi K3。Step 5 Preview 以 328 秒、28 次迭代一次性全通过,展现分层修复、主动补测等工程品味。模型参数 600B(激活 27B),百万上下文,API 定价输入 1 美元/百万 tokens,输出 2.7 美元,成本为 GLM-5.3/Kimi K3 的 35%、Claude Opus 5 的 12.5%。

Step 5 Preview 的核心规格与定位

最近一段时间,我都在参与阶跃星辰的新旗舰模型小范围内测,我们测试的时候,模型代号还是 Water18。现在这款新旗舰有了正式的名字,叫 Step 5 Preview。先单独说明一下:我内测截图里的模型 ID water18-0910,代表的就是 Step 5 Preview。除了横评,文中提到的大部分测试结果都出自这个模型。

6 月份我曾经介绍过 Step 3.7 Flash,当时印象就很深刻。这次的 Step 5 Preview 是阶跃星辰的新一代旗舰基模,开源,面向长程任务、Agent 和 Coding 领域。它的 Slogan 是:Advancing the Pareto Frontier——向前一步,智能效率的新一代“帕累托前沿”。就我自己的使用体感,就是把智能和成本的最优平衡点,再往前推进一步。

基模的基本规格:稀疏 MoE 架构,总参数 600B,每个 token 激活 27B,上下文窗口百万 tokens,支持视觉输入(图像、文本输入,文本输出),在 AI 编程、软件工程、专业知识工作等任务上达到前沿水平,在金融领域表现尤为突出。

API 定价是输入每百万 tokens 1 美元、输出 2.7 美元,缓存输入比标准输入便宜 95%。

OrderHub 项目目录结构图
OrderHub 项目目录结构

一道真实工程题的设计与要求

任务包是一个叫 OrderHub 的订单管理小系统,Python 加 Flask,四百多行代码,带 SQLite 数据库和一套 pytest 测试。系统能运行但有个真实的 bug:在订单列表里筛选“已支付”,导出,拿到的 CSV 只有 20 条,里面还混着其他状态的订单——数据库里有真实的 80 条已支付订单。我还有一个需求:存储层偶尔写入失败,请加个重试,最多三次。

bug 稍微有点深,表面那层在路由里:导出接口压根没把筛选参数传给查询层。后面还跟着一个:就算把参数传进去了,查询方法默认只返回第一页的 20 条。

只解决第一个问题,导出 80 条已支付订单时会发现自己只拿到 20 条,测试用例是通不过的。重试那儿也有个机关:存储层对同一个文件名的第一次写入必然失败,没有重试逻辑,第一次导出必然遇到 500。

验收标准一共十项:测试全绿、筛选导出条数和状态全对、导出不受分页影响、首次写入失败自动重试、重试不留重复或残缺文件、列表筛选分页无回归、无筛选导出全量 235 条、组合筛选正确、存储持续失败时返回明确错误、API 契约不变。每项都对应一条 curl 命令或一个测试用例。

三家模型的解法与表现对比

我肯定最关注模型的 Coding Agent 能力,所以拿到内测资格后,给它出了一道工程师经常会遇到的题:一个陌生的项目,一个能复现的 bug,一个顺手加上的小需求。为了测试它到底做得怎么样,我还拉来了另外两个小伙伴:阿里的 Qwen 3.8 Max 和月之暗面的 Kimi K3。三个模型拿到完全相同的任务包和提示词,在各自独立的目录和会话里开工,中途不许提问,我也不给任何提示。

Step 5 Preview 解题过程截图
Step 5 Preview 解题过程截图

Step 5 Preview 用了 328 秒,28 次模型迭代,第一次宣告完成时,十项验收全部通过。零纠错,零澄清,零人工介入。这个成绩相当不错。

它没有在最省事的调用处打补丁,而是在数据访问层新增了一个专门的 query_all 方法,语义上把“不分页、取全部”说清楚,导出走新方法,列表的分页逻辑原样保留。分层边界是这类问题最容易被糊弄过去的地方,它处理得干净。

另一个细节是测试。它主动给项目补了两个测试用例,其中一个模拟存储彻底挂掉,验证重试耗尽之后不仅返回 500,而且导出目录里非常干净,临时文件全部清除。这条断言对应的是我验收清单里的第九项。

唯一的问题是存储持续失败时,它只返回了一个错误信息“export failed”,虽然够用,但运维显然更喜欢写着重试次数和底层原因的报错。

Qwen 3.8 Max 最快,206 秒,18 次迭代,同样十项全过。它只改了一个文件:路由层先查总数,再按总数一次性取回,绕开分页。务实有效,但查询层那个“默认只给 20 条”的行为给保留了,其他人可能会踩坑。补测试补得最勤,四个用例,覆盖关键词筛选、全量导出和非法参数;失败报错也写得最详细,带重试次数和原始原因。

Kimi K3 用时也在 320 秒左右,十项全过,解法和 Qwen 基本一致,重试封装得更讲究一些,错误信息里带上了底层原因。

测试环境是 macOS 加 Kimi Code 和 Qoder,三家使用完全相同的提示词、代码包和验收清单。

Step 5 Preview 的工程品味与成本优势

这是个带两层 bug、一个隐藏故障点、十项硬性验收的工程任务,放在去年足以难倒绝大多数模型,现在三家都能一次通过,而且都懂得补测试、不碰我设计的断言、保持 API 契约,非常厉害。

Step 5 Preview 让我记住的是它的工程品味:它是唯一一个把 fix 放回了原来位置的选手。快一分钟慢两分钟,对真实工程来说没那么重要;但留在查询层里的分页默认值,在现实的工程里总会坑下一个人。

看模型发布报告,它的单任务成本是 GLM-5.3 和 Kimi K3 的 35%、Claude Opus 5 的 12.5%,这个还是很惊艳的。如果同等智能水平的价格真的打到三分之一,很多团队算得过来的账就得重算了。这大概也是“帕累托前沿”这句口号的味道,智能和成本并重。

真实项目中的落地验证

除了这道标准化的工程题,趁着无限 Token,我赶紧用来做点真实项目。

第一个项目:上周有个用户分享了他自己的开源项目,叫 Agent Hud,官网是 https://agenthud.app,可以利用 macOS 的灵动岛非常优雅地展示你的 Agent 使用额度,比如这样:

Agent Hud 在灵动岛显示效果
Agent Hud 在灵动岛显示效果

不过这个产品有个问题,就是刘海屏的 MacBook 接了外屏之后,它还会给你的大外屏上强制画一个刘海,还有个问题:不知道为什么,下拉菜单里没有退出选项,用着很不方便。既然是开源,那咱们就自己动手,丰衣足食。

我直接 Clone 了这个项目,让 Step 5 Preview 按照我的理解开始修改:

Step 5 Preview 修改 Agent Hud 的交互过程
Step 5 Preview 修改 Agent Hud 的交互过程

几轮交互之后,在非刘海的外屏上,它会只显示菜单项加退出,只在笔记本显示屏上才会有灵动岛的交互,这个任务完成得又快又漂亮。

修改后的 Agent Hud 外屏菜单界面
修改后的 Agent Hud 外屏菜单界面

第二个项目,是墨问的 CatReader。我之前做了一次产品计划,为用户提供更主动的阅读 Agent,第一步是提供主题阅读任务,当用户在 AskCat 里选中主题阅读卡之后,说“我想研究一下最近 Agent 产品的进展”,CatReader 会弹出一个任务卡,帮助你选择合适的文章进行主题阅读,期间可以批量收藏文章,做深度研究,并保存成墨问笔记等等。

这个项目我选择了让 Codex + Astra 和 CC + Step 5 Preview 交叉设计、实现和 review,整体效果相当不错,比如 Step 5 Preview 会对 Astra 的实现给出自己的看法:

Step 5 Preview 对 Astra 实现的 Review 意见
Step 5 Preview 对 Astra 实现的 Review 意见

Astra 的反馈如下,并且根据 Step 5 Preview 的部分意见进行了修复:

Astra 根据 Step 5 Preview 意见修复后的代码对比
Astra 根据 Step 5 Preview 意见修复后的代码对比

周末搞了两天,两个高手配合,Step 5 Preview 主实现,Astra 主审核,这个功能我已经发到测试环境了:

CatReader 主题阅读任务测试界面
CatReader 主题阅读任务测试界面

用户点击确认开始任务,AskCat 就会帮你筛选文章,加收藏,做研究,还能直接把研究成果保存到墨问里:

AskCat 主题阅读全流程操作界面
AskCat 主题阅读全流程操作界面

目前这个功能还有些小 bug,预计本周再修修就可以上线了。这个阅读 Agent,是我这次基模内测的一个附加收获,乌拉。另外,模型测试过程里我遇到的一些中断,安全护栏提示不合理等问题,都直接反馈给模型厂商,很快得到了处理和修复,非常开心。

权威榜单与综合能力验证

今天阶跃星辰的这款旗舰模型已经正式发布了,我们看看官方榜单的数据,比我专业:

Coding 方向上,DeepSWE v1.1 拿到 67.7%,与 Kimi K3 的 67.5%、GLM-5.3 的 66.9% 相近;自研的 StepCodeBench(覆盖 553 个真实代码仓库、33 种编程语言)拿到 49.0%。

长程任务:在一张 H100 上连续 24 小时从零优化 MLA GPU Kernel,最终跑到 508 TFLOPS;还有个彩蛋,它在没有任何专项优化的情况下连续玩 Pokémon Red 超过 3000 回合,累计交互近 600 万 tokens。金融方向的外部评测 FrontierFinance 上拿到 66.4,仅次于 Claude Opus 5。另外值得一提:这款模型将于 10 月 15 日正式开源。

官网放出的部分评测结果:DeepSWE、StepCodeBench、ProgramBench 等
官网放出的部分评测结果:DeepSWE、StepCodeBench、ProgramBench 等

第三方机构 Artificial Analysis 的榜单上,它的 Intelligence Index 是 44(v4.3 口径),单任务成本 0.71 美元。同等智能水平下,它的单任务成本是 GLM-5.3 和 Kimi K3 的 35%,Claude Opus 5 的 12.5%。一句话概括定位:用明显更低的价格,提供 Frontier 级别的能力。

Step 5 Preview 官方“帕累托前沿”图:横轴为单任务成本(对数刻度),纵轴为 AA 智能指数,Step 5 Preview 以约三分之一成本站上新前沿
Step 5 Preview 官方“帕累托前沿”图:横轴为单任务成本(对数刻度),纵轴为 AA 智能指数,Step 5 Preview 以约三分之一成本站上新前沿
Artificial Analysis 榜单:智能 44 分、每任务成本 0.71 美元,右侧成本对比里优势很直观
Artificial Analysis 榜单:智能 44 分、每任务成本 0.71 美元,右侧成本对比里优势很直观

这次内测,除了完成那道工程题,Step 5 Preview 还帮我改好了一个日常使用的工具,把 CatReader 的新功能推进到了测试环节。这样的收获,比跑分和榜单有价值得多。

如果更强的模型能以更低的成本进入日常开发,我们就能把更多时间花在那些一直想做、还没做完的事情上。比如我这个阅读 Agent,再修几个 bug,就能和大家见面了 :)

JOTO 企业落地观察

  • 企业部署 AI 编程助手时,需重点评估其对分层架构的理解能力与修复边界的保守性——Step 5 Preview 在 OrderHub 任务中坚持将修复置于数据访问层而非路由层,表明该类模型更适合嵌入已有工程规范严格的团队,降低后续维护风险。
  • 在 RAG 知识工程场景中,模型对“验收标准”的字面遵循能力(如十项逐条验证、补全测试用例)比单纯生成代码更重要;企业应将验收清单结构化为 prompt 工程的一部分,而非依赖模型自由发挥。
  • 百万级上下文与视觉输入支持,使该模型具备直接解析 PR 描述、截图报错、日志片段等混合信源的能力,为企业构建“问题感知—定位—修复—验证”闭环提供了更紧凑的技术栈选型可能。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.