昨晚在X冲浪,刷到其他博主的一手资讯,Qwen3.8 来了:

这是个参数2.4T的模型,官方给出的自评口径是「可能是除了Fable5外最强大的模型」,线上已经放出Qwen3.8-Max预览版:

预览版,which means,还不是完全体,先给大家品鉴一下。
又看到朋友评价这个模型的表现超预期,嗅到热度的我立马被激起好奇心,写完视频脚本,立即开测!

我是在阿里云买了Token Plan测的,最低39元/月,完整套餐方案如下,给大家参考:

最近还有活动,限时加量10倍,个人版夜间(晚上10点到早上8点)在此基础上再打2折,大家想省开支体验的话可以在晚上肝一肝。
言归正传,今天我的测试方案是,让CodeX帮我把 Qwen3.8-Max-Preview 接进 Claude Code,给完整的本地工具权限,我负责出题,CodeX负责下具体命令,Qwen3.8 来做一线执行,实际观测它处理「读资料—做产品—写代码—跑测试—修 Bug—交付」这套超长任务流程的执行表现。
案例质量出乎我意料……赶紧写下来分享给大家。
我前段时间在帮企业培训的公司做一个投放系统,大概流程就是希望可以接入Agent能力,实现AI自投放,人工干预调整策略,提高投放部门人效。
因为要申请千川API,之前用 Codex 搭了个框架我就闲置了,于是我让 Qwen3.8 接手帮我做下重构,历史项目文件夹里有产品文档、素材追投 SOP、页面交互重构任务书、还有旧 HTML 原型。
半小时后,这个项目就完整做完了:

可以通过执行历史清晰看到 Qwen3.8 的执行过程:

全程让模型通过 Claude Code 读取文件、写代码、运行命令、调用 Playwright,接入丝滑。
通过历史记录,可以发现,Qwen 3.8 在生成超长单文件应用的时候,会先在服务端组织完整的文件写入参数,终端会长时间没有增量输出,但阿里云的连接支持做得不错,稳定,可以长时间保持接口活跃不中断执行。
生成结果看这里:

涉及客户隐私我打个码,总之就是个助力品牌投放提效的系统。
7个功能全部完备,还设计了和飞书的打通,串起人和AI的工作流衔接:

之前这种系统都需要采买,现在有了强大的模型能力,一个不懂技术的业务人员,可以结合自己的业务需求做个更符合团队工作流的系统,不用等研发团队迭代,想改就改。
这就是AI时代给普通人带来的新机遇。
测模型的时候我最喜欢做游戏案例,主要是方便给大家看视觉效果,相信你们如果看过我之前的文章也知道之前的模型大概是个什么能力。
为了测试长任务效果,今天我提高了游戏的复杂度,让 Qwen3.8 给我复刻个童年经典 GBA 像素 RPG。
OK,做完了:

我把游戏截图发群里,有做过游戏的朋友评价:

以上截图还有点视觉bug后面我修掉了,完整的体验视频体验可以看这里:
GBA 时代画面元素拉满,小镇、草丛、实验室、三只初始怪,走进草丛会随机遇敌,战斗里也有招式、属性克制、血条和经验反馈,这已经完全是一个完全体游戏了。
Qwen 3.8实现了自己写 Playwright 测试,10/10 通过,我引入了「第三方监工」 Codex 做复验构建和测试,他俩分工合作,稳稳接住我的需求:

第一版默认做了英文版,我要 Qwen 3.8 改个中文版,它会自己去找到合适的开源字体,有实现阻碍也会自己完成方案设计:

整个流程从下命令到修bug,大概2小时完工——这种开发效率要是之前,哪里敢想。
但现在的模型,就是可以做到。
通过翻看日志,我也看到了 Qwen 3.8 几个执行细节,以下内容比较偏技术,大家可以做个概览:
Playwright 瞬时按键让 Phaser 丢失输入,Qwen 改成了 keydown → 持续 → keyup;战斗结束后场景没有正确唤醒,Qwen 回查 Phaser 生命周期,并完成了修复; 截图状态断言通过,但 UI 实际随镜头漂走、文字溢出,作为多模态模型的 Qwen 读取图片后继续返工。
这就是 long-horizon Agent 和普通一次性代码生成的区别。
不是写完搞个半成品给你,能够自己搞定编码、验收、交付,才算是一个合格的、更接近生产力的完全体模型。
测试下来,目前已经开放体验的 Qwen3.8-Max-Perview 在复杂中文材料理解、长程执行和工具调用上已经可以进入真实工作,交付结果非常可观。
