2.4 万亿参数 Qwen3.8-Max 重磅上线:能自研框架、开放权重,国产 AI 再迈关键一步
千问全新大模型 Qwen3.8-Max 上线,2.4 万亿参数可独立完成完整软件开发,推理定价仅海外头部模型四分之一。官方宣布下周开放权重,不过超大体量难以本地部署,复杂软件工程等能力仍有明显短板,理性看待新模型红利。
2026 年 8 月 3 日周日,科技圈同一天爆出两条重磅消息:一边DeepSeek-V4-Flash靠着低廉推理成本刷屏全网,另一边阿里千问团队悄悄推出重磅新模型 ——Qwen3.8-Max。这款 2.4 万亿参数的大模型不仅对外开放 Max 规格完整权重,更亮眼的是,它只用 16 天从零搭建出一套完整开源 Agent 开发框架。
消息放出当天,阿里港股大涨 7.26%,市值冲到 2.41 万亿港元;美股同步上涨超 4%。资本市场用股价给出了直接反馈,但背后更值得深究的是一个核心问题:当一款万亿级大模型既能拿下各大评测榜单高分,还能自主写代码、提交迭代、修复程序漏洞,AI 行业的比拼逻辑,是不是已经彻底变了?
现状:Qwen3.8-Max到底强在哪?
先看实打实的硬件与架构数据。Qwen3.8-Max 基于 Qwen 3.5 架构打造,采用稀疏 MoE 搭配混合注意力机制,整体总参数 2.4 万亿,实际激活运行仅 950 亿参数,原生支持百万 token 超长上下文窗口与多模态视觉解析。
8 月 3 日更新的 Arena 榜单,它的综合表现全部冲进前五,国产模型里还是头一回做到:
榜单排名得分Text Arena单模型第5 / 实验室第21496分CodeArena (WebDev)单模型第4 / 实验室第31668分Vision Arena第21305分再看主流专业基准测试,优势项十分突出:
基准Qwen3.8-Max对比PaperBench93.0高于Fable 5的88.8OSWorld-Verified86.1参评模型首位BabyVision(无工具)82.0超出部分主流模型近2倍GPQA Diamond92.6—Agent's Last Exam52.4前沿水平参数化CAD91.5超过Fable 5、GPT-5.6 Sol、Gemini 3.1 Pro
Qwen3.8-Max 在 16 项基准上与主流模型的对比核心优势一目了然:论文研读、电脑系统操作、工业建模都是它的王牌,多项测试直接登顶参评榜单。
不过它并非全面碾压所有海外顶尖模型,短板同样清晰:SWE-bench 专业软件工程仅 67.7 分,和 Fable 5 相差 12 分;终端指令操作、长视频理解两项,也小幅落后 GPT-5.6 Sol。强弱一目了然,全部用测试数据说话。
下面从四个核心角度,把这款新模型拆解清楚。
核心拆解:四个维度看Qwen3.8-Max
🤖 维度一:16天自主编程——AI给自己写了个"大脑操作系统"
这可能是整场发布中最具想象力的部分。
Qwen团队让Qwen3.8-Max从一个空文件夹开始,自主创建了一个叫oh-my-cli的项目——一个自进化的agent harness。整个过程持续约16天,截至7月30日。
产出数据:
指标数量Commits265个Pull Requests127个Issues151个这不是简单的代码生成。Qwen3.8-Max用的是一套叫Loop Engineering的方法论:
- • issue状态机:每个任务从
ready → leased → active → E2E测试+CI检查 → PR合并,完整的状态流转 - • dispatcher + monitor + watchdog:三重保障,异常状态自动回传修复
- • 自测试体系:Build / UnitTest / E2E / Desktop Lifecycle全覆盖
- • 多源进化:社区反馈 + 用户反馈 + 开发者反馈,全部转化为可执行任务
换句话说,它不只是写代码,它是在管理一个软件项目。提issue、领任务、写代码、跑测试、提PR、合并——一个人干完了整个开发团队的活。
而且,oh-my-cli已经完全开源:GitHub仓库 qwen-code-dev-bot/oh-my-cli。支持 /goal、/resume、Dynamic Workflow、Session Replay、Desktop等功能。
更关键的是,这种能力不是只在自己造的 harness 上才有效——Qwen3.8-Max 在 Claude Code、Codex、OpenCode、Hermes、QoderWork 等主流 Agent 框架上同样能跑出接近甚至超越其他专用模型的表现。
Qwen3.8-Max 在 5 大主流 Agent 框架上的泛化表现(图:Qwen3.8-Max 在 CoWorkBench / WorkspaceBench / JobBench 三个跨框架基准上,与 Fable 5、Opus 4.8、Qwen 3.7 Max 的对比。Qwen3.8-Max 在 OpenCode、Hermes 等 5 种 harness 上都拿下了领先成绩。来源:阿里云官方博客)
这让人想起7月17日Kimi K3发布时讨论过的"万亿参数开源"趋势。如果说Kimi K3证明了万亿参数可以开源,Qwen3.8-Max则证明了万亿参数模型可以自主构建工具链——从"被使用"到"自己造工具",这是一个质变。
✨ 维度二:125小时自主研究——不止会写代码,还会做科研
16天编程之外,Qwen3.8-Max还花了约125小时做自主研究。
任务很硬核:复现研究论文实验,然后工程化新方法,超越原始论文。
目标论文是《Unified Data Selection for LLM Reasoning》,主题是"AI训练中哪些数据样本值得保留"。结果呢?在AIME24上提升了2.7分。
更夸张的是量化工作流:约330个子Agent协调,约6000次因子回测。
这是什么概念?相当于一个量化研究员团队几个月的工作量,它用子Agent集群在短时间内跑完了。你把330个子Agent想象成330个实习生同时干活,每个负责一个因子回测的切片,最后汇总结果——只不过它们不需要吃饭睡觉。
还有两个实验值得一提:
实验能力展示亮点RecreationBench无互联网、无源码的黑盒环境重建应用纯交互反馈+视觉反馈,前沿混合Agent能力WWW2025竞赛多模态对话意图识别挑战赛超越人类参赛者RecreationBench尤其有意思。想象一下:你给它一个APP,不给源码,不让它上网,它纯靠"点一点、看一看"就把这个APP复刻出来。这已经不是简单的代码生成了,而是逆向工程+视觉理解+代码重建的复合能力。
支撑这一切的,是阿里在训练阶段对 RL 训练环境的规模扩展。看下面这张图——随着训练环境数量从 0 增加到 4000+,综合 Score Index 从 0.474 一路爬升到 0.725(最佳 Checkpoint),之后才略有回落。
Qwen3.8-Max 综合 Score Index 随 RL 训练环境数量的变化(图:Qwen3.8-Max 在 10+ 项基准上的综合 Score Index 随 RL 训练环境数量(0→5000)的变化曲线。最佳 Checkpoint 出现在 4000 个环境附近,综合得分相对 SFT 基线(0.474)提升了约 53%。来源:阿里云官方博客)
这就是所谓的 "Joint Scaling of RL Environments and Compute"——把环境规模和算力一起扩,模型在多种 Agent 框架上的综合能力才能稳定提升。这也是 Qwen3.8-Max 能在不同 harness 上都跑出好成绩的底层原因。
🏆 维度三:首次开放Max级权重——但别急着兴奋
Qwen团队宣布,下周在Hugging Face和ModelScope上开放Qwen3.8-Max的权重,同时开源Qwen3.8-27B。
这是首次开放Max级模型权重,意义重大。
但冷静算一笔账:2.4万亿参数,4-bit量化后约1.2TB。这是什么概念?一台顶配的8×H100服务器,显存也就约640GB。普通团队根本无法本地部署。
所以,真正对大多数团队有意义的,是Qwen3.8-27B。这个体量才是能实际跑起来的模型。Max级权重的开放更多是象征意义和科研价值——它让全世界的研究者可以拆解一个2.4万亿参数模型的内部结构,研究MoE路由策略、专家分布、注意力机制的设计选择。
一言以蔽之:Max版看API,27B版看本地,别搞混了。
💰 维度四:定价——比Opus 5便宜多少?
说完了能力,说钱。Qwen3.8-Max的定价策略相当激进:
项目国内(¥/百万Token)国际($/百万Token)输入¥12$2输出¥36$6隐式缓存命中¥1.5$0.25关键对比:国际输入价格仅为Opus 5的40%,输出价格仅为24%。隐式缓存命中更是只有输入的1/8。
如果你之前看过本号Dify API接入和vLLM自部署的实战文章,应该对这个价格敏感。这意味着你可以用不到四分之一的输出成本,获得一个Arena排名前五的模型能力。
当然,27B开源版才是自部署的真正选择。Max版走API,27B版走本地,双线并行——这大概是当前最优的搭配策略。
对你的影响:该不该上车?
分三种情况说:
你是开发者/技术团队:27B开源版值得第一时间关注。下周Hugging Face和ModelScope同步发布,拿到权重后可以跑benchmark,对比你当前在用的模型。如果你的场景偏代码生成和Agent编排,Qwen3.8-Max的API值得接入测试——尤其价格优势明显,试错成本极低。
你是研究者:Max级权重首次开放,这是研究MoE架构和万亿参数模型内部机制的绝佳机会。同时,oh-my-cli项目本身就是研究Agent自主性的活教材——265个commit的完整历史,比任何论文都生动。你可以逐个commit追踪它的决策过程。
你是企业决策者:QwenWork同日发布,通过PC客户端和钉钉使用,是面向办公场景的Agent产品。如果你的组织在用钉钉生态,这可能是最低门槛的接入方式。不用碰代码,直接在钉钉里用。
冷静思考:6个不能忽视的问题
热度之下,有几个点必须说清楚:
1. SWE-bench Pro落后12分。 67.7 vs Fable 5的80.0,这是传统软件工程任务的核心benchmark。说明在复杂代码重构、多文件协作等场景,Qwen3.8-Max仍有明显差距。自主编程16天的产出很惊艳,但SWE-bench Pro的数据提醒你:实验室的自主项目和真实的软件工程,不是一回事。
2. TerminalBench和VideoMME未达领先。 终端操作86.6(低于GPT-5.6 Sol的88.8)和视频理解68.3(低于71.1),这两个方向Qwen3.8-Max还没追上头部。
3. 2.4T权重,部署不了。 前面算过了,1.2TB的4-bit量化,普通团队想都别想。别被"开放权重"四个字冲昏头脑,27B才是你的菜。
4. Arena排名含系统调优加成。 实验室排名和纯模型能力排名是两回事。系统层面的优化(检索增强、工具调用编排等)会拉高Arena得分,这不完全等于裸模型能力。看单模型排名更客观。
5. 自主编程16天的产出质量需社区检验。 265个commit、127个PR听起来很美,但代码质量、架构合理性、可维护性如何,需要等社区实际review之后才能下结论。数量不等于质量。
6. 开源承诺尚未兑现。 "下周发布"不等于"已经发布"。在权重真正上线Hugging Face之前,一切都还是承诺。技术圈见过太多"下周开源"变成"下个月"甚至"下次一定"。
写在最后
把Qwen3.8-Max放进更大的时间线里看:
- • 7月7日,GPT-5.6发布,中美AI竞赛进入新阶段
- • 7月17日、27日,Kimi K3两次更新,万亿参数开源成为趋势
- • 8月3日,DeepSeek-V4-Flash和Qwen3.8-Max同日发布,中国模型集体突破
Qwen3.8-Max的真正意义,不在于某个benchmark的分数,而在于它同时做了三件事:把万亿参数模型的权重开放出来、把模型能力的边界推到自主编程和自主研究、把价格压到了竞品的四分之一。
这三件事叠加在一起,传递的信号很清晰:AI竞争已经从"谁的模型更聪明"进入"谁的模型更自主、更开放、更普惠"。
16天自主编程写出一个开源Agent框架,这件事本身或许比任何benchmark都更能说明问题——当AI开始给自己写工具,人类的角色,是不是正在悄悄改变?
这个问题,留给每一个正在用AI的你。
参考资料
- 1. Qwen3.8-Max官方发布文档,阿里巴巴千问团队,2026年8月3日
- 2. Arena官方榜单,2026年8月3日放榜
- 3. GitHub仓库:qwen-code-dev-bot/oh-my-cli
- 4. 论文:《Unified Data Selection for LLM Reasoning》
- 5. 阿里巴巴港股/美股市场数据,2026年8月3日
- 6. 往期关联阅读:DeepSeek-V4-Flash深度解读(8/3)、Kimi K3系列解读(7/17、7/27)、GPT-5.6系列解读(7/7、7/30、8/3)、Dify API接入实战、vLLM自部署指南
互动话题
Qwen3.8-Max花了16天自主编程构建了一个开源Agent框架。你觉得AI自主写代码的时代,程序员会被取代还是会进化?你会放心让AI给你提PR吗?来评论区聊聊你的看法👇



