JOTO
Contact us
← AI 智库
开源模型

Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了

2026 年 8 月 28 日

Qwen 团队于 8 月 26 日发布 Qwen3.8-Flash-Next 模型,原生支持 26 万 Token 上下文,可扩展至 100 万;Qwen Cloud 生产版本 Qwen3.8-Flash 默认启用 100 万上下文。模型在 Coding(SWE-bench Pro 62.5)、Agent 工具调用(Toolathlon 73.5)等能力上显著增强,并采用 125B 主模型、每 Token 激活约 6B 参数的高效架构,训练成本约为 Qwen3.7-Plus 的 1/9,API 定价为输入 0.16 美元 / 百万 Token、输出 0.47 美元 / 百万 Token。

8 月 26 日,Qwen 团队发布了 Qwen3.8-Flash-Next

这次更新有几个信息很抓眼球:

125B 主模型参数,每个 Token 只激活约 6B;原生支持 26 万 Token 上下文,可扩展到 100 万;Coding、Agent、工具调用能力继续增强。

同时,Qwen Cloud 上的生产版本命名为 Qwen3.8-Flash,默认就是 100 万 Token 上下文

如果只是日常聊天,这些数字可能没那么有感觉。

但如果你是开发、测试、运维或者其他 IT 从业者,这次更新其实很值得看。

因为从 Qwen3.8-Flash 身上能看到一个越来越明显的趋势:

大模型正在从“回答问题”,继续往“完成工作”走。

而软件研发,恰好是这一轮变化最明显的场景之一。

Qwen3.8-Flash模型体验地址👇

  • 技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
  • 技术博客:https://qwen.ai/blog?id=qwen3.8-flash-next
  • Hugging Face:https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
  • ModelScope:https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV&file=Qwen3.8-Flash-Next
  • 千问AI平台:https://www.qianwenai.com/models/qwen3.8-flash

01 先说最直观的:上下文来到 100 万 Token

Qwen3.8-Flash-Next 原生上下文长度达到 262,144 Token,并且可以扩展到 1,000,000 Token;Qwen Cloud 提供的 Qwen3.8-Flash 则默认支持 1M 上下文。

100 万上下文到底意味着什么?

以前使用 AI Coding,很多人的操作是:

复制一段代码 → 丢给模型 → 问它哪里有问题。

或者测试同学:

复制一段需求 → 让模型生成测试用例。

这当然能用,但跟真实的软件工程还有很大距离。

因为真正做一个项目,模型要理解的东西远不止一段代码。

比如一个支付需求改动,测试人员可能同时要看:

  • PRD 和需求变更
  • 接口文档
  • 前后端代码
  • 数据库表结构
  • 上下游服务
  • 历史测试用例
  • 历史 Bug
  • 日志
  • Git Commit / Diff
  • 监控信息

过去最大的一个问题就是:

这些东西根本塞不进去。

上下文越来越长之后,AI 才有机会从“看懂一个文件”,逐渐走向“理解一个项目”。

当然,100 万 Token 不代表把整个公司代码库一股脑塞进去就完事了。

真正落地依然涉及代码检索、知识库、上下文管理、权限控制等工程问题。

但模型能够处理的上下文上限提高,确实给复杂研发任务提供了更大的空间。

Qwen3.8-Flash 架构示意图
Qwen3.8-Flash 架构示意图

02 Coding 能力,已经不是“帮你补几行代码”了

这次 Qwen 官方给出的测试成绩里,Coding 是一个明显重点。

例如:

SWE-bench Pro:62.5

SWE-bench Multilingual:81.0

DeepSWE 1.1:58.7

这些 Benchmark 和以前单纯考“写一道算法题”不太一样,更偏向真实软件工程:理解代码仓库、定位问题、修改代码、解决 Issue。(Qwen)

这也是最近 AI Coding 最明显的一次变化。

前两年大家谈 AI 编程,更多想到的是:

“帮我生成一个 Java 方法。”

现在已经越来越像:

“你自己去代码仓库里找问题,然后把它解决掉。”

这两件事不是一个量级。

现在 Codex、Claude Code、Qwen Code 这类 Coding Agent 的工作模式,越来越接近:

读取代码 → 搜索项目 → 分析依赖 → 修改文件 → 执行命令 → 跑测试 → 根据结果继续调整。

甚至这次 Qwen 官方已经专门给出了接入 Claude Code 和 Codex 的方式,Qwen API 同时兼容 Anthropic 协议和 OpenAI Responses 协议。

所以,如果现在对 AI Coding 的理解还停留在:

“代码补全工具”

其实已经有些滞后了。

03 Agent 能力,也在明显加强

Qwen3.8-Flash-Next 在 Toolathlon 和 CoWorkBench 的评测分数
Qwen3.8-Flash-Next 在 Toolathlon 和 CoWorkBench 的评测分数

另外一个值得关注的关键词就是:Agent。

这次 Qwen3.8-Flash-Next 在官方公布的 Toolathlon Verified 工具调用评测中拿到了 73.5,长流程办公任务 CoWorkBench 为 73.9

分数本身不是最重要的。

重要的是现在厂商越来越重视一件事:

模型能不能自己调用工具完成任务?

因为聊天模型和 Agent 最大的区别之一就在这里。

你问 ChatGPT:

“帮我分析一下为什么这个接口测试失败了。”

它给你一段分析,这是 AI 助手。

但如果它可以自己:

读取接口文档 → 调测试平台 → 执行接口 → 获取 Response → 查询日志 → 查看数据库 → 分析原因 → 修改测试脚本 → 再执行一次

这时候性质就完全不一样了。

它已经开始进入真正的软件研发流程。

04 这件事对测试行业影响其实更直接

为什么我们一直强调测试从业者要关注 Agent?

因为测试工作天然就适合被拆成大量“工具调用”。

举个很现实的例子。

现在很多测试团队已经开始使用 AI 生成测试用例:

需求文档
   ↓
大模型
   ↓
测试用例

这属于第一阶段。

但再往后发展,很可能变成:

读取需求
   ↓
分析代码 Diff
   ↓
查询历史 Bug
   ↓
识别影响范围
   ↓
生成测试用例
   ↓
调用自动化测试平台
   ↓
执行测试
   ↓
读取失败日志
   ↓
分析异常
   ↓
输出测试报告

这里面只有其中几步是在“生成内容”。

剩下的大部分工作,本质上都是:

模型 + 工具 + 工作流。

所以未来 AI 测试真正的核心,很可能不是单独研究:

Prompt 怎么写得更好?

而是研究:

怎么让模型拥有完成测试任务所需要的上下文和工具。

这就涉及到:

企业知识库、RAG、MCP、Tool Calling、Agent、自动化测试平台、CI/CD。

这些东西开始逐渐连起来了。

05 100 万上下文,对测试其实特别有用

测试工作的一个特点是:

信息非常散。

需求在需求平台。

代码在 Git。

测试用例在测试管理平台。

Bug 在 Jira。

接口文档在 Swagger。

日志在 ELK。

监控又在另外一套系统。

一个经验丰富的测试工程师之所以能判断风险,很多时候并不是因为他会执行多少测试用例。

而是因为他能把这些信息串起来。

例如:

这个接口虽然只改了一个字段,但它会不会影响订单状态?

这个模块以前是不是出过类似 Bug?

这次代码修改到底影响到了哪些下游服务?

哪些历史测试用例需要重新执行?

这类问题,其实非常吃上下文。

长上下文 + 代码能力 + 企业知识库组合起来之后,AI 才更有可能真正参与:

需求理解

变更影响分析

测试范围判断

历史缺陷关联

测试用例生成

而不是每次只看一小段材料,然后给一个看起来正确、实际上不了解业务背景的答案。

06 还有一个容易被忽略的变化:成本

AI 真正进入企业之后,不能只看模型强不强。

还有一个非常现实的问题:

贵不贵。

如果一个测试 Agent 每天要反复读取代码、需求、日志,再调用十几次甚至几十次模型,那么调用量和普通聊天完全不是一个级别。

Qwen 官方披露,Qwen3.8-Flash-Next 相比 Qwen3.7-Plus,训练成本约为后者的 1/9,同时也在降低推理成本。其架构采用 125B 主模型,但每 Token 只激活约 6B 参数。

官方在发布时给 Qwen3.8-Flash 公布的 Qwen Cloud 定价为:

输入:0.16 美元 / 百万 Token

输出:0.47 美元 / 百万 Token。

截至 8 月 26 日官方发布文章时,API 标注为即将开放。

这其实是 Flash 模型很重要的一层意义。

企业需要的未必永远是“能力最强的那个模型”。

很多业务真正需要的是:

能力足够强,同时速度、成本、吞吐量也能接受。

尤其是自动化测试、客服、代码 Review、日志分析这类高频任务。

一天跑几次和一天跑几十万次,完全是两套经济账。

07 这还是一次 Qwen4 架构的“提前剧透”

这次发布还有一个值得关注的点。

Qwen 官方明确表示:

Qwen3.8-Flash-Next 同时也是 Qwen4 新架构的一次提前预览。

这次主要调整了四个方向:

Attention、Residual、Embedding、Optimization。

Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了 配图 3

JOTO 企业落地观察

  • 100 万上下文能力对企业 RAG 知识工程提出新要求:传统单文档切片策略已不适用,需转向跨源、跨模态、带语义关联的动态上下文组装机制。
  • 其每 Token 激活约 6B 参数的稀疏激活设计,降低了长上下文推理的显存与延迟压力,使企业在私有化部署智能体时,可在有限 GPU 资源下支撑更高并发的自动化测试或代码审查任务。
  • Qwen API 兼容 Anthropic 与 OpenAI 协议,大幅降低企业将现有 Agent 工作流迁移至 Qwen 生态的技术摩擦,尤其利于已在多模型间做协议抽象的 FDE 驻场共创项目快速集成。
  • 模型在 SWE-bench Pro(62.5)与 Toolathlon(73.5)上的表现,表明其已具备支撑真实研发闭环的基础能力,但企业部署时仍需重点评估工具调用链路的稳定性、错误恢复机制及权限隔离粒度,而非仅关注单点 benchmark 分数。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.