01
02
03
04
推理引擎:VLLM / HF Transformers 测试模型: Qwen3-Next-80B-A3B-Instruct Qwen3-Next-80B-A3B-Thinking Qwen3-32B 计算资源:4 x H20 96GB NVLINK
PROMPT:“请写一个关于人工智能发展历程的简短段落,包含主要里程碑”; MAX_TOKENS:4096 并发数:128 总请求数:1024
Qwen3-Next-Instruct
在相同并发级别下,其请求吞吐量(RPS)达到 16.06,是 Qwen3-32B 的 2.55 倍; 平均响应时间仅 7.85 秒(Qwen3-32B 为 19.55 秒),且最大响应时间控制在 10.88 秒,不仅是时效,更多看到的是稳定性; 总耗时仅为 Qwen3-32B 的 39%(63.77s vs 162.44s)。
Qwen3-Next-Thinking
尽管整体吞吐量(TPS)达到 4,256.22(超 Qwen3-32B 1.08 倍),但总耗时长达 451.70s(是 Qwen3-Next-Instruct 的 7.1 倍),且最大响应时间高达 1119.11 秒,表明其更适合对延迟不敏感但需高输出质量的场景; RPS 仅为 2.27,远低于 Instruct。
05
沿用 Qwen 先前工作中的输出门控机制,缓解注意力中的低秩问题; 将单个注意力头维度从 128 扩展至 256; 仅对注意力头前 25% 的位置维度添加旋转位置编码,提高长度外推效果。
06
07
