JOTO
Contact us
← AI 智库
开源模型

腾讯混元Hy4 preview开源,WorkBuddy实测:有了小型团队交付实力,但还得有人盯

2026 年 8 月 28 日

腾讯发布混元Hy4 preview(770B总参数、49B激活参数、1M上下文),聚焦Agent、Coding与生产力场景。WorkBuddy实测显示:其在四端网页开发、季度复盘等长链路任务中表现强劲,具备小型产品团队式交付能力;但在AI编程工具采购等需高精度事实核查与数字自检的任务中,仍存在关键性错误,需人工最后一道核验。

Hy4 preview核心能力与开源部署

今天,腾讯发布了混元Hy4 preview,总参数770B、激活参数49B,上下文长度突破1M,重点面向Agent、Coding与生产力场景优化,增强在真实业务场景中完成复杂任务的能力。

Hy4 preview模型参数与能力示意图
Hy4 preview模型参数与能力示意图

相比上一代,Hy4 preview在多步骤Agent、代码开发和生产力任务上进一步提升,尤其是在更好的任务拆解、上下文承接、指令遵循和长链路执行能力上。

在Coding场景中,进一步增强代码理解、生成、修改和复杂工程任务处理能力;在生产力场景中,重点提升文档处理、信息分析、办公自动化、游戏开发、网页生成及跨工具协作等能力;在游戏开发场景中,增强了一句需求直接生成可玩原型能力,并能熟练使用游戏引擎,开发者可以通过多轮交互持续完善复杂游戏项目;在科学研究场景下,提升复杂科研问题的理解、推理与求解能力。

Hy4 preview在自身研发的全链路过程中发挥了积极价值,首次参与训练方法、数据策略、评估体系和底层算子的自动优化。模型提出方案、运行实验并根据结果继续迭代,实验产生的代码、日志和反馈进入下一轮探索,形成初步的递归自我改进闭环。

Hy4 preview还通过自主分析推理系统瓶颈,并围绕算子融合、通信优化等方向开展多轮优化,端到端吞吐相较基线提升31.8%,在不同上下文长度和并发度下均取得稳定收益,初步展现了自主开展推理基础设施优化的能力。

Hy4 preview已经开源,并在WorkBuddy/CodeBuddy国内版及国际版、元宝、ima等腾讯产品同步首发,也可通过腾讯云Tokenhub和OpenRouter接入API使用。

定价方面,Hy4 preview继续走普惠高性价比路线,输入6元/百万tokens,输出18元/百万tokens,缓存命中0.3元/百万tokens。为进一步收集用户反馈以进一步提升模型性能,腾讯表示,WorkBuddy/CodeBuddy将面向用户开展为期2周的限时免费活动。

WorkBuddy实测一:AI编程工具采购报告——搜索能力强但差临门一脚

我们在WorkBuddy中测试了Hy4 preview,最直接的感受是Agent已经开始具备“把一件事情做完”的能力,但人还是需要作为最后一道防线,Agent还需要解决“最后一公里”问题。

我们首先给的任务是:公司准备为30人开发团队统一采购AI编程工具。请调研以下四类方案的当前团队/企业选择:Cursor;GitHub Copilot;Claude Code / Claude for Work;OpenAI Codex / ChatGPT Business 或 Enterprise 中的Codex。(给的提示词会更详细一些)

先直接说结论:最后的报告很漂亮,结果非常接近通过,但因几处关键事实和成本计算错误被卡在及格线下。

这份报告有不少做得不错的地方,比如能调用十来个网页,把复杂政策调查得非常深入,时效性信息也抓得很好,像GitHub 2026年4月22日暂停Copilot Business新自助注册,这是真实且很容易漏掉的动态政策,报告抓到了。

但仍然有遗漏,而这也带来了严重后果:由于Cursor年付价格漏查,造成整个成本横向比较口径不一致。

报告按照40美元/席/月算出Cursor Teams Standard 30人一年14,400美元,Premium算成43,200美元;但Cursor 2026年6月官方已经明确,Teams年付分别是Standard 32美元/席/月、Premium 96美元/席/月。

因此,如果报告对Claude、ChatGPT都采用年付最低价格,Cursor也应该同口径使用年付价格。正确应为:

  • Cursor Teams Standard:30 × 32 × 12 = 11,520美元/年,不是14,400美元;
  • Cursor Teams Premium:30 × 96 × 12 = 34,560美元/年,不是43,200美元;
  • 20 Standard + 10 Premium:20×32×12 + 10×96×12 = 19,200美元/年,不是24,000美元。
Hy4 preview采购报告错误对比图
Hy4 preview采购报告错误对比图

这个错误直接导致了错误的结论:“即使Copilot Business额度超支100%,年成本13,680美元仍低于Cursor Teams Standard的起步价14,400美元。”

还有OpenAI Business的SSO不是“未确认”,而是已经有明确官方文档这样的错误。

此外,在系列调研后,最终却在一个简单乘法或者复制数字上翻车。比如15席Claude Team时总成本写为10,800美元,实际上是6,840 + 15×20×12 =10,440美元。

可以看出,目前Hy4 preview在WorkBuddy后,其信息密度、官方资料覆盖、动态政策捕捉都明显高于普通搜索型回答,调研能力很强,但没有完成最后一道交叉校验和数字自检,导致少量错误进入了核心采购结论。

因此,当前人力核验是必不可少的环节。它已经像一个相当能干的采购研究员,但还不是可以不复核就签字的采购负责人。对于后续研发来说,在长链路工具调用结束后,Agent需要加强对自己的事实和计算进行二次审计。

WorkBuddy实测二:四端网页制作——小型产品团队式交付能力

第二个任务,是做一个四端产品实现。

还是直接说结论:明确通过,而且属于目前相当强的一档表现。

这次给的任务提示词是:

公司准备开发一套内部“项目作战中心”,用于同时管理多个产品项目。系统至少包含:项目名称、项目负责人、当前阶段、完成进度、截止日期、风险等级、待办任务。请基于同目录中的projects.json,分别实现Web端、移动端、桌面端和一个3D项目作战室。要求四个版本使用一致的数据结构,但针对不同终端设计适合的交互方式,不能只是简单缩放同一个页面。必须支持查看项目列表、查看项目详情、按负责人和风险等级筛选、创建任务、修改任务状态、查看整体项目进度、对已逾期或高风险项目给出清晰的视觉提示。3D版本要求:不同项目表现为可进入或可点击的独立区域,可以移动或旋转视角,点击项目区域能够看到项目状态,至少提供一种对任务或项目状态的交互操作,场景应有基本灯光、空间层次与可辨识的项目区域,而不是仅把平面卡片贴到3D画布。最终请交付可以实际运行的版本,说明每一端的运行方式,并在交付前自行检查主要功能是否正常。
  • 3D项目作战室展示:

“它真的把3D交互和真实业务状态接起来了。”8个项目在环形空间中仍然能够区分,左右HUD没有把中心操作区域完全挤没。测试期间隐藏检查点几乎全部被主动识别并处理了。比如特意埋进去的“P003已经逾期且进度只有42%”“P006已经完成91%但仍然是高风险”等,它不但处理了,还专门为这些场景写了测试。

  • Web端展示:
Hy4 preview Web端项目作战中心界面
Hy4 preview Web端项目作战中心界面

能够正常渲染8个项目、4个KPI,1920×1080下没有横向溢出;点击“张晨”负责人筛选后,项目从8个正确变成P001/P007两个。直接新增任务后,Store中任务总数从17→18,页面也同步出现新任务。这证明它不是做的假按钮,而是业务状态真实发生了变化。

产品完成度也比较高。它已经接近一个可以实际使用的内部Dashboard。P003的“逾期9天”、P006的“高风险但已经完成91%”都进行了显著提示,说明模型不仅执行了页面需求,还理解了业务信息层级。

  • 移动端展示:

“移动端不能只是把Web缩窄。”这个做得很好。设计了项目/任务/概览/我的四个Bottom Tab,加全屏详情、Bottom Sheet、移动端筛选和任务状态面板。没有出现页面级横向溢出,各项点击正常。而在代码层面,其甚至处理了safe-area-inset-*、44px触控目标、iOS输入框以及左边缘滑动返回等细节。明显的问题是任务的四个状态变成了空白。

  • 桌面端展示:
Hy4 preview桌面端项目作战中心界面
Hy4 preview桌面端项目作战中心界面

总的来说,它已经不只是会写代码,而是具备了小型产品团队式的交付能力。四端并非简单套壳:移动端重新设计了触控信息架构,桌面端使用了原生菜单、磁盘和系统通知,3D场景甚至将任务状态与空间物体实时联动。更重要的是,Agent主动建立了共享数据层和大量自动测试,连高风险91%、超长任务名等隐藏边界都考虑到了。

不过在最终交付时出现了一些问题:一键测试脚本存在目录错误,两份浏览器测试又写死了生成机器的绝对路径。另外,Agent很会写测试,但最后没有检查“这些测试离开自己的机器还能不能跑”。比如,README宣称可以一键执行147项测试,但实际执行的第一步就失败了,问题在没有最终检查交付包本身。

可以看出,它能够完成一个相当复杂的软件项目,中长程生产能力已经非常强,但最后一公里的交付审计却是薄弱环节,仍然需要人在最后审核,确认交到别人手里的东西真的能从零运行。

这个测试无疑是耗时最长的,期间出现了三次无法进行下去的情况,但没有做任何设置、检查等情况下,仅简单对话后,它可以自己继续运行下去。比较意外的是,它在运行期间,会有“定期回看消耗高的任务,看看哪里可以优化”的思考,如果真的能帮我们省下token消耗的话,就很值得称赞了。不过,由于后台没有找到相关统计,我们没办法更进一步查看细节。

Hy4 preview运行中自我优化思考截图
Hy4 preview运行中自我优化思考截图

一个有意思的“小思考”:

Hy4 preview自我反思过程截图
Hy4 preview自我反思过程截图

WorkBuddy实测三:季度运营复盘——长链路分析表现亮眼

第三个任务,我们给了10个附件,包含公司最近12个月业务数据、产品指标、客户反馈、销售笔记、管理层会议纪要以及上一季度经营复盘模板,让其完成2026 Q3季度经营复盘。

依然直接说结论:表现亮眼,不但完成了长链路分析,而且最终的数字校验、异常发现和多源冲突处理基本没有掉链子。

感兴趣的读者可以点击查看最后输出的复盘文档:

https://docs.qq.com/doc/DYm5zUEpRWHBZTERU

具体来说,我们给的是一份故意做脏的数据包,比如有错误汇总表、缺失月份、重复订单和前后观点改变的会议纪要等,但其没有被带偏。比如发现两个来源不一致后,它会继续往下追,直到确认哪个才是可信口径。

从“执行闭环”看,其完整走完了文件盘点 → 数据校验 → 去重 → 发现缺失 → 发现公式异常 → 重算 → 同比/环比 → 产品指标 → 客户信号 → 回查销售纪要 → 回查管理层纪要 → 处理冲突 → 经营归因 → 风险 → Q4优先事项 → 数据质量附录 → 管理层摘要。

这次运行过程中确实是0次人工干预,但出问题的地方依然是“最后一公里”,第一版Word文档出现了下面问题,修改对话了两次才改好,最后我们也同步到了腾讯文档一份。

Hy4 preview复盘文档格式问题截图
Hy4 preview复盘文档格式问题截图

它可以像一个分析师一样追溯数据,也能像项目负责人一样跑完整个复盘流程。但是,偶尔其推导因果结论会比较勉强。

如果结合第一个AI编程工具采购的测试来看,任务越长,并不一定越容易失败。模型的能力短板不一定随着任务变长而线性放大,在有明确数据和封闭任务空间的长任务中,它反而可能比开放互联网调研更稳定。

被算力拖慢的腾讯发力

“混元大模型经历了不同阶段,多次重构,混元Hy3架构化繁为简,更注重训练数据的质量,在同等参数的大模型中效果突出。但由于公司整体的算力严重不足,拖慢了模型训练与产品发展,产生了比较大的影响。”腾讯集团高级执行副总裁、云与智慧产业事业群(CSIG)CEO汤道生在腾讯内刊发表的署名文章上说道。

汤道生近日回应“腾讯做AI慢了”的质疑时坦言,混元经历了多个阶段和多次重构,但“公司整体算力严重不足”,拖慢了模型训练和产品发展,对腾讯AI进度产生了较大影响。

这种算力焦虑其实早有迹象。今年6月,汤道生就表示腾讯算力“一直处于不太够的状态”,Token调用出现爆发式增长,有限资源甚至需要优先满足内部需求。

“我们非常期待下半年有更多国产算力可以支持到我们的云业务,可以把一些推理场景服务得更好。”在6月底的采访中,汤道生直言自己做芯片设计并不解决产能问题,因此腾讯选择开放生态的,“跟更多芯片厂商合作,也让国产算力芯片厂商愿意拥抱腾讯,作为它们算力应用的一个展现标杆。”

但这不会立刻解决算力短缺问题。7月,Hy3正式版发布,而在Hy3接入WorkBuddy后迅速遭遇算力挤兑,7月9日下午排队率一度超过50%,腾讯不得不紧急扩容。

从8月初的财报看,2026年二季度腾讯资本开支达到527.8亿元,同比大增176%,环比也比一季度的约319亿元增加约65%,主要投向AI基础设施和算力采购。仅上半年资本开支就达到约847亿元,已经超过2025年全年792亿元的水平。二季度大规模AI基础设施投入和相关预付款甚至让腾讯自由现金流转为-138亿元。公司表示,若剔除AI算力采购预付款项,自由现金流为376亿元。

另一方面,腾讯也在明显整合、加速。

自2月重建基础设施以来,混元大模型平均每两个月迭代一次大版本。在4月,重构后的首个模型Hy3 Preview推出;7月6日,Hy3正式发布,总参数2950亿、激活参数210亿,支持256K上下文,并把重点放到代码、复杂任务和Agent能力,而不是继续单纯放大参数。腾讯称,从Preview上线到正式版发布,其日均Token消耗增长20倍,WorkBuddy中主动选择Hy3 Preview的用户数增长6倍。

通过preview先行、正式版跟进的方式,把真实世界的反馈持续引入研发之中。按照这一节奏,Hy4的下一版模型也将在近期陆续上线。

与此同时,腾讯也在收拢过去相对分散的模型体系。46款混元旧模型已在6月集中下线,Hy3 Preview将在8月底下线,并迁移至Hy3。原混元大模型平台的新模型销售入口也逐步迁向TokenHub。后者不仅提供腾讯自研模型,还接入DeepSeek、Kimi、MiniMax、GLM等第三方模型。

另外,腾讯开始把模型和产品绑得更紧。Hy3已经进入WorkBuddy/CodeBuddy、元宝、ima、Marvis等产品,8月又进一步向全球开放。在腾讯内部办公场景中,接入Hy3后WorkBuddy任务成功率超过90%,平均完成时间较上一代模型缩短34%。

这也体现了腾讯现在对AI竞争的态度。汤道生认为,AI应用不止模型,还有算法和工程。“场景,是腾讯做AI最厚的底牌。场景中的数据,不管是用户生成的,还是专业机构提供的,都为大模型提供了上下文;场景中的历史互动,也能被提炼成个人记忆,或打造成可复用的技能。”

Hy4仍在继续追赶基础模型,但腾讯显然不准备只靠模型翻身。

JOTO 企业落地观察

  • Hy4 preview在四端交付、季度复盘等封闭数据域长链路任务中稳定性高,表明企业若构建自有知识库与结构化业务数据资产,可显著降低智能体幻觉风险,提升端到端任务成功率。
  • 采购报告中暴露的事实核查与数字自检缺陷,揭示当前Agent工程必须嵌入“交付审计层”:包括外部数据源交叉验证、计算过程回溯、交付物可移植性检查等刚性环节,不能仅依赖模型单次输出。
  • Hy4参与自身训练优化与推理基建调优,印证“模型即基础设施”的演进趋势;对企业而言,这意味着智能体系统需预留可观测、可干预、可回滚的工程接口,而非黑盒调用。
  • 腾讯将Hy3/Hy4深度绑定WorkBuddy等产品,并推动TokenHub聚合第三方模型,反映企业AI平台正从“模型中心”转向“场景-工具-模型”协同架构;企业部署需同步规划工具链集成、权限治理与技能沉淀机制。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.