展开目录
#腾讯#混元#Hy4#开源#大模型#MoE#AI Agent#大厂动态

腾讯混元 Hy4 开源深度解析:7700 亿参数、100 万上下文,国产开源新旗舰

8月28日,腾讯混元发布并开源 Hy4 preview:7700 亿总参数 MoE、单 token 激活 490 亿、上下文超 100 万 token,Apache 2.0 权重开放,API 输出价仅 2.5 美元/百万 token。本文拆解它的架构、自进化能力、产品矩阵,以及它对国产开源大模型格局意味着什么。

预计阅读 8 分钟

一句话总结

2026 年 8 月 28 日,腾讯混元发布并开源 Hy4 preview:总参数 7700 亿、单 token 激活 490 亿的 MoE 架构,上下文窗口超 100 万 token,以 Apache 2.0 协议开放权重。它同时上线腾讯云 TokenHub 与 OpenRouter,API 输出价仅 2.5 美元/百万 token——不到 Claude Sonnet 5 的四分之一。这是国产开源大模型在「Agent 能力 + 超长上下文 + 价格」三个维度同时向第一梯队发起冲击的旗舰之作。


数据来源

本文事实依据来自:腾讯官方公告(tencent.com,2026-08-28)、Technode(2026-08-28)、IBTimes(2026-08-28)、Startup Fortune、TechBullion、AIReiter 定价分析、Kimi/DeepSeek 官方定价页等公开信息。


核心参数:7700 亿总参数背后的「稀疏艺术」

Hy4 preview 最抓眼球的是 7700 亿总参数——但懂行的都清楚,总参数在 MoE 架构里主要是「门面」,真正决定推理成本的是激活参数

指标数值
总参数7700 亿(770B)
激活参数490 亿/单 token(49B active)
架构MoE,78 层 ×(256 个 routed experts + 1 个 shared expert)
上下文窗口超 100 万 token(1M+)
开源协议Apache 2.0(开放权重)
对比前代Hy3(2950 亿总参数)

Hy4 MoE 架构示意

把 770B 直接和稠密 770B 模型对比是误导——Hy4 的稀疏架构意味着每个 token 只计算 490 亿参数,剩余容量处于休眠状态、按需路由。这也是它能在「超大容量」和「可控推理成本」之间取得平衡的关键:总参数负责上限,激活参数负责成本

它凭什么敢对标 Codex:从「聊天模型」到「管理 Agent 的 Agent」

Hy4 最特别的地方不在参数,而在腾讯给它定的角色——不是更强的聊天模型,而是能当「主管」的 Agent 模型

腾讯在公告中给出一个相当挑衅的演示:Hy4 preview 可以同时协调多个 Codex 会话——并行启动多个 Codex 工作流,对比它们的结果,再根据观察到的进展调整研究方向。也就是说,OpenAI 的编程 Agent 在演示里当「工人」,Hy4 当「监工」。

Hy4 的 Agent 监督者定位

在腾讯内部组织的盲测中(163 位专家、203 个工程任务),Hy4 preview 得分 2.99/4.00,略高于 Kimi K3(2.94/4.00)和 GLM-5.3(2.92/4.00)。外部基准方面:

  • SWE Atlas:仅次于 Claude Opus 5,超过 GPT-5.6 Sol、Kimi K3、GLM-5.3、Qwen、DeepSeek
  • Agent Last Exam:22.8 分,超越 DeepSeek
  • Program Bench:17.5,与 Qwen 持平
  • Humanity’s Last Exam(纯文本):43.4,超过 GLM-5.3

能力矩阵:编码、办公、游戏、科研四线并进

Hy4 面向 Coding(编码)、Agent(智能体)与办公场景 深度优化,且明确表示与 CodeBuddy、WorkBuddy 等产品做「深度共设计」——模型与产品互相打磨,而不是先发布模型再适配产品:

  • 编程与工程:长上下文吃下整个代码库,多轮迭代调试;可同时编排多个编码 Agent 工作流
  • 办公生产力:显著增强对复杂工作环境的理解与金融分析能力,支持从信息处理到文档、表格、演示文稿产出的全流程跨文档协作
  • 游戏开发:一条自然语言请求即可生成可玩的游戏原型,并能与游戏引擎配合,通过多轮对话持续完善复杂游戏项目
  • 科学研究:在 AI 研发、分子动力学模拟、凝聚态物理、基础数学等领域表现出更强的理解与推理能力

Hy4 的能力矩阵与生态渠道

最硬核的部分:模型开始「自己优化自己」

Hy4 首次参与了自身开发过程的自动化优化——包括训练方法、数据策略、评测框架、底层算子。公告披露:模型提出方案、运行实验、根据结果迭代,产出的代码、日志与数据都已公开。

更直观的数字是推理侧的自我优化:Hy4 自主分析了自身推理系统的瓶颈,并对算子融合、通信优化等做了多轮改进,使端到端吞吐量较基线提升 31.8%,且在不同上下文长度与并发度下保持一致。

这标志着「AI for AI」从概念走向工程实践:大模型不再只是被优化的对象,也开始成为优化自身基础设施的主体。配合 8 月底 OpenRouter 等平台的价格数据,开源模型对推理成本的控制能力正在形成正循环。

价格与生态:开源旗舰的「白菜价」冲击

Hy4 preview 的 API 定价(每百万 token):

项目价格
输入$0.834
输出$2.501
缓存命中$0.042

开源旗舰 API 价格对比

对比一下:Claude Sonnet 5 输出 $10、Kimi K3 输出 $15、GPT-5.6 Sol 输出 $20——Hy4 的输出价只有它们的 1/4 到 1/8。虽然「每 token 价格」不完全等于「每任务成本」(Agent 任务还要看 token 效率),但这个价位已经把开源旗舰的性价比标杆拉到了新高度。

接入渠道同样「全都要」:

  • 产品端:WorkBuddy(腾讯编程 Agent)、CodeBuddy、元宝(Yuanbao)、ima 等全线接入;WorkBuddy/CodeBuddy 上线即免费用两周,Hy3 免费期延长至 9 月 30 日
  • API 端:腾讯云 TokenHub + OpenRouter,国内国外开发者都能直接调用
  • 权重端:Hugging Face 开放下载(Apache 2.0),可自托管、可微调、可商用

坦诚的一面:预览版的已知问题

腾讯没有回避 Hy4 的短板,官方明确承认预览版存在 推理过长、过度验证(over-verification) 等问题——在需要快速响应的交互场景里,模型可能「想太多」。这些问题预计会在后续版本通过推理策略优化解决。把它当作「预览版」而非「正式版」来评估,是更务实的态度。

行业影响:国产开源进入「双巨头 + 挑战者」格局

Hy4 开源的行业意义,可以从三个层面看:

  1. 开源旗舰的「参数军备竞赛」进入万亿时代:阿里 Qwen3.8(2.4 万亿总参)、Kimi K3(2.8 万亿)、腾讯 Hy4(7700 亿)——中国开源模型的体量已经与美国闭源旗舰站在同一层级,只是用「开源 + 低价」的差异化打法。
  2. 大厂「模型-产品共设计」路线成型:Hy4 不是实验室产物,而是和 CodeBuddy/WorkBuddy 一起长出来的。模型能力直接注入产品,产品反馈又反哺模型优化——这套闭环是纯开源社区项目难以复制的。
  3. 价格锚点被重新定义:输出 $2.5/百万 token 的旗舰级开源模型,让所有闭源厂商的定价都面临压力。对企业来说,「自托管开源旗舰」vs「调用闭源 API」的权衡正在快速偏向前者。

适合谁用

  • 开发者/技术团队:想低成本试用「能编排多个编码 Agent」的旗舰模型,WorkBuddy/CodeBuddy 免费期是零成本入口
  • 自托管玩家:需要 100 万 token 超长上下文、又不想被 API 账单绑架,Apache 2.0 权重 + 开源推理栈是最佳组合
  • 办公与金融场景:跨文档协作、金融分析、文档/表格/PPT 全流程生成是 Hy4 的强化方向
  • 游戏开发者:一条提示词出可玩原型的能力,适合早期玩法验证

一句话收尾:当 7700 亿参数的模型以 2.5 美元/百万 token 的价格开源时,「前沿能力 = 天价账单」的等式正在被改写——国产开源大模型的下半场,比的是谁能把「强」和「便宜」同时做到极致。

Related

相关文章

延伸阅读

查看全部 →