一句话总结
2026 年 8 月 28 日,腾讯混元发布并开源 Hy4 preview:总参数 7700 亿、单 token 激活 490 亿的 MoE 架构,上下文窗口超 100 万 token,以 Apache 2.0 协议开放权重。它同时上线腾讯云 TokenHub 与 OpenRouter,API 输出价仅 2.5 美元/百万 token——不到 Claude Sonnet 5 的四分之一。这是国产开源大模型在「Agent 能力 + 超长上下文 + 价格」三个维度同时向第一梯队发起冲击的旗舰之作。
数据来源
本文事实依据来自:腾讯官方公告(tencent.com,2026-08-28)、Technode(2026-08-28)、IBTimes(2026-08-28)、Startup Fortune、TechBullion、AIReiter 定价分析、Kimi/DeepSeek 官方定价页等公开信息。
核心参数:7700 亿总参数背后的「稀疏艺术」
Hy4 preview 最抓眼球的是 7700 亿总参数——但懂行的都清楚,总参数在 MoE 架构里主要是「门面」,真正决定推理成本的是激活参数。
| 指标 | 数值 |
|---|---|
| 总参数 | 7700 亿(770B) |
| 激活参数 | 490 亿/单 token(49B active) |
| 架构 | MoE,78 层 ×(256 个 routed experts + 1 个 shared expert) |
| 上下文窗口 | 超 100 万 token(1M+) |
| 开源协议 | Apache 2.0(开放权重) |
| 对比前代 | Hy3(2950 亿总参数) |

把 770B 直接和稠密 770B 模型对比是误导——Hy4 的稀疏架构意味着每个 token 只计算 490 亿参数,剩余容量处于休眠状态、按需路由。这也是它能在「超大容量」和「可控推理成本」之间取得平衡的关键:总参数负责上限,激活参数负责成本。
它凭什么敢对标 Codex:从「聊天模型」到「管理 Agent 的 Agent」
Hy4 最特别的地方不在参数,而在腾讯给它定的角色——不是更强的聊天模型,而是能当「主管」的 Agent 模型。
腾讯在公告中给出一个相当挑衅的演示:Hy4 preview 可以同时协调多个 Codex 会话——并行启动多个 Codex 工作流,对比它们的结果,再根据观察到的进展调整研究方向。也就是说,OpenAI 的编程 Agent 在演示里当「工人」,Hy4 当「监工」。

在腾讯内部组织的盲测中(163 位专家、203 个工程任务),Hy4 preview 得分 2.99/4.00,略高于 Kimi K3(2.94/4.00)和 GLM-5.3(2.92/4.00)。外部基准方面:
- SWE Atlas:仅次于 Claude Opus 5,超过 GPT-5.6 Sol、Kimi K3、GLM-5.3、Qwen、DeepSeek
- Agent Last Exam:22.8 分,超越 DeepSeek
- Program Bench:17.5,与 Qwen 持平
- Humanity’s Last Exam(纯文本):43.4,超过 GLM-5.3
能力矩阵:编码、办公、游戏、科研四线并进
Hy4 面向 Coding(编码)、Agent(智能体)与办公场景 深度优化,且明确表示与 CodeBuddy、WorkBuddy 等产品做「深度共设计」——模型与产品互相打磨,而不是先发布模型再适配产品:
- 编程与工程:长上下文吃下整个代码库,多轮迭代调试;可同时编排多个编码 Agent 工作流
- 办公生产力:显著增强对复杂工作环境的理解与金融分析能力,支持从信息处理到文档、表格、演示文稿产出的全流程跨文档协作
- 游戏开发:一条自然语言请求即可生成可玩的游戏原型,并能与游戏引擎配合,通过多轮对话持续完善复杂游戏项目
- 科学研究:在 AI 研发、分子动力学模拟、凝聚态物理、基础数学等领域表现出更强的理解与推理能力

最硬核的部分:模型开始「自己优化自己」
Hy4 首次参与了自身开发过程的自动化优化——包括训练方法、数据策略、评测框架、底层算子。公告披露:模型提出方案、运行实验、根据结果迭代,产出的代码、日志与数据都已公开。
更直观的数字是推理侧的自我优化:Hy4 自主分析了自身推理系统的瓶颈,并对算子融合、通信优化等做了多轮改进,使端到端吞吐量较基线提升 31.8%,且在不同上下文长度与并发度下保持一致。
这标志着「AI for AI」从概念走向工程实践:大模型不再只是被优化的对象,也开始成为优化自身基础设施的主体。配合 8 月底 OpenRouter 等平台的价格数据,开源模型对推理成本的控制能力正在形成正循环。
价格与生态:开源旗舰的「白菜价」冲击
Hy4 preview 的 API 定价(每百万 token):
| 项目 | 价格 |
|---|---|
| 输入 | $0.834 |
| 输出 | $2.501 |
| 缓存命中 | $0.042 |

对比一下:Claude Sonnet 5 输出 $10、Kimi K3 输出 $15、GPT-5.6 Sol 输出 $20——Hy4 的输出价只有它们的 1/4 到 1/8。虽然「每 token 价格」不完全等于「每任务成本」(Agent 任务还要看 token 效率),但这个价位已经把开源旗舰的性价比标杆拉到了新高度。
接入渠道同样「全都要」:
- 产品端:WorkBuddy(腾讯编程 Agent)、CodeBuddy、元宝(Yuanbao)、ima 等全线接入;WorkBuddy/CodeBuddy 上线即免费用两周,Hy3 免费期延长至 9 月 30 日
- API 端:腾讯云 TokenHub + OpenRouter,国内国外开发者都能直接调用
- 权重端:Hugging Face 开放下载(Apache 2.0),可自托管、可微调、可商用
坦诚的一面:预览版的已知问题
腾讯没有回避 Hy4 的短板,官方明确承认预览版存在 推理过长、过度验证(over-verification) 等问题——在需要快速响应的交互场景里,模型可能「想太多」。这些问题预计会在后续版本通过推理策略优化解决。把它当作「预览版」而非「正式版」来评估,是更务实的态度。
行业影响:国产开源进入「双巨头 + 挑战者」格局
Hy4 开源的行业意义,可以从三个层面看:
- 开源旗舰的「参数军备竞赛」进入万亿时代:阿里 Qwen3.8(2.4 万亿总参)、Kimi K3(2.8 万亿)、腾讯 Hy4(7700 亿)——中国开源模型的体量已经与美国闭源旗舰站在同一层级,只是用「开源 + 低价」的差异化打法。
- 大厂「模型-产品共设计」路线成型:Hy4 不是实验室产物,而是和 CodeBuddy/WorkBuddy 一起长出来的。模型能力直接注入产品,产品反馈又反哺模型优化——这套闭环是纯开源社区项目难以复制的。
- 价格锚点被重新定义:输出 $2.5/百万 token 的旗舰级开源模型,让所有闭源厂商的定价都面临压力。对企业来说,「自托管开源旗舰」vs「调用闭源 API」的权衡正在快速偏向前者。
适合谁用
- 开发者/技术团队:想低成本试用「能编排多个编码 Agent」的旗舰模型,WorkBuddy/CodeBuddy 免费期是零成本入口
- 自托管玩家:需要 100 万 token 超长上下文、又不想被 API 账单绑架,Apache 2.0 权重 + 开源推理栈是最佳组合
- 办公与金融场景:跨文档协作、金融分析、文档/表格/PPT 全流程生成是 Hy4 的强化方向
- 游戏开发者:一条提示词出可玩原型的能力,适合早期玩法验证
一句话收尾:当 7700 亿参数的模型以 2.5 美元/百万 token 的价格开源时,「前沿能力 = 天价账单」的等式正在被改写——国产开源大模型的下半场,比的是谁能把「强」和「便宜」同时做到极致。