大模型没有秘笈:腾讯混元4背后站着GLM-5核心研究员

日期:2026-09-01 20:52:55 / 人气:16



“做大模型其实并没有什么秘密。”

两个月前,从OpenAI空降腾讯的姚顺雨,在谈及大模型竞争时这样说道。当时很少有人真正在意这个论断。毕竟,此话由一位顶级研究员口中说出,未免有凡尔赛之嫌。但只要看清他接手的战局,就知道此话未必是谦辞。

过去半年,智谱、月之暗面、DeepSeek、千问……群狼环伺,开源旗舰的更新周期被压到几个月,甚至数周;而腾讯,急缺一款能在行业里站稳脚跟的旗舰模型。这位1998年出生、清华姚班与普林斯顿背景、ReAct与思维树共同提出者,2025年下半年从OpenAI回国、12月出任腾讯首席AI科学家的少帅,接手的是一场容不得迟疑的前线救火。

上周,混元交出了这份答卷。这是混元大语言与多模态两大部门合并重组、姚顺雨统管基础模型部后的首次大考——混元4(Hy4 preview)总参数770B、激活49B、支持百万上下文,距上一代大版本不到四个月,在Terminal Bench 2.1等基准冲到开源第一。

细品这份README,你会猛然回过味来:姚顺雨说的是大实话。从官方坦诚架构设计“受到DeepSeek和GLM启发”,到注意力模块借鉴DeepSeek的DSA与智谱的IndexCache机制,再到GLM-5的核心研究员白雨石出现在混元论文作者栏……原来大模型所谓的“独门秘笈”,早已被顶尖人才的高速流动、极度透明的开源机制迅速瓦解。

一套熟悉的骨架

当模型参数来到700B这一中大规模档位,各家面对的是同一道算力极限题。在Hy4交卷之前,国内在这个体量上跑通万卡训练、立住口碑的,是智谱2026年2月发布的GLM-5(744B,激活约44B,78层,隐藏维度6144,64注意力头,采用DSA+MTP)。

相隔半年,同处700B量级,把两代旗舰底层骨架并排摊开,重合之处一目了然:Hy4 preview的README明确写明“inspired by DeepSeek and GLM”,注意力主干用DeepSeek的Gated+DSA、配智谱IndexCache做跨层稀疏索引复用,残差通路用字节的iHC(identity Hyper-Connections)。

隐藏维度6144、78层、64个注意力头——这是智谱用真金白银砸出来的“700B最优解”,而开源让它成了全行业公认的共识底座。对于急需突围的混元来说,没有理由绕开它重新踩一遍坑。

技术沿路迁移

2025年9月,DeepSeek在V3.2-Exp首次公开DeepSeek稀疏注意力(DSA):增加轻量索引器筛Top-K Token,再做核心注意力,避免长上下文全量遍历。

2026年2月,智谱GLM-5(744B)直接采用DSA,并在生产级验证;随后发现索引器跨层重算仍是成本黑洞。3月前后,智谱联合清华推出IndexCache:相邻Transformer层Top-K高度重合,下层复用上层索引,最高砍掉75%索引器计算、端到端提速约1.2倍。

不到一年,一项底层创新完成“概念提出(DeepSeek)→旗舰验证(GLM-5)→工程降本(IndexCache)→全行业标配(Hy4)”的闭环。开源生态下,大模型技术迁徙周期已被压缩到以月计。

论文背后的人

技术接力只是故事的一半,另一半在作者栏。

白雨石,清华姚班2022届本科,留校计算机系读博(导师李涓子),曾赴斯坦福、哈佛访问,参与唐杰、刘知远等学者项目;在智谱期间是GLM-5架构线关键人物,主页自述负责“GLM-5新模型架构(DSA)、架构改进以及强化学习适配”,并以第一作者发IndexCache,当时在智谱身份为实习生。

他与腾讯的交集开始得更早:2026年1月入选首届腾讯青云奖学金(15人,20万现金+30万云算力,颁奖人正是姚顺雨)。 7月3日,腾讯混元发HiLS-Attention(无限上下文稀疏注意力)论文,作者栏已现Yushi Bai,归属Tencent HY Team;8月Hy4发布后,其主页更新为“Prev @Zai_org, currently scaling @TencentHunyuan”。

论文完成显性技术公开,跳槽的天才推进隐性工程经验物理迁徙。

大模型没有独家秘笈

今天,任何能被论文、代码、实验数据完整表达的技术优势,独占期都在急剧缩短。DeepSeek的DSA发布即成行业模块,智谱IndexCache不到五个月被旗舰验证,连残差侧的iHC(替代DeepSeek mHC)最初也只是知乎热帖讨论,作者“涮月亮的谪仙人”(微软亚研谢天)近期亦加入阿里千问。

从顶会论文、开源代码到社区讨论,前沿架构传播路径彻底扁平化。Hy4 preview技术报告大方标明灵感来源与修改方式,本身就是在宣告:700B档的工程最优解正在收敛,护城河不在“某块积木独家”,而在“谁能最快把公开积木搭成稳定旗舰,并让下一代接着生出来”。

顶尖人才高速流动,正在迅速填平领先大模型的护城河——这才是姚顺雨“没有秘密”的真意。

按你前几篇的收束习惯压一句:混元4不是腾讯发明了什么,而是腾讯用姚顺雨+白雨石这条人才链,把DeepSeek、智谱、字节一年内摊开的公开作业,重新默了一遍;大模型竞争的下半场,拼的不是秘笈,是“把行业共识底座焊进自己迭代节奏”的组织能力。

要不要我把这篇按《华为的增长,越来越贵了》的带修订标记精简补丁方式,给你嵌一组“770B/49B激活/1M上下文 vs GLM-5 744B/44B激活/202K”的对照锚点,并把白雨石青云奖学金→HiLS-Attention→Hy4的时间线收成一条三行脚注?

作者:杏宇娱乐




现在致电 5243865 OR 查看更多联系方式 →

COPYRIGHT 杏宇娱乐 版权所有