今天(8月28日)腾讯混元放出了新一代大语言模型Hy4 preview。770B总参数、49B激活参数、上下文长度突破100万Token。定位"为生产力而生",直接在WorkBuddy、CodeBuddy、元宝、ima全线产品首发,同时开源。
看到这个消息的第一反应是:腾讯混元的迭代速度比想象中快。今年2月重建基础设施以来,平均每两个月一个大版本。这节奏,已经不是追赶了,是在抢跑道。
参数不是重点,场景才是
770B参数听起来吓人,但真正值得关注的不是这个数字,而是它怎么用这些参数。混元这次瞄准了四个方向:软件工程、办公分析、游戏开发、科学研究。
软件工程方面,Hy4增强了长程开发任务的理解和规划能力,能处理前端开发的视觉审美和交互质量。办公分析则优化了跨文件协作,可以从数据分析一路做到文档和PPT交付。游戏开发支持一句话生成可玩原型,还能对接Unreal5和Unity引擎。科研场景覆盖了分子动力学、凝聚态物理、基础数学。
说白了,这不是一个通用聊天模型,而是一个为特定工作场景深度优化的模型。这个思路是对的,通用能力卷到头了,差异化在场景。
盲测数据说了算
腾讯内部搞了一次盲测:163名专家,203个真实工程任务。Hy4 preview拿了2.99分(满分4.0),GLM 5.3是2.92分,Kimi K3是2.94分。差距不大,但Hy4确实排第一。
这个对比很有参考价值。因为这三家都是国产开源大模型的头部选手,同一套评测体系下直接比拼,比各家自己发的benchmark有说服力得多。
更值得一提的是科研方向的突破。Hy4配合Hyra推理系统,在三维Blaschke-Lebesgue这个百年几何难题上,把体积下界从0.380799推进到了0.41104,距离Meissner四面体猜想的最终证明只剩约2%。另外在32,512原子磷脂双分子层模拟中实现了2.0倍加速。
递归自我改进:自己优化自己
这次Hy4最大的技术亮点,是首次全程参与了自身研发的优化过程。模型自己提出训练方案、运行实验、分析结果、继续迭代。代码、日志和反馈数据反哺下一轮研发,形成了初步的递归自我改进闭环。
具体来说,Hy4自主分析了推理系统的瓶颈,围绕算子融合、通信优化等方向做了一轮又一轮的优化,端到端吞吐量比基线提升了31.8%。也就是说,不只是模型能力提升了,连推理基础设施都被它自己优化了一遍。
这一步的意义在于:如果递归自我改进这条路走通了,模型迭代的速度就不再完全取决于人类工程师的投入,而是可以部分自我驱动。这是通往更强模型的一条可能的加速器。
价格战继续卷
定价方面,Hy4 preview走的是普惠路线:输入6元/百万tokens,输出18元/百万tokens,缓存命中0.3元/百万tokens。WorkBuddy和CodeBuddy还开了两周限时免费,明显是想快速收集真实反馈。
对比一下行业价格:这个定价和Qwen3.8-Flash、GLM-5.3-Flash基本在同一区间。开源模型的价格战已经打到"够用且便宜"的阶段了。对企业用户来说,选择越来越多,成本越来越低,这是好事。
国产大模型的8月混战
回看整个8月,国产大模型的发布密度确实惊人:月中DeepSeek上线V4 Pro正式版,下旬阿里发Qwen3.8系列,智谱同步开源GLM-5.3-Flash,现在腾讯又甩出Hy4。几乎每周都有新模型出来。
竞争焦点已经从参数比拼转向了真实生产力和落地效率。谁能把模型能力转化为用户真正能用的产品,谁就赢了下一局。腾讯的策略很清楚:模型+场景+工程,通过WorkBuddy等产品深度绑定,用真实场景的反馈驱动模型迭代。
这场大模型竞赛,跑的不是百米冲刺,是马拉松。8月只是其中一个补给站。
三维Blaschke-Lebesgue问题那个科研突破挺硬核的,百年难题推了2%
6块钱一百万tokens的输入价格,确实卷。企业用户现在选择太多了
两个月一个大版本的节奏确实猛。今年2月才重建基础设施,半年不到就迭代到Hy4了
盲测2.99对2.92和2.94,差距虽然不大但说明国产模型已经进入同一水平线了。接下来的竞争就是谁能把模型更好地嵌入产品里。
770B参数但只激活49B,MoE架构的效率路线走得越来越多了。关键是实际体验能不能追上参数规模。