腾讯770B大模型开源!1M上下文,盲测力压GLM和Kimi
官方称该模型在尺寸、上下文与数据规模上均显著扩展,预训练与后训练同步进步带来智能水平再次跃升,稳居开源模型第一梯队。的早期迭代版本,预训练与后训练仍有提升空间,也存在复杂任务长思考、过度自我验证等已知问题,将持续敏捷迭代。
国内大模型又出新成员
今日, 腾讯正式发布了混元Hy4模型, 其总参数为770B, 激活参数是49B, 上下文长度达100万字, 当下已在多个开源社区同步上线, 还接入了腾讯云相关平台, 面向全球开发者开放下载以及调用。
此次的开源行为, 直接把面向的对象选定为开发者群体, 这种做法降低了使用的门槛。对于中小企业来说, 这有着特定的意义, 对于独立开发者来讲, 同样有着特定的意义, 那就是能够以较低的成本去尝试企业级大模型的能力, 这种情况进而推动了国产开源生态的发展。

参数规模与效率兼得
数量为770B的总参数量, 于开源模型里头处于第一梯队, 然而借助稀疏架构设计, 在实际进行推理的时候, 仅仅只需激活49B参数, 对模型容量以及运行效率予以了兼顾, 这样的设计思路, 于近年来大模型的发展过程中, 渐渐变成了主流。
据官方所展示的数据表明, Hy4于超前训练以及后续训练这两个层面都存在着同步性的进展, 其型号智能水准已然得到了明显的提高。以腾讯宣称的情况来说, 此型号稳居在开源型号的第一梯队范围之内, 这展现出它对于技术路线所抱有的信心。
生产力场景全面覆盖
软件工程这一领域, 办公分析它一范畴, 游戏开发此一方面都被Hy4所涵盖, 科研领域同样为之覆盖。腾讯动员了163名内部 expert实施检验, 还组织203个工程任务来展开测试, 当中涉及代码生成这种实际情景, 文档处理这般真实场景, 原型搭建如此现实场景, 测试的数据来源具备可靠性, 可信度是比较高的标点符号。
在软件工程领域,模型对长程开发的理解、规划以及验证能力起到了强化作用, 办公分析能够达成从数据处理直至演示的完整交付, 游戏开发可依据一句需求迅速生成可玩原型, 科研场景于在那分子动力学、凝聚态物理等方向也取得了进步。
盲测成绩略胜一筹
根据腾讯所组织的盲测得出的结果表明, Hy4于由163名专家参与的203个工程任务里, 其平均得分是2.99分, 此为满分4分的情况下, 该得分略微高于GLM – 5.3的2.92分以及Kimi K3的2.94分。尽管这种差距十分微小, 不过在大规模盲测当中已然具备参考价值。

这一成绩证实了Hy4于实际生产力任务里的竞争力, 还为国内大模型相互间的性能比较提供了新的参照基准, 对推动行业整体技术进步以及良性竞争有帮助。
科研难题取得突破
1. 于配合Hyra系统之后, Hy4在百年几何难题三维四面体问题这方面取得了进展。2. 其把体积下界从0.3推进到了0.41104。3. 距离著名的四面体猜想所给出的理论最优值0.41986仅仅只剩下约2%的差距。4. 这一成果展现出了模型在复杂推理层面的潜力。
数学领域中的突破性进展常常都需要具备极为强大的逻辑推理能力, 几何范畴里的重大突破往往也少不了超强的逻辑推理能力, Hy4在这个方向展开的探索, 为模型能力的边界给予了全新的注脚, 并且还使得更多的领域看见了国产大模型, 在基础科学研究之中所蕴含的潜在价值。
坦承不足持续迭代
官方明白无误地宣称Hy4纯粹只是早期的迭代版式, 预先开展的训练以及随后进行的训练依旧存有能够提升的空间, 面对复杂任务长时间思考、过度地自行验证等状况依旧还是存有。腾讯就此作出承诺将会持续以敏捷状态开展迭代优化, 不间断地去完善模型具备的性能以及稳定性。
现今, 模型已然跟多个平台深度协作了, 用户能够经由腾讯元宝、ima等产品直接去体验。从整体方面来讲, Hy4在参数规模方面、开源策略方面以及实际应用场景方面都呈现出了腾讯于AI领域的持续投入以及技术积累。
你认为国产大模型距离能够全方位超越国际顶尖水准还有多久呢, 欢迎于评论区去分享你的见解。