只用1300张H200 新出模型硬刚GPT-6 Astra还赢了科学基准
而Astra的10万张以上Blackwell,对应的是一个前沿通用模型的大规模训练。所以,1300对10万,算不出一个效率倍数,但它至少说明,这1300张卡被Periodic用到了极致。官方表示,把训练算力扩到与今天前沿模型相当的量级,能解锁更强的科学能力。
Neon这家公司, 只用了1300张H200芯片, 还有几个月的实验数据, 就在他们自己搞的分析基准测试里, 把成绩做得比GPT-6 Astra还要好。这件事说明, 这条新走的路子, 正在改变得让过去的大模型进化的老逻辑。
从大模型转向材料科学的核心动因
核心团队的跨界背景
Fedus这人, 以前是OpenAI那个大公司的核心搞事情的人之一。他长期负责模型后训练的那个环节。他对怎么让大模型性能变好这件事, 有一个极深的理解。他从原来的地方离开之后。他拉上了一个人一起创业。这个人叫Ekin Dogus Cubuk。他以前是谷歌的化学和物理研究负责人。
这两个人都看到了, 通用大模型在发展的时候碰上了挺明显的堵点, 网上能找到的那些公开数据已经被琢磨透, 基本没剩啥有用的东西了, 所以根本撑不起让模型能力再往上跳一大截的需求, 基于这个情况, 他们就商量好了, 要把自己的主攻方向给调到材料科学这块领域里去, 目的是在那儿找到一个能够打破僵局的地方。
互联网数据的增长瓶颈
现在大家用的那些厉害的大模型, 在训练阶段用到的数据, 绝大部分都从网上公开的地方扒来的。这种数据的总量, 一年比一年地减速增长, 里面重复的东西变多了, 比例越来越大。像好多前沿的科学领域里真正有用的那种好数据, 要在公开的互联网上找个完全没缺漏的高品质样本, 基本上是一件根本找不到的事。
大模型如果想要继续把性能上限往上突破, 就必须跳出现有的互联网数据这个舒适圈, 去寻找那些全新的、还没有被大规模使用的数据来源, 真实物理世界里面的实验数据就这样成了他们瞄准的新方向。
自建高通量材料实验室的核心思路
全流程自主生成私有数据
团队从项目启动的第一天起就自建了实验室, 所有的实验设备和流程都由团队自主调试并搭建。实验室里的样品托上摆放着刚合成的候选材料, 这些材料会被送入X射线衍射仪以生成专属的物质图谱。
这些图谱就像是每一种材料所独有的那种独一无二的指纹, 它们成为了人们判断合成出来的产物到底是不是目标超导体的核心依据, 同时也决定了它是不是磁性材料或者半导体, 因为这是最核心的标准。所以, 每一次实验过程中所产生的那些全部都是私有的数据, 它们是绝对不会和那些公开的数据集发生任何重合的。
24小时不间断的实验循环
实验室现在已经能够全天候地持续进行运转工作, 并且把关于材料的发现这一过程给拆解成了有着完整闭环的一个环节。先由那个模型去根据现有的这些数据信息来进行预测, 看看哪些新材料可能具备特定的性质, 然后就可以生成出下一步应该去做实验的那个具体方向。
每当一个人完成了一轮实验的操作, 就会得到一批全新的数据, 这批数据里头带着真实的物理反馈情况。大家把这些直接放进模型去训练, 这样就使模型在预测和分析方面的本事能够不断地进行更新和变化, 由此形成了一个不断变好的正向循环过程。
Neon模型的核心性能表现
XRD分析基准测试结果
Neon 这个模型的参数规模大约是一万亿, 就是在那些特别难的 X 射线衍射分析测试里面, 它的成功率达到了百分之五十五点三, 这成绩超过了 GPT-6 Astra 还有 Fable 5.1 在同期测出来的成绩。
为了不让模型靠着背答案来刷高分, 团队专门准备了总共一百九十八道测试题目, 这些题目都剔除了训练时用到的那些化学体系相关内容。
和那种基于代码搭配标准XRD工具的传统方案相比, 在单题成本差不多的前提下, Neon的成功率达到了后者的3.8倍, 它显示出非常明显的性能优势。
算力投入的悬殊对比
黄仁勋公开提到过, GPT-6 Astra背后的训练算力依托超过10万张Grace芯片。而Neon完成峰值训练, 仅用到1300张H200芯片。双方算力投入差距接近百倍。
这组数字相差很大, 直接去换算的话, 算不出个明确的效率倍数。但这却能够让人一眼看明白, Neon团队把每张GPU的算力都用到了最厉害的地方, 他们走出了一条跟别人完全不同的技术路线。
解决科学强化学习的核心痛点
搭建专属AI裁判体系
XRD图谱的拟合匹配度很难直接作为判定的依据, 人工核验需要耗费极高的成本, 这种状况无法支撑起大规模的训练工作。所以团队寻找来了大量材料领域的专家, 对数千个XRD图谱进行了标签标注, 通过这种方式校准出了由Opus 5和GPT-5.6 Sol组成的AI裁判组。
最终, 这个AI裁判做出的判断的可信度很高。它的可靠程度已经非常接近人类专家彼此之间给出结果时的一致水平。这一成果成功地把那些原本模模糊糊、不好下定义的科学任务, 转化成了明确的任务奖励信号。这些信号可以被用于强化学习的过程中。
优化算力调度机制
在早期强化学习的循环里面, 训练过程、推理过程还有模型生成的代码都没有做完严格的隔离工作。当时就发生过这样的情况:模型申请了八十GB的内存, 结果直接导致了整个任务崩溃。
后来团队调整了架构设计, 改成直接去调用GPU节点上边闲置的CPU资源来运行特定的科学工具方法。在这个过程中, 所有数据全程都在集群内部处理, 绝对不会流出去。
这套方案, 和第三方托管的沙箱服务相比, 数据传输的速度, 快了4.5倍, 任务的吞吐量, 达到了对方的3.3倍, 整个GPU集群的常年利用率, 稳定保持在95%以上。
数据飞轮的全新运行模式
中训练与RL的协同增效
Neon的中训练语料混合了学术文献、代码和自研实验数据,数据集规模每个月都在翻倍增长。团队发现先通过中训练把基础科学知识注入模型, 后续开展强化学习的效果会得到明显提升。
在GPU等待训练数据更新的这段时间隙里, 还可以拿已经存在的实验数据继续做分析工作, 以此来优化以后要给出的预测结果, 这样一来就不会出现算力白白闲置、造成浪费的情况了。
避免智能体扩展的成本陷阱
数字世界的强化学习, 能够靠派出海量的智能体, 快速刷题、自动判分这种方法, 帮助智能体写出大量的代码, 解开那些悬而未决的数学猜想, 这一方面已经得到了证实。但是, 物理世界里的科研实验, 不可以无限制地增加并行任务的数量, 因为每多跑一组实验, 就要额外消耗电力、设备以及人力成本。
Neon 这个模式是不需要没完没了地去提高算力投入的, 它是靠着不停产出的那种独有的物理实验数据, 就能让模型的科学能力一步一步地不断变好, 这样自然就躲开了那种纯粹靠堆积算力进行的恶性竞争。
未来的全自主科研闭环规划
当前的落地进展
现在, Neon已经正式部署到了自家的实验室内。它直接参与了真实实验的结果分析工作。它正在辅助团队去寻找性能更优的超导体和磁性材料。目前, 它已经完成了整个科研闭环里的结果识别环节。它能够精准地读懂实验室实际产出的物质是什么。
团队并没有采用让模型去完全替代科学家来做这种决策的做法。在现阶段, 它给自己的定位是辅助科研人员来判断实验的方向, 并且给出更多一些具有参考性质的建议。至于最后的决定权, 还是牢牢地掌握在科研人员的手里。
后续的扩展方向
接下来的时间, 团队会一步步把这个手段扩展到设计实验方案还有规划合成路径这些事儿里头, 去补上现在还没连通的那两个闭环环节。官方说在后面要是能把训练用的算力升到跟当前最领先的那些通用大模型一样多的话, 这个模型在科学方面的本事还会再上一个非常大的台阶。
他们未来也是会考虑去更换那些强度更高一点的开源类型的权重模型的, 把它们作为基础底座使用的, 目的是要进一步地去把这套围绕数据建立起来的循环迭代体系的整体效能给大幅度地提升上去的, 最终是想要去实现让人工智能来主导整个科学研究过程的, 并且达到完全自主进行科研成果产出的那种状态的。
对于这种依靠自行研发的物理实验数据, 以此来推动大模型不断进化的技术路线, 你是否觉得在接下来不远的几年时间里, 它有可能促使产生出更多的、并且超出人类当前认知范围的新材料方面的成果呢?