中文AI推理训练性能接近英语,差距仅1.1%,非英语团队可放心用母语
训练有一个关键设计选择:奖励模型用英语推理,还是用提问者的母语推理。此前研究认为母语推理性能代价太大,非英语团队只能默认走英语推理路线。这直接改变了路线判断:中文推理模型有条件从训练阶段就跳过英语,走自己的路。语言本身在预训练阶段积累的资源厚度,直接决定了母语推理训练的性价比。
中文推理终于能独立走路了
分别来自美国的苹果公司以及德国的Hasso研究所, 二者联合发表了这样一篇具有重量级意义的论文, 此论文针对9个主流模型、11种语言开展了超过200组对照性实验。最终得出的结果, 使得所有并非英语AI团队的相关人员都长长地舒了一口气, 具体结果为: 当使用中文进行推理训练时, 同使用英语训练所呈现出的性能差距仅仅只有1.1个百分点。
这个数据当即将此前行业之中的默认判断予以推翻, 过往诸多研究报告表明, 以非英语语言开展推理训练, 其性能相较于英语要落后超过10个百分点, 故而大家都接受了事态, 默认按照英语推理路线行进,如今这份论文凭借数据证实, 中文的差距远非如想象那般巨大。
GRPO训练的关键设计选择
GRPO强化学习推理练习存在一个关键设计, 奖励模型依靠哪种语言来进行推理判定, 是持续将英语当作统一标准, 还是转换成提问者的母语予以评估, 此选择直接对模型的推理语言趋向有所决定。
先前的探究觉得, 致使模型运用非英语语种开展推理, 性能方面所要承担的代价极为巨大, 因而非英语语言领域的团队基本上都只能沿袭进行英语推理这条路。然而, 这份论文所呈现的数据表明, 对于中文而言, 所需付出的代价仅仅在1个百分点左右, 已然并不属于那种无法接收的技术耗费了。
跨语言迁移存在极端塌方风险
论文同时察觉到了一个意外状况, 尽管跨语言迁移一般来讲是有效的, 然而某些模型与语言的特定搭配却会致使极端性能瓦解, 举例来说, 在使用斯瓦希里语训练之后, 模型在含有英语内容的任务里面准确率急剧下降了19.2个百分点。
这种回退高度聚焦于困难的数学以及逻辑任务之上, 倘若将同一个模型更换成另外一种训练语言, 便会恢复到正常状态。研究人员宣称, 当前没办法凭借模型自身或者语言属性单独去预测哪些组合会出现问题, 唯有实际去运行实验才能够将风险暴露出来。
中文是跨语言迁移的双面选手
有数据表明, 中文于跨语言迁移里担当了双重角色, 它既是出色的接收方, 又是出色的发送方。Qwen3系列模型于用中文进行奖励训练之后, 能够有效地对推理语言不出现漂移加以控制, 同时还能够作为训练源助力其他语言提高性能。
研究人员还找出了一个违背直觉的现象, 在特定的模型之上, 针对中文的迁移效果而言, 用孟加拉语进行训练所得出的结果反而是要大于借助英语进行训练得出的结果。论文作出推测, 低资源语言的训练很有可能强迫模型加以更底层的推理能力实施重组改造, 而这种重组改造最终得出的泛化效果在某些时候是要比高资源语言所带来的效果更为强大一些的。
对中文AI从业者的现实意义
此篇论文于中文 AI 从业者而言, 最大意义是: 推理模型于训练阶段便能越过英语, 踏上自身的技术旅途。这表明国内团队无需再仰仗英语推理模型的翻译适配层级, 能够径直开展原生中文推理本领。
然论文亦明确予以提醒, “可控”之态况且“安全上线”之间所差者乃评估之覆盖程度也。其进行之实验单单针对8B以下之开源模型以及程序化所生成之数学逻辑题目 , 并未施行逐配置之超参调优之举 , 亦未涵盖真实之生产场景。中文团队于推进独立路线之际 , 依旧需要于更多之中任务类型以及更大之参数规模方面去验证稳定性。
非英语AI生态的独立窗口
要是将视野从中文这儿再进一步放宽开来, 那这篇论文对于整个并非英语的AI生态而言都是具备信号意义的。在过去的一年当中, 从阿拉伯语开始到法语再到日语, 各个语言社区都在询问同一个问题: 推理训练是不是一定要经由英语绕路而行呢。
要是答案一直都是“必须”, 那么非英语模型就始终只能去做英语模型的下游适配工作。如今这份论文, 将“差距可控”从先前的猜测, 转变成为了拥有数据予以支持的判断成果, 起码在资源相对丰富的语言以及中小规模模型层面已然是成立的状态了。当差距被压缩到1至2个百分点以后, 采用目标语言从RLVR训练阶段开启进程, 便成为了一个性价比合乎情理的工程选择项。
要是中文的人工智能推理已然能够独立地行走, 你认为国内的团队想要推出真正是源于原生中文推理的可以用于商业用途的产品, 最快会花费多长时间呢?