AI资讯

GPT刷爆旧考卷考到满分 下一代AI测试题ARC-AGI-5来了

智能摘要

AI把考卷刷到接近满分,下一张,还能考什么?Astra一出世,在ARC-AGI-3半私有测试集上,拿下了99.9%的成绩。下一张考卷人类还能出几张考卷?分数逼近天花板后,原来的考卷也越来越难分辨:AI究竟又强了多少,人类还领先在哪里?5瞄准「发明」,很可能是在提前寻找一道更难被刷穿的考题:

最新发布GPT-6在第三方最新评估基准的全新ARC-AGI-3评测集上刷出了高达99.9%的超高准确率, 直接把原定官方通用正式评测方案逼到了被迫作废, 人类专属出题人因此直面这道考无可考的独特新尴尬。

成绩跳升背后是工程魔术

拿到ARC-AGI-3半私有集满分近似99.9%的GPT-6 Astra, 貌似实无半点漏洞的如此表现, 实则依靠某一套能对上下文实施管控调配的适配工具。
一模一样权重编码的相同设备, 适配通用的标准化框架, 只能得到62.7%的测评结果;一旦接上归其独有的特制工程类功能模块, 整体分数就能暴涨至高出原本三十六百分点之多。

这种分数差异绝非模型泛化能力有所增强, 而是测试环境更贴近真实生产场景。英伟达的AVO模型也在演示集取得百分百, 表明当下评测体系对工程适配高度敏感, 只比模型权重已缺失公平性。

旧考卷正在集体失效

ARC-AGI-3原本让AI在游戏世界中自主探索规则, GPT-6在96%关卡用少于人类中位数的步数逐步通关, 平均每关节节省的空间动作省达51.7%。但这类有界确定性的动态复杂环境被人类用数据以超高迭代效率快速饱和, 不再能继续作为前沿顶尖智能标尺。

弗朗索瓦发布揭露ARC-AGI-4将明年第一季度发布、聚焦长尺度持续学习;ARC-AGI-5则直指发明能力。原有四百八十六名人类受试者、二千八百九十三次尝试构建的基线, 在开放式发明场景里彻底失效之因, 是无现成人类解法可作对照用。

发明能力成终极考题

ARC 5的核心作用是协助AI生成具备复用性可验证特性的全新工具与全新整套规则并非对既有架构范式做搬运套用, 所采用的衡量评判准则并非围绕AI运算的步数总量或者核心步骤识别的准确率, 而是基于新生成的中间呈现表达形式能否对后续问题的解决方案形成赋能加速, 诸如Astra已经尝试为各式回合策略类游戏构建体系化编造专属速记符号。

此类考题本无固定答案, 人类亦无法供给“制造该工具动用了多少步”的基准线, 评估将朝智能本质归属往回追溯: 习得新本领的效率, 倘若人工智能和人类在此维度层面再度没有任何客观悬殊, 那便抵达通用人工智能的节点。

出题人陷入时间赛跑

从ARC-1的静态找规律, 到ARC-3的游戏探索, 再到ARC-5的开放式发明, 每一代考卷的寿命都在缩短。一道大难关口刚被攻克啊, 出题团队就得重新拟题了, 留给评测证明“足够难”的窗口被不断压缩。

弗兰索瓦明确强调, 就只要还可提出人类能办却AI不能办之事时, 便会继续出相关题目, 预定在ARC系列达第六或第七代时完结。待人类学习效率与当前前沿AI发展水准差距无法精准衡量时, 考卷本身会丧失意义, 只余下AGI判定仪式而已。

人类还剩几张考卷

目前人类基线依赖2893次尝试量化静态的规则归纳, 而ARC 5要求AI产出可复用发明, 其评测维度从“解得快”转向“造得出”, 这道题能守住的时限多久无人知晓, 而开放式发明是当前现有最难的壁垒。

若连发明无法拉开人机差距, 将从“下一张考什么”讨论直接跳到AGI是否存在, 人类出题人的角色从命题者退守终点确认者。

评分标准该重写了

当工程适配能让同一模型分数翻倍, 纯权重对比已无意义;当发明没有人类基线, 传统评分体系必须重构。评测焦点应从“能否通过”转向“能否产出可验证新物”, 否则分数饱和只是工程幻象。

接下来该测定什么? 是新创物的重复利用率, 还是产出的效能? 这一问题没有已有的答案, 而左右它是否还会衍生出下一道考题。

你觉得在AI能“发明”那些场景的情况下, 人类还能靠什么来证明自己拥有专属的独特价值? 欢迎在评论区说说你的看法, 顺手点个赞或者把它分享出去, 让更多人了解这场关乎AI评测定下结局的竞速赛吧。

相关文章

OPPO陈明永谈AI不是替代人 是解决难题以人为本

AI资讯 # AI # CEO # OPPO