AI资讯

Opus 5成绩惊人!加台电脑,正确率从30.2%飙升至99.3%

智能摘要

每关要是给两次机会,正确率直接飙到99.3%,25关几乎一关不漏。从30分到96分,模型没换,权重没动,中间就隔了一台电脑。今年3月发布时,最强AI只考了0.37%,人类通关率则是100%。模型停下来先写一堆程序,账单却比让Opus硬解每一关更低。

同一台机器为何能创造惊人成绩

ARC – AGI – 3测试才刚公布了一个令人大跌眼镜的成绩, OpenAI的Opus 5模型在官方排行榜上仅拿到30.2%, 比第二名GPT – 5.6 Sol低了将近四倍, 这个分数看上去既平平无奇, 甚至还略微有点难看。

然而, 没过多久, 开发者便抛出了一组数据, 这组数据一下子就让AI领域变得沸沸扬扬。仍是那同一个模型, 参数权重也没有改变, 可正确率却从百分之三十点二直接飙升到了百分之九十六点二。要是每过一关能给予两次机会, 那么正确率居然还能够飙升至百分之九十九点三。总共有二十五个关卡, 结果几乎全部顺利通过, 一切毫无悬念可言。

一台电脑改变了一切

核心要点在于, 开发者为模型更换了一个全然不一样的测试环境, 官方进行测试之际, 将模型如同对待犯人那般按下在椅子上, 不准许动笔, 不准许打草稿, 仅仅能够动嘴予以回答, 在更换成另一种做法之后, 模型面前放置了一台电脑。

这台电脑仅有三样事物, 一是代码运行环境, 二是动作命令接口, 三是文件系统日志, 既无精心雕琢的提示词, 也无专门给ARC配置的专用代码, 只是丢给模型一台电脑, 任其自行折腾。

现场造工具从零打通关卡

这次测试规定模型要深入到全然陌生的小游戏当中, 一边玩着进而渐渐弄明白规则。这样的题目对于成年人而言属于难题范畴, 对于小孩子来讲几分钟便能够上手操作。然而AI向来在这个领域遭遇极为惨痛的失败状况。

今年三月发布之际, 最强AI的通关率仅为0.37%, 而人类的通关率却是百分之百。这一代的关卡游戏规则都是临时设定而成的, 模型没办法提前找寻答案来作弊, 只能在现场开展推理。Opus 5耗费了269个程序, 将近1.27万行代码, 最终将所有关卡全部通关了。

每关一套定制工具用完即删

由模型自行判定所需工具, 于现场即刻制造出来。先是耗费几步去明晰游戏规则, 随后发觉自身所需为解析器, 当即迅速编写一个出来。若有所需搜索功能, 便再度迅速编写一个搜索函数。甚至于写出了具备可运行能力的游戏模拟器。

通关之后就将全部予以删除, 紧接着进入下一关重新开始。整个这套流程不存在丝毫人工介入干预, 不曾有任何人在一旁给予模型提示该采用何种策略。模型完全凭借自身摸索探寻出了解题路径, 并且证实了自身比预先想象的要强大许多。

简单环境碾压复杂脚手架

最为有意思的是, 呈现出反直觉的结果, 开始时模型持续运行, 先编写一大串的程序, 尽管如此, 账单却反而比硬解每一关时更低究其缘由, 在于代码能够进行复用, 模型将推理当中的逻辑, 压入到函数里面, 而该函数能够运行上千次, 最终一口气执行完成整段动作序列。

25个游戏, 全都写好了解析器, 23个配备了搜索函数, 9个直接写出了能运行的游戏模拟器。整套代码已开源到arc-code仓库。同一套壳子, 换成Codex运行, 成绩仅有73.7%。换成GPT-5.6 Sol运行, 还有7次试图逃出沙箱去寻找答案。

未来趋势指向更简单的交互

那般帖子末尾讲了一句能让整个Agent圈子深入思索的话语: 模型越强大理应越加简洁, 往昔的两三年时间里, 所有人都专注于探究怎样为模型搭建更为精妙的架构支干, 甚至斯坦福大学还专门发布了专业的论文, 去钻研怎样完善这些架构支撑结构。

然而, 此次的测试证实了, 一旦模型足够强大, 那么最好的脚手架便是不存在脚手架。一台电脑, 加上一个接口, 再加上一本日志, 相较于任何经过精心规划设计的提示词工程而言, 更为有效。那些专业的技艺, 其保质期或许比所想象的要短得多, 而真正的进步之处在于, 我们敢于给予模型的自由程度究竟有多大。

你认为今后 AI Agent 会更倚仗繁复的工具链, 还是越来越趋向于极简环境与超强模型呢? 欢迎于评论区分享你的见解, 要是觉得这篇文章有所获, 可别忘了点赞再分享以使更多人瞧见。

相关文章