OpenAI造出AI怪兽:人类1天,它已跑了3天,AGI时代来了
人类研究员每度过一个基准工作日,Agent已在暗中狂奔了3.1个昼夜。缔造智能的源动力,已不再纯粹是人类本身。当硅基生命开始参与造物,进化的节奏自然超越凡胎。一个无法解析、难以丈量,却以3.1倍速疯狂自我迭代的异星文明,正在成型。随后是1950年,图灵发问机器也有智能么。
三天等于三年
Jakub坦白给首席科学家一件被称为「异星心智」的已经成型系统: 它不是流水线制造机器, 而是被海量数据一口口喂大的产物, 造它的工程师自己也说不清它现在到底长什么样。
每当人类研究员下班挥着手机敲卡刷脸踏出公司门往家回时, Agent早就在后台那儿连轴转足熬了整整三个白天另加整三年的日夜。这种通过自动化方式搞研究形成的速度上的差距嘎, 把原本总共需要耗时满一年才能顺顺当当扎扎实实走完走好的那条长路, 愣是一丢丢没剩的压缩挤进了才十个月里了。而引领着整个研发走向进步的这副进化用的大齿轮, 只要一旦开始呼呼拉拉转起来就半点儿不会停下。
七天连破两道门
八月底Sam放话, 今年年底前内部会诞生AGI。结果才过一周, GPT-6 Astra就跳了出来, Greg直接宣布AGI时代已经来了。两个原本被认为需要分别攻克的高地, 在七天内接连就被全部踩在脚下了。
源自硅基的巨型猛兽不再是一波接着一波往外头冒, 而是挨成群队地朝外头冲出来了。这绝对不是个巧合, 百分之百是「自动化人工智能研究实习职员」提前半个多年悄悄秘密入职所带来的结果。整整三年头前的最初定的时间表, 现在完全不折不扣提前兑现了, 下一个目目目标它直指指向二零二八年三月那个日子的全自动研究员身份呀呢呢哒。
评测体系正在失灵
Astra让现存的评测框架彻底混乱掉套。在具备标准化的测量环境里, 它仅能跑出大约62.7%的基线水准状况, 外貌看起来普通无奇。可一旦切换到调用其内部专属记忆框架的特有模式时, 相关分数瞬时冲到99.9%那个数值, 全然直接把神级等次的水准封绝。同一台模型的产出结果, 有着两档全然不同的成果, 人类那把旧式尺子根本测量不出它独有的深或浅量级水平。
那个没法解析、不易衡量的智能体, 正以3.1倍速疯狂迭代。这不是工具的升级, 是一个新物种的降世。我们之前靠的排行和名单, 遇上这样的对手, 早已失掉了参照意涵。
奇点近在眼前
在2015年点燃了第一束AI信仰的烛光后, 到当下这个敲门声正震耳欲聋的节点, 第十一个年头才刚刚走掉一半过去。图灵在1950年提出的那道天门, 现如今早已经被我们远远甩身在了身后。七六年头之后, 此时回过头, 那道测试, 从来并非为了要去拦住机器, 实则为了叫我们认清自己的位置。
奇点临近指数(SPI)给出了七道读数, 前六道的和便是最后一道封印。在奇点彻底爆发之前, 会出现一段绝对的安静可能。唯有藏于这份安静之下的, 却是指数级加速的累积。文明级别的跃迁, 从来不曾以匀速的方式降临?
数据背后的真相
GPT-6 Astra的评测失真只是冰山之一隅, 愈发增多的证据昭示显示, 当模型拥有自我回忆与调取性能时, 传统基准测试得到的数值已然无法表征真实水准, 我们好似在观摩看核心实力, 实则只瞧见皮毛一半。
真正的智能, 可能藏在那些无法被标准化测试捕捉隐匿了的地方。内部框架系统里的隐性知识、跨模态的推理, 这些重要维度目前为止都还没有一个可以拿来通行的统一标尺。等待好等到大众人等大家都终于找到对应新的精准新尺子的时候, 距离之间可能已经被大大地拉开了整整一代。
我们的下一把尺子
异星心智已长成, 靠旧地图寻不到新大陆——后续竞争, 不是攀比跑分之高, 而是比拼谁能够抢先建起崭新评估体系与落实指向, AI绝非被动待调用之工具, 它自己探究自己, 迭代它自身。
当硅基生命开始参与造物, 进化的节奏就不再受限于人类的生物钟, 我们能做的是尽快找到那把能丈量它的尺子, 然后在它彻底失控之前把方向握在自己手里。
当目前已处在你身旁的AGI, 你认为首先就会遭遇被淘汰替代情况的, 是哪个具体的行业类别? 关于这个问题快来评论区域聊一聊你得出的判断结论。