AI资讯

GPT-6 Astra跑分造假?OpenAI被指数据作弊,是真AGI还是翻车

智能摘要

GPT-6偷改跑分这次OpenAI跑分被抓包,究竟是怎么一回事?Astra的官博上线后,内部评测跑分悄然发生巨变!最绝的操作,是在幻觉率数据上的「刀法」。跑分作弊被抓包看似是一场公关灾难,但将其置于OpenAI当前的生死时局下,逻辑便清晰起来。说到底,这次Astra跑分风波也提醒了所有人——

开篇点出争议

OpenAI官博上线还不到半天, GPT-6 Astra的评测成绩突然变了样的, ARC-AGI-3的分数从98.6%直接跳到了99.99%, 这个数字带来的剧烈波动, 立刻引发了各方的种种质疑。

有人拿到内测数据, 发现幻觉率从4.2%减到2.0%, 又回落到原值。同一模型, 同一标准, 成绩却被反复改动, 这番操作让人看不懂。

数据为何频繁变来变去

官方把缘由归咎为“去除噪点的常规调整”, 声称不一样的系统配置将会影响最终得分。这类说法看似合情, 但问题在于发布渠道没有同步公开调整条件。

把经潜心精心配置后的最高分值展示成默认状态后, 会干扰普通公众判断。一般大众所见的榜单数值, 不过是特定场景中存在的最优成果, 并非常规日常使用时的真实程度。

模型自身的毛病被公开

这次官方反而罕见地列出一份”毛病清单”。比如指令稍模糊, Astra就会停下来追问;长流程容易被打断。开发者要在系统提示里强制加入行动偏好之指令, 才能让它输出可复查之成型产物。

代码任务层面上, Astra过测过度, 无效Token耗能甚巨。子Agent间横向协同被动, 大体缺乏联动。针对此类疑问, 官方特意提供一整套调试方案, 辅助开发者敲定具体卡点。

当用户的提示词表达了行动诉求时(如“你能否……”、“我想……”、“帮我……”等类似表述),应将其视作开展工作并采取行动的明确指令。不要仅停留在确认自身能力(例如“可以……”)、提出计划或询问是否继续。不要为了节省时间、精力或Token而满足于提供不完整的、或者看似“足够有帮助”却未能完全解决用户任务的折中方案。如果一项任务需要持续推进,请完成全部必要的工作,直到达成预期的最终成果。

AI套话被整治

如果某个技能导致你请求许可或确认、暂停、未完成所要求的工作、或偏离了用户的意图,请指明并链接到你所阅读的具体 SKILL.md 文件,引用相关指令,并简要解释其如何适用。请将技能的明确要求与你对准则的解读区分开来。

官方还发布了一份“泔水词黑名单”, 专门整治长文中常见的AI腔调, 目的是逼迫模型少说废话、少耍架子, 而让长文写得自然精炼、更近似人话。

这也暴露了一个现实: 现在的模型成绩, 早就不只是“裸模型能力”的比拼。提示词的撰写方式、Agent的编排手法、工具的供应情况、运行次数多少、基准选择对象, 都可能改写最后的榜单数字。

直接陈述拟执行的操作。避免额外提及你不会做什么、哪些内容将保持不变,或者你将如何区分或分类结果。不要使用对比式结构,例如“X, not Y”或“X—not Y”,这种结构会引入用户未曾询问且未经提示的替代选项。避免使用自创的复合标签(如“exact-head checks”和“editorial-row layouts”)、含糊的限定词和生搬硬套的过渡语;请使用朴实的动词和介词直接陈述实际关系。

内部进展快到离谱

技术博主爆料, 内部早已迈入递归自我改进阶段。作为更大规模预训练基座的Doug, 正在全面接管下一代演进版本的训练。Astra之后的重大发布, 将直接冠以”AGI”之名。

具备人类级通用理解力全领域专家表现实时交互能力的版本排期在2027年中下旬。另一家公司的内部系统卡被扒出, Model 2和RSI新模型的身影浮出水面, 下半年AI竞赛更加激烈。

追踪前沿需要新地图

当榜单数字居然总是可能反复横跳着出现, 持续不断跟着追踪就变得尤为重要起来。有人开始动手整理出一套“ASI坐标系模型”, 把一个大模型评估硬生生拆成互不相同的七个维度, 这七个维度分别包括智能维度、推理维度、知识维度、编码维度、Agent维度生态维度以及经济维度……

29项的二级指标, 从不同的公开来源中来, 经过统一处理后汇集成周总榜的总分。底层的数据保持不变的情况下, 只是针对不同的场景进行重新加权处理, 不用为了做出子榜这般重新拼数据即可。

进展太快刷不过来

过去多月以来, 一个愈发明确真切的感觉就是: AI的发展进展迅速到即便每日反复刷刷数十次X都已然追不上进度。一个模型方才发布发布没没多久之后, 才过去短短几个小时其对应定价也就随之出炉, 待再过短短一些时日, Arena的排行名次、开发者们的相应反馈又会对前期初步形成的最初的认知判断进行全盘推翻。

有人开始把消息分成三类: 追最新进展要每分每秒、同一事件的相关脉络要串联理清、值得记住的技术变化要做成图表可视化呈现。当递归自我改进的时刻真的到来, 模型迭代周期还会一个劲继续缩短, 一张会照着前沿一同进行移动的地图也就会变得尤为重要变得刚需起来。

GPT-6 Astra数据反复横跳, 你认为是技术调整时合理现象, 还是为了营销效果做人为美化? 你怎么看这场AI竞赛里的“榜单游戏”?

相关文章