AI资讯

OpenAI发布GPT-6 Astra,多次修改评测数据,表现提升

智能摘要

模型公告以来,已经多次修改其中的评测基准数据。然而,当博客重新上线后,其中的多项评测数据已经发生变化,而且部分数据此后仍在继续调整。所有这些因素通常都会在模型发布前的最后几天持续调整,因此我并不惊讶看到一些数据更新。

发布后数据反复修改

OpenAI发布GPT-6 Astra,多次修改评测数据,表现提升

OpenAI的GPT-6 Astra模型于9月3日发布, 但之后多次改动评测数据, 引发高度行业关注。

这次修改牵涉幻觉值、网络防御等多重量化内容, 有部分指标有所提升, 尚有部分删改了竞品的数据, 操作特征清晰可见。

延迟发布背后的疑问

原本拟定在下午两点零二分推送博客栏目标文, 实际往后顺延了大约一个小时五十八分后才能够正常被打开访问。OpenAI表示缘由同基础参照测算分数没关系, 但对应数据事实确实有了变动。

这种时间差让外界猜测颇深: 有人认为是在修改数据, 也有人认为只是技术问题, 唯有真相仅被OpenAI自己知晓?

专家直指”刷分”嫌疑

斯坦福研究人员指出, 屡次调整测试条件刷高性能的措施当属“刷分”, 该手法对公司营销甚为有利、反倒获益更大, 他们还对 OpenAI 的系统卡这类举措指责缺乏技术层面细枝末节、透明度远远不够。

这样的质疑不是没依据没来由, 行业里头类似的所谓”最优条件中实测操作”做法愈发常见, 普通消费者真实体感或许远低于对外披露数值。

OpenAI发布GPT-6 Astra,多次修改评测数据,表现提升

竞争对手数据被下调

需注意本次修改中, 不止自家模型成绩被调整, 竞争对手模型的部分数据也被下调。

OpenAI解释称 11.5% 的成绩对应的是未向商业用户开放之推理等级 正在考虑是或恢复至5.5% 这种操作让用户更难判定真实水平。

行业乱象由来已久

这并非AI行业里头一回浮现同类问题, 二〇二五年Meta也曾被曝人为拔高Llama 4的测验效果, 后来还曾予以否认。

新模型每次发布前, 都在最后几天进行数据调整, 已成为某种潜规则, 只是这次OpenAI动作太大, 藏不住了。

透明度呼吁升级

行业人士希望形成新规范: 变更基准测试成绩时, 必定明确说明评测条件的变更, 令研究者能准确理解结果。

况且, 评测成绩直接左右客户抉择、企业招人及投资判别, 数据失实会搅乱完整市场的判定。你信AI公司的测试数据么?

相关文章

AI医疗超越医生?专家称AI独立照护患者效果更好,医生存疑

AI资讯