AI资讯

大模型也犯舌尖现象?知识明明存了,却答不出来

智能摘要

大模型答不出来,很多情况下真不是它大脑里没有,是学过了,取不出来。在前沿模型的事实错误里,「取不出来」已经压过了「没学过」,成了大头。那些存进去却答不出的事实,它找回了40%–65%。下一段增益更可能来自后训练和推理时的方法,也就是怎么用好已经存进去的知识。

GPT-5也能忘词?研究发现大模型有”舌尖现象

你遇上那种瞅见眼熟之人, 可怎么也想不起来其名字的状况, 在心理学领域被称作“舌尖现象”。当下谷歌探测到, GPT – 5以及GPT – 3存在同样的问题——知识实际上已然存储进去了, 然而就是没法提取出来。

模型也有”舌尖现象”

谷歌开展的研究, 揭示出了一个令人尴尬的现实情况, GPT – 5以及GPT – 3, 将百分之九十五到百分之九十八要测试的事实, 都收纳进了相关参数里面, 然而, 当你直接去进行询问的时候, 它们却存在百分之二十六到百分之三十四相关事实回答不上来这种情况。

这表明大模型回答不上来, 许多时候并非脑子里没有, 而是学过之后却无法提取出来, 如同我们想不起老朋友的名字那般, 那些知识处于参数之中, 只是暂时被“卡住”了。

知识画像的五种状态

谷歌所提出的是一个 “知识画像” 框架, 并非不再与没有问答对相关, 而是要判定这条事实于模型记忆里处于何种状态。总共划分成为五种状态: 其一为存入失败, 其二为回忆失败, 其三是直接回忆, 其四乃借助回忆,其五是未存入却依靠推理答对。

如何去判断是不是存进去了呢, 将维基原文截取到答案出现的前面部分, 让模型顺着这个去接着写, 两道题目都不允许开启, 仅仅是为了把“记住了”以及“推论出来的”严格地划分开来。

存得进却取不出

数据透露出, 将近半数的稀奇少见的事实, 明明就沉睡在模型中, 可偏偏就是没办法将其调取出来。以往的时候, 人们笃定地认为是模型的容纳量不足, 以至于那些稀奇少见的事实根本就未曾被学习进去。然而, 实际状况却狠狠地给人以教训。

GPT 3 Pro, 保留下来了百分之九十四点五的冷门事实, 以及百分之九十九点五的热门事实, 二者之间仅仅相差五个百分点。然而, 一旦开始开口进行回答, 冷门事实的留存比例就降至百分之六十三点三, 热门事实的留存比例则为百分之八十四点七, 期间相差了二十一个百分点。在存储阶段, 二者几乎不存在差别, 而在提取阶段, 却呈现出四倍的差距。

选择题和问答题的差距

好例子是有反向提问这个情形的 , 你向AI询问汤姆·克鲁斯的妈妈是谁 , 它能够又快又准地给出回答 , 然而关于2023年的论文表明 , 模型学会了“A是B”这种情况 , 卻不会自动将其泛化得出“B是A”。

改成在谷歌的四选一情况之后, 发生了让人意想不到的惊人反转结果;GPT-5进行正向问答时的回收率达到了82.9%, 然而进行反向问答时却掉到了74%;不过在选择题当中, 反向类型的题目并不比正向难度大, 在13个模型里, 有9个模型反而在同样测验中表现更好;上述状况从而清晰表明事物之间的关联是确实存在的, 真正面临的阻碍却是如何把这种关联挖掘出来。

开启思考链能帮上忙吗

使人感到意外的是, 开启之后, 回忆失败了占比百分之四十到百分之六十五的事实, 而那些根本就没有存进去的事实, 仅仅只能捞回占比百分之五到百分之十五, 这表明思考链对于已经存进去的知识是有效的。

缘由存在着两个方面, 其一为计算缓冲, 思索tokens即便内容毫无意义, 却也在为模型谋求额外的隐式算力, 其二是事实启动, 相应模型先是讲出一批与之有关的事实, 这等同于为正确答案搭建起一座语义桥梁。

未来方向在推理优化

通过研究发觉, 当模型逐渐变大时, 编码失败呈现出一路收缩的态势, 然而回忆失败几乎维持不变。在GPT – 5.2这个模型里, 回忆失败在全部错误中所占比例超过了七成, 并且模型越强, 此比例就越高。

虽已触达存进去比例处于百分之九十五至百分之九十八的上限, 持续增添参数所带来的提升正渐趋变小。下一段的增益更有可能源自后训练以及推理方法, 也便是怎样将已存进去的知识运用得当。然而模型也必须先察觉到“我想不起来”, 才会明白值得再多思索片刻。

你觉得,让AI学会”自知之明”,比堆参数更重要吗?

相关文章