AI教父警告:依赖合成数据训练AI是巨大错误
行业越来越依赖合成训练数据,这可能正在把整个行业带向错误的方向。当被问及使用合成数据是否能够帮助大型语言模型持续扩展时,萨顿直言:“这绝对是个大错误。萨顿在周二的播客中表示,人工制造的数据并不能充分替代真实数据。“我们不可能为其他人的思想制造合成数据。
泰斗发声 警告行业走偏

获得图灵奖的里奇·萨顿, 于红杉资本播客里, 公开地对当下AI行业的发展路径作出批评, 他觉得科技巨头过度倚赖合成训练数据, 正将整个行业朝着错误的方向引导, 此言论在业内引发了广泛的关注。
萨顿清晰地表明, 运用合成数据助力大模型持续拓展的行为是个极大的失误, 他预估这或许会成为人工智能领域后续的关键教训, 身为人工智能领域的先驱者, 他的此番言辞极具分量。
合成数据是什么
由算法也或是人工生成的AI模型所产出的并非是从真实世界原始数据里采集而来的数据, 被称作合成数据, 伴随AI公司持续挖掘互联网以外的训练源头, 合成数据的应用场景愈发广泛。
经常用计算机生成的汽车图像做训练的范畴是自动驾驶领域, 欺诈检测系统会用虚构的银行交易记录。这类数据成本不高, 并且易于做到规模化生产, 所以受到不少企业的喜欢。
巨头高价争抢真实数据
大量科技公司, 正不计任何代价去寻觅更多真实数据, 谷歌在本周稍早的时候, 同意拿出1000万美元, 收购已然破产公司的内部数据以及软件。这样一笔交易, 突显了专有真实数据对于AI训练的价值, 正处于快速提升的态势。
这些企业殷切期望得到那种, 难以轻易从互联网获取到的, 大规模的专有数据集。在数据已然成为核心竞争力的时代岁月里, 究竟是谁能够掌握住更多的, 优质还真实的数据, 那么谁就比较有可能, 在AI竞赛里面占据到优势地位。
真实世界的复杂难模拟
萨顿借助人类思维来举例表明合成数的局限, 他点明不存在任何为别人想法创设合成数据能成立之绝对可能, 每个人的认知以及经验都是具备唯独特性且复杂异常的。
任何合成数据, 都无法准确预测无人机在现实物理环境里的表现, 机器人的电机有摩擦、磨损等变量, 世界纷繁复杂, 任何模拟不过是管中水窥豹之态。
新公司探索体验学习
萨顿更偏向采用真实体验数据, 也就是AI智能体借着与真实环境开展互动工作, 去观察实际发生的各类事情, 并且于行动结果当中持续进行学习。此模式能够让AI获取到更贴近现实状况的认知能力。
上个月, 萨顿跟之前 的学生Javed一块儿开始创建Oak Lab。这个刚刚起步的公司在努力去研发那种能够不断地从自身经历里进行学习的AI智能体 , 并不是依靠大规模预先制作好的数据集。当前这个公司还没有把融资方面的信息以及投资者的名单给公布出来。
经验数据或成关键
把真实体验当作根基的学习方式, 呈现出一条不一样的技术发展路径。相比于借助合成数据去堆砌模型规模, 更应该让AI于真实环境里持续地进行试错以及实现成长。
那条路即便成本更为高昂、周期更为漫长, 然而或许能够产出具备更高实用价值的智能系统。在行业纷纷都在追逐数据规模之际, 质量以及真实性的价值正处于被重新审视的状态。
试问, 你认为AI的发展究竟契合合成数据此种路线呢还是适配体验学习这种路线? 欢迎诸位在评论区域中分享自身的此种看法, 倘若自感这一篇文章存有一定的助益, 可千万别忘了点赞以及分享!