AI资讯

Self-reflection等概念虽涌现,但长期缺统一坐标系

智能摘要

agent等概念不断涌现。问题在于,这些术语描述的变化层级和强度并不相同,却长期缺少一套统一坐标系。自我改进也不是大模型时代突然出现的概念。它更轻量、更透明,也更容易验证和撤销,因此是当前工程实践中最活跃的方向。论文给出的核心设计原则,可以概括为八个字:快环探索,慢环固化。

什么是真正的自我改进

近来, 存在研究团队, 针对AI的自我改进, 给出了全新定义, 诸多概念得以梳理清晰。往昔, 众人所提及的自我改进, 种类繁杂多样, 其中部分仅仅是于对话期间的临时反思, 部分则是一次性的行为, 根本不能算作有效。

对于真正的自我改进来说, 存在着一个硬性的标准, 那就是系统需要依据自身执行后所获得的结果, 从而持续不断地去修改内部的参数或者结构, 如此一来便可使得进行下一次任务时是从不一样的起点来开始生发出去的, 要是不存在这种改变, 那就不能够算作是真正的自我改进。

改参数和改脚手架的区别

走更新模型权重这一条路, 能让AI提升能力, 这路途较高的成本、较慢的速度, 出错后难以把过程回滚, 成功时能力可跨任务共享。走修改工具、记忆以及控制逻辑这另一条路, 是更轻量和透明的, 也容易进行有效性及无误性上的查验和撤销。

工程实践当下最为活跃的是第二条路径, 众多号称自我改进的例子, 实际不过是在对脚手架进行改造, 像所谓的整理记忆, 抑或是创建新工具, 还有修复工作流等行为, 这些改动并不涉及参数更新, 然而却真实能够改变Agent未来的行为表现。

学习信号从哪来

AI获取改进信号, 主要存在着三类来源, 其一乃是自身生成的训练示例以及推理轨迹, 其二便是模型自身给出的分数、偏好又或者批评意见, 其三则是源于真实环境或者模拟环境的经验。

代码执行可提供反馈, 网页交互能提供反馈, 游戏能够提供反馈, 机器人操作也能提供反馈。环境越是丰富, Agent所能学到的东西便越多。关键之处在于要将这些信号有效地写回到系统里, 以便形成闭环。

不同场景怎么用

代码范畴之内是反馈最集中的所在之地, 存在着编译器、单元测验以及持续集成, 其结果极易得到验证。网页Agent所面对的是持续变动的页面与接口, 要将成功或失败的踪迹积淀成为经验。

游戏所处的环境能够进行重置, 这种情况适宜用于自我对弈以此来积攒经验, 然而却极易致使Agent找到空子可钻。科学方面的发现将循环朝着假设以及实验的方向予以扩展, 而其中的难点在于反馈出现延迟以及具备可复现性。对于每个场景而言, 其改进的方式均是不尽相同的。

怎么判断改得好不好

以往传统评测着眼的仅仅是静态模型的最终所得分数, 然而自我改进的Agent所探究关注依靠的却是更新轨迹这一要素。此外, 评测具体被划分成可执行指标以及基于裁判的评测这两种不同类别, 其中程序代码以及工具调用等方面契合于前者, 开放式的较长链条任务则适配于后者。

负责生成的一方与进行评估的一方应当予以分开, 采用独立的裁判, 运用隐藏测试以及可验证子集去校准结果。当反馈呈现嘈杂状态时, 优先对脚手架作出修改, 在策略得到充分验证后, 再将其蒸馏进参数之中, 以此形成快速适应与慢速固化双轨并行的态势。

未来方向在哪

研宄团队提出来六个方向, 其中包括测试时进行持续适应, 主动展开探索并带着好奇心, 对参数与脚手架开展联合优化, 在资源受限情形下提升改进效率, 实现多 Agent协作进化, 还有确保开放世界具备鲁棒性。

更要紧的就是将Agent视作处于受保护环境里的不可信程序, 一切更新均需经由分层门控。真正达到成熟状态的系统并非进行二选一, 而是促使两条路径构建起协同循环, 致使每次任务都留存下能够被验证的成长。

你认为当下的AI自我进行改进, 距离实现真正能够被掌控的进化, 究竟还有多远呢? 欢迎于评论区当中说一说你的想法, 点赞分享从而让数量更多的人得以看见。

相关文章