Agent不会积累经验?浙大开源HugAgentOS,四大环节让AI自主进化
但另一个更基础的问题始终没有被解决:Agent不会进行自主积累与自主进化。所以HugAgentOS想解决的不只是怎样让Agent记住,而是经验如何长成能力、能力如何自行组队,以及这一切如何在可控的前提下发生。记忆引擎让经验留存,技能引擎把经验变成单项能力,编排引擎把多项能力变成一套打法。
标题
智能体怎么自己积累经验?浙大开源方案帮你搞定
文章正文
智能体的进化困境与破局思路
此刻大家给AI增添各类功能, 去搜资料, 去写报告, 去跑流程, 看上去似乎什么都可以干。然而一个问题一直未曾解决: 做完一百回活儿, 它的头脑之中仍然是一团乱麻, 完全不清楚哪一回做对了, 哪一回做错了。下一回碰到相似任务, 依旧要从最初开始摸索。
最近, 浙大省部共建协同创新中心开源了一套方案, 其核心目标仅有一个, 那便是使得Agent能够自行积累经验, 能够自行进化。它并非依靠人逐条去教导它, 而是让它从失败之中学习, 从成功里面提炼。这才确是AI从“工具”转变为“伙伴”的关键性一步呀。
三个引擎各司其职
存在着第一道基础, 它是记忆引擎, 其职责是要将每次任务执行所产生的痕迹留存下来, 让有效经验持续沉淀, 使重复内容主动融合, 令过时信息渐渐淡化, 通过如此这般, 智能体便不会在每次时都于同一个坑中跌倒。
第二道是技能运作的引擎, 它专门针对、处理与记忆紧相关联的产物, 当某一具体任务里的某一条特定路径在多次重复尝试后均能成功奏效, 这时它会将这条路径精心提炼, 使之成为一套流程规范、标准统一的流程, 流程中的每一步都带有专门的检查点, 并且在流程的末尾还额外附上了曾出现过的失败案例, 这些技能既能够通过自动生成的方式产生, 也能够经由人工进行编写创作, 它们遵循同一套体系, 进入库中实施管理。
第三道有的是编排引擎, 复杂任务一般常常需要多个技能相互配合起来, 当某一种协作模式经过多次验证是有效的, 编排引擎就会将整套组合给固化成默认打法, 下次碰到同类任务, 智能体不用再次重新去规划, 直接带着完整装备上场。
经验如何变成实战能力
由浙大团队所进行的是一个对照实验, 此项实验安排让他们所开发的智能体去执行两次任务, 在这两次任务执行过程中, 除了自沉淀开关存在不同之外, 其他的参数全部都是完全一致的, 然而所呈现出来的结果却是天差地别的, 当关闭开关的时候, 该智能体每一次都是进行临时搭建流程的操作, 而当打开开关之后, 它就会自动去检索过往记录, 并且按照既定框架来执行, 最终交付一份结构规范的Word文档。
此实验里最为有意思的是, “产业链调研作业手册”这一技能得以出现。它并非由任何工程师所撰写, 反而是系统从8次同类任务的历史记录之内蒸馏而得的。智能体察觉到大家运用了6种不同的做法, 于是自动提炼出2条反复能够奏效的路径, 进而合并成为三步流程之后。
归因关卡挡住盲目修改
智能体能发生进化, 然而, 由谁来判定究竟应不应该进行更改呢? 这便轮到了归因关卡。三个引擎共同使用同一份执行证据, 由归因模块进行统一判断: 问题究竟是出在记忆方面、技能之上、还是编排流程当中。有时证据同时指向多个模块, 那么就干脆不做变动。
更为关键之处在于, 真实的失败当中存在着一部分根源根本并非处于这三个引擎之处。举例而言, 知识库自身缺少这份资料, 又或者说外部接口在昨天更改了返回结构。在这种情形之下, 强行去修改任何一个环节, 仅仅会污染统计数据, 进而产出永远无法修好的方案。而归因关卡所要做的事情, 便是精确地识别这类状况并且予以驳回。
隔离验证锁住风险
哪怕就算归因模块判定需要进行更改, 新方案也不可能在当下就马上上线。浙江大学为此设计规划了第二道关卡: 那便是隔离回放验证。系统在这种情况下会将同一批历史任务再次重新运行一遍, 仅仅只替换掉其中这一处, 其余所有的资产版本都予以冻结, 之后再对新旧结果展开对比。
要正式生效, 在验证通过之后, 还得需要用户进行确认才行。每一条改动建议, 都得标注来源, 也就是要说明依据了哪几次任务, 以及积累了多少证据。进化控制台全程都能够进行查询, 要是出了问题, 随时都可以回滚, 不会像很多AI系统那样, 改着改着就没办法收回来了。
本体关卡划清行为边界
单靠内部机制是不足够的, 浙江大学给系统设置了一道外部防护栏, 也就是本体关卡。他们将一个行业的核心概念、关系以及硬性约束撰写成机器能够执行的规范, 以此作为三个引擎进化的界限。
如以企业风险领域当作例子, 本体库对六个概念作出了定义, 分别是领域实体、企业主体、风险事件、风险等级、证据来源以及企业风险报告。每一个概念都带有别名以及继承关系, 并且还规定了最小基数, 像风险事件必定得至少拥有一个能够追溯的证据来源。要是没有这些硬性的约束, 智能体便能够一直狂奔直至悬崖边缘。
就本体关卡而言, 它不但能够防止越界行为的发生, 而且还会给出相应的整改路径。假如有某个智能体准备跳过核验这一步骤, 直接去查询风险的话, 系统并非是简单地予以拒绝, 而是会清晰明确地告知: 首先要去查询企业ID, 接着再进行主体的核验, 最后使用同一个ID来查询风险。像这样的设计能够使得规范切实落地, 成为可以执行的指令。
由三个引擎所生成的新记忆, 以及新技能, 还有新打法, 在正式起始运用之先, 同样需要经由本体进行校验。