阿里云开源Better Harness,智能编程Agent工作流分析与改进工具
是否使用相关能力,以及能力是否支持任务完成。开源方面,该项目采用三层开源体系:评估模型:负责把工程实践转化为可以逐项检查的问题,并约束证据、评分与结论之间的关系。第三层是可运行的工程实现:负责让前两层不只停留在文档和模型中,而是能够在真实项目里重复运行。
开源工具解决Agent工作流痛点
7月29日, 消息传来, 有着阿里云背景的智能体编程平台Qoder, 于其官方公众号发布了一篇博文, 宣称在该平台之上, 开源了一套全新工具, 此工具面向Agent工作流。这套工具被命名为“Qoder Agent Workflow Evaluation”, 专门用以针对Agent工作流的工程实践展开分析以及进行持续改进。它使得工程实践同Loop评估模型产生了连接, 能够适应Code、Codex、Qoder等多种编程平台。
不把配置存在视为能力生效
于功能设计方面, 这套工具不会轻易认定配置在那儿就意味着能力起作用。它会严谨核查Agent是不是切实运用了相关能力, 以及这些能力能不能助力任务达成。每一条评估结果都要有可追查的证据、对用户的影响、修复的范围以及验证的方式, 保证评估过程透明且可信。

三层开源体系层层递进
存在首层为工程实践层, 其覆盖CLI、可观测性、Rules、MCP、Hooks以及自动化等具体场景, 第二层为Agent Work Loop评估模型, 该模型担负把工程实践转化为能够逐项检查的问题, 还要约束证据、评分与结论彼此间关系。接着第三层是可运行的工程实现体, 确保前两层并非仅停留在文档和模型中的状态, 而是能够于真实项目内重复运行。
独立采集三类关键证据

将会有工具独自去采集三类证据, 这三类证据指的是代码变更、Agent日志以及运行结果等, 这些证据并非依靠开发者手动来提供, 而是经由系统自动去进行收集以及验证, 首轮内部评测涵盖了30个真实项目, 其验证了工具在多种种场景之下的有效性以及可靠性。
面向开发者社区的实用价值

对于那些涉及运用Agent来开展编程工作的开发者而言, 这一套开源性质的工具构架起了具备标准化特征的评估方式, 借助这种方式它能助力团队去寻觅Agent工作流程里存在的薄弱之处, 比如说究竟是哪些能力出现了被错误运用或者未被运用的状况, 凭借持续不断地进行改进, 开发者能够促使Agent的稳定性以及任务完成比率得以提升, 进而减少用于调试以及返工的时间。
开源生态推动行业进步

被称作Qoder的这套工具被选择开源, 这表明整个开发者社区都能够参与到改进以及扩展它这一行为当中。该工具那种三层体系的独特设计, 使得它既适宜小团队能够较为快速地实现上手操作, 同时又对大型项目的深度定制予以支持。由于有更多的开发者去贡献实践案例, 所以Agent工作流的评估标准将会逐步地趋向于完善。
对于Agent工作流的评估而言, 你认为究竟是更应当着重于自动化, 还是更应该侧重于人工审核? 欢迎在评论的区域当中分享出你自己的看法, 进行点赞以及转发, 从而让更多的开发者能够见到这个具备实用性质的工具。