AI资讯

腾讯新出多领域评测套件WorkBuddy Bench,题从真实场景逆向出

智能摘要

四个子集共享同一套任务目录格式,但各自有独立的验证方式,分数因此不能在子集之间直接比,所以腾讯干脆不报套件平均分。评分资产在智能体跑完之后才引入,它全程看不见。

以往在测试 AI 写代码时, 众人都是各自玩各自的, 修复程序错误查看一个榜单, 从事前端工作查看另一个榜单, 生产环境当中的数据还被藏着捂着, 这样的一种割裂情形根本无法反映出真实的能力, 如今腾讯把四块业务拼凑到一块, 推出了一个新的套件, 论文刚刚挂到 arXiv 上, 马上就引来了关注。

拒绝背答案构造

这套基准最具挑战性之处在于防止模型背题, 任务并非源自公开题库, 而是经对真实提交进行逆向工程得来, 改写后成为简短且口语化的请求, 你搜不到相应线索自然无法背答案, 抗污染依靠的是构造方式而非捂住题目。

腾讯新出多领域评测套件WorkBuddy Bench,题从真实场景逆向出

四大领域全覆盖

它跨越四个工作方面, 代码方面、网页方面、办公方面以及安全方面都在其中。规模总计有260项任务组成, 每个子集合单独展开验证。代码类别查看隐藏测试的通过概率, 网页类别借助智能体开展评判。办公类别侧重规则进行检查, 安全类别运用确定性脚本来执行三次并求取平均值。分数不能够对跨过子集合去进行比对, 从而致使不报总体分数。

隔离与角色扮演

任务构建的时候, 全程都不会去触碰用户数据, 它是在隔离容器当中运行的。模型针对五种角色进行了设定, 比如说开发者或者产品经理。其故意将信息写得不够充分, 并不会告知目标文件。智能体需要依靠自身去找回上下文。评分资产是在跑完之后才引入的, 自始至终都看不见。把联网搜索关掉, 以此来验证抗污染的效果。

榜单显示巨头优势

在众多表现之中, Opus4·8处于排行榜里, 呈现出极为强劲的态势, 从而获取了五个位居首位的成绩。GLM – 5·2于部分的榜单之上, 成功占据了最高位置, GPT – 5·5同样也收获了冠军荣誉, 框架的敏感性程度不可小觑, 安全子集的排名出现了幅度颇大的变动。GPT – 5·5输出的数量较少, 然而分数却颇高, 而 – V4 – Pro在代码方面运行时显得颇为吃力。不同的模型在各个领域所具备的优势与劣势清晰明了。

团队承认存在局限

论文是由腾讯好几家实验室共同努力完成的, 团队坦率承认代码子集主要是以Java为主, 跨语言的情况比较少, 开源发布有可能会带来爬取方面的风险, 需要依靠版本管理来进行缓解, 评判器偏差目前还没有被量化, 办公类暂时没有OCR支持, 近期的计划是校准网页评分, 扩充公开榜单, 让门打开得更加开阔。

以你的看法而言, 这般具备防止作弊功能的评测形式, 真的能够挑选出好用的人工智能编码助手吗? 欢迎留下话语展开探讨。

相关文章