AI资讯

Anthropic公开最新研发自动化底牌 Claude主导近三成AI研发工作

智能摘要

研发自动化的底牌。从事研究和工程工作,它们拥有独立于底层模型升级的身份标识,通过共享消息系统互相委派任务、交叉纠错。研究员,最薄弱的环节仍是决定做什么——任务超过4小时就需要人类频繁介入。规模、算力投入占比和安全监控覆盖率都被公开,透明度本身就变成了无声的竞争压力,不跟进就可能被当成有意遮掩。

在当地时间9月17日这一天, 有一家属于头部梯队的科技企业, 他们这一次首次公开了自己的内部AI研发自动化核心的量化数据, 这个动作直接把此前一直还停留在概念层面的递归自我改进进程, 一下子推到了整个行业所关注的聚光灯下面。

核心研发自动化进度披露

阶段性覆盖比例数据

时间已经到了二零二六年八月, 这时候,这家公司的相关人工智能系统已经在内部主导了百分之二十六的人工智能研发工作, 可是, 在二零二六年二月, 那个占比甚至都不足百分之一, 再来说说情况, 现在, 在内部的那个平台上面, 任意的一时刻, 大概都会有三万个由人工智能代理构成的智能体处于运行的状态, 并且, 在八月份的单月期间内, 所生产出来的决策次数是超过了十亿次的。

这一组增长速度非常快的数值, 打破了外界长期以来形成的一种固定想法, 也就是认为人工智能的研发自动化工作现在还处在试验的那个阶段, 这件事变成了一个非常重要的标志, 这个标志显示递归式自我改良的方法已经从书本上的理论概念, 转化成了实际的工程操作手段。

六级框架下的当前等级分布

这家企业用了独立AI研究机构Epoch AI搞出来的那个六级自动化框架, 把AI参与的程度分成了从AL0到AL5一共六个层级, 这当中AL0是完全没有AI参与, AL5就是完全靠自主研发。

到了2026年8月的时候, 有26%的AI研发工作已经达到了AL4这个等级。在这个时候, 人类只需要给出高层级别的目标就行了, AI就能自己去完成端到端的大部分工作。

人员主要负责的事情, 就是去做监督检查, 以及做最后的拍板决定。另外, 还有超过90%的研发工作, 至少在AI协作等级这个方面, 达到了AL3的水平。

真实落地的应用场景

夜间故障自主处理流程

在夜间数据管道发生突发性故障以后, 工程师仅仅需要把故障报告上传到AI系统里面去, 然后下达修复指令, AI就能自主地按照完整流程进行处理, 它会去自动查看系统日志, 进而定位故障根源, 编写对应的修复代码并完成测试工作, 在处理过程中即便遇到新出现问题的时候, 它也能够自己调整方案。

后续的AI会再次去运行数据管道, 它会去对比一下在修复之前和修复之后的那些输出结果到底有什么不一样的地方, 到了最后就会生成一个完整的、关于故障处理的说明文档, 这样做的结果是整个过程都不需要工程师一直都在旁边全程跟着进行操作。

明确划定的能力边界

该企业对外明确说明, 目前所有纳入监测范围的人工智能研发工作, 没有任何一项能够达到AL5的完全自主水平。在研发方向把控和核心风险决策方面, 人类依然牢牢掌握着最终权限。

这一种表态, 把外界在此之前对人工智能完全脱离人类掌控, 自己进行独立研发的担心, 给消除了。现在的自动化技术, 依然还是在人类定下的框架内部运行着。

内部Agent集群运行现状

集群基础运行规模

到现在的时间点, 也就是到了2026年8月的时候, 这个企业的内部情况是这样的, 里面大概有3万个AI Agent在那里工作, 这些AI Agent主要做的事情就是研究和工程的方面的事务, 它们每一个都有一个独属于自己的身份标识, 这个身份标识跟底下的那些模型升级的过程没有关系, 是完全分开的, 它们之间有一个可以共享的消息系统, 在这个系统里, 它们可以把任务派给自己的人去干, 还可以互相看一下对方输出的结果, 以此来检查有没有错误, 如果发现错了就改正过来。

这种分布式协作的模式。它让多任务并行处理的效率得到了大幅度的提升。同时呢。研发自动化的覆盖范围也快速地进行了扩张。

全流程安全监控机制

所有属于 AI Agent 的动作, 必须在执行之前经历在线安全监控这一环节, 根据二零二六年八月超过十亿次的决策数据统计出来, 大概只有百分之零点零零二的违规操作会被系统直接拦下来予以阻止, 另外关于离线监控这部分内容会在每周的时间里大致标记出十万条对话记录来, 这些记录在经过分类器帮忙过滤掉一些误报情况以及进行初步的检查筛选之后, 里面优先级排得最高的那些数量大概在五十条左右的记录会提升级别送到人工那里去进行审查处理。

这套监控体系具有多层级的结构, 在保障运行效率的同时, 把AI自主运行的风险控制在可接受的范围内。

算力资源分配细节

安全研究算力占比

在2026年7月进行的样本统计周期内, 这家公司的大约百分之六的面向人工智能的研发算力资源, 被分配到了安全研究的环节当中。倘若只把那些由人工智能技术直接推动的研发相关的计算力算作基数, 那么上述的这个比例数字, 就会攀升到大约百分之十二的水平。

这一数据体现出了该企业在推进研发自动化的过程当中。同时也体现出该企业对人工智能安全问题的重视程度之高。这种重视程度是远超普通研发项目的。

边界模糊的客观说明

该企业自己也公开承认,因为AI协作和AI主导之间的那个界限多少有点主观, 所以各个不同的团队在判定的时候可能会有一点点差别。如果想要把不同实验室的数据拿来比较, 那就必须要有一套统一的评估方法, 还得靠专业的第三方机构来验证一下, 只有这样才算是公平的。

因为这种公开透明的说法, 所以就让外面的人没法把那个数据进行绝对化的错误理解。

全行业相关跟进动态

国内厂商落地进展

智谱公司的创始人员唐杰在近期对外披露了相关信息, 他指出GLM-5.3-Flash这个模型版本仅仅花费了两周的时间, 就完成了对国产加速器的全面部署工作。在这过程中, 绝大多数的部署任务都是由被称为Infra Agent的这个智能体来完成的, 而这个智能体是由GLM-5.3来进行驱动的。

他对此作出了自己的判断, 认为要达到那种完全的递归自我改进的状态还是距离非常遥远的。不过他也认为, 目前模型优化的那个系统已经开始运转起来, 并且形成了由系统进行反哺模型的这种正向循环机制。

这一进展同时也做出了一个说明, 也就是国内的那些厂商们, 在人工智能研发自动化的这条赛道上面, 它们的跟随以及追赶的速度, 正在变得越来越快。

海外头部企业布局

谷歌的相关团队在2026年的9月初宣布, 他们达成了关于自动化AI研究实习生的一个阶段性目标。这一阶段性的成果被认定为具有里程碑式的意义。该团队的长远目标是, 要在2028年3月之前实现全面自动化的AI研究员角色。

但是在目前的实际进展中, 最为薄弱的环节依然是负责确定具体任务方向这一过程。一旦某个任务的时长超过了4个小时的时间阈值, 就需要人类进行非常频繁的操作, 以便介入并对相关细节进行调整。

谷歌提出的那种采用进化式编码的智能体所给出的电路方案, 已经被集成到了下一代的TPU产品里面。谷歌的前任首席科学家杰夫·迪恩表示, 这算是最新的案例, 展现了TPU设计正形成一个正向循环。

公开披露背后的深层考量

引导社会参与规则制定

该企业主动公开这些量化数据, 其真实目的。是想趁着人类仍牢牢掌握主导权的那个特定时间窗口。让全社会都能参与到, 关于人工智能自我迭代的节奏与方向的讨论和决策之中来。这么做, 是为了避免技术迭代的过程完全由企业单方面进行主导。从而防止引发那些本来可以避免的社会争议现象。

这种开放的态度, 其实也能够起到一个作用。那就是让公众在面对快速发展起来的AI技术的时候。能减少一点那种陌生的感觉。同时, 也能让大家对这项技术少一些抵触的情绪。

建立行业披露参照基准

一旦研发自动化比例这一指标被公开, Agent运行规模也被纳入其中, 安全算力投入的占比以及安全监控的覆盖率也都晒了出来, 那么透明度本身就直接给行业内施加了一种无声的竞争压力。在后续的时间里, 如果其他企业不跟着把这类似的数据也公开出来, 那么就很容易被外界质疑为是有意隐瞒那些潜在的风险。

这一个办法, 它会把这整个人工智能行业给带动起来, 让这个行业朝着更加清楚、明白的方向去发展,同时也会让这个行业发展得变得更容易掌控, 不容易跑偏。

你就谈一谈, 国内的那些搞人工智能设备的公司, 想把现在对外公开讲的这种自动写代码的水平给追上来, 到底哪一步是最关键、最应该最先解决的。

相关文章