AI资讯

阶跃Step5Preview全量开放!稀疏MoE架构,兼顾能力效率成本

智能摘要

Opus5的八分之一——同一笔预算换更强智能,或者同等能力以更低价格落地,两条路它都给铺了。StepCodeBench,覆盖553个独立代码仓库、9类任务、20个应用领域和33种编程语言。修复、功能开发、重构、环境配置这类真实活儿都能接。

600B的总参数规模, 每次只激活27B的算力, 单任务成本仅为Opus5模型价格的八分之一。阶跃今天正式全面开放了他们的新一代旗舰基础模型, 这一举动直接把模型的智能水平以及使用成本都向前推动了好大一个台阶, 让这两个方面都得到了非常明显的进步。

稀疏MoE把帕累托前沿往外推

这次阶跃采用的是一种稀疏的Moe架构, 参数的总数量是600B, 在进行推理的时候每次只激活27B部分。系统原生就支持100万Token的上下文长度, 能够直接处理文本和视觉两种类型的输入数据。在Index评测里面拿到了44分, 排名进入了全球开源模型的前三名。

过去在发展大模型领域的时候, 如果想让能力变强, 那么就需要多地投入资金来烧钱, 但如果想要节省成本的话, 就不得不降低性能表现。

阶跃在这里把这个边界整体向外推移了, 也就是说在预算相同的情况下, 可以获得更强大的智能水平, 而在要求具备同等能力的前提下, 也可以以更加低廉的价格来实现落地应用, 这两条道路同时也都已经铺开通了。

阶跃Step5Preview全量开放!稀疏MoE架构,兼顾能力效率成本

高难度基准上咬住顶级闭源模型

在Last Exam的ALE-CLI、金融投资研究评测, 以及跨领域深度研究评测DRACO上, 阶跃的表现只比GPT或者Opus5差那么一点点。它将其他所有参加评估的开源模型全都远远甩在了后面。这里采用的AA v2是截止到9月19日的最新结果。

这些不是那种虚头巴脑的题目。ALE-CLI考察的是真实的命令行操作。DRACO考察的是跨领域的深度研究能力。这些都是代理任务里真正会遇到实际工作内容。阶跃智能能在这些项目中站稳脚跟, 说明了它不是一个只能跑演示版本的存在。

编程能力覆盖真实工程场景

阶跃自行建立的编程评估体系, 涵盖了553个独立的代码仓库、9类任务、20个应用领域以及33种编程语言。

无论是bug修复这种工作, 还是功能开发这种工作, 亦或是重构这种工作, 或者是环境配置这种实际工作中的需求, 它都能够进行处理。其整体的成功率表现尚可, 在跨场景的稳定性方面, 也能够得到一定程度的认可。

在一场演示活动中, 该软件仔细阅读了关于ESP32的技术开发文档, 进而对一块配备ESP32-S3主控芯片的电路板进行改造工作, 从而使其具备支持蓝牙连接按键以及语音识别输入的新型Vibe键盘功能。

它自主开启通信串口中枢接口、精准调试摄像头设备、截取电子设备界面图片、模拟鼠标操作行为, 并针对于系统反馈的各类报错信息连续修正源代码执行调试任务, 最终一口气耗时三个多小时不间断地完成上述全部操作流程。

阶跃Step5Preview全量开放!稀疏MoE架构,兼顾能力效率成本

24小时长周期任务见真章

第一项这次实验的条件是给了一台运行了24小时的设备, 同时配备了一张H100显卡, 目的是让它从头开始优化MLA这个GPU内核。在这个过程中, 系统自主地修改代码, 然后再去跑内核程序, 并且测试吞吐量的表现。

如果遇到了会导致速度下降的方案, 就会直接放弃, 接着从之前最好的版本继续往上爬升。大概经过了22小时的时间, 最终它把峰值性能提升到了超过Opus5的水平。

第二项同样是24小时, 通过让它在自动化后训练提升Qwen3-30B-A3B的表现。模型自己决定怎么使用标注API。模型自己决定怎么调整数据。最终把准确率从53.3%拉到了60%。这水平跟Opus5持平了。但是更省标注token。

前端视觉和金融是综合能力试金石

这个升级之后, 它的能力变得更强了。它不仅能够编写网页程序, 而且还可以调用相关的工具来创建三维模型。并且它会对这些三维模型进行反复的修改和完善。随后, 它会将这些内容接入到Three.js平台里。这样就能开发出具有交互功能的应用程序以及游戏作品。

除此之外, 它的信息提取能力也非常出色。它甚至可以从一本在1922年出版的《广九铁路旅行指南》中抽取相关信息。利用这些信息, 它能实现行程查询的功能。它还能进行费用计算的工作。它甚至可以做到路线回放的效果。通过这些技术的应用, 可以让小火车沿着百年前的历史线路重新行驶起来。

在金融业务这一块, 阶跃这家公司围绕企业研究这项工作, 专门建立了三项内部评估测试方案。同时呢, 在外部基准方面, 使用了包含220道专家出题以及11543项具体评分标准的内容, 以此来全面覆盖六种不同的投资应用场景。

在上述的测试环节中, 阶跃都给出了相当强劲的测试结果表现。不管是检索核验环节、估值建模环节, 还是生成全程报告这一整套流程下来, 都没有出现任何差错或者失误的情况。

10月15日权重全放可以动手了

从Step3到Step4, 阶跃一直强调的是把算力用得更高效这一点。其思路并不是单纯地去堆叠参数规模。目前全量已经开放, 完整的模型权重会在规定的时间10月15日进行释放操作。这时候开发者可以直接把相关资源拉取下来使用。在后续的日子里它可以作为Agent任务里的日常主力部分来发挥作用。

把成本降到了Opus5的八分之一, 能力却紧紧地咬住了顶级的闭源模型。对于预算有限的团队来说, 用同样的一笔钱, 能够完成以前那些做不到的事情;而对于已经在使用闭源模型的团队来讲, 这也是提供了一个多了一个值得进行对比测试的选项。

请问, 你手头是不是存在那样一个任务, 它因为价格太高而始终无法让人工智能连续不间断地持续运行二十四个小时? 欢迎你把这种情况在评论区进行描述与交流。如果你觉得这个观点对你来说具有实际帮助, 那么就请点击点赞按钮, 并将内容分享给那些同样正在挑选模型版本的同事。

相关文章