韩国AI实验室发布Solar Pro 4大模型,支持512K长上下文,面向复杂智能体任务
智能体任务的商用大模型。定价方面,援引博文介绍,附上相关信息如下:的主要提升集中在更接近真实工作的评测上,包括长文档、终端任务和多轮工具调用。的门店选址分析作为演示任务。模型评测平台。音乐等多领域进行无偏见的性能与托管成本评估。行业最权威的“人类偏好”大模型即时对战与评测平台。
韩国AI再出大招
全新发布由韩国人工智能实验室执行, 时间是8月13日, 发布的是模型Solar Pro 4。该模型有着明确的定位, 专门致力于复杂的商业智能体种种复杂的特定任务。
当下参数规模并未公开, 然而512K上下文窗口以及128K输出长度已然足以引发关注。这表明单次会话能够加载多份合同, 还能加载报告, 并且能加载大量数据文件。
长文档处理能力强
就 Agent 任务这种状况而言, Solar Pro 4 着重提高了长文档理解以及多轮工具调用的本领, 存在三项核心评测成绩, 之中 Bench v2.1 所获分数是57, 且τ³ –得分获取到的数值是 23 , 再者 AA – LCR 所取得分高达 71。
针对模型接近真实工作场景里的表现, 有若干的指标用以做出反应, 此次升级相较于以往给出的版本, 更为紧密地靠近企业里面实际的应用需求。
咖啡选址演示吸睛
官方拿一个虚构而成的咖啡品牌门店选址相关的这样一个案例来进行能力的展示, 输入涵盖了一份政策方面的文档以及六份市场数据类型的文件。
模型于3条提示词范围以内, 完成了10个候选站点的筛选工作, 并且依照顺序生成了Excel工作簿、审查报告以及幻灯片这三类交付物, 这般端到端的输出能力, 对于商业用户而言极具吸引力。

三大榜单均有排名

Agent Arena的榜单表明, Solar Pro 4排于第44名,它跟OpenAI o3、Claude 3.7 Sonnet等那些有名的模型处在同一个梯队之中。这是韩国实验室的模型, 它是第一个登上Agent Arena、Code Arena以及Text Arena这三大排行榜的。

这成绩源于Arena.ai平台的盲测数据, 此平台运用人类双盲A/B测试形式, 测评结果比较客观可靠。
定价方案未公布
官方所发布的博文当中, 仅仅只是提到了定价方面的信息, 是附在了相关的文档里面的, 然而却并没有直接去披露精确的具体数字。针对于商用模型来讲, 其价格会对企业的采购决策产生直接的影响。
行业内人士所期望的是更为详尽的定价方案以及API调用成本方面的说明, 当下单单能够等待官方进一步地去公开与之相关的信息。
韩国AI追赶势头猛
随着 “Solar Pro 4” 的发布, 这意味着韩国在大模型领域持续投入力量, 在此之前, 韩国团队在多个基准测试当中已经展示了自身具备的竞争力。
此次针对Agent任务所开展的模型专项优化, 表明韩国实验室探寻到了差异化竞争途径。你认为这款模型可不可以在全球市场里稳固立足呢? 欢迎留言予以讨论。