AI资讯

蚂蚁集团开源百灵多模态大模型,124B参数支持图像视频输入

智能摘要

在训练层面,蚂蚁集团表示,通过原生多模态联合训练,视觉信息的引入对模型的文本能力带来了正向提升。在实际应用测试中,该模型在图片转网页任务中可理解布局与组件关系并生成代码,且能通过渲染结果对比进行自我修正。时,模型可识别界面结构并完成跨工具操作;在医疗报告解读场景中,模型支持跨文档数据整合与风险标识。

面向普通用户及开发者来说,这类技术大多之前都掌握在地少数公司手中, 现在自家的Ling-3.0-flash-VL则被蚂蚁集团直接开源, 使得多模态大模型开始免费开放使用的情况有着格外不少的突变性, 相关的技术使用门槛也被一下子降了下来。

模型基本参数

这款使用MoE混合专家架构的此款模型, 拥有计达124B的总参数量, 单次过程推理仅需激活5.5B参数分量, 其计算效率得到了大幅地提升。图像、文本以及视频这三种输入类别的它原生进行支持, 原就扩展达256K Token的上下文窗口, 可以用来自行处理更长的任务相关序列。

视觉编码器兼容任意分辨率, 无需预裁剪就可处理各种尺寸的图片, 这种设计让模型在实际使用中更加灵活, 用户上传的照片、文档扫描件都能直接被感知别。

视觉反馈机制

蚂蚁集团开源百灵多模态大模型,124B参数支持图像视频输入

引入视觉反馈闭环的模型, 把任务执行变成观察、行动、验证、修正的持续循环, 且模型可以根据执行结果不断调整策略, 该机制显著提升任务完成质量, 毕竟不同于一次性的看图生成。

蚂蚁集团开源百灵多模态大模型,124B参数支持图像视频输入

在医疗报告的解读过程之中, 模型可对照原文反复核实对答信息准确程度。在前端代码的生成场景里头, 它能透过渲染结果发现布局错误偏差, 再自行修正, 减少人工干预所需要花费的成本之类的资金。

训练效果提升

原生多模态联合训练给文本能力带来了正向增益, 在基准测试中该模型相比纯文本版本提升了4分。

蚂蚁集团开源百灵多模态大模型,124B参数支持图像视频输入

这说明视觉信息的引入并非负担, 反而促进了语言模型的理解能力。多模态训练正在成为提升基础能力的新路径。

实际应用表现

在图片转网页任务中, 模型能理解页面布局与组件关系生成代码, 还能借渲染结果对比实施自我修正, 作为GUI代理时, 可识别界面结构并搞定跨工具操作。

蚂蚁集团开源百灵多模态大模型,124B参数支持图像视频输入

医疗报告解读场景下, 模型支持跨文档数据整合与风险标识, 帮助医生更快定位关键信息。这些能力让它在专业领域展现出实用价值。

技术架构设计

语言主干沿用42层混合架构, KDA与Gated MLA按5:1比例交替排列。124B总参数单次推理仅激活5.5B参数, 兼顾性能与效率。

在实时视频对话、多轮视觉交互及长时任务中可维持低延时应答。256K上下文窗口承载长文档与长视频里深层剖析。

开源情况获取

那模型在Ling平台上线了且提供免费体验, 用户能直接在线试用。BF16以及FP8版本已在开源社区平台发布, 开发者可免费下载。

FP4和INT4版本计划于近期推出, 将减低更进一步部署门槛。不同版本精度能满足从科研实验到生产环境的多样化需求。

你认为多模态大模型落地应用的最大障碍是什么? 欢迎在评论区留言交流, 也欢迎点赞分享此文。

相关文章