腾讯合并多模态和大语言模型部门,全力冲刺全模态智能上限
腾讯混元合二为一:多模态与大语言模型部门合并,姚顺雨统管冲全模态上限此举旨在提升研发与协同效率,全力冲刺全模态模型的智能上限。整合早有伏笔,去年12月姚顺雨已接管大语言模型团队,如今双边归一,意味着腾讯集中资源推动多模态与语言深度融合,加速构建新一代统一基础模型,向全模态智能更高峰迈进。
合并背后的战略意图
7月23日, 腾讯宣布, 混元多模态模型部门, 与大语言模型部门将合并且组建新的基础模型部, 此动作看似突兀, 实际上早有规划之安排, 去年 12 月, 姚顺雨已接管大语言模型团队, 如今两边正式归为一体, 这表明腾讯在AI赛道上开始汇聚力量。
此次合并并非单纯的人事方面的调整, 而是旨在提升研发以及协同效率, 以往多模态和语言模型是分开进行研发的, 这容易致使资源出现重复投入, 如今实施统一管理, 能够避免内耗现象, 从而使技术团队更加聚焦。
姚顺雨的角色升级
担任腾讯首席AI科学家的姚顺雨, 当下把整个基础模型部进行统管。他此前于多模态领域拥有深厚积累, 在去年接手大语言模型团队后, 已为合并做好了伏笔铺垫。此次正式获得任命, 表明他成了腾讯AI技术路线的总策划者。
由姚顺雨负责的任务清晰明朗, 那便是统筹率领团队全力冲击全模态模型展现出的智能高度顶点, 全模态所蕴含的意义表明该模型需要同步处理文本、图像、音频以及视频等诸多不同类型的信息, 这种情况对于技术系统所具备的架构以及运行算法时所需的能力而言, 均构成了规模巨大的挑战, 而腾讯公司做出选择让他全面管理的决定, 所看重考量的也正是他所拥有的跨越多个相异专长或知识领域的经验。
多模态与语言深度融合
以往, 多模态模型、大语言模型彼此各自为战, 多模态着重在图像、以及视频的理解层面, 大语言模型单单专注那文本的生成方面。如今, 进行了合并之后, 这两者需要在深度上予以融合。像是, 有一个模型, 它不但能够看懂图片, 而且还能够运用自然语言去描述图片的内容, 除此之外, 它还能够依据所描述内容生成全新的图片。
这种融合具备相当的价值在应用场景方面, 于腾讯的诸多业务里诸如广告、游戏、社交等, 用户时常要一并处理好多不同种类的信息, 存在着一个统一的基础形态的模型, 它能够更高效地为这些业有关领域的诸多需求加以支撑住, 还可以削减掉重叠再去开发从而需付出的成本。
研发效率的提升路径
合并之后, 研发团队能够共享底层技术架构以及训练数据, 以往两个部门各自维护一套训练框架, 当下统一之后, 算力资源能够更为灵活地进行分配, 举例来说, 大语言模型的训练经验能够直接应用于多模态任务之上, 反过来也是如此。
听闻有来自腾讯的内部人士透露, 整合过后的团队规模已然超出了300人, 并且集中办公地点在深圳以及北京这两个地方。这种集中式的管理模式使得沟通成本得以减少, 进而技术决策能够更加快速地实现落地。预计从立项开始一直到原型验证的这个周期, 是能够缩短超过30%的。
全模态模型的行业竞争
现如今, AI行业之中竞争极为激烈, OpenAI所拥有的GPT – 4o已然达成了多模态的能力, 谷歌的Gemini同样是朝着全模态的方向投入力量。腾讯此次进行合并, 显著地是要去追赶行业的第一梯队。姚顺雨于内部会议之上着重表明, 全模态乃是下一代AI的至关重要的突破口。
腾讯具备的优势是有着海量的用户数据以及丰富的应用场景, 微信、QQ、腾讯视频等产品每日产生大量的多模态数据, 这些数据能够被用于模型训练, 同时, 游戏与广告业务对于全模态模型存在直接需求, 能够快速地验证技术成果。
对腾讯业务的实际影响
腾讯内部业务会被合并后的基础模型部优先服务, 像在微信里, 未来或许能达成图片搜索、视频理解以及语音交互的深度融合, 于腾讯游戏中, AI能够同时领会玩家语音指令与游戏画面, 进而提供更为智能的交互体验。
重点受益的领域当中也涵盖着广告业务, 全模态模型能够更为精准地去理解诸多广告素材, 像是对图片内容以及文字描述同时展开分析, 凭借这样实现广告投放效果的提升, 腾讯在二零二三年时广告收入就已经超过了一千亿元, 经过AI优化以后有希望带来明显的增长。
你觉得腾讯的此次合并能不能协助它于全模态 AI 领域追上 OpenAI 呀 , 欢迎于评论区那儿分享你的观点呐 , 点赞以及转发进而使更多人加入到讨论当中啊。