谷歌DeepMind新出语音模型Gemini 3.8 实时对话更强更优质
智能摘要
官方称它们是谷歌迄今最先进的实时对话模型。然后谷歌放了一个……语音模型。主打规模化和成本效率,对话智能、流畅度和视觉理解捏在一起,适合大批量铺开。主打高复杂度任务,智能更高,能做多步推理。近实时的视觉输入直接进对话,你不用先截图、再上传、再等它描述一遍。RSI,谷歌今天的回答是一个语音模型。
AI圈刚吵完RSI不久, 谷歌就甩出语音模型了呀, 唔, 这波操作既意外又委实很务实, 它直接精准戳中业内所有人都想不到也没法回避的核心痛点去了, 是这味儿!
语音模型双雄上线
谷歌在一夜之间放出了3.8 Live以及Ultra这两个版本, 重点推打本的是实时具备着的对话能力。
Ultra专注高难度任务,标准版主攻低成本规模化。
RSI泄露风波余波
上周爆出的RSI模型代号引发全网猜测。
官方仅透露内部测试代号,未宣布自动改写权重。
交互延迟彻底解决
模型学会说“我查一下”,边思考边给用户反馈进度。
后台并行处理工具调用,聊天和办事终于不打架。
多语言与视觉融合
支持97种语言对话中自动切换,无需预设语种。
摄像头画面实时接入,指哪问哪,视觉理解零延迟。
跑分实测对比
语音质量榜82.6分居首,办事能力仍有差距。
银行复杂场景仅35.1%,简单对话场景优势明显。
实时Agent界面成型
屏幕不再是人类与AI交互的必经之路。
这种边聊边干的能力,重新定义了人机协作边界。
你觉得语音交互真能取代打字吗,欢迎评论区聊聊你的看法。