谷歌Gemini 3.7 Flash大降价,推理能力猛增,程序员快来薅羊毛
别家都在卷性能,谷歌独树一帜开始打价格战。先看谷歌力推的主要买点:Flash支持可定制思考配置,此后开发者可以自己调节「想多久」,在质量、成本和延迟之间找平衡点。谷歌的算盘很清楚:趁年底前用低价把开发者的项目绑进Gemini生态,等迁移成本够高了再恢复原价。
性能暴涨,价格腰斩
谷歌于近期抛出一记分量极重的举措, 将Gemini 3.7 Flash正式推至市场。依据官方所给出的数据表明, 它在与代码相关任务方面的表现实现了显著的提高, 生产代码质量由34.4%攀升至43.6%, 增长幅度将近27个百分点。长时程软件工程能力也从49%猛增至65.3%, 上涨幅度超过34%。Code Arena Elo获得的分数达到1588, -bench 2.1评测取得了85.8%。
较吸引开发者的那般事物其实是价格, 谷歌直接打出限时半价此种牌, 输入每百万Token所需金额仅为0.75美元, 输出所需金额为3.75美元, 且一直维持至2026年12月31日, 之后才恢复原价1.50美元以及7.50美元, 这般算盘打得颇为明白, 在年底之前凭借低价将项目捆绑进谷歌生态, 待迁移成本提升之后再来涨价。
编码能力的真实提升
就在此次, 3.7 Flash最为突出的卖点便是编码能力, 于调试工作, 以及问题解决这类需求深度推理的任务当中, 它相较于3.6版本呈现出了显著的进步, 开发者给予反馈, 借助更少的提示词便能够生成更为完善的网页布局以及应用结构, 而且在完成真实业务工作流之际, 其准确率与推理能力均提升到了一个新的层次。
然而, 也有网友表明, 于部分软件工程基准测试里, 3.7 Flash的表现仅仅是处于中规中矩的状态。甚至有人持有这样的看法, 在性价比这一方面, 还比不上竞品。毕竟, Flash的定位乃是轻量级产品线, 真正的高端竞争较量是在Pro和Ultra级别, 而那里才是和GPT进行正面对抗的主要战场所在。
可定制思考和多模态加持
3.7 Flash增添了一项实用功能, 开发者能够自行调控模型的「思考时间」。这表明能够在质量、成本以及延迟之间寻觅到最契合自己的平衡点。对于需要快速响应的情景而言, 可以降低思考深度, 而在追求高精度的任务下, 则能够放宽预算以换得更佳的输出。
于多模态范畴之中, 其涵盖了文本, 与图像, 以及音频, 还有视频这四种输入形式, 上下文窗口扩展至1上百万Token, 单次输出上限为64K Token。当下已然上线App, 以及AI平台, 乃至API接口, 知识库截至2026年3月。
知识截止的隐忧
截止到今年3月的知识, 表明模型对过去五个月所发生之事丝毫不知, 这对于时效性要求偏高的应用场景而言是显著的短板, 并且谷歌官方也认可, 幻觉问题依旧存在, 输出内容得靠人工进行复查。
不少用户已然反馈, 于部分专业领域的问答当中, 3.7 Flash会给出貌似合理实则错误的答案。就编程方面的任务而言, 该问题相对在可控范围之内, 原因在于代码自身能够借助运行去验证其正确性。然而在其他那些需要事实精准性的场景之下, 这一情况是值得予以警惕的。
3.5 Pro被放弃,Flagship推迟
据说谷歌把3.5 Pro项目给搁置了, 好多团队都在全力以赴地打造下一代旗舰模型。在业内, 这被看作是谷歌最后的一次机会, 要是再落后的话, 有可能在高端市场完全失去竞争力。
存在消息表明, 作为联合创始人的布林, 其年龄为52岁, 在最近几个月里, 多次去催促AI团队要加快速度。在4月举行的全员大会上, 他明确地提出要求, 要加快进展的程度,随后公司针对旗舰版作出了重大的领导层方面的调整, 原本确定的发布时间, 因为性能没有达到标准, 而被推迟了两个月。
布林亲自下场督战
经知晓情况之人透露, 布林正朝着核心团队不断灌输这样一个理念: 乃是务必追赶, 一定要迎头赶上人工智能前沿。他特别着重推举「递归式自我改进」这一方向, 满心期望模型能够拥有自主进化的能力, 从而削减对于人工干预的依赖程度。
今年8月初的时候, Demis退到幕后去了, 副手Koray接手了更多的管理职责, 与此同时, 旗舰版的两位技术联合负责人离开公司去创业, 公司还将部分非技术团队从AI部门转移到企业体系, 释放出明显的战略聚焦信号。
你认为谷歌打出的这步以低价为特点的牌, 能够在年底之前稳住开发者吗, 欢迎在评论区留下你的看法。