DeepSeek新增免费多模态,看图能力白送,开发者省钱了
在别家要单独算钱的多模态能力,在DeepSeek这里直接变成了赠品。多模态方面,更是一度干掉了硅谷顶流模型。有了如此强大的能力,对开发者来说,再也不用为看图去接第二个模型了。同一天,Harness跟着发了0.1.1,开箱即支持新模型,适配代码一行不用写。
一张图最多384个token
有着多模态版本之称的V4-Flash–Exp, 是V4-Flash模型, 它最大的特点在于, 将视觉能力当作符合规定统一标准直接放入, 并非跟其他平台那样进行分别收取费用。这表明, 当开发者调用图片理解这项功能的时候, 无需再另外去申请接口, 也不用承担多模态所产生的额外费用了。
更为关键之处在于, 图片的token消耗被限定在384以内封顶。此限制对于高频运用图像识别的Agent应用而言, 等同于给成本施加了紧箍咒, 从此无需再为图片数量增多账单愈发昂贵这类烦恼而忧心。
视觉功能当成免费赠品
曾几何时, 于别的平台之上, 多模态能力常常是单独计价的项目, 需额外进行采购, 或者依照更高档位来付费。然而, V4 – Flash–Exp 将视觉 API 打包进了基础套餐, 且其与纯文本版本的计费标准全然相同。
在代码之中, 开发者能够毫无顾忌地去调用图片识别, 而不会需要再三地去权衡“这一步是否要看图片”。当边际成本渐渐趋向于零之时, 产品设计的思路便发生了全然不同的变化。
Agent能力全面反超
在七项Agent评测里头, V4 – Flash–Exp有六项逾越了V4 – Flash – 0731版本, 纯属文本任务因增添了视觉预训练情形, 反倒获取了正向加成, 模型的整体推理能力得以提升。
多模态领域的呈现更是超乎预料, 于多个国际横向测评当中战胜了硅谷头部企业的模型。这表明国内开发者运用此模型之后, 在智能化任务方面的竞争力能够获得显著增强。
网站截图复刻演示
团队用以一张官网截图针对V4-Flash–Exp去做1:1复刻, 要输出能够直接运行的单文件HTML, 存在要求为内联所有CSS以及JS, 且不能运用外部依赖, 模型要对之作逐块解析布局结构, 还要推测字体族, 并且提取主色hex值, 进而还原间距节奏, 最后把交互细节翻译成代码。
最末生成的页面于视觉效果层面和原始截图高度一致契合, 往375px窄屏进行响应式适配时业维持稳定状态。此项任务并非单纯“认出图中存在什么”, 而是得将视觉信息转译为结构化代码, 对于模型的综合能力所需程度颇为高。
B端合作PPT也能生成
又有一道测试题, 是要让模型去制作用于精品咖啡烘焙工坊的面向B端的合作PPT, 其要求是要明确品牌所具有的独特调性, 明确内容的具体结构, 明确视觉风格, 不能包含相关行业里所特有的黑话, 所配的图片要能够体现出烘焙车间的情形以及生豆所具有的那种质感, 并且还要给出三档真实的供货方案。
模型输出了一份共计11页的完整提案, 所有核心信息要点尽皆覆盖, 分寸拿捏精准无误, 不存在一句写给外行看的多余话语。模糊的指令能够产出可直接发送给客户的成品, 这表明模型对于商业场景的理解已然达到可切实应用的级别。
成本对比差距惊人
官方视觉 API 横评得出的数据表明, 针对同样一张 1024×1024 的图片进行处理时, 某一款模型会吃掉 1334 个 token, 若处理一千张图则收费 4 美元;另外一款有着不同表现的模型, 消耗的 token 数量为 765 个, 收费是 1.9 美元;还有第三款模型会消耗 258 个 token, 收费 0.5 美元, 而折合人民币后, 最贵的那一档近乎 29 元。
V4 – Flash — Exp的封顶数量是384个token, 其输入价格是每百万token仅为3元, 在低谷时段还会再打五折。同样是一千张图, 成本是1.15元, 而在谷时成本不到0.6元。29元和1.15元之间相差25倍, 在谷时两者的差距超过50倍, 这样的定价直接改变了产品设计的逻辑。