8月21日,DeepSeek 在其 API 平台上线了首款多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,开发者把请求里的 model 参数设为 deepseek-v4-flash-vision-exp 即可调用。名字末尾那个 Exp 已经把定位说得很明白:这是一个实验性版本,还不是 V4-Flash 的多模态正式版。
对等这块拼图等了快四个月的人来说,这条消息的分量不亚于又一次「发新模型」。
V4 的最后一块拼图
把时间线铺开看,DeepSeek 这局棋下得很有节奏:
- 4月24日:V4 系列预览版发布并开源;
- 7月31日:V4-Flash 正式版 API 上线公测;
- 8月13日:V4-Pro 正式版与官方 Agent 框架 DeepSeek Harness(dsh)同日落地,如今 GitHub Star 已冲到 17.8 万;
- 8月21日:视觉模型上线。
视觉是最后一块,也是外界等得最久的一块。以至于在官方开放之前,社区已经等不及自己动手,把第三方视觉编码器接到 V4-Flash-0731 上,做出了非官方的「混合视觉」版本(关于 V4 本身和 Harness,可回看《DeepSeek 是什么?国产大模型黑马完全解读》和《DeepSeek 官方 Agent 框架 Harness,5 分钟跑通》)。
「会看」到底带来了什么
按 DeepSeek 官方说法,V4-Flash-Vision-Exp 在纯文本能力(Agent、推理、世界知识)上与 V4-Flash 正式版持平;而在需要视觉理解的 Agent Benchmark 上,相比 V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Claude Opus-4.8(以上均为官方/媒体口径)。
官方公告给了三个能力示例,恰好都是「看图干活」的场景:在 Agent 框架下生成一份面向高净值客户的西藏自驾游定制 PPT;对 DeepSeek Harness 官网做深海黑蓝加玻璃 UI 风格的二次创作;以及做一个黏土怪物风格的动态特效前端 Demo。
这三点背后是同一件事:文本模型再强,也只能「读」和「写」,接不住真实世界里一张截图、一份设计稿、一个待改的网页。视觉补上之后,Agent 才能把眼睛伸进这些任务里。DeepSeek Harness 也在发布前两小时同步新增了对该模型的支持,等于给自家 Agent 框架配上了第一双眼睛。
成本:又是一发「掀桌子」的价格
价格是 DeepSeek 的保留节目。这次视觉模型沿用 V4-Flash 正式版的价格体系,即「价格和 V4-Flash 正式版一致」(财新网口径)。而 V4-Flash 上一次出场,就是把大模型调用成本打到「几亿 token 才几块钱」的级别(见《DeepSeek 又掀桌子了:几亿 token 才几块钱》)。
换句话说:视觉不再是高端模型的专属小灶,它正被拉到和文本模型同一个价位的平民档。这对相册整理、票据识别、截图转代码、设计稿还原这一类「普通人也会遇到」的视觉活儿,意义比跑分更重要。
冷思考:兴奋之前,摆正预期
有三件事值得先按住。
第一,Exp 就是实验版。它明确不是正式发布,稳定性、可用额度、规模的正式供应都还悬着,开发者今天能调,不代表明天可以直接搬上生产线。
第二,「接近 Opus-4.8」是官方在特定 Benchmark 上的口径,实战效果向来众说纷纭——Benchmark 分数和真实项目里的表现,吃的是两套功夫。
第三,对普通用户来说这还早。这是一个面向开发者的 API 模型,不是面向 C 端的新应用。但它真正传递的信号是:国产大模型从文本卷到多模态,补齐「眼睛」的速度比很多人预想的快。会看图、会动手的 AI,离普通人的工具箱又近了一步。
Q: DeepSeek 这次上线的是什么模型?
是 DeepSeek-V4-Flash-Vision-Exp,DeepSeek 首款多模态视觉理解模型,8月21日上线其 API 平台。开发者在请求里把 model 参数设为 deepseek-v4-flash-vision-exp 即可调用。名字里的 Exp 表示这是实验性版本,不是 V4-Flash 的多模态正式版。
Q: 它的「视觉」能力有什么用?
主要用于让 Agent「看图干活」:文字模型只能读写文本,接不住截图、设计稿、网页这类视觉输入。补上视觉后,官方示例包括生成西藏自驾游定制 PPT、对官网做视觉风格的二次创作、做黏土怪物风动态前端 Demo 等。DeepSeek Harness 也已同步支持该模型。
Q: 价格贵吗?
不贵。据财新网报道,视觉模型价格与 V4-Flash 正式版一致。而 V4-Flash 此前就把调用成本打到了「几亿 token 才几块钱」的平民价位,视觉因此也被拉到了和文本同档的低成本区间。
Q: 「接近 Opus-4.8」可信吗?
这是 DeepSeek 官方在视觉理解相关 Agent Benchmark 上的口径,指多模态 Agent 能力已接近 Claude Opus-4.8。Benchmark 分数与真实项目表现是两回事,引用时应标注为官方/媒体口径,实际效果以各自场景的实测为准。
💬 评论