8月21日下午三点多,DeepSeek的API文档里悄悄多了个名字。
没有发布会,没有直播,没有梁文锋站台。
deepseek-v4-flash-vision-exp,就这么出现在了模型列表里。一个"Exp"后缀,在告诉所有人别急,先试试。
但这件"悄悄"的事,恰恰是DeepSeek这半年最大的转折点。它终于长出眼睛了。
说起来你可能不信,过去半年,DeepSeek一直是国内最受关注的AI公司之一,但它的模型有个尴尬的短板,只能处理文字。
你可以跟它聊天、写代码、做推理,但给它发张截图,它会直接报错,MODEL_DOES_NOT_SUPPORT_IMAGES。
这个报错信息,过去一周在DeepSeek Harness的GitHub讨论区里反复出现。8月14日,DeepSeek开源了Agent框架Harness,让模型可以调用终端、文件、代码和外部工具。框架很强大,但开发者很快发现一个实际问题,Agent连图都看不了,怎么操作界面?
社区等不及了。有人开始在DeepSeek前面接一个Qwen-VL,先把图片转成文字描述,再交给DeepSeek推理。有人写了vision bridge插件,让图片先保存到工作区,再由视觉插件读取。GitHub上甚至出现了专门的项目dsh-deepseek-vision。
一个发布了Agent框架的公司,自己的模型却看不了图,得借别人家的眼睛。这事儿怎么说呢,有点离谱。
8月21日下午,这个尴尬终于结束了。
这里有个细节很多人可能没注意。
DeepSeek给加视觉能力的,不是旗舰版V4-Pro,而是Flash版。
V4-Pro总参数1.6万亿,激活490亿,是DeepSeek的旗舰。V4-Flash总参数284亿,激活13亿,定位是高吞吐、低成本。按常理,新能力应该先上旗舰,再下放。
DeepSeek反着来。
我觉得这个选择不是随便做的。你想,Agent在真实工作流中需要看的是什么?是截图、界面、报错信息、表格、设计稿。这些任务要的不是"看一张图看得多精细",而是"看得够快、够便宜、能连续运行"。
一个Agent执行任务,可能需要在一分钟内连续看十几张截图。如果每次看图都要调用最贵的模型,这个Agent就没人用得起。
Flash的定位恰好匹配这个场景。13B激活参数,推理快,成本低。给它加上眼睛,Agent就能在执行任务时自己看路。
DeepSeek官方说,V4-Flash-Vision-Exp在多模态Agent基准测试中相比V4-Flash"大幅跃升",整体表现接近Anthropic的Opus-4.8。注意,是"接近",不是"超越"。但定价跟V4-Flash完全一样。
每张图最高折算384个token,跟文字一起计费。缓存命中时,百万token输入只要0.05元。
0.05元
这个价格摆在这,用DeepSeek看一千张截图,可能花不了几毛钱。
| 计费项 | 空闲时段 | 高峰时段(9-12, 14-18点) |
|---|---|---|
| 缓存命中输入 | 0.05元/百万token | 0.10元/百万token |
| 缓存未命中输入 | 1.5元/百万token | 3元/百万token |
| 输出 | 4.5元/百万token | 9元/百万token |
| 图片计费 | 每张最高384 token,按V4-Flash价格计费 | |
| Files API | 免费(单文件最大64MiB,最多10000个文件) | |
如果你只看"DeepSeek出了视觉模型"这件事,可能会觉得这不就是个常规更新吗。
但把时间线拉长看,完全不是那么回事。
Harness解决的是"手"的问题,让Agent能操作工具。Files API解决的是"记忆"的问题,让图片可以存储和复用。Vision解决的是"眼睛"的问题,让Agent能看懂视觉信息。
手、记忆、眼睛。三个东西凑齐了。
这不是在做一个模型更新,是在搭一套完整的Agent系统。每一步都精准地补上了前一步留下的缺口。
你可能会说,这不算什么,GPT-5.6和Gemini早就有视觉能力了。
但有个区别。GPT-5.6的视觉是给聊天用的,你能给它发张照片问"这是什么"。DeepSeek的视觉是给Agent用的,它看截图是为了操作界面,看报错是为了修代码,看表格是为了分析数据。
DeepSeek此次上线deepseek-v4-flash-vision-exp,并没有单独强调图像生成或视觉娱乐能力,而是将重点放在多模态Agent场景。
这就像给一个工人配眼镜,不是为了让他看风景,是为了让他看图纸。
把视角再拉远一点。
过去72小时,中国三家头部AI公司,分别在不同方向完成了突破。
| 公司 | 发布日期 | 产品 | 核心突破 |
|---|---|---|---|
| 智谱 | 8月19日 | GLM-5.3 | AA智能指数60分,与Claude Fable 5、GPT-5.6 Sol并列,开源第一。编程能力+50% |
| 阿里 | 8月20日 | Qwen-UI-Agent | 真机MobileWorld-Real成功率92.2%,超越GPT-5.6 Sol和Claude Opus 4.8 |
| DeepSeek | 8月21日 | V4-Flash-Vision-Exp | 视觉能力补齐,Agent感知层到位,定价不涨 |
8月19日,智谱发布GLM-5.3。在Artificial Analysis智能指数中拿到60分,跟Claude Fable 5、GPT-5.6 Sol并列,开源模型第一。编程能力暴涨50%,还顺手挖出了2436个安全漏洞,最老的可以追溯到1981年。总参数7430亿,但单任务成本是旗舰模型中最低。
8月20日,阿里发布Qwen-UI-Agent。100多台真实手机训练出来的GUI智能体,在真机评测集MobileWorld-Real上拿到92.2%成功率,把GPT-5.6 Sol和Claude Opus 4.8甩在身后。主力版本只有27B参数,做到了别家旗舰做不到的事。
8月21日,DeepSeek上线V4-Flash-Vision-Exp。视觉能力补齐,Agent感知层到位。
三天,三家公司,三个方向。
智谱往深了挖,把编程和安全能力推到开源天花板。阿里往广了铺,让AI真正能操作手机和电脑上的每一块屏幕。DeepSeek往底层补,给Agent框架配上眼睛。
这不是"中国AI追上了"的故事。这是中国AI开始分化的故事。
三家公司不再追同一个方向、卷同一个benchmark。智谱不跟阿里比GUI,阿里不跟DeepSeek比价格,DeepSeek不跟智谱比编程。每家都在自己认为重要的方向上深挖。
这比"追上GPT-5.6"重要得多。
最后说说那个"Exp"后缀。
DeepSeek不是第一次用实验版探路。2025年9月,他们推出V3.2-Exp,用实验版本验证了DSA稀疏注意力机制。两个月后升级到V3.2正式版。DeepSeek后来明确说,实验版获得了大量社区对比测试结果,这些反馈帮助验证了新架构。
V4-Flash-Vision-Exp很可能走同样的路。先把模型交给开发者,在真实图片和Agent工作流中找问题,再决定正式版怎么做。
腾讯新闻的报道里提到一个有意思的细节。Vision Exp最初接收image_url时还会返回expected 'text',随后官方模型表和视觉接口才陆续更新。这说明视觉能力和V4-Flash现有API体系之间经历了明显的适配过程。
还有个值得关注的技术问题。DeepSeek此前已经有一条独立的DeepSeek-OCR产品线。Vision Exp到底是原生多模态模型,还是把视觉编码模块接到了V4-Flash前面?目前DeepSeek没有公布模型结构、训练方式或视觉编码器信息。
但说实话,对开发者来说,这个区别可能没那么重要。重要的是,能看图了,价格没涨,Harness原生支持,Files API免费。
接下来的看点不是"DeepSeek看图能不能跟GPT-5.6比",而是视觉+Harness+Files API组合在一起,Agent能做什么以前做不了的事。
一个能看截图、能读文件、能操作终端、还能记住看过的图片的Agent,跟一个只能处理文字的Agent,完全是两个物种。
回到开头那个问题。DeepSeek终于长出眼睛了,但它看的不只是照片。
它看的是截图里的报错信息,是界面上的按钮位置,是表格里的数据排列,是设计稿的布局结构。这些东西,是Agent从"能聊天"走向"能干活"必须看懂的。
本周中国AI的三连击,与其说是在跟硅谷竞争,不如说是在各自搭建Agent时代的不同基础设施。智谱搭的是大脑的深度,阿里搭的是双手的灵活,DeepSeek搭的是眼睛和记忆。
三条路,最后可能汇到同一个终点,也可能各自走出不同的风景。
但有一点是确定的。中国AI不再只是追着别人的路线跑了。
谢谢你看我的文章。
信息来源:DeepSeek API官方文档、凤凰网·爱范儿、腾讯科技、IT之家、36氪·智东西、环球网、AI HOT、runtimewire