DeepSeek终于长出眼睛,但它看的不只是照片

2026年8月21日 · 阅读时间约6分钟
文|犀牛伯爵

8月21日下午三点多,DeepSeek的API文档里悄悄多了个名字。

没有发布会,没有直播,没有梁文锋站台。

deepseek-v4-flash-vision-exp,就这么出现在了模型列表里。一个"Exp"后缀,在告诉所有人别急,先试试。

但这件"悄悄"的事,恰恰是DeepSeek这半年最大的转折点。它终于长出眼睛了。

社区等不及,自己先给DeepSeek"装眼睛"

说起来你可能不信,过去半年,DeepSeek一直是国内最受关注的AI公司之一,但它的模型有个尴尬的短板,只能处理文字。

你可以跟它聊天、写代码、做推理,但给它发张截图,它会直接报错,MODEL_DOES_NOT_SUPPORT_IMAGES。

这个报错信息,过去一周在DeepSeek Harness的GitHub讨论区里反复出现。8月14日,DeepSeek开源了Agent框架Harness,让模型可以调用终端、文件、代码和外部工具。框架很强大,但开发者很快发现一个实际问题,Agent连图都看不了,怎么操作界面?

社区等不及了。有人开始在DeepSeek前面接一个Qwen-VL,先把图片转成文字描述,再交给DeepSeek推理。有人写了vision bridge插件,让图片先保存到工作区,再由视觉插件读取。GitHub上甚至出现了专门的项目dsh-deepseek-vision。

一个发布了Agent框架的公司,自己的模型却看不了图,得借别人家的眼睛。这事儿怎么说呢,有点离谱。

8月21日下午,这个尴尬终于结束了。

不是Pro版,是Flash版

这里有个细节很多人可能没注意。

DeepSeek给加视觉能力的,不是旗舰版V4-Pro,而是Flash版。

V4-Pro总参数1.6万亿,激活490亿,是DeepSeek的旗舰。V4-Flash总参数284亿,激活13亿,定位是高吞吐、低成本。按常理,新能力应该先上旗舰,再下放。

DeepSeek反着来。

我觉得这个选择不是随便做的。你想,Agent在真实工作流中需要看的是什么?是截图、界面、报错信息、表格、设计稿。这些任务要的不是"看一张图看得多精细",而是"看得够快、够便宜、能连续运行"。

一个Agent执行任务,可能需要在一分钟内连续看十几张截图。如果每次看图都要调用最贵的模型,这个Agent就没人用得起。

Flash的定位恰好匹配这个场景。13B激活参数,推理快,成本低。给它加上眼睛,Agent就能在执行任务时自己看路。

DeepSeek官方说,V4-Flash-Vision-Exp在多模态Agent基准测试中相比V4-Flash"大幅跃升",整体表现接近Anthropic的Opus-4.8。注意,是"接近",不是"超越"。但定价跟V4-Flash完全一样。

每张图最高折算384个token,跟文字一起计费。缓存命中时,百万token输入只要0.05元。

0.05元

这个价格摆在这,用DeepSeek看一千张截图,可能花不了几毛钱。

计费项 空闲时段 高峰时段(9-12, 14-18点)
缓存命中输入 0.05元/百万token 0.10元/百万token
缓存未命中输入 1.5元/百万token 3元/百万token
输出 4.5元/百万token 9元/百万token
图片计费 每张最高384 token,按V4-Flash价格计费
Files API 免费(单文件最大64MiB,最多10000个文件)
数据来源:DeepSeek API官方文档,2026年8月21日

这不是一个模型,是一套系统

如果你只看"DeepSeek出了视觉模型"这件事,可能会觉得这不就是个常规更新吗。

但把时间线拉长看,完全不是那么回事。

2026年4月
发布V4预览版(V4-Pro和V4-Flash),纯文本模型,支持1M上下文
8月13日
V4-Pro正式版上线,Agent能力大幅增强,Terminal Bench 2.1达87.9
8月14日
开源Harness Agent框架,支持终端、文件、代码、外部工具调用
8月21日
V4-Flash-Vision-Exp上线 + Files API开放,视觉能力补齐

Harness解决的是"手"的问题,让Agent能操作工具。Files API解决的是"记忆"的问题,让图片可以存储和复用。Vision解决的是"眼睛"的问题,让Agent能看懂视觉信息。

手、记忆、眼睛。三个东西凑齐了。

这不是在做一个模型更新,是在搭一套完整的Agent系统。每一步都精准地补上了前一步留下的缺口。

你可能会说,这不算什么,GPT-5.6和Gemini早就有视觉能力了。

但有个区别。GPT-5.6的视觉是给聊天用的,你能给它发张照片问"这是什么"。DeepSeek的视觉是给Agent用的,它看截图是为了操作界面,看报错是为了修代码,看表格是为了分析数据。

DeepSeek此次上线deepseek-v4-flash-vision-exp,并没有单独强调图像生成或视觉娱乐能力,而是将重点放在多模态Agent场景。

凤凰网·爱范儿,2026年8月21日

这就像给一个工人配眼镜,不是为了让他看风景,是为了让他看图纸。

这一周,中国AI打了三枪

把视角再拉远一点。

过去72小时,中国三家头部AI公司,分别在不同方向完成了突破。

公司 发布日期 产品 核心突破
智谱 8月19日 GLM-5.3 AA智能指数60分,与Claude Fable 5、GPT-5.6 Sol并列,开源第一。编程能力+50%
阿里 8月20日 Qwen-UI-Agent 真机MobileWorld-Real成功率92.2%,超越GPT-5.6 Sol和Claude Opus 4.8
DeepSeek 8月21日 V4-Flash-Vision-Exp 视觉能力补齐,Agent感知层到位,定价不涨
数据来源:智谱官方公告、阿里技术报告、DeepSeek API文档

8月19日,智谱发布GLM-5.3。在Artificial Analysis智能指数中拿到60分,跟Claude Fable 5、GPT-5.6 Sol并列,开源模型第一。编程能力暴涨50%,还顺手挖出了2436个安全漏洞,最老的可以追溯到1981年。总参数7430亿,但单任务成本是旗舰模型中最低。

8月20日,阿里发布Qwen-UI-Agent。100多台真实手机训练出来的GUI智能体,在真机评测集MobileWorld-Real上拿到92.2%成功率,把GPT-5.6 Sol和Claude Opus 4.8甩在身后。主力版本只有27B参数,做到了别家旗舰做不到的事。

阿里Qwen-UI-Agent在真实手机上执行GUI操作的演示动画
阿里Qwen-UI-Agent真机操作演示,图源:36氪

8月21日,DeepSeek上线V4-Flash-Vision-Exp。视觉能力补齐,Agent感知层到位。

三天,三家公司,三个方向。

智谱往深了挖,把编程和安全能力推到开源天花板。阿里往广了铺,让AI真正能操作手机和电脑上的每一块屏幕。DeepSeek往底层补,给Agent框架配上眼睛。

这不是"中国AI追上了"的故事。这是中国AI开始分化的故事。

三家公司不再追同一个方向、卷同一个benchmark。智谱不跟阿里比GUI,阿里不跟DeepSeek比价格,DeepSeek不跟智谱比编程。每家都在自己认为重要的方向上深挖。

这比"追上GPT-5.6"重要得多。

Exp意味着什么

最后说说那个"Exp"后缀。

DeepSeek不是第一次用实验版探路。2025年9月,他们推出V3.2-Exp,用实验版本验证了DSA稀疏注意力机制。两个月后升级到V3.2正式版。DeepSeek后来明确说,实验版获得了大量社区对比测试结果,这些反馈帮助验证了新架构。

V4-Flash-Vision-Exp很可能走同样的路。先把模型交给开发者,在真实图片和Agent工作流中找问题,再决定正式版怎么做。

腾讯新闻的报道里提到一个有意思的细节。Vision Exp最初接收image_url时还会返回expected 'text',随后官方模型表和视觉接口才陆续更新。这说明视觉能力和V4-Flash现有API体系之间经历了明显的适配过程。

还有个值得关注的技术问题。DeepSeek此前已经有一条独立的DeepSeek-OCR产品线。Vision Exp到底是原生多模态模型,还是把视觉编码模块接到了V4-Flash前面?目前DeepSeek没有公布模型结构、训练方式或视觉编码器信息。

但说实话,对开发者来说,这个区别可能没那么重要。重要的是,能看图了,价格没涨,Harness原生支持,Files API免费。

接下来的看点不是"DeepSeek看图能不能跟GPT-5.6比",而是视觉+Harness+Files API组合在一起,Agent能做什么以前做不了的事。

一个能看截图、能读文件、能操作终端、还能记住看过的图片的Agent,跟一个只能处理文字的Agent,完全是两个物种。

落点

回到开头那个问题。DeepSeek终于长出眼睛了,但它看的不只是照片。

它看的是截图里的报错信息,是界面上的按钮位置,是表格里的数据排列,是设计稿的布局结构。这些东西,是Agent从"能聊天"走向"能干活"必须看懂的。

本周中国AI的三连击,与其说是在跟硅谷竞争,不如说是在各自搭建Agent时代的不同基础设施。智谱搭的是大脑的深度,阿里搭的是双手的灵活,DeepSeek搭的是眼睛和记忆。

三条路,最后可能汇到同一个终点,也可能各自走出不同的风景。

但有一点是确定的。中国AI不再只是追着别人的路线跑了。

谢谢你看我的文章。

信息来源:DeepSeek API官方文档、凤凰网·爱范儿、腾讯科技、IT之家、36氪·智东西、环球网、AI HOT、runtimewire