作为国内最知名的AI模型之一,DeepSeek一直是个「偏科生」:在文本推理这块确实强的离谱,但一遇到图片就瞬间拉闸,可以说是让小雷又爱又恨。
但就在8月21日,DeepSeek正式发布多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp,API同日开放,手机端的识图模式也开启了体验。

(图片来源:DeepSeek官方)
根据官方介绍,DeepSeek-V4-Flash-Vision-Exp在Agent、推理、世界知识这些纯文本能力与V4-Flash正式版持平,原本的优势都保留了。它真正变化的是视觉理解:在需要视觉理解的 Agent 基准测试里,新模型相比V4-Flash大幅提升,官方表示是「多模态 Agent 能力已接近 Opus-4.8」。

(图片来源:DeepSeek官方)
官方提供了三个演示案例,其中最显眼莫过于PPT 生成:在 Agent 框架下做一份商业定制的西藏自驾游方案,要「野性、原始、探索感」的调性,给出三种带真实定价的方案,配图还得是实拍质感。其余两个分别是重设计官网和生成前端动态特效 Demo。

(图片来源:DeepSeek官方)
至于大家在意的如何调用API,官方也提供了详细的说明,我们只需把 model 参数设为DeepSeek-V4-Flash-Vision-Exp就行。

(图片来源:DeepSeek官方)
这时图片会转成 token 计费,一张图最多占 384 个 token,单价和 V4-Flash 完全一致。图片传入除了常见的 base64 内联和外部 URL,还有同步开放的 Files API:图片上传一次,后续用 file_id 引用,同一张图在多个请求里不用重复上传,这项服务还不收费。
不过模型名里带着「Exp」,说明这只是实验版本,离正式版还有距离。不过回想V4-Flash前段时间刚在Arena.ai前端编码榜上首次超过Opus 4.8,现在又把视觉理解补上了,小雷觉得DeepSeek今年的节奏确实快。

(图片来源:AI生成)
可以说DeepSeek的短板这次算是补上了,接下来就看 Agent 场景能挖出多少真需求,那才是对它真正的考验。
机器人产业最重要风向标,世界机器人大会(WRC)2026重磅来袭,还有世界人形机器人运动会紧随其后。
宇树、智元、启元、魔法原子、银河通用、云深处、灵心巧手等300余家TOP展商联袂呈现,定义全球机器人产业未来!
所有关于机器人的核心问题,WRC都将给出答案。
雷科技WRC 2026报道团已抵达WRC现场。



雷科技





































