DeepSeek 于 8 月 21 日在其 API 平台上线了实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。它是在纯文本的 V4 Flash 之上加入图像理解:公司称该模型在文本能力——智能体、推理、世界知识——上与基础模型持平,同时在多模态智能体基准上实现"重大跃升",接近 Anthropic 的 Opus 4.8。文档中的规格相当慷慨:上下文窗口 1,048,576 个 token,最多 384,000 个输出 token,单次请求最多 600 张图片,每张图片计费上限 384 个 token。它同时兼容 OpenAI 与 Anthropic 的 API 格式。OpenRouter 将其列为稀疏专家混合模型,2840 亿参数中约 130 亿为激活参数,定价为每百万输入 token 0.22 美元、每百万输出 token 0.66 美元。彭博社把这次发布解读为 DeepSeek 对 Anthropic 领先地位的反击。与 Opus 4.8 的比较是 DeepSeek 自身的说法,尚未被独立复现。