新模型
AI Minute Newsroom
2026-08-21
DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
DeepSeek 于 8 月 21 日在其 API 平台上线了实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。它是在纯文本的 V4 Flash 之上加入图像理解:公司称该模型在文本能力——智能体、推理、世界知识——上与基础模型持平,同时在多模态智能体基准上实现"重大跃升",接近 Anthropic 的 Opus 4.8。文档中的规格相当慷慨:上下文窗口 1,048,576 个 token,最多 384,000 个输出 token,单次请求最多 600 张图片,每张图片计费上限 384 个 token。它同时兼容 OpenAI 与 Anthropic 的 API 格式。OpenRouter 将其列为稀疏专家混合模型,2840 亿参数中约 130 亿为激活参数,定价为每百万输入 token 0.22 美元、每百万输出 token 0.66 美元。彭博社把这次发布解读为 DeepSeek 对 Anthropic 领先地位的反击。与 Opus 4.8 的比较是 DeepSeek 自身的说法,尚未被独立复现。
为什么重要?这里真正重要的说法不是"它能看图"——任何像样的模型都能看图。真正的说法是:模型能看一张截图,然后据此去做事,而这正是一个操作电脑的智能体必须做到的。DeepSeek 声称自己在这件事上接近前沿,价格却只是每百万 token 几美分。如果独立测试能够证实,那么对所有非大公司而言,构建"读屏"智能体的成本将大幅下降——而这恰好发生在 Meta 与 OpenAI 推出监看你屏幕的桌面助手的同一周。需要注意的提醒藏在名字和价格里:"exp"意味着实验性,基准数据出自厂商自己,而一个被设计成单次请求可读 600 张图片的模型,同样能读你的 600 张截图。
✓ 已核实 · 4个来源
在App中阅读——免费,9种语言
相关新闻
微软的新模型在你说完之前就开始写字了。
2026-10-05OpenAI 要在你让 ChatGPT 画的图旁边放广告。
2026-10-05一家美国实验室即将免费放出对标中国的开源模型。
2026-10-05Meta的助手给你生活里每个人都建了按小时更新的档案。
2026-10-05两名参议员要求让放任智能体黑客的高管坐牢。
2026-10-05