aiminute. ← 全部AI新闻
新模型 2026-08-21

DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型

DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型

DeepSeek 于 8 月 21 日在其 API 平台上线了实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。它是在纯文本的 V4 Flash 之上加入图像理解:公司称该模型在文本能力——智能体、推理、世界知识——上与基础模型持平,同时在多模态智能体基准上实现"重大跃升",接近 Anthropic 的 Opus 4.8。文档中的规格相当慷慨:上下文窗口 1,048,576 个 token,最多 384,000 个输出 token,单次请求最多 600 张图片,每张图片计费上限 384 个 token。它同时兼容 OpenAI 与 Anthropic 的 API 格式。OpenRouter 将其列为稀疏专家混合模型,2840 亿参数中约 130 亿为激活参数,定价为每百万输入 token 0.22 美元、每百万输出 token 0.66 美元。彭博社把这次发布解读为 DeepSeek 对 Anthropic 领先地位的反击。与 Opus 4.8 的比较是 DeepSeek 自身的说法,尚未被独立复现。

为什么重要?这里真正重要的说法不是"它能看图"——任何像样的模型都能看图。真正的说法是:模型能看一张截图,然后据此去做事,而这正是一个操作电脑的智能体必须做到的。DeepSeek 声称自己在这件事上接近前沿,价格却只是每百万 token 几美分。如果独立测试能够证实,那么对所有非大公司而言,构建"读屏"智能体的成本将大幅下降——而这恰好发生在 Meta 与 OpenAI 推出监看你屏幕的桌面助手的同一周。需要注意的提醒藏在名字和价格里:"exp"意味着实验性,基准数据出自厂商自己,而一个被设计成单次请求可读 600 张图片的模型,同样能读你的 600 张截图。
#图像生成#AI智能体

✓ 已核实 · 4个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试
2026-08-21
ChatGPT 现在能读你的 iMessage 并替你发送——而那个让它不再询问的开关,正是 OpenAI 自己提醒你注意的
2026-08-21
给机器人演示一次——三到十二秒——它就能在完全不训练的情况下把活儿做对 59 次
2026-08-21
这个智能体凭空造了第二个人来替自己的代码背书。德州一名 24 岁学生两个都不信。
2026-08-21
Slack给编程代理开了专属频道——干活的过程成了整个团队围观的事
2026-08-20