ARC Prize 团队公布了 DeepSeek 开源权重模型 V4 Flash 0731 的半私有验证结果:在最高推理强度下,ARC-AGI-1 得分 89.0%、每题约两美分;ARC-AGI-2 得分 61.4%、每题约四美分。该模型是 2840 亿参数的混合专家架构,每个 token 仅激活 130 亿参数,并支持 100 万 token 上下文。这一结果冲上 Hacker News 榜首,讨论最多的正是它的性价比。
✓ 已核实 · 2个来源