aiminute. ← 全部AI新闻
研究 2026-08-15

要求一边写代码一边证明其正确,最强智能体做出了43题中的27题——最难的那批一题未破

要求一边写代码一边证明其正确,最强智能体做出了43题中的27题——最难的那批一题未破

包括 Dawn Song 在内的团队于8月13日在 arXiv 发布了 Vero,称其为首个仓库级可验证代码合成基准。Vero 不是要求智能体写出一个能通过测试的函数,而是要求它在一个多模块代码库上给出可运行的实现,外加一份可由机器检查的证明,表明该实现符合形式化规范。它包含43个由真实仓库构建的实例,覆盖 Lean 4、Dafny、Verus、Coq 等证明与编程语言,领域从密码协议到分布式系统。作者测试的最强智能体配置完整解决了43题中的27题,在最难的仓库上则一条规范也没能闭合。

为什么重要?你读到的关于智能体写软件的几乎每一条论断,都建立在「测试通过」之上;而测试只覆盖有人想到要写的那些情况。机器检查的证明是唯一一种不在乎模型说得多漂亮的证据——证明要么编译通过,要么不通过。这是第一次有人在整个仓库的尺度上按这个标准去衡量智能体,答案是:简单的三分之二能过,困难的三分之一碰都碰不动。下次再有人说某个编程智能体「可靠」时,这是一个值得记住的数字。
#编程#AI智能体

✓ 已核实 · 1个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

机器学习读懂了患病脑细胞的形态,挑出九种已获批药物让它们平静下来
2026-08-21
传闻:那个免费登顶编程基准的匿名模型,据称是智谱尚未发布的旗舰
2026-08-21
DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21
英伟达出资 60 亿美元买下对手的"造模型机器",并招走运营它的 109 人
2026-08-21
给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试
2026-08-21