aiminute. ← 全部AI新闻
研究 2026-08-21

给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试

给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试

8月20日发布在 arXiv 上的基准测试 AI4AI-Bench,考察的问题比常见的编程评测更窄也更有意思:AI 智能体能否改进用来训练 AI 的算法?测试环境是十个冻结的研究代码库,覆盖十类训练算法。智能体在单块 B300 GPU 上有四小时时间修改训练代码;结果随后运行最多十二小时,用隐藏基准打分,量表上 0 表示毫无信息量的模型,0.1 表示未经修改的原始算法,1.0 表示已知最佳结果。在六个系统的29种配置、全部十项任务上,平均分为0.166,单个系统最高达到0.250。最能说明问题的数字其实与能力无关。真正尝试修改算法的系统平均得分0.226,未尝试的只有0.126——而提高推理投入后,尝试修改的运行比例从8%升至64%,平均分从0.094升到0.196。该论文为预印本,未经同行评议。

为什么重要?递归自我改进——AI 让 AI 变得更好并不断复利——是大多数"快速起飞"论证背后的机制,而这一直主要停留在抽象讨论中。这是首批认真为它标出数字的尝试之一,而这个数字很小:最好的系统只走到了文献中已有结果的四分之一。但值得记住的是失败的方式。这些智能体主要不是在科学上失败;它们中的大多数根本没有尝试科学,而是退回到安全的小修小补——仅仅让它们多想一会儿,就把这一比例提高了八倍。这是习惯的限制,而不是智力的限制,而习惯正是那种很快就能被工程手段消除的东西。
#编程#AI智能体

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

机器学习读懂了患病脑细胞的形态,挑出九种已获批药物让它们平静下来
2026-08-21
传闻:那个免费登顶编程基准的匿名模型,据称是智谱尚未发布的旗舰
2026-08-21
DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21
英伟达出资 60 亿美元买下对手的"造模型机器",并招走运营它的 109 人
2026-08-21
ChatGPT 现在能读你的 iMessage 并替你发送——而那个让它不再询问的开关,正是 OpenAI 自己提醒你注意的
2026-08-21