8月20日发布在 arXiv 上的基准测试 AI4AI-Bench,考察的问题比常见的编程评测更窄也更有意思:AI 智能体能否改进用来训练 AI 的算法?测试环境是十个冻结的研究代码库,覆盖十类训练算法。智能体在单块 B300 GPU 上有四小时时间修改训练代码;结果随后运行最多十二小时,用隐藏基准打分,量表上 0 表示毫无信息量的模型,0.1 表示未经修改的原始算法,1.0 表示已知最佳结果。在六个系统的29种配置、全部十项任务上,平均分为0.166,单个系统最高达到0.250。最能说明问题的数字其实与能力无关。真正尝试修改算法的系统平均得分0.226,未尝试的只有0.126——而提高推理投入后,尝试修改的运行比例从8%升至64%,平均分从0.094升到0.196。该论文为预印本,未经同行评议。