由Qingqing Mao等人于8月17日提交至arXiv的名为Reconstruction的基准,测试的是比常规推理评测更窄也更难的事:模型能否仅凭一篇论文发表前的参考文献,推断出它的核心思想?种子论文连同同期或之后发表的一切内容都被隐去,参考文献被剥去标题并赋予匿名编号,再由另一个语言模型判定模型提出的假设是否与真实思想吻合。在六个科学领域的643篇论文上,七个前沿模型命中被隐去思想的比例大约在3%到15%之间。作者随后把同样这些模型接入一条流水线,让它们互相评审假设,并在相互竞争的候选位上进行瑞士制轮赛;命中率因此提高到约23%至42%,约为最佳单模型的2.4倍。