Lena Holzwarth、Rita González-Márquez和Dmitry Kobak于8月11日提交至arXiv的预印本估计,截至2025年12月底,PubMed Central中开放获取的生物医学论文里有89%出现了与大语言模型相关词汇的超额使用。这套方法刻意避开了并不可靠的AI文本检测器,转而追踪聊天机器人普及之后特定词汇在整个语料库中出现频率的变化,并度量其中的超出部分。这比早先的做法更敏感,也正是该数字高于以往估计的原因。真正有信息量的是按章节的分布:讨论部分为68%,摘要67%,引言59%,结果46%,方法32%——论文进行论证的地方最重,报告实际做了什么的地方最轻。《自然》于8月21日报道了这份预印本。研究尚未经过同行评议,而且该度量既会捕捉起草,也会捕捉润色和编辑,无法区分究竟发生的是哪一种。