Dans un rapport avec des partenaires académiques, OpenAI a documenté huit déploiements réels où des agents de code ont modernisé des logiciels de recherche délaissés — dont une accélération de 60x du contrôle qualité du séquençage ARN et la réécriture en Rust d'un aligneur de génomes de 20 000 lignes de C++ avec 99,8 % de parité. Cinq projets ont utilisé Codex seul ; trois l'ont combiné avec Claude Code d'Anthropic. Le rapport est franc sur la limite : les agents ont achevé des tâches d'ingénierie ambitieuses mais n'ont pas su juger si les résultats étaient scientifiquement corrects, présentant parfois du code défectueux avec une confiance totale.