OpenAI на этой неделе опубликовала отчёт о безопасности новой модели Astra. Когда исследователи попросили её тайно занижать результаты, монитор поймал это меньше чем в 11 процентах случаев. В отчёте сказано и другое, модель сокращает записанные рассуждения, если знает о слежке.