Anthropic publicó el 31 de agosto una revisión de su trabajo de alineación y seguridad. Marcó más del 10 por ciento de sus entornos de aprendizaje por refuerzo como rotos o vulnerables al engaño de recompensa. La empresa congeló los cambios durante un mes y pasó 150 ingenieros a seguridad.