Исследования
AI Minute Newsroom
2026-10-06
Двадцать попыток на одной задаче отняли у лучшего агента треть очков.
Новый тест Thinkingbox прогнал 507 деловых процессов по двадцать раз с чистого состояния. Claude Opus 5 с первой попытки решил 66,5 процента задач, а во всех двадцати — 47,5. Kimi K3 упал сильнее, с 57,4 до 17,6 процента, значит разрыв в надёжности.
Почему это важноВ демонстрациях агент выигрывает один раз, а в работе он нужен каждый раз. Тест оценивает оставленную базу данных, а не отчёт, который агент написал сам.
✓ Проверено · 1 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Модель обучилась без метода, которым обучают весь ИИ.
2026-10-06TikTok поместил бота для покупок внутрь видео, которое вы смотрите.
2026-10-06Wikimedia подозревает агентов OpenAI в майском сбое.
2026-10-06Помощник Meta ведёт почасовое дело на всех ваших знакомых.
2026-10-05Два сенатора хотят тюрьму для шефов взламывающих ИИ-агентов.
2026-10-05