aiminute. ← Все новости ИИ
Новые модели 2026-08-15

Компания, стоящая за китайским Instagram, открыла брата модели, набравшей полный балл на математической олимпиаде

Компания, стоящая за китайским Instagram, открыла брата модели, набравшей полный балл на математической олимпиаде

Xiaohongshu — лайфстайл-приложение, известное за рубежом как RedNote, — 14 августа опубликовала открытые веса dots3-note-prev: модель на смеси экспертов с 280 миллиардами параметров, из которых одновременно активны лишь 16 миллиардов, с контекстным окном 512K и вводом текста, изображения и речи. Она из того же семейства, что и dots-note-3.0, в прошлом месяце показавшая результат, который её лаборатория описывает как первые официальные 42 балла из 42 у ИИ на Международной математической олимпиаде. Лаборатория также опубликовала метод обучения TEMPO, при котором на длинных задачах модель попеременно выступает исполнителем и оценщиком собственного прогресса, плюс два набора тестов, созданных именно под такие задачи: VibeSearchBench — 200 заданий в 20 областях, и VibeLifeBench — 20 заданий с 1247 отдельными проверками. По данным лаборатории, ни Claude Opus 5, ни GPT-5.5 не преодолели установленный порог прохождения.

Почему это важноЗдесь необычны две вещи. Первая — кто: не лаборатория, а приложение социального шопинга выпускает открытые веса на той же неделе, что Alibaba и Meta. Это напоминание, что в Китае потребительские интернет-компании держат собственные передовые команды и готовы отдавать результат даром. Вторая — что именно измерено. Почти все публичные тесты вознаграждают модель за ответ на вопрос; эти два вознаграждают за доведённое до конца многочасовое поручение — спланировать поездку, провести операцию — и оценивают более чем по тысяче мелких проверок. Для агента это более трудный и более честный экзамен, а утверждение, что два передовых модели его не проходят, заслуживает независимого воспроизведения, прежде чем считать вопрос закрытым.
#ИИ-агенты

✓ Проверено · 4 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic
2026-08-21
Четыре часа и один GPU, чтобы улучшить способ обучения ИИ: лучший агент набрал 0,25 из 1 — а большинство даже не попробовали
2026-08-21
ChatGPT теперь может читать ваши iMessage и отправлять их — а настройка, позволяющая ему не спрашивать, и есть та, о которой предупреждает сама OpenAI
2026-08-21
Покажите роботу один раз — от трёх до двенадцати секунд — и он выполнит работу верно 59 раз из 100 вовсе без обучения
2026-08-21
Агент выдумал второго человека, чтобы тот поручился за его код. 24-летний студент из Техаса не поверил ни одному из них.
2026-08-21