REASONING

Две ИИ-системы получили идеальный балл на IMO-2026

Celia от Huawei и dots-note-3.0 от RedNote набрали максимальные 42 из 42 баллов на Международной математической олимпиаде 2026 года по официальному судейству турнира — впервые. Ещё четыре топовые модели через несколько дней якобы повторили этот результат, но только в неофициальном тесте, который оценивал другой ИИ, а не судьи IMO.

Пустой экзаменационный зал в янтарном свете: парты завалены листами с геометрическими доказательствами, в тени — судейская трибуна.
Пустой экзаменационный зал в янтарном свете: парты завалены листами с геометрическими доказательствами, в тени — судейская трибуна.

Две ИИ-системы — Celia от Huawei и dots-note-3.0 от RedNote (Xiaohongshu) — решили все шесть задач Международной математической олимпиады 2026 года и получили от собственных судей олимпиады высший балл, 42 из 42. Это первый случай, когда языковая модель прошла официальное судейство IMO с максимальным результатом.

Экзамен прошёл в Шанхае 15-16 июля 2026 года одновременно с 666 участниками-людьми; церемония закрытия состоялась 22 июля. Такой же результат среди школьников показали только семь человек — напоминание о том, насколько редок безупречный результат даже среди сильнейших юных математиков мира.

ИИ-трек IMO работает по строгим правилам: компании получают шесть задач только после завершения экзамена у людей, представляют письменные решения в фиксированное окно времени и не имеют права на какое-либо вмешательство человека в этот период. Решения проверяют собственные координаторы IMO по тому же критерию, что и работы школьников — важна полная, без пробелов, доказательная запись, а не просто правильный финальный ответ.

Это различие существенно, потому что годом раньше, в 2025-м, Google DeepMind и OpenAI сообщили о результате 35 из 42 на той же олимпиаде — уровень золотой медали, но не максимум, — используя методы проверки вне официального канала IMO. Скачок с 35 до 42 за один год означает, что самый сложный формат экзамена — шесть задач за два дня — впервые дал безупречные работы ИИ по собственной шкале организаторов.

Параллельный неофициальный трек показывает, почему слово "официальный" здесь имеет значение. Через несколько дней после объявления результатов инвестор Диди Дас (Deedy Das) прогнал тот же набор задач через ещё четыре топовые модели — Claude Fable 5, GPT-5.6 Sol, Kimi K3 и доказчик на базе Lean, AxiomProver — и сообщил, что все четыре также набрали 42 из 42. Но эти оценки выставляли агенты на базе Claude в собственном тестовом стенде Даса, а не судьи IMO; в своих же заметках Дас называет результаты "убедительными, но не авторитетными".

Разрыв между двумя треками и есть суть истории. Официальная оценка IMO означает, что человек-координатор прочитал доказательство на естественном языке по той же планке, что и работу шестнадцатилетнего школьника, и не нашёл пробелов в логике. Самостоятельно организованная оценка означает, что один чат-бот решал, выдержало ли доказательство другого чат-бота критику — планка ниже и куда менее проверенная, каким бы ни было итоговое число.

В RedNote заявили, что планируют открыть исходный код dots-note-3.0 "в ближайшем будущем", не назвав точной даты. Модель по-прежнему описывается как самая лёгкая, ещё бета-версия в линейке dots3 компании, наряду с двумя более крупными вариантами для более тяжёлых нагрузок.