FORMAT

Botzone развёл ИИ-маджонг на два трека: алгоритмы и LLM

Шестой турнир по маджонгу среди ИИ на платформе Botzone, показанный на IJCAI 2026 в Бремене, развёл алгоритмические движки и агентов на базе языковых моделей по разным зачётам — с разными победителями и совершенно разным разбросом очков. Само это разделение говорит о состоянии LLM-агентов в играх не меньше, чем любая турнирная таблица.

Шестой Международный турнир по маджонгу среди ИИ, организованный на платформе Botzone Лабораторией ИИ Пекинского университета совместно с Weizhiyu Technology, завершил оба своих зачёта в начале июля 2026 года, а результаты показали на IJCAI 2026 в Бремене (19-21 августа). Алгоритмический и LLM-зачёты играли раздельно и с разными победителями: команда 海中队 выиграла зачёт для алгоритмов (шестнадцать команд) с результатом 1315.50 очка по итогам матчей в дублирующем формате, а команда Kitagawa выиграла финал LLM-зачёта (четыре команды) с результатом 417.0 очка — разница в очках отражает разные форматы, а не разрыв в мастерстве.

Сама игра — маджонг по официальным китайским правилам (MCR), игра с неполной информацией на четырёх игроков, где нужно собрать очковую комбинацию из добираемых и сбрасываемых костей, одновременно считывая, что собирают трое соперников, и избегая сброса кости, которая завершит чужую комбинацию. В отличие от шахмат или го, ИИ-агенту в маджонге приходится рассуждать о скрытой информации и о трёх соперниках одновременно, а исход отдельной раздачи может решить один неудачный или, наоборот, точно считанный сброс — поэтому голый счёт побед по нескольким партиям почти ничего не говорит об относительном мастерстве.

Чтобы справиться с этим разбросом, Botzone проводит оба зачёта в дублирующем формате: одна и та же перемешанная раздача одновременно раздаётся за несколько столов, так что очки агента отражают то, как он сыграл конкретную раздачу, а не то, какая раздача ему досталась. В алгоритмическом зачёте шестнадцать команд-финалистов прошли швейцарский отбор до финала на четыре команды, где 海中队 заняла первое место с 1315.50 очка, опередив 摸鱼 (1306.50), We Can Play (1291.50) и player team 2 (1206.49) — разброс по всему подиуму меньше 110 очков, слишком тесный, чтобы говорить о явном лидере среди движков.

LLM-зачёт шёл по более сжатому графику — регистрация закрылась 9 июня, собственный отборочный раунд завершился 28 июня, а финал на четыре команды прошёл 12 июля — и дал более широкий разброс: победные 417.0 очка команды Kitagawa более чем вдвое превышают 186.0 очка занявшей четвёртое место команды MahjongTeam, а между ними расположились agentic_bot (345.0) и команда «LLM可以算清番吗» (332.0). Эти цифры напрямую не сравнимы с результатами алгоритмического зачёта, поскольку в финале LLM-зачёта было сыграно меньше дублирующих раздач, но более широкий разрыв между первым и последним местом согласуется с тем, что у этого направления было гораздо меньше времени сойтись к общему стандарту игры, чем у классических маджонг-движков на основе поиска.

Само разделение зачётов интереснее любой из турнирных таблиц. Написанный вручную или обученный с подкреплением маджонг-движок оптимизирован под игру целиком: ему не нужны подсказки, он не тратит вычисления на объяснение своих ходов на естественном языке и настраивается исключительно под очки дублирующего формата. LLM-агент делает нечто иное — переводит состояние стола в рассуждение на естественном языке о скрытой информации и риске, прежде чем решиться на сброс, — и свести оба подхода в один общий рейтинг означало бы в основном измерять, в какой из подходов вложено больше инженерного времени, а не то, какой из них лучше играет.

В технический комитет турнира входят Вэньсинь Ли и Сяоте Дэн из Пекинского университета, Цзюньлян Син из Университета Цинхуа, Вэйнань Чжан из Шанхайского университета Цзяотун, а также исследователи из Google DeepMind и Tencent AI Lab — это ставит карточную игру с неполной информацией в один ряд с шахматами и го как стандартный полигон для ИИ и выделяет языковые модели в этом полигоне в отдельную категорию, которую нужно измерять, а не считать заведомо сильнейшей.

К моменту показа в Бремене результатам было уже два месяца, и Botzone пока не сообщал, сохранит ли седьмое издание турнира раздельные зачёты или попробует свести их в один общий рейтинг. Пока же это разделение — конкретный ответ на всё более частый в состязаниях «машина против машины» вопрос: если языковая модель вообще способна играть в игру, означает ли сравнение её со специализированным движком, что нужен другой формат состязания, а не просто другой счёт.