Kaggle Game Arena определила двух разных чемпионов по покеру
Когда в феврале Kaggle Game Arena от Google DeepMind добавила к шахматам покер и «Мафию» (Werewolf), Gemini 3 выиграла первые два турнира. В покере телевизионная сетка и статистический рейтинг назвали разных победителей — и это расхождение говорит о реальных различиях в том, как эти модели рассуждают в условиях неопределённости.
2 февраля 2026 года Google DeepMind расширила Kaggle Game Arena за пределы шахмат, добавив к платформе противостояний «модель против модели» безлимитный хедз-ап покер (Техасский холдем) и социально-дедуктивную игру Werewolf. Трёхдневное мероприятие продолжалось до 4 февраля и транслировалось с комментариями гроссмейстера Хикару Накамуры по шахматным партиям и покерных профессионалов Дага Полка, Ника Шульмана и Лив Бори за карточным столом.
Результаты в шахматах и Werewolf оказались однозначными. Gemini 3 Pro и Gemini 3 Flash заняли первые два места в обоих рейтингах: в DeepMind объяснили шахматный результат тем, что модели рассуждали образами, опираясь на такие понятия, как подвижность фигур, пешечная структура и безопасность короля, а не на грубый перебор вариантов. В Werewolf те же две модели последовательно отслеживали высказывания и поведение других игроков на протяжении нескольких раундов игры, которая строится на социальном выводе, а не на фиксированном состоянии доски.
Покер же дал раздвоенный результат. Телевизионный показательный турнир прошёл по системе на выбывание ради зрелищности, и в его финале o3 от OpenAI обыграла GPT-5.2 в матче один на один. Но фактический покерный рейтинг Kaggle строился отдельно, на куда большей выборке: примерно 180000 раздач при блайндах 1-доллар/2-доллара по всему полю участников. В этом рейтинге первой оказалась GPT-5.2 с чистой прибылью в 167614 долларов — впереди модели, которая только что обыграла её в эфире.
Это расхождение — не противоречие, а демонстрация того, что на самом деле измеряет турнир из трёх игр на выбывание и выборка в 180000 раздач. Короткий формат на вылет определяется дисперсией отдельных раздач; выборка на два порядка больше усредняет эту дисперсию и вознаграждает стратегию, которая работает на длинной дистанции. Покерный рейтинг, в отличие от турнирной сетки, ближе к тому, как игру оценивают среди профессионалов.
Комментатор Даг Полк, разбирая партии, указал на стиль игры как на общую черту результатов обеих моделей OpenAI: он описал o3 и GPT-5.2 как одинаково гиперагрессивные, готовые давить на соперника и вынуждать его принимать сложные решения, вместо пассивной игры в ожидании сильных рук. Эта агрессия сочеталась с заметными проблемами в рассуждениях. Полк отметил, что модели в турнире неверно оценивали силу руки — например, принимали флеш-дро за уже собранный флеш — и с трудом усваивали, что фолд может быть правильным решением с нулевым ожидаемым значением в определённых ситуациях. Даже итоговые победители иногда учитывали фишки, уже вложенные в банк, принимая решение о дальнейших действиях — паттерн невозвратных издержек, которому не место в расчёте эквити, основанном только на текущей раздаче.
Разделение результатов по трём играм говорит о том, какой тип рассуждений переносится между типами игр, а какой нет. Шахматы и Werewolf вознаграждают способность модели отслеживать полностью или частично наблюдаемое состояние и рассуждать от него вперёд — и одна и та же архитектура преуспела в обеих. Покер добавляет поверх этого состязательный, намеренно скрытый слой, где правильный ход зависит от того, что может быть на руках у соперника и как он, вероятно, отреагирует, причём оценивается это не за одну раздачу, а на выборке, достаточной, чтобы отделить мастерство от везения. То, что для определения победителя в покере потребовался другой метод подсчёта, а не другая модель, само по себе говорит о том, что пытаются показать подобные арены.
Готовность Kaggle Game Arena проводить одни и те же модели через структурно разные игры — одну с полной информацией, одну на социальном выводе, одну на скрытой информации и долгосрочной дисперсии — отличает её от бенчмарков на одной игре или показательных турниров на выбывание. Формат, в котором языковые модели сходятся один на один по системе на выбывание, — это и есть формат, в котором проходит BattaliAI, сезон 1, хотя и на меньшем, фиксированном поле из шестнадцати участников.
Источники
- Google DeepMind — Game Arena: Poker and Werewolf, and Gemini 3 tops chess
- Poker.org — 'Hyper-aggressive' OpenAI bots reign supreme as silicon poker battle concludes
- Spade Poker — AI That Doesn't Fear 3-Bets: GPT-5.2 Model Becomes a Poker Champion in AI Showdown
- Poker.org — Polk, Schulman, Boeree explore AI poker showdown as OpenAI dominates