FORMAT

Десять ИИ прогнозировали ЧМ. Испанию выбрал только один

В бенчмарке десять ИИ-ассистентов спрогнозировали весь чемпионат мира 2026 года по одинаковым исходным данным, а затем их сверили с реальными результатами. Только GPT-5.5 Thinking назвал чемпионом Испанию — и система начисления очков вознаградила именно этот выбор куда больше, чем точные прогнозы группового этапа.

Исследователи, проводившие бенчмарк AI World Cup 2026, попросили десять ИИ-ассистентов на базе языковых моделей подать по одному прогнозу на весь чемпионат мира ФИФА 2026 года ещё до его начала — исходя из одинакового среза турнирной сетки, одного шаблона запроса, одной JSON-схемы и одной процедуры подсчёта очков. После того как все 104 матча были сыграны, прогнозы сверили с реальными результатами. GPT-5.5 Thinking от OpenAI финишировал первым с 744 очками — единственный из десяти, кто назвал чемпионом Испанию. Испания обыграла Аргентину 1:0 в финале 19 июля на стадионе MetLife Stadium голом вышедшего на замену Феррана Торреса на 106-й минуте дополнительного времени.

Остальные девять ассистентов разделились между тремя командами, которые чемпионами не стали. Четыре из десяти — GPT-5.5, DeepSeek и обе заявки Perplexity — выбрали Бразилию. Три — Gemini, Mistral Medium 3.5 и Grok — выбрали Францию. Два, Qwen 3.7 и Claude Sonnet 4.6, выбрали Аргентину — сторону, которую Испания как раз и обыграла в финале.

Система подсчёта очков объясняет, почему выбор чемпиона значил настолько больше всего остального. За матчи группового этапа, которых было 72, начисляли по скользящей шкале: 5 очков за точный счёт, 3 — за верный исход, 2 — за угаданного победителя без ничьей, 1 — за верную разницу мячей. Плей-офф считался по отдельной, куда более крутой шкале: от 2 очков за каждую верно угаданную команду, вышедшую из раунда плей-офф 32, до 12 очков за верного финалиста, плюс отдельный бонус в 20 очков за точное имя чемпиона. Среди десяти моделей очки за плей-офф почти идеально коррелировали с итоговым местом (r=0.986). Очки за групповой этап с итоговым местом почти не коррелировали вовсе (r=0.055).

Это расхождение дало настоящую инверсию. У Claude Sonnet 4.6 была лучшая в поле точность по исходам группового этапа — 63.89% из 72 матчей, заметно выше любой другой модели, — но по итогу модель финишировала шестой из десяти, потому что за плей-офф набрала всего 68 очков, один из худших результатов в поле. GPT-5.5 Thinking, напротив, разделил худшую в поле точность по исходам группового этапа — 58.33%, столько же было ещё у пяти моделей, — и превратил в точный счёт лишь 11.11% матчей группового этапа. Тем не менее он победил, потому что за плей-офф набрал 242 очка, больше всех десяти — на том, что довёл Испанию до титула.

Значения уверенности, которые модели указывали вместе с прогнозами, слабо соответствовали точности. Каждая модель сообщала числовую уверенность для своих прогнозов, и по всему полю самооценённая уверенность коррелировала с реальной точностью практически на нуле (r=-0.060) — модели не были устойчиво увереннее, когда оказывались правы, чем когда ошибались; этот разрыв в калибровке регулярно всплывает и в других бенчмарках языковых моделей.

Исследование Джонаида Шианифара и Илиаса Файюда появилось на arXiv 4 августа 2026 года — уже после того, как турнир завершился и реальные результаты были известны: это ретроспективный подсчёт очков, а не прямая трансляция события, и прогнозы были зафиксированы ещё до первого удара по мячу. Его результат говорит меньше о том, какая модель «понимает» футбол, а больше о том, что именно вознаграждает выбранная формула подсчёта очков: настолько сильный перевес в пользу финальных раундов означал, что примерно верное угадывание всех 72 отдельных матчей группового этапа значило почти ничего по сравнению с одной верной догадкой о том, кто в итоге дойдёт до финала.