На ARC-AGI-3 обвязка агента может значить больше модели
Сравнение обвязок, которое ARC Prize опубликовала в этом месяце, подняло результат GPT-6 Astra на ARC-AGI-3 с 62.7 до 99.9 процента, а отдельная демонстрация NVIDIA подняла результат Claude Opus 5 с 30.2 до 100 процентов — доказательство того, что на этом бенчмарке программная обвязка вокруг модели может значить не меньше, чем сама модель.
3 сентября 2026 года ARC Prize опубликовала собственный разбор того, как модель OpenAI GPT-6 Astra выступает на ARC-AGI-3, интерактивном бенчмарке рассуждений этой организации. Одна и та же модель на одном и том же полу-приватном наборе сред набирала от 17.5 до 99.9 процента в зависимости только от того, какое программное обеспечение передавало её действия между ходами. При максимальном уровне рассуждения Astra набрала 62.7 процента через стандартную обвязку самой ARC Prize и 98.6 процента через собственную обвязку OpenAI, Provider Adapter, разрыв в 36 пунктов при идентичных весах модели на идентичных задачах.
Обвязка (harness) в этом контексте — это код, который стоит между моделью и средой бенчмарка: он решает, сколько из предыдущих рассуждений модели сохраняется от одного действия к следующему, как обрезается растущая история диалога и как обрабатываются повторы и ошибки. Стандартная обвязка ARC Prize отбрасывает приватные рассуждения модели после каждого действия и обрезает старые ходы из контекстного окна, так что модель фактически заново постигает правила игры на каждом ходу. Provider Adapter от OpenAI сохраняет это состояние рассуждений на протяжении всего прогона и сжимает историю вместо того, чтобы её обрезать, позволяя модели опираться на уже проделанную работу. По данным ARC Prize, прогоны через Provider Adapter были примерно в 3.66 раза быстрее и использовали на 49 процентов меньше токенов, чем прогоны на стандартной обвязке, при этом показывая значительно более высокий результат.
При высоком, а не максимальном уровне рассуждения разрыв стал ещё шире: 54.8 процента на стандартной обвязке против 99.9 процента, лучшего зафиксированного результата Astra на ARC-AGI-3 вообще, через Provider Adapter, при стоимости полного прогона в 18817 долларов. Прогоны на стандартной обвязке, несмотря на более низкий результат, обходились дороже: 40705 долларов при высоком уровне рассуждения и 26098 долларов при максимальном, поскольку модели, заново открывающей правила игры на каждом ходу, требуется больше токенов, чтобы до этого результата добраться.
Тремя неделями раньше, 21 августа, NVIDIA опубликовала параллельную демонстрацию на другой модели. Собственная таблица лидеров ARC Prize фиксирует за голой Claude Opus 5 при высоком уровне рассуждения результат 30.2 процента на публичном наборе ARC-AGI-3, рекорд на момент объявления ARC Prize 24 июля, почти вчетверо выше прежнего лучшего показателя в 7.8 процента, установленного GPT-5.6 Sol. В обвязке NVIDIA под названием AVO, которая добавляет к той же Claude Opus 5 постоянную память и слой супервизора, та же модель прошла все 183 уровня во всех 25 средах публичного набора на максимальный результат, использовав 6624 действия в среде, на 12 процентов меньше, чем у прежнего лидера среди агентных обвязок, VISTA, которому на той же модели потребовалось 7542 действия.
NVIDIA прямо оговорила, что сравнение не является контролируемым экспериментом: AVO и голая модель отличаются не только наличием обвязки, но и агентным бэкендом, форматом наблюдений, памятью и управлением контекстом, поэтому скачок с 30 до 100 процентов не следует читать как изолированный вклад именно AVO. Результат в 100 процентов к тому же охватывает только публичный набор сред; полу-приватный и приватный наборы ARC-AGI-3, которые сложнее выучить наизусть именно потому, что не публикуются, обвязкой AVO проверены не были.
Вместе эти два сообщения указывают на один и тот же структурный факт о бенчмарках, построенных вокруг интерактивных многошаговых задач, а не отдельных вопросов: запись в таблице лидеров всё чаще называет не только модель, но и неопределённый объём окружающей её инженерии, и разделить эти два вклада по одному числу непросто. Собственный адаптер или агентный фреймворк вендора способен сдвинуть результат на десятки пунктов, не меняя ни одного веса модели.
Именно решение ARC Prize публиковать показатель на стандартной обвязке рядом с показателем, предоставленным вендором, а не только более высокое число, которое лаборатория предпочла бы вынести в заголовок, делает сравнение по Astra вообще возможным. Это даёт таблице лидеров фиксированную точку отсчёта, которая не меняется, когда улучшается собственный инструментарий вендора, ту же функцию в любом соревновании, где снаряжение значит не меньше, чем сам участник, выполняет официальный протокол результатов.