ROBOTICS

NMPC-контроллер победил на AI Olympics с двойным маятником

На IJCAI 2026 в Бремене контроллер с прогнозирующим управлением в реальном времени от Университета Патр обошёл соперника, построенного на идентификации системы, и победил в четвёртом сезоне AI Olympics с RealAIGym — соревновании, которое судится целиком на реальном железе, а не в симуляции.

Четвёртый сезон AI Olympics с RealAIGym завершился на IJCAI 2026 в Бремене 19-21 августа: организаторы объявили победителем контроллер, созданный Ником Каридакисом и Константиносом Хадзилигеруди из Лаборатории автоматизации и робототехники Университета Патр. До очного финала дошли две команды. Заявка из Патр использовала нелинейное прогнозирующее управление в реальном времени (NMPC), решаемое методом последовательного квадратичного программирования; команда, занявшая второе место, из Технологического университета Чалмерса в Швеции, соединила собственную идентификацию системы оборудования с отдельным NMPC-решателем, отслеживающим заранее рассчитанную траекторию раскачки.

Задача — раскачать и удержать в равновесии недоприводной двухзвенный маятник, стартуя из полной остановки, в одной из двух конфигураций: 'Acrobot', где приводится только второй, внешний сустав, или 'Pendubot', где приводится только первый. В отличие от большинства ИИ-бенчмарков, соревнование проходит на физическом оборудовании, а не в симуляции: участники присылают код контроллера, который выполняется удалённо на стенде организаторов 'CloudPendulum'. Финальная оценка распределяется по четырём отдельным физическим ячейкам с маятниками, так что контроллеру приходится справляться с небольшими механическими различиями между экземплярами, а не с одной откалиброванной установкой. Каждое испытание длится 300 секунд, и очки — это суммарное время, которое маятник удерживается в верхней целевой зоне, усреднённое по 16 прогонам на команду — четыре ячейки на четыре попытки. Отдельная серия прогонов добавляет нераскрытое возмущение — толчок в середине раскачки — чтобы проверить устойчивость.

Контроллер из Патр объединяет раскачку и стабилизацию в единую оптимизационную политику вместо переключения между отдельными контроллерами для каждой фазы, используя структурно-эксплуатирующие методы ADMM и внутренней точки (HPIPM), чтобы решатель оставался достаточно быстрым для управления реальным оборудованием в реальном времени — средняя частота обновления выше 100 Гц, около 400 Гц на Pendubot и 240 Гц на более сложной конфигурации Acrobot. В собственной опубликованной проверке команды контроллер Pendubot достиг 100-процентного успеха как с толчком в середине испытания, так и без него, удерживая маятник в целевой зоне медианные 92.5 процента времени в испытании без возмущения и 87.3 процента — с возмущением. На Acrobot, более сложном из-за того, что приводимый сустав дальше от точки опоры, успех составил 100 процентов без возмущения и 70 процентов с толчком.

Команда из Чалмерса пошла другим путём: двенадцатипараметрическая модель трения и сопротивления, подогнанная под данные обору��ования, собранные с частотой 200 Гц, питает NMPC-решатель acados на основе последовательного квадратичного программирования, работающий с целевой частотой 400 Гц против заранее рассчитанной опорной траектории. Во время разработки команда полагалась на небольшое пассивное вспомогательное устройство в составе, добавлявшее около 5 миллиньютон-метров момента, — правила соревнования не допускают его в зачётных прогонах. Без него, в официальном формате из четырёх ячеек по 300 секунд, собственные опубликованные данные команды показывают, почему подход занял второе место: в среднем 80 секунд из 300 в верхнем положении на Pendubot и 75 секунд на Acrobot, при этом на Acrobot команда получила ноль очков на двух из четырёх ячеек, а семь из шестнадцати зачётных попыток закончились остановкой по пределу безопасности. Сама команда назвала эти цифры диагностическими, а не зачётными, поскольку вспомогательное устройство, благодаря которому контроллер работал в лаборатории, в день соревнования отсутствовало.

Результат примечателен на фоне истории самого соревнования. Более ранние сезоны, проходившие вместе с IROS и ICRA, были представлены в основном контроллерами, обученными с помощью обучения с подкреплением. Победитель этого года вместо этого использовал классическую оптимизацию траектории, работающую достаточно быстро и структурированную достаточно хорошо, чтобы состязаться напрямую на реальном оборудовании, а не в симуляторе. Провал команды, занявшей второе место, — более поучительная часть истории: контроллер, надёжно работавший в лаборатории, потерял большую часть запаса, как только для зачёта убрали вспомогательное устройство, использовавшееся только при разработке, и этот разрыв проявился именно потому, что бенчмарк тестирует на физических стендах с реальным трением и реальными пределами безопасности, а не на их симулированном приближении.

Призовой фонд сезона 2026 года превысил 2000 долларов и был вручён на церемонии 21 августа. Организаторы проводят соревнование ежегодно с 2023 года на одном и том же оборудовании с двойным маятником, что делает сравнения между годами содержательными даже при смене методов участников.