Alibaba показала Qwen-Robot Suite — набор из трёх открытых моделей, которые закрывают ключевые задачи «воплощённого ИИ»: навигацию, работу с предметами и моделирование будущих событий в сцене. Идея в том, чтобы упростить создание физических агентов и перенос навыков между разными роботами.
Alibaba представила Qwen-Robot Suite — набор из трёх фундаментальных моделей, рассчитанных на роботов и «физических» агентов. В отличие от обычных ассистентов, которым достаточно текста и картинок, здесь упор на действия: как роботу двигаться, как взаимодействовать с объектами и как прогнозировать, что произойдёт дальше в реальной сцене.
Что вошло в Qwen-Robot Suite
В набор включили три модели, каждая отвечает за свой «кусок» поведения робота. Вместе они образуют связку, которую можно использовать как основу для более сложных агентных систем (например, когда внешний планировщик делит большую цель на шаги и по ходу переключает режим работы).
- Qwen-RobotNav — модель для навигации с несколькими сценариями: следование инструкциям, движение к заданной точке, поиск объектов, отслеживание цели и автономное вождение. Для навигационной части разработчики обучали модель на 15,6 млн примеров и масштабировали размер от 2 до 8 млрд параметров для улучшения результата. Также предусмотрена настройка «протокола наблюдения», чтобы система по-разному обрабатывала визуальный контекст (например, менять объём токенов или учитывать вклад разных камер).
- Qwen-RobotManip — vision-language-action модель, ориентированная на физическое взаимодействие с предметами (роборуки, захваты, перестановка объектов). Её задача — помочь с одной из самых болезненных проблем робототехники: данные и управление у разных платформ устроены по-разному, из‑за чего навыки сложно переносить между роботами. В модели применяют механизм выравнивания представлений, движений и поведения, а обучали её на корпусе из 38 тыс. видео с робототехническими и синтетическими данными.
- Qwen-RobotWorld — «модель мира», которая по наблюдениям в реальном времени и текстовым инструкциям прогнозирует, как будет развиваться физическая среда. Проще говоря, модель генерирует будущие визуальные траектории для разных сценариев, чтобы агент мог не только реагировать, но и планировать.
Почему это важно не только исследователям
Роботы в бизнесе обычно упираются не в «железо», а в то, что поведение приходится долго настраивать под конкретную модель платформы, датчиков и условий. Даже если один робот научился аккуратно брать коробку или объезжать препятствия, повторить тот же трюк на другой платформе бывает сложно и дорого.
Идея комплекта из трёх моделей выглядит как попытка собрать более универсальный слой:
- навигация — чтобы робот понимал, куда и зачем ехать;
- манипуляции — чтобы мог работать руками/манипуляторами и переносить навыки между разными устройствами;
- модель мира — чтобы не действовать «вслепую», а оценивать последствия и выбирать более безопасные траектории.
Практический сценарий: от команды до действия
Представьте складского робота, которому дают задачу: «Найди коробку с маркировкой X и отвези её на зону отгрузки». Такой кейс распадается на цепочку подзадач: найти нужный стеллаж, подъехать, распознать цель, аккуратно взять коробку, выбрать маршрут к зоне отгрузки и не столкнуться с людьми или техникой. В логике Qwen-Robot Suite часть шагов закрывает навигация, часть — работа с предметами, а «модель мира» помогает предсказать, что будет, если впереди внезапно появится препятствие или изменится обстановка.
Что известно про доступность
Все модели из набора заявлены как открытые, а также демонстрируются на официальной странице проекта. Это означает, что разработчики и команды, которые экспериментируют с роботами и агентами, могут рассматривать Qwen-Robot Suite как базу для прототипов и исследований, не начиная с нуля.
