A
ИИ-чатQwen-DriveAlibabaавтономное вождение3D-восприятиеQwen3.5

Qwen-Drive 1.0: ИИ для автопилота объясняет торможение, но не всегда правильно

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Qwen-Drive 1.0: ИИ для автопилота объясняет торможение, но не всегда правильно

Есть что-то по-своему показательное в том, что самая честная характеристика новой модели Alibaba для автономного вождения звучит примерно так: машина тормозит правильно, но объяснение, которое она дает, может с реальным маневром не совпадать. Это не баг - это симптом всей отрасли, которую Qwen-Drive 1.0 пытается встряхнуть.

Что построили и зачем

Qwen-Drive 1.0 - совместная разработка исследовательского подразделения Alibaba и Хуачжунского университета науки и технологий. Модель построена поверх Qwen3.5-4B, вышедшего в феврале этого года, и расширена двумя внешними модулями - при этом архитектура базовой языковой модели остается нетронутой. Это принципиальное архитектурное решение, о котором стоит поговорить отдельно.

Большинство существующих стеков автономного вождения устроены как набор специализированных пайплайнов: отдельный блок воспринимает среду, отдельный отвечает на вопросы, отдельный строит траекторию. Qwen-Drive предлагает общие представления для всех трех задач - восприятие окружающей среды, диалог о трафике и планирование маршрута работают через одну модель.

Первый добавленный модуль - BEV Perception Head - строит карту окружения с видом сверху: определяет объекты в 3D-пространстве, оценивает заполненность зон и размечает дорожную разметку. Второй модуль, Planning Expert, генерирует траекторию движения на ближайшие секунды, опираясь на промежуточные состояния языковой модели. Выпущено две версии планировщика: одна обучена на имитации примеров вождения, вторая дополнительно оптимизирована через обучение с подкреплением.

Почему текстово-визуальные модели не понимают пространство

Авторы бумаги зафиксировали то, что интуитивно понятно, но редко проверяется экспериментально: модель, умеющая описывать изображения, не умеет автоматически понимать трехмерное пространство. Когда команда обучала только добавленный BEV-модуль, оставив языковую модель нетронутой, точность пространственного восприятия оставалась низкой. Пространственное понимание нужно прямо встраивать в обучение языковой части - иначе модель видит картинку, но не чувствует глубину.

Это критично для реального вождения: модель должна надежно определять расстояния, позиции объектов и свободные зоны. Классический файн-тюнинг на парах вопрос-ответ о трафике эту задачу не решает.

Вторая проблема классического подхода - так называемое "катастрофическое забывание". Если модель слишком глубоко специализируется на данных о вождении, она теряет широкие знания из исходного обучения. А именно эти знания нужны в нестандартных ситуациях на дороге - когда случается что-то редкое и непредсказуемое.

Цифры и обучение

Обучение строится поэтапно: сначала модуль восприятия, затем совместное обучение восприятия и диалога, потом планирование маршрута, финальный шаг - обучение с подкреплением. Для языково-визуальной части команда собрала 24 публично доступных датасета с дорожными сценами, выровняла их структуру через отдельную языковую модель и дополнила собственными примерами с объяснениями решений - почему машина должна затормозить именно из-за этого объекта.

Главный измеримый результат: переобучение снизило частоту съезда с дороги в симуляциях с 24% до 12%. Вдвое - это значимо, хотя 12% все еще звучат тревожно для реального дорожного применения.

Здесь и проявляется главный изъян, который исследователи честно признают: объяснения модели не всегда соответствуют фактически принятым решениям. Модель может тормозить по правильной причине, но называть другую. Это проблема интерпретируемости, которую архитектурным трюком не решить.

Открытый код и лицензия

Модель выпущена под лицензией Apache 2.0 - код, веса и демо-данные доступны публично через репозиторий Qwen-Drive-1.0 на GitHub. Бумага была опубликована на arXiv 31 августа, авторов 16 человек, ведущие - Синь Чжоу и Цзунчуан Чжао.

Для разработчиков это означает реальную возможность взять модель и адаптировать под собственные задачи. Открытые веса в автомобильном ИИ - редкость: большинство игроков здесь предпочитают закрытые стеки.

Контекст: Alibaba и автономное вождение

Qwen-Drive - прямое расширение линейки Qwen в автомобильную область. Сама линейка прошла долгий путь от запуска Tongyi Qianwen в апреле 2023 года до нынешней ситуации, когда у Alibaba есть генеративные модели для текста, изображений, агентов и теперь - для вождения. В августе этого года Qwen впервые открыл веса модели класса Max (Qwen3.8-Max с 2,4 триллиона параметров), что само по себе было значимым сигналом об изменении стратегии.

Авторы бумаги прямо указывают на конвергенцию инфотейнмент-системы и системы вождения в современных автомобилях - оба компонента все чаще живут на одном вычислительном узле. Модель, которая одновременно умеет отвечать на вопросы пассажира и планировать траекторию, вписывается в этот тренд.

Сравнивать Qwen-Drive с конкурентами напрямую сложно: открытых бенчмарков по закрытому циклу в бумаге нет, сами авторы признают, что вопрос о том, держится ли подход с общими представлениями против специализированных пайплайнов в реальных условиях, остается открытым. Это честно - и редко для пресс-релизной культуры больших технологических компаний.

Для российской аудитории: модель открыта, веса можно скачать напрямую с HuggingFace и GitHub без VPN - ограничений на доступ к репозиторию Qwen нет.

Информация подтверждена несколькими независимыми публикациями, включая технический разбор архитектуры и данные об условиях выпуска модели.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости