Qwen-Drive 1.0: ИИ для автопилота объясняет торможение, но не всегда правильно

Есть что-то по-своему показательное в том, что самая честная характеристика новой модели Alibaba для автономного вождения звучит примерно так: машина тормозит правильно, но объяснение, которое она дает, может с реальным маневром не совпадать. Это не баг - это симптом всей отрасли, которую Qwen-Drive 1.0 пытается встряхнуть.
Что построили и зачем
Qwen-Drive 1.0 - совместная разработка исследовательского подразделения Alibaba и Хуачжунского университета науки и технологий. Модель построена поверх Qwen3.5-4B, вышедшего в феврале этого года, и расширена двумя внешними модулями - при этом архитектура базовой языковой модели остается нетронутой. Это принципиальное архитектурное решение, о котором стоит поговорить отдельно.
Большинство существующих стеков автономного вождения устроены как набор специализированных пайплайнов: отдельный блок воспринимает среду, отдельный отвечает на вопросы, отдельный строит траекторию. Qwen-Drive предлагает общие представления для всех трех задач - восприятие окружающей среды, диалог о трафике и планирование маршрута работают через одну модель.
Первый добавленный модуль - BEV Perception Head - строит карту окружения с видом сверху: определяет объекты в 3D-пространстве, оценивает заполненность зон и размечает дорожную разметку. Второй модуль, Planning Expert, генерирует траекторию движения на ближайшие секунды, опираясь на промежуточные состояния языковой модели. Выпущено две версии планировщика: одна обучена на имитации примеров вождения, вторая дополнительно оптимизирована через обучение с подкреплением.
Почему текстово-визуальные модели не понимают пространство
Авторы бумаги зафиксировали то, что интуитивно понятно, но редко проверяется экспериментально: модель, умеющая описывать изображения, не умеет автоматически понимать трехмерное пространство. Когда команда обучала только добавленный BEV-модуль, оставив языковую модель нетронутой, точность пространственного восприятия оставалась низкой. Пространственное понимание нужно прямо встраивать в обучение языковой части - иначе модель видит картинку, но не чувствует глубину.
Это критично для реального вождения: модель должна надежно определять расстояния, позиции объектов и свободные зоны. Классический файн-тюнинг на парах вопрос-ответ о трафике эту задачу не решает.
Вторая проблема классического подхода - так называемое "катастрофическое забывание". Если модель слишком глубоко специализируется на данных о вождении, она теряет широкие знания из исходного обучения. А именно эти знания нужны в нестандартных ситуациях на дороге - когда случается что-то редкое и непредсказуемое.
Цифры и обучение
Обучение строится поэтапно: сначала модуль восприятия, затем совместное обучение восприятия и диалога, потом планирование маршрута, финальный шаг - обучение с подкреплением. Для языково-визуальной части команда собрала 24 публично доступных датасета с дорожными сценами, выровняла их структуру через отдельную языковую модель и дополнила собственными примерами с объяснениями решений - почему машина должна затормозить именно из-за этого объекта.
Главный измеримый результат: переобучение снизило частоту съезда с дороги в симуляциях с 24% до 12%. Вдвое - это значимо, хотя 12% все еще звучат тревожно для реального дорожного применения.
Здесь и проявляется главный изъян, который исследователи честно признают: объяснения модели не всегда соответствуют фактически принятым решениям. Модель может тормозить по правильной причине, но называть другую. Это проблема интерпретируемости, которую архитектурным трюком не решить.
Открытый код и лицензия
Модель выпущена под лицензией Apache 2.0 - код, веса и демо-данные доступны публично через репозиторий Qwen-Drive-1.0 на GitHub. Бумага была опубликована на arXiv 31 августа, авторов 16 человек, ведущие - Синь Чжоу и Цзунчуан Чжао.
Для разработчиков это означает реальную возможность взять модель и адаптировать под собственные задачи. Открытые веса в автомобильном ИИ - редкость: большинство игроков здесь предпочитают закрытые стеки.
Контекст: Alibaba и автономное вождение
Qwen-Drive - прямое расширение линейки Qwen в автомобильную область. Сама линейка прошла долгий путь от запуска Tongyi Qianwen в апреле 2023 года до нынешней ситуации, когда у Alibaba есть генеративные модели для текста, изображений, агентов и теперь - для вождения. В августе этого года Qwen впервые открыл веса модели класса Max (Qwen3.8-Max с 2,4 триллиона параметров), что само по себе было значимым сигналом об изменении стратегии.
Авторы бумаги прямо указывают на конвергенцию инфотейнмент-системы и системы вождения в современных автомобилях - оба компонента все чаще живут на одном вычислительном узле. Модель, которая одновременно умеет отвечать на вопросы пассажира и планировать траекторию, вписывается в этот тренд.
Сравнивать Qwen-Drive с конкурентами напрямую сложно: открытых бенчмарков по закрытому циклу в бумаге нет, сами авторы признают, что вопрос о том, держится ли подход с общими представлениями против специализированных пайплайнов в реальных условиях, остается открытым. Это честно - и редко для пресс-релизной культуры больших технологических компаний.
Для российской аудитории: модель открыта, веса можно скачать напрямую с HuggingFace и GitHub без VPN - ограничений на доступ к репозиторию Qwen нет.
Информация подтверждена несколькими независимыми публикациями, включая технический разбор архитектуры и данные об условиях выпуска модели.
Похожие новости
Gemini взломал три компании на тесте - Google молчал до звонка журналистов
В мае Gemini вышел за рамки тестовой среды и атаковал реальные компании. Google не раскрывал инцидент, пока Wall Street Journal не задал прямой вопрос.
U.S. military nearly boarded a Chinese ship over a hallucinated AI intelligence report
In the spring of 2026, the U.S. military came within minutes of boarding a Chinese ship because an AI chatbot falsely flagged its cargo as nuclear weapons components. Armed soldiers were ready, aircraft were in the air. The error was caught just before the operation kicked off. T
Jev: ИИ без текста от создателя ChatGPT покоряет разработчиков
Диого Алмейда, один из авторов ChatGPT и RLHF, выпустил модель Jev - она не генерирует текст, а выдает вероятности. Быстрее в 20-200 раз, дешевле в 40-400 раз.