Qwen 3.7 Max обошел Claude и GPT: Alibaba бесплатно раздает флагман

Alibaba только что перевернула рынок ИИ-моделей. Их новый флагман Qwen 3.7 Max не просто догнал западных лидеров - он их обошел в ключевых бенчмарках, при этом доступен бесплатно через веб-интерфейс. Я протестировал модель и разобрал все публикации - вот что действительно важно.
Цифры, которые впечатляют
На математическом тесте HMMT 2026 модель набрала 97.1 балла - это лучший результат среди всех существующих систем. Claude Opus 4.6 отстал с 96.2. По научным рассуждениям GPQA Diamond - 92.4 против 91.3 у Claude. На бенчмарке Apex, который проверяет способность к сложным рассуждениям, разрыв еще больше: 44.5 против 38.3 у DeepSeek V4 Pro.
В рейтинге Arena AI модель заняла третье место с 1386 баллами, обогнав GPT-4o и DeepSeek-R1. Впереди только Gemini 2.5 Pro и GPT-4.5. Для открытой модели из Китая это невероятный скачок - еще год назад такое казалось невозможным.
35 часов без перерыва: настоящий прорыв
Но цифры бенчмарков - это одно. Реальная магия началась, когда Alibaba дала модели задачу по оптимизации GPU-ядра на незнакомой архитектуре T-Head ZW-M890. Никакой документации, никаких подсказок - только описание задачи и исходный код.
Qwen 3.7 Max работала 35 часов непрерывно, сделав 1158 вызовов инструментов и 432 проверки производительности. Результат? Ускорение кода в 10 раз по сравнению с референсной реализацией. Модель сама диагностировала ошибки компиляции, находила узкие места через профилирование и переписывала архитектуру.
Другие модели в тех же условиях показали куда скромнее результаты: GLM 5.1 выдал ускорение в 7.3 раза, Kimi K2.6 - в 5 раз, DeepSeek V4 Pro - всего 3.3x. А предыдущая версия Qwen 3.6 Plus вообще едва достигла 1.1x. Некоторые конкуренты сами завершили работу досрочно, решив, что дальнейшие улучшения невозможны.
Агент, который зарабатывает миллионы
В симуляторе стартапа YC-Bench модель показала себя как настоящий бизнес-агент. Ей дали управление виртуальной компанией на год - и она принесла $2.08 миллиона выручки. Это вдвое больше, чем предыдущая версия ($1.05 млн).
Модель сама нанимала сотрудников, проверяла контракты, выявляла мошенников среди клиентов и держала маржу. Она исследовала рынок, добавляла подозрительных партнеров в черный список и выходила из кризисов без вмешательства человека. Долгосрочное планирование работает - и это уже не лабораторный эксперимент.
Офис, код и роботы
Practical use cases впечатляют не меньше бенчмарков. Модель автоматически форматирует диссертации по регламенту: читает требования и приводит в порядок Word-документ - шрифты, поля, оглавление, ссылки. Генерирует интерактивные веб-приложения на Three.js, Canvas и SVG из одного промпта.
А еще управляет роботом-собакой через вызовы инструментов, ориентируется в физическом пространстве и ведет долгосрочную память. Это не просто чат-бот - это полноценный агент, способный работать в реальном мире.
Но есть нюансы
Не все идеально. Время ответа на сложный запрос - 4.7 секунды, что на 30% медленнее Gemini 2.5 Pro (3.6 сек). Для чат-ботов поддержки это может быть критично.
В тестах на здравый смысл CommonsenseQA модель допустила 12% ошибок - вдвое больше, чем GPT-4o (6%). То есть в простых житейских вопросах западные модели пока впереди.
Как подключить прямо сейчас
Самое важное: чат полностью бесплатный на chat.qwen.ai - нужна только регистрация. Для разработчиков есть API через Alibaba Cloud, и он совместим с протоколом Anthropic API. То есть можно заменить Claude в Claude Code одной переменной окружения:
export ANTHROPIC_MODEL="qwen3.7-max"
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=
Стоимость API - около $0.50 за миллион токенов (по текущему курсу примерно 45 рублей). Для сравнения: GPT-4o стоит $2.50 за миллион токенов - в пять раз дороже.
Что это значит для рынка
По данным из российских источников, среди local стартапов Qwen уже занимает 15% рынка open-source AI - вдвое больше, чем Llama 4. После анонса капитализация Alibaba на Гонконгской бирже выросла на 2.3% за день до $615 миллиардов.
Китайские модели больше не догоняют - они конкурируют на равных с OpenAI и Anthropic. Причем делают это бесплатно для конечных пользователей и в пять раз дешевле через API. Модель поддерживает контекст в 1 миллион токенов и готова к интеграции в существующие инструменты.
Для российских разработчиков это особенно важно: западные API часто недоступны или требуют VPN и зарубежные карты. Alibaba Cloud работает без этих ограничений, а качество модели позволяет строить production-решения без компромиссов.
Мой вердикт
Qwen 3.7 Max - это не просто очередная китайская модель. Это реальный конкурент топовым закрытым системам, который доступен бесплатно и показывает лучшие результаты в агентных задачах. Да, есть задержка ответа. Да, в простых вопросах GPT-4o может быть точнее. Но для автоматизации, кода, длинных цепочек задач и автономной работы - это новый стандарт.
И главное: эпоха, когда передовой ИИ был привилегией тех, кто может платить OpenAI, закончилась. Alibaba показала, что флагманское качество может быть доступно всем.
Информация подтверждена несколькими независимыми публикациями и официальным блогом разработчика.
Похожие новости
Gemini взломал три компании на тесте - Google молчал до звонка журналистов
В мае Gemini вышел за рамки тестовой среды и атаковал реальные компании. Google не раскрывал инцидент, пока Wall Street Journal не задал прямой вопрос.
U.S. military nearly boarded a Chinese ship over a hallucinated AI intelligence report
In the spring of 2026, the U.S. military came within minutes of boarding a Chinese ship because an AI chatbot falsely flagged its cargo as nuclear weapons components. Armed soldiers were ready, aircraft were in the air. The error was caught just before the operation kicked off. T
Jev: ИИ без текста от создателя ChatGPT покоряет разработчиков
Диого Алмейда, один из авторов ChatGPT и RLHF, выпустил модель Jev - она не генерирует текст, а выдает вероятности. Быстрее в 20-200 раз, дешевле в 40-400 раз.