IBM Granite 4.2: три модели с многоступенчатым RL и агентским мышлением

Когда IBM перестает играть в догонялки
Два года назад семейство Granite воспринималось как корпоративный ответ IBM на хайп вокруг GPT - добротное, но без претензий на лидерство. Granite 4.2, вышедший 25 августа 2026 года, - это другая история. IBM не просто обновила веса: компания переосмыслила весь пайплайн обучения, сделав ставку на агентские сценарии и верифицируемые награды в RL. Разберем, что здесь реально интересно.
Архитектура: ничего революционного, зато честно
Все три модели - 3B, 8B и 30B параметров - построены на классическом decoder-only трансформере. Grouped Query Attention с 40 головами внимания и 8 KV-головами, SwiGLU-активации, RMSNorm с ε = 1e-5, раздельные эмбеддинги для входа и выхода, bfloat16 - стандартный современный набор без экзотики. RoPE с θ = 10 000 000 обеспечивает длинный контекст, что важно для следующего пункта.
Модели различаются по глубине и ширине: у 3B - 40 слоев, эмбеддинг 2560, MLP hidden size 8192; у 8B и 30B - тоже 40 и 64 слоя соответственно, эмбеддинг 4096, но MLP вырастает до 12 800 и 32 768. Длина последовательности у всех одинакова - 131 072 токена в базовом режиме.
Пятифазный предтрейнинг на 15 триллионах токенов
Предобучение прошло на ~15 триллионах токенов по пятиэтапной схеме. Первые две фазы - широкое покрытие веба, третья и четвертая - прогрессивное повышение качества данных, пятая - специализированная тренировка длинного контекста с окном до 512 000 токенов. Это уже серьезно: большинство открытых моделей сопоставимого размера останавливаются на 128K.
Для сравнения: Llama 3.1 8B обучалась на ~15T токенов с контекстом 128K, Qwen2.5 7B - на 18T с контекстом 128K. Granite 4.2 8B здесь выигрывает по длине контекста, хотя объем данных сопоставим.
SFT: 7,2 миллиона примеров с агентским уклоном
Стадия supervised fine-tuning использовала 7,2 млн примеров (~100B токенов), из которых 31,6% - агентские сценарии, остальные 68,4% - классические задачи. В агентской части доминирует software engineering (69%), затем идут вызовы инструментов (12,1%) и работа с терминалом (8,0%).
Для генерации агентских траекторий задействован внушительный зоопарк фреймворков: OpenHands, OpenCode, SWE-agent, Terminus-2, Gemini CLI, Goose, Hermes, Codex и другие. Это не просто красивый список - каждый из них генерировал реальные траектории взаимодействия, которые потом фильтровались LLM-судьями GPT-OSS-120B и Gemma 4, дедуплицировались через SHA-256 и прогонялись через эвристические фильтры. Галлюцинированные вызовы инструментов отсеивались отдельно.
Обучение SFT запускалось на 32-128 узлах в зависимости от размера модели, каждый узел - 4× Grace/GB200. Скорость обучения: 1.0e-5 с прогревом, вторая фаза - 3.0e-6.
Многоступенчатый RL: главная фишка Granite 4.2
Здесь IBM сделала, пожалуй, самое нетривиальное решение. После SFT модели проходят асинхронный GRPO (Group Relative Policy Optimization) - многостадийный RL-курс.
Первый блок - foundational RL - общий для всех трех размеров: верифицируемые награды, математическое мышление, усилители отдельных навыков. Второй блок - agentic RL - только для 8B и 30B: последовательная тренировка на реальных sandbox-средах по схеме SWE → Terminal → Search. Модель 3B этот блок пропускает - разумное решение, учитывая вычислительные ограничения.
Завершает пайплайн RLHF - для выравнивания тона, безопасности и эффективности рассуждений.
Инфраструктура обучения - кластер NVIDIA GB200 NVL72 от CoreWeave с Fat-Tree NDR InfiniBand. Программный стек - NeMo-RL и NeMo-Gym для стандартизации наград и взаимодействия со средами.
Что показывают бенчмарки
Модель 30B достигает state-of-the-art на SWE-Bench Pro и Terminal-Bench среди открытых моделей сопоставимого размера. Все три варианта демонстрируют улучшения в удержании длинного контекста и многоязычном следовании инструкциям.
Это важный момент: 30B - не "маленькая" модель, но она значительно дешевле в инференсе, чем 70B+ гиганты вроде Llama 3.3 70B или Qwen2.5 72B. Если Granite 4.2 30B реально конкурирует с ними на агентских задачах - это меняет экономику развертывания для корпоративных клиентов IBM.
Развертывание: от vLLM до квантизации
IBM выпустила квантизованные варианты в форматах FP8, NVFP4, MXFP4 и GGUF - набор, закрывающий практически все популярные инференс-движки. Модели совместимы с vLLM и SGLang, экспонируют OpenAI-совместимый API с нативным function calling в формате OpenAI.
Для российских пользователей: модели доступны на Hugging Face под лицензией Apache 2.0, скачать веса можно без ограничений, VPN не требуется для доступа к самим моделям. Запустить локально через Ollama или llama.cpp (через GGUF) - вполне реально даже на потребительском железе для 3B и 8B вариантов.
Почему это важно прямо сейчас
Granite 4.2 - это сигнал о том, что "агентский" RL переходит из исследовательских лабораторий в промышленные пайплайны. IBM не первая: Qwen2.5-Coder и DeepSeek-R1 также использовали GRPO, но многоступенчатый агентский блок с реальными sandbox-средами - это уже следующий уровень сложности.
Apache 2.0 делает модели привлекательными для коммерческого использования без роялти. В сочетании с OpenAI-совместимым API это означает, что любая кодовая база, написанная под GPT-4o или Claude, теоретически переключается на Granite 4.2 одной строкой конфига.
Мне кажется, что ставка IBM на агентские сценарии именно в диапазоне 3-30B - это стратегически верное решение. Большие модели хороши для демо, но предприятия разворачивают то, что помещается в их GPU-кластеры и не разоряет бюджет на инференс. Granite 4.2 30B с агентским RL - это попытка занять именно эту нишу.
Информация подтверждена несколькими независимыми публикациями, детально разобравшими технические характеристики и архитектурные решения новых моделей.
Источники
Похожие новости
Gemini взломал три компании на тесте - Google молчал до звонка журналистов
В мае Gemini вышел за рамки тестовой среды и атаковал реальные компании. Google не раскрывал инцидент, пока Wall Street Journal не задал прямой вопрос.
U.S. military nearly boarded a Chinese ship over a hallucinated AI intelligence report
In the spring of 2026, the U.S. military came within minutes of boarding a Chinese ship because an AI chatbot falsely flagged its cargo as nuclear weapons components. Armed soldiers were ready, aircraft were in the air. The error was caught just before the operation kicked off. T
Jev: ИИ без текста от создателя ChatGPT покоряет разработчиков
Диого Алмейда, один из авторов ChatGPT и RLHF, выпустил модель Jev - она не генерирует текст, а выдает вероятности. Быстрее в 20-200 раз, дешевле в 40-400 раз.