I
ИИ-чатIBMGranite 4.2LLMагентский ИИGRPO

IBM Granite 4.2: три модели с многоступенчатым RL и агентским мышлением

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·5 мин чтения
IBM Granite 4.2: три модели с многоступенчатым RL и агентским мышлением

Когда IBM перестает играть в догонялки

Два года назад семейство Granite воспринималось как корпоративный ответ IBM на хайп вокруг GPT - добротное, но без претензий на лидерство. Granite 4.2, вышедший 25 августа 2026 года, - это другая история. IBM не просто обновила веса: компания переосмыслила весь пайплайн обучения, сделав ставку на агентские сценарии и верифицируемые награды в RL. Разберем, что здесь реально интересно.

Архитектура: ничего революционного, зато честно

Все три модели - 3B, 8B и 30B параметров - построены на классическом decoder-only трансформере. Grouped Query Attention с 40 головами внимания и 8 KV-головами, SwiGLU-активации, RMSNorm с ε = 1e-5, раздельные эмбеддинги для входа и выхода, bfloat16 - стандартный современный набор без экзотики. RoPE с θ = 10 000 000 обеспечивает длинный контекст, что важно для следующего пункта.

Модели различаются по глубине и ширине: у 3B - 40 слоев, эмбеддинг 2560, MLP hidden size 8192; у 8B и 30B - тоже 40 и 64 слоя соответственно, эмбеддинг 4096, но MLP вырастает до 12 800 и 32 768. Длина последовательности у всех одинакова - 131 072 токена в базовом режиме.

Пятифазный предтрейнинг на 15 триллионах токенов

Предобучение прошло на ~15 триллионах токенов по пятиэтапной схеме. Первые две фазы - широкое покрытие веба, третья и четвертая - прогрессивное повышение качества данных, пятая - специализированная тренировка длинного контекста с окном до 512 000 токенов. Это уже серьезно: большинство открытых моделей сопоставимого размера останавливаются на 128K.

Для сравнения: Llama 3.1 8B обучалась на ~15T токенов с контекстом 128K, Qwen2.5 7B - на 18T с контекстом 128K. Granite 4.2 8B здесь выигрывает по длине контекста, хотя объем данных сопоставим.

SFT: 7,2 миллиона примеров с агентским уклоном

Стадия supervised fine-tuning использовала 7,2 млн примеров (~100B токенов), из которых 31,6% - агентские сценарии, остальные 68,4% - классические задачи. В агентской части доминирует software engineering (69%), затем идут вызовы инструментов (12,1%) и работа с терминалом (8,0%).

Для генерации агентских траекторий задействован внушительный зоопарк фреймворков: OpenHands, OpenCode, SWE-agent, Terminus-2, Gemini CLI, Goose, Hermes, Codex и другие. Это не просто красивый список - каждый из них генерировал реальные траектории взаимодействия, которые потом фильтровались LLM-судьями GPT-OSS-120B и Gemma 4, дедуплицировались через SHA-256 и прогонялись через эвристические фильтры. Галлюцинированные вызовы инструментов отсеивались отдельно.

Обучение SFT запускалось на 32-128 узлах в зависимости от размера модели, каждый узел - 4× Grace/GB200. Скорость обучения: 1.0e-5 с прогревом, вторая фаза - 3.0e-6.

Многоступенчатый RL: главная фишка Granite 4.2

Здесь IBM сделала, пожалуй, самое нетривиальное решение. После SFT модели проходят асинхронный GRPO (Group Relative Policy Optimization) - многостадийный RL-курс.

Первый блок - foundational RL - общий для всех трех размеров: верифицируемые награды, математическое мышление, усилители отдельных навыков. Второй блок - agentic RL - только для 8B и 30B: последовательная тренировка на реальных sandbox-средах по схеме SWE → Terminal → Search. Модель 3B этот блок пропускает - разумное решение, учитывая вычислительные ограничения.

Завершает пайплайн RLHF - для выравнивания тона, безопасности и эффективности рассуждений.

Инфраструктура обучения - кластер NVIDIA GB200 NVL72 от CoreWeave с Fat-Tree NDR InfiniBand. Программный стек - NeMo-RL и NeMo-Gym для стандартизации наград и взаимодействия со средами.

Что показывают бенчмарки

Модель 30B достигает state-of-the-art на SWE-Bench Pro и Terminal-Bench среди открытых моделей сопоставимого размера. Все три варианта демонстрируют улучшения в удержании длинного контекста и многоязычном следовании инструкциям.

Это важный момент: 30B - не "маленькая" модель, но она значительно дешевле в инференсе, чем 70B+ гиганты вроде Llama 3.3 70B или Qwen2.5 72B. Если Granite 4.2 30B реально конкурирует с ними на агентских задачах - это меняет экономику развертывания для корпоративных клиентов IBM.

Развертывание: от vLLM до квантизации

IBM выпустила квантизованные варианты в форматах FP8, NVFP4, MXFP4 и GGUF - набор, закрывающий практически все популярные инференс-движки. Модели совместимы с vLLM и SGLang, экспонируют OpenAI-совместимый API с нативным function calling в формате OpenAI.

Для российских пользователей: модели доступны на Hugging Face под лицензией Apache 2.0, скачать веса можно без ограничений, VPN не требуется для доступа к самим моделям. Запустить локально через Ollama или llama.cpp (через GGUF) - вполне реально даже на потребительском железе для 3B и 8B вариантов.

Почему это важно прямо сейчас

Granite 4.2 - это сигнал о том, что "агентский" RL переходит из исследовательских лабораторий в промышленные пайплайны. IBM не первая: Qwen2.5-Coder и DeepSeek-R1 также использовали GRPO, но многоступенчатый агентский блок с реальными sandbox-средами - это уже следующий уровень сложности.

Apache 2.0 делает модели привлекательными для коммерческого использования без роялти. В сочетании с OpenAI-совместимым API это означает, что любая кодовая база, написанная под GPT-4o или Claude, теоретически переключается на Granite 4.2 одной строкой конфига.

Мне кажется, что ставка IBM на агентские сценарии именно в диапазоне 3-30B - это стратегически верное решение. Большие модели хороши для демо, но предприятия разворачивают то, что помещается в их GPU-кластеры и не разоряет бюджет на инференс. Granite 4.2 30B с агентским RL - это попытка занять именно эту нишу.

Информация подтверждена несколькими независимыми публикациями, детально разобравшими технические характеристики и архитектурные решения новых моделей.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости