IBM выпустила Granite PatchTST-FM-r2: второе место в мире без дообучения

Когда компания выпускает модель с пометкой "второе место в мире" - это повод разобраться, что именно стоит за этой цифрой. IBM 9 сентября 2026 года опубликовала Granite Time Series PatchTST-FM-r2 - преемника прошлогодней r1-версии в семействе Granite для прогнозирования временных рядов. Модель работает в режиме zero-shot: загружаешь данные, получаешь прогноз. Никакого дообучения, никаких месяцев работы ML-команды.
Что показывает GIFT-Eval
GIFT-Eval - один из наиболее полных бенчмарков для моделей прогнозирования временных рядов. Там два ключевых показателя: CRPS и MASE, и оба нужно минимизировать. По состоянию на 8 сентября 2026 года PatchTST-FM-r2 занимает второе место среди воспроизводимых zero-shot моделей по обоим метрикам. CRPS составил 0.467 (геометрическое среднее), MASE - 0.6846. Впереди только TimesFM-3 от Google.
Но есть нюанс, который IBM честно обозначает. На бенчмарке есть отдельная категория - pretrained-модели, которым разрешено включать тренировочные части оценочных датасетов в свой корпус предобучения. Это другие правила игры. Даже в этом расширенном сравнении PatchTST-FM-r2 держится третьим по CRPS и четвертым по MASE среди воспроизводимых моделей - обгоняя Chronos-2, Timer-S1 и несколько вариантов Toto, причем некоторые из них заметно крупнее.
Среди моделей с открытой коммерческой лицензией PatchTST-FM-r2 занимает первое место в своей категории. Это принципиальный момент для бизнеса.
Архитектура: зачем понадобились conformer-блоки
r2 унаследовал от предшественника patch-based представление данных, но заменил стандартные трансформерные блоки на conformer-блоки - архитектуру, пришедшую из распознавания речи. Каждый такой блок устроен так: два полушаговых feed-forward слоя обрамляют multi-head self-attention и слой временной свертки. Ядра свертки чередуются по схеме {5, 5, 3, 3}.
Логика здесь понятная: свертка работает с локальными паттернами в коротком окне, attention - с дальними зависимостями между патчами. Вместе они перекрывают оба масштаба временного ряда.
Технические характеристики по сравнению с r1 изменились существенно: - 385 млн параметров (r1 был заметно меньше) - 30 conformer-блоков против 20 в r1 - скрытая размерность 1024 - контекст до 8192 шагов - патчи длиной 16, шаг 8, перекрытие 50%, взвешивание окном Хэмминга - 99 квантилей прогноза - то есть модель выдает не точку, а распределение вероятностей
Последнее - важное практическое преимущество. Получить интервалы неопределенности без отдельной калибровки - это то, о чем многие команды мечтают годами.
Добавили и поддержку импутации пропущенных значений. В реальных промышленных данных пропуски - норма, а не исключение, так что это не косметика.
Лицензия и данные: что IBM раскрыла
Модель выходит под двойной лицензией: Apache 2.0 и OpenMDW 1.0 от Linux Foundation. OpenMDW - относительно новый фреймворк лицензирования, созданный специально для ИИ-моделей и датасетов. Пользователь выбирает любую из двух. Обе разрешают коммерческое использование, модификацию и распространение без серьезных ограничений.
Состав обучающего корпуса IBM задокументировала полностью - редкость для промышленных моделей такого класса. Четыре источника: - датасеты из GiftEvalPretrain - синтетические данные на основе KernelSynth с модифицированными периодическими ядрами - TSMixup-корпус по методологии из статьи о Chronos, но только на датасетах за пределами GIFT-Eval - около 500 000 синтетических последовательностей CauKer длиной 4096 шагов каждая, сгенерированных командой IBM FlowState
Такая прозрачность нужна для compliance-аудита. Компания, которая собирается встроить модель в финансовый или промышленный продукт, обязана понимать, на каких данных та обучена.
Все - веса, архитектура, код воспроизведения бенчмарков, инференс-пайплайн - опубликовано в репозитории granite-tsfm на GitHub. Модель обратно совместима с чекпоинтами PatchTST-FM-r1.
Потоковая обработка через Confluent
Отдельная история - интеграция с Confluent Cloud. Еще 2 сентября IBM и Confluent запустили Early Access для Granite time-series моделей на AWS. Суть: модели вызываются прямо из Apache Flink SQL через функции AI_FORECAST и AI_DETECT_ANOMALIES. Результаты пишутся в Kafka-топики и расходятся оттуда в дашборды, алертинг и агентские системы.
Практически это означает: прогнозирование и детектирование аномалий работают прямо в слое потоковой обработки, без отдельного model-serving инфраструктуры. IBM приводит пример с производственной линией шоколадного завода - температура, скорость, пропускная способность каждые несколько секунд, и модель в потоке видит отклонение до того, как оно превратилось в брак.
Oни называют цифры: 5-10-кратный рост производительности, более 44 млн загрузок моделей. Эти заявления пока не подтверждены независимыми исследованиями, и дата общей доступности (GA) не объявлена.
Что это значит для рынка
Granite PatchTST-FM-r2 закрывает реальный пробел. До сих пор выбор был такой: либо мощная модель с ограничительной лицензией, либо открытая, но слабее. Теперь у разработчиков есть вариант, который занимает второе место в публичном бенчмарке и при этом разрешает коммерческое использование без юридических рисков.
Для российских команд модель технически доступна через Hugging Face и репозиторий granite-tsfm. Для работы с Hugging Face в ряде случаев может потребоваться VPN - сам сервис в РФ не заблокирован, но бывают нестабильности. Confluent Cloud на AWS в Early Access - отдельный вопрос доступности, который стоит уточнять напрямую.
Информация о модели подтверждена несколькими независимыми публикациями, включая технический разбор архитектуры и данные бенчмарков.
Похожие новости
Crusoe привлек $3,9 млрд: заводские ИИ-фабрики против гигантских дата-центров
Денверская компания Crusoe закрыла раунд Series F на $3,9 млрд, оценив себя в $30,9 млрд - втрое дороже, чем год назад. Деньги пойдут на модульные ИИ-фабрики Spark и мегакампусы в Техасе.
Claude Code перезапустил Projects: несколько агентов в облаке под одной крышей
Anthropic обновила Projects в Claude Code: теперь команда агентов работает параллельно, делит память и файлы, а координатор следит за порядком.
GitHub переписал движок Copilot на Rust с помощью самого Copilot
GitHub перевел runtime Copilot CLI на нативный Rust, задействовав агентов Copilot для миграции 800 000 строк кода - масштаб, который раньше был просто нерентабелен.