I
Генерация кодаIBMGranitePatchTST-FM-r2временные рядыzero-shot

IBM выпустила Granite PatchTST-FM-r2: второе место в мире без дообучения

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
IBM выпустила Granite PatchTST-FM-r2: второе место в мире без дообучения

Когда компания выпускает модель с пометкой "второе место в мире" - это повод разобраться, что именно стоит за этой цифрой. IBM 9 сентября 2026 года опубликовала Granite Time Series PatchTST-FM-r2 - преемника прошлогодней r1-версии в семействе Granite для прогнозирования временных рядов. Модель работает в режиме zero-shot: загружаешь данные, получаешь прогноз. Никакого дообучения, никаких месяцев работы ML-команды.

Что показывает GIFT-Eval

GIFT-Eval - один из наиболее полных бенчмарков для моделей прогнозирования временных рядов. Там два ключевых показателя: CRPS и MASE, и оба нужно минимизировать. По состоянию на 8 сентября 2026 года PatchTST-FM-r2 занимает второе место среди воспроизводимых zero-shot моделей по обоим метрикам. CRPS составил 0.467 (геометрическое среднее), MASE - 0.6846. Впереди только TimesFM-3 от Google.

Но есть нюанс, который IBM честно обозначает. На бенчмарке есть отдельная категория - pretrained-модели, которым разрешено включать тренировочные части оценочных датасетов в свой корпус предобучения. Это другие правила игры. Даже в этом расширенном сравнении PatchTST-FM-r2 держится третьим по CRPS и четвертым по MASE среди воспроизводимых моделей - обгоняя Chronos-2, Timer-S1 и несколько вариантов Toto, причем некоторые из них заметно крупнее.

Среди моделей с открытой коммерческой лицензией PatchTST-FM-r2 занимает первое место в своей категории. Это принципиальный момент для бизнеса.

Архитектура: зачем понадобились conformer-блоки

r2 унаследовал от предшественника patch-based представление данных, но заменил стандартные трансформерные блоки на conformer-блоки - архитектуру, пришедшую из распознавания речи. Каждый такой блок устроен так: два полушаговых feed-forward слоя обрамляют multi-head self-attention и слой временной свертки. Ядра свертки чередуются по схеме {5, 5, 3, 3}.

Логика здесь понятная: свертка работает с локальными паттернами в коротком окне, attention - с дальними зависимостями между патчами. Вместе они перекрывают оба масштаба временного ряда.

Технические характеристики по сравнению с r1 изменились существенно: - 385 млн параметров (r1 был заметно меньше) - 30 conformer-блоков против 20 в r1 - скрытая размерность 1024 - контекст до 8192 шагов - патчи длиной 16, шаг 8, перекрытие 50%, взвешивание окном Хэмминга - 99 квантилей прогноза - то есть модель выдает не точку, а распределение вероятностей

Последнее - важное практическое преимущество. Получить интервалы неопределенности без отдельной калибровки - это то, о чем многие команды мечтают годами.

Добавили и поддержку импутации пропущенных значений. В реальных промышленных данных пропуски - норма, а не исключение, так что это не косметика.

Лицензия и данные: что IBM раскрыла

Модель выходит под двойной лицензией: Apache 2.0 и OpenMDW 1.0 от Linux Foundation. OpenMDW - относительно новый фреймворк лицензирования, созданный специально для ИИ-моделей и датасетов. Пользователь выбирает любую из двух. Обе разрешают коммерческое использование, модификацию и распространение без серьезных ограничений.

Состав обучающего корпуса IBM задокументировала полностью - редкость для промышленных моделей такого класса. Четыре источника: - датасеты из GiftEvalPretrain - синтетические данные на основе KernelSynth с модифицированными периодическими ядрами - TSMixup-корпус по методологии из статьи о Chronos, но только на датасетах за пределами GIFT-Eval - около 500 000 синтетических последовательностей CauKer длиной 4096 шагов каждая, сгенерированных командой IBM FlowState

Такая прозрачность нужна для compliance-аудита. Компания, которая собирается встроить модель в финансовый или промышленный продукт, обязана понимать, на каких данных та обучена.

Все - веса, архитектура, код воспроизведения бенчмарков, инференс-пайплайн - опубликовано в репозитории granite-tsfm на GitHub. Модель обратно совместима с чекпоинтами PatchTST-FM-r1.

Потоковая обработка через Confluent

Отдельная история - интеграция с Confluent Cloud. Еще 2 сентября IBM и Confluent запустили Early Access для Granite time-series моделей на AWS. Суть: модели вызываются прямо из Apache Flink SQL через функции AI_FORECAST и AI_DETECT_ANOMALIES. Результаты пишутся в Kafka-топики и расходятся оттуда в дашборды, алертинг и агентские системы.

Практически это означает: прогнозирование и детектирование аномалий работают прямо в слое потоковой обработки, без отдельного model-serving инфраструктуры. IBM приводит пример с производственной линией шоколадного завода - температура, скорость, пропускная способность каждые несколько секунд, и модель в потоке видит отклонение до того, как оно превратилось в брак.

Oни называют цифры: 5-10-кратный рост производительности, более 44 млн загрузок моделей. Эти заявления пока не подтверждены независимыми исследованиями, и дата общей доступности (GA) не объявлена.

Что это значит для рынка

Granite PatchTST-FM-r2 закрывает реальный пробел. До сих пор выбор был такой: либо мощная модель с ограничительной лицензией, либо открытая, но слабее. Теперь у разработчиков есть вариант, который занимает второе место в публичном бенчмарке и при этом разрешает коммерческое использование без юридических рисков.

Для российских команд модель технически доступна через Hugging Face и репозиторий granite-tsfm. Для работы с Hugging Face в ряде случаев может потребоваться VPN - сам сервис в РФ не заблокирован, но бывают нестабильности. Confluent Cloud на AWS в Early Access - отдельный вопрос доступности, который стоит уточнять напрямую.

Информация о модели подтверждена несколькими независимыми публикациями, включая технический разбор архитектуры и данные бенчмарков.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости