Reflection выпустила Beam: открытая модель с 501 млрд параметров за треть цены

Когда DeepSeek в начале 2025 года потряс индустрию своей эффективностью, многие западные лаборатории восприняли это как сигнал тревоги. Reflection - бруклинский стартап, основанный двумя бывшими исследователями Google DeepMind, - судя по всему, воспринял его как техническое задание. Спустя два года работы компания выпустила Beam, свою первую открытую модель, и сразу заявила, что та бьет ведущие западные open-weight модели и не уступает китайским флагманам при кратно меньших затратах на инференс.
Что внутри
Beam - это mixture-of-experts архитектура с 501 млрд суммарных параметров, из которых при обработке каждого токена активируются только 23 млрд. Для сравнения: GLM-5.2 от Z.ai имеет около 744 млрд суммарных параметров при 40 млрд активных. Beam предобучена на 23,8 трлн токенов и поддерживает контекстное окно в 1 млн токенов. Модель работает только с текстом - мультимодальности нет, хотя Reflection говорит, что Beam может обрабатывать содержимое других форматов, если оно представлено в текстовом виде.
Особняком стоит этап обучения с подкреплением. Reflection прогнала его на 10 500 GPU Nvidia GB300 в течение более четырех недель - по словам компании, один из крупнейших RL-прогонов среди открытых лабораторий. Примечательно, что скоринг на бенчмарках продолжал расти вплоть до конца обучения без признаков плато даже после 80 млн роллаутов. Это говорит о том, что модель не уперлась в потолок - что само по себе интересный сигнал для следующего поколения.
Цифры против конкурентов
На бенчмарках по агентному кодированию картина неоднозначная, и Reflection этого не скрывает. На SWE-Bench Verified Beam набирает 80,9 против 77,6 у Inkling (открытая модель от Thinking Machines Lab Миры Мурати) и 70,7 у Nemotron 3 Ultra. На Terminal Bench v2.1 - 80,1, тогда как GLM-5.2 дает 81,0. На SWEBench Multilingual Beam показывает 78,0 против 67,7 у Nemotron.
Но есть и откровенно слабые места. Kimi K3 на SWE Bench Pro v2-Hard набирает 84,3 против 77,2 у Beam, а DeepSeek V4.1 Flash на DeepSWE v1.1 достигает 74,2 - хотя по ряду других бенчмарков данные не опубликованы. Сама Reflection признает: более мощные открытые модели вроде Kimi K3 превосходят Beam по пиковой производительности. Ставка сделана не на первое место в рейтинге, а на соотношение результата к вычислительным затратам.
По этому показателю Reflection утверждает, что Beam использует в 3-4 раза меньше инференс-вычислений, чем GLM-5.2 при сопоставимом качестве. Независимой верификации этих цифр пока нет.
"Эмерджентные" сюрпризы
Во время RL-фазы произошло кое-что неожиданное. Reflection обучала модель на смеси задач: рассуждение, разработка ПО, работа с терминалом. Веб-браузинга в этой смеси не было. Тем не менее Beam самостоятельно научилась обращаться к веб-страницам, делать запросы к другим языковым моделям и подтягивать документы из внешних сервисов. Компания называет это "эмерджентными способностями" - явлением, когда модель осваивает навыки, которым ее явно не учили.
Reflection показала несколько демо: живая карта метро Нью-Йорка с обновлением в реальном времени, небольшая 3D-игра и ноутбук для дообучения другой ИИ-модели. Пользователи смогут настраивать глубину рассуждения через параметр, который регулирует баланс между скоростью ответа и качеством на сложных задачах.
Деньги, инвесторы и стратегия
Reflection основана в 2024 году и привлекла около $4,7 млрд от Nvidia, Sequoia Capital и Lightspeed Venture Partners. Последний раунд оценил компанию в $25 млрд по pre-money. Летом 2026 года Reflection заключила контракты на поставку GPU GB300 суммарно более чем на $7 млрд с SpaceX и Nebius - до 2029 года.
Целевая аудитория - предприятия, государственный сектор и суверенные правительства. Reflection продает концепцию "AI factory": учреждение берет модели Reflection, дообучает их на своих данных и разворачивает локально. Первый пилотный проект такого рода уже запущен с южнокорейским конгломератом Shinsegae Group. Jensen Huang давно продвигает эту идею - и понятно почему: каждая такая "фабрика" работает на GPU Nvidia.
Наиболее прямой западный конкурент Beam - Inkling от Thinking Machines Lab. По четырем кодовым бенчмаркам, где оба продукта опубликовали результаты, Beam выигрывает. Но Inkling мультимодальная, а Beam - нет. Это принципиальное ограничение для части сценариев.
Когда и как получить
Reflection обещает выпустить веса модели и полную техническую документацию "в течение этого месяца" - то есть в октябре 2026 года. Лицензия Apache 2.0 допускает коммерческое использование, хотя, как и любая открытая лицензия, содержит ряд условий - в частности, требования к уведомлениям и положения о патентах. Распространение пойдет через гиперскейлеры и облачные платформы, также заявлена интеграция с популярными open source библиотеками.
Для российских разработчиков ситуация стандартная для западных open-weight моделей: скачать веса технически можно, запустить локально - тоже, но облачный доступ через западных провайдеров потребует решения привычных вопросов с оплатой и геоблокировкой. Параллельно Reflection уже тренирует следующую версию, которая должна закрыть разрыв с топовыми открытыми моделями.
Главный вопрос, который повиснет до выхода весов: насколько честны заявленные цифры эффективности. TechCrunch прямо указывает, что показатели Reflection независимо не проверены. Индустрия это заметит - и проверит быстро.
Источники
Похожие новости
Reflection AI выпустила Beam: 501 млрд параметров против китайских моделей
Стартап из Бруклина с оценкой $25 млрд представил первую открытую модель Beam - MoE на 501B параметров, которая претендует на эффективность GLM-5.2 при втрое меньших вычислительных затратах. Ключевые бенчмарки пока не прошли независимую проверку.
DeepSeek Harness v0.2: десктоп, плагины и планировщик задач без командной строки
DeepSeek выпустил v0.2 своего агентного фреймворка с нативными приложениями для macOS и Windows, встроенным менеджером плагинов и планировщиком задач на базе session-local механизма.
OpenAI и Synopsys учат ИИ проектировать чипы вместе с инженерами
OpenAI и Synopsys запустили многолетнее партнерство и строят GPT-Synopsys - специализированную модель, которая умеет работать с EDA-инструментами и помогает инженерам оптимизировать дизайн полупроводников.