AMD поглощает Taalas: ИИ-модели теперь вплавлены прямо в кремний

Сделка, которая меняет правила игры в инференсе
Когда AMD объявила об очередном поглощении, рынок поначалу отреагировал сдержанно — ну купили ещё один стартап, делов-то. Но стоит разобраться в том, что именно делает Taalas, и становится понятно: это не просто очередной кирпич в стену. Это потенциально новая архитектурная парадигма для всей индустрии инференса.
Taalas — торонтский стартап, основанный в 2023 году. Компания вышла из стелса в феврале этого года с радикально нестандартным подходом: вместо того чтобы загружать веса модели из памяти при каждом запросе, Taalas буквально вгравировывает архитектуру и параметры модели прямо в кремний. Получается то, что инженеры компании называют MSIC — model-specific integrated circuit, то есть чип, созданный под конкретную модель и только под неё.
Цифры, от которых перехватывает дыхание
Демонстрационный чип HC1, изготовленный по 6-нм техпроцессу TSMC, показал результаты, которые в индустрии принято называть «неприличными». На модели Llama 3.1-8B чип выдавал около 17 000 токенов в секунду на одного пользователя — по данным самой Taalas, это в 48 раз быстрее GPU от Nvidia и в 8,5 раз быстрее ускорителей Cerebras. SiliconAngle со ссылкой на данные компании добавляет ещё более впечатляющую цифру: в 73 раза быстрее Nvidia H200 при потреблении в 10 раз меньшей мощности.
Да, Llama 3.1 сегодня выглядит динозавром — модель вышла ещё в середине 2024-го. Но HC1 и не был боевым решением. Это была демонстрация концепции, proof-of-concept, который должен был убедить инвесторов и потенциальных покупателей в том, что физика работает именно так, как обещает команда.
Следующее поколение — HC2 — нацелено на модели до 20 миллиардов параметров. Звучит скромно? Не спешите. При 20 млрд параметров на чип для обслуживания триллионной модели достаточно 50 ускорителей. И у AMD, что немаловажно, как раз есть rack-scale платформа Helios, которая комфортно вмещает подобные конфигурации.
Почему это работает — и в чём подвох
Технически чип Taalas состоит из двух ключевых областей: mask-ROM recall fabric, куда и «запечатываются» веса модели, и SRAM recall fabric для KV-кешей и адаптеров тонкой настройки (например, LoRA). Никакой HBM-памяти, никаких постоянных обращений к внешнему хранилищу весов — всё уже внутри.
Плата за скорость очевидна: гибкость равна нулю. Чип умеет работать ровно с той моделью, под которую он создан. Любое существенное изменение модели требует нового кремния. Казалось бы, катастрофа — но Taalas уверяет, что это дешевле, чем кажется. Из более чем 100 слоёв маски меняются только два при переходе на новую модель, а сам tape-out занимает около двух месяцев с использованием собственного инструментария компании.
ЦEO и сооснователь Любиша Баич — человек не случайный в этой индустрии. До Taalas он руководил Tenstorrent, так что понимает в специализированных ИИ-ускорителях не понаслышке. По его словам, компания создавалась с целью «переосмыслить инференс с нуля, строя железо вокруг модели, а не наоборот».
AMD строит экосистему, а не просто покупает чипы
Для AMD эта сделка — третье AI-поглощение за девять месяцев: в ноябре была MK1, в июне — Mext, в июле команда FastFlowLM. Taalas привлёк за свою историю $219 млн венчурного финансирования — последний раунд в $169 млн в феврале этого года от Quiet Capital, Fidelity и легендарного полупроводникового инвестора Пьера Ламонда.
Сумма сделки не раскрывается. Для сравнения: в декабре прошлого года Nvidia потратила $20 млрд на лицензирование активов Groq — крупнейшая транзакция в истории компании. AMD явно решила сыграть аналогичную карту, но дешевле и, возможно, умнее.
План интеграции выглядит логично: чипы Taalas встанут рядом с Instinct GPU в стойках Helios, создав дезагрегированную архитектуру. GPU будут заниматься вычислительно тяжёлой обработкой промптов (prefill), а токен-генерацию (decode) возьмут на себя MSIC-ускорители Taalas. Именно здесь выигрыш в скорости максимален — и именно здесь экономия на энергопотреблении наиболее ощутима.
Vamsi Boppana, старший вице-президент AI-подразделения AMD, формулирует цель лаконично: дать клиентам «правильные вычислительные решения для каждой рабочей нагрузки». AMD при этом не отказывается от GPUs как основного продукта — Лиза Су ещё в июле прямо сказала, что GPU останутся доминирующим форматом из-за своей гибкости. Taalas — это премиальный инструмент для конкретных сценариев, а не замена.
Что это значит для рынка
Google, по имеющимся данным, разрабатывает аналогичный чип под Gemini. Если это подтвердится, мы наблюдаем формирование нового класса специализированного железа — не универсальных ускорителей, а модель-специфичных кристаллов, заточенных под конкретные продукты.
Для бизнеса это означает новую экономику инференса: там, где скорость отклика критична — AI-агенты, code assistants, реалтаймовые приложения — MSIC-подход может радикально снизить стоимость токена. Для разработчиков это пока ещё terra incognita: инструментарий Taalas интегрируется в экосистему ROCm, но реальные API и SDK мы увидим уже после закрытия сделки.
Российским пользователям и компаниям прямой доступ к этому железу в обозримой перспективе закрыт — санкционные ограничения на поставки передовых чипов никуда не делись. Но косвенно технология будет доступна через облачные сервисы тех провайдеров, которые развернут системы на базе AMD Helios + Taalas.
Информация о сделке подтверждена несколькими независимыми изданиями, освещавшими её одновременно с разных углов.
Похожие новости
OpenAI распустила команду по катастрофическим рискам ИИ
OpenAI тихо ликвидировала отдел Preparedness, который оценивал угрозы от собственных моделей. Сотрудники говорят о нарастающем «чувстве тревоги и ответственности».
Optima: бенчмарки ИИ наконец-то на ваших реальных данных
Artificial Analysis запустила платформу Optima, которая позволяет строить персональные бенчмарки для LLM на основе собственных данных и сравнивать модели не только по качеству, но и по стоимости задачи.
ИИ-книги затопили Amazon и режут доходы живых авторов
Исследование 14 000 книг показало: ИИ-контент занял 20% каталога, но забирает лишь 12% выручки — зато тянет вниз доходы всех авторов без исключения.