AMD поглощает Taalas: ИИ-модели теперь вплавлены прямо в кремний

Сделка, которая меняет правила игры в инференсе
Когда AMD объявила об очередном поглощении, рынок поначалу отреагировал сдержанно - ну купили еще один стартап, делов-то. Но стоит разобраться в том, что именно делает Taalas, и становится понятно: это не просто очередной кирпич в стену. Это потенциально новая архитектурная парадигма для всей индустрии инференса.
Taalas - торонтский стартап, основанный в 2023 году. Компания вышла из стелса в феврале этого года с радикально нестандартным подходом: вместо того чтобы загружать веса модели из памяти при каждом запросе, Taalas буквально вгравировывает архитектуру и параметры модели прямо в кремний. Получается то, что инженеры компании называют MSIC - model-specific integrated circuit, то есть чип, созданный под конкретную модель и только под нее.
Цифры, от которых перехватывает дыхание
Демонстрационный чип HC1, изготовленный по 6-нм техпроцессу TSMC, показал результаты, которые в индустрии принято называть "неприличными". На модели Llama 3.1-8B чип выдавал около 17 000 токенов в секунду на одного пользователя - по данным самой Taalas, это в 48 раз быстрее GPU от Nvidia и в 8,5 раз быстрее ускорителей Cerebras. SiliconAngle со ссылкой на данные компании добавляет еще более впечатляющую цифру: в 73 раза быстрее Nvidia H200 при потреблении в 10 раз меньшей мощности.
Да, Llama 3.1 сегодня выглядит динозавром - модель вышла еще в середине 2024-го. Но HC1 и не был боевым решением. Это была демонстрация концепции, proof-of-concept, который должен был убедить инвесторов и потенциальных покупателей в том, что физика работает именно так, как обещает команда.
Следующее поколение - HC2 - нацелено на модели до 20 миллиардов параметров. Звучит скромно? Не спешите. При 20 млрд параметров на чип для обслуживания триллионной модели достаточно 50 ускорителей. И у AMD, что немаловажно, как раз есть rack-scale платформа Helios, которая комфортно вмещает подобные конфигурации.
Почему это работает - и в чем подвох
Технически чип Taalas состоит из двух ключевых областей: mask-ROM recall fabric, куда и "запечатываются" веса модели, и SRAM recall fabric для KV-кешей и адаптеров тонкой настройки (например, LoRA). Никакой HBM-памяти, никаких постоянных обращений к внешнему хранилищу весов - все уже внутри.
Плата за скорость очевидна: гибкость равна нулю. Чип умеет работать ровно с той моделью, под которую он создан. Любое существенное изменение модели требует нового кремния. Казалось бы, катастрофа - но Taalas уверяет, что это дешевле, чем кажется. Из более чем 100 слоев маски меняются только два при переходе на новую модель, а сам tape-out занимает около двух месяцев с использованием собственного инструментария компании.
CEO и сооснователь Любиша Баич - человек не случайный в этой индустрии. До Taalas он руководил Tenstorrent, так что понимает в специализированных ИИ-ускорителях не понаслышке. По его словам, компания создавалась с целью "переосмыслить инференс с нуля, строя железо вокруг модели, а не наоборот".
AMD строит экосистему, а не просто покупает чипы
Для AMD эта сделка - третье AI-поглощение за девять месяцев: в ноябре была MK1, в июне - Mext, в июле команда FastFlowLM. Taalas привлек за свою историю $219 млн венчурного финансирования - последний раунд в $169 млн в феврале этого года от Quiet Capital, Fidelity и легендарного полупроводникового инвестора Пьера Ламонда.
Сумма сделки не раскрывается. Для сравнения: в декабре прошлого года Nvidia потратила $20 млрд на лицензирование активов Groq - крупнейшая транзакция в истории компании. AMD явно решила сыграть аналогичную карту, но дешевле и, возможно, умнее.
План интеграции выглядит логично: чипы Taalas встанут рядом с Instinct GPU в стойках Helios, создав дезагрегированную архитектуру. GPU будут заниматься вычислительно тяжелой обработкой промптов (prefill), а токен-генерацию (decode) возьмут на себя MSIC-ускорители Taalas. Именно здесь выигрыш в скорости максимален - и именно здесь экономия на энергопотреблении наиболее ощутима.
Vamsi Boppana, старший вице-президент AI-подразделения AMD, формулирует цель лаконично: дать клиентам "правильные вычислительные решения для каждой рабочей нагрузки". AMD при этом не отказывается от GPUs как основного продукта - Лиза Су еще в июле прямо сказала, что GPU останутся доминирующим форматом из-за своей гибкости. Taalas - это премиальный инструмент для конкретных сценариев, а не замена.
Что это значит для рынка
Google, по имеющимся данным, разрабатывает аналогичный чип под Gemini. Если это подтвердится, мы наблюдаем формирование нового класса специализированного железа - не универсальных ускорителей, а модель-специфичных кристаллов, заточенных под конкретные продукты.
Для бизнеса это означает новую экономику инференса: там, где скорость отклика критична - AI-агенты, code assistants, реалтаймовые приложения - MSIC-подход может радикально снизить стоимость токена. Для разработчиков это пока еще terra incognita: инструментарий Taalas интегрируется в экосистему ROCm, но реальные API и SDK мы увидим уже после закрытия сделки.
Российским пользователям и компаниям прямой доступ к этому железу в обозримой перспективе закрыт - санкционные ограничения на поставки передовых чипов никуда не делись. Но косвенно технология будет доступна через облачные сервисы тех провайдеров, которые развернут системы на базе AMD Helios + Taalas.
Информация о сделке подтверждена несколькими независимыми изданиями, освещавшими ее одновременно с разных углов.
Похожие новости
OpenAI DevDay 2026: Dots, GPT-6.1 Sol и 1,2 млрд пользователей в неделю
OpenAI провела DevDay 2026: автономные агенты Dots, модель GPT-6.1 Sol за пятую часть цены Astra и новый рекорд аудитории ChatGPT.
GPT-6.1 Sol: почти Astra за пятую часть цены
OpenAI представила GPT-6.1 Sol - модель, которая почти догоняет GPT-6 Astra по качеству, но стоит в пять раз дешевле. Кешированный ввод - $0.10 за миллион токенов.
OpenAI DevDay 2026: GPT-6 Astra, агент Dots и 20+ анонсов за один день
OpenAI провела крупнейший DevDay в своей истории - более 20 анонсов за один день: агент Dots, скоростной режим Ultrafast, новый тариф Pro 500 и плагины-приложения внутри ChatGPT.