A
ИИ-чатAMDTaalasAI-чипыинференсMSIC

AMD поглощает Taalas: ИИ-модели теперь вплавлены прямо в кремний

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
AMD поглощает Taalas: ИИ-модели теперь вплавлены прямо в кремний

Сделка, которая меняет правила игры в инференсе

Когда AMD объявила об очередном поглощении, рынок поначалу отреагировал сдержанно — ну купили ещё один стартап, делов-то. Но стоит разобраться в том, что именно делает Taalas, и становится понятно: это не просто очередной кирпич в стену. Это потенциально новая архитектурная парадигма для всей индустрии инференса.

Taalas — торонтский стартап, основанный в 2023 году. Компания вышла из стелса в феврале этого года с радикально нестандартным подходом: вместо того чтобы загружать веса модели из памяти при каждом запросе, Taalas буквально вгравировывает архитектуру и параметры модели прямо в кремний. Получается то, что инженеры компании называют MSIC — model-specific integrated circuit, то есть чип, созданный под конкретную модель и только под неё.

Цифры, от которых перехватывает дыхание

Демонстрационный чип HC1, изготовленный по 6-нм техпроцессу TSMC, показал результаты, которые в индустрии принято называть «неприличными». На модели Llama 3.1-8B чип выдавал около 17 000 токенов в секунду на одного пользователя — по данным самой Taalas, это в 48 раз быстрее GPU от Nvidia и в 8,5 раз быстрее ускорителей Cerebras. SiliconAngle со ссылкой на данные компании добавляет ещё более впечатляющую цифру: в 73 раза быстрее Nvidia H200 при потреблении в 10 раз меньшей мощности.

Да, Llama 3.1 сегодня выглядит динозавром — модель вышла ещё в середине 2024-го. Но HC1 и не был боевым решением. Это была демонстрация концепции, proof-of-concept, который должен был убедить инвесторов и потенциальных покупателей в том, что физика работает именно так, как обещает команда.

Следующее поколение — HC2 — нацелено на модели до 20 миллиардов параметров. Звучит скромно? Не спешите. При 20 млрд параметров на чип для обслуживания триллионной модели достаточно 50 ускорителей. И у AMD, что немаловажно, как раз есть rack-scale платформа Helios, которая комфортно вмещает подобные конфигурации.

Почему это работает — и в чём подвох

Технически чип Taalas состоит из двух ключевых областей: mask-ROM recall fabric, куда и «запечатываются» веса модели, и SRAM recall fabric для KV-кешей и адаптеров тонкой настройки (например, LoRA). Никакой HBM-памяти, никаких постоянных обращений к внешнему хранилищу весов — всё уже внутри.

Плата за скорость очевидна: гибкость равна нулю. Чип умеет работать ровно с той моделью, под которую он создан. Любое существенное изменение модели требует нового кремния. Казалось бы, катастрофа — но Taalas уверяет, что это дешевле, чем кажется. Из более чем 100 слоёв маски меняются только два при переходе на новую модель, а сам tape-out занимает около двух месяцев с использованием собственного инструментария компании.

ЦEO и сооснователь Любиша Баич — человек не случайный в этой индустрии. До Taalas он руководил Tenstorrent, так что понимает в специализированных ИИ-ускорителях не понаслышке. По его словам, компания создавалась с целью «переосмыслить инференс с нуля, строя железо вокруг модели, а не наоборот».

AMD строит экосистему, а не просто покупает чипы

Для AMD эта сделка — третье AI-поглощение за девять месяцев: в ноябре была MK1, в июне — Mext, в июле команда FastFlowLM. Taalas привлёк за свою историю $219 млн венчурного финансирования — последний раунд в $169 млн в феврале этого года от Quiet Capital, Fidelity и легендарного полупроводникового инвестора Пьера Ламонда.

Сумма сделки не раскрывается. Для сравнения: в декабре прошлого года Nvidia потратила $20 млрд на лицензирование активов Groq — крупнейшая транзакция в истории компании. AMD явно решила сыграть аналогичную карту, но дешевле и, возможно, умнее.

План интеграции выглядит логично: чипы Taalas встанут рядом с Instinct GPU в стойках Helios, создав дезагрегированную архитектуру. GPU будут заниматься вычислительно тяжёлой обработкой промптов (prefill), а токен-генерацию (decode) возьмут на себя MSIC-ускорители Taalas. Именно здесь выигрыш в скорости максимален — и именно здесь экономия на энергопотреблении наиболее ощутима.

Vamsi Boppana, старший вице-президент AI-подразделения AMD, формулирует цель лаконично: дать клиентам «правильные вычислительные решения для каждой рабочей нагрузки». AMD при этом не отказывается от GPUs как основного продукта — Лиза Су ещё в июле прямо сказала, что GPU останутся доминирующим форматом из-за своей гибкости. Taalas — это премиальный инструмент для конкретных сценариев, а не замена.

Что это значит для рынка

Google, по имеющимся данным, разрабатывает аналогичный чип под Gemini. Если это подтвердится, мы наблюдаем формирование нового класса специализированного железа — не универсальных ускорителей, а модель-специфичных кристаллов, заточенных под конкретные продукты.

Для бизнеса это означает новую экономику инференса: там, где скорость отклика критична — AI-агенты, code assistants, реалтаймовые приложения — MSIC-подход может радикально снизить стоимость токена. Для разработчиков это пока ещё terra incognita: инструментарий Taalas интегрируется в экосистему ROCm, но реальные API и SDK мы увидим уже после закрытия сделки.

Российским пользователям и компаниям прямой доступ к этому железу в обозримой перспективе закрыт — санкционные ограничения на поставки передовых чипов никуда не делись. Но косвенно технология будет доступна через облачные сервисы тех провайдеров, которые развернут системы на базе AMD Helios + Taalas.

Информация о сделке подтверждена несколькими независимыми изданиями, освещавшими её одновременно с разных углов.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости