A
ИИ-чатAMDTaalasAI-чипыинференсMSIC

AMD поглощает Taalas: ИИ-модели теперь вплавлены прямо в кремний

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
AMD поглощает Taalas: ИИ-модели теперь вплавлены прямо в кремний

Сделка, которая меняет правила игры в инференсе

Когда AMD объявила об очередном поглощении, рынок поначалу отреагировал сдержанно - ну купили еще один стартап, делов-то. Но стоит разобраться в том, что именно делает Taalas, и становится понятно: это не просто очередной кирпич в стену. Это потенциально новая архитектурная парадигма для всей индустрии инференса.

Taalas - торонтский стартап, основанный в 2023 году. Компания вышла из стелса в феврале этого года с радикально нестандартным подходом: вместо того чтобы загружать веса модели из памяти при каждом запросе, Taalas буквально вгравировывает архитектуру и параметры модели прямо в кремний. Получается то, что инженеры компании называют MSIC - model-specific integrated circuit, то есть чип, созданный под конкретную модель и только под нее.

Цифры, от которых перехватывает дыхание

Демонстрационный чип HC1, изготовленный по 6-нм техпроцессу TSMC, показал результаты, которые в индустрии принято называть "неприличными". На модели Llama 3.1-8B чип выдавал около 17 000 токенов в секунду на одного пользователя - по данным самой Taalas, это в 48 раз быстрее GPU от Nvidia и в 8,5 раз быстрее ускорителей Cerebras. SiliconAngle со ссылкой на данные компании добавляет еще более впечатляющую цифру: в 73 раза быстрее Nvidia H200 при потреблении в 10 раз меньшей мощности.

Да, Llama 3.1 сегодня выглядит динозавром - модель вышла еще в середине 2024-го. Но HC1 и не был боевым решением. Это была демонстрация концепции, proof-of-concept, который должен был убедить инвесторов и потенциальных покупателей в том, что физика работает именно так, как обещает команда.

Следующее поколение - HC2 - нацелено на модели до 20 миллиардов параметров. Звучит скромно? Не спешите. При 20 млрд параметров на чип для обслуживания триллионной модели достаточно 50 ускорителей. И у AMD, что немаловажно, как раз есть rack-scale платформа Helios, которая комфортно вмещает подобные конфигурации.

Почему это работает - и в чем подвох

Технически чип Taalas состоит из двух ключевых областей: mask-ROM recall fabric, куда и "запечатываются" веса модели, и SRAM recall fabric для KV-кешей и адаптеров тонкой настройки (например, LoRA). Никакой HBM-памяти, никаких постоянных обращений к внешнему хранилищу весов - все уже внутри.

Плата за скорость очевидна: гибкость равна нулю. Чип умеет работать ровно с той моделью, под которую он создан. Любое существенное изменение модели требует нового кремния. Казалось бы, катастрофа - но Taalas уверяет, что это дешевле, чем кажется. Из более чем 100 слоев маски меняются только два при переходе на новую модель, а сам tape-out занимает около двух месяцев с использованием собственного инструментария компании.

CEO и сооснователь Любиша Баич - человек не случайный в этой индустрии. До Taalas он руководил Tenstorrent, так что понимает в специализированных ИИ-ускорителях не понаслышке. По его словам, компания создавалась с целью "переосмыслить инференс с нуля, строя железо вокруг модели, а не наоборот".

AMD строит экосистему, а не просто покупает чипы

Для AMD эта сделка - третье AI-поглощение за девять месяцев: в ноябре была MK1, в июне - Mext, в июле команда FastFlowLM. Taalas привлек за свою историю $219 млн венчурного финансирования - последний раунд в $169 млн в феврале этого года от Quiet Capital, Fidelity и легендарного полупроводникового инвестора Пьера Ламонда.

Сумма сделки не раскрывается. Для сравнения: в декабре прошлого года Nvidia потратила $20 млрд на лицензирование активов Groq - крупнейшая транзакция в истории компании. AMD явно решила сыграть аналогичную карту, но дешевле и, возможно, умнее.

План интеграции выглядит логично: чипы Taalas встанут рядом с Instinct GPU в стойках Helios, создав дезагрегированную архитектуру. GPU будут заниматься вычислительно тяжелой обработкой промптов (prefill), а токен-генерацию (decode) возьмут на себя MSIC-ускорители Taalas. Именно здесь выигрыш в скорости максимален - и именно здесь экономия на энергопотреблении наиболее ощутима.

Vamsi Boppana, старший вице-президент AI-подразделения AMD, формулирует цель лаконично: дать клиентам "правильные вычислительные решения для каждой рабочей нагрузки". AMD при этом не отказывается от GPUs как основного продукта - Лиза Су еще в июле прямо сказала, что GPU останутся доминирующим форматом из-за своей гибкости. Taalas - это премиальный инструмент для конкретных сценариев, а не замена.

Что это значит для рынка

Google, по имеющимся данным, разрабатывает аналогичный чип под Gemini. Если это подтвердится, мы наблюдаем формирование нового класса специализированного железа - не универсальных ускорителей, а модель-специфичных кристаллов, заточенных под конкретные продукты.

Для бизнеса это означает новую экономику инференса: там, где скорость отклика критична - AI-агенты, code assistants, реалтаймовые приложения - MSIC-подход может радикально снизить стоимость токена. Для разработчиков это пока еще terra incognita: инструментарий Taalas интегрируется в экосистему ROCm, но реальные API и SDK мы увидим уже после закрытия сделки.

Российским пользователям и компаниям прямой доступ к этому железу в обозримой перспективе закрыт - санкционные ограничения на поставки передовых чипов никуда не делись. Но косвенно технология будет доступна через облачные сервисы тех провайдеров, которые развернут системы на базе AMD Helios + Taalas.

Информация о сделке подтверждена несколькими независимыми изданиями, освещавшими ее одновременно с разных углов.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости