AMD купила Taalas, и эксперты уже фантазируют об ИИ-моделях в виде сменных картриджей
AMD объявила о покупке торонтской Taalas, основанной в 2023 году и работающей над кремнием, в котором веса нейросети физически "выжжены" в чипе.
Сделка ещё должна получить одобрение регуляторов, однако в сети уже начали обсуждать бытовую фантазию, где ИИ-модель покупают как картридж для приставки.
Идея простая. Раз модель нельзя обновить после выпуска чипа, значит, обновлением становится сама покупка нового чипа. Отсюда и образ полки в магазине, где рядом лежат картриджи с разными моделями и разной ценой.
Технически такой сценарий опирается на архитектуру вычислений в памяти, где веса хранятся прямо в соединениях между транзисторами, а не в отдельных ячейках. Taalas использует металлические слои разводки для постоянного запоминающего устройства, отводя один транзистор доступа на четырёхбитный вес и выбирая один из шестнадцати вариантов. Классического разделения процессора и памяти по фон Нейману здесь нет, так что данные не требуется подтягивать издалека.
Демонстрационный чип HC1 несёт зашитую Llama 3.1 8B, изготовлен по 6-нанометровому техпроцессу TSMC и занимает 815 мм² при примерно 53 миллиардах транзисторов. Заявленная скорость составляет 16 960 токенов в секунду, что на момент анонса в феврале давало 48-кратный отрыв от ускорителей Nvidia и 8,5-кратный от Cerebras. Публичная демонстрация на chatjimmy.ai отвечает за доли секунды, регулярно выдавая при этом откровенные выдумки.
На фоне этой концепции сложился целый каталог воображаемых форматов поставки:
USB-C-донгл, куда вставляется картридж с весами
PCIe-карта с несколькими слотами под разные модели
слоты на материнской плате по аналогии с планками оперативной памяти
вторичный рынок подержанных картриджей с устаревшими моделями
модульный телефон, где чип с моделью меняется отдельно от корпуса
Скептики указывают на площадь кремния. 815 мм² уже близко к пределу экспозиции литографии, который составляет около 850 мм², а RTX 5090 для сравнения занимает 750 мм². Восьмимиллиардная модель при этом ужата примерно до трёх бит на параметр, что заметно бьёт по качеству ответов.
Второе ограничение касается контекста. Кэш ключей и значений меняется в процессе работы, так что выжечь его в металле невозможно, и он живёт в SRAM на том же кристалле. Демонстрация держит всего 6 144 токена против 131 072, которые поддерживает исходная Llama 3.1.
Сторонники подхода отвечают, что гнаться за передовыми моделями здесь и не нужно. Классификация обращений в поддержку, суммаризация документов, подагенты для чтения кода и голосовые ассистенты в бытовой технике не требуют рассуждений уровня флагманов. Мгновенный отклик при этом открывает сценарии, где к одной задаче параллельно запускают десятки попыток и выбирают лучшую.
Сооснователь и глава Taalas Любиша Баич описал замысел компании коротко.
Мы основали Taalas, чтобы переосмыслить ИИ-инференс с нуля, строя железо вокруг модели.
Вице-президент AMD по направлению искусственного интеллекта Вамси Боппана заявил, что технология и инженерная команда усилят портфель компании за счёт производительности и энергоэффективности инференса.
AMD планирует встроить разработку в дорожную карту ускорителей и делать системные решения совместно с Instinct. Про картриджи в пресс-релизе не сказано ни слова, а обсуждение вокруг него уже расписало их форм-факторы.
- Видеокарты AMD на архитектуре RDNA 5 могут выйти не раньше конца 2027 года и скорее всего подорожают из-за ИИ-бума
- Глава AMD призвала выпускников не бояться ИИ, но и не доверять ему слепо
- Глава AMD не опасается каннибализации GPU – агентный ИИ увеличивает спрос на процессоры, не замещая ускорители