AMD купила Taalas, и эксперты уже фантазируют об ИИ-моделях в виде сменных картриджей

AMD объявила о покупке торонтской Taalas, основанной в 2023 году и работающей над кремнием, в котором веса нейросети физически "выжжены" в чипе.

Сделка ещё должна получить одобрение регуляторов, однако в сети уже начали обсуждать бытовую фантазию, где ИИ-модель покупают как картридж для приставки.

Идея простая. Раз модель нельзя обновить после выпуска чипа, значит, обновлением становится сама покупка нового чипа. Отсюда и образ полки в магазине, где рядом лежат картриджи с разными моделями и разной ценой.

Технически такой сценарий опирается на архитектуру вычислений в памяти, где веса хранятся прямо в соединениях между транзисторами, а не в отдельных ячейках. Taalas использует металлические слои разводки для постоянного запоминающего устройства, отводя один транзистор доступа на четырёхбитный вес и выбирая один из шестнадцати вариантов. Классического разделения процессора и памяти по фон Нейману здесь нет, так что данные не требуется подтягивать издалека.

Демонстрационный чип HC1 несёт зашитую Llama 3.1 8B, изготовлен по 6-нанометровому техпроцессу TSMC и занимает 815 мм² при примерно 53 миллиардах транзисторов. Заявленная скорость составляет 16 960 токенов в секунду, что на момент анонса в феврале давало 48-кратный отрыв от ускорителей Nvidia и 8,5-кратный от Cerebras. Публичная демонстрация на chatjimmy.ai отвечает за доли секунды, регулярно выдавая при этом откровенные выдумки.

На фоне этой концепции сложился целый каталог воображаемых форматов поставки:

  • USB-C-донгл, куда вставляется картридж с весами

  • PCIe-карта с несколькими слотами под разные модели

  • слоты на материнской плате по аналогии с планками оперативной памяти

  • вторичный рынок подержанных картриджей с устаревшими моделями

  • модульный телефон, где чип с моделью меняется отдельно от корпуса

Скептики указывают на площадь кремния. 815 мм² уже близко к пределу экспозиции литографии, который составляет около 850 мм², а RTX 5090 для сравнения занимает 750 мм². Восьмимиллиардная модель при этом ужата примерно до трёх бит на параметр, что заметно бьёт по качеству ответов.

Второе ограничение касается контекста. Кэш ключей и значений меняется в процессе работы, так что выжечь его в металле невозможно, и он живёт в SRAM на том же кристалле. Демонстрация держит всего 6 144 токена против 131 072, которые поддерживает исходная Llama 3.1.

Сторонники подхода отвечают, что гнаться за передовыми моделями здесь и не нужно. Классификация обращений в поддержку, суммаризация документов, подагенты для чтения кода и голосовые ассистенты в бытовой технике не требуют рассуждений уровня флагманов. Мгновенный отклик при этом открывает сценарии, где к одной задаче параллельно запускают десятки попыток и выбирают лучшую.

Сооснователь и глава Taalas Любиша Баич описал замысел компании коротко.

Мы основали Taalas, чтобы переосмыслить ИИ-инференс с нуля, строя железо вокруг модели.

Вице-президент AMD по направлению искусственного интеллекта Вамси Боппана заявил, что технология и инженерная команда усилят портфель компании за счёт производительности и энергоэффективности инференса.

AMD планирует встроить разработку в дорожную карту ускорителей и делать системные решения совместно с Instinct. Про картриджи в пресс-релизе не сказано ни слова, а обсуждение вокруг него уже расписало их форм-факторы.

Больше статей на Shazoo
Тэги:

Об авторе

Эксперт по Fallout
Главный редактор
Более 16 лет в индустрии освещения видеоигр, кино, сериалов, науки и техники. Особенно разбираюсь в серии Fallout, ценитель The Elder Scrolls. Поклонник Arcanum и Fallout Tactics. Больше всего играю в Civilization, Old World и градостроители. Изучаю ИИ и загадки космоса.