IBM создала первое ядро с двумя архитектурами
IBM представила на Hot Chips 2026 процессор нового поколения для мейнфреймов, ядро которого нативно исполняет инструкции сразу двух наборов – z/Architecture и AArch64.
Чип производится по 2-нанометровому техпроцессу и несёт 11 ядер с базовой частотой 5,7 ГГц. Разработка стала результатом сотрудничества с Arm, о котором объявили в апреле.
Принципиальный момент в том, что это не гетерогенный кристалл с отдельными Arm-ядрами рядом с классическими. IBM построила единое ядро, способное переключаться между двумя наборами инструкций динамически, по словам разработчиков, "за наносекунды". В IBM считают, что это первый процессор, где обе архитектуры получили статус равноправных.
За поддержку AArch64 отвечает механизм KVM на уровне ядра Linux, тот же самый, что уже используется для Linux на мейнфреймах IBM Z. Стандартные инструкции z/Architecture проходят мимо KVM напрямую. Такой подход позволяет не жертвовать надёжностью платформы ради расширения совместимости с софтом.
IBM заявляет о доступности на уровне 99,999999%, что превосходит привычные показатели систем высокой доступности. В пересчёте на реальное время это всего 0,032 секунды простоя в год.
Смысл проекта прост – подавляющая часть современной разработки, особенно вокруг ИИ, ориентируется на x86 и Arm, а мейнфреймы остаются в стороне и вынуждены решать проблему самостоятельно. Портировать чужое ПО на s390x можно, но бесконечно это делать невозможно.
Тина Тарквинио, директор по продуктам IBM Z и LinuxONE:
Мы никогда не смогли бы работать со всеми ними.
По словам IBM, Arm-приложения запускаются без каких-либо модификаций, а виртуальные машины на Arm работают так, будто находятся на родном Arm-кремнии. Формально так оно и есть, просто реализовано это иначе, чем обычно.
Чтобы добиться такого результата, инженерам пришлось перестроить внутренности ядра. Реализована полная аппаратная поддержка AArch64 v9.3 с расширением Scalable Vector Extension, всего 2792 инструкции AArch64. При этом блок предсказания переходов перенесён из Telum II без изменений.
В движке выборки применяются виртуальные теги кеша, что позволяет обращаться к данным быстро и обходить издержки трансляции адресов. Для декодирования Arm-инструкций IBM создала инструменты автоматизации, разбирающие XML-описания архитектуры Arm и определяющие маршрут команд по конвейеру. Именно декодер стал самой разросшейся по площади кремния частью ядра.
На этапе диспетчеризации IBM переиспользовала механизм переименования регистров общего назначения в банкованных регистрах с 16 по 31. В арифметических блоках и блоках загрузки-выгрузки основные потоки данных общие, поскольку, как выразились в IBM, сложение остаётся сложением. Отдельно добавлены новые аппаратные структуры для SVE и типов данных вроде FP16.
Нашлось место и неочевидному использованию существующих CISC-механизмов, например для операций копирования и очистки памяти. Движок трансляции адресов сохранил прежний буфер TLB, но получил новый механизм обхода таблиц страниц. Одновременная многопоточность доступна обеим архитектурам.
С кристалла никуда не делись DPU и аппаратные ускорители для ИИ, сжатия и криптографии, как и в Telum II. Помимо роста числа ядер и частот, основная работа пришлась именно на само ядро.
Параллельно IBM показала следующее поколение ИИ-ускорителя Spyre, заметно более мощное, чем нынешняя версия. Новинка получила 16 ядер с оптимизациями под современные форматы данных, включая FP4 и MXFP4. Главное изменение произошло в подсистеме памяти:
переход с LPDDR5 на HBM3e
96 ГБ памяти на каждый ускоритель
пропускная способность до 4 ТБ/с, что в 20 раз выше показателей LPDDR5
Выбор в пользу единого двухархитектурного ядра вместо гетерогенного чипа объясняется желанием принести масштаб экосистемы Arm на платформу для критически важных задач. Мейнфреймы по-прежнему остаются фундаментом обработки данных в финансовых организациях и государственных структурах.
Обычно IBM обновляет линейку мейнфреймов каждые два с половиной – три года, а мейнфреймы z17 были показаны на Hot Chips в 2024 году.
Новая система, вероятно, выйдет по схожему графику, хотя реальные сроки внедрения всегда зависят от потребностей конкретного заказчика.
- Исследователь создал таблицу лидеров самых медленных инструкций x86 – рекорд 198 миллиардов циклов за 62 секунды
- Новые чипы AMD Zen 6 получат ядра из пяти разных поколений Zen
- IBM создала первый в мире чип меньше 1 нанометра с почти 100 миллиардами транзисторов