AMD показала первые наработки по нейросетевому глобальному освещению для FSR Diamond
AMD ранее анонсировала переход на нейросетевой рендеринг для видеокарт Radeon и консолей в рамках технологии FSR Diamond, и теперь стали известны первые технические подробности этого подхода. Технический персонал компании опубликовал научную работу, посвящённую замене классического глобального освещения генерацией изображений в реальном времени.
Исследование называется "Temporally stable generative illumination with a one-step diffusion model", что можно перевести как стабильное во времени генеративное освещение с помощью однопроходной диффузионной модели. В отличие от классических диффузионных моделей, которые формируют изображение через множество шагов устранения шума, разработка AMD выдаёт результат за один проход. Такой подход критически важен для скорости работы в реальном времени, ведь именно она определяет применимость технологии в играх.
Суть метода в том, чтобы получить картинку, похожую на результат честного глобального освещения, то есть непрямого света, отражающегося от объектов и подсвечивающего окружение, но без затратных вычислений вроде трассировки пути. По словам одного из авторов работы Сунгай Кима, команда пытается решить задачу глобального освещения как задачу генерации изображения, ведь именно оно делает рендер реалистичным и одновременно остаётся самым дорогим этапом рендеринга.
Метод берёт кадр с прямым освещением, то есть светом, который идёт от источника к объекту без дополнительных отражений, и использует его как исходную "подсказку" для диффузионной модели Stable Diffusion 2.1 Turbo. Саму модель обучили на синтетическом наборе данных из 31 тысячи кадров интерьерных сцен, отрендеренных в Blender Cycles, встроенном в Blender рендере с трассировкой лучей. Каждая сцена содержит от 1 до 30 источников света и подвижные объекты, благодаря чему модель "видит" широкий диапазон условий освещения.
Обучение проводилось на видеокартах AMD Instinct MI210 и включало 50 проходов по всему датасету. Для генерации используются разреженные сигналы освещения, яркости, материалов и геометрии, которые удерживают результат в соответствии с реальной геометрией сцены и источниками света. Кадр, подаваемый в модель, специально обрабатывается так, чтобы заставить систему фокусироваться именно на освещении, а не на прочих деталях изображения.
Этот момент выглядит особенно важным на случай, если технология когда-нибудь доберётся до реальных игр – реакция геймерского сообщества на подобные ИИ-инструменты бывает крайне резкой. Для повышения стабильности между кадрами исследователи применили так называемый временной вариационный автоэнкодер (TVAE). Он использует векторы движения, чтобы совмещать текущий кадр с предыдущими, и хранит историю прошлых результатов, не позволяя освещению мерцать или искажаться от кадра к кадру.
Проблема согласованности особенно актуальна для генеративных моделей: при повторном запуске одной и той же задачи они выдают немного разные результаты каждый раз, а человек легко замечает такие расхождения при работе в реальном времени покадрово. Финальный результат совмещается с исходным кадром, содержащим только прямое освещение, что дополнительно сглаживает возможные ошибки. В блоге компании отмечается, что метод "подходит для сценариев рендеринга в реальном времени с покадровой генерацией".
По сравнению с другими генеративными моделями новый метод AMD показывает более достоверные результаты. Ким отметил, что подход AMD восстанавливает мягкие тени и отражённый свет, тогда как RGB↔X "галлюцинирует" несуществующий в сцене контент, а DiffusionRenderer искажает геометрию.
Скорость работы модели составляет 0.29 секунды на кадр, что соответствует примерно 3.45 кадра в секунду при разрешении 512 на 512 пикселей. Тестирование проводилось на видеокарте RTX 3090, и хотя это быстрее упомянутых конкурирующих техник, до применения в реальных играх технологии предстоит пройти долгий путь. Весь процесс требует около 8-9 ГБ видеопамяти, при этом стоит учитывать, что речь идёт только об этапе глобального освещения, а не о полном пайплайне рендеринга кадра.
Получается, что не только Nvidia исследует нейросетевой рендеринг как новое направление компьютерной графики, хотя об этом было известно и раньше. В начале этого года представитель AMD Джек Хуинь анонсировал набор технологий под названием FSR Diamond, включающий "нейросетевой рендеринг нового поколения", под который как раз подпадает новое исследование. В пакет также входят улучшенное масштабирование на основе машинного обучения, генерация нескольких кадров с помощью ML, регенерация лучей и трассировка пути.
Остаётся открытым вопрос, как именно AMD будет преподносить подобные технологии геймерам, когда они будут готовы к релизу. Вероятно, в компании внимательно следят за скандалом вокруг небрежного анонса DLSS 5 от Nvidia и последующим отступлением с переформулировкой позиции, чтобы представить технологию не как замену традиционному рендерингу, а как инструмент для разработчиков.
Слухи о применении нейросетевого освещения от AMD уже начали появляться – в частности, сливщик Kepler_L2 на форумах Anandtech упоминал такую разработку. Пока неясно, идёт ли речь именно об этом исследовании или о чём-то более продвинутом на дальнейшем этапе разработки, но очевидно, что нейросетевой рендеринг разрабатывает не только Nvidia.
- Майнинговую карту AMD на базе чипа PS5 научили работать с FSR 4
- AMD купила Taalas, и эксперты уже фантазируют об ИИ-моделях в виде сменных картриджей
- AMD раскрыла план развития процессоров до 2028 года – Zen 7 Florence и Zen 8 Ravenna уже в разработке