Энтузиаст добавил Nvidia Tesla V100 в игровой ПК за $266 и получил 32 ГБ видеопамяти для запуска ИИ-моделей
Энтузиаст вычислительной техники нашёл применение шумной и во многом устаревшей корпоративной видеокарте с большим объёмом видеопамяти, задействовав её для локального инференса больших языковых моделей.
В результате общий объём видеопамяти системы удвоился до 32 ГБ, а обошлось всё это в $266. Достойный результат, особенно на фоне нынешнего дефицита оперативной памяти.
Оскар Молнар рассказал, что приобрёл недорогую Tesla V100 SXM2 с 16 ГБ памяти HBM2, а также переходник с SXM2 на PCIe и провёл модификацию PWM для громкого, как газонокосилка, кулера.
Всё это понадобилось для расширения видеопамяти под тяжёлые локальные языковые модели. Такие видеокарты действительно выглядят дёшево прямо сейчас, ведь на eBay в США они продаются по цене менее $140 за штуку, если не смущает покупка из Китая.
Просто взять такую Tesla V100 SXM2 с большим объёмом видеопамяти и подключить её к своему ПК не получится. По словам Молнара, он потратил около $66 на переходник с SXM2 на PCIe, также приобретённый на eBay.
Можно было бы подумать, что этого достаточно. Однако энтузиаста ПК и локальных языковых моделей отпугнул шум "вентилятора из ада", который шёл в комплекте с Tesla V100 SXM2. Этот визжащий кулер выдавал 82 дБ шума.
Молнар описал звук так:
Где-то между измельчителем отходов и газонокосилкой.
Возможно, это оказалась самая сложная доработка из всех, но по сути провода вентилятора нужно было просто перенаправить и подключить к разъёму PWM на материнской плате. Для этой задачи можно также приобрести переходник "2.54mm male to PH2.0 female".
Судя по всему, вентилятору достаточно работать на 10% мощности, чтобы удерживать Tesla V100 ниже 50 градусов при полной нагрузке.
После того как всё оборудование было установлено и настроено, в распоряжении Молнара оказалась система с 32 ГБ видеопамяти. Речь о ПК с RTX 4080 на 16 ГБ памяти архитектуры Ada и Tesla V100 на 16 ГБ памяти архитектуры Volta. Он отметил, что существуют версии Tesla V100 с 32 ГБ видеопамяти, но стоят они вдвое дороже.
Заставить систему использовать все 32 ГБ видеопамяти для языковых моделей оказалось несложно. Молнар применил NixOS с устаревшим драйвером Nvidia, который поддерживал сразу обе архитектуры, Volta и Ada.
При тестировании локальной языковой модели ему удалось запустить модель на 27 миллиардов параметров со скоростью 32 токена в секунду. По его словам, этого "достаточно быстро для интерактивного использования", и такой результат быстрее большинства облачных API-альтернатив.
- Администрация Трампа купит ядерных реакторов на $80 млрд для питания ИИ-индустрии на фоне споров о финансовом пузыре
- Сотрудники EA столкнулись с увольнениями и увеличением нагрузки из-за обязательного внедрения ИИ
- Почти три миллиона пользователей ChatGPT испытывают проблемы с психическим здоровьем