Запуск GPT-OSS 20B на двух видеокартах CMP 50HX с низкой стоимостью и обзор производительности.
Key Takeaways
- Запуск GPT-OSS 20B возможен на бюджетных видеокартах CMP 50HX с приемлемой производительностью.
- Суммарный объем видеопамяти 12 ГБ ниже рекомендуемого, но модель работает стабильно.
- Стоимость оборудования значительно ниже, чем у видеокарт с 16 ГБ VRAM, что делает запуск доступнее.
- Локальный запуск подходит для проектов с частым использованием, но не для редких запросов из-за затрат.
- Масштабирование до моделей с большим числом параметров требует значительно больше видеокарт и памяти.
What the video covers
- Автор запускает нейросеть Chat GPT OSS с 20 млрд параметров на двух видеокартах CMP 50HX после майнинга.
- Видеокарты работают на 16 и 4 линиях PCIe из-за ограничений процессора, аналог i7 6700 с 4 ядрами и 8 потоками.
- Используется 24 ГБ оперативной памяти, чат запущен через LM Studio, который показывает количество токенов и производительность.
- Две видеокарты с 6 ГБ VRAM каждая обеспечивают суммарно 12 ГБ видеопамяти, что ниже рекомендованных 16 ГБ для LOLM.
- Скорость обработки составляет около 68 токенов в секунду, что считается хорошей производительностью для такой сборки.
- Стоимость двух видеокарт CMP 50HX около 10 000 рублей, что в 4-5 раз дешевле аналогов с 16 ГБ VRAM.
- Автор отмечает, что локальный запуск нейросети не всегда оправдан из-за затрат и низкой частоты использования.
- Для масштабирования до 120 млрд параметров потребуется около восьми видеокарт с 60 ГБ VRAM.
- Автор рекомендует подписываться на канал и участвовать в обсуждениях в группе.
Chapters
- 00:00Введение и цель видео
- 00:18Описание видеокарт и процессора
- 00:35Характеристики системы и памяти
- 00:48Запуск Chat GPT OSS через LM Studio
- 01:50Использование видеокарт и распределение памяти
- 02:20Производительность и скорость обработки токенов
- 03:09Стоимость и сравнение с другими видеокартами
- 03:35Выводы и рекомендации по использованию
- 04:33Перспективы масштабирования и завершение
Full Transcript — Download SRT & Markdown
Speaker A
Всем привет. В этом видео мы попробуем запустить нейросеть Chat GPT OSS на 20 млрд параметрах на двух видеокартах CMP50ксы после майнинга.
Speaker A
Видеокарты эти распаяны на 16 линий. Одна из них работает полностью в 16, а вторая будет работать на четырёх линиях, потому что здесь нет столько линий у процессора, чтобы две видеокарты на все 16 линий тащить. Процессор здесь
Speaker A
это аналог i7 6700. Это четыре ядра, восемь потоков стоит. Материнская плата на 11 псяде первом сокете.
Speaker A
Ну и оперативной памяти. Здесь у меня стоит четыре планки, две посе и две почеты, 24 Гб. [фыркает] Значит, запустил я чат. Чат я запустил через LM Studio, можно и через Олаама.
Speaker A
Там даже оперативной памяти чуть поменьше она требует. Но LM Studio здесь показывает количество токенов. Какая производительность?
Speaker A
Вот у меня получается GPT OSS 20 млрд параметров. [фыркает] Сам монитор подключён к компьютеру через встроенную видеокарту в процессор, выводит изображение.
Speaker A
Так, в диспетчере задач у нас 16 ГБ занимает, почти 17. И подключены две видеокарты. Они на драйверах, которые пропачены, они отображаются как 2080, как 2080 Ti, но это CMP 50 и хаиксы.
Speaker A
Значит, при размещении в них модели памяти уходит по 6 Гб. Это на одной 6 Гб.
Speaker A
И на второй видеокарте тоже 6 Гб. То есть суммарно 12 ГБ — это минимум.
Speaker A
Ну, на сайте в рекомендованных пишут, что для запуска этой LOLM нужно минимум 16 ГБ.
Speaker A
Так, в общем, давайте попробуем ей какой-нибудь запрос отправить и посмотрим скорость. Она долго загружается, потому что у меня на жёстком диске всё это. То есть примерно вот скорость работы её.
Speaker A
Всё уже, ну, печатает, напечатал. Так. Получается, скорость в токенах — это 68 токенов в секунду. Она мне выдаёт на 2750.
Speaker A
Вот примерно такая производительность. В общем, посмотрел в интернете. Эта производительность, на самом деле, неплохая для такой сборки.
Speaker A
Суть в том, что это очень дёшево получается. То есть две видеокарты, они по 5.000 стоят. Э, и для запуска всего лишь 10.000 надо. А любую видеокарту там от 16 ГБ, если купить, но я думаю 40-50.000 будет. Ну, в четыре, в пять
Speaker A
раз дороже. И примерно то же самое у вас получится. Но если локально запускать, то я особого смысла не вижу, потому что в той же Олаами, ну, и вообще в интернете, вот я DPC пользуюсь, я зайду, может, в день
Speaker A
пару запросов сделаю, и запуск постоянно мне, ну, не нужен этот. Постоянный запуск — это будет для меня очень дорого.
Speaker A
То есть я вообще бесплатно и пользуюсь, грубо говоря, ну, дипсиком. То есть если, возможно, какой-то проект у вас и по IP у вас используется, то такой вариант может быть даже выгоден, потому что производительность у них не такая низкая. Ну, вот может
Speaker A
400-500 сам компьютер потребляет. М, то есть, а, при количестве пользователя, если увеличиваться, я читал, что там токенов даже будет больше. То есть как-то это считается, что на одного пользователя будет меньше токенов, но в общем, в общем их будет
Speaker A
больше. Вот получается как-то так. Так что такие 750 можно даже использовать под нейросети. И в теории, наверное, даже можно было бы запустить на 120 млрд параметров, если подключить штук восемь, там, по-моему, от 60 Гб надо.
Speaker A
И можно было её тоже затестить. Сколько она выдаёт? Всё, спасибо за просмотр. Подписывайтесь на канал, пишите комментарии, подписывайтесь в группу, если что. Там можно тоже пообщаться.
Speaker A
Всего доброго. Yeah.
Topics:GPT-OSSCMP 50HXнейросетьвидеокартаLM StudioChat GPT20 миллиардов параметровлокальный запускпроизводительностьбюджетный ИИ











