**Запустил GPT-OSS 20B на двух CMP 50HX x16  — это в 5 раз дешевле. 20 ГБ VRAM за копейки — Transcript & Summary | SozAI**
Source: https://sozai.app/transcript/gpt-oss-20b-cmp-50hx-cheap-vram/

Запуск GPT-OSS 20B на двух видеокартах CMP 50HX с низкой стоимостью и обзор производительности.

## Key Takeaways

- Запуск GPT-OSS 20B возможен на бюджетных видеокартах CMP 50HX с приемлемой производительностью.
- Суммарный объем видеопамяти 12 ГБ ниже рекомендуемого, но модель работает стабильно.
- Стоимость оборудования значительно ниже, чем у видеокарт с 16 ГБ VRAM, что делает запуск доступнее.
- Локальный запуск подходит для проектов с частым использованием, но не для редких запросов из-за затрат.
- Масштабирование до моделей с большим числом параметров требует значительно больше видеокарт и памяти.

## What the video covers

- Автор запускает нейросеть Chat GPT OSS с 20 млрд параметров на двух видеокартах CMP 50HX после майнинга.
- Видеокарты работают на 16 и 4 линиях PCIe из-за ограничений процессора, аналог i7 6700 с 4 ядрами и 8 потоками.
- Используется 24 ГБ оперативной памяти, чат запущен через LM Studio, который показывает количество токенов и производительность.
- Две видеокарты с 6 ГБ VRAM каждая обеспечивают суммарно 12 ГБ видеопамяти, что ниже рекомендованных 16 ГБ для LOLM.
- Скорость обработки составляет около 68 токенов в секунду, что считается хорошей производительностью для такой сборки.
- Стоимость двух видеокарт CMP 50HX около 10 000 рублей, что в 4-5 раз дешевле аналогов с 16 ГБ VRAM.
- Автор отмечает, что локальный запуск нейросети не всегда оправдан из-за затрат и низкой частоты использования.
- Для масштабирования до 120 млрд параметров потребуется около восьми видеокарт с 60 ГБ VRAM.
- Автор рекомендует подписываться на канал и участвовать в обсуждениях в группе.

## Chapters

1. 00:00 Введение и цель видео
2. 00:18 Описание видеокарт и процессора
3. 00:35 Характеристики системы и памяти
4. 00:48 Запуск Chat GPT OSS через LM Studio
5. 01:50 Использование видеокарт и распределение памяти
6. 02:20 Производительность и скорость обработки токенов
7. 03:09 Стоимость и сравнение с другими видеокартами
8. 03:35 Выводы и рекомендации по использованию
9. 04:33 Перспективы масштабирования и завершение

Answers

## Questions about this video

Какие видеокарты использовались для запуска GPT-OSS 20B?

Для запуска использовались две видеокарты CMP 50HX после майнинга, которые работают на 16 и 4 линиях PCIe.

Какова производительность модели на данной сборке?

Скорость обработки составляет около 68 токенов в секунду, что является хорошим результатом для бюджетной сборки.

Стоит ли запускать GPT-OSS локально на такой системе?

Если вы делаете несколько запросов в день, локальный запуск может быть невыгоден из-за затрат на постоянную работу, лучше использовать облачные сервисы.

## Full Transcript — Download SRT & Markdown

00:02

Speaker A

Всем привет. В этом видео мы попробуем запустить нейросеть Chat GPT OSS на 20 млрд параметрах на двух видеокартах CMP50ксы после майнинга.

00:18

Speaker A

Видеокарты эти распаяны на 16 линий. Одна из них работает полностью в 16, а вторая будет работать на четырёх линиях, потому что здесь нет столько линий у процессора, чтобы две видеокарты на все 16 линий тащить. Процессор здесь

00:35

Speaker A

это аналог i7 6700. Это четыре ядра, восемь потоков стоит. Материнская плата на 11 псяде первом сокете.

00:48

Speaker A

Ну и оперативной памяти. Здесь у меня стоит четыре планки, две посе и две почеты, 24 Гб. [фыркает] Значит, запустил я чат. Чат я запустил через LM Studio, можно и через Олаама.

01:10

Speaker A

Там даже оперативной памяти чуть поменьше она требует. Но LM Studio здесь показывает количество токенов. Какая производительность?

01:20

Speaker A

Вот у меня получается GPT OSS 20 млрд параметров. [фыркает] Сам монитор подключён к компьютеру через встроенную видеокарту в процессор, выводит изображение.

01:35

Speaker A

Так, в диспетчере задач у нас 16 ГБ занимает, почти 17. И подключены две видеокарты. Они на драйверах, которые пропачены, они отображаются как 2080, как 2080 Ti, но это CMP 50 и хаиксы.

01:54

Speaker A

Значит, при размещении в них модели памяти уходит по 6 Гб. Это на одной 6 Гб.

02:02

Speaker A

И на второй видеокарте тоже 6 Гб. То есть суммарно 12 ГБ — это минимум.

02:08

Speaker A

Ну, на сайте в рекомендованных пишут, что для запуска этой LOLM нужно минимум 16 ГБ.

02:15

Speaker A

Так, в общем, давайте попробуем ей какой-нибудь запрос отправить и посмотрим скорость. Она долго загружается, потому что у меня на жёстком диске всё это. То есть примерно вот скорость работы её.

02:40

Speaker A

Всё уже, ну, печатает, напечатал. Так. Получается, скорость в токенах — это 68 токенов в секунду. Она мне выдаёт на 2750.

02:54

Speaker A

Вот примерно такая производительность. В общем, посмотрел в интернете. Эта производительность, на самом деле, неплохая для такой сборки.

03:09

Speaker A

Суть в том, что это очень дёшево получается. То есть две видеокарты, они по 5.000 стоят. Э, и для запуска всего лишь 10.000 надо. А любую видеокарту там от 16 ГБ, если купить, но я думаю 40-50.000 будет. Ну, в четыре, в пять

03:22

Speaker A

раз дороже. И примерно то же самое у вас получится. Но если локально запускать, то я особого смысла не вижу, потому что в той же Олаами, ну, и вообще в интернете, вот я DPC пользуюсь, я зайду, может, в день

03:35

Speaker A

пару запросов сделаю, и запуск постоянно мне, ну, не нужен этот. Постоянный запуск — это будет для меня очень дорого.

03:43

Speaker A

То есть я вообще бесплатно и пользуюсь, грубо говоря, ну, дипсиком. То есть если, возможно, какой-то проект у вас и по IP у вас используется, то такой вариант может быть даже выгоден, потому что производительность у них не такая низкая. Ну, вот может

03:58

Speaker A

400-500 сам компьютер потребляет. М, то есть, а, при количестве пользователя, если увеличиваться, я читал, что там токенов даже будет больше. То есть как-то это считается, что на одного пользователя будет меньше токенов, но в общем, в общем их будет

04:14

Speaker A

больше. Вот получается как-то так. Так что такие 750 можно даже использовать под нейросети. И в теории, наверное, даже можно было бы запустить на 120 млрд параметров, если подключить штук восемь, там, по-моему, от 60 Гб надо.

04:33

Speaker A

И можно было её тоже затестить. Сколько она выдаёт? Всё, спасибо за просмотр. Подписывайтесь на канал, пишите комментарии, подписывайтесь в группу, если что. Там можно тоже пообщаться.

04:47

Speaker A

Всего доброго. Yeah.

Topics: GPT-OSS CMP 50HX нейросеть видеокарта LM Studio Chat GPT 20 миллиардов параметров локальный запуск производительность бюджетный ИИ


---
This is the markdown twin of https://sozai.app/transcript/gpt-oss-20b-cmp-50hx-cheap-vram/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
