Обзор сборки ПК из 4 видеокарт Tesla V100 с NVLink, тесты производительности и анализ стоимости.
Key Takeaways
- Объединение нескольких Tesla V100 через NVLink даёт прирост производительности, но не пропорциональный количеству карт.
- Tesla V100 остаётся востребованным и мощным железом, несмотря на возраст и мнение о его устаревании.
- Стоимость сборки из 4 Tesla V100 с NVLink сопоставима с более дорогими современными решениями, но имеет свои преимущества.
- Серверные платы для 4 видеокарт сложны в изготовлении и требуют мощного питания и охлаждения.
- Для задач с большими объёмами данных и языковыми моделями Tesla V100 показывает высокую эффективность.
What the video covers
- Автор собрал ПК из четырёх видеокарт Tesla V100 с поддержкой NVLink для максимального объёма видеопамяти и вычислительной мощности.
- Проведено более 200 часов тестов в 68 конфигурациях с разным количеством видеокарт и режимами работы.
- Обсуждается реальный прирост производительности при добавлении видеокарт — около 22%, а не линейный рост.
- Показано сравнение с видеокартами RTX 3090 по стоимости и производительности.
- Рассказано о сложности и стоимости материнских плат с поддержкой 4 видеокарт и особенностях их питания и охлаждения.
- Автор объясняет, почему Tesla V100, несмотря на возраст и мнение о «хламе», остаётся актуальным и мощным железом.
- Демонстрируется пример загрузки и обработки большого объёма текста (роман 'Война и мир') для тестирования языковых моделей.
- Обсуждается разница между моделями Tesla V100 с 16 ГБ и 32 ГБ памяти и их ценовая доступность на вторичном рынке.
- Показаны технические детали NVLink, PCI Express и особенности серверных решений для объединения видеокарт.
- Видео содержит подробные инструкции по сборке, настройке и тестированию системы.
Chapters
- 00:00Введение и идея объединения видеокарт Tesla V100 через NVLink
- 05:57Особенности серверных плат и их сложность
- 10:45Приобретение и подготовка платы и компонентов для сборки
- 16:18Процесс установки модулей и сборка системы
- 21:28Тестирование производительности и анализ результатов
- 26:16Обработка больших текстов и тестирование языковых моделей
- 32:40Сравнение с RTX 3090 и обсуждение стоимости
- 42:23Заключение и рекомендации по покупке Tesla V100
Full Transcript — Download SRT & Markdown
Speaker A
И сейчас представьте ещё на секунду. Она ведь поддерживает технологию NV. Представьте, если объединить такие две видеокарточки либо четыре штуки, это просто будет запредельно, просто неадекватный объём видеопамяти, ещё и вычислительной мощности. Но это уже совершенно другая история.
Speaker A
Другая история, которая должна быть раскрыта, я считаю, рассказана полностью. Тот парень в чёрно-белом кадре был уверен, знаете, в одной вещи.
Speaker A
Он сказал: "Это совершенно другой уровень мощности. 22%, столько мне дали две дополнительные видеокарты, не в два раза прирост производительности, не в полтора даже".
Speaker A
22% скорости за киловатт 350 Вт из розетки, за второй контур охлаждения и за примерно 200 часов у стенда. 68 конфигураций, одна видеокарта, две видеокарты, четыре, тензорный режим, конвейерный, гибридный и везде одна и та же самая картина.
Speaker A
Добавляешь карту, получаешь проценты. 22% вместо другого уровня мощности. Здесь я должен был выйти и сказать: "Я ошибался.
Speaker A
Никакого другого уровня там мощности нет. Есть 22%. Я почти так и сделал. Меня остановила одна только мысль, что я мерил не то.
Speaker A
Все 3 недели у меня на столе лежала одна книга. Это "Война и мир" Льва Николаевича Толстого. И я её, наконец-таки, читаю, потому что не перечитываю, потому что в школе я её ни хрена не читал. И здесь, наконец-таки, мне захотелось почитать
Speaker A
о классике. И я решил, знаете, проверить не скорость, а кое-что другое. И искать материал, как вы понимаете, не пришлось.
Speaker A
Он лежал прямо передо мной. Первый том — это 700.000 знаков в токенах, тех единицах, которые модель меряет и мы с вами меряем — это примерно там 230.000 токенов. Для понимания, обычная видеокарта на 24 ГБ. Обычная, вы скажете, видеокарта на 24. У каждого же
Speaker A
дома стоит видеокарта на 24 ГБ, но будем считать, что она обычная видеокарта. Тянет примерно от 8 до 32.000 токенов. Я загрузил, чтобы вы понимали, эту книгу целиком. Не пересказ, не куском, сплошным текстом, как и есть, и на глубине примерно 70%
Speaker A
вставил вот это. Пьер вынул из кармана сложенный вчетверо листок бумаги и прочёл вслух. Видеокарта V100 SXM2, серийный номер 7734 Alpha, установлена в слот номер три. Частота 1.372 МГц.
Speaker A
Наташа посмотрела на него с недоумением. Один абзац где-то в середине там третьей части и задала один лишь вопрос: что Пьер прочёл вслух с листка, сложенного вчетверо? Обратите внимание, чего в этом вопросе нет. Я не сказал, что искать. Я
Speaker A
не сказал, что в этом тексте что-то вообще поменялось. Я не назвал ни видеокарту, ни номер, ни главу. Модели нужно было прочитать всю книгу целиком, найти сцену, понять, кто такой Пьер и в какой момент он конкретно лезет в карман. И знаете что? Она ответила слово
Speaker A
в слово. На одной карте этого вопроса задать нельзя. На двух тоже нельзя. И почему, я объясню это чуть-чуть позже.
Speaker A
Чуть больше 3-х недель чисто на одни тесты. Это в районе там 200-250 часов, чисто сидя вот у консоли. 250 кВт/ч только обычно квартира съедает за месяц со светом, холодильником, стиралкой, со всем вообще чем угодно. У меня это ушло
Speaker A
просто в одну розетку за 3 недели. 68 конфигураций, 13 языковых моделей, восемь моделей для создания картинок и две даже для генерации видео. И две RTX 3090 в качестве соперника стоит, потому что они примерно столько же, а продать их потом, ну, несравнимо легче, чем вот
Speaker A
эти V100. И к концу этого видео вы будете знать три вещи. Для чего эта штука прямо лучшая покупка на рынке прямо сейчас? А для чего это, ну, спорное решение? А для чего её брать, ну, прямо категорически нельзя? Вообще.
Speaker A
Полгода назад я выпускал ролик про Tesla V100 на 32 ГБ. И мне тогда написали, что это прямо устаревшее железо, это хлам, это мусор и серверный, которому место сейчас на данный момент на свалке. Насчёт устаревшего, ну, соглашусь, Вольта. Это 2017 год, это 9
Speaker A
лет уже у нас прошло. Насчёт хлама нет, потому что эта штука до сих пор делает вещи, за которые сегодня просят суммы с шестью нулями. Эти карты изначально сделаны не для того, чтобы работать по одиночке. Посмотрите на дно модуля. Это
Speaker A
у нас два разъёма. Первый — это обычно у нас PCI Express. По нему карта говорит с материнской платой. А второй — это у нас Elink. И он существует ровно для одного, чтобы карта говорила напрямую с другой такой же картой, минуя процессор, минуя
Speaker A
материнку, минуя вообще всё. 300 ГБ в секунду между чипами. Для сравнения, PCI Express третьей версии, на которой работают эти видеокарты, даёт примерно 16. Такие платы бывают на две, на четыре и на восемь видеокарт. Восемь — это, конечно, уже совершенно прямо серверная
Speaker A
стойка. Нам туда точно не надо. Четыре — это самый популярный вариант. Официально их никто прямо не продаёт. NVIDIA документацию на эту платформу просто-напросто не публиковала. Поэтому эти платы делают, естественно, наши друзья из Поднебесной. Реверсор, закрытое серверное железо вслепую и
Speaker A
собирают, ну, что по сути называется, самодельный DGX. А вот за что мы платим, смотрите сюда. Когда вот таких у нас видеокарт две, их можно соединить фактически напрямую. И платы на две карты стоят примерно в три раза, чтобы вы понимали, а то и в четыре,
Speaker A
дешевле, чем на четыре карты. Потому что, соединяя четыре карты, вам нужен специальный чип, потому что он будет разруливать трафик между всеми картами сразу. Кто с кем говорит, в какой момент, по какой линии, по сути, это коммутатор внутри платы. Плюс схема
Speaker A
питания там такой сложности, что процент брака достаточно-таки высокий, а гарантий нет никаких, потому что вам нужно запитать каждую карту по 300 Вт. И это всё идёт через материнскую плату, вот эту плату для карт. Представьте, вам нужно практически киловатт 300, киловатт
Speaker A
200 направить через плату ко всем картам. Там брак, естественно, будет. И он очень большой. Поэтому цена такой платы на четыре карты — это 64.500 руб. Плюс ещё примерно 7.000 руб. на пошлину. Практически 72.000 руб.
Speaker A
получается. Правда, за эти деньги вам приезжает не только плата, потому что вам ещё приезжает переходник PCI Express на два разъёма, SF 8654, два кабеля туда же к нему, вентилятор для чипсета, термопрокладки и ещё четыре водоблока к тому же. Так что ценник
Speaker A
выглядит уже не таким страшным за такой наборчик. И знаете, я её купил, потому что мне, как и вам, хочется в этот мир больших технологий и бума вот этого всего, из-за которого у нас железо с каждым днём всё дорожает и дорожает,
Speaker A
потому что 100 — та же самая, H200, но нам точно не по карману, а сюда мир, в принципе, открыт. И данная плата приехала и легла ко мне на стол. Плата у меня была уже, а карт, естественно, у меня ещё не было.
Speaker A
Денег на плату хватило легко. Я продал свою видеокарту на 32 Гб V1, которую делал тогда обзор на неё. И купил, чтобы вы понимали, тогда я её за 40.000 руб., а продал за 60.000 руб. Запомните этот момент. Железо, которое называют все
Speaker A
хламом, за полгода прибавило к цене [смех] 50%, а сейчас она стоит ещё больше. А дальше начинается простая арифметика. С рук. В России тридцатидвухгигабайтную видеокарту сегодня можно купить в районе там 60-70.000 руб. И с Китая, с пошлиной. Это что-то там в районе, ну,
Speaker A
тех же самых денег. То есть четыре штуки у меня получается в районе 300.000 руб.
Speaker A
Плюс ещё сама оплата. Итого весь наш проект получается что-то в районе 400.000 руб. У меня нет 400.000 руб.
Speaker A
свободных. Я не блогер миллионик. Но есть второй вариант. Ровно такие же карты, ровно тот же самый чип, ровно тот же NVLink, та же самая архитектура.
Speaker A
Отличие только одно. Память 16 ГБ вместо 32. И стоят они не вдвое дешевле, они стоят 12.000 руб.
Speaker A
Не вдвое, а в семь раз. Представьте себе, вдвое меньше памяти. В семь раз по деньгам у нас отличие. Одна и та же карта, один и тот же чип. То есть у нас четыре модуля по 16 ГБ. Это у нас 64 ГБ
Speaker A
суммарно. Ровно столько же дают две тридцатидвухгигабайтные видеокарты, но стоит это в разы просто дешевле. И нашёлся один человек местный.
Speaker A
У него были четыре видеокарты на руках. У него было три по 16 ГБ и одна на 32 ГБ. И сделал он мне хорошую скидку.
Speaker A
Говорит: "Забирай всё за 70.000 руб." То есть я получал 80 ГБ по цене, то есть одной плашки на 32 ГБ, одного чипа на 32 ГБ примерно. Представьте себе.
Speaker A
Естест
Speaker A
А у вот этого разъёма SXM2, то есть у нас нет ни разъёмов, ни видеовыходов, нет ни вентиляторов, чтобы проверить это всё на мониторе, потому [фыркает] что это не видеокарту, которую, знаете, вотнул и посмотрел там этот модуль, который без платы, без питания, без
Speaker A
охлаждения, это просто кусок текстолита просто с чипом. Оплата, на которой можно проверить, у продавца также не было. И он сказал: "Все рабочие, забирай 100%".
Speaker A
И я, знаете, что сделал? Естественно, забрал. Начнём с того, что это плата формата E от не просто большая, а очень прямо большая. И теперь добавьте сюда четыре водолока помпу резервуар два радиатора по 360 мм и найти корпус. Куда
Speaker A
это поместится? Ну, задача со звёздочкой. Я выбрал Chift Night Hunter. То есть он стоит в районе там 6-7.000 руб. Total Black без единого светодиода, здоровый, насквозь, просто продуваемый.
Speaker A
В комплекте четыре 14 со0вочки идут ещё. Ну, мне вертушки не нужны, и я сразу же их, естественно, выкрутил. Брал я его только по одной причине. На сайте написано: "Поддерживает два радиатора 360 мм чёрным по белому". Я данную информацию проверил на нескольких
Speaker A
площадок. Везде одна и та же история. поддерживает ровно то, что мне и нужно. Забегая наперёд, это правда. Они туда действительно влезают, но с оговоркой.
Speaker A
[фыркает] Теперь про сами радиаторы. Здесь я мм чуть не выкинул деньги на ветер, потому что если посчитать, а, по уму, как говорится, четыре видеокарты, каждая по 350 Вт, это 1.200 Вт у нас электричество ватов нужно отвести тепла.
Speaker A
По всем расчётам сюда нужно два радиатора по 360 мм. И ещё толщиной не 30, а 45 мм. По 3.500 руб. за каждый.
Speaker A
Так я сам подумал в принципе посчитал. И так мне ещё нейроночка подсказала. Я, естественно, послушал это всё дело и заказал. А потом он поговорил с человеком, который собирает контуры руками, и он сказал: "Под данные задачи хватит обычных двух, а, 360 мм радиаторы
Speaker A
по 30 мм." Потому что расчёт на бумаге не учитывает одну очень важную деталь, что часть тепла уходит в воздух прямо с самих модулей и с самой платы, на которой они стоят, то есть мимо самого контура. То есть 45 мм здесь избыточно.
Speaker A
Радиаторы к тому моменту уже ехали из Китая. Ну и ладно, я подумал, работать это будет всё тише. Дальше в комплекте с платой идёт, а, маленький радиатор с вентилятором, тот самый, который охлаждает чипмонита.
Speaker A
Сразу скажу, это шумная Она самая шумная в корпусе. Наперёд вам сбегаю. Потом я дам вам послушать, как это всё звучит. И ставится он через термопроку и прикручивается болтами. Болтов в комплекте не было, хотя они должны были быть. Ладно, думаю, съежу строительные,
Speaker A
куплю их. И как вы думаете, какая резьба нужна? Не, не 4,2 с поной. Минимальный размер, который был вообще в магазине и существовал в продаже, это был 3, а здесь 25,5. Итого плата за 72.000 руб., карта за 70.000 руб. Радиаторы из Китая. И весь этот
Speaker A
проект у меня стоит из-за двух болтиков по 3 руб. В итоге я заказал эти винты на озоне. Длина нужна, кстати, либо 10 мм, либо 12 мм, если у вас тоже эти болтиков не окажется. Я взял 12. У меня всё это
Speaker A
вкрутилось без каких-либо вопросов. Это был, кстати, первый дозаказ и не последний. Дальше нам нужно собрать все комплектующие для основного контура.
Speaker A
Первое - это у нас помпа DDC. Я взял на 780 л в час. То есть она стоит 4.900, резервуар 1.200, а, девять фитингов, шаровый кран, 3 м шланга. И вот это вообще всё, всёвсё вместе. Мне выходит что-то в районе там
Speaker A
9.700 руб. То есть водоблоки, напоминаю, приехали бесплатно. Ну как бесплатно, за 72.000 руб. в комплекте с самой платой.
Speaker A
И жидкость. Вот здесь момент, на котором убивают многие контуры. В воблоке у меня медные радиаторы. Я решил сэкономить и взял алюминиевые. Два разных металла в одном контуре. Если залить туда обычную дистиллированную воду, начнётся электрохимическая коррозия. Алюминий будет разрушаться, а продукты реакции
Speaker A
осядут на каналах воблока, и постепенно это всё забьётся. То есть контур начнёт греться, и вы будете думать, что сдохла помпа, а внутри просто у вас нарастает грязь. Поэтому мы либо с вами берём уже какую-то готовую жидкость с ингибиторами, вот, например, я взял вот
Speaker A
такую. Это самая дешёвая она была у нас, либо мы берём десятилят и отдельно к нему добавляем присадки. Есть ещё вариант доплатить там 15-2.000 руб. и взять радиаторы медные. Я решил, как сказал, уже сэкономить. Взял готовую, самую дешёвую, 500 руб. за литр. Чтобы
Speaker A
вы понимали, вот эта банка стоила. Купил две такие бутылки, потому что понятия не имел, сколько вообще может понадобиться.
Speaker A
понадобилось, чтобы вы понимали, вот столько осталось у меня одной бутылкой. То есть у меня одна целая стоит и вот столько осталось. Тут разметка есть. Тут осталось 300 мл, чтобы вы понимали. То есть это 700 мл на весь контур. Это
Speaker A
четыре водолока, два радиатора, помпа, резервуар и ещё 3 м шланга. Это меньше литра жидкости вам нужно. То есть вторая стоит, так и не распечатана. Опять переплатил.
Speaker A
Посадка модулей - это самое простое, что есть в данной сборке. Снимаем заглушки, смотрим на разъёмы. Там две прорези: маленькая и большая. На самом модуле они такие же. Совмещаем большую с большой, маленькую с маленькую. Кладём этот чип сверху. Просто восемь болтов. Сначала
Speaker A
четыре у чипа крест-накрест, потом четыре по краям. Также крест-накрест. Тянем спокойно, без какого-либо фанатизма. Всё это вся установка.
Speaker A
Никаких защёлок, никаких слотов, ничего страшного тут нету. А вот с воблоками нужно быть внимательней. Об этом практически нигде не сказано и не написано. Они приезжают двух видов. Есть сетчатые структуры внутри. Это ровно такие, которые можно поставить в любом
Speaker A
положении, и у вас будет всё прекрасно работать. А есть с параллельными такими, можно назвать, каналами, канавками. И тут есть одно положение правильное, а другое неправильное. Из четырёх водоблоков правильно собран, приехал только один. Лечится это, конечно, за 5 минут. Откручиваем четыре винта,
Speaker A
поворачиваем медную пластину на 90°. Закручиваем это всё дело обратно. Главное проверить прижимы и посмотреть, чтобы уплотнительная прокладка легла ровно и никуда она у нас не сместилась.
Speaker A
Кстати, воблок к модулю притягивается обычными болтами М3 на 6 мм, то есть ровно теми же корпусными винтами, которые материнская плата крепится к корпусу. Один я потерял, взял один из винтов, который шёл в комплекте с корпусом, и встал он как родной. После
Speaker A
истории с М2,5 это была уже приятная неожиданность, потому что я думал, опять что-то надо куда-нибудь ехать надо будет и подбирать. Нет, всё отлично. Дальше идёт у нас термопаста. Мажем прямо на кристалл. Тут всё как обычно, никакой возни. А просто намазали и всё. И
Speaker A
прокладки, термопрокладки. В комплекте они идут все одинакового размера. Это на 2 мм. Что на мосветы, что на дроссели.
Speaker A
Ну, я посмотрел и мне кое-что не понравилось, потому что два дросселя у нас остаются вообще ничем не прикрыты.
Speaker A
То есть прокладочки они коротенькие оказались. И взял свои двухмиллиметровые, нарезал потоньше и положил туда же. Может, это было и лишним каким-то моим действием, но мне так будет спокойнее житься.
Speaker A
Эту штуку многие вообще, в принципе, не покупают, а я купил. 2.500 руб. по акции стоит дешевле, чем фитинги. Не потому, что я был уверен, что она мне понадобится. Просто раз уж я лезу в кастомную воду, буду делать это
Speaker A
по-человечески, как это написано в учебнике по кастомной водянке. Первую проверку я сделал сразу же после того, как пересобрал водоблоки. 0,7 бара я вкачнул на модули. 15 минут стрелка не дрогнула ни на миллиметр. Потом я собрал весь контур на столе и проверил ещё раз.
Speaker A
И вот теперь важное предупреждение. На полном контуре больше 0,4 бара мы с вами не качаем. 0,5 - это вообще уже потолок.
Speaker A
У вас в системе десятки резиновых уплотнителей и лишнее давление не проверяет их, а убивает. Даёт вот эти микротрещины какие-то, которые протекут у вас через месяц. Не пытайтесь проверить контур на прочность. Вы проверяете герметичность.
Speaker A
Теперь про питание. И начну с цифры, которая меня удивила. 200 Вт. Этот стенд жрёт в простою. Вы его просто включили, ничего не запустили, просто сидите и у вас из розетки уже жрётся 200 Вт за то, что эти карты просто существуют. Теперь
Speaker A
другой край. По 300 Вт на карту плюс примерно 150 Вт. Вся остальная обвязка это 1.350 Вт. И вот что интересно. За 3 недели теста я эту цифру увидел только на самом деле пару раз. Первый момент был это когда я читал Войну и мир, когда у меня
Speaker A
карта читала её, просчитывала. И второй раз при генерации картинок на четырёх видеокартах. Всё. В других моментах я не видел эту цифру ни разу. Во всё остальное время в обычных чатах при генерации картинок не батчем, а генерация видео тех же самых, стенд есть
Speaker A
в районе там 700-800 Вт. То есть загрузить эти карты на 100% возможно добиться этих показателей, но это трудно сделать. Но 1.350 Вт - это ещё не вся правда, потому что считайте, что это у вас просто видеокарта столько потребляет, и ей дополнительно нужен ещё
Speaker A
компьютер, который будет этим всем делом управлять. И он подключается с помощью а вот таких, в общем, проводов. Она называется SFF 8654.
Speaker A
И в комплекте идёт вот такая плата, куда это всё дело вставляется. То есть у нас два провода таких и вот такая вот плата.
Speaker A
И представьте, что другой компьютер у вас тоже жрёт электричество. А тестовый стенд у меня достаточно-таки мощный, и потребление его было у меня в районе 400 Вт. Итого из розетки в пике 1.700 примерно 1.800 Вт электричества и две коробки под
Speaker A
столом. Вот это уже, я считаю, честная цифра. И здесь есть решение, до которого я додумался слишком поздно. Тот же самый вот этот SF провод. Вот этот SF to SF.
Speaker A
Кстати, знаете, что это за провода? Это от супермикро, чтобы вы понимали. Это в серверах вот таких провода подключают диски, чтобы вы понимали. Это серный провод для дисков. Это не для видеокарт даже. Это он такое отступление. В общем, он есть ещё SF to Окулиink. А окулиink
Speaker A
знаете что у нас? И кто умеет? Окулиink у нас умеют мини ПК. То есть, в принципе, в теории возможно просто вот этот мини ПК положить в корпус другого ПК большого, и у вас будет одна коробка вместо двух. И что
Speaker A
это меняет? Вместо 400 Вт на управление у вас получается в районе там 65, максимум 100 Вт, потому что эта коробка жрёт, максимум 100 Вт. То есть общее потребление - это в районе там 1.400-1500 Вт. И главное, вся система у нас
Speaker A
становится одной коробкой, а не двумя. Такого провода, к сожалению, у меня не было. Купить его достаточно-таки тяжело.
Speaker A
В России, по крайней мере, я не нашёл. Ну, может быть, я плохо искал. Но он 100% существует, потому что у продавца платы есть отдельная комплектация конкретно с Окулинка. Вместо вот этого PCI экспрессовского вот этого а разъёмчика. Вот вместо вот этого
Speaker A
разъёмчика у вас здесь будет просто один провод ещё Окулинка лежать в комплекте. По поводу блока питания. В идеале я считаю сюда ставить 2 кВт, но такие блоки питания стоят космических просто бабок денег. Дешёвый путь, знаете, у нас есть, естественно, это майнерские блоки
Speaker A
питания с Савида, потому что это полтора примерно там 2 кВт можно купить за 3-4.000 руб. За надёжность, конечно, я не ручаюсь, но майнеры на них майнили годами, в принципе. Единственный момент, они шумноватые, то есть вентилятор лучше сразу под замену. Я взял first player на
Speaker A
1.300 Вт. Platin от X3.1 модульный гарантии 10 лет. То есть он стоит 18300. Это на 1.300 Вт стоит 18300.
Speaker A
Представьте, сколько бы стоил там на 2 кВт блок питания. Проблем с данным блоком питания у меня ни разу не было.
Speaker A
Хоть и запаса у нас здесь нулевой. Даже мы берём ещё в долг 50 Вт, потому что у нас на 1.300 Вт, а мы берём 1.350 Вт. И на самом деле блок питания справляется прямо достойно. Ну не ни не странно,
Speaker A
потому что Kberneticsкс платина, он сам платина. Так что, естественно, он лучше будет дальше даже китайщина на 1.500 Вт, мне кажется, а то и на 2.000 Вт. Но жить я, в общем, с этим блоком питания на постоянке вам не советую. А ставьте
Speaker A
всё-таки что-то помощнее. Помните, я вам говорил, что на сайте написано: "Два радиатора 360 мм у нас влезают. Первый у нас встаёт идеально, естественно". Спецификация не соврала.
Speaker A
2-360 мм сюда влезают. Просто в этот момент в корпусе не должно быть ничего. Просто он должен быть пустой. Ничего в нём не должно быть. Ни платы формата EATX, ни помпы, ни резервуара, ни фитингов, которые нужно куда-то выводить. Второй радиатор упёрся в
Speaker A
притык. Выводить коннекторы стало некуда. Как я и говорил, 45 мм здесь были избыточные, они не нужны просто-напросто. И плыму сюда, а встанут идеально 2 360 мм на 30 мм. Либо мой вариант, к которому я уже пришёл, один толстый радиатор мы берём на 360
Speaker A
мм 45 мм толщиной. Второй мы берём 240 мм на 30 мм толщиной. И стоит он всего там 2.000 руб., грубо говоря, за два толстых радиатора я отдал 7.000 руб.
Speaker A
Один из них оказался просто-напросто лишним. спасли меня. 240 спас на 30 мм. Совет нейросети обошёлся мне в 3.500 руб. Опять меня нейросетка кинула. Как тогда, помните выпуск у меня был, когда меня с материнской платы она тогда кидала меня на бепсете
Speaker A
и с видеокартами ARК. Теперь она меня на 3.500 руб. тут кинула. Вот зараза кидает меня. Я ещё под неё сборку собираю.
Speaker A
Охреневшая. Под температуру, кстати, всё отлично. В простое контур держит. Ну, как в простое, там 200 Вт потребления, как я уже говорил, в простой. У него в простоей - это комнатная температура всё равно 25 -30°.
Speaker A
Лёгкие какие-то задачи вот эти 700-800 Вт, это где-то у нас в районе 50°. Если мы вжариваем все 1.350 Вт туда и вентиляторы выкручиваем, потому что я купил диммер, который выкручивает вентилятор и помпу на скорость определённую. При 70% примерно это
Speaker A
70-60% - это беззвучный режим данной помпы, я бы назвал. Это у нас в районе 60-62°.
Speaker A
То есть запас у нас ещё есть. И тут у нас случился, как вы понимаете, второй дозаказ. Опять нам надо радиатор заказать и опять ждать. И пока у меня это всё дело ехало, вылез ещё и третий.
Speaker A
Плата приезжает у нас с металлической пластины сзади, то есть с бэкплейтом, так называемым. Её можно снять, потому что она держится на обычном скотче, но я решил оставить. Итого толщина вместе крепления у нас получается около 5 мм. А корпусные винты, напоминаю, они 6 мм.
Speaker A
Итого у нас получается то, что материнскую плату мы не можем просто-напросто прикрутить, потому что у нас не хватает длины вот этого болтика.
Speaker A
Он просто не достаёт до резьбы. То есть 3 нам нужно на 8 мм. Тоже заказываем, тоже ждём. К тому моменту я уже перестал удивляться, что мне надо что-то будет дозаказывать.
Speaker A
Пока ехал второй радиатор и винты, я не выдержал и собрал на столе это всё как есть. С одним хотя бы радиатором без нагрузки посмотреть, что это всё включится, запустится. Залил обычную дистиллированную воду. Напоминаю, что этом делать нам не стоит, но я сразу же
Speaker A
потом её слил, и всё нормально было. То есть никакой коррозии у меня там не образовалась. И чудо запустилось всё с первого раза. Я даже кружочек там в Telegram вроде как скинул видео, я уже не помню. И все четыре видеокарты на
Speaker A
месте. Я уже выдохнул. Ну, на следующий день мне пришли винты. Я собрал всё в корпус, залил правильную жидкость. И вот, наконец-таки, по-настоящему мы сейчас будем тестировать всё позади, сборка позади. И я ставлю убунту, загружаюсь, открываю терминал, смотрю список
Speaker A
устройств на шине. Четыре видеокарты на месте, тридцатидвухгигабайтная тоже здесь. Я уже потираю руки, думаю, всё, ну, половина реально работа позади, дальше только тесты. Ставлю драйвера, ввожу NVIDIA SM, и у меня там три [откашливается] тридцатидвухгигабайтной видеокарты просто-напросто нет. Я
Speaker A
потыкался, посидел сначала, думал, может, какая-то программная ошибка, это всё-таки у нас тридцатидвухгигабайтный модуль, а те другие 16. Может, они как-то между собой не ладят? Я подумал.
Speaker A
Ну, какие-то вот мои там программные вот эти разработки ничем не увенчались. Я уже думаю: "Ну ладно, может быть, там пылька какая-то попала, разберу-ка я, продую модуль, разобрал, продул модуль, поставил обратно, ничего не помогаю".
Speaker A
Думаю, ну, последний тест, прямо поменяю модули местами. Поменял модули местами. Та же ситуация. Итак, ребят, почему мы с вами тут сидим сейчас? Всклиниваюсь я так резко. Вот эта вот видеокарта, она у нас мёртвая. Если вы ещё не поняли, как
Speaker A
это произошло в самом начале, когда я окончательно уже начал запаковывать наш контур, грубо говоря, заливать жидкость, я включил и проверил винде. А в винде у меня отображалось то, что, ну, я аж открыл ГПУ программу, смотрю, там все видеокарты есть. Я думаю, отлично, тогда
Speaker A
можно собирать. И сейчас, когда я загружаюсь в буunнт, у меня данной видеокарты нет, когда я пишу Nvidia SIM.
Speaker A
И что это получается? то, что у нас видеопамять мёртвая. Просто потому что я эту видеокарту вытащил, продул. Я подумал, может быть, что-то там с контактом не то. Продул её, вытащил, ничего не изменилось. Поменял видеокарты местами, ничего не изменилось. Просто
Speaker A
ничего. Я уже всё ставил болванку. У меня была болванка для одной видеокарты, ставил её в компьютер. Она не определяется. То есть как PCI Express устройство, то есть она видится, но с ней работать нельзя. То есть она не заточена подработа. То есть эта
Speaker A
видеокарта мёртвая, у неё память всё кирдык. А я вот уже контур как бы запаковал, и мне пришлось это всё дело сливать, заново это всё делать. Так что эта сборка, на самом деле, не из лёгких.
Speaker A
И почему вот этот выпуск так затянулся? Потому что я каждый день что-то дозаказываю, чтобы вы понимали. Реально каждый день что-то дозаказываю. Как я вам уже сказал, карта оказалась мёртвой.
Speaker A
И вот эта видеокарта, кстати, помните, я говорил, что проверить её негде было. Вот поэтому и негде было её проверить.
Speaker A
Модуль виден на шине, он физически там есть, к ней идёт питание, система его обнаруживает, а работать он с ней не может. И понять это можно только установив драйвер, никак. Потому что из винды я запускал, тоже открывал ГПУ Z и
Speaker A
там он был. Этот модуль был, но он нерабочий. И вот что важно. Человек вернул мне 20.000 1.000 руб. сам без каких даже разбирательств. Он сказал то, что карту оставляй себе, она мне не нужна, она всё равно нерабочая. И на тебе 20.000 руб.
Speaker A
То есть мне обошлись три видеокарты за 50.000 руб. Ну ладно, чуть больше а рынка. Но как таковых претензий к данному человеку у меня ноль. Он продал то, что у него было. Он сам не мог проверить. Я думаю так. Я думаю, люди
Speaker A
только хорошие. Может, он сам не знал, не мог проверить и мне это продал. и потом ещё вернул деньги. Так что ноль претензий. Дальше пришлось, как обычно, это всё разбирать, сливать жидкость, снимать модуль. Почему вы скажете не оставить три видеокарты, оставил вот это
Speaker A
так, как есть, и тестировать бы начал бы, а потом приехал, поменял бы. Потому что NVLink не работает на трёх видеокартах. Там нечего делить. Работали просто две видеокарты, а две другие стояли, подогревались там, грелись. А зачем это делать? И учтите, что
Speaker A
перебрать контур, это надо повторно всё сделать, всю процедуру, что я сделал. Это слить жидкость, отсоединить шланги, нарезать новые, проверить герметичность, залить жидкость. Это не 2 минуты времени, это, ну, час работы минимум. А я это делал, я говорю, сливала жидкость
Speaker A
вот примерно семь раз за всё это время. И вы скажете: "Почему так долго видео, Андрей, не выходит? Почему так долго видео не выходит?" Потому что я на эту сборку, я говорю: "Это самый долгий проект. Это вот 3 реально недели, 3 12
Speaker A
недели сидел чисто вот за тестами и сборкой вот вот вот этой сборки. Просто реально это самое геморное, что я когда-либо делал. И в итоге я заказал ещё один модуль на 16 ГБ у другого человека уже с отзывами, с доставкой
Speaker A
проверенного. И вышло мне это 14.500 руб. и ещё 4 дня ожидания. То есть итоговая сборка получилась у меня не такой, какой я задумывал на 80 Гб. В итоге у меня получились просто все видеокарты на 16 Гб, итого 64 Гб памяти,
Speaker A
то есть 64 ГБ. Итак, спустя какое-то время все четыре видеокарты были у меня уже на руках, и они заработали. Эта видеокарта приехала рабочая, слава богу. Итого у меня было 64 ГБ видеопамяти NVLink, и это всё работает. И тут я упираюсь в стену,
Speaker A
потому что вопросов у меня было гораздо больше, чем один, а ответов на них у меня не было. Мне нужно было понять не только, что умеет моя конкретная сборка.
Speaker A
Мне нужно было понять, за счёт чего она это умеет. Даёт ли что-то NVLink на самом деле, либо можно было обойтись просто обычными PCI экспрессовскими вот этими переходниками, четыре штуки их вотнуть. Что меняют тридцатидвухгигабайтной версии этих видеокарт? И главное, стоит
Speaker A
ли эта вся возня каких-то свеч, если за те же примерно деньги можно взять две обычные игровые видеокарты RTX390, ну, чуть дороже получается. Чтобы ответить на все мои вопросы прямо и полностью расставить все точки над и уже наконец-таки мне нужны были четыре
Speaker A
тридцатидвухгигабайтных модуля по 80.000 за модуль, напоминаю, и парочка ещё 3090 соточка, а то и больше там за одну видеокарту. Купить это ради одного выпуска я не могу, поэтому я это всё дело арендовал. Все тесты на тридцатидвухгигабайтных V100 и парочки
Speaker A
RTX390 сняты на машинах Imers Cloud. Ребята дали мне доступ, без них половина этого видео просто бынапросто не состоялась. Спасибо им отдельное прямо за это. Причём там было куда, естественно, больше вариантов разных комбинаций железа, чем я взял это в
Speaker A
тесты. Я половину просто, ну, не стал добавлять в сравнение ролика. И так, я думаю, получится на полтора часа. Но рассказать я хочу даже не про это.
Speaker A
Смотрите, я сейчас вам буду полтора часа рассказывать, как я потратил 200.000 руб. и 3 недели своей жизни на то, чтобы выяснить, подходит ли мне это конкретное железо. У большинства из нас вообще с вами не 200.000 руб. свободных денег. У
Speaker A
меня их тоже, если честно, не было. И прямо хватило прямо ровень-ровень. Мне даже карту пришлось свою старую продать, чтобы купить ту самую плату. А вопрос у нас всегда у всех стоит только один.
Speaker A
Подойдёт ли мне это конкретное железо, либо я выкину эти деньги на ветер? И вот здесь простая мысль, до которой я дошёл на самом деле сам даже слишком поздно.
Speaker A
Вам не надо покупать железо, чтобы его проверить. Вам нужно просто арендовать его на пару часов. Здесь можно взять одну видеокарту, четыре видеокарты, две видеокарты, восемь видеокарт, ровно ту конфигурацию, которую вы думаете просто купить. Торификация у них посекундная от
Speaker A
нескольких рублей. То есть посидели, вы попользовались 15 минут, заплатили за 15 минут, посидели полчаса, заплатили за полчаса. Посчитайте сами. Взяли машину, допустим, вы на пару часов поставили свою модель, погоняли её в своих там задачах и уже знаете ответ на свой
Speaker A
вопрос. Хватит ли вам видеопамяти? Какая будет у вас скорость на данных видеокартах? И это стоит всего 1.000 руб. 1.000 руб. вместо 200.000 руб., чтобы узнать, нужна ли вам конкретно данная сборка. Вот это я только понял после того, как купил всё это дело и
Speaker A
собрал. Вы можете сделать наоборот по уму. По ассортименту Imers Cloud самый большой, я сказал бы, сервис в России по выбору видеокарт. То есть там и H100 есть, и H200 есть. В том числе конфигурация с НВНком, да, тот самый
Speaker A
NVLink, про который я вам буду рассказывать весь ролик, только видеокарты не 2017 года, а те, которые стоят как целая квартира. Плюс есть та же самая RTX5090, если нужно что-то посвежее и попроще. В библиотеке готовых образов можно поднять машину с уже
Speaker A
установленным совтом на любой прямо операционной системы. То есть вам не обязательно делать то, что я, в принципе, делал в этом выпуске. Кстати, вариант, о котором мало кто думает. То есть берёте машину с RDX5090, ставите Windows и можете даже поиграть
Speaker A
на 5090. И платим мы за часы, которые играли, а не за пакет. Если задачи, например, у вас рабочие, можем поставить просто голый Linux без графики, только под расчёты, подключиться по SSI протоколу и вперёд, пожалуйста. Нужно Windows с интерфейсом, чтобы смонтировать,
Speaker A
например, тот же ролик, поиграть на железо тоже, пожалуйста. Также у данного сервиса недавно был свежий релиз. Они добавили каталог нейросетевых модулей, то есть те самые языковые модели. Более 200 штук. Также самый большой в России.
Speaker A
Публичные точки доступа на данный момент бесплатные, приватные. Платите за время сервера, которое вы на нём работаете, не за какие-то токены. Для тех, кто гоняет много- это принципиально другая прямо математика. Ссылка под роликом, по ней 20% сверху к первому пополнению. То есть
Speaker A
проверьте до того, как вы что-то начнёте собирать. Я вот не проверил. И теперь сижу вам полтора часа, рассказываю, естественно, про мои ошибки. А мы возвращаемся с вами к железу. Итого у нас получается такая замечательная программка на сегодня. Мои видеокарты на
Speaker A
16 ГБ. Одна видеокарта, две видеокарты и четыре видеокарты. Четыре видеокарты также по 32 Гб через обычный PCI Express без Нлинка, чтобы понять, что даёт тот самый NVLink. и две видеокарты RTX 3090 как ответ на вопрос: а не проще ли взять
Speaker A
игровое и ещё и посвежее? То есть у нас 68 конфигурации, 13 языковых моделей, восемь моделей для генерации картинок, две для видео. И это ещё всё в разных режимах, то есть конвейерный, гибридной, тензорной. 3 недели, даже больше 3х недель на тесты, чтобы ответить на один
Speaker A
вопрос. Ну что, железо у нас собрано, карты у нас видны, контур у нас холодный. Вот здесь можно вот через переключатель выключать и принудительно можно его включить. В другом положении у нас просто оно автоматически будет включаться, когда у вас запускается
Speaker A
компьютер другой. Ну и принудительно можно тоже его включить. Я принудительно его включу для видо. Теперь надо на этом что-то нам запустить. И вот здесь начинается настоящая история.
Speaker A
Стандартный инструмент для таких задач называется VLM. Его ставят все, кто поднимает языковые модели на своём железо. Сейчас многие скажут: "Так, есть же у нас лама, есть же у нас LMUD. По сути, да, но сейчас я вам покажу и
Speaker A
расскажу, почему именно VLM считается стандартом для данного железа. И официальной версии на этих видеокартах данного приложения, данного дистрибутива не работает и не будет, потому что архитектура Volta - это 2017 год.
Speaker A
Поддержку этих видеокарт оттуда давно убрали. Для нового железа она есть, для наших с вами видеокарт нет, но есть люди, которые дописали её туда обратно принудительно. Есть определённый форк, куда вернули коды под наши с вами видеокарты. Ставим его. И тут начинается
Speaker A
самое интересное. Ошибки сборки, конфликты версии, ломающаяся русская локаль, библиотека, которая падает не сразу, а где-то минут через 12 работы. Я не буду показывать это подробно, иначе видео станет реально трёхчасовым, а то и дольше. Всё выложено в отдельном файле
Speaker A
снизу. Ссылка у нас будет в описании, скорее всего. Скажу только, сколько это стоило. Это больше 20 часов моего времени, чистого времени, за терминалом, которые я провёл. Заплатки, обходные пути, эксперименты. И в итоге это всё заработало. Оно заработало, представьте
Speaker A
себе, завелось. Но 2 сентября вышла новая версия этого форка, в которой это всё уже исправили. То есть 20 часов моего времени, а которые я потратил впустую, я считаю, люди сделали бесплатно и лучше даже, чем я. Руки у меня после такого, конечно же,
Speaker A
опустились основательно, но вывод я из этого сделал, и он, пожалуй, полезнее всех цифр в этом ролике. И если чего-то нет, иногда лучше просто подождать. Не всё нужно чинить самому вот сидеть руками. Особенно то, что чинит прямо сейчас несколько там десятков человек по
Speaker A
всему миру и делают это быстрее, чем вы один. И вот так выглядели эти 3 недели.
Speaker A
Встаёшь, наливаешь кофе, включаешь стецент, потом включаешь первый компьютер, второй компьютер, подключаешь поэсайчу и ставишь прогон. И время тестирования написано 40 минут. 40 минут ты ничего прямо не делаешь, смотришь на бегущие логи. Кстати, раз уж наушники в кадре, вот в этих, например, я просидел
Speaker A
6 лет. Это проводные Rizer. Видите, во что превратилась кожза. Он просто потрескался. Они до сих пор, конечно же, живые. Просто я убрал их на полку, потому что появились две другие пары. И последние месяцы я сижу в них. Сразу же
Speaker A
скажу, что в наушниках я про фан, про сцену, детализацию и прочее спрашивайте точно не меня. Но мне иногда пишут, какие наушники посоветуешь. Так что расскажу просто как обычный пользователь, что у меня есть и чем они отличаются. Наушники HAвит две пары, и
Speaker A
они, честно, разные. Не одни чем-то лучше, а просто разные. Вот эти, например, белые, полностью пластиковые.
Speaker A
В руках ощущаются попроще. Динамики 40 мм, подсветка статичная. Включил и она просто переливается радугой. По времени работы я, например, 3 недели сидел за компьютером где-то по 12-14 часов в день. И хватает примерно в моём использовании на 2 12 дня. И вот один
Speaker A
минус, который меня реально зацепил. Индикатора зарядки нет никакого. Просто сколько осталось, посмотреть невозможно. Вместо этого они начинают сообщать голосом каждые примерно 10 минут, что заряд низкий, надо бы зарядиться. Вторые чуть крупнее и сделаны, как по мне, заметно лучше. Слово премиальные для
Speaker A
этих денег я употреблять, конечно, не буду, но в руках они монолит, без люфтов, без скрипов. Амбишуры здесь, например, у нас уже кожаные, а не тряпочные и прямо мягкие. Это начинаешь ценить уже там через 8 часов работы в них. Динамики здесь уже 50 мм. Они
Speaker A
чуть-чуть, как по мне, погромче. Подсветка нормальная, настраивается уже, эффекты разные можно настраивать, а статичные цвета и просто её можно выключить. И живут они уже дольше, примерно на 10 часов. У меня выходило 3 с2 где-то 4 дня в том же самом режиме.
Speaker A
Есть несколько способов подключения, что у тех, что у других, то есть по джеку, по радиоканалу, либо по Type-C проводу обычному. Так что выбирайте сами. Нужны помягче, покрупнее, которые подольше держат зарядку. Берите вот эти чёрные.
Speaker A
Нужны такие, чтобы вписывались в белый сетап чуть-чуть полегче. Берите белые. Обе версии вы можете купить в ДНСе, потому что они там продаются дешевле всего.
Speaker A
Прежде чем перейти к цифрам, нужно объяснить одну вещь. Без неё дальше ничего не будет у нас, в принципе, понятно. Когда у нас несколько карт, модель между ними можно разделить двумя основными способами. Разница между ними колоссальная. Первый способ - это
Speaker A
конвейерный, стандартный. То есть модель режется на слои. Первая четверть на первой карте, вторая четверть на второй, третья, четвёртый и так далее. Данные идут просто по цепочке. Проблема здесь у нас очевидная. Как только вы посмотрите на загрузку видеокарты, потому что пока
Speaker A
считают у нас первая видеокарта, остальные у нас три стоят, отдыхают, потом считают вторая видеокарта и остальные три стоят, отдыхают. То есть при одном запросе 3/4 вашего железа вообще ничего не делает. Второй у нас способ - это тензорный. Здесь режется не
Speaker A
модель на слои, а каждый слой просто режется на части. То есть все четыре карты считают один и тот же слой одновременно, каждый свой кусок, и потом они обмениваются результатами. Вот ради этого обмена как раз-таки у нас и нужен
Speaker A
NVLink. Карты в тензорном режиме разговаривают с друг другом постоянно на каждом просто слое. Одна и та же модель, то же самое железо, разница только в способе деления. Например, у нас конвейерный режим- 32 токена в секунду, тензорный режим- 70 токенов в секунду,
Speaker A
больше чем вдвое. И вот теперь практический вывод, ради которого стоило смотреть эту голову. LM Studди тензорный режим. Она, в принципе, там есть такае название, но он просто крашится, когда вы его ставите. Лама CPP, вот это то же самое есть, но он просто не работает. То
Speaker A
есть, если вы собрали себе сервер на нескольких таких видеокартах и работаете через данные приложения прямо сейчас, примерно половина скорости вы на этом теряете. И даже не задумывайтесь об этом.
Speaker A
Проверим это на практике. Один и тот же файл модели, одно и то же железо, три разных способа запуска. Гема 3 на 12 млрд параметров. Кван Q4, обычный вот этот Goofy файл, тот самый, который большинство из вас качает. Начнём с
Speaker A
самого простого пути. LM Studдия. Ставится это всё в два клика. Модель выбирается мышкой, и всё у нас прекрасно работает. Этим, я думаю, пользуются большинство, и я понимаю даже, почему.
Speaker A
Дальше идёт у нас CPP. Тот же самый движок, что и внутри LM Studio, только напрямую без вот этой красивой обёртки.
Speaker A
Это уже чуть-чуть сложнее в установке. Собирается это всё ручками из исходников, слагами под нашу с вами архитектуру. Лама CPP 66 токенов в секунду. LMD 63 токена в секунду. То есть 4% вы платите просто за красивую кнопку. Честная, в принципе, цена. За
Speaker A
удобство, спорить даже не буду. А теперь третий путь. Тот же самый вот этот Goof Файл, те же самые четыре Витякарты, но уже VLM, точнее тот самый. Причём даже для vlлма это не родной формат. Его ему нужно совершенно другой. Его нужно
Speaker A
эмулировать, чтобы заставить запустить его тут. Но что не сделаешь ради красивого теста. И получаем 107 токенов в секунду против 66. Больше 60% разницы на одном и том же файле, на одном и том же железе, а от LM Studдия
Speaker A
до там VLM того самого разница практически там в два раза. Причина та самая, о которой я говорил минуту назад.
Speaker A
Тензорный режим Влаama CPP. Он формально есть, но он плохо сделанный. И для нашего с вами железа он просто-напросто не подходит. Я проверял, потому что обработка запроса проседает втроя, и в итоге вы всё равно м работаете в конвейерном режиме. А VLM тензорный
Speaker A
режим - это основной режим. То есть четыре карты действительно считают это всё одновременно. Итого LMDIA забирает у нас около 40% скорости от железа. Теперь цена вопроса. И тут я даже приукрашать не буду. И эти цифры я получил с
Speaker A
восьмой, чтобы вы понимали, попытки. Первое - это LMUDIA не даёт запустить эту модель в 16 битах. Вторая, формат весов не поднимается на 32 бита. Третье, четвёртая, ядра требуют архитектуру новее, чем наши. Пятое: Веса загрузились, упали на внимание. Шестая:
Speaker A
сменил эээнд. Внимание у нас не заработало никак. Седьмая, другой эээнд, и мы получаем 75 токенов в секунду. И восьмой у нас моментик, мы получаем 107 уже токенов в секунду. То есть между седьмой и восьмой попыткой разница просто в одном слове, в командной
Speaker A
строке. Название бэкэнда, внимание. Их у нас четыре штуки основных. И на этом железе каждый ведёт себя по-разному.
Speaker A
Один падает, один не работает. Один даёт около 75 токенов в секунду, а другой- 107 токенов в секунду. Нигде не написано, какой выбрать. Это выясняется просто-напросто перебором. И это, знаете, я ещё не считаю саму установку того самогома, форка. Официального VLМ,
Speaker A
как я сказал, уже нету для наших с вами видеокарт. Есть форк. И если вы хотите выжить всё-таки из железа, всё, форк вам нужно собирать своими правками в исходниках, ручками своими. Так что у этой главы вывод двойной, и обе половины
Speaker A
очень важны. Если вы работаете в LMUD на нескольких V100, вы теряете около 40% просто ну скорости производительности. Это факт. Вот цифры я вам показал. Но чтобы их забрать, придётся собрать свой форк из исходников, пропачить его, перебрать четыре бэкэнда, внимание, и запомнить,
Speaker A
какой ещё у вас работал. У меня на это ушло 20 часов времени. Стоят ли эти 40% скорости 20 часов вашей жизни? Решайте сами.
Speaker A
Начинаем с самого начала. Одна видеокарта, 16 ГБ видеопамяти, маленькая модель на 4 млрд параметров. Задаю вопрос, на который видно прямо нашу скорость. Напиши подробную инструкцию для новичка, как выбрать видеокарту для домашнего сервера с нейросетями.
Speaker A
Получаем 122 токена в секунду. Это быстрее, чем вы читаете. Заметно, прямо быстрее. И тут возникает закономерный вопрос: а вообще тогда зачем четыре видеокарты? одна справляется у нас прекрасно справляется. Пока модель маленькая, берём модель посерьёзнее. 27 млрд параметров, та, которая реально уже
Speaker A
что-то прямо умеет, и получаем out of memory. То есть карта забирает всё до последнего МГбайта. Ничего нет, ничего не свободно. У неё свободно 12 гигов, 16 гигов, а модель весит 21 ГБ, а на карте 16. Она туда просто не влезет. И вот
Speaker A
отсюда начинается история с несколькими видеокартами. Не потому, что это медленно, а потому, что это просто-напросто не влезает.
Speaker A
Добавляем вторую видеокарту. Тензорный режим. И это всё поднимается по касанию. Уже через 20 часов модель разложилась на две видеокарты, примерно по 10,5 Гб весов на каждую. Остальное место у нас уходит под кэш. И получаем 52 токена в секунду. То есть вдвое медленнее, чем
Speaker A
мелкая модель на одной видеокарте. Так и должно, в принципе, быть, потому что модель в семь раз просто больше. А теперь смотрите сюда. И сюда практически никто не смотрит. 26.000 токенов контекста. Сервер сам пишет. Это три с лишним обычных разговора. Либо один
Speaker A
документ страниц так на 40. Запомните эту цифру. 26.000. Четыре карты, та же самая модель, тензорный режим. И получаем 70 токенов в секунду. Было 52, стало 70. 34%.
Speaker A
Я удвоил количество железа, удвоил своё потребление и получил 34%. Вот на этом месте 3 недели назад я и решил, что эта затея вообще большая ошибка. А потом я посмотрел на другую цифру, на вторую, и там написано 440.000 440.000
Speaker A
токенов контекста. На двух видеокартах, напоминаю, было 26.000. То есть скорость выросла на треть, а контекст практически в 17 раз. И это не единичный случай. Вот та же самая картина на другой модели на 14 млрд параметров. Одна карта 63 токена
Speaker A
в секунду и 22.000 контекста. Четыре видеокарты, 116 токенов в секунду и 273.000 контекста. Скорость практически, ну, вдвое выше, да, примерно вдвое выше, а контекст больше, чем в 12 раз.
Speaker A
Механика простая, и когда её понимаешь, всё становится на свои места. модель делится на четыре части. На каждой карте лежит четверть весов, значит, освобождается не четверть памяти, а 3/4 памяти. И вот эта вся память уходит под одно, под контекст. Вторую, третью,
Speaker A
четвёртую карту вы покупаете не ради скорости. Скорость тоже растёт, но не совсем так быстро, как хотелось бы. Вы покупаете память под то, сколько текста модель способна держать в голове одновременно. Помните, я обещал вам объяснить, почему войну и мир нельзя
Speaker A
запустить на двух картах? Потому что это около 230.000 токенов. На двух картах помещается максимум 26.000. Это немедленно, не неудобно, это просто нет, сервер даже у вас не стартанёт. А если стартанёт и вы загрузите эту модель, он будет помнить
Speaker A
только вот эти 26.000 токенов и из конца книги. Ра мы сюда вернулись, расскажу, как этот тест устроен на самом деле, потому что в первый раз он у меня не получился. Я прикрепил книгу файлом в интерфейсе, задал вопрос и получил общие слова.
Speaker A
Модель отвечает, что-то там на расплыв читаем, что это книга Толстого и всё. Никакой видеокарты она там не находит.
Speaker A
Выглядело, ну, как полный, как провал вообще моей вот этой всей затеи. Час я потратил на то, чтобы понять вообще, в чём дело. А дело было вот в чём. Open Web UI. при прикреплении файла не отправляет его модели целиком. Она
Speaker A
просто режет документ на куски по 1.000 символов, строит по ним какой-то там индекс и подсовывает модели три-четыре подходящих фрагмента. То есть мой файл превратился в 1.000 кусков, из которых до модели доехало всего четыре штучки.
Speaker A
Контекст даже тут был ни при чём. Текст не доезжал просто до видеокарты. Лечится это одной галочкой в настройках. обход, встраивание и извлечения. После неё текст у нас идёт до видеокарт целиком. И проверять это надо не на глаз, а по
Speaker A
логу. После отправки книги кэш заполняется у нас на 32%, это около 230.000 токенов. Если вы работаете с каким-то длинным контекстом через веб-интерфейс, сходите и проверьте эту настройку прямо сейчас. Возможно, всё это вы время, знаете, вы платили за память, которую вы
Speaker A
даже не использовали. Теперь сам тест. Я задал три вопроса по нарастанию, знаете, такие. Первый достаточно-таки простой.
Speaker A
Найди упоминание видеокарты и процитируй. Второй: найди фразу, которого у Толстого быть не может. И третий, вы уже видели, что Пьер прочёл вслух слека сложенного в четверо. Первые два - это у нас поиск по совпадению.
Speaker A
Третий - это уже реально нужно понять сценарий. И модель справилась со всеми тремя прекрасно. Для понимания масштаба вся война и мир целиком - это 1.200.000 токенов. Мой рекорд кэша на данном стенде, на данном железе - это 1.200.000 токенов. Правда, один запрос у этой
Speaker A
модели ограничен 262.000. То есть кэш делится между запросами. Теперь то, что сломало мне картину мира.
Speaker A
Когда я снимал вот про данную видеокарту видео, я этого ещё не понимал. Сейчас я это прекрасно понимаю. Есть правило, которое кажется очевидным. Чем больше модель, тем медленнее она должна работать. То есть есть модель на 27 млрд параметров нам давала 30.000 токенов в
Speaker A
секунду. Да, значит, 35 млрд параметры должны давать меньше. Запускаю 35 млрд и получаю 115 токенов в секунду. Модель на треть крупнее и в полтора раза быстрее.
Speaker A
Разгадка тут к троится в устройстве самих вот этих моделей. Это разряженная модель. То есть она называется моя модели. Внутри неё там два десятка блоков специалистов, и каждое слово включается только 2три, остальные просто сидят, спят. То есть всего параметров,
Speaker A
да, там 35 млрд, а активных на каждом шаге около трёх. А скорость генерации упирается не в арифметику, а в то, сколько весов карта успевает прочитать из памяти. Читать надо только активную ей часть. То есть практический вывод: если гонитесь за скоростью на большой
Speaker A
модели, смотрите на разряженные модели. Они обходят плотные модели меньшего размера. И кэша данная модель как раз-таки и держит больше всех. Это 710.000 токенов на тензорном режиме. Но я вам говорил, есть 1,2 млн. Да, есть 1,2 млн, если поднять эту модель в гибридном
Speaker A
режиме. То есть две на две видеокарты. И получаем мы 1. Как раз-таки 200.000 токенов. Это абсолютный прямо рекорд стенда. Больше миллиона токенов на железе 2017 года.
Speaker A
Эту главу я считаю одной из самых важных в данном ролике. И красивых цифр в ней не будет. Запускаю новенькую модель 3,8 в четырёхбитном формате. две видеокарты.
Speaker A
Скорость практически 50 токенов в секунду. Читаю ответ. А там мусор. Больше 500 токенов одной и то же. Фразы по кругу. Хотя я спрашивал на русском языке, она мне ещё и на английском отвечает. Прошу ответить её по-русски. И она также идёт просто по кругу. Открываю
Speaker A
веб-интерфейс, спрашиваю там. То же самое, всё по кругу. Та же самая модель, тот же самый формат, но уже на четырёх видеокартах. И она выдаёт нормальный текст по-русски и по делу, представьте себе. И мы получаем 71 токенов в секунду. То есть навен 3,8, запомните,
Speaker A
мы получаем 71 токен в секунду. И знаете, по какой причине у нас всё-таки мусор получается на двух видеокартах?
Speaker A
Это причина деления между видеокартами. То есть шина слоя - это у нас 4.120. Её добивают до 4.128.
Speaker A
И эта надбавка проверена авторами для деления на четыре видеокарты, а на две не проверена, и мы получаем поэтому мусор. И важный момент, ровно тот же самый дефект я потом получал и на других стендах, на арендованном железе. То есть
Speaker A
два независимых компьютера, одна и та же поломка в одной и той же конфигурации. Теперь, надеюсь, вы понимаете, почему я говорил, что цифра скорости ничего прямо не значит, пока вы не прочитаете, что эта модель вам написала. И такие же
Speaker A
сюжеты у нас с вами будет и в картинках, и в видео. Всё, что было до этого - это одиночные запросы. Один человек, один вопрос. А теперь представьте, что сервер вы подняли не только для одного себя. Вы не такой эгоист. вы решили поделиться, то
Speaker A
есть с семьёй и там, с друзьями, либо у вас небольшая команда на нём работает.
Speaker A
Четыре человека одновременно. Один просит рассказать там про инженера, второй объяснить а механику внимания, третий- план ролика какой-нибудь составить и четвёртый, таблицу архитектур какую-нибудь, спрашивает один запрос практически мы получаем 200 токенов в секунду. Четыре запроса практически 700 токенов в сумме. То есть
Speaker A
по 175 токенов на каждого. То есть в 3 раза больше. Не вдвое и не в 2 с по раза, а практически линейно. Механика та же самая, что и раньше. На каждом шаге карта читает все веса целиком. Неважно, сколько у неё запросов. Посчитает она
Speaker A
один токен либо четыре токена, ей стоит практически одинаково. То есть эта сборка спокойно тянет, я бы сказал, даже небольшую команду. И это, пожалуй, главный практический сценарий для неё.
Speaker A
Теперь вопрос, ради которого я вообще арендовал чужое железо. Мы всё время с вами говорили про NVLink, что это прямая связь между картами и так далее. А если без него те же самые карты, то же самое количество, но общаются они уже через
Speaker A
PCI Express. И давайте посмотрим с вами. Одна карта, отставание около 10%. Две карты около 12%.
Speaker A
А теперь четыре карты, практически четверть. На одной и двух картах разница объясняются, я бы сказал, самими картами, потому что SXM2 разъём берёт у нас 300 Втся экспрессовские версии по 250 В. То есть межслойное вот это вот деление, ну, практически оно не
Speaker A
участвует. А на четырёх картах разрыв вот здесь как раз у нас уже удваивается. Вот эти 10 с лишним процентных пунктов и есть цена отсутствия линка. Измеренная она уже по факту, а не рассказанная. То же самое видно и на других режимах. На
Speaker A
моей сборке с NVLink тензорный режим быстрее конвейерного примерно там вдвое. Без NVL разрыв сжимается примерно до 50%. И это логично, потому что тензорный режим синхронизируется на каждом слое.
Speaker A
Связь между картами ему нужнее всех. Второй вопрос к арендованному железу. Что будет, если мы поставим с вами тридцатидвухгигабайтные вот эти вот модули, а не по 16 ГБ? И самое главное, естественно, это у нас кэш вырастет примерно вдвое. То есть это около
Speaker A
полутора млн токенов на разряженной модели, а в гибридном режиме под 2,5 млн токенов. То есть, если считать по-человечески, это 1,5 млн токенов - это 170 одновременных разговоров. То есть обычному пользователю нам с вами это вообще не надо. То есть маленькой
Speaker A
какой-то компании уже, да. Второе менее очевидное. На моих картах на 16 ГБ всё, что крупнее 24 млрд параметров на одну видеокарту не лезет. И там колонка у нас пустая.
Speaker A
А на картах на 32 ГБ это лазиет практически всё. Но с оговоркой, которую надо сказать честно, модель 27 млрд параметров занимает около 22 ГБ из 32 Гб. То есть на кэш у нас остаётся в районе 25.000 токенов. Это примерно три
Speaker A
разговора. влезает на одну видеокарту и работает на одной видеокарте- это совершенно разные вещи. А вот то, ради чего стоит городить огород со 128 Гбми и покупать четыре видеокарты на 32 Гб? Есть модели, которая весит больше 100 ГБ, не
Speaker A
миллиардов параметров, а гигабт на диске. Вам придётся модель такую скачать. Например, Deepsic 284 млрд параметров, 106 ГБ он весит. Квен на 177 млрд параметров, 103 ГБ- это модели того класса, которые обычно живут в дата-центров, и мы на них получаем 25
Speaker A
токенов в секунду. Почему цифра именно такая, надо объяснить. Потому что она заниженная. И я знаю даже, насколько она заниженная. Всё, что мы с вами видели до этого, я гонял на VLM. То есть там тензорный режим работает, там четыре
Speaker A
видеокарты работают одновременно, а эти модели VLM запустить нельзя, просто потому что кванта для данной системы просто-напросто не выложили. Остаётся LAAM CPP, тензорный режим. Там формально, как я говорил, уже есть, но он работает плохо. На наших видеокартах он совершенно не работает. Я проверял,
Speaker A
обработка падает втрое. Уже говорил про это. Поэтому эти [откашливается] 25 токенов в секунду снято послойно, то есть в конвейерном режиме. А что такое конвейер, мы уже с вами знаем. Пока считает первая видеокарта, три другие стоят просто и ждут. Прикинем, что было
Speaker A
бы в нормальном тензорном режиме, если бы был бы нормальный квант. И на этом железе у меня есть как раз-таки эта цифра. Отличие тензорного режима от конвейерного - это практически в два раза. То есть здесь вышло бы около 50
Speaker A
токенов в секунду. Сразу оговорюсь, это оценка, а не замер. То есть проверить мне не на чем кванта.
Speaker A
Но, в принципе, я думаю, цифра будет порядка такого. Это около 50 токенов в секунду на модели на 284 млрд параметров на железе 2017 года. А имеем 25 токенов в секунду. И не потому, что карты не тянут, а потому, что под неё просто
Speaker A
нужен свой формат файла. То есть 25 токенов в секунду - это примерно темп чтения ну обычного человека. То есть одному человеку на данной модели будет работать комфортно. Но что самое удивительное, что это вообще всё дело работает, потому что модель на 284
Speaker A
млрд параметров работает на четырёх видеокартах 2017 года. И тут сравнение прямо становится безжалостным, потому что мои четыре видеокарты по 16 Гб, 64 ГБ памяти не грузит. Это вообще самый мелкий квант весит 70 там 3 Гб, то есть больше, чем у меня оперативки есть. 2
Speaker A
RTX 3090. Вы сейчас скажете, это же вообще имбуля. 48 ГБ у нас памяти. Грузим с выгрузкой на в оперативку.
Speaker A
Знаешь, сколько получаем токенов в секунду? Два. Два токена в секунду. Это не работа, это слайд-шоу. То есть четыре видеокарты по 32 Гб около 25 токенов в секунду. Больше чем в 10 раз быстрее.
Speaker A
Это единственная задача, где 128 ГБ дают не больше, а вообще хотя бы что-то дают.
Speaker A
Теперь главный вопрос этого видео. Мы наконец-то до него добрались. Две RTX 3090, каждая стоит от 90 там до 110.000 руб. в зависимости от состояния. То есть нам нужно отдать за две, грубо говоря, 200.000 руб. Плюс купить блок питания на
Speaker A
1.000 Вт и материнку, которая нормально держит две видеокарты. Итого это всё у нас получается под 250.000 руб. Моя сборка обошлась в 180 примерно 1.000 руб. совсем. То есть плата, корпус, водянка, блок питания, опрессовщик, замена даже мёртвой карты. По деньгам
Speaker A
она выгоднее. Тут спорить даже не о чем. 48 ГБ против 64 ГБ. Вопрос только в том, что вы за эти деньги получаете. И сразу одна техническая вещь, которую нужно знать. У пары 3090 без мостика нет прямой связи между картами. То есть
Speaker A
Nvidia отключила её драйверами. Всё между всё, чем они, точнее, обмениваются, это идёт через оперативную память компьютера, а это практически 6 Гб в секунду против трица у Нвлинка. То есть держите это в голове, дальше будет видно, где это вылезет.
Speaker A
Гоняем один и тот же набор моделей на обеих сборках. Тензорный режим, одинаковый контекст, одинаковая методика, 4 млрд параметров, 3090 быстрее примерно на 13%. 8 млрд параметров, быстрее на 6%, 14 млрд параметров, а разницы вообще никакой нету. И дальше начинается самое
Speaker A
интересное. Myст модель на 24 млрд параметров 3090 остают примерно на 13%. 27 млрд параметров примерно на четверть. То есть переломы случается на 14 млрд параметров. До них игровые видеокарты впереди. После у нас она идут уже позади. С каждой ступенью всё сильнее и
Speaker A
сильнее уступаем. И знаете, причина здесь не в самих чипах, потому что ампер новее вольта и на бумаге она, естественно, круче и мощнее. Причина в том, что происходит между видеокартами.
Speaker A
Чем крупнее модель, тем больше карты вынуждены разговаривать друг с другом. У моей сборки эта связь прямая, а у пары 3090 разговор идёт через оперативную память компьютера, а это шесть с лишним раз вмедленнее. На маленьких моделях это неважно, там разговор практически ни о
Speaker A
чём не идёт, а на больших это решает всё. Второй фронт - это кэш, естественно, кэш у 3090 меньше как минимум в полтора раза. То есть прямое следствие объёма 48 ГБ против 64 ГБ. И на разряженной модели, и на модели там
Speaker A
на 27 млрд параметров У3090 кэш заметно прямо меньше. Одному человеку всё равно этого, в принципе, хватит запасом, а для команды это уже, ну, совсем не то.
Speaker A
А теперь я вам расскажу то, что мне самому не понравилось. Весь этот ролик я вам доказываю. Покупайте карты ради контекста. Больше памяти, длиннее разговор. На этом строится, в принципе, всё видео.
Speaker A
И вот на сценте с двумя 3090 я упёрся в неудобный фокт. Я прогнал 10 моделей и на каждой выкручивал контекст до упора, до того значения, на которой сервер ещё, в принципе, поднимается. У восьми из десяти моделей ограничения оказались
Speaker A
вовсе не память. Они упёрлись в сами себя и на то, на нас на сколько токенах их, в принципе, обучали. То есть разряженная на 35 млрд, а модель параметров взяла 262.000 токенов. То есть весь заявленный потолок до последнего. И после этого у неё
Speaker A
остался ещё около там 700.000 кэша. Квен 3,8 на четырёх битах. То же самое. 262.000.
Speaker A
токенов просто потолок. То есть для восьми моделей из десяти вам, в принципе, хватит даже 48 Гб памяти. И это не узкое место. Ограничение вылезает только на плотных моделях на 27 млрд параметров. Там 3090 не дотягивает. То есть одна взяла там что-то в районе
Speaker A
200.000 токенов из заявленных 262. Вторая меньше 100.000. Так что честная формулировка здесь у нас будет такая. 64 ГБ нужны не всем и не всегда. Они нужны, если вы работаете с плотными моделями от 27 млрд параметров, если пользователей несколько или если модель весит больше
Speaker A
48 ГБ. Давайте теперь подведём итоги по языковым моделям. Три разные сборки и три разных ответа. Две RTX 3090, это у нас 48 ГБ общей памяти получится.
Speaker A
Берите, если работаете один с моделями до 14 млрд параметров и хотите просто включить и пользоваться. На мелких моделях они быстрее. Восемь моделей из десяти их памяти, в принципе, хватает на полный контекст. И три неделя вам не нужно, в принципе, а тратить на починку
Speaker A
этих самых драйверов. Плюс также есть очень серьёзный аргумент. И очень серьёзный аргумент, вы продадите их за неделю. Это игровые видеокарты.
Speaker A
Покупателей у нас миллионы. Четыре видеокарты по 32 ГБ, 128 ГБ видеопамяти. Единственная сборка, которая запускает модели там на 280 млрд параметров.
Speaker A
Немедленно запускает, а вообще запускают на 3090. Такая модель выдаёт два токена в секунду. Я вам только сейчас это говорил. Здесь 25 токенов в секунду. То есть, ну, стоит она под 400.000 руб. Это совершенно другая лига. И большинству из
Speaker A
нас туда не надо. Прямо не надо вам. Эта сборка вам не нужна. 4 V100 по 16 ГБ, то есть 64 ГБ, то есть вот эта сборка.
Speaker A
Скажу прямо, за эти деньги это лучшее, что можно собрать под языковые модели. Там всё, что крупнее тех же самых 14 млрд параметров, она идёт шустрее, чем 2390.
Speaker A
Кэша минимум на полтора раза больше. Просто тензорный режим работает как надо, потому что между картами есть прямая связь. Но входной билет в эту лигу у нас не только деньги, а 3 недели, 200 часов и мёртвая видеокарта. Если вы
Speaker A
к этому готовы, берите прямо не думая. Если вы хотите включить и работать, берите RTX 3090.
Speaker A
Переходим к картинкам. Начну с вопроса, которые мне задавали чаще всего. Если у меня четыре карты будет, картинка же будет в четверо, получается, быстрее рисоваться. Нет, совсем нет, потому что одна видеокарта делает всё, а три другие вас просто будут простаивать. Причина в
Speaker A
том, как устроена вообще генерация. Картинка - это там 20 тире50 последовательных шагов. То есть восьмой шаг нельзя начать, пока не просчитан ещё седьмой. Делить, на самом деле, можно, но внутри только одного шага. Но шаг на этих видеокартах длится в районе там
Speaker A
50-100 мсекунд. А чтобы разделить его на четыре видеокарты, картам нужно обменяться данными. И если обмен съедает у вас те же самые 30 мсекунд, на пересылку выигрыш, ваш здесь съедается и сгорает. Инструмент для настоящего деления существует, но в Confie UI его
Speaker A
нет. Зато есть другой путь, и он работает отлично. Четыре независимых экземпляра по одному на каждую карту.
Speaker A
Каждый рисует свою картинку. Одна картинка быстрее не станет, но четыре вы получаете за время одной картинки.
Speaker A
Ускорение в четыре раза практически линейно. И разница между быстрее и больше здесь принципиальная. Если вы подбираете какой-то промт и ждёте один кадр, сидите, четыре видеокарты вам никак не помогут. А если нужен какой-то вам поток, они могут очень пригодиться.
Speaker A
Одно открытие из этого блока, которое сэкономит вам вечер. Один экземпляр Conf UI съедает 21 ГБ оперативной памяти. Не видеопамяти, а обычной. Он держит копию весов в оперативочке, чтобы быстро подкачать их на карту. Четырём таким процессам понадобилось 80 ГБ оперативной
Speaker A
памяти. У меня их на тестовом стенде только 32, то есть 29 свободно. То есть я упёрся бы не видеокарты, а свою просто оперативную память. Решается это одним флагом. Он переводит Confui в режим, где выгружать веса некуда, и они живут
Speaker A
просто на картах. И у нас было 21 ГБ, а стало 2 Гб. Знаете почему? Потому что остаток, который не хватило на данной видеокарте загрузить, он загрузил просто в другую видеокарту и всё. И скорость никак не изменилась. То есть 9 секунд
Speaker A
до, 9 секунд после не изменилась вообще. Флаг не ускоряет, он делает параллельность, в принципе, возможность.
Speaker A
Вы задействуете хотя бы видеопамять другой карты. Кстати, на 3090 этот флаг ещё и ускоряет. На лёгких моделях примерно там до 40%. Там шаг короче и постоянные вот эти накладные расходы, они заметнее.
Speaker A
И теперь давайте я вам покажу результат первого прогона. Quen imagй квадрат. Ни ошибки в логах, ни падения. Генерация проходит, файл сохраняется, а в нём пустота. Чёрный квадрат Малевича. Я сказал бы первое, что я нашёл в логе - это предупреждение про вая в 16 битав.
Speaker A
решил, что виноват он, перезапустил слагом, который переводит Вае в 32 бита. Не помогло. Тогда я сохранил промежуточный результат, то, что модель считает до всякого вая, и проверил его напрямую. Данные были испорчены уже там.
Speaker A
То есть вая тут вообще прямо была ни при чём. Моя первая версия оказалась неверная. Настоящая причина. В переполнении модель обучена на формате BF16, у которого широкий диапазон вольта. его аппаратно не умеет и считает FP16. То есть активации выходят за этот
Speaker A
предел и превращаются в бесконечность. Поэтому у нас получается неопределённость и картиночка у нас получается чёрная. Лечится это эмуляции BF16. И 15 секунд у нас превращаются в 49 секунд. То есть втрое медленнее. Это единственный рабочий хотя бы какой-то вариант. Вот он потолок вольта во всей
Speaker A
красе. не медленнее на проценты, а либо втрое дольше, либо у тебя просто чёрный квадрат получается.
Speaker A
Теперь сравнение с RTX390 на картинках. И оно оказалось неожиданно скучным, потому что SD 1,5 секунды, обе сборки, SDXL 6 секунды и там, и там. Флаг склеен на 4 млрд параметров 14 секунд одинаково. Креа 2 16 секунд одинаково.
Speaker A
Четыре модели из семи совпали практически до секунды. Представьте себе, до секунды. Карты 2017 года и карты 2020 года рисуют а с одинаковой прямо скоростью. А потом мы доходим до image 49 секунд против 15 секунд, то есть в три с лишним раза. Я напоминаю, у
Speaker A
нас чёрный квадрат также рисовался за те же самые 16 секунд. Если бы была поддержка того же самого вот этого BF16, у нас также они рисовались бы. Но всё это уже старое железо, оно здесь уже не может. А в базовом режиме, чтобы вы
Speaker A
понимали, с полной моделью, это у нас 450 секунд против 100, больше, чем в четверо. И это ровно та же модель, которой нужен BF16. Единственная в наборе. То есть дело не в том, что RTX 3090 быстрее. Дело в одном конкретном
Speaker A
формате данных, которого у архитектуры Вольта просто-напросто нету. Но есть и обратная сторона, про которую забывают.
Speaker A
Если мерить не одну картинку, а пропускную вообще способность сесть сборки, картина уже переворачивается, потому что SDXL у меня четыре конвейера против двух, то есть полторы секунды на картинку против 3 секунд. Флаг склен 4 млрд 3,5 секунды против семи, фактически
Speaker A
вдвое. Логика простая. Там, где модель вылезает на 16 ГБ, я поднимаю четыре конвейера, а 3090, их только два, и выигрывают, естественно, они в два раза.
Speaker A
Итого по картинкам вердикт у нас такой: работаете с Quen Image, берите 3090. Разрыв прямо реально большой, и закрывать его нечем. Гоняйте потолок SD XCL либо к берите V100, потому что четыре конвейера против двух. Во всём остальном разницы вообще никакой нету.
Speaker A
Вообще никакой нету разницы. И вот вам второй из трёх вердиктов, который я обещал. И он, как видите, прямо ни в чью пользу.
Speaker A
И теперь мы переходим к видео, к последнему нашему с вами блоку. Начну с самой странной вещи, которую я вообще видел за эти 3 недели. Запускаю LTX, пишу промт. Красный двухэтажный автобус, ночь, ливень, отражение на асфальте. Получаю рыцаря.
Speaker A
Меняю промт. Серый кот спит на подоконнике тёплый свет. И я получаю рыцаря. Мужчина в костюме тройки с сигарой в кожаном кресле. Рыцарь в доспехах.
Speaker A
модель рисовала одно и то же при любом вообще запросе. Причём рисовала качественно, в принципе, просто вообще совершенно не то, что я ей пишу. Причина оказалась изящной. Между текстом, который вы пишите, и картинкой, которая рисует модель, есть мост. Слои, которые
Speaker A
переводят одно в другое. У меня этот мост был в сжатом виде, чтобы всё влезло вообще в память. И сжатие просто-напросто его сломало. Модель перестала слышать промт и рисовала то, что у неё осталось по умолчанию. То есть важная деталь у второй модели - это Mini
Speaker A
Max H3. Encoder тоже был в сжатом виде, и всё работало замечательно. Возможно, потому что там был сжат и сам языковой блок, а не мост между текстом и картинкой. виновато не сжатие вообще, а сжатие конкретно в этом узлу. На 3090
Speaker A
эта поломка не повторилась ни разу. Там хватает памяти, чтобы держать весь мост несжатым. Теперь цифра здесь мы с вами закончим очень быстро. Генерирую 2 секунды видео разрешение 1.44x768 со звуком. Один проход 6 минут 42 секунды. За 2 секунды видео на тех же
Speaker A
самых настройках. тот же самый промт, тот же самый сит 2390 около полутора минут, то есть в 4 тире5 раз быстрее.
Speaker A
Это не единичная замер. По всей сетке разрешений этот разрыв держится от четырёх до пяти раз. И отговорок здесь у меня прямо никаких нету. Дело не в памяти, дело не в шине. Просто карта загружена реально на все 100%. Она
Speaker A
просто медленнее считает. У вольта нет ускорителя, внимания нового поколения, вот этого BF16. нет восьмибитных вычислений, нет всего, что появилось после 2017 года, и что вообще зачем сейчас стоит вот эти новая генерации видео.
Speaker A
И теперь вопрос, который напрашивается сам с собой. А если памяти у нас, видеопамяти вдвое больше, версия на 32 Гб у нас спасёт? Сначала объясню вообще, как устроена генерация видео на нескольких картах. Это не то же самое, что и с из языковыми моделями. Модель
Speaker A
здесь состоит из трёх разных частей. Первая - это у нас считывающая часть. Вторая - это у нас энкодер, то есть это ваш промт. И последний у нас декодер, который превращает результат в кадр и звук. Их можно разложить по разным,
Speaker A
принципе кадрам. Считывающая часть на первую, энкоodдер на третью, там декодер на вторую. Четвёртая видеокарта у нас просто стоит и кайфует, ничего не делает. Она вообще не загруженная. Зачем так вообще делать? Иначе всё это бы уезжало в оперативную память и
Speaker A
подкачивалось бы именно оттуда, на каждом шаге. У меня карты на 16 ГБ. Encodдеer LTX занимает почти 29 ГБ оперативки. Один раз система его просто-напросто убила, потому что закончилась оперативная память и процесс снесло. На картах по 32 ГБ это всё
Speaker A
целиком ложится в видеопамять. Риск здесь в этом снят. А теперь главный вопрос. Что это даёт по скорости, если вы поменяете видеокарты на 32 ГБ? Вообще ничего это вам не даст, потому что разрешение 640х384 около 70 токенов в секунду, что там, что
Speaker A
там, разрешение 1.44x768 около 400 секунд против примерно 425 секунд. Разница в пределах 10% и местами не в пользу даже видеокарт на 32 Гб. И это логично, потому что чип-то один и тот же. Вольта он и есть вольта. Памяти
Speaker A
больше, да, у нас, но считают-то они одинаково. Так что 32 Гб действительно дают только одно. Это разрешение. То есть на 16 ГБ потолок у нас был 1.280x704.
Speaker A
Дальше нехватка памяти. На тридцатидвухгигабайтных картах в LTX мы можем доходить вплоть до 4К. Звучит отлично. Теперь давайте посмотрим на время больше 20 минут.
Speaker A
Больше 20 минут за 2 секунды. Видео в разрешении 1.920. Это даже не 4К. А4К на LTX это ещё около 15 минут на один короткий ролик. И вот что редко говорят вслух. Само по себе высокое разрешение качество вам не добавит
Speaker A
генерации, потому что эти модели обучены на контенте определённого разрешения. То есть заставить их выдавать 4К, в принципе, можно, но детали ты ни откуда взять для данного разрешения. Вы получите просто большой файл, а не лучшую какую-то картинку. Так что вывод
Speaker A
достаточно-таки простой. 32 ГБ под видео - это деньги на ветер. Скорость та же самая, разрешение выше, но пользоваться им невозможно. Оплатите вы за эту карту там в семь раз больше. Вердикт.
Speaker A
Третий мой вердикт, самый короткий из всех трёх. Если вы делаете видео, берите 3090. Не подумую, не зависит от задач.
Speaker A
Просто 3090. На видео это прямо вот эта сборка, она не конкурент 3090. И делать вид, что это так, я не буду.
Speaker A
Теперь давайте, наконец-таки, с вами посчитаем, сколько это всё дело стоило до последнего винта. Плата с четырьмя водоблоками 70 там 2.000 руб. Корпус 6700, блок питания 18.000. Два радиатора по 45 мм 360, один лишний оказался 7.000 руб.
Speaker A
Радиатор 240- 2.000 руб. Контур целиком- это у нас 9.000 руб. Опрессовщик там 2.500 руб. Карты у первого продавца 70.000 руб. из-за которого я вернул ещё двадцаточку за мёртвую. Ещё одна карта дозаказанная 14.500 руб. Вентиляторы, которые нужно тоже купить. Это если вы
Speaker A
артики будете покупать, это ещё примерно за Артик за каждый по 500 руб. Ещё плюс вам нужно, получается, пять вентиляторов, ещё 2.500 руб. Итого вся эта сборка шикарная нам обходится в районе 182.000 руб. Плюс 3 недели на эту всю
Speaker A
тестирование и сборку. Плюс 200 часов - это примерно времени. Плюс 20 часов потраченных зря просто на настройках, чего можно было не настраивать. Плюс 250 кВт, который из розетки она сожрала.
Speaker A
Плюс мёртвая видеокарта, которая до сих пор лежит у меня вот здесь вот на полочке. Теперь будет стоять вот такая красотка.
Speaker A
Прежде чем дать итоговый ответ, три вещи, о который обычно молчат. Первое - это штука шумит. И то есть и самый громкий элемент из всей вот этой системы, знаете, что это маленький вот этот радиатор на вот этом коммуникаторе, на чипсете. Сейчас у меня он заклеен
Speaker A
скотчем. Ну то есть, если сейчас я его вот открою, ему дам типа, а воле покрутиться, это прямо вот слышно и он шумнее, чем вся вот эта система водяного охлаждения. Даже если выкручива вот я её на 100%. Он он прямо шумит. Эта штука
Speaker A
шумит. И сейчас у меня работает вся система вот на 100%, потому что у меня есть есть диммер, которым я регулирую это всё дело.
Speaker A
И его стоит, я думаю, всё просто всё-таки оттуда выкинуть, просто вандально оторвать и купить ногтовертушку. Вот это 40х40, правда, она стоит 2.500 или 3.000. И туда её поставить 100%. Это будет прямо ощутимо комфортнее. Но имейте в виду из коробки
Speaker A
это серверная деталь. И звучит она как серверная деталь. В спальню такое я бы точно, ну, не поставил. Второе - это у нас ликвидность. 2,3090 вы продадите за неделю. Это игровые видеокарты, покупатели у нас миллионы. А эта штуга нужна для десятка человек в
Speaker A
стране. То есть для таких же, как и мы, грубо говоря, энтузиастов, для тех, кто досматривает вот эти часовые ролики до конца. Продать можно, быстро нельзя. И третье, самое важное, вы покупаете себе, не видеокарты, вы покупаете себе проект.
Speaker A
3 недели у меня ушло на это тестирование. Всё. Не потому, что я тупой, а потому, что тут нет ничего готового.
Speaker A
То есть драйвера, фордвижка, патчиходников, флаги, про которые нигде ничего не написано, чёрные картинки, рыцари в доспехах вместо автобуса. Если вам это интересно, вы получите прямо истинное удовольствие. Я получил, на самом деле. Если нужно включить и работать, вы будете страдать, и, скорее
Speaker A
всего, вы это дело просто забросите. Я обещал вам дать три ответа на три вопроса, которые сам себе и задал. И я держу слово. Языковые модели. За эти деньги ничего лучше вы не купите и точка. Всё, что крупнее 14 млрд
Speaker A
параметров, работает здесь быстрее, чем на двух RTX390. До четверти просто быстрее. Кэша как минимум в полтора раза больше. И в контексте можно держать целую книгу целиком, а не 40 страниц. Картинки здесь зависит от задач. Одну картинку быстрее вы не нарисуете. Там всё решает
Speaker A
последовательные шаги. А четыре карты здесь никак не помогают. Если вам нужен потолок и у вас есть четыре видеокарты, вы можете устроить конвейер, и у вас будет четыре конвейера вместо двух. И это выигрыш в два раза. Но есть одно
Speaker A
исключение. Quen image. Ей нужен формат, которого у Вольта просто-напросто нету. Она выигрывает в 3 тирече раза. Если работаете с ней, вопрос закрыт. Берите 3090 видео и однозначно сразу нет. Не подумаю, не зависит от бюджета, просто нет. В 4 тире пять раз медленнее.
Speaker A
Потолок по разрешению ниже, а версия на 32 ГБ, она вообще никак не спасает. Она просто не влияет никак на скорость. Они также считают. Делайте видео, берите 3090. 3 недели сборки не повод делать вид, что это не так. Эта сборка для
Speaker A
видео полная Знаете, я больше не вернусь к данной видеокарте, к Tтеesla V1. Вот её можно вот так вотк и выключить. Не потому, что она плохая, а потому, что я для себя закрыл тему. У меня есть все прямо цифры, которые возможны. одна
Speaker A
видеокарта, две видеокарты, четыре видеокарты, 16 ГБ, 32 ГБ, NVLН без три режима деления, 13 языковых моделей, восемь моделей для генерации картинок, две для видео, три стенда разных. Ничего нового про это железо я уже для себя не узнаю. Оно мне ничего не может нового
Speaker A
сказать. Всё, что оно могло мне сказать, оно уже сказало. Поэтому эту сборку я продаю, она мне не нужна. Если мне она понадобится, я соберу точно такую же за неделю. Теперь я всё знаю, все нюансы знаю, как это сделать. А деньги нужны
Speaker A
для следующего ролика по серму железу. Так что, если вы хотите получить собранную проверенную работающую систему со всеми моими ошибками, которые здесь уже были исправлены, с правильными там радиаторами, с с правильными болтами, пожалуйста, можете купить. Блок питания.
Speaker A
Я правда вам сюда поставлю на 2 кВт, чтобы был хотя бы запас по мощности, а не 50 Вт до предела. Если отправка у нас будет в другой город, жидкость, естественно, я всю солью. Вы сами это всё себе туда заправите, потому что
Speaker A
возить там залитый контур через полстраны нельзя. Цена, себестоимость. Пишите, если вам это надо. Не надо, не пишите, я прямо не обижусь. Представьте, если объединить такие две видеокарточки, либо четыре штуки, это просто будет запредельно просто неадекватный объём видеопамяти, ещё и
Speaker A
вычислительной мощности. Но это уже совершенно другая история. Тот парень из видео был не прав. Никакого другого уровня мощности тут нету. Есть максимум там в два раза мощнее, чем одна видеокарта.
Speaker A
Но история действительно другая. И тут он угадал. Просто она оказалась не про мощность, а про то, сколько всего можно удержать в голове одновременно. Кстати, первый том "Войны и мира" эта машина прочитала за 2 минуты со всеми подробностями, со всеми именами
Speaker A
и одним подложенным абзацем про видеокарту. Я его читаю уже третью неделю. И, честно говоря, я ещё не дочитал. M.
Topics:Tesla V100NVLinkсборка ПКвидеокартытест производительностиязыковые моделивидеопамятьсерверное железоRTX 3090глубокое обучение




![Какой была Русь до Рюрика? / [История по Чёрному] — Transcript](https://i.ytimg.com/vi/3EG4Dkk31mg/maxresdefault.jpg)






