Автор рассказывает, как добиться высокой скорости генерации токенов из локальной модели Qwen3.6 без потери качества и удобства работы.
Key Takeaways
- Локальные LLM могут конкурировать с платными при правильной настройке.
- Скорость генерации токенов важнее скорости обработки промпта для пользовательского опыта.
- Lama CPP предпочтительнее для запуска Qwen 3.6 с MTP для лучшей производительности.
- Баланс между скоростью, качеством и стабильностью критичен для практического использования.
- Контекст и квантизация существенно влияют на производительность и качество модели.
Summary
- Локальные LLM значительно приблизились к платным аналогам, таким как Клод.
- Важно правильно настраивать модель для баланса скорости, качества и стабильности.
- Автор использует модель Qwen 3.6 и показывает, как добиться 73 токенов в секунду.
- Скорость генерации токенов зависит от квантизации, размера контекста и параметров запуска.
- Рекомендуется запускать модель в Lama CPP или VLM, с предпочтением Lama CPP.
- Скорость обработки промпта (PP) и скорость генерации токенов (TG) — разные метрики.
- Генерация токенов — последовательный процесс, зависящий от пропускной способности VRAM.
- Для Mac есть специальные форматы моделей (MLX, NVFP4), но с ними могут быть проблемы.
- Качество модели зависит от плотности параметров и квантизации, агрессивные настройки могут снижать стабильность.
- Автор делится конкретными параметрами запуска и советами по оптимизации для кодинга.
Chapters
- 00:00Введение и сравнение локальных LLM с платными
- 01:42Важность настройки модели для скорости и качества
- 03:12Критика простого сравнения токенов в секунду
- 04:46Качество, стабильность и удобство работы с моделью
- 06:30Метрики скорости: обработка промпта и генерация токенов
- 08:19Влияние квантизации и размера модели на производительность
- 10:08Использование нескольких видеокарт и управление контекстом
- 11:54Рекомендации по параметрам для кодинга и MTP
- 14:36Автоматизация распределения слоев и оптимизация генерации











