Skip to content

YouTube Video — Transcript

Обзор выбора между API и self-host для агентских систем с учётом регуляций, стоимости и надёжности.

Ask about this video. Answers come from its transcript only — with the timestamp, so you can check them.

Generated from the transcript and can be wrong — check the timestamp.

Key Takeaways

  • Выбор между API и self-host должен базироваться на конкретных требованиях продукта и регуляциях.
  • Использование гибридных решений часто оптимально для баланса надёжности и стоимости.
  • Экономия на токенах может быть нивелирована затратами на инфраструктуру и поддержку.
  • Региональные требования к данным могут ограничить использование облачных API.
  • Надёжность системы требует продуманного fallback и роутинга.

What the video covers

  • Современный ландшафт агентских систем разделён на закрытые провайдеры и open source модели.
  • В продакшн обычно используются связки моделей для разных задач: генерация, роутинг, эмбеддинги, безопасность и работа с изображениями.
  • Цены на токены падают, но расходы растут из-за увеличенного потребления агентами.
  • Выбор между API и self-host зависит от регуляций, масштабов, бюджета и инженерных ресурсов.
  • Регуляция данных и требования к хранению могут заставить использовать локальные решения или провайдеров с развёртыванием в нужном регионе.
  • Масштаб нагрузки и экономическая эффективность влияют на решение о self-host или API.
  • Fallback и роутинг важны для надёжности и оптимизации затрат, что может привести к гибридным решениям.
  • Рассмотрена мысленная модель принятия решения с учётом всех факторов без идеологических лозунгов.
  • Open source модели не всегда бесплатны, учитывая стоимость GPU и поддержку.
  • Видео является частью серии о разработке агентских систем с последующими темами по безопасности и деплою.

Answers

Questions about this video

Когда стоит выбирать self-host вместо использования API?

Self-host стоит рассматривать, если есть строгие требования к регуляции данных, высокая нагрузка, и в команде есть инженеры, способные поддерживать инфраструктуру. Также self-host оправдан при необходимости fallback и роутинга для надёжности и экономии.

Почему не всегда выгодно использовать open source модели бесплатно?

Хотя open source модели не требуют оплаты за токены, затраты на GPU, поддержку и devops могут быть значительными и меняться с течением времени, что снижает экономическую выгоду.

Что такое fallback и зачем он нужен в агентских системах?

Fallback — это резервное решение на случай отказа основного провайдера. Он обеспечивает непрерывность работы системы, может быть реализован через другой API или локальную модель, что повышает надёжность.

Full Transcript — Download SRT & Markdown

00:00
Speaker A
Когда я начинал делать агентские системы, всё казалось простым. Берёшь модель, оборачиваешь пайплайн, погнали.
00:18
Speaker A
Сейчас два разных ландшафта, и в обоих них надо ориентироваться.
00:39
Speaker A
С одной стороны, закрытые фронтирпровайдеры: Anthropic, OpenAI, Google.
00:55
Speaker A
У каждого по пять-шесть тиров: Opus, Sonet, HKU, GPT Pro, Thinking Mini, Nano, Flash, Flashl и так далее.
01:13
Speaker A
Релизы происходят каждые недели.
01:26
Speaker A
Только за первый квартал двадцать шестого года крупные провайдеры выкатили больше 250 релизов.
01:40
Speaker A
С другой стороны, у нас есть open source мир и на Hugging Face 2 с лишним миллиона моделей.
01:54
Speaker A
Это, конечно, с файнтюнами, эмбедингами и дублями реально базовых foundation от серьёзных команд десятки.
02:10
Speaker A
Это Metaslama, Alibabas Cen, Mrль, Dipsic, Microsoft Fe и Google, плюс активные китайские лабы.
02:17
Speaker A
Bunshot, Zifo, Minimк.
02:26
Speaker A
И каждые несколько недель кто-то выкатывает что-то новое.
02:47
Speaker A
Это уже не один выбор.
03:01
Speaker A
У тебя в продакшн агенте обычно работает не одна модель, а связка.
03:15
Speaker A
Праймеры для основной генерации, маленькая для роутинга, эмбединги для RAG, реранкеры и ещё модели для security.
03:23
Speaker A
Если на вход попадаются картинки, то ты ещё добавишь Vision или модели, которые работают и с картинками, и с текстом.
03:37
Speaker A
А как же fallback?
03:44
Speaker A
На случай, если основной провайдер у нас лёг.
03:57
Speaker A
И каждое из этих решений — это отдельная задача.
04:06
Speaker A
Не по бенчмаркам, а потому, как модель ведёт себя на твоих данных.
04:13
Speaker A
И поверх экономика.
04:32
Speaker A
Цены за токен вроде кажется, как будто бы валятся в 10 раз за год, но счета у команд растут, потому что агенты потребляют в десятки раз больше токенов, чем обычный чат.
04:42
Speaker A
И получается, что это не выбрать ту самую модель, это построить систему выбора, которая выдержит то, что новые модели выходят каждую неделю, а твой биллинг провайдера обгоняет зарплаты у инженера, который этого агента написал.
04:55
Speaker A
У меня на канале есть серия про разработку агента.
05:07
Speaker A
Сейчас на канале уже две части.
05:21
Speaker A
Первая про построение пайплайна.
05:38
Speaker A
Вторая про память и бюджет контекст.
05:57
Speaker A
Третья будет про продакшн, безопасность, отказоустойчивость, observability и деплоймент.
06:04
Speaker A
Она у нас уже на подходе, а сейчас промежуточная часть между второй и третьей, потому что тема выбора моделей оказалась слишком большой, чтобы добавить её в блок третьей части.
06:14
Speaker A
Поэтому обсудим отдельно про API, а может быть своё или гибрид, как нам считать, как тестировать и почему правильный ответ почти никогда не будет одна модель на всё.
06:27
Speaker A
Поехали.
06:42
Speaker A
И первый вопрос.
06:53
Speaker A
Скажите честно, а вам вообще надо разворачивать своё?
07:11
Speaker A
Потому что есть такая штука: "Мы серьёзная команда, у нас на продевст звучит очень солидно".
07:26
Speaker A
А за этой солидностью часто стоит инженер, который несколько недель настраивал VLM вместо того, чтобы делать продукт, и получил то же самое, что можно было бы взять через API за 20 минут.
07:40
Speaker A
Реальная развилка.
07:55
Speaker A
И у нас есть с вами несколько вопросов.
08:09
Speaker A
Давайте посмотрим.
08:24
Speaker A
И начнём мы с вопроса, есть ли у вас в продукте чувствительные данные: персональные, банковские, медицинские, может быть, государственные, потому что почти в любой юрисдикции есть требования к тому, где эти данные хранятся и как они обрабатываются.
08:37
Speaker A
И какие именно требования, это зависит от вашего региона.
08:51
Speaker A
Но принцип везде похожий.
09:06
Speaker A
Данные не должны бесконтрольно покидать периметр.
09:21
Speaker A
Но есть небольшой нюанс.
09:38
Speaker A
Прежде чем решать, что мы поднимаем своё, давайте посмотрим.
09:54
Speaker A
Может быть, у провайдера, с которым вы работаете, можно развернуть модель в нужном вам регионе и подписать договор о защите данных.
10:10
Speaker A
Часто этого достаточно, и тогда совхост не нужен.
10:26
Speaker A
И получается, мы можем закрыть этот вопрос на уровне провайдера в нужном регионе.
10:42
Speaker A
Следующий вопрос, на который нам надо ответить, — масштаб.
10:59
Speaker A
Универсальной точки окупаемости нет, зависит слишком от многих переменных: какая модель, какая длина запроса, паттерны нагрузки, есть ли в команде инженер, который умеет совхостить железо.
11:11
Speaker A
И это всё надо рассмотреть.
11:28
Speaker A
Правильный подход — это посчитать свой кейс, прикинуть месячный счёт по API на текущей нагрузке, прикинуть стоимость GPU плюс devops время на self-host.
11:42
Speaker A
Посмотреть, как обе цифры меняются, если нагрузка вырастет в три раза.
11:57
Speaker A
Если разница на текущем масштабе мизерная, то берите.
12:13
Speaker A
Если счёт уже бьёт по бюджету и продолжает расти, есть смысл считать всерьёз.
12:31
Speaker A
Итак, если у нас будет дорого, мы посчитали и на основе расчёта понимаем, что своё железо становится ещё дороже, то мы с вами берём API.
12:48
Speaker A
Если же мы посчитали и понимаем, что с учётом роста нагрузки, с учётом того, что у нас есть нужные инженеры, мы можем позволить себе self-host, то мы берём self-host.
12:58
Speaker A
И третий вопрос.
13:13
Speaker A
Нужен ли нам с вами fallback или роутинг?
13:24
Speaker A
Это два разных вопроса, но оба часто приводят к одному ответу: нужно своё.
13:40
Speaker A
Fallback — это резерв на случай, когда основной провайдер лёг.
13:57
Speaker A
Не обязательно это будет локальная модель.
14:11
Speaker A
Может быть, это будет API у другого вендера.
14:23
Speaker A
Но если по требованиям к надёжности нам нужен второй уровень резерва вне облачного API, то это будет аргумент за своё.
14:30
Speaker A
И роутинг — это у нас про экономику.
14:44
Speaker A
Если у нас с вами разнообразный трафик и большая часть запросов простые, и вы хотите гонять их на дешёвой локальной модели, чтобы не платить фронтиры за каждый привет, это тоже аргумент за своё.
14:55
Speaker A
Давайте финально пройдёмся и проставим недостающие стрелочки.
15:07
Speaker A
Первое.
15:16
Speaker A
Регуляция данных нужна нам?
15:32
Speaker A
Да, нет, смотрим на регион, смотрим на провайдеров.
15:46
Speaker A
Можем там развернуть?
16:00
Speaker A
Если можем, то мы используем API.
16:13
Speaker A
Если же этот API нам уже бьёт по карману, мы переходим к выбору, дорого это или нет.
16:30
Speaker A
Если это дорого, то мы начинаем считать, и после расчёта мы можем понять, стоит нам использовать API либо всё-таки self-host.
16:37
Speaker A
Нужен ли нам fallback, нужен ли нам роутинг?
16:43
Speaker A
И на основе этого мы можем понять, нужен нам гибрид или нужен API.
16:57
Speaker A
Также в гибрид мы можем с вами попасть и с этих вопросов, если мы на них будем отвечать дальше, исходя из этого дерева.
17:11
Speaker A
Если же у нас с точки зрения нашей регуляции здесь у нас никак, в регионе нету никаких провайдеров, ещё ничего, то это точно у нас будет self-host.
17:29
Speaker A
Вот такая получилась интересная мысленная модель о том, как нам выбирать API или всё-таки мы хотим менеджить модели сами.
17:45
Speaker A
Вы можете придумать и добавить свои вопросы для того, чтобы понять по вашим требованиям, что подходит, что не подходит.
17:59
Speaker A
И здесь самое главное — без каких-то лозунгов, типа API — это рабство или open source — это для серьёзных, давайте не будем использовать API, потому что лозунги — это не инженерия.
18:07
Speaker A
Если вы сможете таким образом разложить свои требования, то, скорее всего, поймёте, что вам надо использовать.
18:20
Speaker A
Вы можете использовать API, либо вы вообще его не можете использовать.
18:36
Speaker A
А может быть, вам надо прийти к гибриду.
18:52
Speaker A
Если мы с вами прийдём к модели, которую мы хотим сами менеджить, то дальше нам надо будет понять, сколько же это будет стоить на самом деле.
19:06
Speaker A
Open source-модели иногда называют бесплатными.
19:21
Speaker A
Не платишь провайдерам за токены, кайф, экономия.
19:35
Speaker A
Так давайте же разберём, насколько эта экономия настоящая.
19:50
Speaker A
Тарифы провайдеров и цены на GPU меняются каждые несколько месяцев.
Topics:агентские системыAPIself-hostopen source моделирегуляция данныхмашинное обучениеэкономика моделейfallbackроутингHugging Face

Get More with the SozAI App

Transcribe recordings, audio files, and YouTube videos — with AI summaries, speaker detection, and unlimited transcriptions.

Or transcribe another YouTube video here →