Курс по предиктивной аналитике: основы машинного обучения, кластеризация, прогнозирование и применение в бизнесе.
Key Takeaways
- Предиктивная аналитика помогает прогнозировать будущие события на основе исторических данных.
- Обучение с учителем требует размеченных данных, обучение без учителя — выявления структуры данных без меток.
- Кластеризация эффективна для сегментации клиентов и выявления скрытых групп в данных.
- Метрики точности и полноты важны для оценки качества классификационных моделей.
- Современные алгоритмы, такие как бустинг и Prophet, значительно улучшают качество прогнозов.
What the video covers
- Введение в предиктивную аналитику и её задачи — прогнозирование значений и событий на основе исторических данных.
- Объяснение различий между обучением с учителем и без учителя, их применение в аналитике.
- Примеры использования кластеризации для сегментации клиентов и анализа текстов.
- Рассмотрение задач кредитного скоринга и оценки рисков на основе машинного обучения.
- Обзор популярных алгоритмов, таких как метод k-средних и бустинг, их особенности и применение.
- Метрики оценки качества моделей, включая точность, полноту и F-мера.
- Применение моделей для автоматической детекции аномалий и прогнозирования временных рядов.
- Использование библиотеки Prophet для анализа трендов и сезонности в данных.
- Обработка текстовых данных и проблемы с разными формами слов в анализе.
- Практические советы по выбору количества кластеров и интерпретации результатов.
Chapters
- 00:00Введение в предиктивную аналитику и базовые методы
- 03:36Группировка и кластеризация данных
- 12:56Кредитный скоринг и применение моделей машинного обучения
- 18:19Алгоритмы кластеризации и их особенности
- 23:34Метрики оценки качества моделей
- 34:43Обсуждение вероятностных моделей и интерпретация результатов
- 40:42Бустинг и улучшение моделей
- 61:45Прогнозирование временных рядов с помощью Prophet
- 67:01Обработка текстовых данных и проблемы с формами слов
Full Transcript — Download SRT & Markdown
Speaker A
Всем привет и добро пожаловать на курс по предиктивной аналитике. А меня зовут Саша, и сегодня я вам расскажу, что же это такое, а как предсказывать значение каких-то величин в будущем, вероятность наступления каких-то событий и познакомимся с базовыми методами.
Speaker A
классического машинного обучения А вообще с ки аналитикой мы сталкиваемся когда решение своих аналитических задач мы хотим что-то спрогнозировать или что-то предсказать какой будет погода завтра каким будет курс валют оценить сколько заказов получит наш интернет-магазин там через там в ближайшую неделю месяц или
Speaker A
Классического машинного обучения. А вообще с ки аналитикой мы сталкиваемся, когда решение своих аналитических задач мы хотим что-то спрогнозировать или что-то предсказать: какой будет погода завтра, каким будет курс валют, оценить, сколько заказов получит наш интернет-магазин там через там в ближайшую неделю, месяц или.
Speaker A
складываем с другим на что-то делим и сами определяем эту зависимость это просто реализация какого-то алгоритма и какое-то программирование А если мы берём исторический набор данных какой была погода у нас за прошедшие десятилетия по всему миру в разных городах и используем какие-то алгоритмы
Speaker A
Год. И как правило эти задачи решаются методами машинного обучения. Если мы наме для того же прогноза погоды сами исследуем какие-то и задаём какие коэффициенты, например, мы там смотрим, какой была погода вчера, какой она была там неделю назад, там одно.
Speaker A
можно поделить на два типа это обучение без учителя и обучение с учителем а отличаются они тем есть ли у нас какой-то ответ на наш вопрос или Мы просто хотим получить какое-то Знание сводя из структуры данных а в обучени без учителя
Speaker A
Складываем с другим, на что-то делим и сами определяем эту зависимость. Это просто реализация какого-то алгоритма и какое-то программирование. А если мы берём исторический набор данных, какой была погода у нас за прошедшие десятилетия по всему миру в разных городах и используем какие-то алгоритмы.
Speaker A
групп а учесть сразу множество факторов если мы разбиваем покупателей на основе того А какие товары Они покупают как-то по их интересам группируя можем сгруппировать тексты по теме например там отзывы на товар в которых жалуются на какую-то конкретную тему а понять А на какие основные темы
Speaker A
Которые будут сами выявлять зависимость, то есть мы да там подбираем какой-то класс уравнений моделей, но сам подбор весов, сам подбор коэффициентов мы уже а формулируем как задачу для обучения самостоятельного, то это уже является машинное обучение. А машинное обучение.
Speaker A
каких-то процессов продуктов количестве покупок Чего угодно и не хотим следить за ними там сами ежедневно а хотим по какую-то автоматическую детекции когда что-то идёт не так либо всё внезапно стало хорошо либо всё внезапно стало плохо Мы хотим автоматически понимать но
Speaker A
Можно поделить на два типа: это обучение без учителя и обучение с учителем. А отличаются они тем, есть ли у нас какой-то ответ на наш вопрос или мы просто хотим получить какое-то знание, сводя из структуры данных. А в обучении без учителя.
Speaker A
есть исторические данные А какой была температура и мы можем а для каждого дня в истории получить набор признаков какой в тот день была температура было давление Были ли осадки какие были вот эти метео данные в соседних регионах и мы знаем какой
Speaker A
У нас нет какой-то явной разметки, нет сигнала из примеры. Это выявление групп людей по сходных там по каким-то признакам. Например, демографическим, если мы там сегментируем базу покупателя какого-то нашего магазина и хотим там не просто их там сгруппировать там по доходу на несколько.
Speaker A
быть какая-то накопленная информация мы уже там много лет выдам кредиты мы знаем кам был человек каким-то данным по кредитной истории вот по всем таким параметрам на тот момент когда он этот кредит врал и мы знаем кто из них кредит
Speaker A
Групп, а учесть сразу множество факторов. Если мы разбиваем покупателей на основе того, а какие товары они покупают, как-то по их интересам, группируя можем сгруппировать тексты по теме, например, там отзывы на товар, в которых жалуются на какую-то конкретную тему, а понять, а на какие основные темы.
Speaker A
делать также может быть прогноз зарплаты футболиста на основе там его истории прогноз котировок акций курсов валют определение тем текста мы можем разметить какой-то набор текста в отличие от случая когда мы пытались сгрупировать текста там по одной теме мы можем вначале взять какой-то
Speaker A
Там в наших товарах жалуются, а за какие нас хвалят. А это всё задачи кластеризации. Или же мы хотим сократить размерность данных с минимальной потерей информации или детектировать какие-то аномалии, то есть мы можем собирать какие-то метрики и данные там о работе.
Speaker A
сам воспроизводит а или сделать это не с текстом А с изображениями например автоматически определять код или пёс на фотографии мы берём какойто набор картинок размечаем где был код где был пёс обращаем на этом деле алгоритм который выявляет какие-то зависимости в
Speaker A
Каких-то процессов, продуктов, количестве покупок, чего угодно, и не хотим следить за ними там сами ежедневно, а хотим по какую-то автоматическую детекции, когда что-то идёт не так, либо всё внезапно стало хорошо, либо всё внезапно стало плохо. Мы хотим автоматически понимать, но.
Speaker A
Давайте начнём с кластеризации кластеризация - это как раз пример обучения без учителя когда у нас нет какого-то левого знания имы имеем Като множество обетов выявить в них какую-то структуру разбить их на подмножество так чтобы внутри каждого такого подмножества объекты были похожи
Speaker A
При этом у нас а может не быть какой-то чёткой там разметки в прошлом каких-то аномальных ситуаций, а хотим делать это автоматически. И наоборот задача обучения с учителем, когда у нас такая разметка есть, а пример да то же самое предсказание температуры у нас.
Speaker A
кластера и для каждого кластера мы сможем ть какой-то центр как вот самого характерного представителя идеального ответа на то что такое хорошая кластеризация его нет и каждый раз надо подбирать исходя из задачи А вот на этой табличке прекрасно видно ЧМ отличаются алгоритмы риза что
Speaker A
Есть исторические данные, а какой была температура, и мы можем а для каждого дня в истории получить набор признаков, какой в тот день была температура, было давление, были ли осадки, какие были вот эти метео данные в соседних регионах, и мы знаем какой.
Speaker A
разные где-то нам важно сохранить Вот Каю близость точек в плане рассто втори СВ с этой задачей то есть вот есть зелёный кластер где точки близки оранжевые где они тоже близки но при этом все точки зелёного оранжева друга Далековато но при
Speaker A
Температура была завтра, это вот наше истинное значение, и мы хотим его предсказывать. Сюда же можно отнести задачу кредитного скоринга, когда мы хотим понять, если мы сегодня выдадим человеку кредит, он его нам вернёт там через год или не вернёт. Здесь у нас тоже может.
Speaker A
результаты друг от друга сильно отличаются А как правило в практике данные больше похожи Вот на третью строчку Когда у нас есть вот такие такие хаотичные множества с какими-то вот выделяющимися группами и что мы видим здесь какие-то алгоритмы вот ещ выявляют
Speaker A
Быть какая-то накопленная информация, мы уже там много лет выдали кредиты, мы знаем, кем был человек, каким-то данным по кредитной истории, вот по всем таким параметрам на тот момент, когда он этот кредит брал, и мы знаем, кто из них кредит.
Speaker A
мы видим то что у нас как правило такие три множества выделяются вот зелёно оранжево синяя они друг к другу близки мы видим такой скучен и точек здесь а но при этом они друг от друга отделились самый лёгкий пример пастеризации Это
Speaker A
Вернул, кто из них не вернул, и на основании этих данных мы уже можем построить какие-то модели, какие-то алгоритмы машинного обучения, которые позволят нам вот принять решение, сейчас стоит ли выдавать конкретному человеку кредит или это будет для нас слишком рискованно и не стоит этого.
Speaker A
нам предварительно Необходимо выбрать количество кластеров на которые мы будем разбивать он сам автоматически Это не сделает и Давайте посмотрим вот на примере как он работает изначально мы имеем такое множество которое состоит вот из таких из двух облаков и очевидно Да что мы
Speaker A
Делать. Также может быть прогноз зарплаты футболиста на основе там его истории, прогноз котировок акций, курсов валют, определение тем текста. Мы можем разметить какой-то набор текста, в отличие от случая, когда мы пытались сгруппировать текста там по одной теме, мы можем вначале взять какой-то.
Speaker A
множества мы смотрим Какой из центров ближе и вот здесь получается что для всех синих точек У нас вот первая точка ближайшая для вторых вторая это кластеризация которую получили мы на первом этапе затем мы пересчитывает кластера Как как центр тяжести вот наших
Speaker A
Набор текстов, разметить, например, там как положительные или отрицательные, если мы говорим про отзывы, или как-то про их, если это там тема обращения в техподдержку, и вот мы делали такую ручную работу, а потом уже в будущем у нас есть алгоритм, который эту разметку.
Speaker A
пересчитывал их в центр и так делаем пока Либо мы не выполним какое-то количество операций например мы заложили тыя таких шагов 000 прошли и считаем что алгоритм всё сошёлся Либо мы смотрим когда на каждой итерации точки уже изменяются не сильно и на этом
Speaker A
Сам воспроизводит, а или сделать это не с текстом, а с изображениями, например, автоматически определять код или пёс на фотографии. Мы берём какой-то набор картинок, размечаем, где был код, где был пёс, обращаем на этом деле алгоритм, который выявляет какие-то зависимости в.
Speaker A
ме попробуем запустить кластеризация картина то есть мы видим что нас есть один сорт который очень хорошо отделяется ивах которые вот ВМТ нет какой-то чёткой границы но мы можем их вот поделить где-то пополам и у нас они друг от друга тоже
Speaker A
Изображениях, и дальше уже он может определять автоматически, где код, где пёс с каким-то качеством. И сегодня мы поговорим о некоторых из этих примеров, как их какими алгоритмами можно решать, как оценить качество, насколько хорошо решает алгоритм эту задачу, и.
Speaker A
а идеального ответа на этот вопрос у нас не существует иногда исходя просто из практического применения У нас есть единственный вариант числа кластеров который нам необходим Например у нас есть какая-то база покупателей нашего там какого-нибудь магазина их там тысячи
Speaker A
Давайте начнём с кластеризации. Кластеризация - это как раз пример обучения без учителя, когда у нас нет какого-то левого знания, мы имеем как-то множество объектов выявить в них какую-то структуру, разбить их на подмножество так, чтобы внутри каждого такого подмножества объекты были похожи.
Speaker A
чтобы они обслуживали вот какое-то наиболее подходящее для себя или хотя бы просто одинаковое под множество клиентов и вот сколько у нас менеджеров по продажам Здесь илько кластеров нам и надо да у нас исходя из практического применения из практической ценности есть вот свои
Speaker A
Друг на друга, но при этом если мы берём из разных кластеров объекты, они существенно отличались. Например, то, как мы уже обсуждали, выделить каких-то людей, покупателей однородных по демографическим признакам или там сгруппировать тексты по теме. Результатом кластеризации будет являться для каждого объекта номер.
Speaker A
ближайшего ластра пори что это такое у нас есть два таких пограничных состояния в кластеризации Первое - это когда мы говорим что у нас всё один кластер и каждый объект принадлежит просто какому-то одному и другое состояние когда у нас каждый объект является
Speaker A
Кластера, и для каждого кластера мы сможем иметь какой-то центр, как вот самого характерного представителя. Идеального ответа на то, что такое хорошая кластеризация, его нет, и каждый раз надо подбирать исходя из задачи. А вот на этой табличке прекрасно видно, чем отличаются алгоритмы, и что.
Speaker A
уходит в ноль а начальное состояние оно у нас максимально Когда у нас от каждой точки приходится далеко идти куда-то вот до основного центра и что мы делаем мы идём постепенно исходим из ситуации когда у и вот метри ици выя
Speaker A
Ответы могут быть совершенно разными. У нас по вертикали разные алгоритмы, а по горизонтали разные наборы данных. И вот давайте пойдём по строчкам. Мы вот видим множество точек, как вот две вложенные окружности, и у нас могут быть задачи совершенно.
Speaker A
перестаёт уменьшаться как-то уже значимо Мы останавливаемся и почему метод называется методом локти если мы представим вот этот график как руку где вот у нас где-то он уходит в кисть нается вот единички из плеча то где мы примерно видим локоть там есть оптимальное
Speaker A
Разные, где-то нам важно сохранить вот какую близость точек в плане расстояния. С этой задачей, то есть вот есть зелёный кластер, где точки близки, оранжевые, где они тоже близки, но при этом все точки зелёного и оранжевого далеко друг.
Speaker A
мы переходим от одного кластера когда вот всё бы это было одним кластером к двум то у нас Вот эта группа хорошо отделяется и вот э но вот это облако точек оно довольно вытянутое и когда мы переходим к трём у нас ещё всё
Speaker A
От друга, но при этом например вот эти вот точки розовые, вот эти точки зелёного, они друг другу близки, но находятся в разных кластерах. В каких-то других случаях нам может быть важно вот эту замкнутую структуру сохранить и наоборот отделить одно кольцо от другого. Видим вот.
Speaker A
говорили про геометрические размеры всё было довольно просто мы их располагали вот в таком получается четырёхмерном пространстве У нас есть там листики и чашелистики и на каждую там длина ширина они там сопоставимы по размерности и мы просто вот в
Speaker A
Результаты друг от друга сильно отличаются. А как правило в практике данные больше похожи вот на третью строчку, когда у нас есть вот такие хаотичные множества с какими-то вот выделяющимися группами. И что мы видим здесь? Какие-то алгоритмы вот ещё выявляют.
Speaker A
уровню образования и например зарплату ние средня опять доктор и если мы просто по этим данным возьмём построим Лидо расстояния то если мы возьмём два объекта например там оба с зарплатой в Тысячу там долларов месяц рублей в час неважно
Speaker A
Чёрные точки. Чёрные точки - это шумы, и это те, которые не похожи ни на что другое, то есть они находятся далеко от всего остального, мы им не назначаем никакой кластер, мы их просто исключаем из нашего анализа. Но в остальном да, вот.
Speaker A
получается что отличие в 1% по зарплате на итоговый результат оказывает больше влияние чем максимальное отличие в образовании кажется это не то чего мы хочем добиться и здесь налу в ито рии ин просто разби какие-то группы по зарплате потому что образование вообще
Speaker A
Мы видим, что у нас как правило такие три множества выделяются: вот зелёно, оранжево, синяя, они друг к другу близки, мы видим такой скупченность точек здесь, а но при этом они друг от друга отделились. Самый лёгкий пример кластеризации это.
Speaker A
уже стандартизованные значение ноль и стандартное отклонение один и в данном случае да там у нас будет какой-то Там средний уровень образования нормированный разброс и уже зарплата и образование будет вносить равный вклад в сделать так чтобы образование например имело больший вклад в результат чем
Speaker A
Предпоследний тут, мы прямо наглядно видим границы, провести легко и очевидно, все алгоритмы справились, всё поделили. Но на практике скорее всего мы столкнёмся будут не чёткими. А одним из самых популярных и эффективных алгоритмов является com метод ко средних. А из его особенностей.
Speaker A
влиять на результат чем было до этого Да это подготовить данные а посмотреть что с ними Да там всё хорошо мы получили всё что надо у нас там нет пропусков определиться с расстоянием проверить что всё стандартизованность и вносить какой-то
Speaker A
Нам предварительно необходимо выбрать количество кластеров, на которые мы будем разбивать, он сам автоматически это не сделает. И давайте посмотрим вот на примере, как он работает. Изначально мы имеем такое множество, которое состоит вот из таких из двух облаков, и очевидно да, что мы.
Speaker A
сегмент посмотрите что это были за товары Действительно ли они похожи или вы находите каких-то людей у которых товары всё-таки отличаются больше чем вы ожидали Тогда возможно стоит взять число кластеров побольше или наоборот зде Визуальная реута и чем в любых других задачах и если вы
Speaker A
Хотим в результате получить, чтобы одно отделилось от в.
Speaker A
Нава класса Мы хотим получить ответ вопрос Да нет единички нолики Позитив негативно примерами можеть как раз кредитный скоринг Верт или нет заёмщик кредит код или собака на изображении Стоит ли отправить письмо в спам то есть всегда вот два варианта
Speaker A
один сорт Ника и попробуем решить задачу а Относится ли данный цветок к сорту Ника в качестве признаков мы используем те же самые геометрические значения Здесь нам важно поделить выборку на обучающую тесто чтобы мы Потом могли оценить наш результат обучающая выборка - это та где
Speaker A
мы уже знаем что за класс А есть у цветка там это вирджини или это не вирджини А и нам важно а иметь какую-то выборку которую мы не покажем алгоритму а то есть это будет такой её набор для проверки чтобы он там
Speaker A
вдруг просто не выучил ответы на вопрос действительно их как-то обобщил и мы просто случайным образом половину выборки относим в обучающую этос половину в тестовую импортируем метод ближайшего соседа о нём мы разговаривали уже в вводном блоке к лекции на этой неделе
Speaker A
А запустим вас параметром в три ближайших соседа и Посмотрим что получилось то есть да вот мы об учились на нашем обучающем датасете и используем тестовый для прогноза получаем вот ответ и мы хотим как-то оценить качество то есть алгори что-то
Speaker A
дал что-то предсказал насколько он был прав насколько он был не прав для этого Давайте посмотрим на такую сводную табличку У нас есть предсказание это но не передавали в арит и что мы видим для 44 Цветков алгоритм предсказал что это не вирджини
Speaker A
и они действительно не были вирджини то есть 44 ответа истинных в случаях алгоритм предсказал что это вирджини и это действительно был Этот сорт то есть всё тоже сошлось но вот у нас есть один случай когда алгоритм сказал Да А на самом деле было
Speaker A
нет и два случая наоборот алгоритм предсказал что это не цветок Ника а на самом деле это был он вот э табличка которую мы сейчас рассмотрели это Матрица ошибок или по-другому и вот эти четыре значения по диагонали у нас Это истинное значение когда у нас в
Speaker A
сошлось [музыка] как раз наши ошибки ошибки первого рода и ошибки второго рода когда там мы предсказали позитивный исход А был на самом деле негативный и наоборот на основе conf Да она как бы даёт много информации Но это четыре значения
Speaker A
которые надо как-то интерпретировать их там сложно сравнивать друг с другом поэтому на осном метрики основными в случае бинарной классификации являются точность и полнота prision и prision - это доля верно угадано от предсказанных и рекол - это доля найденных классификатором от
Speaker A
всех тестовой выборки и в нашем случае 96 про Цветков Да мы угадали верно то есть в 96% случаев если мы говорим что это цветок этого сорта мы правы и в тестовой выборке для 90 Цветков этого сорта мы их находим у
Speaker A
идеального алгоритма точности пота равна единички Давайте посмотрим а может ли Можем ли мы как-то предсказать лучше результат чем вот с такими метриками и попробуем использовать другой алгоритм возьмём классификатор о том что такое мы поговорим там чуть позже когда дойдём до
Speaker A
других алгоритмов пока мы просто импортируем и посмотрим на результат и что мы здесь получили мы получили что-то очень похожее То есть у нас прогноз но результат чуть отличается но он у нас не стал лучше модель при этом бы
Speaker A
сложнее чуть позднее а при этом задаче бинарной классификации мы можем получить не только вердикт но и какие-то предсказанные вероятности отнесения К объекту то есть получить ответ на вопрос да или нет Это уже хорошо но хочется иметь какую-то уверенность То есть это да это прям 100%
Speaker A
да Или мы на 90% уверены и мы можем использовать не метод а метод уже вернёт не просто нолики единички а для каждого объекта он Верт два значения вероятность отнесения к первому классу и ко второму Да в сумме они дают единичку
Speaker A
но у нас может быть задача не бинарной классификации А много классовой тогда этих значений будет столько Сколько классов например не просто понять там это вот этот сорт или не Этот сорт А какой это из сортов иго из полезных
Speaker A
метрик это эта Метрика позволяет оценить насколько хорошо прогноз [музыка] ранжирования характеризуют качество алгоритма и их может быть модели не оче удобно друг с другом одно будет их снить какая лучше не очень понятно и хочется иметь какое-то значение вот
Speaker A
которое одно для этого Давайте построим рок кривую что это такое вот наш алгоритм предсказал нам наши вероятности Да отнесение к первому классу в нашем случае чтото м ранжиру все наши цветки из тестового датасета по этой вероятности то есть от
Speaker A
тех где алгоритм меньше всего считает что это нужный нам класс до тех где алгоритм максимально уверен по этому скру и начинаем вот постепенно эти объекты перебирать начиная с наименьшего скора если мы встречаем то что это был цветок на самом деле не того сорта Это
Speaker A
был там нулевой ответ мы движемся вверх е это был нужный нам класс единичка то мы движемся по этой кривой вправо и что получается Если алгоритм идеально ранжировании скора то у нас где он был менее уверен это на самом деле окажутся
Speaker A
нолики где он более уверен это окажется на самом деле единички и по кривой мы пройдём в начале Строго вверх а потом строго направо а если мы например обучили Модель которая всё не имеет какой-то предсказательной силы или вместо модели мы просто брали и
Speaker A
кидали монетку то они у нас и будут как-то перемешаны друг с другом вот то как мы их аранжировать иметь никакой связи с какой-то действительностью и мы будем двигаться как-то по диагонали и вот та самая Метрика которая Одним числом
Speaker A
описывает что же у нас произошло и Какое качество алгоритма это площадь под вот этой кривой То есть если э Метрика равна единички у нас идеальный классификатор если 05 то нашу модель можно заменить генератором случайных чисел а если ноль то мы попутали класс и вместо
Speaker A
ноликов мы предсказываем единички вместо едини но и что ещё такая важная часть есть би фимы обсудили выхо может дава ответ какую-то вероятность какой-то вот Ну да вероятность отнесения там к первому классу и мы переходя к какому-то конечному ответу да или нет мы можем
Speaker A
менять какое-то пороговое значение и выбирать там что нам важнее например там точность или полнота Допустим мы разбра какой-то классификатор который там по результатам анализов скажет болен человек болезнью или нет И здесь нам наверное важнее а не пропустить человека с заболеванием
Speaker A
А чем ошибиться в другую сторону и больному человеку сказать что нет Он не болен и мы можем там чуть понизить для этого порог А подробнее у вас в домашнем задании на это будет одно из упражнений Так давайте посмотрим на
Speaker A
вопросы так имеет ли смысл делать стандартизацию для фичи Уровень образования Если почино чис имет какой-то физический смысл то непонятно что будет образовать означать Уровень образования 23 это проблема или нет Если да то как с ней [музыка] бороться действительного све
Speaker A
обни будет нести но нам это не так важно то есть эти признаки они у нас находятся где-то внутри где-то внутри алгоритма и как он там посчитал расстояние так в общем-то и посчитал когда это у нас дальше всплывёт скорее всего Когда мы
Speaker A
будем строить центр кластера И на самом деле даже ес мы проводим стандартизацию мы мся с этой же проб два человека с образованием уровня там и три человека с образованием уровня 3 у нас уже получилось Там что-то промежуточное между двойкой и тройкой И
Speaker A
решение здесь когда мы потом описываем центры Наших кластеров мы не просто усредни за которыми скрывались какие-то ния М не просто усредни сказали что вот тут вот там два с чем-то а посмотрели вас с образованием три больше людей например
Speaker A
взяли просто медианное значение И вот сказали что три грубо округлили и уже физический смысл вернули интерпретировать можем А следующий вопрос Какую метрику классификации использовать если классы не сбалансированы такой есть пример лже F1 дают оценку модели как хорош но она определяет только один самый
Speaker A
большой класс хорошо Да хороший вопрос то есть что такое сбалансированность класса допустим вот тот же самый пример с тестом на болезнь Если э болезнь какая-то достаточно редкая да то у нас там тысячи людей там 10.000 людей пройдёт исследование и там
Speaker A
окажется больных челове всегда будет говорить нет то в 9997 случаях из этих 10.000 мы будем правы и вроде бы как какое-то качество алгоритма что точность что полнота там будет 99 там и там выше и вот например как раз руук
Speaker A
борется с этой проблемой алгоритм их распределит где-то например к правой стороне мы будем понимать то что Да он умеет ранжировать он наших три больных человека как-то правильно определить А если эти три человека у нас по вероятности раскиданы как-то по всей
Speaker A
выборки то иро у нас будет в районе 05 и мы увидим что всё плохо так другой вопрос Какую точность модели считать Привой и от чего это зави наше вообще бизнес-задачи и от применения в идеале научиться связывать точность модели с
Speaker A
каким-то с какой-то прибылью с каким-то профитом который мы окупа и например допустим мы работаем в каком-нибудь там финансовом фонде Наша задача там торговать акциями чем-то е и если мы даже там можем с вероятностью больше чем 50% определять будет там увеличиваться
Speaker A
цена какого-то актива или падать кажется мы на этом уже сможем зарабатывать Ну если там сколько это чуть-чуть Но заметно выше чем Случайность а а если это там какой-нибудь кредитный скоринг то наверное Мы хотим качество повыше Так что в идеале связывать с
Speaker A
каким-то уже применением сравнивать с тем как без моделя То есть у нас же может быть так что мы модель вводим для того чтобы а что-то заменить или что-то усовершенствовать и мы понимаем как оно работает без и как оно
Speaker A
работает с этим А может быть мы хотим нашей моделью заменить врача который будет ставить диагноз тогда у нас требования к модели будут какими-то просто высочайшими или у нас Автопилот Мы у нас классификатор идёт человек пешеходному переходу или нет тогда нам надо
Speaker A
будет во-первых опять же сравниваться с например с результатами реального водителя потому что реальный водитель он тоже не идеален он тоже может пропустить И если мы лучше чем то что было до этого то это хорошо но при этом сам уровень
Speaker A
может быть сильно разм так давайте последний вопрос в этоке им дальше Так А нет у меня просто про дублировал вопрос кроне сбалансированную выборку Окей вопрос можете также писать в чат когда мы там подойдём к концу этого блока мы разберём и на всё
Speaker A
ответим Давайте теперь поговорим о задачах регресси зада классификации определяли там вероятность наступит или нет какое-то событие или пытались отделить один класс от другого а в задаче регрессии мы предсказываем какое-то вещественное значение А например да В вводном задании занятии у
Speaker A
вас было там домашнее задание по прогнозу зарплаты футболистов то есть наша цель предсказать какое-то вещественное число тот же самый курс акций там количество осадков в следующем месяце что угодно ещ у нас да есть там те же самые признаки
Speaker A
футболистов которые как-то характеризуют их конкретные скилы Мы также выделяем тестовую выборку А импортируем регрессор и то что было в вашем домашнем задании посчитать метрики А вот мы их определили в случае регрессии У нас тоже А много разных метрик которые мы можем посчитать да то
Speaker A
есть у нас по каждому объекту есть целевое значение нашей трки и то что мы предсказали и на основе этого мы уже можем строить много всего можем Смотреть насколько Мы отклоняет в среднем и получить Да там среднюю абсолютную ошибку можем их
Speaker A
высадить в квадрат чтобы какие-то прям далеко какие-то прям критичные ошибки имели очень большой вес А В некоторых случаях пере прогноз Может быть там меньше или больше важен чем недо прогноз и тогда мы там не просто смотрим на модуль нашей ошибки а смотрим
Speaker A
то В какую сторону и а домностроителей а сколько людей нам стоит завтра вывести вот операторов просто на на работу и если мы делаем переп То есть если по нашему прогнозу мы ожидаем больше чем окажется на самом деле то у нас операторы
Speaker A
оказываются не [музыка] дозагрузки А если мы недооценили и не до прогнозировали количество обращений на следующий день то что мы получаем операторы не справляются с работой А клиенты долго ждут в очереди А когда клиенты долго ждут Они получают ответ на
Speaker A
свой вопрос Они могут уйти конкурентам а И это тоже нам несёт убытки и тут уже зависит от того насколько мы клиенты ориентированы что для нас дороже и что мы вообще обещаем клиентам может быть наше конкурентное преимущество которое мы всегда объявляли это то что у нас там
Speaker A
лучшая техподдержка которая Ответит вам всегда максимум за одну минуту и тогда окей Мы готовы смириться с тем что операторы будут простаивать Но главное чтобы у нас не было завалов А может быть наоборот у нас эконом сегмент Окей Пусть
Speaker A
клиенты ждут но мы не можем себе позволить чтобы операторы простава просто так А давайте посмотрим а можно ли улучшить прогноз использовать другие модели также импортируем и посмотрим что вот в данном случае действительно справился лучше То есть у нас раза в полтора прогноз стал
Speaker A
точнее Вот по моей и понт ошибки мы с 6% ошибки спустились до 49 Так у нас что-то было в чате а просто идт обсуждение это отлично Давайте го наконец обсудим что же такое заб Из какого семейства алгоритмов он
Speaker A
появился есть семейство алгоритмов постни Вот таких вот деревьев и в НМ на самом деле довольно простая логика заложена то есть мы накиды много-много и последовательно наме Мы хотим оценить риск того что клиент нам не вернёт кредит и наме посмотреть на его
Speaker A
там кредитный рейтинг на его зарплату на какие-то другие признаки тамри какая-то призна знание ниже 4 то мы там возвращаем да иначе возвращаем нет Или там доки к нашему ответу в случае задачи регрессии там ми1 или там 5 то есть мы строим вот какую-то такую
Speaker A
решающую линию и это дерево может быть более глубоким наме тотже случае кредитного скока если возраст зависимость образования Может быть если там у вас больше сока имеется дом то да вы даём кредит у нас есть что взять залог Он точно вернёт Если нет то
Speaker A
посмотрим на уровень дохода То есть это такое множество последовательных фов которые влияют на итоговое решение они добавляют итоговому ответу либо больше либо меньше уверенности или в случае регрессии там закидывает какую-то сумму Например если мы предсказываем стоимость недвижимости Да там
Speaker A
площадь там больше 100 м или меньше там близость до метро район города вообще что за город возраст квартиры и в зависимости от каких-то пограничных значений как-то изменить наш И если мы возьмём Одно такое дерево то кажется что для получения какой-то
Speaker A
хорошей точной модели оно должно быть очень большим очень большое дерево оно будет сложно Сложно обучать Возможно там возникнут какие-то конфликты и оно будет не очень эффективным поэтому деревья эффективнее объединять и есть разные варианты как деревья объединять в один алгоритм
Speaker A
а один из популярных методов это Случайный лес лес он потому что мы берём много деревьев а Случайный потому что мы берм разные подборки и разные признаки То есть если у нас там на вход был из данных для обучения сся объектов там и сот
Speaker A
признаков мы берм 50 признаков там 200 объектов обучаем одно дерево берём другие признаки другие объекты обучаем ещё одно дерево и так делаем несколько сотен раз и у нас получается что каждое дерево знало какую-то информацию оно увидела какие-то объекты из нашей
Speaker A
общей выборки и может быть даже далеко не идеальном результат предсказывает и Давайте просто возьмём и усредни их прогноз То есть у нас есть много не очень точных прогнозов но всё-таки имеющих какое-то значимое качество и как правило на практике оказывается после усреднения мы
Speaker A
получаем более точный прогноз чем был там у одного дерева и тем более одного маленького дерева в случае задачи регрессии мы можем просто усреднить это значение а в случае задачи классификации например провести голосование за какой класс больше тот и
Speaker A
использу Из плюсов Фореста что он может обучаться быстро потому что может обучаться параллельность мы выборку поде признаки поделили у обучение ит гораздо более маленькому набору бы признаков выборке и мы можем параллельно Независимо все эти деревья обучать и просто Потом всё
Speaker A
усреднить а другой вариант когда мы деревья используем не параллельно а последовательно то есть мы берём какое-то дерево тоже не очень большое оно даёт далеко не идеальный результат и смотрим насколько это дерево ошиблось и уже второе дерево обучаем не на то чтобы оно предсказывала
Speaker A
наш нашу исходную задачу а пыталось исправить первое дерево то есть второе дерево предсказывает насколько ошиблась первая мы вносим корректировку и получаем уже какой-то суммарный ответ от двух деревьев потом берём третье дерево смотрим насколько ошиблись вот эти первые два
Speaker A
суммарно и снова на этом обучаемся и как-то их корректируем и когда мы таким образом обучаем там несколько сотен деревьев мы от какого-то плохого ответа так уточняем корректируем и приходим уже к какому-то финальному решению чаще всего бустинг оказывается эффективнее
Speaker A
чем в плане качества То есть это более такой эффективный подход и поэтому иль прот ви задачу то есть мы получили задачу предсказать там-то бинарный класификатор преть какое-то вещественно значение обучаем там какой-нибудь смотрим что получилось это как раз одна из
Speaker A
реализации бустинга на деревьях она была создана в Яндексе из параметров Сколько деревьев так вот последовательно обучать Какой глубины брать эти деревья сколько признаков использовать для обучение каждого дерева и в кот бусте очень эффективно реализован вот автоподбор этих параметров То есть можно вообще не
Speaker A
заморачиваться с тем чтобы как-то оптимизировать модель и получить довольно неплохой результат то есть с какими-то другими реализация как правило приходится повозиться с подбором гипер потратить на это какое-то время и получить прирост к тому что было Вот по дефолту АБ он как правило хорошо
Speaker A
справится сам его там можно будет как-то чуть-чуть скорректировать Но как правило это уже не даёт какого-то большого прироста А во всех примерах ранее мы обучали модель на одном доти проверяли на другом а помимо того что это просто даёт нам такую честную оценку
Speaker A
и мы оцениваем алгоритм на тех данных Где алгоритм не видел нашего истинного значения Это ещё позволяет нам проверить а не переобулись ли мы или там может быть не добули Что такое переобучение Допустим мы решаем задачу регрессии и у нас исходные данные Да вот
Speaker A
по Ире это наша целевая значение наша целевая переменная А по иксу признак на основе которого мы предсказываем и у нас данны расположе в вот и в идеале Мы хотим Вот так и предсказать А если мы переобучить например использовали там очень глубокие деревья
Speaker A
а выборка у нас была очень маленькой то алгоритм его просто запомнит он запомнит там уже деревья будут настолько подробные что там для такого икса Давай такой Y и на наших обучающих данных мы будем видеть идеальное качество просто попадание
Speaker A
там с нулевой ошибкой но когда мы получим какие-то новые данные там отличающиеся там буквально на на чуть-чуть а мы получим что модель работает как-то странно и наоборот модель может не дооб учиться как-то всё очень грубо приблизить и мы просто вот
Speaker A
не дойдём до того качества До которого могли бы то есть в идеале мы обучаемся усложняем постепенно наши Модели там строим более глубокие деревья берём их больше и смотрим как у нас улучшается качество на нашем обучающем датасете и оно будет Там
Speaker A
постоянно улучшаться А и проверяем на то как вот на этом отложенном датасете тестовом качество у нас растёт или не растёт оно до какого-то момента будет расти потом выйдет на какой-то стабильный уровень и вот это уже будет говорить о том что пора остановиться то
Speaker A
есть о том что мы вот от каких-то грубых приближений перешли вот к максимальной способности алгоритма Выучить все зависимости и дальше Мы уже идём просто в Запоминание обучающего датасета и это нам позволит просто получить какие-то красивые метрики Здесь и сейчас но потом
Speaker A
когда мы начнём использовать эту модель в реальном мире всё пойдёт не так всё будет очень плохо Давайте проверим не переобулся ли наш в примере выше то есть да в сравнени с мы получили результаты получше Давайте посмотрим что же было в
Speaker A
обучающие наше выборки На трене и на трене мы получили результат ещё лучше То есть если 49 а catboost при обучении строит вот такие графики это как раз наше качество на обучающей выборке и на тесте и вот мы видим да что качество на нашей обучающей
Speaker A
выборки оно всё падало падало падало даже там на тысячном дрели оно всё падало а тест вышел вот на такой на плату но при этом всё чуть-чуть да улучшалось и в принципе можем там обрезать дерево где-нибудь там на 400 на 500 и получить
Speaker A
модели с примерно таким же качествам А в некоторых задачах если продолжать там усложнять алгоритм увеличивать количество деревьев качество на тесте начнёт ухудшаться и расти вверх и тогда нам уже точно надо брать Вот останавливаться там где мы достигли мини так есть ли у нас вопросы или мы
Speaker A
можем переходить к следующей теме так вопросов У нас пока нету И давайте перейдём к другому набору задач - это прогноз временных рядов а временной ряд - это все величины которые как-то Вот идут в динамике идут во времени а прогноз погоды количество осадков курс
Speaker A
валют это всё временные реб и мы довольно часто хотим рассказывать а что же будет дальше какой будет спрос на товары сколько у нас будет посетителей сколько у нас будет обращени в техподдержку прогноз каких величин для бизнеса часто полезен Мы из этого Исходя из этого
Speaker A
можем планироваться очень важная штука на первый взг вро зада рере У нас есть как будто бы только таргеты то есть да вот целевое значение есть а признаков то в нём и нету а но на самом деле признаки у нас тут
Speaker A
тоже есть мы можем использовать значение там за несколько периодов назад например да мы смотрим А как было вчера как было неделю назад как было год назад и на основе этих данных строить какой-то прогноз и у нас вохх может какие-то сезонности какие-то
Speaker A
периодичности в случае там с той же температурой у нас там летом температура выше зимой ниже обращение в техподдержку наверное ночью их будет меньше а днём больше при этом можно учитывать праздники что-то ещё то есть на самом деле в ных рядах У нас
Speaker A
есть информация притянуть много-много разной информации там какой-то был день недели какой-то был месяц это было рабочее время или это была ночь а что ещё можем использовать какую-то другую информацию которую мы получаем именно на этот день в м могут быть сложно с пром времен
Speaker A
выглядить то есть Вот пример там эталонного ряда с сезонностью это просто синусоид и тут можем построить прогноз очень просто мы там берём назначение на один период назад мы построили идеальный прогноз но данных там может расти амплитуда в них может наблюдаться
Speaker A
какой-то тренд и здесь уже например взять значение за период назад Не сработает то есть здесь надо будет учесть то что ряд ня смту становится более таким СТМ здесь дополнительно е есть какая-то Линейная зависимость и наши модели по-хорошему это всё должно
Speaker A
учитывать Здесь нам также будет необходимо делить данные на на Обучаю тестовые выборки ими рядами есть очень важ просто в задаче регрессии нам часто позволительно взять какую-то случайную подборку взяли случайную половину точек на них обучили на предсказали результат замерили Всё Давайте представим что из
Speaker A
этого ряда мы просто какую-то случайных точек нарга и будем пытаться их предсказать но например если мы знаем иде было м Если бы мы не знали только вот эту область потому что нам надо учесть и тренд И всё И самое главное тут бы не
Speaker A
просто наше желание усложнить себе задачу не решать более простую в реальной жизни У нас как раз мы будущее это и не знаем то есть у нас есть то что было здесь мы на этом обучаемся ва идёт дальше и потом уже
Speaker A
следим за тем как эта модель в реальном мире работает и как она предсказывает то будущее который на момент нашей работы на момент обучения модели мы не знали а что можно использовать из такого Самого простого но при этом эффективного
Speaker A
подхода для прогноза временного ряда - это библиотека профет она умеет выделять как раз тренды сезонности раскладывать ременной ряд на составляющая может также учитывать какие-то праздники в зависимости от региона и другие важные такие-то признаки и это такая хорошая отправная
Speaker A
точка для нашего прогноза А давайте возьмём для примера вот такой временной ряд это данные Насколько помню по энергопотреблению в зависимости там дата с библиотекой работать очень просто мы её импортируем подгружает в таком формате у нас один столбец - это дата
Speaker A
второй наше значение обучаем модель М указываем да На сколько дней мы хотим сделать прогноз в данном случае на год вперёд а предсказываем устроим и вот мы получили наш прогноз то есть синяя - это прогноз модели с какими-то доверительным
Speaker A
интервалами а Чёрные точки - это те данные которые на которых мы обучались то как было в истории мы видим да что в реальности были какие-то выбросы какие-то аномальные значения А моделях как-то вроде бы усредни но при этом и
Speaker A
сезонности какие-то выявила и тренды и Давайте посмотрим что же внутри у модели произошло модель выявила тренд данных подсказала что вот это вот падающее знание будет продо вот такое видим модель выявила недельную сезонность То есть как оно внутри неделя
Speaker A
Да там с ростом в понедельник с падением в выходные модель это обработала и модель исследовала сезонность внутри года То есть у нас Летом идёт снижение нашего значения рост осени и держится зиму эта модель она вот как раз из
Speaker A
признаков использует день недели день го отдельно выявляет какие-то тренды внутри себя решают зада оптимизации я документацию приложу кому подробности интересны можете почитать и вот ищет оптимальное предложение приближение нашего ряда это значение уже можно использовать как какой-то базовый прогноз то есть что
Speaker A
мы можем сделать наши прогнозные значения из вот этих посмотреть в каждый день насколько модель ошиблась то есть получить какой-то остаток и мы уже получим временной ряд очищенный от тренда очищенный от сезонное И уже какими-то нашими более сложными подходами
Speaker A
какими-то другими моделями пытаться улучшить имеющийся прогноз То есть это похоже на то что мы обсуждали в бустинг и мы будем использовать в качестве первого алгоритма вот наш профет он нам чтото предсказал самое главное что он нам выловил базовый там тренд сезонности
Speaker A
потому что они там не очень удобны для там некоторых других алгоритмов и уже другими алгоритмами будем его улучшать и также в самом фете там есть что понастроили там о праздниках например потому что очень часто там по для тех же обращений
Speaker A
в техподдержку праздничный день его нет будет довольно важным фактором и Профит тоже может учесть А в домашнем задании у вас на это тоже будет пример там вы сможете попрактиковаться в этом а какие алгоритмы лежат в основе профе что мы обсуждали скими фикация или
Speaker A
что-то совершенно другое а в профите подход больше такой оптимизационный то есть это чем-то похоже на модель авторегрессия которые мы не разбирали у нас сегодня такой очень базовое Погружение в машинное обучение на него как бы всё-таки есть много разных
Speaker A
отдельных курсов про него можно говорить очень долго мы сегодня Разбираем какие-то выборочные примеры а Но к профе можно относиться что это просто такой оптимизационный алгоритм который раскладывает по вот разным сезонным компонентам и трендам наш временной ряд и вот как раз за счёт каких-нибудь
Speaker A
бустинга мы можем этот прогноз уже улучшать например в профет не очень удобно вносить какие-то а дополнительные признаки которые у нас там есть на дату и вот профет хорошо предсказывает ряд сам по себе но не учитывает влияние каких-то там других
Speaker A
признаков под другими признаками там предсказываем количество обращений Мы например можем иметь там количество клиентов на эту дату вообще то есть если у нас компании количество клиентов растёт то и количество обращений вроде будет расти и неплохо бы там для
Speaker A
прогноза это в качестве признака иметь или количество продуктов или информацию о сбоях потому что да сбои могут приводить к продуктам и вот мы можем с помощью профе вот выявить какие-то сезонности а потом уже используя бустинг с какими-то конкретными признаками уже с
Speaker A
другими фичами его начать уточнять и это будет скорее всего эффективно и давайте рассмотрим последний такой класс задач это работа с текстом а это сильно отличается от того что мы обсуждали до этого То есть у нас были какие-то числовые признаки
Speaker A
а м то есть да у нас там был какие-то размеры листка какие-то характеристики футболиста когда мы решали прошлые задачи а допустим у нас есть просто текст это отзывы на разные там компании заведения и в качестве таргета это положительный
Speaker A
он или отрицательны то есть да вот здесь был какой-то негатив то что там шумно ещё что-то здесь наоборот всё хорошо единичка и Допустим мы какую-то часть отзывов разметили просто там вычитали сказали да тут хорошо Да тут плохо а и
Speaker A
хотим дальше этот процесс автоматизировать есть нам прилетают отзывы и ус уже есть алгоритм который говорить там хорошо плохо и мы можем следить например за долей хороших отзывов Или например там реагировать на каждый плохой отзыв в срочном порядке и чтобы как-то применить вот те
Speaker A
алгоритмы которые мы сегодня обсуждали да то есть мы вот с числовыми признаками работать умеем А тут текст Ну текст в дерево или текст ещё куда-то передать мы не можем использовать метод ближайших соседей Ну мы можем там да вть там если
Speaker A
один текст равен одному то они близки но тексты Мы хотим как-то больше там по смыслу по содержанию уметь агрегировать какие ближе какие дальше а вариантов Как преобразовать текст их очень много Давайте разберём самые простые А самый простой - это
Speaker A
confer то есть мы берём а Смотрим А что же у нас за слова вообще встречаются во всех наших текстах Составляем словарь и вот сколько раз какое-то слово в нашем тексте встретилось столько раз омы в качестве признака используем то есть по
Speaker A
всему нашему дасе мы получаем большой датафрейм где у нас в качестве столбцов идут как раз слова а по горизонтали сколько раз они встретились там мы видим что в первом тексте цена часа ча встретилась по одному разу во втором примере слово что встретилось два
Speaker A
раза в случае других нолики и что нам это уже даёт во-первых такую матрицу уже можно закинуть и В Н И В бустинг И куда угодно это уже вещественное значение которое он сможет обработать потом мы здесь можем вводить какую-то меру
Speaker A
близости То есть это у нас уже какие-то векторы которые можем там как-то друг на друга перемножить что-то ещ сделать И вот если мы их пережим и там в двух текстах были какие-то общие слова у нас там будет что-то не нулевое
Speaker A
в их скалярном произведени и чем больше общих слов в тексте тем вот будет больше вот какая-то мера их близости а также если мы это передадим в в бустинг кае другие алгоритмы каждое Вот это слово будет уже признаком и скоко раз о
Speaker A
вре Спасибо отлично это будет поводом для того чтобы бун Да там накинул какого-то там Значение к нашей итоговой вероятности сделал оценку более позитивной а там какие-нибудь слова там про жалобы про что-то плохое наоборот будет иметь негативный оттенок это уже позволит сделать хоть
Speaker A
что-то Но кажется что сработает плохо потому что у нас слов много слова все в разном виде Там хорошие А кто-то написал хороший или хорошая это всё будут разные столбцы и они уже никак не пересекутся никак не учту а для этого есть
Speaker A
специальные подходы к работе с текстом например мы можем текст нормализовать и как раз сократить размер наших признаков за счёт того что Хорошее хорошее и хорошо мы сведём к какой-то единой форме например да Хорошее хорошее у нас с велись к хорошей но с хорошо не
Speaker A
сработало то есть нормализатор они есть но они работают не всегда идеально А и работая с текстами что мы можем сделать мы да там разбиваем по слова убираем все знаки припинания убираем всё лишнее нормализуя и собираем обратно получаем уже текст получше это вот самый
Speaker A
такой базовый подход который там исторически был там одним из самых первых давным-давно и Он позволяет сделать хоть что-то но он не Очень эффективен для нас часто важна какой-то контекст то есть слово встретилось Какие слова были рядом какие-то союзы например Они вроде
Speaker A
хочется чтобы имели меньший вклад чем какие-то другие более значимые слова и в домашнем задании вас будет с чем попрактиковаться [музыка] Да убрать все знаки припинания всё лишнее убрать какие-то союзы какие-то стоп слова обвести а перейти от фрайер там к более сложной
Speaker A
форме Да там к PDF фрайз который А ещё использует уникальность слова То есть если какое-то слово используется практически в каждом тексте в нашем датасете а то нам отдаст меньши вес это как раз идут всякие союзы предлоги они не несут в себе много смысла а если
Speaker A
слово было уникальным и встречается в текстах довольно редко то это что-то чему стоит дать большей вес на самом деле тоже умеет работать с текстами и Попробуйте передать Вот это текстовое значение просто как текстовую фичу и он внутри сделает что-то очень
Speaker A
похожее на ист ответ это будет для домашнего задания достаточно потому что мы сейчас говорим Да про какие-то базовые методы машинного обучения про такие классические подходы но сейчас вот Тема обработки текстов она шагнула далеко-далеко вперёд в последние годы там с Трансформерами с гпт вы все
Speaker A
сталкивались понимаете насколько хорошо они решают там задачи понимание текстов и например для них задача оценить позитивность там хорошее от плохого она будет довольно лёгкая но в наш курс это не входит Но сегодня просто базовый такой обзор Так ну и какие можно дать вообще
Speaker A
общие рекомендации при обучении модели и когда вы там столкнулись с задачами прогнозирования проводите разведочный анализ датасета смотрите Есть ли в НМ пропуски как распределены признаки как они связаны с таргетом что коррелирует Есть ли признаки которые друг с другом
Speaker A
связаны Может там какую-то лишнюю информацию стоит убрать а где-то там что-то объединить то есть а посмотреть на данные глаза это всегда полезно а не просто отдать в алгоритм чтобы оно там как-то само отработала и всё а подумайте о том а Можете ли вы
Speaker A
какие-то новые признаки придумать на тех что есть к примеру в задаче с цветками можно не просто передать Да там длину и ширину а передать там соотношение длины к ширине это уже может алгоритм где-то упростить потому что да алгоритм будет
Speaker A
например сам какое-нибудь дерево будет Там если длина такая ширина такая то вот столько-то и вот все вот эти соотношения будет как-то внутри себя выстраивать и попутно накапливая какую-то ошибку А вот какую-то вытянуто форму лепестка можно вот задать как поделив длину
Speaker A
ширину тотже Рен футболиста нормировать по стране по клубу это тоже принесёт какую-то дополнительную информацию потом Да пробуйте разные алгоритмы пробуйте их объединять смотреть Какие лучше Какие хуже Иногда приходится выбирать там между там качеством сложностью алгоритма или там один будет более стабилен и
Speaker A
ошибаться там чаще но на чуть-чуть а другой будет ошибаться там реже но на какие-то очень сильные значения и всегда уделяйте внимание переобучения следите за моделью за тем как она а ведёт себя на обучающем наборе данным на тестовом и
Speaker A
когда модель используется там уже выкатили впд она у вас работает в реальном мире на реальных клиентов тоже за ней следите Потому что при обучении могло там что-то пойти не так вы вроде бы отложили тестовую часть данных но она
Speaker A
оказалась не очень тестовой а то есть а что-то там всё-таки пошло не так и это было не очень честный тест и в проде видите результаты хуже или там в проти приходят немного не те данные и всё перестало работать как бы важно следить
Speaker A
за метриками важно следить за качеством модели А вот сегодня мы очень так поверхностно пробежались по алгоритму У нас не было никакой теории того как работает например А как дерево строит вот эти вот свои границы как оно выбирает А по какому
Speaker A
именно признаку всё-таки вот здесь разбить сую ветку это мы сегодня ничего не затрагивали Но если вам интересно понять вот всю теорию вот есть учебник от школы анализа данных Яндекса он по своему объёму и полезности он идеален он достаточно короткий но очень подробно
Speaker A
Дат ответ на очень много вопросов а если хочется больше на практике А есть гл Я думаю вы и так знаете об этой площадке а помимо того что там много соревнований на которых можно попрактиковаться там выложено очень много решений других участников и вы
Speaker A
можете перенять огромное количество чужого опыта понять что работает Что не работает что люди используют как подходит к обучению Как обрабатывают признаки как объединяют модели это очень-очень полезный опт так если у нас вопросы вопросов Я не вижу а Всем спасибо за лекцию на этом У нас
Speaker A
на сегодня всё удачи в домашнем задании [музыка] [музыка] [музыка] 2 [музыка]
Topics:предиктивная аналитикамашинное обучениекластеризацияобучение с учителемобучение без учителякредитный скорингпрогнозированиеалгоритмы машинного обученияProphetанализ данных











