**L02/S02 | MLE. Regression problem | ml-pro | mipt | 26f | girafe-ai — Transcript & Summary | SozAI**
Source: https://sozai.app/transcript/regression-problem-ml-pro-mipt/

Лекция о параметрических и непараметрических моделях в машинном обучении и методе максимального правдоподобия.

## Key Takeaways

- Параметрические модели имеют конечное число параметров, которые можно оптимизировать и интерпретировать.
- Непараметрические модели не имеют фиксированного числа параметров и работают иначе, часто без возможности прямого управления параметрами.
- Метод максимального правдоподобия применяется преимущественно к параметрическим моделям и помогает оценить параметры модели.
- В машинном обучении часто используется смешанный подход, где модели могут иметь как параметрические, так и непараметрические компоненты.
- Понимание статистических основ и функций правдоподобия важно для построения и интерпретации моделей.

## What the video covers

- Введение в статистику и её связь с машинным обучением.
- Объяснение различий между параметрической и непараметрической статистикой.
- Практические примеры параметров на основе моделей, таких как линейная регрессия и наивный Байес.
- Рассмотрение формального определения параметрических и непараметрических моделей через касательное подпространство.
- Обсуждение влияния параметров на процесс обучения и интерпретацию моделей.
- Введение в функцию правдоподобия и метод максимального правдоподобия в контексте параметрических моделей.
- Пример применения метода максимального правдоподобия на примере наивного Байеса с дискретными признаками.
- Различие между вероятностью и правдоподобием и их роль в машинном обучении.
- Практическое понимание параметрических и непараметрических моделей и их смешение в реальных задачах.
- Подготовка к дальнейшему изучению функций потерь и оптимизации параметров.

## Chapters

1. 00:00 Введение и проверка технических условий
2. 01:00 Обзор статистики и связь с машинным обучением
3. 10:00 Параметрические и непараметрические модели: определения и примеры
4. 18:20 Практическое значение параметров и их интерпретация
5. 23:20 Введение в функцию правдоподобия и метод максимального правдоподобия
6. 27:30 Применение MLE на примере наивного Байеса
7. 36:40 Различия между вероятностью и правдоподобием
8. 43:20 Заключение и подготовка к дальнейшему изучению

Answers

## Questions about this video

В чем основное отличие параметрических и непараметрических моделей?

Параметрические модели имеют фиксированное число параметров, которые можно оптимизировать, тогда как непараметрические модели не имеют фиксированного числа параметров и работают без прямого управления ими.

Что такое метод максимального правдоподобия?

Метод максимального правдоподобия — это способ оценки параметров параметрической модели путем максимизации функции правдоподобия, показывающей насколько вероятны наблюдаемые данные при заданных параметрах.

Почему в машинном обучении часто предпочитают параметрические модели?

Параметрические модели проще интерпретировать, их параметры можно оптимизировать через функции потерь, и они часто более удобны для практического применения.

## Full Transcript — Download SRT & Markdown

00:00

Speaker A

Угу. Так, ну что, давайте начинать. Так, скажите, там видно экран и слышно ли меня и видно ли?

00:23

Speaker A

Да, видно, слышно. Те, кто в зуме, там нормально всё видно, слышно? Да. Угу. Хорошо. Так, почему сейчас тогда нам надо включить проверить, что так?

00:55

Speaker A

Так, сейчас ещё включим проектор, чтобы включать. Сейчас посмотрим. Вот, отлично, теперь видно. Хорошо, давайте продолжим наш разговор.

01:43

Speaker A

Смотрите, на чём мы остановились в прошлый раз. А мы определили всякое там машинное обучение, что вот, значит, оно является прикладной статистикой, ну, и прочие другие всякие штуки, которые нам так или иначе понадобятся. А теперь давайте, собственно, поговорим немножко про

02:01

Speaker A

статистику. И у нас ближайшие пара занятий, они будут, э-э, сильно переплетены, в принципе, со статистикой, потому что мы будем вводить здесь те величины, которые нам потребуются в течение курса. Мм, эти все величины, они, а-э, по идее с курс статистики вводятся и всё это

02:26

Speaker A

делается, но, э, повторить, тем не менее, это стоит. Значит, первая штука - это параметрическая, не параметрическая статистика. Кто про это что-то слышал, что-то знает, про такие в целом вещи?

02:41

Speaker A

Ага. Ну, условно, половин. А, хорошо. Ну, я думаю, что ещё если что, ребята в зуме, вы можете на вопросы отвечать в чат плюсами и минусами своими, и я их тоже увижу.

02:55

Speaker A

Хорошо. [фыркает] А давайте тогда посмотрим. То есть получается, что у нас есть какие-то такие штуки, вот параметры, и что-то там они делают. А значит у нас в курсе, в принципе, в машинном обучении и у нас в курсе будут

03:13

Speaker A

использоваться и те, и другие, разумеется. И как бы вы сформулировали основное отличие этих двух классов подходов?

03:24

Speaker A

Кто-нибудь может назвать? Ну, из тех, кто вот как-то знаком. Ладно, давайте это уберём, чтобы вас не этот не погружать вёто чтение. Как вы это понимаете? Ну, чисто вот самостоятельно, как чувствуете?

03:52

Speaker A

Угу. Ну, это это скорее как применять, да, что типа если что-то более определённое, если мы знаем какой-то класс функций, то мы его параметризуем и вставляем в модель. А если мы совсем не ожидаем, какой класс функций, то мы можем

04:06

Speaker A

использовать непараметрические. О'кей, хорошо. Это такой практический подход, который действительно используется. Хорошо. А если говорить просто вот про само определение именно параметрических, непараметрических, ну, смотрите, в чём здесь фишка. А-а, а в чём здесь фишка? Значит, э у нас действительно есть два класса. И вот у

04:37

Speaker A

нас есть эта функция f, а, которая будет нам по иксам там каким-то образом выдавать игреки, ну, какие-то ответы. Мы сейчас говорим пока по про supervised задачу. И, соответственно, есть вот эта функция. И вот у этой функции для того,

04:55

Speaker A

чтобы натренироваться, может существовать какой-то там вектор вот этих самых параметров. А, и в случае параметрической функции вот этот вектор, а, он будет какими-то там значениями задан. Ну, неважно, как мы их получим, в принципе. Про это мы сейчас поговорим. А

05:14

Speaker A

в непараметрической, а, а, в непараметрическом случае вот эта вот функция f, у неё просто таких параметров, собственно говоря, и нету.

05:25

Speaker A

То есть она, грубо говоря, всегда работает одинаково. То есть, что бы я ни положил, аа у меня нету способа как-то повлиять на модель. И в чём здесь, э, принципиальное для нас отличие? На самом деле есть формальное определение из вот классической настоящей

05:44

Speaker A

статистики. Здесь я отошлюсь как раз вот курсу теории вероятности, который сейчас идёт, например, вот он, а, Данил Григорьев идёт. А вот он там прямо супер детально объясняет во всех всех всех подробностях. Для нас формальное определение такое, что вот

05:59

Speaker A

здесь вот а касательное подпространство является а бесконечномерным. Вот. А здесь касательное подпространство, ну, если у нас модель - это какое-то семейство функций, то касательное подпространство а будет, соответственно, конечным.

06:20

Speaker A

Вот. Ну, это прямо суперформальное определение. А на практике в случае параметрическом, мы можем двигать какие-то параметры, и это нам в будущем поможет, а воздействовать на модель через какие-то опосредованные действия, например, через функцию потерь. То есть у нас была функция потерь, скажем, MSE,

06:40

Speaker A

то есть квадратичная функция ошибок. Мы к ней добавили, например, регуляризационный член, и у нас параметры поменялись. Вот практическое значение такое для нас. И вот это одна из причин, почему на практике очень часто люди предпочитают параметрические модели. Плюс эти параметры можно как-то

07:00

Speaker A

интерпретировать, там ещё что-то делать, ещё что-то делать. Ну вот это такой небольшой взгляд на параметрические, непараметрические модели, которые нам понадобятся.

07:10

Speaker A

Веса. А па, мм, ну, это примером параметров может могут быть веса в линейной регрессии, это правильно. Но это не только веса. То есть типа значение параметра и как оно может использоваться внутри, очень сильно зависит от модели.

07:25

Speaker A

То есть типа очень странные могут быть модели. А, например, ну, давайте, вот мы с вами уже говорили про, а, наивного Баяса, который в прошлый раз разбирали.

07:35

Speaker A

Вот вы как думаете, он к какому семейству относится и почему? Непараметрические. Угу. Так, хорошо.

07:47

Speaker A

Ага. Да. Поэтому я и говорю, что то есть вот смотрите, лост - это пример просто, то есть это один из огромного множества примеров а того, как можно воздействовать на параметры. Хорошо. Ещё какие-то взгляды?

08:02

Speaker A

Что? Распределение, да? Мы же выбирали распределение, например, нормальное, помните? А у нормального распределения есть ещё что?

08:14

Speaker A

Средняя, дисперсия, то есть параметры. И это тоже часть модели. То есть вся эта модель, она параметрическая целиком.

08:22

Speaker A

Вот. Ну, понятное дело, что в реальной жизни мы можем там смешивать. То есть можно сказать, что типа, ээ, если бы у нас был, ну, блин, всё равно как бы мм получится в случае, а наивного Баяса, что мы как-то должны оценить

08:36

Speaker A

распределение, а оценивать распределение не параметрически. Ну, опять же, есть такие способы, но это довольно заморочено, это скорее лучше назвать параметры. Вот. То есть, а, более того, касательно параметрических и непараметрических моделей мм я бы так сказал, что на практике, на

08:56

Speaker A

практике, а, мы скорее склонны считать модель параметрической или непараметрической в определённом случае. То есть, если мы решаем какую-то одну задачу и для нас какие-то параметры просто наглухо прибиты, мы никогда их там не трогаем и так далее, в этом

09:11

Speaker A

смысле она для нас будет непараметрической. Вот это есть с практической точки зрения смотреть. И наоборот, любую не в любую непараметрическую модель можно добавить каких-то параметров. Но это такое практическое определение. На самом деле здесь мы уже потихонечку уходим от

09:26

Speaker A

определения статистического, потому что вот строгое определение, оно вот задаётся через вот эти штуки. Хорошо. Но главное, мы поняли, что вот есть параметры, и они довольно-таки сильно влияют на весь процесс. Мы дальше увидим, как именно. А на самом деле

09:41

Speaker A

сейчас мы поговорим про функцию правдоподобия. И кто вот знает про функцию правдоподобия, метод максимального правдоподобия?

09:48

Speaker A

Ага, всё отлично. Тогда давайте это быстренько, а, быстренько всё пройдём. Угу. Да, в зуме тоже вижу, что ребята пишут плюсы. Супер, спасибо. Вот. А тогда давайте посмотрим, значит, а как у нас мм поставлена задача? Давайте возьмём дискретные признаки и дискретный

10:09

Speaker A

таргет. Ну, чисто для простоты. И прикинем, что вот мы нашего наивного Баяса на самом деле, когда выдавали финальный ответ, то есть понятно, мы определили как-то вероятности, и, собственно, в этом стоит модель. И потом мы сказали: "Ну, наверное, если

10:24

Speaker A

вероятность наибольшая, то это наиболее хороший случай". И будем выдавать ответ такой, у которого наибольшая предсказанная вероятность. Вот это на самом деле и был пример использования метода максимального правдоподобия. То есть мы интуитивно уже его использовали.

10:38

Speaker A

Значит, э что в таком случае происходит? У нас есть X, Y. В данном случае мы будем работать с параметрической моделью. То есть, ээ, метод максимального подобия, он для параметрических моделей определён. И дальше мы говорим следующее. А, у нас есть два мира, один

10:54

Speaker A

из которых называется, собственно, правдоподобие, а другой из которых называется вероятность. И мы...

11:13

Speaker A

три значения, вот тогда верно такое равенство. Здесь важно, что из этих трёх значений ни одной не является переменной для того, чтобы случилось именно что равенство. Вот. То есть нельзя взять тета параметров и сказать, что для всех тета, для этого икса ика так будет

11:30

Speaker A

равно. Нет, это неправда. Там будут другие значения. Что это всё значит? Аа идеологически это значит следующее. А вот этим равенством мы говорим такую штуку. Смотрите, вот есть, э, Давайте, мм, давайте скажем, что а у нас есть аа Давайте начнём от моделек. То есть вот

11:58

Speaker A

вот этот вот случай справа, правая часть определяется моделью, то есть вот справа от Ты мы хотим, чтобы она была константой.

12:09

Speaker A

А, а тут мы говорим, что XY, а не константа. И что мы имеем слева? Смотрите, у нас есть а какой-то воображаемый воображаемый мир, в котором а модель верна.

12:35

Speaker A

То есть модель полностью описывает вот этот наш придуманный не в самом деле лишний мир. И он полностью 100% всегда работает по её параметрам, по её законам. И тогда мы говорим, что смотрите, при а фиксированном а значении параметра тетта какую вероятность имеет

12:58

Speaker A

на сэмпле данную выборку. Ну напомню, что у нас выборка в данном случае дискретная. То есть я сказал, что и признаки дискретные, и Y дискретный, поэтому у нас будет именно что вероятность. Если у нас признаки непрерывные или таргет непрерывный, то

13:10

Speaker A

это будет плотность вероятности. Если смесь, то это будет так называемая RН производная. Ну, за её определением отсылаю куда-нибудь в литературу или вот в курс, например, теоретической, э, курс теории вероятности. А значит, э что нам здесь важно? Смотрите, у нас тета - это

13:28

Speaker A

константа, и у нас есть вот такие переменные, как X и Y. Ну, понятное дело, что это обе матрицы там разных размеров, но я сейчас именно говорю про вот принципиально это пространство. То есть одна точка - это одна матрица X,

13:42

Speaker A

одна точка - это одна матрица Y. И вот на этих координатах существует а какое-то распределение.

13:51

Speaker A

То есть где-то есть какая-то точка, для которой эта вероятность максимальная, и вокруг неё как-то эти вероятности распределены. Ну, если задача выпукла и так далее. Ну, мы сейчас предполагаем какие-то простые условия. А, то есть наша моделька P, она для любой точки XY

14:10

Speaker A

выдаёт, собственно говоря, эту вероятность. И дальше мы будем искать тету. Ну вот если мы посмотрим на метод максимального правдоподобия, да, то мы будем искать а такую точку, которая а будет а вот это p будет максимальным при всех возможных значениях и y.

14:33

Speaker A

Вот это мир справа. То есть у нас есть все возможные выборки XY, и мы ищем, а, какая вероятность будет у конкретной выборки при условии модели. А слева у нас на самом деле другая история, а которая называется реальный мир.

14:56

Speaker A

То есть смысл в том, что определение правдоподобия - это вот краеугольная штука во всей этой истории, потому что есть вот типа чистая математика, которая, собственно, теория вероятности описывается, да, а есть как бы реальный мир. И вот мы верим, что они где-то

15:11

Speaker A

сопрягаются. Вот определение э-э правдоподобия, оно именно про это. И что мы здесь говорим? У нас здесь есть тетта. И на самом деле здесь есть пространство вот этих тет. Ну давайте обозначим тет1, там тетта2. Ну если понадобится больше, но я для простоты

15:28

Speaker A

буду так делать. И здесь а вот у нас может возникнуть, точнее обязательно возникает тоже как какой-то, ну это называется landscape, то есть как, ну какая-то поверхность.

15:42

Speaker A

А в простом случае это тоже будет, ну, давайте, я не знаю, вот здесь вот будет у нас точка максимума этой поверхности, и от неё как-то там будет по-хитрому расходиться какие-то уровни, э, уровни одинакового, а, лайклихда, то есть одинакового правдоподобия.

16:04

Speaker A

А, и получается, что вот здесь у нас будет например максимум. Вот. А и через это мы можем, а, связать вот эти вот два мира, потому что на самом деле мы не вполне знаем, как вот это, а-а, вот эти параметры тетта, вот какое

16:29

Speaker A

полное распределение они индуцируют, мы на самом деле не знаем. Вообще-то говоря, нам будет интересна только вот эта вот точка. А, собственно говоря, метод максимального правдоподобия состоит в том, чтобы мы, а, взяли выборку, как-то оценили в каких-то точках правдоподобия и потом нашли

16:47

Speaker A

максимально. Вот. А, а что здесь делает модель для нас? Модель, на самом деле, она индуцирует вот эту штуку. То есть мы какой вообще алгоритм работы именно модели самой? А мы берём, а у нас есть вот эта вот выборка XY, и мы для каждой теты, ну,

17:12

Speaker A

например, если у нас ТЕТ какое-то конечное множество, а, перебираем, а, какие вероятности есть, и дальше из них выбираем максимальную. Вот, буквально в наивном баясе мы так и сделали. То есть у нас ответов было конечное множество.

17:27

Speaker A

Ну, например, там, а-э, у нас были оценки, да, получается пятёрка, четвёрка, тройка, там двойка. Хорошо. И мы для каждого результата просто оценили эту штуку и сказали: "Хорошо, дальше будет максимально". Вот, э, в этом суть понятия а правдоподобия. То есть связать

17:45

Speaker A

два мира: мир вымышленный, где весь мир работает по закону модели, и мир реальный, где мы не вполне знаем, как что-то работает. Но мы хотим подобрать такую модель, которая будет наиболее уверена в том, что она правильно предсказывает вероятности. То есть, если

18:05

Speaker A

мы возьмём модель, которая работает точно по закону тета и попытаемся намплить вот именно такую выборку XY, то мы хотим, чтобы это было максимально. И с другой стороны, а если у нас а есть XY, то мы хотим выбрать такую тет, чтобы

18:22

Speaker A

у нас эта модель с тетой наилучшим образом описывала именно XY. То есть в этом смысле идеологически мы делаем что-то похожее на теорему Бая. Только здесь-то определение как бы, ну, теорема, ну, слушайте, теорема Баяс она тоже почти определение. Вот. Но здесь

18:39

Speaker A

мы, важно, что смыкаем два мира: вы вымышленный и реальный. Вот в этом главная суть правдоподобия.

18:48

Speaker A

А понятно ли, что произошло и зачем это нужно? Есть ли вопрос? Сейчас я ничего не поняла. Давайте порядке. Мы изначально говорим, что справа у нас модель. Это что означает модель?

19:06

Speaker A

Ну что весь мир, то есть любые, любая выборка XY в этом мире, она строго порождена моделью. Ну типа, если у нас линейная, например, регрессия, ну вот скажем, у нас есть линейная регрессия, любая выборка будет строго лежать на одной линии. Всё. Ну как бы это типа вот

19:24

Speaker A

вот любая выборка, вот мы на смпле, мы на смпле, не знаю, 1.000 объектов, и она строго будет под подчиняться линейному закону. То есть это далеко не все выборки, которые могут быть в мире, в реальном слева, но в идеальном мире

19:40

Speaker A

только такие выборки существуют, которые подчиняются идеально закону вот этому, да? Ну, модель может быть любая, то есть там деревья решений, неросети, бусинги, всё что угодно. Ну да, я привожу на самом простом примере, чтобы было понятно. То есть мы в этом мире говорим,

20:02

Speaker A

что а любая выборка порождена моделькой. Дело формули модель. Модель - это P. Модель модель. Вот это модель генерирует P.

20:16

Speaker A

Ага. Модель генерирует P парамет. Да. Ну модель с параметрами тета генерирует конкретную одну P. И мы ходим максимум на это станция и говорим, что вот слева у нас реальны мир и типа составляем максимум плати.

20:33

Speaker A

Ну да. А слева у нас есть какие-то кривые косые выборки, которые мы там, ну как угодно на сэмплилели. Ну, собственно, реальный мир, да. И мы говорим, что среди всех возможных описаний, то есть дело в том, что, э, например, если мы возьмём выборку вот

20:50

Speaker A

какую-нибудь вот такую, да, то её идеально ни одна модель не опишет линейно. Ну, просто это невозможно никогда. Просто это просто невозможно математически. Вот поэтому мы хотим прикинуть такой параметр, который бы наилучшим образом это сделал. И для этого мы, собственно говоря, вводим

21:10

Speaker A

правдоподобие. Там пространство это 1 2. Ну, потому что это - это вектор в общем случае.

21:19

Speaker A

Ну, типа в лейной модели много параметров. Это 1 2 - это типа два конкретных параметра.

21:28

Speaker A

Да, я это сказал, когда рисовал этот график. Т - это вектор. Я просто изобразил ТТ1, ТТ2. Могу изобразить ТТ3, могу изобразить Т4, но просто у меня только двумерная вот плоскость, поэтому я две изобразил.

21:43

Speaker A

Это просто координаты вектора. Ну, максимум ищется вверх в пространстве тета. Ну, у нас здесь тета - это переменная, но смотрите, у нас вот xy константа, тета переменная, поэтому мы ищем в пространстве тета.

22:03

Speaker A

Можно было бы искать вот в таком пространстве, но это не очень интересно, на самом деле. То есть, э-э, искать идеальную выборку, которая порождается вот этой ттой. Ну, какая-то это очень скучная задача. Она очень просто решается и на практике ничего нам

22:16

Speaker A

хорошего не даёт. О'кей. Угу. Так, ещё вопросы какие-то. Вот у нас есть два мира, и мы их, собственно говоря, сопрягли с помощью этого определения. В этом главное значение правдоподобия. И на самом деле в дальнейшем мы, когда будем к каждой

22:39

Speaker A

модели подходить, мы будем себя спрашивать: "А где здесь, собственно, модель?" Потому что модель выдаёт, на самом деле, вероятность. Мы же занимаемся практической статистикой, а статистика всегда оперирует какими-то там вероятностями, ну, и другими ещё величинами, но всё-таки самое самое

22:54

Speaker A

главное - это вероятность. И дальше, что мы говорим? А, ну, собственно, то, что я уже сказал, что давайте выберем максимальное правдоподобие среди всех возможных. А, но момент здесь в том, что мы оптимизировать будем именно левую часть.

23:10

Speaker A

То есть правая часть, она равна только в точке. Это ещё раз замечу, потому что это суперважно. Аа здесь, потому что тта константа, её как бы, ну, нельзя менять.

23:20

Speaker A

Вот. Хорошо. А, и в этом смысле правдоподобие - это не является функцией вероятности. Вот функции вероятности в смысле P.

23:33

Speaker A

Какие свойства у вероятности главные? Вот типа у нас есть какая-то функция, которая заращает вероятность событий.

23:42

Speaker A

Область значений, да? И что с ним? Ага. Так, сейчас сейчас секунду. Угу. Да, у нас есть основные свойства вероятности. Первое свойство - это что?

24:09

Speaker A

Вероятность от нуля до единицы супер. Ну, если это не так, то это просто невалидная функция и всё. В данном случае L в силу того, что она в каждой точке равна P, она будет удовлетворять этой штуки. То есть с этим всё ок.

24:22

Speaker A

Что-то ещё? Сума всех возможно единиц, да? И второе свойство - это что сумма всех э вероятностей должна быть равна единице. Вот это условие в случае L не выполняется.

24:39

Speaker A

Это так, потому что L равна вероятности только в точке. Но в каждой точке она равна разной вероятности. То есть каждый раз при конкретном значении тетта справа стоит разная функция вероятности, и поэтому она не интегрируется в единицу. Но опять же вот это то, что мы

24:59

Speaker A

здесь имеем возможность сделать, а всё это повторить и припомнить. Что-то такое говорили, говорили на статистике.

25:09

Speaker A

Так, кому такое говорили на статистике? Ага, понял. Хорошо. Ну, теперь мы это сказали здесь.

25:19

Speaker A

В конце оста X y левой части мм не по не получится так сделать, потому что у нас ну то есть x, y и то есть у нас нет ни одной функции, которая бы зависела одновременно от трёх штук.

25:37

Speaker A

Обращу внимание, что смотрите, вот здесь вот эта константа - это не переменная, и здесь вот эта константа - это не переменная. То есть вот сейчас здесь вот в этой строчке нет ни одной функции от трёх переменных. Её просто нет

25:48

Speaker A

технически, потому что это не переменная, это условие, понимаете, да? То есть можно какую-то функцию ввести, ну там, я не знаю, там φ, которая будет зависеть, а, от трёх.

26:01

Speaker A

Просто она тоже не будет вероятностью, потому что она будет интегрироваться, на самом деле в бесконечность. Ну, если тта бесконечное количество, то она будет, то есть я имею в виду, что для каждой отдельно взятой тетты она будет интегрироваться в какую-то там ненулевую

26:15

Speaker A

величину, например. А если мы проинтегрируем бесконечность раз в ненулевую величину, ну, мы получим бесконечность в этом смысле тоже. То есть, к сожалению, такой хак не пройдёт.

26:23

Speaker A

Но это хорошая идея, но но так не получается. Было бы прикольно, но если бы это было, оно бы уже это это бы уже, короче, я не знаю, где-нибудь в XVI веке кто-нибудь заметил бы и сразу бы ввёл. Вот. Но хороший вопрос, да,

26:40

Speaker A

всегда хочется что-нибудь обобщить. А следующее свойство - это ID. Мы с вами его в прошлый раз проговаривали, когда говорили про датасет. Помните, да, что у нас строчки друг от друга не зависят.

26:52

Speaker A

Соответственно, можно взять пример временных рядов, где наоборот каждый момент времени зависит от предыдущего это свойство не выполняется. А вот это свойство нам понадобится здесь для медно максимального правдоподобия. Для чего?

27:04

Speaker A

Смотрите, здесь у нас XY - это матрицы, и они в этом смысле никаких дополнительных условий не содержат. Но нам бы очень хотелось всё-таки модельку рассматривать на одном объекте XY. То есть здесь и у нас нумерует строчки в датасете. То есть просто объект.

27:24

Speaker A

И если мы так сделаем, тогда наша жизнь сильно упростится, потому что как бы а выводить какие-нибудь формулы для матриц прям вот пря причём у которой для матриц, у которой строчки между друг другом зависят, то есть там уравнения выйдут, ну, космического масштаба. Мы

27:40

Speaker A

никогда этого не сделаем. Поэтому а нам это свойство очень нравится. Аа но мы хотим его прологарифмировать. Мы с вами говорили, зачем логарифмировать, да, в прошлый раз. Давайте напомним, типа, почему нам нравится тактая функция логарифм, что чего в ней такого-то

27:58

Speaker A

хорошего? Чего унижается тип? Угу. Угу. Да. Аа производные считаются достаточно легко, но это, я бы сказал, наверное, менее важный момент. Второй момент, что действительно нам проще складывать, чем умножать. На самом деле, если мы ещё на один шажок погрузимся

28:23

Speaker A

вниз, окажется, что мы в компьютере быстрее умножать умеем, чем точнее складывать быстрее, чем умножать. И кроме того, мы можем более точно хранить это число. Вот. Потому что у вероятностей, к сожалению, быстро произдёт переполнение, то есть они слишком быстро станут, слишком

28:40

Speaker A

маленькими. Вот. Ну, это такой инженерная причина, почему это делать. А-а, и мы, на самом деле, потом увидим, что при выводе формул нам везде эта сумма будет помогать, потому что мы под сумму как бы всё проносим очень-очень легко. Хорошо. А-а, значит, да, и на

28:57

Speaker A

самом деле внутри моделей никто не считает вероятности. То есть понятное дело, что вы как пользователь там лэмки или чего угодно можете попросить вероятности или нероночки или ещё чего-нибудь, но внутри всех моделей почти, ну, я бы сказал просто всех,

29:12

Speaker A

наверное, да, а-а, на самом деле имеют место логарифмы вероятностей. И мы с вами скоро ещё введём интересные штуки.

29:21

Speaker A

А, но это будет всё-таки на следующем занятии. А значит дальше, а если у нас какую-то функцию мы применили, то есть у неё есть классные свойства, но нам нужно ещё посмотреть на задачу оптимизации, потому что если сделать, если у нас была

29:36

Speaker A

исходная задача, то как бы если мы применим функцию, то может быть сдвинется как-то минимум или максимум.

29:42

Speaker A

Но нет, к счастью, логарифм выпуклая функция, всюду выпуклая, все дела. Поэтому именно вот смотрите, технически, ну, likely, то есть вот, например, правдоподобие, оно может быть, ну, давайте в каком-то воображаемом случае там будет равно 0,32, например, да? В этот же момент логарифм будет равен, ну,

30:04

Speaker A

чему? Примерно там давайте минус там, я не знаю, 3,7. Ну, я сейчас придумал число из головы.

30:12

Speaker A

Ну, примерно вот что-то в таком духе, да? То есть технически это два разных числа нужно иметь в виду, но при этом заметим, что тетта, которая обеспечивает максимум в одном и в другом случае, она строго одинаковая. Поэтому мы можем так

30:25

Speaker A

сделать. Это тоже немаловажный момент, потому что как бы что попало делать задачей оптимизации нельзя. Она может обидеться и уйти. Мы такого, конечно же, не хотим. Хорошо. А значит, поняли, что у нас ничего не случилось с этого, только плюсы мы получили от логарифма.

30:42

Speaker A

Отлично. Поехали дальше. Собственно, в чём состоит метод максимального праподобия, если его выражать формулой? Ну, по определению, это будет вот так.

30:51

Speaker A

То есть, смотрите, arc мак по тетта, то есть мы изменяем тет, ищем, а, аргумент, то есть саму тет, которая доставит максимум вот этой в этом правдоподобию при условии вот этой выборки.

31:03

Speaker A

Это называется тета с крышкой. В статистике так принято обозначать. Крышка - это у нас оценка. Звёздочка - это истинное значение, которое, ну, на самом деле, мы не знаем, но оно где-то там есть. Это в целом нотация в статистике принятая. Мы её будем

31:18

Speaker A

стараться придерживаться везде. И дальше, что мы можем сделать? Можем подставить наш трюк с логарифмами. То есть вот всё, что мы сейчас выше обсуждали, давайте подставим вот в эту формулу сверху, то есть вот в эту букву L. Мы для начала подставим p иксов

31:33

Speaker A

больших, потом преобразуем его в маленькие иксы и в сумму, потом применим логарифм, и у нас получится вот такая вот штука. Вот это вот главная формула.

31:42

Speaker A

Вот запоминать её стоит вот в таком именно виде. В рамочке объедена именно главная формула. И называется эта формула log likelihood. То есть то, что вот здесь под а символом а минимизации, а оно называется negative log likelhood или nll. Это можно запомнить, и это нам

32:05

Speaker A

очень много раз ещё пригодится. Мы будем всегда использовать его. А вот и это будет у нас функция потерь. То есть на самом деле мы всегда почти будем использовать вот эту функцию потерь.

32:18

Speaker A

Вот. Хм. Опять же, кто видел такую формулу где-то в курсе статистики. Ага, хорошо. А это то, что нам понадобится.

32:31

Speaker A

Значит, если у нас есть, а, переменные фечи, таргеты и так далее, вот эта вот вероятность заменяется на плотность вероятности. Если смешанные, то нам производный.

32:43

Speaker A

А, ну это так. Э, значит, для особенно замороченных. А что ещё важно сказать? Смотрите, если мы, а, вспомним вот этот вот график, который я уже рисовал с тетами, то есть есть какое-то пространство параметров, там тета1, те и так далее, и внутри него вот

33:05

Speaker A

эта функция правдоподобия генерирует какую-то там а-а какие-то там, значит, а, поверхности. И в этом смысле всё, что мы делаем с помощью момента максимального продоподобия, это на самом деле мы ищем вот это а мода.

33:28

Speaker A

Кто помнит, что такое мода в статистике? Ага, хорошо. И что это? Да, самое часто встречаемое значение либо значение с максимальной плотностью вероятности.

33:44

Speaker A

Вот. А когда мы будем работать с разными моделями, иногда эта мода может совпасть с медианой, может совпасть со средним в случае хороших распределений, но она не обязана такой быть. Вот здесь мы строго ищем именно моду. Почему моду? Ну,

34:00

Speaker A

потому что, смотрите, мы ищем минимум от вероятности. Это буквально определение моды. Ну, прямо буквальное определение моды. То есть, что такое мода - это точка, где вероятность максимальна. Что мы ищем? точку с максимальной вероятностью. Вот так. Аа и это как раз

34:17

Speaker A

то место, где А помните, мы в прошлый раз говорили про а частотную статистику и байсовскую.

34:25

Speaker A

Помните такой момент? Кто помнит? Ага. Хорошо. Вот. И смотрите, вот когда мы ищем моду, а вот это подход а частотный. То есть мы ищем самое часто встречаемое событие. То есть самая часто встречающаяся, самый часто встречающийся набор параметров, если у нас выборка вот

34:50

Speaker A

такая. В этом смысле байсовский подход, он звучал бы так. А давайте мы, давайте я, наверное, даже сейчас другим цветом это сделаю.

35:04

Speaker A

А байсовский подход звучал бы так. Давайте мы смоделируем вот всю эту поверхность, вообще всю вот вот все эти кружочки, чтобы у нас была какая-то функция. Ну давайте я опять обозначу волшебной буквой фи, а от тта1, тета 2, тта3 и так

35:25

Speaker A

далее. Ну сколько у нас там их есть, чтобы вот это была прямо вся функция. То есть давайте всю функцию фи замоделируем целиком. Не только моду, а всю функцию целиком. И вот в чём польза байсовской статистики, в чём её именно суперсила? В

35:41

Speaker A

том, что если у нас есть одна моделька, которая решает одну задачу, и другая моделька, которая решает другую задачу, то мы можем тривиально получить результат работы одной применительно к другой, потому что это полное распределение, мы их просто умножим и

35:57

Speaker A

получим задачку. А что здесь можно привести? Давайте, например, прикинем такую задачу, как суммаризация текста.

36:05

Speaker A

Но суммаризация текста не простая, а из голоса. То есть вот я наговариваю микрофон, и я хочу, чтобы у меня вычищенный, красивый, со всеми опечатками поправленными оговорками был в финале текст. Как мы это сделаем?

36:20

Speaker A

Мы возьмём одну модельку, которая переводит с пичтуте текст. Получится голый текст, то есть ровно те слова, которые я наговорил, и потом над ним произойдёт редактура. Это вторая модель.

36:29

Speaker A

Ну вот можно так задачу эту решать, да? И если у нас есть и тут полное распределение, вот это вот фи, которое я нарисовал волшебное, и во втором случае тоже мы их просто умножаем и всё, и сразу получаем бесплатный ответ. Другой

36:40

Speaker A

вопрос, что каждый из этих фистроит настолько дорого, что этого никто не делает. Ну, для практически важных больших задач. А, но вот, к сожалению, с модами так не произойдёт. Если здесь мода одна, а здесь другая, то они как бы

36:54

Speaker A

в разных точках расположены. И мода произведения двух функций, она не будет как бы посередине или, ну, как бы нет никакого метода рассчитать моду произведение двух произвольных вот таких вот распределений.

37:08

Speaker A

А вот эта разница между частотной статистикой и басоской, по крайней мере, та разница, которая нам с вами нужна будет в курсе. Понятно, что здесь происходит и в чём основная разница?

37:20

Speaker A

Хорошо. Ну, мы байкские модели, конечно, не будем рассматривать серьёзно, а вот, но знать это, тем не менее полезно. И, вообще-то говоря, э если иметь в дубайскую статистику, то для неё аа нужен отдельный курс. Если что, у Ветрова а есть курс по просто байевской

37:40

Speaker A

статистике, а точнее баевское машинное обучение и потом второй курс - это нейробаясовское обучение. Вот. То есть целый год люди говорят только про байсную статистику в машинном обучении.

37:52

Speaker A

И это очень интересный курс, но он такой довольно замороченный, так что мы его здесь не читаем.

37:58

Speaker A

И в этом смысле, э, ребята из подхода байсовского постоянно там смеются над частотниками, что типа вот, ээ, значит, частотный подход - это байс для бедных.

38:10

Speaker A

Это так часто ещё называют из-за того, что оценивают только одну точку, а не всё распределение. А, но нужно понимать, то есть мы, что не одним только MLE мы живём. То есть метод максимального праподобия далеко не единственный способ оценить параметры. Давайте вот ещё раз

38:28

Speaker A

здесь подсветим, что самое главное, что делает нам метод максимального правдоподобия - это он даёт методологию конкретную, конкретный набор шагов. как взять датасет и получить набор параметров, то есть оценку параметров для этого датасета, для какой-то модели.

38:49

Speaker A

При этом давайте ещё запомним проговорим это явно, что на самом деле моделью является вот это. То есть вот это является в этой точке моделью, то есть вот в этой всей формуле модель живёт вот здесь. Модель - это то, как

39:05

Speaker A

связаны связан датасет и вероятности. Вот эта модель, например, линейная, то есть датасет и вероятности связаны линейно. Или наивный баяс. Датасет и вероятности связаны так, что каждый признак независимо контрибютит в результат. Можно другие ещё всякие формулировки привести, и мы их,

39:27

Speaker A

собственно, будем приводить во множестве внутри курса. А разных по природе способа связать данные и вероятности.

39:37

Speaker A

Вот это главная задача модели. Аа, хорошо. И дальше вот методология, как из модели и датасета получить параметры. Их, на самом деле, довольно много. Вот здесь только некоторые перечислены. Ну, первое - это MLE, кстати, надо будет его отсюда убрать.

39:59

Speaker A

Это же не только MLE. Второе - это BS. Вот я сейчас про него вам сказал. Это вообще всё замоделировать полностью, а, от и до. Но это очень дорого. Есть другие ещё, например, а, метод моментов, метод крамераоo, например, фильтр

40:13

Speaker A

частиц, а, MCMC и прочее, и прочее. То есть методов ценить параметры много, но в этом курсе мы почти всегда будем использовать метод максимального праподобия, потому что он самый простой, самый разработанный, а, и он работает, ну, он работает в наибольшем количестве

40:28

Speaker A

случаев, причём довольно равномерно. Ну, то есть примерно везде достаточно одинаково. А, но для каких-то других случаев применяются и другие методы, и они довольно прикольные. То есть каждый из этих методов он довольно-таки милый.

40:41

Speaker A

Например, алгоритм и так далее, и так далее. Про это тоже можно отдельный курс прочитать. М, что можно посмотреть про MLE? Так, здесь надо отключить. А, ну какие-то ссылочки, какие-то ссылочки полезные, вкусные, очень хорошие объяснения. Кто такие эти ваши MLE?

41:00

Speaker A

А, хорошо. Хорошо. Теперь давайте посмотрим на модель линейной регрессии через эту призму, именно через эту оптику. Значит, в прошлый раз вот мы говорили про всякие определения, датасеты и всё, что нужно с этим делать.

41:28

Speaker A

Сейчас ввели максимальное правдоподобие. А сейчас давайте поговорим на этом занятии про, во-первых, задачу регрессии. В принципе, на английском она называется regression model. То есть я буду говорить всегда задача регрессии, но формально вот на английском языке она называется regression model. Сейчас

41:47

Speaker A

обсудим, почему так. А поговорим про линейные модели. И дальше мы применим наши сегодняшние знания для того, чтобы а какие-то правильные выводы сделать. Но начнём с модели регрессии.

42:01

Speaker A

Значит, почему а нам нужна какая-то модель? А это такой очень важный, фундаментальный вопрос. А смотрите, что такое вообще регрессия? А, ну это то, когда мы мы предсказываем какое-то непрерывное число, правильно? То есть что-то там такое во флотах, действительное число какое-то. Ну, это

42:22

Speaker A

такое бытовое понимание, оно в целом верно. А формальное определение будет звучать так, что мы предполагаем, что у нас таргет соотносится с моделью, а так что это модель плюс какой-то шум.

42:39

Speaker A

А и вот это в этом смысле это модель. А почему так? Мы говорим, иными словами, можно переформулировать, что мат ожидания таргета, а при условии известных признаков в точности равно вот этой детерминированной функции f. То есть f здесь детерминированная функция.

42:57

Speaker A

И что мы этим утверждаем? Мы утверждаем, что, в принципе, существует такое разделение, что вот здесь есть аа матожидание, а вот здесь вот сосредоточена вся дисперсия, и они связаны вот так плюсиком. На самом деле это не очевидный факт. Он ни из

43:20

Speaker A

чего абсолютно не следует. Он следует только из того, что мы пришли и так сказали. То есть никто никаких гарантий не даёт, потому что в реальной жизни зависимость может быть любая. Вот смотрите, вот есть детерминированная часть какая-то F вот от X, то есть она

43:34

Speaker A

строго детермированная. И, ну, мы знаем просто в жизни, что есть какой-то шум. Кто-то где-то что-то не записал, какое-нибудь там реликтовое излучение, которое мы не учли, там ещё сотни тысяч факторов, про которые мы ничего не знаем. То есть ошибки всегда будут. Это,

43:47

Speaker A

кстати, нулевой пункт, который утверждает модель регрессии. И она могла бы зависеть вот в такой пропорции, например. Или -э другой вариант, а, например, вот такое соотношение могло быть или какое угодно ещё, или каждый раз разное. О'кей. Но мы говорим, вот мы

44:07

Speaker A

пришли и говорим, а мы хотим, чтобы мотожидание и дисперсия делились э именно адитивно. И на самом деле в большинстве реальных задач, если мы строго проверим это свойство, оно не будет выполняться так-то, потому что а дисперсия будет влиять на то, какой у

44:27

Speaker A

нас результат. Но мы этим, как всегда, пренебрегаем. То есть, а, в этом смысле это модель. То есть мы думаем о мире, что он устроен так, равно как мы в прошлый раз думали о мире, говоря об аевском наидном классификаторе, что он

44:40

Speaker A

устроен так, что каждый признак, независимо от других влияет на таргет. То есть это такое же наше предположение.

44:48

Speaker A

Но, к счастью, оказывается из практики, что вот это именно предположение, которое мы сейчас видим на слайде, оно всё-таки довольно разумное и позволяет решать, ну, чрезвычайно широкий класс задач. А, и мы с вами, кстати, ещё увидим на будущих занятиях моменты, где

45:05

Speaker A

вот эта штука не совсем выполняется. А, ну давайте, наверное, приведём сразу этот пример, чтобы не откладывать долгий ящик, чтобы оно здесь осталось связанным. Смотрите, а, предположим, у нас есть, а, график точнее, не график, а диаграмма зависимости, аа, не

45:27

Speaker A

зависимости, а просто распределение, а, скажем, цен квартир. Вот у нас есть цена, а, на квартиру и есть количество таких квартир, которые сейчас выставлены.

45:42

Speaker A

А как вы думаете, какое-то распределение? Ну, качественно, что там примерно будет в э видно.

45:57

Speaker A

Ну вот у нас есть, например, квартиры в Москве, да, которые когда-либо продавались на каком-нибудь там весёлом ресурсе.

46:04

Speaker A

А вот примерно как качественно выглядит вот такое распределение нормальное. А-а, нормальное, смотрите, у него, ну, хорошее предположение, чтобы начать. Смотрите, нормальное дело в следующем, оно у нас симметричное, а у нас минимальное значение есть в виде ноля. Ну, меньше ноля оно стоить не не

46:26

Speaker A

может, скорее всего. Кроме того, мы знаем, что у нас есть какие-нибудь там, знаете, апартаменты трёхэтажные в Москва Сити, ну, вы знаете, да, которые стоят как бы, я не знаю, там миллион рублей.

46:37

Speaker A

Ой, миллион по вообще миллиард. Угу. Москве не в Москве точно ненормально. Это 100%. Москва она не только не Россия, она ещё ненормальная. Это это всё в порядке, да?

46:57

Speaker A

Смотрите, будет что-то, ну вот такое, я бы сказал. Вот. Чем это описывать? Лог нормальным ли или экспоненциальным? Мне кажется, я бы экспоненциальным описал. Ну, это как бы качественно на наш результат никак не влияет. То есть, смотрите, распределение, видите, какое-то кривое.

47:16

Speaker A

И в этом смысле, смотрите, вот если мы ошибёмся, вот у нас есть вот это си, которая ошибка любой природы. А вопрос, вот если мы здесь ошибёмся плюс-минус на 100.000 руб., например, и вот здесь на плюс-минус 100.000 руб., наверное, это

47:34

Speaker A

будет по-разному влиять на результат, правильно? По оси X нуж. По оси X - это просто цена. А по оси Y сколько таких квартир есть на продаже?

47:45

Speaker A

Ну, в текущий конкретный момент времени. Вот. Ну или там за месяц, например, накопим. А вот и здесь мы можем заметить, что ошибка разная в разных точках таргета. И в этом смысле, на самом деле, если мы формально применим вот эту формулу, она вообще-то не будет

48:02

Speaker A

работать, потому что функция f, она будет зависима от ელ. То есть они независимы, но мы тем не менее будем применять модели регрессии. А как, кстати, починить эту ситуацию? Вот конкретно эту ситуацию можно починить. К сожалению, не все ситуации можно починить, но вот эту

48:20

Speaker A

можно. Ещё раз в чём проблема? В том, что, смотрите, вот у нас есть ошибка.

48:29

Speaker A

И вот мы говорим, что ошибка полностью отделена от мотожидания. Но с другой стороны, у нас вот здесь ошибка, например, в 100.000 и тут ошибка в 100.000. Это они будут поразному воздействовать на результат.

48:45

Speaker A

Я бы сказал, что, ну, они связаны. Кто от кого зависит, это вопрос очень сложный, но они скоррелированы как минимум. Давайте скажем консервативно, они скоррелированы. Вот. То есть если мы будем знать си, мы можем сказать, что f, скорее всего, вот примерно вероятнее

49:01

Speaker A

всего вот тут. Если мы зна будем знать f, мы скажем, что, а, вот здесь си, скорее всего, другое. Вот. И так далее.

49:08

Speaker A

Но нас сейчас интересует в основном влияние си на f, но в принципе это не столь важно. Как вот это починить?

49:16

Speaker A

Можно ли как-то его починить? А вы имеете в виду пофиксить формулу регрессии? Я предлагаю так не делать, потому что если у нас начнётся много постановок задач, а это постановка задач в этом смысле, то мы заморочимся их решать.

49:35

Speaker A

Желательно иметь одну задачу регрессии, одну задачу классификации. Там потом мы поговорим об одной задаче ранжирования, и вот из этих трёх компонент мы потом сложим вообще весь мир. Вот. То есть если много задач, там начинается много функций потерь. В общем, прямо очень

49:48

Speaker A

заморочно. Давайте попробуем как-то мутировать таргет. Можем ли мы что-то сделать с игреком, чтобы было хорошо? В принципе, вот уже высказывали предположения насчёт распределения. Может, что-то с ним сделать?

50:06

Speaker A

Мм, не что-нибудь поизячнее. Не, ну типа просто прийти, открутить кусок датасета, выкинуть. Это такое типа это причём это не выбросы. То есть справа, смотрите, справа это не выбросы, это реальные значения, они настоящие. То есть их нельзя выкидывать, потому что они не то

50:22

Speaker A

есть это не ошибка, это, ну, реальный мир так устроен, да? Правильно. А как? Ну, говорили идею вот про распределение.

50:37

Speaker A

Ну, вы же говорили, что уже log нормальное распределение. Куда ещё? А что можно сделать ещё?

50:49

Speaker A

Ну, в данном случае нет, стандард скелер не подойдёт, потому что он нам всего лишь средняя, да, тут предлагают тоже задачу регрессии пофиксить. Давайте не будем фиксить задачу регрессии. Если у нас будет две ошибки 1 и2, ой, мы прямо

51:03

Speaker A

очень сильно заморочимся. То есть мы прям я боюсь, что у нас не хватит сил потом выводить какие-либо формулы.

51:14

Speaker A

Смотрите, есть у нас log нормальное распределение, как получить нормальное, да, сдела примить обратную операцию в данном случае экспоненту.

51:23

Speaker A

Как это решит нормализация? Смотрите, ес если мы вот это моделируем log нормальным, ну я сейчас там более А ну на самом деле, да, короче, вот вот это нужно есть такое преобразование бокса кокса. Кто-нибудь слышал про такое? во временных рядах используется.

51:43

Speaker A

Ну, не суть. А вот, короче говоря, можно вот от этой шляпы, а если log нормально взять экспонентую, тогда у нас распределение ну собственно станет нормальным.

51:56

Speaker A

А для него, для нормального распределения, вот эта формула работает, ну, прямо очень хорошо, прямо супер хорошо. Ну, наверное, ничего такого хорошего нет, как нормальное распределение, чтобы эта формула вдруг стала работать.

52:08

Speaker A

Чёмлось предыдущем примере, что говорили. Ну, потому что, смотрите, если мы вот возьмём E в степени Y и E в степени F отx +, ну, это как бы совершенно другая формула.

52:20

Speaker A

Я понимаю, в плане на графике показывали, что в разных точках как-то. Ну, так после того, как мы применим преобразование, у нас преобразуется всё.

52:32

Speaker A

Сейчас Y, да, этот, да. Короче говоря, нам вот это распределение надо, то есть вот смысл какой этой операции, это распределение надо как-то выпрямить в какое-то красивое распределение. Красивом, самое красивое - это нормально. Уже красивое ничего не придумаешь. Вот нам это даже доказали с

52:53

Speaker A

помощью там ЦПТ, ЗБЧ и прочих. Вот хорошо. И ээ что нам в этом вся вся эта история нам говорит? Что прежде чем решать задачу, надо понять, а вот вы говорите там: "А давайте решать нейросетями". Перед этим нужно подумать о формулировке задачи.

53:14

Speaker A

Какую вы задачу решаете? То есть задачу машинного обучения. Помните, мы раньше говорили про компоненты, три а источника и три составные части машинного обучения. Давайте так назовём.

53:26

Speaker A

А помните с прошлого раза? Ну и постановка задачи, да? То есть вот задача она, ну на английском будет problem, а модель и данные, это три вот наших кита. О'кей? Прежде чем а переходить к модели, всегда нужно озаботиться постановкой задачи. Какую

53:52

Speaker A

задачу я здесь решаю? То есть какую формализацию я использую. И на самом деле на практике особенно ответ именно на этот вопрос, он куда больше влияет на ваш финальный результат, чем то, какую модель вы используете. Потому что модель вы будете использовать типа хорошую,

54:09

Speaker A

популярную в 90 там 5% случая. А вот какую постановку задачу выберете, от этого будет зависеть, какого рода популярную хорошую модель вы будете использовать и как ваши ошибки, ошибки в вашем реальном мире отобразятся в ваш таргет. Вот это, на самом деле, самый

54:29

Speaker A

главный вопрос, который на практике решают уже люди, занимаясь машиным обучениям. И можно всегда обо обо всех задачах думать с этих позиций. В целом мы в курсе, вот в этом будем большое внимание уделять именно, так скажем, способу мышления и каким-то ключевым

54:47

Speaker A

точкам, на которые нужно смотреть при разработке любой практической задачи. На самом деле этих точек совсем немного. Я бы сказал, где-то штук пять, наверное, может быть, семь. Вот. И под них дальше вот в зависимости от того, как вы на эти

55:03

Speaker A

вопросы ответите, будут почти полностью предсказываться ваше финальное решение. со всеми моделями и так далее, потому что, а, очень много где рассказывают так, что типа так, ну, ребята, смотрите, линейная модель - это, короче, когда мы вес умножаем на значит

55:19

Speaker A

значение признака. Побежали дальше. Значит, дерево - это когда мы там порог делаем, там нейронка - это когда ещё всякие там преобразования. Это всё хорошо, но просто а этим не исчерпывается реальная практика. То есть люди приходят и просто такие: "Ага, что

55:33

Speaker A

я знаю, нейронка, всё делаем, не получилось, а что делать?" И вот здесь уже наступает сложный момент. То есть технически применить модель - это не супер сложно, а вот понять, что произошло и что я хочу от этого, вот это

55:46

Speaker A

как будто более серьёзный такой вопрос. На него мы будем стараться отвечать в течение всего курса. Хорошо, понятно.

55:55

Speaker A

Есть ли вопросы про вот эту историю с постановкой задачи регрессии или по-английски это будет regression model?

56:04

Speaker A

Опять же скажу слово модель здесь именно потому, что мы вносим свои предположения в реальный мир, которые объясняются тем, что мы так хотим.

56:16

Speaker A

В целом есть некая наука про то, как вот не не этой формулой руководствоваться, но типа вы туда не хотите ходить, честно.

56:26

Speaker A

Угу. Ну да, задача, ну да, подобрать какое-то F. И причём здесь мы не специфицируем, какое вообще. Нам всё равно. Это может быть любая абсолютно модель. Помните, мы в прошлый раз говорили, что моделью может быть эксперт, живой человек. То

56:42

Speaker A

есть живой человек может решать задачу машинного обучения. Вполне себе ничего сложного, ничего ужасного в этом нету.

56:50

Speaker A

Вот. Хорошо. А там есть кое-какие предположения, в которых всё это выполняется. Ну, эти предположения сводятся там ко всякому IID, хорошим распределениям и так далее.

57:06

Speaker A

Ну, я в них супер сильно погружаться не буду. Аа, наверное, самое главное, что вот выборка должна быть достаточно большой для всех этих историй, но, в принципе, это характерно для частотной статистики.

57:21

Speaker A

Частотная статистика, в принципе, работает в случае, когда мы имеем такую штуку. вот всякие вот эти вариансы, про которые я вам сейчас говорил, и так далее. Вот, вот здесь всё это выписано формально. Кому интересно, почитать. Аа, хорошо. Теперь давайте поговорим про

57:36

Speaker A

линейные модели. Вот это уже класс моделей. То есть смотрите, обратите внимание, да, как мы действуем. Мы сперва сказали про постановку задачи. Мы её сформулировали достаточно формально и потом переходим к моделям. Это вот важно. Мы всегда будем такую, а,

57:49

Speaker A

последовательность держать в голове. И обратим внимание, что люди часто путают, а, говоря, что у нас есть линейная регрессия. Вот линейную регрессию часто путают с моделью регрессии. Вот линейная регрессия - это когда f(x) линейна, а модель регрессии - это когда просто y

58:07

Speaker A

зависит от x + y. Пожалуйста, не перепутайте. Значит, что такое линейные функции? Ну, по определению, вот два свойства, если выполняются, значит, всё хорошо. У нас есть какое-то там векторное поле, а мы на нём умеем, ну, на самом деле, линейное пространство

58:22

Speaker A

просто вот здесь. А, и у нас на нём есть функция. И вот она линейная, если два свойства выполняются. А в нашем случае это выглядит примерно так. А, да, минутка терминологии. Вот Y, мы его будем называть таргетом, мы его будем

58:39

Speaker A

называть лейблами иногда, когда это будет классификация потом. А также это называется зависимой переменной, значит, исходом или респонсом, ответом, сигналом, что-нибудь типа такого. У иксов вот такие названия бывают. Вот.

58:54

Speaker A

Они в зависимо дело в следующем. А статистику переоткрывали несколько раз в каждых сферах, в разных. Кто-то переоткрывал статистику в биологии, кто-то переоткрывал статистику в экономике. Вот экономисты самые большие любители переоткрыть статистику. У них вообще своя статистика, которая, ну, к

59:10

Speaker A

формальной математической статистике иногда имеет странное отношение, там свои полностью термины. А, ну, доказывать вообще это не отсюда. Вот поэтому, если встретитесь где-то с другой терминологией, это ок, а просто можно её отмапить, можно просто спросить типа: "А что значит эта штука в таком

59:28

Speaker A

контексте?" И вам ответят. мы будем следовать, э, формализму, в общем-то, более-менее устоявшейся математической статистики, которая там общая, типа там от Фишера, от Баеса и там от Калмогорова и так далее. Вот примерно этой школы.

59:44

Speaker A

Аа лейные модели, они на удивление крутые. Аа они умеют решать самые разные задачи. И это опять возвращаясь к трём китам, на которых мы стоим. То есть линейная модель умеет решать почти любые задачи. пример регрессию, классификацию.

59:59

Speaker A

Мы с вами очень детально будем на это смотреть. А разные задачи без учителя, типа снижения, типа снижение размерности. И также линейная модель является кирпичиком в других моделях для построения каких-то промежуточных результатов. И это, на самом деле, если честно, самый глав самое главное её

60:18

Speaker A

свойство, что она служит фундаментом для, ну, настолько большого количества моделей, что даже перечислить я затруднюсь. А, именно из-за этого нам нужно знать довольно детально, как работает линейная модель. И в следующий раз, я думаю, мы придём с вами к тому,

60:35

Speaker A

чтобы, а-а, посмотреть, кто такие даже генерализованные линейные модели. Ну, это легко мы к этому достаточно придём.

60:43

Speaker A

Аа хорошо. И на самом деле главная причина такого такой любви к линейным моделям, она лежит в то, в том, что мы умеем их считать на компьютере очень эффективно.

60:56

Speaker A

настоль настолько же эффективно мы никакую другую модель считать не умеем. Вот. А и всё, что мы на изобретаем, придётся когда-нибудь вычислять. И вот хорошо бы, чтобы оно было вычислимо легко. Про это мы тоже поговорим отдельно про то, как устроено железо и

61:12

Speaker A

почему а железо в ряде моментов довольно сильно воздействует на те методы, которые мы используем.

61:19

Speaker A

Аа, о'кей. Линейная регрессия. Собственно говоря, заметим другую формулировку. была модель регрессии, теперь линейная регрессия. А отличается всего лишь тем, что f принимает конкретную форму вот такую. А здесь мы с вами сделаем а один трюк а блин, когда-нибудь я это пофикшу. Вот здесь

61:40

Speaker A

должен быть X. Аа мы сделаем с вами следующий трюк. Ну, я думаю, вот эту формулу примерно все знают. Но для того, чтобы дальше сократить просто свои вычисления, в смысле просто запись в строчку, чтобы каждый раз не таскать вот это омегаль, а

61:57

Speaker A

везде вот в мельной литературе, а statistтика learning Theory, везде, вот где всё это выводят, вводят вот такое вот эфимерное измерение, где у объектов просто есть единичка, а у омеги есть параметр. Это и есть свободный член. Вот. А по

62:16

Speaker A

определению мы будем считать, что когда пишем xt омега, мы имеем в виду вот эту штуку. Это везде в теории мы так будем делать с сегодняшнего момента и навсегда. А на практике просто не забываем заводить дополнительную переменную в коде, которая является

62:31

Speaker A

басой. То есть вот вот эта штука называется смещением или аа мм бас. Есть баes, который человек, а есть ба яс, который вот переменное смещение. А что ещё важно здесь заметить? А, пожалуйста, привыкайте писать вот так. Сперва выборка и только

62:52

Speaker A

потом параметры. Зачем это нужно? Для того, чтобы вы один раз запомнили правильно и потом везде это использовали без за изменений. Если их поменять местами, вот здесь это возможно пока. То есть ряд людей пишут там что-то типа такого, но, к сожалению, когда мы с вами

63:08

Speaker A

придём в неросетки какие-нибудь и в другие всякие модельки, окажется, что вот такая переменна мест слагаемых, она уже не прокатит. И поэтому проще запомнить один раз правильно, чем потом переучиваться и сомневаться, что кого.

63:22

Speaker A

Вот. Ну, это такой, э, а, совет для того, чтобы не ошибаться. Хорошо. Это вот линейная модель всего лишь когда функция f имеет определённую структуру.

63:34

Speaker A

А давайте теперь полностью запишем постановки постановку задачи линейной регрессии. Значит, у нас есть выборка. А выборка у нас стандартная, которую мы с вами писали. А если в матричной форме мы с вами договаривались использовать R N P, N - количество объектов, P - это

63:49

Speaker A

количество признаков, Y у нас тоже N ответов. И что такое, собственно, линейная регрессия? Но это всего лишь вот такая штука. У нас есть f параметризованная омегой от x и она равна сюрприз вот вот такой штуки, да? А и давайте заметим здесь размеры. У нас

64:08

Speaker A

есть n, здесь у нас есть p, а омега у нас p на единицу. Ну и у нас выходит необходимый нам размер. В принципе, уже здесь можно видеть, зачем xt омега лучше использовать, чем что-то ещё. Для того, чтобы всегда таскать первым измерением

64:23

Speaker A

количество объектов. Так и в нампае будет, так во всей теории будет. Поэтому лучше один раз запомнить и уже не возвращаться к этому.

64:30

Speaker A

Собственно, сама задача регрессии будет вот в этой точке возникать. А и м мы хотим какое-то предсказание построить, которое будет наиболее близко к игреку.

64:42

Speaker A

Вот. Мм такова наша задача. Хорошо. Мм, здесь уже использован трюк вот с дополнительным измерением, если что. А, хорошо, с этим вроде бы разобрались.

64:58

Speaker A

И дальше, дальше нам нужно, а, каким-то образом, а, прикинуть эту омегу. То есть, смотрите, в силу того, что модель параметрическая, то мы можем менять омегу. Это, в принципе, ну, более-менее всё, вся наша область возможностей на текущий момент. Мы там потом ещё всяких

65:16

Speaker A

добавок накинем, но пока вот так. И как мы должны, а, найти вот эту хорошую омегу? Что такое хорошая омега? Как бы вы это определили?

65:32

Speaker A

Ну вот у нас типа мы омегу можем любую поставить, какую захотим. А, но мы, наверное, хотим выбрать хорошую омегу.

65:38

Speaker A

Вот что такое хорошая омега? Как бы мы это определили? Да, чтобы игреки действительно были как, то есть игреки, предсказанные с крышкой были к истинным игрекам наиболее близко.

65:53

Speaker A

Это верно, да? А хорошо, как из этого определения конкретную омегу найти? Ну, типа омега-1 равно там 1,3, омега-2 = там 7,8 и так далее. Вот мне нужен вектор омега один конкретный, самый лучший.

66:11

Speaker A

Как это сделать? Какой алгоритм? Какой подход вообще к этому? Слева слева стильно. Что слева найти?

66:21

Speaker A

Ну просто слева, да, мы получим как тически, типа x - пер. Мм, ну нет, так прямо не выйдет.

66:36

Speaker A

Смотрите, тогда у вас должна выборка идеально соответствовать линейной зависимости. Ну, короче, я я понял идею как бы решения, что типа давайте алгебраически это сделаем. Но имейте в виду, что смотрите, наша цель всё-таки вот в этом э приближённом равенстве, это неточное

66:53

Speaker A

равенство, мы не можем, то есть нужно вот эту штуку как-то уточнить. То есть как найти омегу методологически? Я сейчас не имею в виду конкретные вот шаги 1 2 3. А вот какой вообще подход в принципе к этому?

67:09

Speaker A

[фыркает] Хорошо. А что такое омега? Да. Параметр. Параметр для модели линейной регрессии. Вот помни. Давай теперь вспоминать то, с чего мы начали сегодняшний разговор. С чего мы начали сегодняшний разговор?

67:31

Speaker A

Да. И мы там сказали, что модель - это буковка П, и в ней живут какие-то параметры. Правильно?

67:39

Speaker A

Так вот, теперь мы пришли к ситуации, где у нас есть конкретные параметры. Тогда мы говорили про абстрактные параметры тетта, то есть любые вообще для любой модели. А здесь у нас конкретный параметр омега.

67:51

Speaker A

И что мы будем делать? Нене, вы же говорите какие-то формулы пока это. Ну, типа, чтобы формулы сделать, надо, а, то есть это, знаете, из серии типа как, я не знаю, мм, мм, не знаю, как как получить, я не

68:16

Speaker A

знаю, там, а, тёплую воду. Ну, вы говорите, открыть кран, как бы, и наполнить типа любой сосуд, который вам интересен. Я говорю: "Хорошо, а как вот типа попадает к вам эта вода? Почему она вообще там оказалась? Вот в таком духе."

68:30

Speaker A

Хорошо, мы сказали метод максимального праподобия. Как мы его здесь можем применить? Вообще, в принципе, когда мы будем с вами видеть в любом аа месте какие-то параметры, почти всегда ответ будет метод максимального праподобия. Это можно просто запомнить, но идеологически это

68:51

Speaker A

так. Собственно, метод максимального праподобия - это способ, который позволяет нам, имея выборку, то есть датасет и модель, осуществить простой алгоритм. Вот. И MLE - это и есть тот самый алгоритм, чтобы получить оптимальный вектор параметров. Вот это важно запомнить. А что нам нужно в

69:12

Speaker A

методе максимального правдоподобия? Сумри, да? сумма логари, ну, сумму мы помним, как делать, логарифмы помним, как делать. Нужны какие-то вероятности, правильно? То есть наша модель должна выдавать какие-то вероятности. Ну, какие вероятности она может выдавать? А для простого случая можно предположить, вот

69:36

Speaker A

мы с вами говорили, что y = f(x) +. Исходя из этого, вот смотрите, у нас f - это детерминированная величина, то есть это не случайная величина, а она случайная, правильно?

69:58

Speaker A

На самом деле, таким образом, y у нас тоже случайная величина. Давайте это заметим. Ну, с точки зрения теории вероятности статистики. И что нам нужно сделать? А мы говорим, смотрите, у нас давайте скажем, что ошибки пускай будут будут нормальными.

70:19

Speaker A

На самом деле то, что мы сейчас здесь нарисуем, можно вывести не только для случая нормальных ошибок, а гораздо для более общего случая. Просто тогда доказательство превратится из трёх строчек в три страницы. Вот. Но результат будет тот же. Поэтому я докажу

70:33

Speaker A

это в простом случае. А, будем иметь в виду, что это может сделать и в сложном.

70:38

Speaker A

Ссылки там будут с доказательствами. Кому надо, посмотрите. Кто на десятку хочет, там, пожалуйста, поглядите. Там ничего сложного нет. А вот что мы сделаем. Мне выписано в человеческом виде, и я его укажу.

71:00

Speaker A

Угу. О'кей. Давайте что-нибудь типа 10 минут перерыва, получается. Давайте вернёмся в 17:05. Ну да, мы, получается, к паре идеально успеваем.

71:17

Speaker A

Смотрите, что у нас тут происходит. Нам нужно, а, функцию правдоподобия здесь записать. А как она будет выглядеть? Мы с вами говорили, что это сумма логарифмов.

71:31

Speaker A

сумма по датасету логарифмов, а вероятностей, но в данном случае плотности вероятностей конкретного объекта. А при условии, в нашем случае омеги нам нужно вот эту плотность вероятности мм каким-то образом предсказать. И как мы её предскажем? А смотрите, что у нас

71:53

Speaker A

происходит. У нас есть вот ответы. Ещё раз скажем, что мы для одного только объекта это делаем.

72:03

Speaker A

А вот у нас есть объект один ровно итае и ровно y итае. А есть правильный ответ, который давайте обозначим y со звездой.

72:15

Speaker A

И у нас есть ответ нашей модельки. Его давайте обозначим. Давайте его обозначим вообще другим цветом.

72:24

Speaker A

А давайте ответ нашей модельки обозначим Y с крышкой, как мы это обычно делали. А что здесь дальше происходит? А здесь вокруг вот этого Y со звездой живёт ещё ошибка. И мы с вами сказали, что мы эту ошибку Так, ну ладно, я суперкриво

72:45

Speaker A

рисую, но можете поверить, что это нормальное распределение. И это нормальное распределение - это и есть наше.

72:54

Speaker A

Вот, то есть есть правильный ответ, исходя, собственно говоря, из начального нашего предположения. Смотрите, что y равно там f(x) +.

73:05

Speaker A

Мы сказали, что есть мотожидание, а мотожиданием мы будем считать то, что мы реально намерили в этой в этой точке. И вокруг неё вот распределены вот эти ошибки. И наша задача, самая главная с вами - это оценить вот эту вот разбежку.

73:23

Speaker A

Причём оценить её хочется в терминах каких-то там вероятностей, но в данном случае плотности вероятности, потому что мы работаем с непрерывным распределением.

73:35

Speaker A

И для этого давайте, э, вот эту как раз а плотность вероятности мы подставим вот сюда.

73:45

Speaker A

А эта плотность вероятности будет характеризовать то, насколько правильный ответ, который есть в данных, отличается от нашего ответа, который моделька выдаёт.

73:59

Speaker A

Как оценить вот эту вот вероятность? А, ну, собственно говоря, то, насколько мы нашим предсказаниям далеко по распределению, в данном случае нормальному, убежали, прошу прощения, а, убежали от правильного ответа. И тогда мы берём вот эту вот формулу и подставляем вот сюда.

74:22

Speaker A

А что у нас тут получится? Значит, сумма логарифмов а единицы, ну, на константу она сейчас не важна нам. А значит, потом экспонента от -x, то есть единственное, что вот здесь минус ещё один, а минус, точнее, в данном случае у нас правильный ответ

74:45

Speaker A

будет y со звездой, а здесь будет y с крышкой. А делить на как раз две а сигмы в квадрате. Причём, а когда мы говорим, что у нас, а-а, ошибки одинаково распределены и независимые, то вот это нормальное распределение, оно

75:11

Speaker A

для всех будет одинаковое, поэтому у него будет сигма одинаковая. Аа и что мы сделаем? Ну, давайте вот эти скобки раскроем.

75:25

Speaker A

Мы применим вот этот логариф сюда. У нас получится минус сумма по и логарифмов. А-а, и нет, ставить логарифмы как раз уйдут.

75:37

Speaker A

Мм, давайте я это обозначу. Типа там c1 - это была c0. Мы от неё логарифм взяли по свойству логарифма. Вот. То есть вот здесь вот нужно распилить, а плюс а дальше логарифм с экспонентой раскроется, и здесь останется даже не

75:56

Speaker A

плюс, а минус. А y со звездой - y с крышкой квадра по 2 сигмыва.

76:06

Speaker A

Аа вот так нам нужно сделать. И вот эту штуку нам нужно минимизировать. Давайте вот минус вот здесь ещё а уберём и запишем так. Какая там константа а на сумму а y правильных мину y предсказанных а поделить на 2 сигма вква? Вот эту

76:35

Speaker A

штуку нам нужно минимизировать. А получается, сейчас скажу, а, да х по омеге. И в данном случае у нас y с крышкой равно x омега, которое мы сюда радостно подставляем. И вот эту задачу как раз надо решить с помощью дифференцирования.

77:04

Speaker A

Когда мы продифференцируем, константа уйдёт вовсе, сигма опять уйдёт вовсе, и у нас останется а сумма y минус вы взяте логарифм произведения и у вас получилось произведение, а не сумма равно мм равно нулю. Это если у нас будет идеальное решение. А если у нас не будет

77:29

Speaker A

идеального решения, то мы будем вот с этой задачей, собственно говоря, и работать. То есть, а, эффективно, ну, давайте вот это вот мы уберём и эффективно давайте запишем, что из этого следует.

77:42

Speaker A

А следует из этого вот что, что у нас есть MSE, которая равно, ну, за исключением всяких констант, которые нам не особо интересны. А ику, ну, давайте обозначим просто y ита мину Xт и на омегу в квадрате.

78:07

Speaker A

И вот его мы минимизируем по омеге. Мм, а произведение, да, супер. Сейчас поправим. Здесь должен быть плюс.

78:33

Speaker A

Вот. Ура, мы с вами придумали MSE. А обычный вопрос, который возникает: "А почему в регрессии мы используем MSE?" То есть типа того, что, ну, в школе сказали, ну, все его используют. Ну, и ещё там 100 объяснений. А вот

78:54

Speaker A

объяснение, э, через функцию правдоподобие, оно вот так вот выглядит. То есть мы буквально подставляем, а, наше распределение в функцию правдоподобия и просто считаем, что получится.

79:08

Speaker A

И здесь получаем MSE. Вот. Так, здесь есть всякие ссылочки интересные, чтобы на это ещё раз посмотреть. А-а, и если глобально мы на это всё посмотрим с высоты птичьего полёта, то окажется, что у нас есть какой-то эмпирический риск. И

79:37

Speaker A

вот эта вот схема, которую мы с собой дальше понесём. То есть вот этот вот подход, мы берём какую-то модель, мы берём какую-то задачу, а применяем к ним метод максимального правдоподобия и получаем вот из этой всей композиции вот функцию потерь, которую мы делем

79:54

Speaker A

применяем. Аа вот эту схему мы пронесём с собой сквозь весь курс. У нас будет какая-то сумма по объектам какой-то функции потерь. И чаще всего источником функции потерь будет являться применение модели к методу максимального правдоподобия. Ну или скорее наоборот

80:13

Speaker A

применение метода максимального правдоподобия к модели. А [фыркает] и мы захотим это минимизировать по параметрам. Это такая более-менее общая схема, в принципе, всем знакомая, но стоит понимать, что она, ну, как бы её нам не инопланетяне спустили, то есть она в таком виде не самозародилась, она

80:31

Speaker A

вполне следует из того, что мы хотим получать наибольшие вероятности. Вот. Ну, такая более-менее общая формула. Аа и часто именно с неё начинаешь, типа, ну, как решить задачу? Ну, минимизировать функцию потерь. Почему?

80:45

Speaker A

Что такое функция потерь? Вот. А вот теперь это может стать понятно. А какие типичные функции потерь сбывают? Вот MSE оптимально в случае нормальных ошибок и в случае ещё, если ошибки там айдишные, гитероскидачные и прочее, и прочее. Но можно придумать и другие функции потерь.

81:07

Speaker A

И тогда у нас получатся несколько другие решения. Как раз вот насколько эти решения а отличаются от того, что у нас получится. мы посмотрим, а, в будущие разы, значит, пу-пу-пу. Так, про это мы уже поговорили. И теперь, если мы с вами

81:27

Speaker A

придумали квадратичную функцию ошибок, давайте придумаем ещё и а к ней решение. То есть мы сказали, как найти параметры, ну, применить а метод максимального протопоя. Применили, получили MSE.

81:43

Speaker A

Теперь для MSE нужно конкретную штуку. а какую-то посчитать какое-то значение омега. Как мы это делаем? А, ну, собственно говоря, применяем, раскрываем вот здесь вот скобочки, переписываем в матричной а форме. Так поудобнее будет.

82:00

Speaker A

А известно ли, а вот это соотношение? Почему вот так? Почему вторая норма матричек а будет равна вот такому произведению?

82:16

Speaker A

Видели такой трюк в линале, в Матане? Так, кто видел, кому это известно? Ну, что-то было такое. Хорошо, вот это вот было бы желательно знать. А я ещё что хотел сказать. Мы это напишем в чате. А будет лекция по э математике для

82:39

Speaker A

машинного обучения. То есть там будет одна лекция, один семинар, просто чтобы повторить всё там типа там линальчик, тот мотанчик, который нам нужен. В частности, нам в будущем понадобится матричное дифференцирование, а нам понадобятся всякие хитрые линейные трюки, нам понадобятся разложение по

82:56

Speaker A

типу СВД. И вот это вот всё быстренько повторить за одну пару можно будет, а, по-моему, а мы с преподавателем договорились на субботу, мы об этом объявим. Туда можно будет прийти, посмотрим. Если наберутся люди, мы можем аудиторию организовать физически, но

83:13

Speaker A

можно и онлайн. А это ещё произойдёт. Значит, дальше мы это сделали, нам нужно это минимизировать. А опять же, как мы минимизируем? Ну, продифференцируем.

83:26

Speaker A

А когда мы продифференцируем по омеге, понятное дело, что мы минимизируем по омеге, поэтому по ней же будем дифференцировать. Y уходит вовсе. А-а, от, э, вот этих частей остаётся остаются константы. Там, где омега была линейна, там, где омега квадратична, остаётся

83:44

Speaker A

линейный компонент омеги. Собственно говоря, вот это всё вот матричное дифференцирование, вот здесь все вот эти вот транспонирования лятополя, вот я сейчас не буду останавливаться на том, как размеры там сочетаются, но большая просьба дома постарайтесь понять, как тут размеры соотносятся. И желательно

84:00

Speaker A

это уметь делать самому. Либо, если вы ходите на пятёрку, то вот воспроизвести вот эту вот строчку очень не хотелось бы уметь. Вот это, в принципе, не очень сложно, если вспомнить, как именно матричное дифференцирование работает.

84:14

Speaker A

Там буквально, ну, в выводе там буквально там три формулы, типа матричка на константу, так, там матричка на вектор, так, ну, в общем, вот в таких а-а в таких терминах это всё работает. И здесь получится вот такая штука.

84:30

Speaker A

Если мы её решим, вот отсюда, подставим, а, перенесём, то есть приведём подобные, перенесём в ту сторону, домножим на минус первую матрицу, получится вот такая формула. Вот эту формулу нужно знать даже на тройку, пожалуйста. А, знайте. То есть её можно просто

84:48

Speaker A

запомнить. Единственное, здесь неправильно отмечено. Здесь должна быть с крышкой. Аа вот потому что это, собственно говоря, матричная форма а решения задачи линейной регрессии. То есть конкретные веса, которые получатся. Если нам дали конкретный x, конкретный Y, мы считаем, что у нас хорошие ошибки, то решение

85:08

Speaker A

получится вот таким. А, ну и мы вот сегодня посмотрели, откуда оно такое взялось. Не на пустом месте, а исходя из того, что мы хотим наибольшую вероятность там аа наших, э, параметров получить. Хорошо.

85:23

Speaker A

Гу. Дальше следует интересное, потому что вот это вот решение, которое мы нашли, оно обладает многими интересными и полезными свойствами, а именно, называется теоремка, которая всё это подводит под этим черту теорем Гауса Марко. Аа опять же, кстати, на статистике про неё

85:46

Speaker A

говорили. У кого на статистике говорили про теорему? Ага, интересно. Хорош, хорошо. А, ну, наверное, на мой взгляд, они говорят несколько реже, чем хотелось бы, потому что, ну, типа, на этом стоит вообще вся статистика и всё машинное обучение, потому что статистика, я имею в виду

86:04

Speaker A

классическая, она точно также использует лийный модели везде вообще. То есть типа у вас там всякие ти-тесты, там такие тесты, сяки тесты, там большая часть из них - это линейные тесты, поэтому линейные модели - это суперважно. Чего [фыркает] нам эта теоремка говорит? А

86:22

Speaker A

что у нас есть модель регрессии, но мы с этим уже определились, у нас есть модель линейной регрессии, с этим мы тоже более-менее определились. Вот здесь все вот эти чудесные свойства про независимость одинаковую распределённость, лятополя, это всё, что мы выше перечисляли вот задачи

86:37

Speaker A

регрессии. И дальше какое следствие из всего этого? А если мы будем минимизировать MSE, то у нас получится так называемый, а, так называемая оценка Blue.

86:53

Speaker A

Аа Blue - это по-английски будет легко запомнить в этом смысле. А best linear unbias estimator или там estimation. А estimator в данном случае - это, собственно, модель. И здесь, в принципе, из всего вот модель, наверное, самое простое слово

87:14

Speaker A

тоже понятно, почему. Потому что у нас модель линейная. Ну, то есть это более-менее неизбежно. А unbiased - это что?

87:22

Speaker A

Да, по-русски будет несмещённое. То, что наше предсказание, а, которое мы сделали, оно стремится к истинному значению, к настоящему, если мы растим выборку. А, и дальше best - это означает вот эту часть, а именно то, что дисперсия вот этой штуки, она

87:40

Speaker A

минимально. Почему так? А дело в том, что у нас омега - это внезапно случайная величина.

87:50

Speaker A

А понятно, почему омега случайная? Вот омега, которую мы посчитали с помощью минимизирования MSE - это случайная величина всё ещё с точки зрения статистики.

88:07

Speaker A

А кому понятно, почему так? Угу. Хорошо. А кому непонятно? Хорошо, давайте это прикинем. Смотрите, мы с вами говорили, ну, предположим, э, что у нас x и y даны, да? То есть x большое, x большое - это у нас аа

88:39

Speaker A

константы. Но даже в таком случае мы с вами помним буквально из вот этой штуки вот отсюда, да, что мы помним? Что вот это детерми детерминированная часть, а вот это случайная величина.

88:56

Speaker A

То есть си - это случайная величина. И если мы вот по этой формуле, которую мы изначально приняли как данность, подставим вот сюда значение, получится f(x) + ,, то в данном случае будет случайный. Ну, а как бы значение, то

89:14

Speaker A

есть переменное, которое получено каким-то там в данном случае линейной там комбинацией случайных величин, она тоже будет случайной величиной.

89:26

Speaker A

Вот в этом смысле, на самом деле, вот эта случайность, мы её всё-таки берём из того, что у нас Y мерится как-то недетерминированно.

89:38

Speaker A

Вот то, с чего мы начали. То есть недеальность мира, она протекает в наши данные. Ну какой здесь практический пример будет? А смотрите, предположим, мы предсказываем те же самые цены квартир, с которых мы начинали сегодня.

89:52

Speaker A

И что мы сделаем? Мы соберём данные вот за от сегодняшнего дня за прошедший месяц, прошлое, и это будет одна выборка. А также мы придём завтра и соберём данные от завтрашнего дня тоже на месяц назад, то есть на 30 дней, например. И у

90:13

Speaker A

нас получится с одной стороны выборки, которые из одного распределения, потому что, ну, вряд ли за один день как-то принципиально поменялось то распределение истинное на са в самом делешнее, которое там лежит внутри. Ну, это скорее всего не так. С другой

90:29

Speaker A

стороны, выборки-то разные. И у каждой выборки вот эта вот формула, вот эта буквально вот мы возьмём выборку и по ней посчитаем иксы и игреки. А в силу того, что X y разные, у нас получится разная омега.

90:45

Speaker A

И вот в этом смысле омега - это случайная величина. Она зависит от того, какую именно мы выборку возьмём и как именно сложились кости вероятности, когда мы её сэмплили.

90:57

Speaker A

А поэтому у этой величины есть матожидание. в силу того, что она случайная, и у неё же есть дисперсия.

91:05

Speaker A

Мне омега true - это правильное значение истинное, которое мы не знаем. Ну, это тот самый вот идеальный Y, если бы мы могли его предсказывать. То есть омега она, а, ну, собственно, да, она отвечает идеальной функции f. А в силу того, что

91:34

Speaker A

у нас выборка конечная, то у нас не будет идеального идеальной оценки. Ну, давайте сделаем следующее. Смотрите, а, предположим, опять же, у нас вот есть наша задача оценки там стоимости квартир. И вот есть сегодня, да, давайте посмотрим. Если мы возьмём данные,

91:55

Speaker A

скажем, за оди день, у нас вот отсюда получится какая-то, давайте назовём это омега-1. Вот мы просто соберём эти данные за оди день, вот от сейчас до сутки назад и соберём эту выборку, там все фичи, всё посчитаем, у нас получится

92:12

Speaker A

омега-1, правильно? Если мы возьмём за 2 дня, у нас получится какая-то омега-2. И омега-2, ну, скорее всего, не будет равна омега-1.

92:20

Speaker A

И дальше и дальше мы можем делать так каждый раз. Ну, сколько угодно, ну, например, до месяца. Вот у нас будет 30 разных омег.

92:28

Speaker A

Вот фишка в том, что а если бы мы взяли типа там бесконечную выборку, а и так далее, и так далее, мы бы сошлись вот к этой омега настоящей омегат.

92:41

Speaker A

Настоящее гото себя полностью вбирает насколько может вот это мотожидание. А омегат - это та омега, которая не зависит от конкретного сэмплинга и а у нас всегда в одной конкретной ситуации будет конкретный x и конкретный y. И вот неидеальности этого икса и

93:06

Speaker A

игрека, они будут на нас как-то влиять. В этом смысле омега true, она не случайная величина, она как раз детерминированная величина, потому что мы, смотрите, как мы определяем f(x). Альтернативная формировка - это матжидание, а от вот этого самого Y, правильно? То

93:27

Speaker A

есть, э, если мы подставим формулу, получится, точнее, не так, давайте, ну да, это вот f(x). А если мы оцениваем вот f(x) f отx с крышкой, то есть наша модель уже реальная, [фыркает] то она будет зависеть на самом деле, ну

93:48

Speaker A

какая-то функция, давайте возьмём функцию фит. Это вот функция фит, она от ика зависит. А y у нас это идеальная функция f плюс какой-то си. То есть здесь опять зашита вот эта вот случайность.

94:01

Speaker A

То есть у нас F с крышкой, наша натренированная модель, зависит от того, какие ошибки нам выпали сегодня.

94:12

Speaker A

И вот если мы минимизируем эти ошибки, влияние таких ошибок, тогда у нас получится настоящее вот это вот омега true. Ну вот это, собственно, то, что, собственно, вот это и есть предмет обсуждения статистики.

94:26

Speaker A

То есть вот это всё соотношение между типа там истинными параметрами, оцененными параметрами - это штука, которая во всей статистике вообще работает. Так, то есть а-тесты так работают какие-нибудь там, а оценки монетки точно также работают. Ну, можем на примере монетки про это

94:42

Speaker A

подумать. Смотрите, а вот у мне дали монетку и сказали: "Вот монетка честная или нет". Вот такой пример, наверное, изучали, правильно, на в курсе статистики.

94:53

Speaker A

Вот я беру монетку, кидаю 10 раз и с помощью какого-то там моего теста, который сейчас не имеет особого значения, говорю, что, ну, скорее всего, честно. А или, например, говорю, что скорее всего нечестно. А если я потестирую, например, 100 раз, то я могу

95:09

Speaker A

поменять свой ответ в зависимости от выборки. Так вот, а в данном случае вот это вот типа та вероятность. Вот. И я, например, давайте оценю вероятность, ну, внутри этой монетки, например, я в какой-то момент её оценю как там 0,55.

95:26

Speaker A

И вот это будет омега с крышкой. То есть то, что я предсказываю сейчас из тех данных, которые у меня есть сейчас. Но на самом деле я знаю, что в Монетка честная. Просто у меня сегодняшний тест мне показал там 0,55. А если бы я

95:39

Speaker A

бесконечное время её тестировал, то эта штука, она бы сошлась к настоящему 0,5. Это если она честна. А если нечестно, например, там было бы, знаете, 0,49.

95:49

Speaker A

Вот мне дали такую монетку, у которой 0,49 почему-то. И я бы постепенно сошёлся к этому. Но я этого не знаю, потому что у меня же нету истинного ответа. Это же мне дали неизвестную монетку. И всего лишь у меня есть

96:01

Speaker A

выборка, которую я хочу оценить. Вот омега true - это буквально та самая настоящая вероятность. То есть настоящий параметр, который бы идеально описывал аа нашу э точнее вообще наш реальный мир, который нам дан в виде выборки.

96:20

Speaker A

Такие параметры F от X, да, наско, ну, идеально, насколько это возможно, да, среди того класса f(x), внутри которого мы сейчас ищем, в частности линейных. Просто вот это вот омегат, оно сильно от модели зависит. Если будет нерасеть, да, у неё

96:39

Speaker A

там будет сильно больше параметров, и там будет другая fя, на самом деле. То есть разделение будет другим.

96:47

Speaker A

Но для одного класса моделей, да, это будет правильно. Угу. То есть омега-3 - это когда у нас, грубо говоря, дисперсия равно 2, а омега звёздочка - это когда мы минимизируем дисперсию.

96:58

Speaker A

Дисперсия чего? Нет, дисперсия никогда не равна нулю. Просто это идеальная штука, которая будет не зависеть, а это идеальная омега, которая не будет зависеть от конкретного X.

97:12

Speaker A

Ещё раз, мы по конкретной выборке не можем оценить идеально. Вот мне дали выборку сегодняшнюю и завтрашнюю, у меня получится чуть разные омеги.

97:22

Speaker A

Всё равно м Нет, это не значит. Нене, нет, это немножко другая история. М, сейчас по что омега звёздочками в плане не и я понял вопрос. Ээ это это, короче, такая разница, которую давайте сейчас попробуем почувствовать. Вот у нас есть

97:42

Speaker A

XY, ну, то есть одна фича и таргет. А, смотрите, что такое м предположим, мне в один день дали вот такую выборку.

97:58

Speaker A

Да. А и я говорю, что моя омега, и я говорю в этот момент, что моя, а, омега со звездой, то есть оценочка моя, ну, вообще это с крышкой. Ладно, надо поменять будет обозначение на сегодняшний день. Давайте это обозначим

98:19

Speaker A

омега-1, как раз-таки вот она вот такая. А потом мне дали ещё больше точек, и они легли вот так.

98:33

Speaker A

Я говорю, что моя там какая-то улучшенная оценка, она будет вот такой. Вот это будет у меня омега2.

98:41

Speaker A

Но если мне дадут ещё больше точек, я могу ещё уточнить её. Но а это не значит, что вот это равенство, то есть это не значит, что в какой-то момент достигнет нуля. Это не значит этого. То есть, смотрите, ведь никакая линейная

98:58

Speaker A

функция не сможет идеально описать вот это множество точек, правильно? То есть всегда, то есть для любой линейной функции здесь будет какой-то зазор.

99:10

Speaker A

То есть будет минимальная, но не равна нулю. Равна нулю она может быть тогда, когда наша модель идеально опишет реальный мир. Но это, скорее всего, никогда не произойдёт вообще.

99:22

Speaker A

То есть здесь разница между разными омегами и и вообще способностью модели оценить реальный мир.

99:31

Speaker A

То есть минимальная, но не нулевая. Это да. Омегазвезда это омегазвезда - это это оценка для омегат, исходя из конкретной выборки X конечной, то есть омега1, например, омега-1 или омега-2 или ещё угодно. То есть омега в этом смысле со

99:54

Speaker A

звездой она зависит от конкретного икса и конкретного Y. А омегат не зависит. То есть, если мне сегодня дали вот такие иксы и игреки, а завтра такие иксы ики, то омегат одинаковая, она не поменялась.

100:08

Speaker A

Омегат характеризует то распределение реального мира, которое под этим лежит. И это возвращает нас к началу, где мы определяли вообще понятие правдоподобия.

100:19

Speaker A

Вот правдоподобие - это буквально тот мостик, который соединяет мир моделей, где у нас, например, только линейные функции, никаких других не существует вообще. То есть, в принципе, модель линейная не способна породить нелинейный ответ. Ну, никогда такого не будет. А в

100:36

Speaker A

мире реальном всегда будет отклонение. И вот как раз правдоподобие - это тот мостик, который их соединяет.

100:45

Speaker A

И по сути вот мы сейчас играемся именно вот с этими а понятиями. Теорема заключается в этой форме, что она существует, она определяет внимание.

100:57

Speaker A

Теорема заключается в том, что а если мы вот здесь минимизируем, а минимизируем квадратичную функцию потерь, то мы получим вот такие свойства.

101:11

Speaker A

Ну а здесь ниже просто расписаны более, ну, большим количеством слов вот эти четыре слова.

101:21

Speaker A

Короче говоря, если совсем ужать эту теорему в одну строчку, а она звучит следующим образом. Квадратичная функция потерь - это очень хорошая функция потерь. Это если вот буквально в одну фразу ужать. Но какая именно очень хорошая, а именно лучшая линейная

101:39

Speaker A

несмещённая оценка. Или по-русски это называется эффективная несмещённая линейная оценка. Но она не единственная. Вот такая, ну, что не единственное в каком классе. В смысле, вот смотрите, если взять из всех моделей линейные модели, несмещённые модели, и вот из этих моделей найти с наименьшей

102:02

Speaker A

дисперсией, то такая одна всего. Она будет равна ровно вот этой формуле, которая здесь нарисована. Ну, xx ми пер и далее по тексту.

102:12

Speaker A

О, который что? который даёт аа м ну эффективно единственный, но именно доказательство именно вот такого доказательства не вообще можно его сделать. Не, я думаю, это можно легко доказать. Ну то есть да, де-факто это это единственное, да. Ну, в смысле, я к

102:34

Speaker A

тому, что BL BL - это единственное, да? Да, это это Ну так вот, если существует какой-то другой лос, который приведёт к такому же результату, тогда вопрос: в чём там разница? Ну, ни в чём окажется. Можно от противного доказать, если хочется.

102:49

Speaker A

[фыркает] Что ж сказали? Все лучше 27. Во, вот то, что здесь подчёркнуто красным, не лучший лос. Он даёт лучшую оценку, лучшую омега со звездой.

103:07

Speaker A

Ну, в этом смысле он тоже лучший. А, но формально он даёт лучшую оценку. А лучшее в плане, что бесперси, да? Да. Вот лучшее вот в виде этих четырёх слов, но она должна быть линейной, несмещённой и вот там уже с минимальной дисперсией

103:25

Speaker A

среди вот этих функций. Просто если мы возьмём, например, функции нелинейные, там же всё развалится. Если мы возьмём несмещённые, всё опять развалится.

103:35

Speaker A

Точнее наоборот смещённые. Хорошо. По сути говоря, это всё подводит черту под тем, что мы уже сказали. То есть на самом деле мы уже практически полностью повторили а доказательства теоремы Гаус Маркова для случая нормальных ошибок. То есть вот всё, что мы до сих пор

104:04

Speaker A

написали, оно буквально приводит к этому. То есть там осталось только вот посмотреть на это под определённым углом. Но опять же полное доказательство приводить мы не будем.

104:16

Speaker A

Аа давайте прикинем ещё такую вещь. Коль скоро у нас есть а такая чудоформула, вот эта чудоформула, то казалось бы, и причём она точная, то есть всё, никаких как бы проблем с ней нет в этом отношении. Но есть такой простой факт.

104:34

Speaker A

Никто эту формулу не использует в реальной жизни. Типа мы мы всё это делали, чтобы сказать, что мы этого никогда не будем использовать.

104:41

Speaker A

Вот. А ну важность этой формулы как раз во всех тех словах, которые мы сказали, что там несмещённая, сменяли дисперсия, лята поля, то есть, что мы не с потолка взяли вот этот квадратичный лос, а мы его взяли по очень серьёзным причинам. И

104:56

Speaker A

теперь а мы обратимся к реальности и вспомним, что нам нужно это делать, а на каком-то реальном, а, ну, давайте скажем сразу компьютере. Да. И давайте прикинем, почему эту формулу не используем. А первое, вычислительная сложность.

105:16

Speaker A

А, смотрите, у нас здесь размеры матричек довольно большие. Получается, у нас здесь будет P на N, здесь N на P, то есть это уже довольно много. При этом умножение матричек, ну, давайте будем считать наивное. Если квадратные две матрички умножать, то есть две матрички

105:35

Speaker A

n на n, то у нас будет сложность порядка n в³бе. А, и это очень долго, потому что имеем в виду, что здесь вот смотрите, аа если мы возьмём какие-нибудь реальные задачи вот из сегодняшнего дня 2026 года, например, мы тренируем а какую-нибудь, я не знаю,

105:54

Speaker A

рекомендательную систему и у нас есть хотя бы миллион пользователей. Ну, будем думать, что каждый пользователь дал нам хотя бы там пять взаимодействий. То есть вот это у нас будет 5 на 10 вше.

106:09

Speaker A

А количество признаков у нас будет, например, давайте 10 в тре возьмём. И теперь, когда мы это всё возведём радостно ещё в третью степень, мы там, короче, будем это считать просто до скончания мира на любом железе. К сожалению, вот такая штука. Ну ладно,

106:25

Speaker A

предположим, у нас есть закон Мура. И аа закон Мура, кто помнит, закон Мура для компьютеров это то, что количество изначально он формулируется как количество транзисторов в два раза растёт каждые 2 года. Помните такое? Называется закон Мура. Мы к нему ещё вернёмся, он нам

106:44

Speaker A

сильно понадобится, поэтому можете про него почитать. А вот предположим, у нас есть закон Мура. У нас просто вычислений сколько угодно. Вот всё, мы можем квантовый компьютер сделать. К сожалению, всё ещё это не решение, потому что а вот это вот матричное

107:01

Speaker A

вычисление, оно, к сожалению, нестабильно по двум причинам. Главная причина - это, а, арифметика с конечной точностью. Это вот такая вот штука. То есть, ну, помните, как устроены цифры, числа с плавающей точкой в компьютере?

107:16

Speaker A

Кто помнит вот эту картинку? Ага, хорошо. И мы помним, что вот здесь можем записать только вот, ну, сколько-то чисел, сколько влезло, а все остальные, как бы, извините. В чём проблема? Когда мы умножаем вот такое большое количество раз, то вот эта ошибочка вот здесь, вот в

107:36

Speaker A

этом месте, происходит малюсенькая ошибочка но потом мы си берём и радостно умножаем вот на такую цифру.

107:46

Speaker A

А, ну давайте будем думать, что у нас си - это что у нас получается 23, да? То есть это 2 в 20 в в минутрей.

107:55

Speaker A

Вот 2 в -23 - это характерная величина си. А теперь давайте это умножим вот на такую штуку. Причём не на не просто на такую, а ещё в кубе. И у нас получится уже макроси. То есть типа си вылезет

108:11

Speaker A

непосредственно в результат, и мы получим неточное решение. А пока не изобретём компьютеры с идеальной точностью, такого не получится применить. Есть ещё одна причина, которая называется мультиколинеарные признаки. Что это такое? Смотрите. А кто помнит, что такое детерминант? Какое у

108:30

Speaker A

него главное свойство? Ну вот, которым чаще всего пользуются вот на поверхности. Ну что мы по детерминанту можем сказать, да?

108:44

Speaker A

Вот когда детерминант равен нулю, это значит, что у нас не существует там x мипе, то есть обратная матрица. Обратим внимание, что нам нужна здесь обратная матрица вот в этом месте. О'кей?

109:00

Speaker A

И да, давайте ещё вот посмотрим на эту формулу. Какого размера вот в красной рамочке матрица выйдет?

109:07

Speaker A

Кто может посчитать, прикинуть, оценить? Вот в красной рамочке матрица. Всё, что в красной рамочке. Вот у него какой размер?

109:24

Speaker A

Возможно, я я не знаю. Да, давайте давайте посчитаем. Ну, типа исходя из определений. Не n на n тоже.

109:37

Speaker A

А, да, ну, мы немножко другую терминологию вводили. Лучше N на P. Просто смотрите, M и N, к сожалению, плохая терминология, потому что, знаете, когда M может N, нет, мне показалось, всё-таки N. В общем, это очень тяжело. А вот M N и P они попроще их разделять.

109:55

Speaker A

Вот давайте в такой терминологии, да? Вот если у нас X - это получается N на P, вот такая терминология, да, то у нас эта матричка будет P на P. Все согласны?

110:09

Speaker A

Хорошо. А вот и, ну, кстати, это матрица корреляции, ну, только к ней обратно. М в чём фишка? Вот у этой матрицы в рамочке может быть нулевой детерминант, и тогда мы в беде. А что такое нулевой детерминант у этой матрички? Что это

110:26

Speaker A

означает с точки зрения задачи? Вот что это там означает? Какое свойство есть у наших данных? Тогда, да, линейно зависимые столбцы. Ну, смотрите, P - это у нас количество столбцов, да? То есть N - это количество строк, P - количество столбцов. У нас

110:44

Speaker A

какие-то столбцы линейно зависимы, тогда матрицы необратим. А, о'кей, мы можем как-то избавить. То есть, если у нас столбец в точности является копией, ну, давайте его удалим. То есть, о'кей, хорошо. Но есть ещё одна проблема. Вот если детерминант аа примерно равен нулю, то есть типа

111:03

Speaker A

давайте придумаем так, что детерминант на растря 0 1, да? То есть она почти необратима, иными словами. А вот тогда вот эта проблема, то есть вот то, что у нас детерминант довольно маленький, она тут же отразится через конечную арифметику, пото что как

111:24

Speaker A

только мы попытаемся её обратить, у нас вот свойство аа конечной точности вычислений очень быстро нас сведёт к тому, что мы получим, а коллизию, то есть мы быстро поделим на ноль, если посмотреть там внутрь алгоритмов. Вот это свойство называется мультиколинеарные фичи.

111:42

Speaker A

Смотрите, фечи - это у нас столбики, а мультикалинеарные слово означает то, что эти два вектора, то есть вот один признак и другой признак, это два вектора в пространстве размерности количества образцов, то есть n, да? И вот они колинеарны как

111:59

Speaker A

геометрический объект, то есть как векторы, они почти почти одинаковые. Поэтому называются мультиколинеарные признаки. И вот если они такие, то у нас детерминант почти ноль. И вот как бы всё идёт а прахом.

112:15

Speaker A

А, хорошо. Ну, вот это вот основные причины, почему люди не используют данную формулу. Тогда встаёт вопрос: а что с этим делать? Можно ли как-то починить машинное обучение?

112:29

Speaker A

А, значит, да, мультиколиарные фичи. Какие здесь есть примеры? Например, рост и вес. Ну, достаточно очевидно. И что-нибудь предсказывать будем про человека, не знаю, там ожидаемый возраст жизни, то есть сколько во сколько лет он умрёт. А вот вес и рост будут, очевидно, скорели.

112:52

Speaker A

Возраст человека и количество лет, сколько он работает, например, какой-то его стаж на работе, тоже будет достаточно, очевидно скоррелированно.

113:00

Speaker A

Если мы берём дом, то, а, площадь и количество комнат, если погода, то температура и и дата. То есть летом будет тепло, зимой будет холодно.

113:12

Speaker A

Тоже есть корреляция очень хорошая. Аа и так далее. А, ну вот с транзакциями старт и начало и конец транзакций и так далее. Как это посмотреть на практике?

113:25

Speaker A

На практике можно сделать искусственный датасет XY. Ну, то есть просто случайно намплить и применить прямо формулу и увидеть, что настоящее решение вот это то, которое мы прямо запрограммировали туда. Оно вот такое. А если мы применим формулу, это буквально в нампай

113:42

Speaker A

переписанная формула, окажется, что здесь возникают какие-то ужасные странные значения. Вот это практическое следствие вот этой самой мультиколинеарности фечей. И практический пример, почему эту формулу не используют. То есть она очень долго считается и плюс ещё и неточно считается. Ну то есть как бы вообще

114:03

Speaker A

полный пролёт, да? Просто типа я случайно нагерил X и случайно нагерил Y и потом посчитал по честной формуле с шумом, правда, небольшим.

114:17

Speaker A

А мы это сделаем в в Jпитер ноутбуке. Посмотрим на то, как это делается. Но результат вот такой. Пока поглядим на результат, потом посмотрим. Прямо на практике сделаем.

114:28

Speaker A

А, хорошо. Аа после этого давайте посмотрим на какое-нибудь решение. То есть, что нам а можно с этим сделать с точки зрения математики, а потом придумаем ещё практическое решение, которое на компьютерах инженерное это решит ту проблему. Значит, первое - это

114:47

Speaker A

регуляризация. А, ну, наверное, все слышали про регуляризацию в длинных моделях, я думаю. А, начнём с регуляризации L2. Она же R. Она же грибневая регрессия или сейчас, как там она ещё называлась? А, а она же регуляризация Тихонова. Кто знает, кто

115:07

Speaker A

такой Тихонов? Кто это? Это Да, да, Тиханов советский математик. Он ещё, например, основал ВМК факультет в МГУ. Вот один из родоначальников. И там очень много лет, кстати, работал. А вот это всё называется R regression. Как нам быть в такой сложной ситуации? Вот у

115:31

Speaker A

нас есть необратимая матрица. Давайте докинем просто сюда как какой-то член, который обязательно обратим. Ну то есть очевидно, что единичная матрица, она обратима и как бы с ней довольно мало чего можно сделать, чтобы её не мочь обратить. Мм её сюда просто нагло добавим.

115:51

Speaker A

И во что это резрует? На самом деле нам повезло, потому что а-а этой штуки существует прямо формула для функции потерь. Но сперва нам нужно поговорить про вот эту штуку. Смотрите, а давайте это обозначим омега L2.

116:10

Speaker A

А ещё у нас есть вот та самая омега. А давайте её обозначим омега с крышкой, которая обычная формула. Ну то есть без вот этого квадрата. А и теперь давайте посмотрим на пространство.

116:24

Speaker A

на пространство а наших омег. То есть вот у нас есть омега1, омега2 и так далее. То есть омега - это же вектор в линейной модели. Вот давайте посмотрим на пространство омег. Вот у нас есть в какой-то точке, а

116:41

Speaker A

у нас есть омега со звездой настоящая. А потом у нас есть вторая точка, которая называется омега с крышкой, а именно вот эта вот штука, вот эта, она где-то здесь. То есть омега с звездой - это прямо совсем настоящее.

117:01

Speaker A

Омега с крышкой - это наша оценка настоящего значения. А теперь в игру вступает омега L2.

117:09

Speaker A

Давайте для неё тоже какой-нибудь цвет возьмём. И оказывается, что омега L2 она ещё где-то будет в другой точке.

117:18

Speaker A

Вот. И в чём проблема этой омеги L2? Она никогда не сойдётся к омеге со звездой.

117:25

Speaker A

То есть главное свойство здесь такое, вот эта вот смещённость, это то, что вот смотрите, омега с крышкой настоящее, оно стремится вот сюда. То есть чем больше мы данных будем вкидывать, тем ближе омега с крышкой будет подвигаться к омега со звездой.

117:41

Speaker A

Это и есть несмещённость, что она в пределе сходится к настоящему решению. А вот омега L2, она стремится к какой-то своей другой точке. Давайте обозначим её омега звезда с индексом L2. И вот эти штуки, они друг другу не равны. И вот

118:01

Speaker A

это и есть свойство смещённости. То есть мы никогда к совсем правильному ответу не сойдёмся. То есть, а, просто имейте в виду, что вы, когда делаете регуляризацию, за это есть определённая плата. То есть у этого есть определённая цена, и это не

118:15

Speaker A

бесплатно. Если вы слишком сильно регуляризуете, у вас решение смещается. Причём интересно, что вот это вот свойство того, что регуляризованная модель куда-то убегает, оно сохранится для всех моделей машинного обучения. Мы с вами чуть позже введём понятие, которое называется индуктивный баяс. Ну или, собственно,

118:38

Speaker A

inducctтив BIOS. А кто-нибуд слышал такое выражение? Ну, мы его ещё введём. А это как раз вот подобное же явление, только оно характерно на самом деле для всех вообще моделей, которые есть в машинном обучении.

118:55

Speaker A

Это один конкретный пример. А, хорошо, с этим мы разобрались. И нам повезло, что именно для L2 регуляризации, собственно, почему её так называют L2, а можно записать такую функцию потерь, минимизация которой приведёт нас вот к этой ровно формуле.

119:16

Speaker A

Это не то, чтобы какое-то фундаментальное свойство, это просто вот для одной конкретной формулы нам так повезло.

119:22

Speaker A

А эта формула должна быть, ну, вот лямбда, она сохранилась, кстати. Лямбда в квадрате здесь для того, чтобы обозначить, что она не отрицательная. То есть лямбда должна быть больше или равна нулю. А, ну то есть, точнее, вот весь вся константа больше или равна нулю, а

119:36

Speaker A

лямбда как бы любая. А, и у нас здесь, э, возникает вторая норма вектора весов. Вот это такое математическое объяснение, почему L2 регуляризация вообще случилась. Есть ещё другие объяснения, в частности, ну, назовём его условно инженерным. Аа следует оно из свойств, а, этой

120:02

Speaker A

регуляризации. А L2 регуляризация, она, э, борется с переобучением. Другой способ, собственно говоря, инженерный, ввести ту же штуку, сказать, что смотрите, что такое, а, мультиколинеарные фичи. Ну, это переобучение, хотя мы с вами ещё не определяли, что такое переобучение, потому что это довольно сложная фигня.

120:24

Speaker A

А-а, и давайте бороться с переобучением. Ну, как когда мы добавляем вот эту штуку, оказывается, что переобучение уходит. Ну, просто такой эмпирический факт. И исходя из этого мы говорим: "Это хорошо. Вот это такой другой способ ввести L2 регуляризацию, но он такой,

120:40

Speaker A

ну, прямо суперинженерный, потому что типа, ну да, о'кей, у нас есть проблема, но просто вот мы приложили вот это и оно работает, произошло чудо, а, ура, мы победили, всё. Ну, то есть вот такое такая мотивация. И, э, вот эти веса у

120:56

Speaker A

нас, омеги, они на самом деле стремятся к нулю. М, то есть, ну, смотрите, исходя из вот этой формулы потерь, да, представим, что какая-нибудь там, не знаю, там омега с индексом, а, омега, например, 17 у нас там супербольшая, там, например, равна, я не

121:16

Speaker A

знаю, там 1.000, да, а вдруг в то время, как все остальные где-то в районе там единички. Аа и получается, что вот эта штука наиболее сильно будет делать вклад в функцию потерь. А мы функцию потерь, понятное дело, что минимизируем.

121:31

Speaker A

Поэтому после того, как мы добавим этот член, вот эта именно координата, она будет наибольшим образом страдать, потому что у неё наибольший квадрат. А те омеги, ну, например, не знаю, омега1 равна там, не знаю, 3це, а там 2 она

121:48

Speaker A

сильно меньше пострадает и так далее. Вот это именно такой уже практический анализ аа того, что мы здесь написали.

121:57

Speaker A

Угу. Хорошо. Есть также L1 регуляризация. Вот она по аналогии с L2 может быть введена добавлением первого первой меры, первой нормы а весов.

122:13

Speaker A

У неё есть тоже классные свойства. К сожалению, нельзя записать формулу для омеги в простых координатах. Но если посмотреть на свойства L1 регуляризации, у неё есть очень классные свойства. А именно, на самом деле, существует там определённый хитрый базис. Как ввести

122:33

Speaker A

его, можете посмотреть вот в книжке по ссылке, но существует такой базис, в котором можно вот прямо точное равенство записать, а именно каждая координата, вот это вектор, да, и у него координата J. Что происходит? Если у нас значение больше нуля, то тогда мы из этого

122:54

Speaker A

значения больше нуля вычитаем лямбду и берём положительную часть от этого. А вот если э значение меньше нуля, то мы берём модуль, из него вычитаем лямбду и от этого берём положительную часть и берём потом со знаком минус. А эффективно вот эта вот сложная формула

123:12

Speaker A

означает следующее. Вот смотрите, вот это у нас была омега с крышкой, то есть истинная, которая вот по формуле Гауса Маркл. А вот этот график а здесь он будет омега L1 означать. Что происходит?

123:30

Speaker A

У нас как бы все притягиваются к нулю. То есть мы как будто бы вычитаем лямбду из каждого веса, но вычитаем непропорционально, а мы можем настолько сильно вычить лямбду, что она в точности достигнет нуля. Вот прямо в точности будет равна

123:46

Speaker A

нулю. Это как раз происходит из-за вот этой вот части с плюсиком. А и чем это отличается от L1? Смотрите, в L1 тоже веса будут прибиваться к нулю, но а можно думать, ой, про L2, про L2 можно думать следующим образом. Если у

124:04

Speaker A

нас был омега ну, житый, да, так же, как вот здесь, то после регуляризации у нас будет, ну, какая-то типа лямбда умножить на омега GTтый. Вот что-то типа такого. Это неточная формулировка, но качественно это работает именно так. То есть, если

124:24

Speaker A

мы будем увеличивать лям, точнее, не не так, только здесь надо не умножить, а поделить скорее на лямбду. 1дини делить на лямбду, а умножить на омега gТ. То есть а будет сжимать, но никогда нулю равным не будет, а1 вычитает вместо этого.

124:45

Speaker A

Понятно? Положительную часть. Положительную часть. Ну, смотрите, вот у вас была какая-то какое-то значение, вот у вас есть ноль, а вы стартовали из этой точки, это будет там gжитая, а, по модулю. Потом вы вычили лямбду, приземлились вот сюда.

125:09

Speaker A

И вот от этого числа мы берём только а положительную часть, то есть, а, приближаем к нулю. Ну, то есть типа берём, если меньше нуля, то бери ноль.

125:21

Speaker A

Если от нуля и больше, бери то, что есть. Мм наверное аа, ну да, можно так сказать, да.

125:35

Speaker A

Хорошо. Кстати, хорошая аналогия, надо будет запомнить. Но это в целом, ну, в матёше так вот часто применяют. Это, то есть, я к тому, это стандартное обозначение можно встретить в ряде книжек. математических. Вот. А важно здесь, что смотрите, целый целая пачка

125:53

Speaker A

весов, то есть вот эти все веса, все веса, ну, я не знаю, скажем, давайте я сейчас посмотрю по индексам. Это у нас будет от седьмого веса до одиннадцатого.

126:02

Speaker A

Они все равны нулю. Все равны в точности нулю. И поэтому, а, L1 регуляризацию часто называют выбирающие признаки. То есть вот, а свойство, главное L1 регуляризации - это выбирать признаки.

126:19

Speaker A

То есть для тех признаков, у которых вес равен нулю, мы их не используем никак.

126:23

Speaker A

То есть значение признака никак не влияет на результат. Хорошо, давайте ещё раз посмотрим на вот такую аа вот такой вот график, где у нас был омега1, омега-2. Вот смотрите. А мы сказали, что у нас есть омега со звездой

126:40

Speaker A

настоящего. Мы сказали, что у нас есть, а, омега L2. И на самом деле у нас где-то вот здесь будет ещё омега L1, то есть, а, L1 регуляризация тоже будет как бы портить решение, но по-другому, чем L2.

126:56

Speaker A

То есть L2 портит по-своему, а L1 портит по-своему, как-то вот как им там это нравится внутри. И всё это живёт в пространстве параметров модели.

127:09

Speaker A

Вот это достаточно важная штука. А, то есть лучше всего думать о функциях потерь и их воздействию на модель через пространство параметров.

127:22

Speaker A

Это вот самый такой оптимальный способ, чтобы достаточно эффективно делать выводы про это всё. Хорошо. А есть ещё байсовская интерпретация. Если включить там байсную статистику, короче, там посчитать тополя, то окажется следующее, что вот смотрите, вот эта точка, вот сейчас мы опять живём в пространстве

127:45

Speaker A

параметров, то есть вот здесь по оси X - это омега1, по оси Y - это омега2.

127:52

Speaker A

Вот это у нас истинная задача. То есть вот та точка, которая сейчас бегает вот здесь в центре эллипсов, а это точка омега со звездой, то есть постановка задач основной. А вот эти вот маленькие кружочки, кружочек, ну, мы обычно это

128:08

Speaker A

называем ромбик, а в русском языке, в общем, вот этот такой ромбик, а это как раз из-за линии, а, регуляризации, то есть то, где регуляризация равна одному и тому же значению. То есть, по сути, это такой шар в L2, вот здесь

128:27

Speaker A

слева, а здесь шар в L1. И оказывается, что если у нас задача выпуклая, ну, у нас задача выпуклая, а то вот L1 очень часто предпочитает а какие-то угловые точки. И вот отсюда как раз и следует это зануление, потому что

128:46

Speaker A

для L1 регуляризации очень удобно, а, оказывается, часто жить в углу. А в углу, что такое в углу? Это там, где одна из координат. То есть вот смотрите, здесь омега1 равна нулю, а вот в этой точке омега-2 = 0, равно как и вот здесь

129:05

Speaker A

вот. А что, что вот это такое? Это один кусок лоса, то есть вот тот, который бегает, вот этот лос, это у нас получится mс.

129:16

Speaker A

А вот этот кружочек, вот этот кружочек, он у нас как раз L2 регуляризацию характеризует или L1 регуляризацию характеризует. То есть, а, будет норма омеги вторая в².

129:33

Speaker A

Вот такая вот штука. Значит ли это, что если у нас результа достаточно близко как, точки спадут?

129:44

Speaker A

Ну, там просто линии, ну, смотрите, здесь же много линий изза из-за линий вот этих вот. Их бесконечное так-то количество. Просто мы здесь привели какую-то одну, ну, а как ска а они они ровно вот та точка оранжевая, которая здесь бегает, это и есть точка

129:58

Speaker A

совпадения уже. Нет, в плане, если вот центр самый Ненене, нет, смотрите, у нас всегда регуляризация будет истинную точку сдвигать в сторону нуля, где бы она ни была. Не, если точка решения будет точно в нуле, никогда не совпадут, если

130:17

Speaker A

ну кроме кроме точки ноль. Ну, если омега настоящая равна точно нулю, вот точно нулю, тогда на неё точно никак не повлияет лос. Ну, это из, собственно, лоса, я думаю, видно. В любом другом случае повлияет.

130:31

Speaker A

Вот. Хорошо. А, очень простая идея, а, это сложить два типа регуляризации. Называется это формально, а, да, я ещё что не сказал. Вот эта вот штука называется L1 регулизация и также называет Ласа. Это название той статьи, в которой это было опубликовано. Ну,

130:55

Speaker A

типа, если знаете, слышите ЛАСА, это говорят про L1 регуляризацию. Но мы всегда будем использовать терминологию L1, L2, просто потому что она очень регулярная и очень простая. А вот эти все там лариж, ну, это такие исторические названия как бы, а, которые

131:09

Speaker A

ничего особо не характеризуют. Точнее, характеризуют, но как бы не тривиально. Вот. А вот такая композиция называется Elasticnet. Опять же по названию статьи, в которое это выпустили в своё время.

131:20

Speaker A

Ну, в принципе, можно просто сказать, что типа сумма L1 и L2. Такая идея очень простая. Результаты, ну, буквально суммируем результаты с предыдущих этапов, получаем то, что здесь произойдёт. А вопрос такой: хотим ли мы а применять регуляризацию вот к этой части? Ну, мы

131:43

Speaker A

до сих пор говорили, что у нас тут формулу зашита вот эта вот магия, да, но вот этот, на самом деле, вот эта чиселка, она несколько отличается от других, потому что в реальной формуле, не в нашей, которая удобна вот для

131:56

Speaker A

операций, а в настоящей формуле, там вот она специальная. И стоит ли её регуляризовывать, да или нет, ну и почему?

132:23

Speaker A

Давайте посмотрим на пример. В чём заключается пример? Ну, что-нибудь типа X, что-нибудь типа Y. А, и давайте я нарисую какую-нибудь красивую выборку.

132:36

Speaker A

Выборка у меня будет вот такая. Вот. Мм. Давайте посмотрим. А почему всё не всегда стре хорошо? А давайте посмотрим вот на этом рисунке вот омега 0 она где? Вот какая точка будет соответствовать значению омега 0?

133:22

Speaker A

Да. Ну, смотрите, вот если мы возьмём f от 0, то есть все иксы равны но, ну, типа от вектора ноль, у нас вот здесь полностью будет ноль, правильно? Тогда это будет омега 0, правильно? Вот таким образом это будет вот эта точка. Ок.

133:39

Speaker A

Таким образом можно, почему, собственно, это называется смещение? Потому что оно нас смещает от начала координат. И вот запрещать смещение от начала координат, скорее всего, не стоит.

133:51

Speaker A

Вот, поэтому, как правило, а, значит, смещение не регуляризуется. Вот это такая небольшая оговорка, и это будет нам актуально там в нейронных сетях, да, и в реализации, в принципе, собственного собственной регуляризации тоже это нам поможет. Хорошо. Мм, дальше есть прикольная штука. Наверное,

134:14

Speaker A

можно её ещё раньше вынести. А есть такая статейка называется The Unreasonable Unreasonable effectiveness of Mathematics in the Natural Sciences. А я забыл, как постоянно забываю. Ну, типа, а-а, не необычайная эффективность математики в естественных науках. Ну, типа, так, наверное, можно как-то перевести. А

134:42

Speaker A

статейка за авторством Евгения Вигнера 960 года. Он в ней рассуждает по поводу того, а почему вот наши вот эти линейные регрессии, почему вот то, что мы написали f(x) +, то, что мы взяли простую линейную модель, просто умножили признаки и получили какой-то адекватный

135:03

Speaker A

ответ, почему это работает в реальном мире? Почему это описывает там физику, химию, там биологию, социологию и прочие истории? А-а, ну, на самом деле, в некотором роде это чудо. Вот, то есть, в принципе, не было никаких заранее, а-а, оснований думать, что мы вообще сможем

135:20

Speaker A

записать настолько эффективные формулы. А причём ещё интересно то, что а совершенно не очевидно, почему а наши записанные формулы именно что хороши. То есть, а, а могло бы так случиться, что те формулы, которые мы умеем записывать, и тот мир, который существует, он просто

135:39

Speaker A

очень плохо описывается. Вот ничего не запрещает, но так случилось. И вот эта связка, она на самом деле суперважна. И мы сегодня её в нескольких точках касались, в точках определения того, что такое вообще функция правдоподобия, а в точке, соответственно, введения задачи

135:56

Speaker A

регрессии. И ещё в нескольких точках будем мы об этом говорить. А сама статейка очень классная, всем рекомендую к прочтению, кто вообще ну такими вопросами заинтересован. Ну и мужик тоже крутой, он на самом деле очень много сделал. Кстати, он основоположник

136:12

Speaker A

кибернетики вот одновременно. И э он внёс на самом деле довольно существенный вклад в развитие нейронных сетей, то, что мы сегодня называем неросетями. Вот он один из пионеров всей этой штуки. Он там не лично в это контрибьютил. Он, собственно, у себя на даче собрал всех

136:29

Speaker A

тех людей, которые потом придумали неросеть. Вот такой весёлый тусовщик. А, хорошо. Значит, так. Функции потерь. А, да, давайте заметим, что у нас есть, смотрите, L1 и L2. Вот есть L2 функция потерь для основных данных. И L1 можно тоже использовать как функцию потерь. А

136:51

Speaker A

можно L2 использовать как регуляризацию? Можно L2 использовать как А L2 можно использовать как регуляризацию и L1 можно использовать как регуляризацию.

137:00

Speaker A

Пожалуйста, не путайте две этих штуки. То есть у нас и квадратичная ошибка может быть применена к XY и к Омеге. Это два независимых решения. Нередко люди их путают, поэтому мы это решили вынести на отдельный слайд.

137:15

Speaker A

Ну, тут всякие свойства, мы про них уже поговорили. Это просто повторение. А значит, на самом деле регрессии бывает огромное множество. То есть вот то, что мы сейчас с вами вот определили, это как и MLE, то есть метод максимального правдоподобия, не

137:33

Speaker A

единственный метод оценки параметров, также и линейная регрессия - это не единственный способ решить задачу регрессии. В частности, вот из прикольного вообще, то есть совершенно другие подходы. Первое - это изотоническая регрессия. Что это такое?

137:50

Speaker A

Вот рисуночек вот здесь isonic fit. А если нам нужно предсказать строго возрастаю, ну там неубывающую функцию, то есть мы знаем, например, мы что-нибудь в физике там, а, ну вот, знаете, там счётчик Гейггера, он умеет только накапливать радиацию, да? То

138:05

Speaker A

есть, а, по условиям задачи физическим, а, эта штука не может падать вниз, ну, никогда. или там ещё какие-нибудь процессы такого рода накопительные. А можно, то есть существует моделька, называется изотоническая регрессия, которая вам по датасету будет строить строго неубывающую функцию. А другой

138:25

Speaker A

пример, Ранзак, а картинка вот здесь, а нам дана какая-то выборка очень большая и странная. И аа мы методом случайных проб и ошибок пытаемся найти, буквально палкой в небо тыкая, пытаемся найти хорошую линейную функцию, которая приблизит этот датасет. То есть вообще

138:44

Speaker A

просто мы случайным образом сэмплим и потом проверяем. И магически, если у нас выборка адекватная и там есть сигнал, то мы рано или поздно, на самом деле достаточно рано, найдём хорошую линейную функцию. Это полностью другой подход к оценке весов. всё ещё полностью линейной

139:03

Speaker A

модели. Вот. А есть list angle regression, картинка вот здесь. А мы даём бюджет в какой-то объём весов. То есть мы говорим, например, смотри, вот ты сложишь все веса по абсолютному значению, то есть модули всех весов, и у тебя должно получиться не больше, чем

139:21

Speaker A

какая-то там константа, например, 0,5. Иди распределяй эти веса наиболее оптимальным образом. Вот такая постановка задачи. И дальше можем этот бюджет от нуля откручивать до максимального, неограниченного, и у нас получится какая-то эволюция весов. И это нам скажет, насколько признаки друг с

139:40

Speaker A

другом соотносятся по важности, ещё о чём-то скажет. Это нужно всё во всяких приложениях, как разтаки в биологии, в химии и так далее. Вот это можно применять всё. Аа, ну и есть генерализованные линейные модели. Про них мы, на самом деле, поговорим в

139:54

Speaker A

следующий раз. А, но для этого нам будет нужно ещё про классификацию поговорить. А, то есть ни одной лишь регрессией и ни одной лишь линейной регрессией мы живём.

140:06

Speaker A

Количество моделей, оно очень и очень велико. А, ну и примерно уже двигаясь к окончанию, давайте поговорим про метрики в регрессии. Что такое метрики и почему это хорошо, мы ещё очень детально поговорим в задаче классификации, потому что метрики - это прямо

140:24

Speaker A

довольно-таки, а, интересный конструкт. Но в регрессии, к счастью, дела обстоят всё очень просто. У нас есть все те же самые формулы, которые мы уже писали, в частности, MSE, ME, а есть RMSE, то есть это root means square er ror, то есть

140:41

Speaker A

просто корень. А есть несколько более интересные случаи, а именно а вот мопе, а мопе - это относительная ошибка. То есть вот мы делаем предсказание, да, считаем разницу и потом делим на истинное предсказание. А где это может понадобиться? Давайте прикинем

141:02

Speaker A

какой-нибудь пример, где нам было бы интересно использовать метрику МАПЕ вместо, например, MSE. Ну или даже вместо МАЕ самой.

141:20

Speaker A

Угу. Так, хорошо. Что-нибудь ещё? Да. Ну вот уже сказали, в принципе, правильный ответ. Пример с квартирами, помните, с ценой квартиры. То есть у нас ошибка считается в процентном отношении, вот, а не в абсолютном. И это нас спасает в ряде случаев. А есть ещё вот

141:45

Speaker A

там с мопе, это где мы учитываем оба эти результата, да? Ну, тоже там это уже дальше можно извращаться, как хочется.

141:52

Speaker A

Есть такая ещё штука, называется R², или иногда её называют R2. А вообще это называется коэффициент детерминации или как-то так, да? А что эта штука делает? Формула вот здесь. А что эта штука делает? Смотрите, а с точки зрения а такой простой, она берёт, смотрите,

142:16

Speaker A

вот что у нас в числителе. Что здесь? Ну, скорее, да. Ну, мы здесь можем сказать, что это N де n, поэтому типа это единица на n, вот на эту штуку, поэтому это будет MSE.

142:39

Speaker A

Ну, там буква есть, да? Вот. А что вот здесь в знаменателе? Не, ну, во-первых, давайте скажем, что это тоже MSE.

142:54

Speaker A

Вообще-то это тоже MSE, да? А, и здесь есть ная интерпретация. А, на, на самом деле, хорошо, давай теперь ладно.

143:07

Speaker A

А, на самом деле простая штука состоит в том, что это дисперсия. Обычно обычно вот так. М.

143:17

Speaker A

Дадада. То есть на знаменатель можно посмотреть с позиции классической статистики так, что это дисперсия. Но одновременно, если мы включим оптику эмщика, то мы скажем, что это MSE.

143:30

Speaker A

Вопрос, что за такая функция f отx хитрая а использована для подсчёта этого MSE? Что за модель? То есть, если это, то какая модель порождает такое SE? Средняя, да? То есть просто моделью является средняя.

143:52

Speaker A

А, с точки зрения интерпретации Мля свою модель сравниваем с модель с моделью константы. Просто из формировки, что это доля объяснённой дисперсии, это не всегда прозрачно. А вот именно интерпретация состоит в том, что есть ответ константа и есть наша модель. Вот

144:12

Speaker A

насколько они друг с другом соотносятся, насколько наша модель лучше или хуже аа такой простой модели. Ещё один каверзный вопрос, который обычно задают по поводу R², в принципе, и на собеседованиях как бы, ну, и на экзамене мы такое иногда

144:28

Speaker A

спрашиваем. Аа может ли R² быть отрицательным? Там же квадрат стоит всё-таки, как говорится. Здесь вам не тут.

144:44

Speaker A

А как так? Угу. Ну, а как так может случиться? Да, когда у нас модель сильно хуже, чем средняя. То есть, как мы говорили, моделью мы называем что-то, что преобразует входные данные, выходные, да? И вот это преобразование, оно может

145:08

Speaker A

быть насколько угодно плохим. Например, оно всегда отвечает: "Правильный ответ плюс 10.000". Ну, типа какое-то большое число, да? То есть всегда очень неправильно. Вот тогда наша модель будет даже ещё хуже, чем средняя. То есть средняя - это, казалось бы, бейлайн, но

145:25

Speaker A

можно провалить и этот бейзлайн вниз. Вот. А, хорошо. Поэтому R² не встретишь тут квадрат. Квадрат - это просто так, типа, I don't know. Кстати, надо будет прикинуть, почему здесь квадрат исторически возник. Ну ладно. А может быть отрицательно. Может быть

145:42

Speaker A

отрицательно в случае, когда моделька очень-очень плохая. Среднему константина ноль. Почему нет? Наминатель не ноль.

145:53

Speaker A

Почему ноль? Ну, с крышкой вы имеете в виду? Нет средняя. А, средняя. Аа, да, ну тогда у нас идеальное предсказание. Ну как бы, ну да, о'кей.

146:08

Speaker A

Да, да, это типа выколотый случай. Ну у нас дисперсия равна нулю у выборки, тогда константа идеально её объясняет.

146:17

Speaker A

Ну да, ну просто, ну да, такого типа никогда не будет на практике, но да. Да, технически. Технически, да.

146:25

Speaker A

Хорошо. А с этим разобрались. Так, про это мы поговорим в следующий раз, потому что это прямо супердлинная тема. А нам надо ещё сказать, на самом деле, одну небольшую вещь. Давайте сделаем что-нибудь типа такого, и мы с этого в следующий раз начнём.

146:54

Speaker A

А, а пока это что такое? А, я понял. Хорошо. Ты не хочешь переключать мне раскладку? О'кей.

147:11

Speaker A

А, давайте прикинем, как можно ещё инженерно, а, решить проблему а мультиколинерных свечей. А-а, есть какие-нибудь идеи?

147:36

Speaker A

То есть вот я сказал, что о'кей, формулу мы не используем, а причём даже когда мы сделаем регуляризацию, матрица станет обратимой. Но даже для обратимой матрицы всё равно вот этот вот сдвиг за счёт там просто огромного количества вычислений, за счёт там

147:52

Speaker A

неточности арифметики, всё равно он будет какой-то. И это всем не нравится. Что люди делают вместо этого? Как в реальности решают задачу поиска оптимальных весов, например, линейной регрессии?

148:06

Speaker A

Сейчас сделать дваписания карьеры. Ненене, вообще как бы как говорится thinking out of the box, то есть вообще какое-то другое решение, которое не связано с тем, что было. То есть мы с вами нашли проблему, мы попытались математически решить в виде

148:22

Speaker A

регуляризации, насколько-то мы преуспели, то есть какие-то проблемки мы решили, но, к сожалению, не все из перечислены. Вот. А как в реальности люди тренируют лийную регрессию?

148:34

Speaker A

F инженеринг не финжиниринг - это, ну, буквально финнеринг - это производство новых фичей. Ну вот вы новые фичи сделали, очень красивые, и у вас всё ещё осталось две там матрица X и матрица Y, которую нужно обратить, и не хочется

148:50

Speaker A

использовать формулу, потому что она очень длинная. Ну, вообще без формулы, да? делать. Хорошо, мы понизили размерность, выки выкинули мультиканой фичи, применили регуляризацию. Всё ещё нам нужно считать матричную формулу, а этого не хочется делать сильно, потому что просто матрица

149:14

Speaker A

огромная. То есть м А, ну мы выше говорили о том, что смотрите, предположим, у нас не знаю, там хотя бы миллиончик строк.

149:26

Speaker A

Вот это очень-очень долго считать, просто чудовищно долго. Матри, да, ну матрицы там типа миллион на 1.000. Вот вам нужно сделать там XTX - пер на xy. То есть вам нужно кучу таких матричных умножений сделать. Это очень долго.

149:48

Speaker A

Вот. Да. Вот, собственно, это другое решение совершенно другой природы. Супер, да? А, то есть у нас был путь, э, формула, и второй, э, способ - это, а, градиентный спуск.

150:08

Speaker A

А кто знает градиентный спуск? Ага, супер. То есть, смотрите, что мы с вами говорили раньше. Вот у нас есть пространство параметров омега-1 и омега-2. Там есть где-то это омега со звездой идеально. И у нас есть омега с крышкой, которое мы оценим через матриц.

150:28

Speaker A

А теперь давайте мы вообще пойдём другим путём, а именно мы возьмём какую-то там точку, да, в данном случае обозначим её омега 0, и просто а сдвинемся на какое-то расстояние в пространстве параметров, а так, чтобы следующая точечка, назовём её омега-1, она была поближе вот к той

150:51

Speaker A

самой омегазвезда, которую мы ищем. Ну, одновременно и комегазвезда, и комега с крышкой, они в этом смысле довольно близки. А-а, как это сделать? Нам нужно найти вот этот векторочек разницы. А чему он будет равен?

151:07

Speaker A

Ээ, давайте формулу запишем. То есть омегат + 1 равно какая формула у градиентного спуска? Кто помнит?

151:20

Speaker A

Так. Ага. То есть предыдущая точка, да? Это буквально то, что мы уже сказали. И дальше минус. Ну, давайте я назову это, ага, какой-то параметр. Точнее, давайте сразу, чтобы не париться, назовём это, а, назовём это learning rate.

151:39

Speaker A

Его нам надо умножить на что? А, на градиент. Чего? Вот здесь давайте важный момент, да, происходит на градиент чего?

151:56

Speaker A

Ага. на градиент функции потерь. Потому что, смотрите, а, а почему дифференцировать будем? А, а в нашем случае как называется по омеге. Угу, совершенно верно. Вот. То есть, смотрите, мы берём функцию потерь и дифференцируем её по омеге.

152:16

Speaker A

И это получается у нас некий векторок вот в этом пространстве как раз. И что здесь важно? А, смотрите, если мы говорим про градиент, а, для какой-то функции он смотрит Нет, давайте не так, чтобы было более понятно. Давайте вот

152:36

Speaker A

так. Градиент куда смотрит вектор градиента? Да, в сторону роста. Вот здесь будет рост. А, а если мы градиент повернём, то что произойдёт?

152:53

Speaker A

То будет убывание, да? Но вот эта штука, она только для гладких функций. Гладких, то есть оно же называется C1, то есть дифференцируемых. Вот если функция дифференцируемая, у неё будет такая штука. На самом деле, если функция недифференцируемая, у неё может быть

153:12

Speaker A

рост в одном направлении, а падение в другом. Это не запрещено. А вот если она дифференцируемая, ну, всё хорошо. Ну, это так опять же замечание, а для точности. А, хорошо. И вот этот вектор антиградиента, вот это, то есть минус,

153:30

Speaker A

а, а, набла L, вот это и есть тот самый небольшой векторочек. [фыркает] И дальше мы повторяем этот процесс раз за разом, сходясь потихонечку. На самом деле с определи ладно, мы будем, конечно, сходиться омега с крышкой, а не омега со звездой, к сожалению.

153:48

Speaker A

Вот. Хорошо. Ну вот, собственно говоря, это самое важное, что нам нужно было сказать про градиентный спуск. И как раз а-а следующее занятие мы начнём с того, что запрограммируем всё, что мы тут рассказали, э-э, включая матричную формулу, включая регуляризации, включая

154:05

Speaker A

градиентный спуск и посмотрим, как это всё работает. Вот. А после этого поговорим о том, как правильно модельки тестировать, как понять, что моделька не переобучилась. Ну, для начала введём это понять вообще, что это такое. Ну, нормально как-то систематически. И потом

154:20

Speaker A

поймём, как же нам узнать, что всё-таки модель не переобучилась. Чтобы это не значило. Пока. Хорошо. Супер. Тогда всем до следующей недели. Уложин.

154:33

Speaker A

Мм, неградиентные методы. Так, ну сколько угодно, да? Я же сказал, что у нас даже методов не которые не являются методом максимального правдоподобия, целая куча.

154:48

Speaker A

А можно, то есть в этой точке тоже есть куча разнообразия, но градиентный спуск у него в чём преимущество? Он супер масштабируемый.

154:57

Speaker A

Мы ещё об этом поговорим в следующий раз. Короче говоря, как метод максимального правдоподобия самый практически удобный среди методов оценки параметров, так и метод градиентного спуска, точнее, м среди, ну, метода определения оптимальных параметров, так и среди методов поиска этих параметров

155:17

Speaker A

уже конкретных, а-а, гредный спуск является очень и очень аа масштабируемым. Ну и, короче, у него куча всяких хороших свойств, которые мы уже в следующий раз разберём.

Topics: машинное обучение параметрические модели непараметрические модели регрессия наивный Байес метод максимального правдоподобия статистика функция правдоподобия MLE линейная регрессия

Учить по этому видео

- [Карточки по этому видео](https://sozai.app/ru/tools/ai-flashcard-generator/?from=transcript&id=76773)
- [Тест по этому видео](https://sozai.app/ru/tools/quiz-generator/?from=transcript&id=76773)

Бесплатно, составлено ИИ по этой расшифровке. Без регистрации.


---
This is the markdown twin of https://sozai.app/transcript/regression-problem-ml-pro-mipt/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
