Вводная лекция курса об искусственном интеллекте в химии и материаловедении, охватывающая методы, применение и практические задачи.
Ask about this video. Answers come from its transcript only — with the timestamp, so you can check them.
Generated from the transcript and can be wrong — check the timestamp.
Key Takeaways
- Курс сочетает теорию и практику для глубокого понимания ИИ в химии и материаловедении.
- Важно понимать математические основы и области применения ИИ для успешной работы с данными.
- Практические занятия помогут освоить написание алгоритмов и работу с реальными химическими задачами.
- Оптимизация кода и использование GPU критичны для решения современных вычислительных задач в химии.
- Генеративные модели открывают новые возможности для разработки лекарств и материалов.
What the video covers
- Описание структуры курса: лекции, семинары и практикумы с фокусом на ИИ в химии и материаловедении.
- Обсуждение математических основ и методов, лежащих в основе искусственного интеллекта.
- Рассмотрение областей применения ИИ в химии и материаловедении с примерами из научных статей.
- Семинары посвящены детальному разбору методов и их реализации, включая написание нейронных сетей и физико-химические дескрипторы.
- Практикумы ориентированы на решение химически актуальных задач с использованием Python и Jupyter ноутбуков.
- Обсуждение важности разделения данных на тренировочные и тестовые для проверки моделей.
- Рассмотрение работы с молекулярными и кристаллическими данными как отдельными направлениями.
- Объяснение необходимости оптимизации кода и использования GPU для сложных вычислений в химии.
- Введение в генеративные модели и их применение, в том числе для создания новых лекарств.
- Подчеркивание важности понимания метрик качества моделей и предотвращения переобучения.
Chapters
- 00:00Введение и структура курса
- 06:35Оптимизация кода и использование GPU в химии
- 13:03Химическое пространство: молекулы и кристаллические структуры
- 19:43История и определения искусственного интеллекта
- 26:04Работа с физико-химическими данными и кластеризация
- 32:03Метрики качества моделей и проверка на практике
- 38:09Применение машинного обучения в химии
- 44:28Генеративные модели и новые возможности
Full Transcript — Download SRT & Markdown
Speaker A
[Музыка] Она немного о структуре курса. Вроде бы все как обычно, как это бывает на любых других занятиях. У нас будут лекции, семинары, практикумы. На лекциях мы постараемся рассмотреть вопросы, наверное, можно сформулировать как что и где. То есть мы поговорим о методах, об определениях, о каких-то математических основах, то есть о том, что же заставляет искусственный интеллект, по крайней мере вот ту его часть, которая нам интересна.
Speaker A
определениях о каких-то математических основах то есть о том что же заставляет искусный интеллект по крайней мере вот то его части которая которая нам интересна ну и второй вопрос который тоже будет разбираться в изрядной степени на лекциях это вопрос где где в смысле
Speaker A
Ну и второй вопрос, который тоже будет разбираться в изрядной степени на лекциях, это вопрос где, где в смысле каких областях химии, в каких областях материаловедения мы можем применить ту или иную тему, которую мы будем обсуждать. И, конечно, будем стараться все время давать какие-то примеры, в том числе в виде ссылок на какие-то статьи, интересные человечеству последних лет.
Speaker A
которых будут в данных презентациях может меньше что некоторые сложности дополнительные данного курса являлась найти некоторый баланс между иллюстративно стью статей их новизной и тем что представитель стоит на такие сайтов за от методы поскольку как все прекрасно понимаем развитие метод
Speaker A
Которых будут в данных презентациях, может, меньше, что некоторые сложности дополнительные данного курса являлась найти некоторый баланс между иллюстративностью статей, их новизной и тем, что представитель стоит на такие сайты за от методы. Поскольку, как все прекрасно понимаем, развитие методов искусственного интеллекта, особенно в химии и материаловедении, это вопрос относительно свежий. Она ищет еще во многом нет тех вещей, которые уже успели стать хорошо проверенной классикой, поэтому приходится подчас выбирать по сейчас могли давать по сравнению, что уже успело устояться, но что еще является первыми попытками что-то реализовать.
Speaker A
первыми попытками что-то реализовать ok на семинарах в основном мы будем следовать за лекциями то есть подробнее разбирать то что было на лекциях смысле те же мет на те же подходы но улыбайся вопрос как как это реализовать то есть
Speaker A
Окей, на семинарах в основном мы будем следовать за лекциями, то есть подробнее разбирать то, что было на лекциях, в смысле те же методы, те же подходы, но улыбайся вопрос как, как это реализовать. То есть мы будем говорить на лекциях о чем-то общего математике или там областях применения, а на семинарах мы попробуем не просто обсудить это, но и показать конкретные формулы, которые нам интересны, и алгоритмы, которые помогут формулы реализовать в коде, в том числе, знаю, написать нейронную сеть своими руками, какие-то физико-химические дескрипторы. Пока слов можно не пугаться, разом мест мы все это будем подробно, подробно обсуждать.
Speaker A
написать нейронную сеть своими руками какие то физико-химической дескрипторы пока слов можно не пугаться разом мест мы все это будем подробно подробно обсуждать один исключение из этого правила будет собственно прямо сейчас понятно что первая лекция у нас будет водная то есть
Speaker A
Одно исключение из этого правила будет собственно прямо сейчас. Понятно, что первая лекция у нас будет вводная, то есть сегодня мы разберём некоторый такой глоссарий для всего будущего курса, новые термины, новые понятия, пытаемся придать ему некоторую структуру. Лекция будет очень насыщенной пони новых слов, но нет смысла пугаться, поскольку практически все эти термины будут еще раз разбираться куда более подробно.
Speaker A
ну а без дополнительного разборы мы оставим только те идеи которые нам кажется весьма и весьма очевидными и которые даже на вафтеры каких не содержат ну например идеи уровня того что если у вас есть много данных о которых вы хотите натренировать
Speaker A
Ну а без дополнительного разбора мы оставим только те идеи, которые нам кажутся весьма и весьма очевидными и которые даже на вафтеры каких не содержат. Ну, например, идеи уровня того, что если у вас есть много данных, о которых вы хотите натренировать модель, в принципе было бы неплохо часть из них оставить изначально про запас, чтобы потом эту модель на них проверить. Такие вещи мы разберем на этой лекции. Мы дальше будем считать, что в принципе это относится к любым, любым вещам, которые мы делаем.
Speaker A
окей ну и последняя последняя группа это практикума на практику мы попробуем решить различные задачи задачи адаптированы именно к химически актуальным задачам от анализа данных там представления в графиков картинок в питоне надеюсь мы сможем вас убедить что использование петю ноутбуков это удобнее
Speaker A
Окей, ну и последняя группа — это практикумы. На практике мы попробуем решить различные задачи, задачи адаптированы именно к химически актуальным задачам от анализа данных, там представления в графиков, картинок в Python. Надеюсь, мы сможем вас убедить, что использование Jupyter ноутбуков это удобнее, чем Excel, Origin и что-нибудь еще вместе взятые. И до вопросов в генеративных моделей попробуем с вами сгенерировать новое лекарство от COVID-19. Это, конечно, получится практикум. Если что, будут идти по мере усложнения.
Speaker A
будет возможности подробно разбирать ошибки синтаксически то есть я возвращаюсь к вопросам языка не поэтому очень внимательно больших прошу вас отнестись к первому же практикумом где как раз таки мы попробуем все эти ошибки рассмотреть и это что мы больше не
Speaker A
И к несчастью, на практикумах часто не будет возможности подробно разбирать ошибки синтаксически, то есть я возвращаюсь к вопросам языка. Поэтому очень внимательно, больших прошу вас отнестись к первому же практикуму, где как раз таки мы попробуем все эти ошибки рассмотреть, и это чтобы мы больше не совершали. Основную практикум будут преподаватели, которые вам помогут, подскажут, которые можно показать код, который сказать что и почему в нем работает неправильно, ну или пытаются разобраться в этом вместе с вами, поскольку количество потенциальных неверных решений, разумеется, превосходит количество потенциальных верных.
Speaker A
ну и практикум будет результат практикам и будет сдаваться формат судим уже ближе к самим практику общий набор тем которые мы хотим рассмотреть в рамках данного курса он также представлен в данном слайде это темы от химических данных от того с чем мы
Speaker A
Ну и практикум будет результат. Практикум будет сдаваться в формате судим уже ближе к самим практикам. Общий набор тем, которые мы хотим рассмотреть в рамках данного курса, он также представлен в данном слайде. Это темы от химических данных, от того, с чем мы работаем, почему химические данные там отличаются от каких-нибудь других данных, не знаю, финансовых, может быть, данных о погоде, ещё чем-нибудь, от картинок, где мы пытаемся там распознавать котиков на фотографиях, о том, что такое машинное обучение, о том, что к искусственный интеллект, где и как работают генеративные модели и что это такое вообще.
Speaker A
работаю генеративные модели и что это такое вообще отдельно разумеется рассмотрим как области во многом непересекающиеся это работу с данными молекулярными и данными кристаллическими ну и с прикладной точки зрения мы разумеется будем говорить о в языке python и для самых смелых и в
Speaker A
Отдельно, разумеется, рассмотрим как области, во многом непересекающиеся, это работу с данными молекулярными и данными кристаллическими. Ну и с прикладной точки зрения мы, разумеется, будем говорить о языке Python, и для самых смелых и в хорошем смысле слова гелевых мы дойдем до вопросов оптимизации кода, поскольку понятно, что все, что можно попробовать посчитать на обычном ноутбуке, уже кто не посчитал до вас. Это, скорее всего, очень интересные вместе на актуальной задачи требует использовать их на больших вычислительных ресурсов и, в том числе, вопрос оптимизации кода, ну или другими словами зачем химикам GPU, видеокарты, которые вроде бы традиционно относятся командиром или геймером.
Speaker A
вычислительных ресурсов и в том числе вопрос оптимизации кода ну или другими словами зачем химикам gpu видеокарты которые вроде бы традиционно относятся командиром или геймером ok но наверное самые самые главные камеры для меня лично слайд данного курса картинка которая очень люблю который
Speaker A
Окей, но, наверное, самые главные камеры для меня лично слайд данного курса — картинка, которую очень люблю, которую часто вставляю в презентации на различных конференциях, поскольку эта картинка в изрядной степени описывает мотивацию, нашу мотивацию, почему мы делаем то, что мы делаем, почему разрабатываем какие-то новые методы в вычислительной химии, используем алгоритмы искусственного интеллекта, квантовую химию, подчас что-то еще. Почему бы не пойти просто экспериментальным путем? Эти эксперименты у нас последнее мерило истины, и что не получается у нас сделать экспериментально, но с очень маленькой вероятностью виноват вот экспериментальная работа по сравнению с вероятностью того, что где-то ошиблись в моделировании.
Speaker A
что-то еще почему бы не чтобы не пойти просто экспериментальным путем эти эксперимент у нас последнее мерило истина и что не получается у нас сделать экспериментально но с очень маленькой вероятностью виноват вот экспериментальная работа по сравнению с у вероятность того что
Speaker A
Честный вопрос, почему и зачем нужно вспомнить такое явление, как street light эффект, эффект фонаря, и сказать, что любой исключительно экспериментальный поиск чего-то нового в химии, в разработке новых материалов, то есть тех областях, интересующих вас химического дизайна, он был всегда сопряжен с тем самым, как там фонаря, проще говоря, экспериментально мы обычно ищем там, где светло. Что же это значит?
Speaker A
химического дизайна он был всегда сопряжен с тем самым как там фонаря проще говоря экспериментально мы обычно ищем там где светло что же это значит предположим что мы занимаемся какой-то синтетической какой-то экспериментальной работы сопряженный с поиском новых соединений неважно причем
Speaker A
Предположим, что мы занимаемся какой-то синтетической, какой-то экспериментальной работой, сопряженной с поиском новых соединений, неважно, причем молекулярных, кристаллических, не может быть каких там более сложных структур, гетероструктур, еще чего-нибудь. Понятно, что у нас уже есть какие-то наработки, может, что-то пробовали делать, у нас возможно получилось, ну и скорее всего получилось, это же хорошо, если мы этим продолжаем заниматься.
Speaker A
продолжаем заниматься если мы что делали и у нас получилось значит у нас скорее всего есть прекурсоры у нас есть синтетические пути у нас есть какое-то представление которое держится уже на фактах с которыми мы сами поработали а значит верим потенциально больше всего ну или
Speaker A
Если мы что делали и у нас получилось, значит, у нас скорее всего есть прекурсоры, у нас есть синтетические пути, у нас есть какое-то представление, которое держится уже на фактах, с которыми мы сами поработали, а значит верим потенциально больше всего, ну или хотя бы на эксперимент на известных литературных экспериментальных же данных о том, что же нам нужно сделать, как можно слегка модифицировать то, что мы уже делали, для того чтобы улучшить таргетные свойства, для того чтобы получить материал, обладающий, знаем, другими побочными, обладающий другими побочными полезными или не обладающий другими побочными вредными свойствами.
Speaker A
другими побочными полезными или не обладающие другими побочными вредными свойствами и 2 нас действительно легко это коррелируется нашему потому чем дольше мы работаем в одной сфере тем с большей вероятностью будут сбываться наше предсказание том куда же дальше пойти в
Speaker A
И это действительно легко это коррелируется нашему, потому чем дольше мы работаем в одной сфере, тем с большей вероятностью будут сбываться наши предсказания о том, куда же дальше пойти в поля, в пути модификации уже известных нам соединений. И это все экономически оправдано, то есть действительно нам не нужно тратить много ресурсов для того, чтобы сделать что-то не очень сильно новое, при этом с большой долей вероятности, если мы уже сделали что-то хорошее, что-то следующее тоже хорошее. Во.
Speaker A
хорошее что-то следующее тоже хороший вогнал чуть получше окажется точно близко от первого нашего первые наши удачной попытки поэтому достаточно часто у нас нет никакого повода из этого освещенные зоны в котором мы вроде бы все знаем куда то выглядывать в темноту
Speaker A
однако в темноте как мы понимаем спрятана куда больше потенциально возможных соединений чем то что мы видим перед собой есть например говорить про малые органические молекулы vc2 которых находятся потенциальные все известные нам лекарство ну или там практически все известные нам лекарство
Speaker A
красители любые другие соединения функциональные которые мы можем придумать лиганда для комплексообразования для концентрирования разделения все что угодно то в самых больших базы данных которые мы можем придумать содержащую информацию об этих соединениях будут съезжаться но в миллионы десятки сотни может быть даже
Speaker A
миллионов соединений при этом когда я говорю может быть даже чаще всего я имею ввиду что это будет информацию о существовании самих соединений но ничего не будет известно об интересующих нас свойство может возможности не никто никогда не синтезировал просто
Speaker A
предсказал что он может быть при этом эти величины давать сверху их опишем как 10 в 7 даже 10 в 8 степени различных структур меркнут на фоне потенциальной оценки количества всего возможных органических соединений по некоторым оценкам общее число их может достигать 10 в 60 степени
Speaker A
то есть очень и очень большой долей вероятности какой мы с ней не нашли который обладает нужными нам свойствами скорее всё найдётся не некоторые будет еще лучше возможно еще дешевле в производстве и возможно обладать с меньшим количеством побочных свойств возможно еще что то
Speaker A
разумеется здесь и не зря неоднократно повторял слова возможно возможно первые 10 попыток которые мы сделаем приводит нас к экономическому краху новости нет мы никак не найдем поэтому подход с поиска там где светло он разумеется а правду оправдана тем что не имея никакого некую
Speaker A
мотивации некую уверенность о том что где то там в темноте есть то что нам нужно и хоть какого-то направление куда нам все таки нужно смотреть ну нет никакого смысла пытаться делать стрелять в пустоту и скажет новый абсолютно случайным путем нам не хватит
Speaker A
жизни перебрать все возможные варианты при этом не буду им теоретические методы расчетные является образным карманным фонариком которые можно посвятить по странам и хотя бы приблизительно оценить что же прячется в темноте что прячется в той темной части парка ну или в той темную
Speaker A
части химического пространство пространство мало хронических молекул пространство кристаллических структур и может быть там есть что то что кажется нам перспективным перспективным полезное ключевым можем придумать какой-нибудь метод синтеза ну или хотя бы не закрыт импотентом при этом разумеется на этапе такого первых
Speaker A
предварительного поиска мы можем использовать наверное любые методы теоретической химии от квантовой химии которые являются наиболее таким обобщим методом которые позволяют в большинстве стоимостью особенно говорим про бы низшего методы делать точно уверены и предсказания в независимость того в какой области химического пространство
Speaker A
мы находимся до каких-то более параметрических методов метах основанных на пол эмпирики нами же томных взаимодействиях каждый из которых парализована в своей области поэтому хорошо работает только в ней но и до метров о которых мы сейчас говорим о машинном обучении об искусственном
Speaker A
интеллекте почему же последним наиболее выгодны опять же возвращаемся к количество возможных вариантов нам нужны всегда те методы для самого первого самого простого скрининга который способна работать с наибольшим количеством соединений который способны рассмотреть наибольшее количество вариантов за разумное время если мы будем делать
Speaker A
расчет с одного соединения дольше чем придет эксперимент с большой долей вероятности от расчета уже окажется никому не нужен делать эксперименты кажется быстрее расчеты понятно делать имеет смысл не для одного соединения ну нам случае мы не говорим о тех расчетов
Speaker A
которые пытаются пояснить какой-то уже известный эффект путем заглядывания подглядывания на электронный уровень детям грима скрининге то имеет смысл работать с десятками и сотнями сотнями тысяч соединений для того чтобы действительно найти какие-то большие группы перспективных полезных кандидатов то есть получается что основное
Speaker A
назначение методов искусственного интеллекта которые можно предложить в химии это область это быть никаких некоторыми системы поддержки принятия решений действительно саппорт systems то есть показывать где перспективно вести поиск показывать куда интересно заглянуть чтобы найти что-то новое чтобы заниматься уже куда более направленным
Speaker A
химическим дизайном соответственно и в рамках в рамках ты мотивации строятся и цель нашего курса где-то чтобы к большому несчастью возможно из-за хайпа по отношению к этим методом к ним часто складываться такое несколько мистическое отношении как некоторым шаманизму то есть очень часто
Speaker A
не обращай внимание на то как на самом деле работает эти методы и конях что очень важно быть применимости их результатам или по умолчанию доверяют считаю это некоторые истины в последней инстанции или также однозначно не доверяет но я уже не говорю там а
Speaker A
попытка добавив что то такое просто потому что модная тема уже в рамках данного курса мы попытаемся рассмотреть огромное семейство методов обозначить какие методы применимы и к решениям каких химических задач научить вас разбираться в этом что понимать и например читая статьи или работы своей
Speaker A
научной работой какие методы адекватно применить ну и дать вам в руки какое-то количество инструментов которых инструментов которые после вы сами сделать на этих практикумах которые вы можете уже на каком-то этапе научной работы применять к своим к своим задачам
Speaker A
окей прежде чем разбираться с этим давайте попробуем обозначить основные определения на самом деле уже на этом этапе можно чуть ли не строить весь курс и посвятите это время спорам о том где начиная с одно заканчивается другое о том что
Speaker A
такое дата сайнс чем fish intelligence искусственный интеллект отличается от машинного обучения и зачем все это нужно для интереса здесь взяты определения просто с англоязычной википедии и что характерно накажет советских страниц можете убедиться сами таких определений будет несколько согласно ст а там разных
Speaker A
людей в данном случае мы постараемся не вступать в подобные споры и обозначим такие общие идеи которые мы будем в рамках нашего курса разграничить и понятия ну и что даже чуть важнее бы значит иерархия этих понятий и наверху это иерархия будет располагаться наука
Speaker A
данных data сайнс кто является наиболее общим и всех понятие с которыми мы будем с вами работать и она объединяет в себе очень много различных областей различных наук из которых в первую очередь конечно нужно выделить математику на именно статистику с которым можно увидеть
Speaker A
информатику теория алгоритмов ну и что часто бывать специфично для нас это те области химии и области материаловедения физики которых мы работаем с соответствующими данными поэтому химическим данным но будет посвящена отдельная лекция коротко можем сказать что основной принцип работы с данными это добычи нга
Speaker A
обучал если вы закинули в вашу модель какой-то мусор на выходе вы получите какую-то чушь чтобы этого не было мы с вами попытаемся разобрать много много вариантов о том во первых что же делать с некоторыми несортированным данными которые есть
Speaker A
возможно в разных источниках разного качества как привести к единому виду как привести к машины читаемого виду прежде чем можешь дойти до работы с алгоритмами то есть дать его следующее определение в нашем списке плене вкусного интеллектом пожалуй это самое
Speaker A
определение спорные потому что возможно у каждого есть много свое определение часть методов относят к искусственному интеллекту часть не относят до споров данном случае мы вообщем что искусный интеллект это совокупности алгоритмов относящихся к науке данных кто-то сами которые умеют выполнять действия которые
Speaker A
буквально недавно мы считали прерогативой исключительно человека то есть сам термин искусственный интеллект на самом деле кроме того что является калька с английского языка на удивление еще не очень удачной калькой поскольку хотя обычно бывает наоборот но английском языке использую два различных
Speaker A
слова которые мы будем периоде словам интеллект но естественно в слове intelligence который сейчас написано слайде нет у чего-то антропоморфного нет про искусственные мозги плавающий где-нибудь нету матрицы у стоящего скайнета у нас звучит немного более зловещим но тем не менее по сути
Speaker A
является просто теме алгоритмами которых мы не пытались напрямую задать какой-то условный выбор какое-то действие ответ на известный запрос некоторые за этого могут выполнять те процедуры те действия которые мы считали присуще человеку ну то есть например большинство этих примеров они уже
Speaker A
окружают нас в реальной жизни там распознавания изображений распознавания лиц позволяет платить лицо он за проход в метро в ваших смартфонах уже вы наверное во всех смартфонах алгоритмы подскажу какое следующее слово набрать вместо старого то 9 в смартфонах по новее помимо основа процесса и есть
Speaker A
еще маленький чип который делает вашу фотографию для instagram и чуть более 100 граммами что во всех этих случаях у нас нет такого то однозначно условного выбора где мы играли бы с машиной в вопросы отклик каждый раз это действо очень похожи на
Speaker A
человека действие человеком ну и во многих случаях это в прямую имитирует работу человека как например какие-нибудь чат-боты если мы говорим про следующий плиния машинное обучение это понятно что от искусственной селекции чем сложно его отделить это некоторое более узкого бы искусственным
Speaker A
интеллектом в которой мы соберем алгоритмы искусного интеллекта которые не работают напрямую не запрограммировано достачно строго а вместо этого способны обучаться на известных данных определений разумеется не строгая границы между в общем искусственным интеллектом и конкретно машину обучением является что плавающий и проводит как я
Speaker A
уже говорил и и несколько по-разному но мы будем воспринимать то именно так и на последующих занятиях попытаемся рассмотреть что ж будем носить к машину обучения что к более общим областям ok давайте попробуем сделать некоторые такой спойлер ко всему будущему курсу и
Speaker A
обсудить общие принципы общие принципы которыми с которым будем работать в различных применениях но и наверное в рамках всего нашего вашего курса понятно что в основе всех наших всех наших процедур с которыми мы хотим работать будут лежать тельные данные
Speaker A
сейчас мы просто перечислим эти понятия мы немного расскажем о них буквально в паре слов но дальше разберём их конечно же подробнее данные данные вернемся к ним могут быть совершенно разноплановые журнал лабораторные которые где-то там пылиться в углу тоже в принципе задержки
Speaker A
это очень полезным данным доведите своего борту ножного максимально аккуратно данные могут быть куда более удобных видах сейчас сейчас спою термы компьютер снова ради да и там то есть данные которые можно взять использовать в как он предлагает нам в которых мы еще с вами
Speaker A
поговорим данные могут быть размечены и не размечены то есть они могут содержать информацию например у среди них которые обладают каким-то свойства многие просто быть списком каких-то соединений которые например у вас хранятся в шкафу но и данные получается могут быть
Speaker A
получен из разных источников по мере на на разных приборах содержать различную ошибку быть шумными быть смешанными содержательности ряд мета-данные очень и очень много всего придется сделать прежде чем заняться моделированием с их с их помощью какие в общем задачи мы бы хотели решать
Speaker A
но самая простая задача задача машину обочине сдача классификационная то есть мы хотим научиться предсказывать сказывать глядя например на структуру какой-нибудь органической молекулы обратно обладать каким-то свойствам или не будет ну или в более общем случае а каким из списка свойств она будет
Speaker A
обладать ну то есть например будет ли она растворимого в воде а может быть она будет растворим в ком-то другом растворителе а может быть мы сразу предложен список растворителей и просим оценить вероятность в котором эта молекула будет растворяться это вещество
Speaker A
с этой известном регулярность который будет растворяться в каждом из них диета я просто я в принципе любая задача садящийся к бинарным классификации но наверное сам простая задачка будем работать чуть чуть более сложная задача регрессии то есть в данном случае мы хотим не
Speaker A
оценивать принадлежность к какому-то классу а потом пытаться предсказывать какое-то значение значение численные если мы говорим например опять про ту же растворимость в воде там уже хотим не про сказать на основании там какого-то граничного значения растворяется или нет опускает и самую растворимость ну
Speaker A
например там в молях на литр есть uber на твердом теле но почему бы нам не взять не предсказать случай классификации является ли соединение диэлектриком или может быть полупроводником или проводником ну или для регрессию попытаться предсказать ширину запрещенной зоны для полупроводников
Speaker A
следующим по логике вещей его задача кустари зации идеологической начну похоже то есть мы тоже разбиваем известный нам соединением на какие то группы существенным отличием является только то что в данной задаче у нас этих самых лейблов меток группы изначально нету мы
Speaker A
пытаемся найти внутри самих соединений внутренних структур на той информации физико-химическая какое-то еще которое мы знаем какие то взаимосвязи которые покажут что одни соединения больше похожи на другие и они все как-то удобно кучкуются о какой-то большой области чаще задач который будет работать с
Speaker A
большим количеством данных поскольку ну просто не размеченных данных разумеется больше чем размечена то есть данных о принадлежности об измеренном кому-то свойство всегда сложнее найти чем просто данных о том что такие структуры есть задача которую разумеется возникает в мечтах любого человека
Speaker A
который начинают заниматься методами искусственного интеллекта и задача следующая задача генерации задачи которые в заветной степени обусловлено нашей линию нашим желанием сэкономить время не пойти пить кофе пока компьютер сам предлагает соединение которые будут обладать нужным нам свойствам задача хочешь добавлен очень важно поскольку
Speaker A
как я говорил чуть ранее поле перебора огромные носы научимся предсказывать q это свойство для например органических молекул мы даже с очень быстрым методом потратим жизнь чтобы перебрать все органические молекулы а значит нам неплохо бы искать какие-то алгоритмы которые умеют искать
Speaker A
пути который умеет оптимизировать нептун явно заданную функцию которую ми таскает много и минимум новые максимумы на интересующем нас поле перебора причем желательно делать разумеется не за бесконечное количество шагов значит генерации ну и связано с ними задачи оптимизации мы будем как раз
Speaker A
относить к тем областям искусственно интеллекта который уже немного выходит за рамки машинного обучения делим эту машину починят уже в них была присутствовать оптимизация очень похожи на генерацию только мы хотим оптимизировать например в известную функции какие-то ее внутренние параметры
Speaker A
ну например мы хотим оптимизировать например геометрию трёхмерную геометрию для органической молекулы обычные алгоритма оптимизации еще убираешь и локальный минимум а можно ли мы придумать алгоритм который найдет сразу же глоба не именем ну и вы сами принц и попробовать это сделать на одном из
Speaker A
практику ну и сдача анализа это некоторый выход за пределы вопросы перебора то есть иногда мы хотим не просто узнать предсказать какое-то свойство или найти молекулу который отвечает он устройств найти новую кристаллическую структуру попытаться понять уже на известных структурах а какой же элемент структура
Speaker A
какая же функциональная группа какой же не знаю может быть элемент химически отвечает за таргетные отлетом уже нужно нам свойства в известных нам соединениях и такие задачи часто тоже можно решать если мы хватает данных из нас есть подходящие инструменты
Speaker A
методов понятным делал множество мы будем их рассматривать понемногу за лекцию часть из них мы попробуем прямо на семинарах то есть то что мы называем в кавычках поскольку понятия классики для таких новых методов наверное еще громко применять но тем ни менее назовем
Speaker A
классическим машинного обучения то что еще называют шилу машин людям то есть мелкое машинное обучение в противовес deeply о нем это точно широкий диапазон методов основных на деревьях решениями линейной регрессии их наверное нет смысла сейчас я перечислять отдельно мы сделаем
Speaker A
посмотрим на список чуть позже для того что пытаться уютненьких закономерности ну и попробуем уже эти методы использовать дойдем до них это нейронной сети разумеется которые являются наиболее таким нашумевшем примером искусственного интеллекта благодаря огромном разнообразии архитектуру благодаря из-за этого огромному
Speaker A
разнообразию областей применения ну и еще ряда параметров которые мы о нем чуть позже и неровностям будет посвящена отдельная лекция но и отдельные группы которые тоже здесь немного спорно классифицировать вместе по отдельности как называть это алгоритм эволюционно имитирующие дарвиновскую эволюцию и
Speaker A
алгоритмы роевого интеллект и имитирующие кооперативное поведение например некоторых животных там рой пчел колонии муравьев стаи волков или еще кого-нибудь все эти задачи можно спорить для поиска лучшего пути для оптимизации какой-то там нам неизвестны и функциями мы тоже попробуем с этим всем поиграться
Speaker A
отдельным пунктом которым из очень часто буду вспоминать это пункт сравнения данных в плане того является не человека читаемыми или машиночитаемых съемные дабл или машин придумал этот пункт особенно важно именно в химия поскольку одним из самых сложных вопросов в
Speaker A
действительно использованием метров scusa интеллекта на хорошем уровне чтобы мы с ним получали какие-то предсказательные модели является вопрос как научить машину такому абстрактном указал понятию как молекула или как кристаллическая структура десятки вариантов как это сделать десятки к тех которые более-менее
Speaker A
работают сотни тысяч тех которые не работают разумеется ну и попробуем с вами перебрать их возможно даже над тем какие то новые отдельный вопрос это что же мы оптимизируем дело в том что часто хотим найти хотим найти некоторые неявно заданное
Speaker A
соотношение наборы иксов игреков то есть ту самую функцию f от x равно y функция мы на самом деле не знаем и очень часто ее не существует в аналитическом виде и даже под частном целиком ты не нужно мы хотим найти где-нибудь минимум или
Speaker A
максимум ну или просто предсказывать ее значение в известных точках несмотря даже на общее падение этой функции поэтому часто мы используем будем с политики косами понятия как функция потерь функция ошибок то есть та разница между правильным ответом этим ответом
Speaker A
которые мы там словно предсказывали ну и разумеется мы импульс какими-то метриками качества которые мы будем представлять которые вы будете представлять на практику доказываю нам что ваши модели действительно заслуживают зачета которые мы все публикуем в статьях и по которым мы же
Speaker A
самое главное понимаем вообще можно этой моделью это пользоваться отдельным нужно последние вопросами как раз будут вопросы которые мы целиком с этим на этой лекции это вопрос о том что что дело с данными до того как начать собственно саму
Speaker A
тренировку один вопрос я уже костный упоминал это вопрос о том что если у вас есть данные нельзя лениться нужно оставить какое-то количество их на тестирования вашего метода поскольку в принципе наличии хорошей работы на и на тестом наборе данных то есть на данных которые модель
Speaker A
сама не видела и делает вашу модель предсказать на делает вашу модель полезным инструментом потому что разумеется если мы имеем дело с кем-то алгоритм который зависит большого-большого количества параметров его очень-очень легко подогнать под известные данные так чтобы она вписывалась любой заодно и интересующий
Speaker A
нас точности но при этом понятное дело он не будет никак общался не будет никак предсказывать новые значения и значит будет у нас абсолютно бесполезен обычно вопрос как избежать переобучение является специфичным по отношению к данным еще более специфичным по
Speaker A
отношению к методам и те и другие вопросы мы рассмотрим соответствующих разделах нашего курса но какие-то общие такие банальные рекомендации которые относятся к любым методом любым данным пытаемся создать уже в ближайшее время ну и последний вопрос вроде бы самых
Speaker A
банальный но при этом например с точки зрения философии науки опера самый важный это где же границ применимости у модели то есть принципе если верить оперу любая научная теория будет отличаться научные наличием возможности и фальсифицировать но или иными словами
Speaker A
наличием у нее границ применимости разумеется у хорошей модели машин обучение должны были границ применимости если натренировали что-то на не знаю данных о кристаллической структуре неорганических соединений хотим поискать культом энтальпии образования этого соединения разумеется без местным это будет использовать для каких-нибудь
Speaker A
например пользовавшийся белков абсолютно разные области применения моделей и хотя формально мы сможем загружать данные например от структурах ци файл везде одинаковый но это будет например добычи добыча вот машина всё съест вместе формат будет подходить не выдаст ошибки мы получим откровенную чушь поэтому без
Speaker A
обозначения области применимости само по себе модель является разумеется вот у нас практически бесполезной ok давайте давайте попытаемся все это рассмотреть уже каких-то более конкретных примеров уже из области химии материаловедения а не говорить там например о беспилотных автомобилях этот пример сейчас находящийся на слайде
Speaker A
пример из нашей работы чтобы не быть голословными данной работе мы пытались построить модель и удалим машинного обучения которые вы предсказывали константы комплексообразования различных органических соединений с точной широким набором различных металлов в известных условиях при этом в качестве входных
Speaker A
данных поднялась бы только структуры тот сам органическое соединение в интересующей нас области который частную схемы информатикой применением искусственного телег то при не вашем обучении химии такая задача сейчас называется kers pr кончита эти строчки про питера лишь количественное соотношение структура свойства то есть
Speaker A
мы хотим из известном структуры структуры который находится на слайде это типа искать какое-то новое свойство и на данном слайде изображен в принципе общая идея общий план такой работы точно классическое в плане применения машинного обучения химии т.е. для того
Speaker A
чтобы все это сделать нам собрать какую-то базу данных на первом этапе мы честно все время собирали то из отдельных статей многие баз данных уже есть многие базы данных приходится создавать самостоятельно и собирай например где-то литературные данные или пример про какие-то расчеты
Speaker A
мы насчитали домен и независимыми методами то есть место у кого-то низкого уровня в квантовой химии ну или много много еще вариантов на первом этапе нам нужно это самая базы данных базы данных должна быть очищена стандартизировано например данном случае мы знаю что
Speaker A
комплексообразования будет зависеть от температуры отъемный силы и поэтому нельзя валить в одну кучу данные полученные при абсолютно разных значениях абсолютно разных с ментальных условиях разумеется мы получим какую-то бредовая модель в итоге то есть мы все это приводили к единому виду возможно
Speaker A
иногда даже выкидывает данные которые нам конечно очень бы хотелось применить но которые не подходили под наши критерии под наши правила фильтрации после чего про химические данные соответственно будет у нас лекция подробно после чего данные о структуре которые записаны в
Speaker A
обычном известно еще со школы видео в виде какого-то двумерного изображения мы переводили в машиночитаемой vic v и вектора известным длины постоянной длины то который мы кодирова ли какие-то структурный элемент какие-то физико-химические свойства зовем это не таким вектором признаков
Speaker A
фича вектор эти виктор ал уже в свою очередь отправлялись на некоторую модель машинного обучения нам случае мы использовали нейронные сети пробовали другие варианты но так и начнем модели тренировались и на выходе мы предсказывали таргет на ином значении собственно такая работа является самым
Speaker A
таким классическим простым примером применения методов машинного обучения в химии но и в принципе с таких работ используя машинное обучение в химии и началось и это раз на также является хорошим примером того того набора принципов о которых я говорил чуть выше
Speaker A
то есть проводим чуть чуть подробнее рассмотреть часть из них для начала конечно же о данных как я говорил данные данные основа для всего данные это то что нам нужно без них нету смысла начинать эту историю часто на говорим именно больших данных
Speaker A
это не сюда действительно справились необходимо но хочется чтобы было побольше так меня например на каждые наверное конференция где я особенно не профильный конференция где я делаю доклад связанные с применением ментов машину обучением всегда задают один и тот же вопрос в
Speaker A
любой в аудитории с любых слушателей а сколько она хватает я каждый раз честно отвечаю что не знаю знаю потому что этот вопрос не является универсальным вопрос очень зависит от характера самих данных от их частоты точности от метода которые вы используете от желаемых
Speaker A
результатов поэтому это вопросы будем потихоньку разбирать но наверное весь наш курс обычно на это такой классической диаграмме i smell the sun's данным у нас находится в самом низу данной пирамиды изображены самым самой большой площадью если ты на таких данных
Speaker A
больше всего по данным под и знаем какие то отдельные факты чтобы не структурированное чтобы хранящейся возможны в разных форматах то есть данные сильно будет являться и записи в лабораторных журналах в чем-то очень хорошим страх на идеальном мире м2 что есть среди
Speaker A
слушателей те кто этим пользуется в электронных лабораторных журналах данные часто не аннотированные разнородные то есть к данным например по дну проекта могут носиться и структуры известные нам и какие-то например спектральные данные которые часто еще закодированные в венгерских форматах
Speaker A
соответствующих строме трав их можно открыть там только на том компьютере на котором установлены специальные программы вставлен специальный ключ и так далее часто эти данные еще и в форматах которые мы не ожидаем увидеть ну или не можем например хорошо анализировать
Speaker A
то есть какие-то графики которые были напечатаны эластична старых журнальных статьях дремучих лет и которые даже каким-то попытками сканирование распознавания не очень переводиться в число и формат который нам бы очень нужен и прежде чем использовать все мешанина все это болото у нас прикормка затягивающим
Speaker A
нам нужно пройти серьезную процедуру упорядочу не этих данных добавления к ним контекста добавления к ним метаданных возможно добавление каких-то лейблов какой-то маркировки этих данных очистку практически осмотр не стоит доверять там результатом получено после 2 часов ночи ну и так далее то есть
Speaker A
много предстоит сделать еще до работает специфичные к нашим темам прежде чем данные превратятся в какую-то более менее полезную информацию в принципе эта часть этот вопрос у нас к несчастью не очень формализуется и поэтому как против данные в информацию
Speaker A
но это является вопрос с эпичным каждому отдельному проекту каждом отдельном направления работы к действию у каждой лаборатории в этом кончается моим здесь не можем ничего хорошего сказать если что можем сделать это показать какие же данные можно назвать информацией и что
Speaker A
же такое и точно уровень дельта это все таки что то структурированное что-то с известной погрешностью однородное некоторых случаях это размечены данным некоторых не размечен то есть содержит информацию например ком-то свойство или не содержится это данные которые доступны это данные которые мы можем использовать
Speaker A
в дальнейшем и которые мы хотим использовать сами для моделирования в принципе информация путь тест очень информация данных мы сравнить навернулся написанием статьи где мы берем а ты стой куча огромных количествах который мы накопили за время работы по какому-то направлению
Speaker A
в комната проекту мы пытаемся делать связный текст подкрепляя его картинками подкрепляю его таблицами чтобы прийти к какому-то выводу в конце к несчастью статьях мы обычно например склонны публиковать успехи химии они не успехи при том что для как мы увидим в
Speaker A
дальнейшем хорошей тренировки моделей нам нужны разменять данная неудача но тем не менее в статьях часто в идеале содержится то что мы уже готовы называть информации особенно в статьях которые связаны с построение модели поскольку сейчас в журналах на хорошим тоном является не
Speaker A
только публиковать результаты моделей но естественно публиковать те набора данных которые к этим отелем привели ok если мы сделали модель на основании данных можем уже получить какое-то новое знание мы видим какие-то зависимости структура свойства от структуры мы понимаем что во время как это
Speaker A
функциональной группы у нас изменит свойство нашей молекулы мы понимаем что внедрить чем-то пировать наше соединение для того чтобы она стала чуточку лучше ну или чуточку хуже возможно и на основании этих самых на основе той самой информации скруглен отобранную нами мы
Speaker A
уже получаем какое-то новое знание в принципе эти две области на этом графике информация но жить мы будем снова рассматривать в рамках данного курса на основе этого знания ответственному надеюсь можем очень какой-то мудрость плит новой закономерности глобальные литье таких-то эмпирических
Speaker A
вещей эмпирических летом дипломатических предположение каким-то новым возможны фундаментальным законом но и главное преисполнился понимание в том что мы на самом деле делаем с нашей работой нашей интересующей нас области ну и как я говорил в данном случае инструмента искусственного интеллекта
Speaker A
алгоритм искусственной 3 тыс на являются удобными инструментами для того чтобы прийти со второй ступеньке на третью в данной схеме ну и в каких-то случаях возможно послужить неплохим поспорим чтобы возможно заглянуть на четвертой ступени не зря слайд называется big data как я
Speaker A
уже говорил потеряли бы конечно не павших данных было много так ли это но как и любое такое что простое утверждение основано статистике она конечно никто долю лживо до чаще всего чем больше данных тем лучше почему чаще всего я там что многие мет например
Speaker A
машинного обучения которых мы будем говорить они способны работать только с ограниченным количеством данных точнее говоря исписанной работать кем угодно количеством давно но это не придет к улучшение производительности за пределами какой-то их собственно внутренней границе можно сказать что в этом
Speaker A
в этом ограничении открылось новое преимущество нейронных сетей глубокого обучения и откуда возник такой бум именно этой области в это сайнс и почему это сделал дал толчок развитию всего искусно интелекта в целом и о том что такого ограничения по
Speaker A
количеству данных нет а у нейронных сетей и у них нет на происходит тот самый гигантский переход количества в качество когда он переходит светильник big data мы начинаем получать новый качественный результат сложно данном случае только сказать а что же нас такое big data
Speaker A
потому что не очень понятно скорость на данных нам нужно чтобы минимально построить на примерку это модель чтобы научиться чему-то в знаю экспериментальной работе мы часто получаем десяток экспериментально точек и в принципе по частным этого хватает чтобы вы для себя там не использовать их
Speaker A
методов машинного обучения в голове положить какой-то уже гипотезу сумме можно сказать построить такую вот умозрительная модель происходящего в нашей экспериментальной работе для того чтобы заработали методы машинного обучения обычно мы хотим собрать хотя бы сотню сотни тысячи таких точек что уже в
Speaker A
рамках например экспериментальной работы в отдельной группе становится очень сложной задачей но с учетом поиска данных литературных с учетом возможности подключения данных разнопланового характера чем мы тоже очень много поговорим позже задач уже кажется более-менее выполнимой для самых разных областей химии ну и на
Speaker A
самом деле и развитие это методов в машину обучения тоже на месте не стоит и если раньше я бы мог например на аналогично вопрос продам на ответить что меньше сотни вообще бесполезно о чем-то думать то сейчас я уже могу сказать том
Speaker A
что в принципе есть есть возможности как использовать различные техники так оценкам трансферное обучение еще чего-то которых тоже будет лечь подробно на следующих лекциях для того чтобы попробовать построить модель и на восстающих на маленьких учим данных принципе чтобы не быть голословным
Speaker A
картинка на слайде это из нашей работы где мы показать что можно предсказывать свойства каких-то органических молекул модель при этом тренировать буквально несколько десятков молекул хотя обычно ведь нужно несколько тысяч понятно что здесь dfm details что за тренировкой такой модели прячется
Speaker A
тренировка другой и очень большой модели но тем немее такими обходными путями частым можем избегать приставки big в нашем сочетание big data и работать с уже теме количественными которые реально получить самим за ограниченное время с ограниченными ресурсами ok при этом я повторяю слова данной раз
Speaker A
от раза и буду делать то еще много много раз в течение нашего курса при этом чаще всего на первом этапе я говорю про данные как о чем-то human ряду был как о данных который мы с вами можем посмотреть и понять известном
Speaker A
графики структуры что-то еще при этом машин на эти давно не воспринимают отдельный семинар 1 отдельно senor будет посвящен тому что мы пытаемся конвертировать данные из человека читаемого вида в машиночитаемой причем отдельную будем работать в этом направлении с данными например молекулярных структурах
Speaker A
и отдельно с данными о твёрдом теле принципе вторая область вообще на сито недавно начала развиваться и про неё мы знаем меньше возможно возможно мы с вами стоим что-нибудь новое в этом плане сейчас поэтому не буду забегать вперед к
Speaker A
каким-то особенностям алгоритмов всего лишь пытаюсь обозначить такими общими масками какие результаты мы хотели бы получить результате действия этих самых алгоритмов то есть что же такое достану фичу вектор вектор свойств вектор признаков а который мы хотим описать нашу структуру
Speaker A
для того чтобы дальнейшем использовать это в рамках обучения чаще всего это как небольшой директор говорит чаще всего потому что для разных методов можем использовать вместо vectra q эту матрицу известного размера использовать даже текстуру последовательность использовать тендер кого-то другого порядка отличные от
Speaker A
вектора но тем не чаще всего мы работаем с вектором постоянной длины при этом этот вектор нужен алгоритму а мы сами чтобы получить его работаем с часто не однородными данными данными разных типов это могут быть не зная структуру молекул записаны в строкам
Speaker A
представления обсудим на следующей лекции это могут быть картинки картинки известны на мой учебников это какие-то модели кристаллических структур возможно эта структурная формула даже без отношения к этому как например все это расположено в пространстве то есть возможно вы просто составы
Speaker A
возможно что-нибудь еще одно это будут спектры мы можем действовать с ними разными путями можем какие-то придумывать свои признаки глядя на структуру говорить например здесь есть какой-то элемент значит мы поставим в этом на этой позиции вектора свойств галочку примера здесь есть третий элемент на
Speaker A
третьем месте вектора длиной в 104 там или сколько элементов мы хотим закодировать мы поставим галочку и о наличии можем придумать какие-то простые физико-химические параметры которые мы можем легко посчитать или померить например знаем структуру пытаемся оценить плотную запишем плотность как
Speaker A
один из параметров нашего соединения можем уйти от этого нужен кодировать плюнуть различные алгоритмы чтения структуры и кодировки в виде вектора конечной длины с этим мы с вами тоже еще успеем поработать 0 умножить на 5 и сказать что мы очень очень ленивые и мы
Speaker A
хотим чтобы мы не сами придумывали варианты признаков описания они которая горит он сделал это за нас какой путь из всех этих лучше какой хуже сложно сказать когда я несколько лет назад уступал на конференции american chemical society митин и
Speaker A
имела неосторожность сказать что чем меньше мы физики и химии добавляем вот процесс тем лучше получать результат это вызвало мягко скажем бурное обсуждение в зале и воскового за напополам возможно истина где-то посередине и действительно правильного ответа нет из общего можно сказать том что неплохо
Speaker A
бы чтобы какой бы нет мы не использовали он давал нам данные одного масштаба плохо будет если мы запишем в один тот же вектор от какого-то тесты которые например будет описывать оперировать сотнями тысяч так далее каким-то высокими степенями или другого
Speaker A
теста который будет оперировать десятыми долями для разных методов машину обучения это приведет к разным проблемам и скорее всего не получится хорошего результата по разным причинам которую опять же обсудим позже но для себя отметим что неплохо бы данные так или иначе приводить к единого
Speaker A
масштаба ну и что в общем более важно для того чтобы понять где делал газ применимости данной модели где и при кабинете domain можно сказать такие вектора будут формировать пространство пространство в котором мы получается начиная с сегодняшней лекции и будем работать в
Speaker A
плане построение моделей тренировки моделей поиска там новых соединений чего угодно то есть какое-то внутреннее вечера ты частый которым так иначе записанная информация об известных нам даны уже в закодированном виде уже характеристик это пространством быть разные например в нем могут иметь смысл физически и
Speaker A
химически расстояния между точками то есть чем ближе друг другу находится два соединения в этом пространство тем они ближе по свойствам такой может не выполняться каждый раз по-разному зависит от меты которые мы использовали которые мы с вами ещё попробуем попробую
Speaker A
реализовать ну и в итоге эти данные в этом сам пространстве определят при кабинете domain область применимости нашей модели для чего же можем его реально использовать то есть подводя итоги сносным определением в нашем всем рассказе будет являться дата сами снова
Speaker A
к данных и данные придется обрабатывать прежде чем из них что то сделать но дальше по методу сужения широты термина мы можем прийти к искусственному интеллекту который работает с чем-то что раньше считалось присущим только человеку и до машинного обучения которое имеет учить модели на
Speaker A
данных без того что у меня на завалить это условия кит условные выбор у нас очень часто работает такая вещь как переход количества в качество чем больше данных тем в общем данные как я вас к нужно предварительно обрабатывать ну и данный могут быть
Speaker A
размечены могут не размечен ими и в тех и в других вариантах есть на самом деле много новой полезной информации которые можно извлечь то есть не всегда можно сказать что если данный не размечена нам делать тут нечего возможно как раз таки
Speaker A
здесь и будет кроется ответ на но если на самый вопрос самое главное просто в жизни вселенной и всего такого то хотя бы на вопрос для нашей текущей научной работы ok задача коротко уже сказал но переведу этого технологию которая чаще
Speaker A
используется вот эта сайнс 3 класса задач обучение с учителем то есть как раз таки работа с размещенными данными это классификации регрессе которые мы уже обсуждали насладиться пример одной из его на классификационных задач определить это чихуахуа или маффин в принципе с нами
Speaker A
сейчас не был очков я бы ставил на этот экран издалека возможно для меня самого колбы сложной задачи это задача регрессии песка не какого-то параметра конца навального по известного вектору к известной структуре например химической если мы работаем с данными неразмеченным
Speaker A
это это называется обучением без учителя это в первую очередь задачи кластеризации то есть определение каких-то внутренних взаимосвязей между этими данными и и так называемом учение с подкреплением когда у нас нету разметки данных но мы можем выдать вместо этого алгоритм нету
Speaker A
информация награде которая получает процессе обучения сам известно пример наверное из целом между касается искусственно интеллекта это игра в г где можно пытаться тренировать модель на основании того насколько она близка к выигрышу в пенси что было сделано в альфа га
Speaker A
в области интересующей нас области химии в области материаловедения это например задача оптимизации геометрии оптимизация трёхмерной геометрии поисками лучше конформации на поверхности потенциальной энергии где мы не знаем такого огромного количество правильных ответов которые нам нужно для того чтобы рисовать то поверхность
Speaker A
непосредственно но можем каких-то точках братья кем-то не очень дорогим вычислить на дороге методом считать энергию но и оценят насколько мы глубоко на этой самой поверхности потенциальной энергии методы как я уже говорил их десятки если не больше если мы говорим про машинное обучение
Speaker A
то это методы основанные на например статистике байесовской статистике на и не боюсь искать и время то что вы еще попробуйте руками посмотрите сделать как это работает нет на опорных векторов чем-то ну здесь я немножечко поступлюсь строгой математикой скажу что чем-то
Speaker A
похожее на то чтобы наверняка когда вас пробовал делать прокси миру я данные на практикумов по методу наименьших квадратов мет ближайших соседей которые наверное наиболее интуитивно прост и понятен и близок к тому как работает наш мозг наш опыт в
Speaker A
том плане что мы не считаем что если у нас есть это похоже соединение похожие вещества не будут скорее соблюдайте похожими свойствами ну и мы обычно не ищем предсказываем свойства нового вещества на основные такие свойства есть у ближайших соседей в том самом векторном
Speaker A
пространстве пространстве признаков для этих веществ это различными это дерево решений которые обусловленные которые основанным на зачем простых например бинарных выборах на тему наличие или отсутствие кого-то признак смотрим на молекулу смотрим если нет карбокси группа например идем в одну
Speaker A
сторону если там аминогрупп пойдем другую сторону и говорю ну наверно это не аминокислота но это все можно развивать бьет таких деревьев много как-то ускорять получать огромное семейство методов основанных на деревьях решений некоторые которых по заявителями получать очень очень хорошие результаты
Speaker A
в тренировке моделей и там нет линейной регрессии скарамуш точностью путь более-менее знакомы но и познакомить еще ближе и вплоть до метров глубокого обучения до нейронных сетей здесь я в 1 социально использовал наверное 2 может термин глубокое обучение где в том что очень сложным опять же
Speaker A
придумать какое-то точно хорошее определение поскольку термо много стал маркетинговым и давайте пока для простых скажешь то глубокое обучение мы будем понимать как использовались на нейронных сетей и когда мы хотя бы частично пытаемся апстрак these ровать идею молекула ты
Speaker A
сам исторической структуры внутри самой сети от слоя к слою когда мы дойдем уже до самих архитектурно нейронных сетей мы тогда пытаемся как-то определение через переопределить это различными ты относящихся к генерации новых соединений опять же это в первую очередь огромное количество
Speaker A
нейронных сетей генеративно состязательна сетей с памятью еще чего-нибудь это отдельную группу алгоритмов эволюционных алгоритмов радиол интеллекта которым тоже будет посвящена отдельная лекция ну и какие то другие вещи опять же мы мы начнем здесь в нейронных сетей состязательных неровностей с так
Speaker A
называемых авто им кадрах авто кодировщик of которые умеют через какой-то скрытый латентное пространстве превращает структуру само в себя что часто кажется очень очень удобным потому что со структурами мы не знаем к работе с учетом пространством математика нам в
Speaker A
помощь и это различным меток то возможно кто-то использовал в своей жизни для например выделения принципиальных компонентов при анализа спектров для уменьшения размерности данной что построить какие-то там кино красивые двумерные картинки данных из каких-то изначально многомерных массивов отдельно все же еще разок скажу про
Speaker A
нейронные сети не зря на предыдущем слайде несколько раз упоминал и будет посвящена отдельная лекция поэтому не буду здесь уж сильно давать спойлеры к этой лекции но тем ни менее остановлюсь на одном моменте о том почему же мы столько раз их поминаем почему же такой
Speaker A
hyip половина этого я уже в принципе рассказал когда говорю о том что они позволяют сделать тот самый переход от количества к качеству вниз на больших данных половина заключается высочина простой архитектуре сне простой архитектуре отдельных элементов отдельных узлов сети
Speaker A
то есть неровной сеть построены так названо поскольку в код мере имитирует деятельность человеческого мозга отдельных нейронов которые принимают что на выход на понимаешь на вход и на выход и внутри каждый из них падений совершать точно простое действие но в данном
Speaker A
случае в искусство неровности идиотку эту простую математическую операцию и в совокупности благодаря огромным количеством и потому что кажется простое действие может быть параметризовано чуть-чуть по-разному мы можем использовать разные выходные разные входы и строить очень очень разную архитектуры в тексте систем а еще
Speaker A
например чуть-чуть менять свойства какого-нибудь отдельного нейрона и говорит что может только например какое-то простое действие делать но еще например ну не надо запоминать его результат или передавать его еще куда то может быть наоборот назад благодаря в общем-то простым манипуляция мы можем
Speaker A
получать просто невероятное разнообразие архитектуры а значит и решать огромное количество задач используются что похожие инструменты и не приучилась в работе между разными марками разными принципиальными там идеологиями но подбирая нужный инструмент из принципе 1 класса разумеется говорил такие вот простые
Speaker A
решения часто часто будет приводить к провалу не всегда конечно это классно получится как я сейчас рассказал но действительно потенциал и гибкость точно большая несколько слов опять же в рамках такого общего обзора всего с чем мы будем работать в рамках
Speaker A
данного курса прута а собственно что же нам тренировать какие же нам понятия нужны здесь всякий случай еще раз повторю если кто-то уже успел испугаться испугаться большое количество новых терминов новых понятий я повторю что сейчас у нас есть такое
Speaker A
но я показываю общую структуру всего курса рассказываю опасных понять дуглас арина который мы даже с вами будем общаться разумеется все сложные вещи они будут разорваны еще неоднократно и вы сможете поиграться ними руками ну и возможно только там первые несколько раз
Speaker A
не получится написать собственный нейронную сеть уже ее точное понимание зачем все это было сделано окей оптимизировать мы хотим некоторые функцию которую мы не знаем это классическая задача из русских сказок что мы хотим эти не знаю куда и взяли
Speaker A
сделать не понятно что но мы хотя бы обычно знаем результат мы хотим этому научиться плескались к это свойства молекул или хотим генерировать молекулы с нужен свойствам хотим придумать он и лучший полиморф и твердотельные и jetpack комната параметров были хотим
Speaker A
вообще отвлечься от вопросы структуры свойства и в рамках нашей физической работы хотим оптимизировать условия синтеза которые мы рутинно проводим сейчас в лаборатории чтобы например уменьшить расходы на прекурсоры на чтобы действительно сделать синтез чуть более экономически целесообразно во всех этих случаях мы должны свести
Speaker A
эту ношу это наше абстрактное желание к некоторые математики к некоторые функции возможно заодно и в неявном виде где-то например мы знаем функцию не знаем и набора параметров которые издают отдельно там если например говорим про кого нибудь там поверьте потенциальной энергии где-то мы
Speaker A
не знаем ничего но можем у нас есть база данных которые покажут значение той самой функции в кучу точек значит можем построить функцию потери которая будет показывать нам насколько далеко мы от правильного ответа но в каких-то случаях еще какие то
Speaker A
варианты есть зависит очень сильно от задачи которые нам нужно если в общем так очерчивать рамки того как это работает то те функции которые должны придумывать прежде чем а начинает уже конструировать и конструировать не знаю алгоритм садится вообще за ноутбук
Speaker A
мы должны определить тип задач и то есть то классификации и регрессии генерации нужна оптимизация каких-то параметров эксперимента еще чего то еще чего то мы должны учитывать то что в нашем наборе данных как я говорил ближе к начало сегодняшней лекции может быть
Speaker A
куда больше успехов и мечи мне успехов понятно что если будем учиться только на хороших примеров мы станем излишне оптимистично с точки зрения математики эти функции очень часто должны быть дифференцируема но это мы еще рассмотрим отдельно было соответствующих разделах
Speaker A
часто должны иметь физический и химический смысл 5 же примерно в 1 через датчик которые с которой мы работаем часто мог бы с основными составными в том плане что мы можем пытаться одновременно оптимизировать низко сводят например мы хотим и оптимизировать хотим
Speaker A
оптимизировать параметры эксперимента и хотим и одновременный выход увеличьте цену уменьшить хочется нас такая ну не понятно но почему бы не попробовать смоделировать процесс может быть и правда получится это наверное наиболее сложно наименее про мид лизу и мы еще наименее
Speaker A
формализуем и прошу прощения элемент в данных списках потому что составная функция для оценки оценки чего-то оценки после потери оценки цены это всегда вопрос во первых субъективный что для вас важнее во вторых вещи только вот задача ну и она может связано функция потерь
Speaker A
может быть связано со следующим элементом с метриками качество метрики качества это то что мы демонстрируем то что мы оцениваем после обучения то как мы оценим насколько хорошо у нас модель во многом эти вещи похожи более того они могут быть даже двумя сторонами одной
Speaker A
медали метрики определять и по задачи для там знаю регрессии мы все знаем что такое r квадрат мы знаем среднеквадратическое отклонение для классификации метрик на самом деле побольше то мысли о нюансы мы еще посмотрим на них на семинарах на
Speaker A
практикумов для генерации нам уже не только оценил и свойствам например нам еще хочет ума генерировать это новое соединение чтобы они были уникальны что мы нигде не злюсь на одно и то же медик становится еще больше опять же неплохо чтобы не сбалансировать
Speaker A
набор данных нас как-то в этом учитывалось банальный пример недавно читал о тестировании какого-то из экспресс-тестов на к вид и оказывается что у него очень очень маленький процент ложноположительных результатов но огромный процент должен отрицательных результатов и понятно что если мы
Speaker A
пытаемся историку это бытовое слова точность то зависят метрики который прячется этим бытовым слова мы можем чистую совесть это будет какой-то стороны правдиво написать на коробке что у него точно 95 процентов но подругой метрики она окажется на 60 процентов
Speaker A
поэтому медики специфичных задач и сюда смотрим что важнее но и лучше когда мы публикуемся несколько метрик когда мы смотрим на разные параметры чтобы уже составить некоторое цельное представление о том что мы делаем примеры метрик но даже до 14 назад здесь
Speaker A
еще затерялась фразы том что метрика часто медник три лота логический смысл ну наверное будет даже корректно сказать в том что они подчас является настройка математически а скорее полезно когда не являются очень уж ненаглядными есть математика тоже хороша мы можем че
Speaker A
слегка сравним так уж трудно понимать хорошо мы сделали модель там где он лучше чем кто-нибудь или хуже чем кто-нибудь но подчас полезно когда метрика является наглядный опять чтоб не быть голословным метрики данные из наших же работ сейчас на верхнюю я не помню откуда но верхнем
Speaker A
2 это метрики классификационные они показывают насколько хорошо мы вцепляемся сдачи бинарную классификации левое так называемую roc кривая красивым опираетесь как tristique честно я даже не одного хорошего не не зубодробительной перевода на русский язык показывает насколько у нас как у нас
Speaker A
отношений у нашей модели правильных предсказания на личико то свойство к неправильно предсказаниям о наличии этого же самого свойства подробно рассмотрим опять же на последующих занятиях но коротко морская что чем ближе к левому верхнему углу это принимаю эта кривая тем лучше и
Speaker A
это как раз хороший пример того что метрика является очень наглядный по ней легко оценить качество модели но кстати вот сбалансированность набора данных если нас было много ложных отрицательных например но возможно мы до конца не где второй пример тоже для финальной
Speaker A
классификации confession matrix матрица наших успехов и неудач то где мы правильно песках значения кого-то параметр этого диму неправильно предсказуем и его значение ну тогда и можем посмотреть где и как и в чем мы ошибаемся вы на основании этих вот нескольких четырех
Speaker A
чисел мы можем расстроить какие-то другие метрики качестве которые будут такими удобными там масштабируемыми от нуля до единицы которые мы можем уже честно публиковать в журнал если подачи регрессионные нижние две если память не изменяет относится к вопросы предсказания частично зарядах на
Speaker A
атомов в анатомически каркас это уже работа сделана несколько лет назад и с ной стороны понятно что можно сделать какие-то очень простые числа метрики понятно что для такой картинки predict и плюсы сообщил будет очень высокий r-квадрат дома должен быть высокий но им
Speaker A
до полезно посмотреть на распределение ошибок вообще нормально ли у нас распределение ошибок на скале нас хвосты этого распределения что мы не всегда видим является только на одно например значение среди квадратическая ошибка цилиндр отлично со среднего горчичного в каневе ok
Speaker A
того кратко там итоги по этому пункту у нас а нужна функция можно формализовать нашу задачу которую он за который мы хотим работать в на математическом языке и мы хотим вы должны даже мог бы сказать придумать какой-то набор метрик который
Speaker A
мы которым мы оценим насколько хорошо нас получилось решить нашу проблему насколько мы хороший инструмент сделаю ok что для этого нужно буквально такие последние элементы то что я повторял сегодня уже пару раз принцип которые неплохо бы запомнить из которого мы будем определять много для
Speaker A
нас возможны термины если нас есть набор данных data set неплохо часть этого набора отложить про запас то есть отныне и впредь по большому счету когда мы будем говорить в тренировке моделей генерации чего то о чем то еще но во
Speaker A
всех во всех случаях дальнейшего прохождении данного курса кроме тех которые будут холерные отдельно будем подразумевать что мы всегда на части набора данных тренируем а часть мы откладываем не мы проверяем насколько хорошо получилось почему ну потому что как я уже говорил подогнать под
Speaker A
тренировочный набор можно что угодно с любой точностью мы хотим построить модель мы хотим знаю построить модель машинное обучение мы хотим научиться генерировать какие то новое соединение мы хотим еще что сделать а для этого нам нужно уверенным быть что мы это сделали
Speaker A
хорошо известно месте те которых я говорил чуть выше наибольший интерес представлять конечно метрики сделано тестовом наборе дальше мы видим что конечно от метрик сделан тренировочно более тут же избавляться нельзя бы но до этого всего еще дойдем как я уже говорил для того чтобы мы не
Speaker A
перри обучались мы не просто подгонять тренировочный набор есть множество множество вариантов они специфичны к различным алгоритмом но для того чтобы узнать последние предпоследнего на определение сегодняшней лекции мы скажем что очень часто удобно бывает делитель на две части внутри зачем 3 от них
Speaker A
канаде плавающий то есть мы будем только отделять кита например 20 процентов как это обычно по классике делается вас процентов данных в качестве тренировочного на до тренировочного набора хочет этого набора прошу прощения но и разбивать например тренировочный набор на несколько кусков
Speaker A
например как здесь нарисована на 5 кусков мы будем отделять одну пятую тренировать модель на оставшихся четырех пятых она это 1 5 следишь что модель не перри обучилась то есть например мы тренируем на четырех пятых куча модели оставим из них ту которая будет лучше
Speaker A
работать на маленьком отдельном в редакционном наборе после этого мы сдвинем в лекционный набор возьмем другую одну пятую и так построим в итоге 5 моделей ну и новой моделью будет представлять собой например среднеарифметическая вот выше указано опять же до этого алгоритма
Speaker A
который называется кросс валидации мы еще будем подробно на практику где вас будет возможно с ним поработать ну а с текущего момента можно запомнить в том что в итоге данные с которым будем работать много негатива сном на три части на тренировочную на облигационную
Speaker A
в людей часто development фсф не тестовую часть ну и глаз бандурист концепт который хочется обсудить сегодня это область применимости applicability domain любой модели любого места которые мы хотим сделать как я уже говорил в принципе научный подход от ненаучного отличаются наличие
Speaker A
этой самой области применимости в отношении методов машинного обучения на пример работы с области применимости и проще и сложнее одновременно а сложнее потому что очень часто мы например не заглядываем внутреннюю кухню то что происходит в пока скажем черном ящике на место с
Speaker A
которым мы работаем или не можем интерпретировать результаты этого метода с точностью до химически или физически понятных терминов то есть не может например ответить на опрос тренировали мы эту модель на органике он с например с карбоновыми кто-то вообще будет
Speaker A
работать или нет ни сюда по участок ответить ну и для этого ждете дополнительные вещи из-за этого часто сложнее определить область применимости но очень часто если мы приходим в математические понятно и пространство можно сказать о модель у нас вся она
Speaker A
тренировалась на данных который обозначен без черными точками не мы можем предположить что и работе на хорошо как любая интерполяционной а модель будет где-то недалеко от этих черных точек в этом самом пространстве соответственно может сказать что если все тестовые данные представляют свою
Speaker A
белые пронумерованные точки здесь то доверие к результатам полученного для номер 18 должно быть гораздо гораздо меньше чем для того что находится у нас где тут вот в учетом номера 10 и 11 то есть во первых всегда необходимо использовать те или иные варианты оценки
Speaker A
области применимости что он опять же попробуем возможно видим будущем наших моделях но и во вторых помнить о том что само по себе если вы видите где то модель в статье и ничего не говорится об ее области применимости скорее всего это lookout но или эта
Speaker A
модель практически может оказаться не самым полезным ok успеем пару больших примеров и на этом на сегодня наш ступить на алекса закончил пару примеров опять же возьмем и собственно уже практика собственной же практике например когда-то мы делали в сотрудничестве с нашими коллегами
Speaker A
занимающимся радио фарм кими работали над разработка новых ради фармпрепаратов и в частности мы никогда скачали данные необходимы для отнесения того точнее необходимые данные по отнесение то вольного тальные малые органической молекулы к различным к различным классификацию по различному которю
Speaker A
лекарственных средств дам разумеется не знали что нельзя использовать для тренировки модели ну и хорошо что не знали потому что использует машинное обучение пусть даже не использовать его для тренировки какой-то странной модели но с помощью этих данных натренировать такой
Speaker A
новый фича вектор новое описание этих свойств но описание самих молекул прошу прощения мы смогли например с хорошей точностью поискать bio распределение лекарств которые было проверено на ушах которых хорошо совпало с тем что мы предсказывали нам случае это одновременно и классической пленение
Speaker A
машинное обучение этот случай когда расчетов еще вектора является не физико-химическим оставляется в большей части за нашим алгоритмом другой пример из области материаловедения тоже работа с коллегами занимающимися гибридными слоистыми двумерными перовский to me материал перспективным для солнечной энергетики но ведь для работы с которыми неплохо
Speaker A
было бы предсказывать ширина запрещенной зоны то материала полупроводниковый ну естественно на собранной базе данных была построена модель которую который позволяет искать эту ширину с очень-очень хорошей точностью в данном случае пример помимо то что покажет типичное решение къюс pr
Speaker A
задачи он еще очень хорошо говорит пар applicability найман про область применимости модели понятно что если вот такую модель на кастильском не доступна онлайн если опять сайт не упал например засунуть историческую структура обычного кремния по которой мы все все и
Speaker A
так знаем песен получи ногти какой-то чуши вопрос потому что модель тренировалась на совершенно других данных и способны работать вот в этой и такой узко но интересный области применимости ну и сочетание многих многих алгоритмов которые мы использовали которую которых я рассказывал сегодня мы
Speaker A
собираем применили того чтобы сделать новую генеративная модель для твердого тела где была используя авто кодировщик of и работы спектральными данными и методы оптимизации понижения размерности и что что угодно и буду здесь рассказывать если кому интересно то на n плюс один здесь об
Speaker A
этом точно популярный простой рассказ [музыка]
Topics:искусственный интеллектхимияматериаловедениемашинное обучениенейронные сетиPythonоптимизация кодагенеративные моделиJupyter ноутбукихимические данные











