Part 1 Bases de l’Intelligence Artificielle Regression — Transcript

Introduction aux bases de l'intelligence artificielle et à la régression supervisée par le Professeur Mohamed YOUSSFI.

Key Takeaways

  • L'intelligence artificielle vise à doter les systèmes informatiques de capacités intellectuelles similaires à celles des humains et animaux.
  • Le cours est conçu pour les débutants et couvre à la fois les concepts théoriques et les applications pratiques.
  • L'apprentissage supervisé, notamment la régression, est une base essentielle pour comprendre l'IA.
  • L'utilisation d'outils pédagogiques variés facilite la compréhension et la mise en pratique des concepts.
  • Les séances enregistrées permettent de revoir les démonstrations et approfondir les notions à son rythme.

Summary

  • Présentation générale du cours d'intelligence artificielle destiné aux débutants.
  • Importance de l'IA générative et des concepts fondamentaux de l'intelligence artificielle.
  • Différence entre intelligence individuelle et intelligence collective inspirée du vivant.
  • Introduction à l'intelligence artificielle distribuée et modélisation des agents isolés et collectifs.
  • Explication des notions d'apprentissage supervisé avec un focus sur la régression.
  • Présentation des outils pédagogiques : supports PDF, notebooks, fichiers de données et projets pratiques.
  • Enregistrement des séances pour permettre un apprentissage à son rythme.
  • Exemples concrets de classification binaire appliquée à la détection de fraudes.
  • Importance de la préparation des données, codage des variables catégoriques et division en données d'entraînement et de test.
  • Démonstration de l'ajustement d'un modèle de régression et évaluation de sa performance.

Full Transcript — Download SRT & Markdown

00:06
Speaker A
Bonjour monsieur.
00:33
Speaker A
Oui, on vous entend.
00:49
Speaker A
Oui, oui, bonjour monsieur.
01:02
Speaker A
Voilà, l'écran est bien partagé, tout va bien.
01:19
Speaker A
Oui, monsieur.
01:31
Speaker A
Oui, monsieur, bien.
01:44
Speaker A
Alors, donc, nous allons commencer ce cours concernant l'intelligence artificielle et l'IA générative.
02:04
Speaker A
Donc, je vais vous parler tout à l'heure du contenu de ce programme.
02:17
Speaker A
Je rappelle qu'en fait la formation concerne plusieurs disciplines.
02:33
Speaker A
Donc forcément, tout le monde le sait, il y a forcément des gens de différentes disciplines.
02:52
Speaker A
Il y a des informaticiens qui peut-être sont déjà habitués à un certain nombre de choses.
03:07
Speaker A
Il y en a d'autres qui ne sont pas du tout habitués.
03:20
Speaker A
Et ce cours justement consiste, il concerne, on va dire, les débutants, c'est-à-dire ceux qui veulent débuter dans le domaine de l'intelligence artificielle.
03:34
Speaker A
Et bien sûr, le programme va traiter un certain nombre de choses qui sont très importantes.
03:52
Speaker A
Il y a un volume horaire qui est un peu réduit, mais on verra peut-être.
04:06
Speaker A
Donc, on va laisser un peu plus de temps pour d'autres choses parce qu'en fait, c'est, je pense, comme vous le savez,
04:26
Speaker A
c'est un cours qui est extrêmement important pour tout le monde.
04:41
Speaker A
Et donc, je prendrai tout le temps qu'il faut en tout cas pour qu'on arrive à la fin, c'est-à-dire à maîtriser aussi bien les concepts de base de l'intelligence artificielle et de l'IA générative,
05:03
Speaker A
et aussi donc maîtriser les outils et les techniques de, enfin, de création, d'entraînement de modèle.
05:19
Speaker A
Et donc voilà.
05:32
Speaker A
Donc, j'essaie, pour ceux qui sont déjà habitués à travailler avec les outils de l'intelligence artificielle,
05:49
Speaker A
donc soyez attentifs, peut-être il y a des choses que vous ne connaissez pas.
06:06
Speaker A
Mais aussi, moi, je laisserai plus de temps parce que je suppose que j'ai devant moi des étudiants qui ne connaissent pas beaucoup de choses, plutôt qui ne connaissent rien en intelligence artificielle.
06:22
Speaker A
Donc voilà, vous allez voir en fait comment on va travailler.
06:39
Speaker A
D'abord, il y a un classroom, donc ça, je pense que c'est une bonne chose.
06:55
Speaker A
Je vois que déjà il y a quasiment, pratiquement, l'ensemble des gens concernés, 112 en tout cas inscrits dans le cours.
07:11
Speaker A
Donc principalement, dans ce classroom, vous allez trouver d'abord le support.
07:25
Speaker A
Je viens de partager la première partie du support ce matin.
07:36
Speaker A
Donc vous y trouverez le format PDF des slides des cours, mais surtout vous allez trouver un ensemble de notebooks et de fichiers de données que nous allons utiliser justement dans les activités pratiques.
07:53
Speaker A
Parce qu'il y a des activités pratiques que vous allez essayer de travailler.
08:11
Speaker A
Il y a aussi un projet sur lequel on va travailler dans ce cours.
08:24
Speaker A
Donc tout ça, c'est pour bien sûr votre bien, pour maîtriser cet écosystème.
08:41
Speaker A
Alors, ça, je reviendrai tout à l'heure sur comment vous allez exploiter ces ressources.
09:01
Speaker A
Autre chose, c'est que toutes les séances vont être enregistrées au format vidéo,
09:16
Speaker A
ce qui fait que parfois je serai obligé d'aller un peu plus vite dans les démonstrations, mais ne vous inquiétez pas,
09:34
Speaker A
parce qu'en fait toutes les démos et toutes les séances sont déjà enregistrées.
09:51
Speaker A
Donc plutôt, toutes les séances seront enregistrées, ce qui fait que vous aurez ces enregistrements qui seront partagés sur classroom.
10:05
Speaker A
Et vous allez peut-être y revenir pour plus de détails.
10:24
Speaker A
Voilà.
10:42
Speaker A
Alors, sans trop tarder, le cours, comme je viens de dire, concerne l'intelligence artificielle d'une manière générale.
10:54
Speaker A
Et aussi, il y a une partie qui concerne l'IA générative, qui constitue aujourd'hui l'une des parties les plus importantes au niveau de l'intelligence artificielle.
11:15
Speaker A
Alors aujourd'hui, je vais d'abord essayer d'introduire les bases de l'intelligence artificielle.
11:32
Speaker A
Voilà.
11:51
Speaker A
Pour la séance d'aujourd'hui, on va essayer d'aller tout doucement pour ne laisser personne derrière nous.
12:05
Speaker A
Voilà.
12:25
Speaker A
Et du coup, je vais revenir vraiment sur les bases de l'intelligence artificielle.
12:41
Speaker A
En même temps, je vais vous expliquer globalement quels sont les concepts, voilà, quels sont les concepts de base de l'intelligence artificielle.
12:58
Speaker A
Et vite fait, on va commencer sur la première partie, notamment l'apprentissage supervisé, et notamment avec la régression,
13:11
Speaker A
parce que c'est ce que j'ai prévu en tout cas aujourd'hui.
13:26
Speaker A
Voilà, j'espère que le temps le permettra, mais en tout cas, on y va.
13:40
Speaker A
Alors, d'abord, quand on pose la question : c'est quoi l'intelligence artificielle ?
14:00
Speaker A
Si vous cherchez la réponse, on peut dire que l'intelligence artificielle est une grande discipline qui cherche depuis très longtemps, depuis plusieurs années,
14:14
Speaker A
à doter les systèmes informatiques, c'est-à-dire les ordinateurs, de capacités intellectuelles semblables à celles des êtres humains ou des animaux.
14:26
Speaker A
Bien sûr, chez l'être humain, ce qui nous intéresse, il y a quelque chose de très important, c'est l'intelligence individuelle.
14:41
Speaker A
C'est le cerveau humain, c'est sa façon de résoudre ses problèmes, sa façon d'apprendre.
14:56
Speaker A
Tout ça va être imité sous forme d'algorithmes.
15:17
Speaker A
Mais aussi, chez les animaux, il y a quelque chose qui nous intéresse beaucoup, c'est l'intelligence collective.
15:32
Speaker A
Ce qui fait que dans les communautés d'animaux, si vous prenez par exemple une fourmi, c'est un être vivant qui a une capacité intellectuelle individuelle très faible.
15:48
Speaker A
Mais si vous prenez par exemple une communauté ou une colonie de fourmis, vous avez une intelligence collective qui est très importante.
16:01
Speaker A
Donc, ce qui fait qu'en fait les scientifiques ont essayé de s'inspirer de ces capacités intellectuelles des êtres vivants d'une manière générale,
16:14
Speaker A
et de traduire ça sous forme d'algorithmes notamment.
16:28
Speaker A
Et c'est ce qui a abouti à toute cette évolution depuis les années 50 jusqu'à maintenant.
16:38
Speaker A
Les choses ont beaucoup évolué, surtout ces dernières années.
16:54
Speaker A
Vous voyez, ça s'accélère beaucoup.
17:07
Speaker A
Du coup, l'intelligence artificielle est l'affaire de tout le monde.
17:20
Speaker A
Ce n'est pas forcément l'affaire des informaticiens ou des médecins.
17:34
Speaker A
C'est quasiment un outil qui doit être exploité par tout le monde.
17:50
Speaker A
Et forcément, si vous travaillez dans le domaine de la recherche, c'est un outil qui va vous intéresser beaucoup,
18:05
Speaker A
que ce soit dans votre recherche, mais aussi dans votre façon d'exploiter bien sûr les outils pour faire avancer vos travaux.
18:24
Speaker A
Alors, dans l'intelligence artificielle, il y a ce qu'on appelle l'intelligence artificielle distribuée.
18:37
Speaker A
Dans l'intelligence artificielle distribuée, il y a d'abord la partie IA.
18:50
Speaker A
On s'intéresse à modéliser le savoir et le comportement des agents isolés, c'est-à-dire vous avez un agent qui est isolé quelque part,
19:06
Speaker A
dans un ordinateur par exemple ou dans un système embarqué, et on essaie de le doter d'une capacité intellectuelle qui lui permet de faire des prédictions et du raisonnement.
19:19
Speaker A
Donc ça, c'est l'intelligence artificielle, on s'intéresse plutôt à un agent isolé, individuel.
19:31
Speaker A
Et puis il y a l'intelligence artificielle distribuée qui va essayer de modéliser les interactions entre les agents.
19:46
Speaker A
Parfois, il y a des problèmes qui sont relativement très complexes, et dans les problèmes complexes, généralement, nous avons besoin d'utiliser plusieurs...
19:59
Speaker A
revenir sur ça en détail alors que la classification la classification comme je disais euh c'est euh c'est la prédiction quand vous avez une un outcome ou bien un output qui est une variable catégorique donc c'est-à-dire par exemple euh je voudrais faire la
20:16
Speaker A
prédiction euh est-ce que une transaction financière est frauduleuse selon l'heure par exemple de la transaction le montant de la transaction et par exemple longitude lattitude bon c'est-à-dire en fonction de endroit on voudrait par exemple prédire est-ce que cette transaction est fruduuse ou non
20:34
Speaker A
alors forcément euh ici donc vous avez euh le output donc ça ça peut être 01 alors dans ce cas-là quand vous avez que 0 et 1 c'est-à-dire quand vous avez de classes on dit que ça c'est la classification binaire c'est un
20:46
Speaker A
classifieur binaire parce que à la fin on va dire est-ce que c'est vrai ou bien c'est faux est-ce que c'est frauduleuse ou non alors mais après il y a d'autres modèles de de classification dans lequel on on ce qu'on c'est ce qu'on appelle la
21:01
Speaker A
classification multiclasse multiclasse par exemple quand vous donnerz une photo à un modèle et vous dites est-ce que c'est un chien ou bien c'est un chat ou bien c'est un lapin ou je sais pas quoi donc ça c'est des multiclasses alors la
21:11
Speaker A
même chose à un moment donné quand on va revenir sur ce ce problème de classification on essaiera donc de distinguer ces deux cas parce que il y a y a c'est en fonction du types de problème on va choisir les les modèles
21:22
Speaker A
adéquats euh qui vont vous donner plus de de meilleurs résultats si vous voulez alors bien sûr dans le le domaine de la classification comme je disais la même chose c'est forcément c'est trouvver le c'est-à-dire le le on va
21:36
Speaker A
dire le le modèle mathématique soi-disant une une approximation du du modèle qui va permettre de lier les entrées et et les sorties et donc dans ce domaine il y a plusieurs algorithmes qui sont ass assez connus que vous allez
21:49
Speaker A
manipuler dans ce ce cours KNN par exemple SVM decision tree random forest les réseau de neuron artificiel et cetera et cetera donc il existe beaucoup beaucoup de d'algorithmes alors bien sûr dans ce cours on va pas vous demander
22:03
Speaker A
d'implémenter les algorithmes mais vous allez voir tout est très simple parce qu'il y a il y a plein de librairies vous avez tout ce qu'il faut donc pour pouvoir rapidement c'est-à-dire tester vos algorithmes vous n'avez pas besoin d'être un expert à moins si vous voulez
22:17
Speaker A
réinventer la roue voilà donc vous pouvez toujours c'est toujours bien si vous avez bien sûr le temp les gens qui sont des spécial qui font de la spécialité dans le domaine de l'intelligence artificielle alors forcément il faut vraiment faire faire
22:29
Speaker A
on commence souvent à implémenter ces algorithmes ce qu'on appelle en from scratch soi-disant pour comprendre mais après on commence à utiliser ces librairies pour pour tirer profit alors dans ce cours là ce n'est pas le cas parce que sinon je vais laisser beaucoup
22:43
Speaker A
de monde derrière moi parce qu'en fait comme je disais donc c'est une formation transversale donc on va plutôt donc s'intéresser c'est-à-dire à ce c'est-à-dire on va direct vers le le probl vous allez voir alors donc ça c'est la classification
22:58
Speaker A
euh alors alors j'ai pas dit ça dans la régression là aussi il y a des algorithmes il y a la régression linéaire on peut avoir la régression polynomiale rid l'assaut et cetera donc c'est-à-dire il existe plusieurs types de modèles donc ça tout ça on va y
23:13
Speaker A
revenir alors voyez donc on est dans la classification on est là et après il y a l'apprentissage non supervisé alors c'est quoi l'apprentissage non supervisé donc c'est l'apprentissage non supervisé c'est un type d'apprentissage euh dans lequel on va entraîner un modèle sur des données
23:32
Speaker A
qui ne sont pas étiqueté c'est-à-dire nous avons un dataset nous avons un ensemble de données mais pour lesquels on n' pas des de output donc on a un ensemble de données mais on on n'a pas les les les étiquettes on n' pas le
23:46
Speaker A
l'output pour ces données là et du coup donc il y a des algorithmes parfois qui vont qui sont capables de fouiller dans les données en utilisant ce qu'on appelle des mesures de similarité et ces algorithmes à arrive à créer ce qu'on
24:00
Speaker A
appelle des clusters c'est-à-dire à partir de ces données là on va essayer de de déterminer queles sont par exemple ces échantillons appartient à tel groupe a euh d'autres échantillons vont appartenir au groupe B et cetera alors ici vous avez une image une image qui
24:14
Speaker A
est très très qui explique bien la chose parce que vous savez quand on collecte les les dates donc la première des choses qu'on demande aux gens c'est c'est-à-dire bon moi quand j'étais petit je me rappelais bien mon père il fa il
24:28
Speaker A
faisait ce ce métier là ben du coup don on nous appelle on appelit les les petits- enfants on leur demande allez-y on va on va essayer de de donc et forcément et quand on commence à faire ça c'est que ça c'est
24:43
Speaker A
c'est de la c'est vraiment c'est ce qu'on appelle c'est des algorithmes de clasturine c'est-à-dire on va chercher en fonction de chaque échantillon on va essayer à un moment donné de de créer des des groupes et le le c'est-à-dire le
24:54
Speaker A
clasturine c'est c'est une étape qui est extrêmement importante dans le le probl dans le l'intelligence artificielle même si vous avez un problème même si vous avez un problème d'apprentissage supervisé généralement on commence d'abord à utiliser des algorithmes de
25:11
Speaker A
Classen pour regarder d'abord les données et essayer de chercher quels sont les différentes classes qui existent dans les données parce que parfois ce qui se passe c'est que c'est que vous avez un dataset qui vous dit que par exemple euh il y a le output il
25:25
Speaker A
y a soit la classe A soit la classe B soit la Classe C par exemple vous avez un dataset des médecins qui vont vous dire par exemple pour un un par exemple le cancert de sang il existe par exemple
25:38
Speaker A
il y a des catégories de cancer de sang et dans le DataSet le médecin il il va étiquetter ces données comme quoi il y a par exemple le le cancer de type A ou bien de type B mais quand vous faites un
25:50
Speaker A
algorithme de clasurine et il se peut que vous vous allez voir que parce que le le Class il va chercher les différentes classes il se peut que vous vous allez faire émerger des classes qui ne sont pas connues par les les médecins
26:03
Speaker A
c'est-à-dire c'est que il vous dit ENF il y a pas de classes mais finalement il y a trois classes encore il y a quatre classes alors bien sûr avec les praticiens avec un échange ça ça lance des investigation c'est-à-dire peut-être
26:16
Speaker A
a il y a un autre type de de maladie qui est caché dans les dans les données ce qui fait que la capacité de ces algorithmes de clasterine c'est justement ça c'est-à-dire on va fouiller dans les données on va essayer de
26:29
Speaker A
chercher dans les données en utilisant des des mesures de similarité et qui vont faire que à un moment donné on peut déterminer par exemple quels sont les différentes classes qui existent dans le dans dans dans le dans les les les les données alors parmi les
26:45
Speaker A
les algorithmes les plus populaires euh c'est camins son qu'on va on va l'utiliser donc on va l'utiliser souvent dans le les nos études même parfois si vous faites l'apprentissage supervisé on on on va toujours jeter un codé sur sur
26:58
Speaker A
camin pour voir est-ce que vraiment notre dataset on est en train de traiter trois classes on va regarder camin est-ce qu'ils nous disent que c'est vraiment il y a trois classes peut-être peut-être se poser la question parce que
27:10
Speaker A
vous savez que les les modèles pilotés par les données alors le la phrase piloté par les données si vous avez une mauvaise si vous avez vous n'avez pas des Bones données en qualité et une quantité vous allez avoir un modèle euh
27:26
Speaker A
qui n'est pas bon donc c'est c'est-à-dire que fouiller dans les données faire data analysis faire le prêtement des données tout ça c'est ça fait partie d'un du travail de de Data scientist donc on va tout ça dans le les les exemples on va
27:41
Speaker A
voir comment on peut faire quelques quelques éléments alors ça c'est le le clusttering après vous avez l'apprentissage auto superervisé alors l'apprentissage autosupervisé c'est on va dire c'est le moins connu de chez les Data scientist pourquoi parce que l'apprentissage autosupervisé il a
27:58
Speaker A
émergé ces dernières années depuis 2017 notamment dans le domaine de NLP alors l'idée principale de l'apprentissage autosupvisé c'est quoi c'est que on va prendre des données non structurées comme le texte vous savez si vous prenez un texte on va le donner à
28:15
Speaker A
un modèle et on va lui demander euh on va l'entraîner sur la base d'un texte qui est non structuré c'est du texte qui n'est pas étiqueté alors qu'est-ce qu'on va faire et bien tout simplement on va prendre le texte on va le le montrer au
28:27
Speaker A
modèle et le texte qu'on va lui donner on va essayer de cacher quelques mots c'est-àdire on va essayer de cacher quelques parties de du du texte et après on va entraîner le modèle pour qu'il puisse prédire les les parties cachées
28:39
Speaker A
on cache encore des des mots on entraîne et ben c'est c'est c'est comme ça qu'on a qu'on a c'est comme ça que chat GPT a été créé voilà tout simplement c'est-à-dire sur une grande partie de des données c'est des données non
28:53
Speaker A
structuré c'est du texte plein texte et cetera et bien avec ce type d'appr tisage autosupervisé on est capable d'entraîner également des modèles sur des données non structurées et par la suite on va leur donner des une question c'est ce qu'on appelle un prompt et sur
29:09
Speaker A
la base du prompt mais le modèle il est capable de de donner une une réponse exactement ce que vous faites avec chat jpit vous lu poser une question et après il vous génère une réponse et c'est en fait l'apprentissage autosupervisé c'est
29:22
Speaker A
la base de l' générative donc ça c'est on va y revenir c'est une partie qui est très importante et parmi les les algorithmes les plus populaires déjà les Transformers donc ça ils utilisent donc l'apprentissage autosupervisé et parmi ces modèles il y a les modèles
29:39
Speaker A
Transformers il y a le modèle de Google c'est birth et GPT de open ee donc c'est pour cela que vous voyez donc il y a une course entre entre open e notamment avec ce en fait les modèles les modèles chat
29:54
Speaker A
GPT et cetera il sont basés sur GPT les modèles Gini tout ce qui va avec sont basé sur sur Bir sur birth mais tout ça c'est ce qu'on appelle c'est les Transformers donc on aura l'occasion à la fin donc je sais comme je disais même
30:07
Speaker A
si le le temps il est un peu très court par rapport à tout ce contenu là mais on essaiera de voir peut-être on va ajouter quelques séances pour pour traiter tout ça alors donc ça c'est la prenèse autosupervisée après je reviens encore à
30:22
Speaker A
ça donc je disais il y a deux types d'apprentissage il y a l'apprentissage piloté par les données et puis il y a l'apprentissage piloté par l'expérience donc déjà l'apprentissage piloté par les données vous avez tout ça n'est-ce pas c'est on
30:39
Speaker A
apprend sur la base des données et puis parfois il y a des algorithmes qui sont capables de faire ce qu'on appelle l'apprentissage par l'expérience et ce qu'on appelle l'apprentissage par renforcement reenforcement learning alors c'est quoi l'idée principale de
30:52
Speaker A
l'apprentissage par renforcement c'est à apprendre à partir de l'expérience je vous donne un exemple vous savez un petit enfant un gamin un bébé qui vient de naître si vous vous regardez comment il apprend comment nous on apprend c'est
31:10
Speaker A
que si vous regardez un bébé vous allez voir que il va commencer à tâonner n'est-ce pas au début peut-être il connaît pas les dangers il commence par exemple là ce qu'on appelle c'est un agent ok et vous avez un environnement
31:26
Speaker A
et après l'agent il agisse sur l'environnement donc c'est-à-dire que par exemple le petit enfant il va essayer de de taper sur le mur n'est-ce pas et après l'environnement va lui donner ce qu'on appelle une récompense il y a il y a un une réaction
31:41
Speaker A
un feedback il y a une une récompense et cette récompense peut être positive ou bien négative et une fois que je reçois une récompense et bien le l'agent l'état de l'agent va va changer il va passer d'un état alors
31:55
Speaker A
par exemple le petit enfant quand il va taper sur le mur il va pleurer il va passer vers un état et quand il est dans cet état il va encore agir sur l'environnement il reçoit les récompenses et et ben la la la grande
32:08
Speaker A
partie de notre apprentissage humain il est basé sur le renforcement c'est-à-dire on essaie on va explorer et après par la suite une fois qu'on aurait exploré l'environnement et et ben tout simplement par la suite c'est plus simple de de c'est-à-dire de de de
32:25
Speaker A
prendre les les bonnes les les actions optimales si vous voulez bon un autre exemple que je donne toujours c'est si vous prenez par exemple une personne aveugle qui qui qui ne voit pas euh vous vous allez la mettre dans un à
32:38
Speaker A
l'intérieur d'un immeuble et cette personne vous allez lui demander de sortir n'est-ce pas de de d'emprunter la sortie et vous savez ce qu'il va faire vous pouvez imaginer il va tâonner imaginez qu'il va tâonner pour chercher la sortie pendant pendant 10 heur et 10
32:52
Speaker A
heures une fois qu'il aurait trouvé la sortie une fois qu'il va trouver la sortie on va encore le ramener vers un autre endroit l'immeuble ben on va lui dire tu reprends il va encore chercher chercher c'est ça action reward action
33:07
Speaker A
reward il va encore chercher jusqu'à ce qu'il trouve la sortie et si on reprend ça il va reprendre ça des centaines de fois et croyez-moi que c'est un moment donné c'est que il l'opérationexploration l'exploration c'est la phase d'apprentissage j'explore
33:23
Speaker A
l'environnement mais une fois qu'il aurait bien exploré l'environnement c'est qu'il a appris mais une fois qu'il a appris on va passer vers ce qu'on appelle l'exploitation et l'exploitation c'est quoi c'est que cette personne là quand vous la mettez quelque part dans
33:36
Speaker A
l'immeuble il va prendre le le chemin optimal il va emprunter la sortie assez rapidement bah c'est comme ça que fonctionne généralement le dans le domaine de la robotique généralement l'apprentissage par renforcement il est très très très important et parmi les
33:52
Speaker A
algorithmes qui sont populaires il y a kearning par exemple il y a o donc ça c'est d'ailleurs chat GPT il utilise l'apprentissage par renforcement on va voir comment il est utilisé on utilise l'apprentissage par renforcement dans le domaine de ei agents et dans le
34:13
Speaker A
notamment dans l' générative donc c'est une partie qui est extrêmement importante parce que si vous voulez créer des modèles qui sont costaud généralement vous aurez besoin de faire l'apprentissage supervisé vous aurez besoin de faire l'apprentissage non supervisé et vous ajoutez encore de
34:28
Speaker A
l'apprentissage par renforcement c'est avec ça qu'on arrive à à un moment donné avoir des modèles qui sont ce qu'on appelle autoapprenants et qui sont capables de s'améliorer dans le temps et tous ces algorithmes là donc c'est très intéressant de les étudier et de voir
34:42
Speaker A
comment on va on va les exploiter et puis donc euh bien sûr bon ça c'est c'est les systèmes multiagents dont j'ai parlé tout à l'heure ils sont basés sur ce principe là donc c'est-à-dire sur l'apprentissage par renforcement mais cette notion de
34:57
Speaker A
d'apprentis sche pas renforcement le grand problème qui étit posé depuis très longtemps c'est comment modéliser l'environnement c'est-à-dire on voudrait créer des agents mais cet environnement on va le modéliser alors il y a des problèmes simples on peut utiliser
35:14
Speaker A
le par exemple les réseaux par exemple les process de de décision de Markov on peut utiliser les graphes on peut utiliser tant plein de techniques mais il y a des problèmes assez complexes c'est-à-dire que parfois il est très difficile de modéliser
35:30
Speaker A
l'environnement par exemple vous savez une voiture une voiture autonome une voiture autonome ça existe maintenant c'est une réalité donc une voiture autonome comment la voiture est la voiture est conduite par par fait par deux algorithmes vous avez l'apprentissage
35:48
Speaker A
supervisé pourquoi parce que vous avez des caméras vous savez les caméras ils permettent de capter les les les images et quand on a les images on va utiliser des algorithmes dont je vais parler deep learning qui vont ce qu'on a faire ce
36:03
Speaker A
qu'on appelle l'abstraction d'État c'est-à-dire grâce à ces caméra on peut savoir est-ce qu'il y a des obstacles et cetera c'est-à-dire on peut déterminer l'état l'état de de l'agent et après une fois que je connais l'état maintenant qu'est-ce qui reste c'est quelle est
36:17
Speaker A
l'action optimale à prendre c'estàdire est-ce que je vais accélérer est-ce que je vais freiner de combien et cetera et bien qu'est-ce qui qu'est-ce qui va décider ça c'est l'apprentissage par renforcement c'est-à-dire c'est l'algorithme d'apprentissage par renforcement qui décide c'est lui qui
36:31
Speaker A
conduit mais pour qu'il puisse conduire il faut lui donner l'état de la situation mais qu'est-ce qui va me donner l'état de la situation c'est c'est l'apprentissage supervisé parce qu'on a besoin de faire l'abstraction d'État donc généralement et quand on
36:44
Speaker A
utilise les deux là on on fait ce qu'on appelle le Deep reinforcement learning c'est-à-dire on on combine le Deep learning pour faire l'abstraction d'État et le reenforcement learning c'est pour justement faire prendre l'action optimale euh pour bien sûr alors tout ça
37:01
Speaker A
ça c'est c'est ça fait partie de la alors maintenant les choses on vont encore changer grâce à l' générative euh vous allez beaucoup parler vous allez entendre beaucoup parler de ai agents et ce qui est intéressant maintenant c'est
37:16
Speaker A
que grâce au large language model llms par exemple gpt4o et bien tout simplement bah on lui pose la question et c'est en fait c'est le LLM qui va nous permettre de donner l'état c'estàdire d celui qui va faire
37:28
Speaker A
l'abstraction d'État en fonction de votre question et bien c'est le LLM qui va dire quelle est l'action à prendre et après c'est l'agent il c'est-à-dire l'agent l'agent pour en fait l'agent qu'on développé il y a longtemps on prendait beaucoup de temps pour pour les
37:45
Speaker A
entraîner sur des algorithmes qui sont assez complexes parfois mais maintenant grâce au llms ben un agent peut toujours s'appuyer sur un large language model c'est pour lui permettre de donner en fonction des données actuelles il va lui donner donc le quelle est l'action
38:00
Speaker A
optimale à prendre et du coup donc ça c'est quelque chose qu'on va trouver dans les l'écosystème de ai agents alors je vais je comme je disais aujourd'hui je rentre pas dans les détails mais je voudrais vous donner une lecture
38:13
Speaker A
diagonale de c'est-à-dire de ce que c'est l'intelligence artificielle parce qu'il faut le comprendre d'abord et après on aura l'occasion de détailler chaque partie là alors après a deep learning bon deep learning c'est un terme vous voyez donc ici donc vous avez
38:26
Speaker A
machine learning donc vous avez l'apprentissage supervisé vous avez l'apprentissage par l'expérience reinforcement learning et dans machine learning vous avez ce qu'on appelle deep learning alors deep learning c'est une partie de de machine learning euh dans lequel euh on a affaire à des problèmes dans
38:46
Speaker A
lequel vous avez euh c'est-à-dire des des données dans le nombre le nombre de input est très important par exemple si vous prenez une image vous savez une image tout à l'heure j'ai montré un exemple simple comme ça ici par exemple
39:00
Speaker A
ça c'est un exemple de machine learning vous avez combien de variables ici vous avez quatre quatre variables alors quand vous avez quatre variables vous avez 10 vous avez 20 jusqu'à 50 100 et cetera alors tout ça avec ces
39:12
Speaker A
algorithmes là KNN CSV ça marche il y a pas de problème ça on sait le faire depuis longtemps on peut toujours entraîner les modèles mais si vous avez par exemple une image alors si vous avez une image vous
39:23
Speaker A
savez une image c'est par exemple une image d'un mégapixel ça veut dire 1 million de pixel et quand vous donnez l'image à un modèle c'est-à-dire que votre modèle il y a combien d'input c'est un million chaque pixel c'est une c'est une variable parce
39:36
Speaker A
que chaque chaque pixel il y a une une couleur ben du coup donc avec les les modèles classiques c'est impossible de trouver cette formule mathématique qui qui est capable de de modéliser et là on aura besoin d'utiliser un
39:51
Speaker A
particulièrement les réseaux non artificiel et j'en ai tout à l'heure j'ai pas j'en ai parlé j'ai dit que dans l'apprentissage il y a un ensemble dans l'apprentissage pas plutôt supervisé il y a les réseaux de neuron n'est-ce pas
40:05
Speaker A
et bien ces réseaux de nor là et ben on peut les utiliser dans des problèmes aussi simples de machine learning mais quand il s'agit par exemple des problèmes qui qui manipulent l'image l'audio et aussi le texte c'est NLP et
40:21
Speaker A
dans ce cas-là on on est plus dans une logique de ce qu'on appelle deep learning et dans ce cas-là on va utiliser des réseaux de neuron mais pas de pas uniquement de simple réseaux de neuron mais c'est des des réseaux de
40:32
Speaker A
neuron profonds dans lesquels on va trouver a beaucoup de couches de neuron c'est des des des raéseaux qui sont relativement assez complexes ce n'est pas le moment de rentrer dans les les détails mais il y a des modèles que vous
40:42
Speaker A
devrez manipuler comme CNN les réseaux de de neuron convolutionnel notamment pour les tout ce qui est les images euh vous avez RNN pour tout ce qui est les séries temporelles ou par exemple lstm Gru il existe plus plusieurs modèles de
40:59
Speaker A
Deep learning y compris les Transformers alors maintenant dans deep learning donc forcément on utilise les réseaux de neuron parce qu'il n'y a pas mieux que les réseaux de neuron pour chercher la représentation de de c'est-à-dire de des patterns qui
41:16
Speaker A
existent au niveau des données alors et puis donc voyez donc dans deep learning vous avez euh vous avez quoi les générative donc vous voyez donc l' générative li générative c'est c'est en quelque sorte c'est une partie de diplonine alors c'est quoi li
41:36
Speaker A
générative li générative c'est une catégorie d'intelligence artificielle qui est capable de générer des nouvelles données comme le texte comme le l'image comme l'audio comme la musique et cetera suite à un raisonnement conditionné par un Prom utilisateur c'est-à-dire vous avez un utilisateur
41:58
Speaker A
qui va poser une question au modèle ce qu'on appelle imprompt c'est genre de question que vous posez à chat GPT et le modèle il va analyser ce prompt là et en fonction de ce prompt là il va vous
42:09
Speaker A
commencer à vous générer du contenus comme par exemple il va vous générer du texte il va vous générer un résumé ou bien il va vous générer donc du contenu texte ou des images ou de l'audio et cetera alors dans ce cas-là nous allons
42:22
Speaker A
utiliser ce qu'on appelle des modèles ce qu'on appelle les large language models donc c'est des modèles qui sont basés sur des des modèles notamment des algorithmes principalement les Transformers donc ça c'est j'auris l'occasion de de revenir là-dessus mais
42:36
Speaker A
c'est pas le moment pour rentrer dans les détails mais l'idée principale c'est quoi on va utiliser ces modèles de Deep learning qui sont les transformeur et après on va prendre un large corpus de données c'est-à-dire on va prendre une grande quantité de
42:50
Speaker A
données le web ou et cetera et ce qui est intéressant c'est que ça peut être soit des données structurées comme ça peut être des données non structuré c'est-à-dire peu du texte l'image et cetera et on va entraîner le modèle en
43:04
Speaker A
utilisant l'apprentissage autosupervisé suivi de supervisé suivi de donc c'est toutes des techniques euh qui font que à un moment donné une fois qu'il a il qu'il a appris ce qu'on appelle les patterns à partir de ces données-là et bien le modèle à un moment
43:18
Speaker A
donné il est capable de générer euh des données qu'il n'a jamais vu et vous pouvez personne n' n'a imaginé euh ce que euh maintenant chat GPT ce que DPSI et Cloud ou encore des modèles des LLM sont en train de faire et bien tout
43:35
Speaker A
simplement c'est c'est des techniques euh qui sont utilisées donc et après il y a des LLM différents types de de de large language model notamment par exemple gpt4 Lama 3 GPT c'est c'est open ee c'est Lama c'est open source c'est
43:53
Speaker A
d'origine c'est c'est MTA c'est Facebook donc ça c'est par exemple c'est les modèles on leur donne input le texte ou le output qu'est-ce qu'ils vont générer du texte les modèles comme GPT foro par exemple la mat de par exemple la version
44:11
Speaker A
3.2 ça c'est par exemple c'est des multimodales multimodal ça veut dire quoi on peut leur donner le texte mais on peut leur donner également l'image et après il génère du texte et puis vous avez des modèles qui génèent des images
44:23
Speaker A
comme par exemple Dali comme stable diffusion et cetera on va leur donner une une question soit texte ou image ça génère des images alors tout ça ça c'est la partie aujourd'hui la plus important dans l'intelligence artificielle vous voyez
44:39
Speaker A
ce ce petit schéma là vous avez l'intelligence artificielle de générative et voyez ce petit point le petit point c'est le concentré l'intelligence artificielle qui é produite depuis des années des années des années c'est pour cela qu'aujourd'hui donc la bataille elle est
45:02
Speaker A
elle est là donc c'est pour cela que j'aimerais bien que vous à la fin qu'on fasse le prompéring qu'on fasse un peu de li générative pour savoir comment tirer profit de de cette de cette partieel voilà donc ça c'est la partie
45:15
Speaker A
concept maintenant on va passer rapidement à la la première partie qui est la régression et comme ça on peut déjà commencer une une première partie mais avant ça est-ce que il y a une question sur cette partie là
45:29
Speaker A
est-ce que c'est clair pour pour les autres oui oui oui oui c'est clair ouais c'est cl ok oui c'est bon voilà je je vois plein de pousces je vois plein de PES qui montent comme ça donc ça prouve que vous vous êtes
45:55
Speaker A
éveillé sil vous plat une question si vous permettez voilà allez-y PL question si vous posez une question juste prononcez votre nom d'accord jeis Doct très bien alors c'est quoi ta questioned ma question est quelle est la différence entre la classification et le
46:33
Speaker A
Class d'près votre explication c'est différent ou c'est la même chose non alors en fait la classification la classification c'est quand on a un dataset c'est des supervisé c'estàdire vous avez des données vous avez un dataset pour lequel vous avez les input et le output
46:54
Speaker A
c'estàdire vous avez des données qui sont étiqueté on conna classes c'est-à-dire pour les inputs vous avez les les différentes classes et après on va entraîner le modèle de façon à à ce que à un moment donné on va lui donner
47:06
Speaker A
donc un échantillon et après il va prédire de quelle classe s'agit-il donc ça c'est la classification alors que dans le l'apprentissage non supervisé vous avez un dataset pour lequel qui n'est pas étiqueté c'est-à-dire vous avez un ensemble de données par exemple
47:21
Speaker A
une image et mais on n'a pas forcément de c'est on connaît pas ce que ce qui se passe dans l'image et le clustering c'est des algorithmes qui vont fouer dans les données et c'est l'algorithme lui-même qui va essayer de de de
47:34
Speaker A
chercher les clusters les les groupes et donc ça c'est c'est complètement différent donc si tu veux être un peu plus clair la classification c'est que c'est la ptis ça supervisé ça veut dire vous avez des données pour lesquel vous
47:47
Speaker A
avez les inputs et les outputs on connaît les les output et le le le clusttering c'est quand on a un ensemble de données euh voilà on a un ensemble de données pour lesquel on n pas le output c'estàdire on prend que cette
48:01
Speaker A
partie là des données que cette partieel d'accord merci monsieur je vous en prie alors maintenant on va on va essayer de de commencer la première partie alors dans les les slides je sais que je parle beaucoup et dans les slides vous allez
48:23
Speaker A
trouver une partie de ce que je dis donc si vous revenez vers les slides vous avez le texte euh c'est quoi l'IA c'est quoi li a d c'est quoi les différents types d'IA vous avez le les différents types
48:33
Speaker A
d'apprentissage vous avez tout ce que je viens de dire donc écrit en texte et ça vous permet donc de de revenir sur les petits détails l'apprentissage piloté par l'expérience lia générative et voilà alors bien alors maintenant on va on va
48:55
Speaker A
commencer la la première partie euh notamment on va s'intéresser à la partie apprentissage supervisé et particulièrement on va regarder ce que c'est la régression et par la suite on va la classification c'est pour la semaine prochaine on essaiera de faire
49:10
Speaker A
passer chaque semaine un type donc forcément ça va être condensé mais il y a des des Lab que je vous ai laissé classroom et cetera et je vais vous montrer comment vous pouvez travailler chez vous bien sûr alors donc je
49:26
Speaker A
rappelle euh dans le domaine de l'apprentissage supervisé euh vous avez en fait deux types de de problèm vous avez la régression et la classification alors la régression consiste à prédire en sortie une valeur continue euh comme je disais donc une valeur continue euh
49:42
Speaker A
comme le prix d'un appartement la durée de vie de d'une pièce mécanique euh ou encore la durée de guérison de d'un patient et effectivement ça c'est très important euh c'est-à-dire que vous savez dans les les hôpitaux euh on a les
49:57
Speaker A
médecins ont beaucoup besoin de ça en fonction des les données du patient je voudrais savoir combien il va rester dans dans l'hôpital et là c'est c'est des problèmes qui qui ont un impact socio-économique extrêmement important encore il y a parf il y a des maladies
50:13
Speaker A
qui sont c'est-à-dire qui sont fatales et on a on a besoin de savoir la durée de vie donc c'est les médecins vont aujourd'hui il nous sollicitent beaucoup beaucoup bon c'était pas le cas mais aujourd'hui tous les médecins du monde
50:30
Speaker A
dès qu'il trouvent des gens qui font de l'intelligence artificielle alors que avant on demandait les données alors que avant on demandait les les les données c'était pas le aujourd'hui donc c'est pas le cas voilà alors donc pour le l'apprentissage
50:50
Speaker A
supervisé donc comme je disais donc le la régression l'idée principale c'est quoi c'est déterminer la relation entre les variables d'entrée c'est ce qu'on appelle les variables indépendantes et la variable dépendante donc ça c'est c'est ce que je viens de dire tout à
51:05
Speaker A
l'heure alors par exemple bon je vais vous montrer une petite démo tout à l'heure un petit dataset que j'ai pris comme ça si je d'ailleurs je vous conseille quand vous commencez chaque type de de d'apprentissage n'utilisez pas des données complexes essayez de
51:19
Speaker A
créer un petit fichier excel vous-même un petit dataset que vous créez vous-même et avec ce dataset là vous l'utilisez pour comprendre mais après par la suite vous passez vers des données un peu plus plus conséquentes alors donc ici vous avez
51:34
Speaker A
par exemple un petit dataset que j'ai créé dans lequel vous avez de de de variables une variable indépendante qui est la surface en mètre carré par exemple et la variable dépendant c'est le prix le prix de du bien ou bien de
51:51
Speaker A
l'appartement alors si vous cherchez donc ça c'est un dataset alors quand vous tracez ce qu'on a app les nuages de point et ça c'est très important ce que vous voyez là c'est ce qu'on appelle les nuages de point ici donc nous sommes
52:03
Speaker A
juste en train de représenter c'està-dire le prix en fonction de de la surface donc vous avez un nuage de point avec le nuage de point c'est le DataSet alors ici c'est plus simple représenter parce que c'est vous avez une seule
52:18
Speaker A
variable alors la régression c'est quoi c'est de trouver c'est de trouver tout simplement la la formule mathématique qui permet de passer par ces ces points bon ça c'est le le le la régression c'est ça c'est-à-dire trouver cette formule mathématique qui permet de faire
52:33
Speaker A
le lissage de passer par ces point alors sauf que il est très difficile de trouver toujours la cette formule qui va essayer de généraliser c'est-à-dire qui qui va essayer de comprendre le le c'est-à-dire les données donc c'est pour cela ce
52:49
Speaker A
qu'on cherche c'est que on va chercher une approximation et si vous si vous faites ce qu'on appelle la régression linéaire l'idée c'est quoi c'est de tracer une ligne c'est qui déterminer la droite qui va ajuster ses points c'est-à-dire qui va essayer de passer à
53:03
Speaker A
côté de tous les les points de façon à ce que l'erreur soit minimisée donc l'idée principale est-ce que je vais utiliser cette droite ou bien cette droite ben il faut chercher cette droite là qui ce qu'on appelle line of bestfit
53:17
Speaker A
c'est-à-dire c'est le la ligne qui va ajuster l'ensemble des des points alors justement si vous cherchez à déterminer donc cette cette cette cette cette droite ou bien cette courbe qui va ajuster les points et ben c'est que vous
53:32
Speaker A
êtes en train de faire le la régression tout simplement alors comme je disais tout à l'heure les variables les variables euh c'est-à-dire d'entrée c'est ce qu'on appelle les variaable indépendant et les features et la variable de sortie c'est la variable
53:46
Speaker A
indépendante ou ce qu'on appelle target ou le terme outcome donc c'est des termes qui sont utiliser souvent et par exemple si vous faites le cas le plus simple d'une d'une régression sur laquelle vous avez une seule variable l'idée c'est de trouver tout simplement
54:01
Speaker A
dans la régression linéaire c'est de trouver la fonction y égale quoi égal c'est un coefficient multiplié par X plus ce qu'on appelle l'intercepte donc c'est le coefficient et ça c'est l'intercepte donc ça c'est tout simplement une équation AX + B alors
54:19
Speaker A
sans trop tarder je vais je vais faire une petite démo donc pour vous montrer ce caslà qui est plus simple parce que c'est bien de commencer avec ce caslà alors pour pour comment on va travailler alors euh d'abord je j'ai dit
54:32
Speaker A
que sur classroom je vous ai laissé le le support alors classroom vous avez le support vous allez trouver donc les les les c'est-à-dire ce qu'on appelle les notebook c'est des fichiers IP nB donc c'est là vous allez trouver le le code
54:53
Speaker A
vous allez trouver les explications vous allez trouver les détails et cetera il y a des dataset c'est des fichiers CSV ça peut être des fichiers Excel donc c'est c'est alors ce que ce que ce que vous pouvez faire c'est c'est c'est
55:06
Speaker A
télécharger ces fichiers alors par exemple je vais télécharger par exemple celui-là alors une fois que vous avez téléchargé ça euh vous savez donc pour travailler pour faire vos vos Lab il existe plusieurs façons de faire donc d'abord normalement euh la façon la
55:30
Speaker A
plus simple pour vous si vous n'êtes pas habitué vous voulez pas installer désinstaller benah on va utiliser euh collab alors collab donc euh euh c'est Google collab bah avec ça c'est largement suffisant avec ça vous pouvez faire vos vos vos laps s sans aucun
55:46
Speaker A
problème donc c'est ce que je vais vous montrer de faire euh mais si vous voulez euh si si vous voulez aller plus loin et vous voulez vraiment euh vous pouvez le faire je vous conseille d'install d'installer Visual Studio code vs code
55:58
Speaker A
donc ça c'est ce que j'utilise personnellement pour c'est le meilleur éditeur pour pour travailler tranquillement pour développer vos applications aussi bien l'intelligence artificielle qu'autre chose surtout que ceux qui vont qui veulent développer un front-end avec une application on veut
56:15
Speaker A
déployer donc ça c'est important ou tout simplement vous installez euh Jupiter donc ça c'est un outil également c'est à peu près l'équivalent de collab mais en local dans votre machine c'est c'est pareil donc alors maintenant ce que je
56:30
Speaker A
vais la démo que je vais vous faire aujourd'hui donc c'est sur collab mais après par la suite moi je vais beaucoup travail sur VS code mais vous bien sûr à un moment donné vous faites vous choisissez le l'environnement qui vous
56:41
Speaker A
convient l'essentiel c'est de ne pas bloquer c'est c'est ne vous ne vous bloquez pas sur l'installation des installés et cetera mais c'est il y a des petits détails par la suite je vous promets je vais revenir sur les petits
56:54
Speaker A
détails et à ce moment-là vous pouvez comprendre un peu la différence entre les différents environnements donc ce qui fait euh donc une fois que vous vous téléchargez donc en tout cas Google collab on peut y arriver comme ça alors
57:16
Speaker A
cab alors c'est collab research.google.com alors ce que ce que je vais faire par exemple ici donc je vais créer un nouveau notebook dans Drive alors ça ça suppose que vous avez votre drive dans lequel vous pouvez stocker les les
57:42
Speaker A
fichiers vous pouvez les les les ouvrir et cetera donc c'est c'est vraiment idéal pour donc je crée un notebook et donc vous avez ici en fait un environnement dans lequel je vais travailler euh la démo alors vous avez un notebook ici
58:02
Speaker A
euh vous donnez un nom par exemple ici donc je vais l'appeler régression alors c'est des fichiers qui on l'extension IP NB et puis donc dans l'environnement vous avez vous allez cré ce qu'on appelle des cellules soit que vous créez
58:23
Speaker A
une cellule concerne le code donc là c'est des codes python que nous allons écrire qu'on va exécuter ou bien vous créez des cellules de type texte c'est là où vous allez euh en fait écrire euh en fait des commentaire de l'analyse et
58:35
Speaker A
cetera euh donc le le je vais vous montrer d'abord le notebook le notebook que je viens de de vous partager donc vous pouvez le mettre dans votre drive je cherche mon alors mail alors il y a un dossier voilà ça c'est le c'est le
59:15
Speaker A
notebook vous avez sur classroom donc les les notebook je vais vous donner ils sont ils sont vraiment détaillés parce que premièrement ça vous donne voyez donc euh ça ça rappelle c'est quoi l'intelligence artificielle c'est quoi l'AD euh et il y a des images
59:32
Speaker A
normalement que vous devrez voir je sais pas pourqu elle s'affiche pas mais en tout cas vous pouvez le les voir l'apprentissage supervisé la régression linéaire ça c'est les choses dont je vous ai parlé euh ça on y reviendra tout
59:43
Speaker A
à l'heure comment euh mesurer les comment évaluer la la la régression les différentes donc vous avez des concepts ça on va en parler encore le le overfitting underfitting ça c'est des éléments qui sont importants et puis vous allez trouver de des codes vous
59:59
Speaker A
allez trouver le euh en fait l'exécution au fur et à mesure avec l'analyse et cetera mais en tout cas vous avez un document en même temps vous le lisez vous comprenez le concept alors pour vous si vous nêes vous vous voulez pas
60:12
Speaker A
écrire le code vous prenez ce ce c'est-à-dire ce notebook vous commencez à exécuter et remarquez vous faites le plus important pour vous c'est c'est c'est de comprendre alors bien sûr idéalement c'est de de maîtriser tout ça c'est-à-dire alors voilà ce que je vais
60:27
Speaker A
faire donc je vais créer un donc dans ce nouveau notebook alors comme je disais donc si je crée euh alors je fais un print test ici vous exécutez alors la première exécution ça prend quelques petites secondes le temps qu'il charge
60:44
Speaker A
l'environnement est-ce que c'est c'est lisible comme ça voilà alors euh donc ça c'est c'est c'est une cellule de type code alors ici donc cellle de type texte donc ici c'est du texte par exemple le format utilisé c'est ce qu'on appelle le format
61:02
Speaker A
Markdown le format c'est c'est un format avec lequel chat GPT ou les outils ils vont vous formater les données par exemple quand on met par exemple DDS comme ça par exemple ça c'est le par exemple apprentissage apprentissage supervisé alors alors shift entrée ça
61:25
Speaker A
permet d'exécuter voyez donc ça c'est le style et après vous allez trouver les puces et cetera donc forcément parce qu'il y a un petit projet sur lequel vous allez travailler et le compte-rendu que que vous allez remettre c'est un notebook et dans le
61:38
Speaker A
notebook vous allez forcément écrire du texte pour analyser mettre un peu des explications donc vous aurez besoin de savoir comment manipuler ce ce ce marque CE Mar alors maintenant ce que je vais faire c'est que je vais je vais lire en
61:52
Speaker A
fait un dataset rapidement pour vous expliquer ce que c'est la agession et pour lire un dataset on va utiliser une librairie qui s'appelle pondas alors l'une des librairies les plus utilisés en tout cas il y en a deux que vous
62:06
Speaker A
allez beaucoup utiliser trois pondas cyit learn cborn donc ça c'est trois librairies alors si vous voulez installer circolab si vous voulez installer une librairie on utilise une cellule de code dans laquelle vous mettez un point d'exclamation PIP install
62:28
Speaker A
par exemple ici pandas alors c'est une commande pour lui pour cab pour Jupiter et donc pour luici qu'il s'agit d'installer donc si dans votre environnement il n'est pas installé il va l'installer alors s'il est installé par exemple ici satisf c'est cette livrie est déjà
62:50
Speaker A
installé dans mon environnement donc ici donc panda il est il est installé autre chose donc si vous voulez avoir une idée sur l'environnement c'est très je vous conseille de le tester c'est d'importer c'est d'importer une librairie qui s'appelle
63:05
Speaker A
plateforme de Python et après avec plateforme vous pouvez faire appel par exemple python version par exemple ça c'est important c'est-à-dire je suis dans dans cab mais je je dois savoir quelle version DEP pon que j'utilise alors si je l'exécute je vois bien que j'utilise
63:26
Speaker A
ici la version 3 3.11 et puis vous pouvez voir quel système d'exploitation quel matériel et cetera donc avec ça ça vous dit ça vous donne une idée sur l'environnement sur lequel vous travaillez alors par défaut vous avez ici
63:41
Speaker A
un un lien dans lequel vous pouvez voir vous pouvez modifier le type d'exécution et voyez donc dans le type d'exécution vous voyez donc ici pour le moment j'utilise un simple processeur mais quand vous allez faire du Deep learning
63:54
Speaker A
avec les réseaux de neuron vous aurez besoin d'utiliser ce qu'on appelle les GPU parce que sinon vous lancez votre calcul vous allez vous attendez une année parfois pour pour voir les résultats donc vous aurez besoin d'utiliser les GPO ça on va
64:10
Speaker A
en parler les TPO donc cab il vous offre une possibilité ce qui est gratuit c'est toujours gratuit mais c'est toujours pas toujours disponible donc si vous si vous avez un environnement qui est disponible mais ça pour le moment vous n'aurez pas
64:23
Speaker A
besoin de GPO tant qu'on est dans machine learning donc ici donc un simple environnement peut peut suffire pas de problème voilà alors donc ici ce que je vais faire je vais importer je vais importer pandas as donc ça c'est c'est juste c'est un
64:47
Speaker A
alli pondas alors en fait c'est-à-dire que toutes les livr toutes les fonctions dans dans pondas je peux maintenant les utiliser je vais lire data frame un Data frame c'est un Data en fait un datafame c'est quoi c'est un tableau qui contient
65:05
Speaker A
un ensemble de colonnes et et de lignes alors forcément pour le lire vous allez je vais faire égal pondas read et vous avez ici les fonctions vous avez vous allez trouver read CSV read Excel read read donc ça dépend du
65:22
Speaker A
format de fichier alors ici donc j'ai besoin de lire un un fichier CSV alors ce fichier là où est-ce que je vais le mettre donc ici dans les fich la partie fichier donc vous aurez besoin d'importer votre fichier alors ici donc
65:37
Speaker A
j'ai besoin d'un fichier qui s'appelle primaison CSV alors ça c'est le 2 il a le 1 primisant donc j'en aurais besoin des deux donc là il va falloir les importer dans votre re environnement et puis donc ici donc je vais lire
66:00
Speaker A
primison.csv d'ailleurs si vous faites contrôle espace ça vous ça vous aide à retrouver vos vos fichiers alors shift entrée ça permet d'exécuter donc vous voyez donc je je viens de charger mon mon mes données CSV et après si je veux
66:15
Speaker A
voir qu'est-ce qu'il y a dans le dataframe ben tout simplement vous pouvez le tout simplement DF vous l'exécuter je vois bien comment dataframe se compose ici il y a combien de Colon il y a la surface et le prix
66:30
Speaker A
c'est un grand datas hyper grand 5 C lignes mais ça c'est c'est un truc que je crée avec Excel des trucs comme ça dans un fichier l'objectif pour nous c'est de comprendre et ça c'est c'est vraiment conseillé de faire ça et puis
66:50
Speaker A
donc quand vous avez un Data frame vous avez DF faut c'est une méthode qui qui vous donne des informations sur le Data frame vous avez ici les colonnes par exemple la colonne et regardez quelque chose d'important 5 combien de valeurs sur le
67:09
Speaker A
il y a cinq valeurs non Nules ici également le prix il y a combien de valeurs non Nules 5 les valeurs iles sont de quel type c'est des entiers c'est des des valeurs alors quand c'est c'est des nombres c'est des
67:22
Speaker A
des int quand c'est des des strings c'est des objects et cetera on peut le voir et si vous voyez ici cinq valeurs ça veut dire que typiquement là on n' pas ce qu'on appelle les données mon compte parce que parfois ce qui arrive
67:34
Speaker A
dans les les les dataset on a des données mais dans les données il y a ce qu'on appelle des données mon compte alors tout à l'heure je vais vous montrer comment on traite ces données mon compte d'ailleurs si je veux voir
67:44
Speaker A
quelles sont les données mon compte je vais utiliser DF is Isna et après vous faites la vous faites appel la Somme et ça c'est intéressant parce qu'il vous dit que AA il y a combien de données mon compte zéro et
68:03
Speaker A
pour le prix a combien de Don compte il y a zéro bon je suis tranquille alors ici donc je le vois avec mes yeux mais quand vous avez des milliers de lignes et de de colonnes ça c'est très
68:11
Speaker A
important et puis si vous voulez faire un résumé des statistiques sur les données on va utiliser DF describe tout à fait alors describe c'est très utile parce que ça c'est le résumé de normalement pour faire ce cours il faut faire il est préqué au
68:31
Speaker A
niveau statistique c'est très important comme le le cours il est très réduit donc on peut pas faire ça mais ça je vous je vousenvoie sur un peu le les bases de statistique si vous voyez des termes que vous comprenez pas il
68:44
Speaker A
vaudrait mieux revenir rapidement pour comprendre comment c'est alors qu'est-ce que je vois ici donc je vois par exemple le compte le count c'est-à-dire le nombre de valeurs 5 la moyenne des valeurs ça c'est standard deviation c'est le l'écart type euh la la valeur
69:00
Speaker A
minimale et ça c'est le le les le le premier quartil si vous voulez les 25 % les 50 % des données les 75 % des données c'est le quartil 1 le quartil 2 le quartil 3 et puis euh le maximum alors si vous voulez
69:18
Speaker A
afficher ça parce que ça c'est une matrice si vous mettez point t alors t c'est la transposé vous savez la transposé d'une matrice ça vous ça vous remet ça et c'est en terme de lecture c'est plus intéressant parfois de de
69:29
Speaker A
travailler comme ça parce que je vois il y a deux colonnes et pour chaque colonne je vois donc les les les informations mais à partir de ces informations là après on va faire une lecture on va on va commencer à constater par exemple je
69:41
Speaker A
vois ici c 5 je vois minimum 100 je vois le maximum et après on peut commencer à chercher à tracer les distributions on va c'est ce que je vais vous montrer tout à l'heure pour analyser à peu près
69:54
Speaker A
chaque chaque variable et est-ce qu'il y a des donné mon compte est-ce qu'il y a ce qu'on appelle les outlers ce qu'on appelle les valeurs abérrantes je les les outlers c'est que vous voyez par exemple une population vous avez les
70:08
Speaker A
âges entre entre par exemple entre 18 ans et 20 20 ans n'est-ce pas vous avez beaucoup de monde la majorité des gens ils ont l'âge entre 18 et 20 ans toute la concentration de vos données entre ça et parmi les les données vous avez une
70:24
Speaker A
seule personne qui il y a par exemple 90 ans donc la donné c'est ce qu'on appelle un outlerayer donc si vous supprimez pas la donné il va vous faer le votre modèle donc parfois les outlayers il faut qu'on
70:38
Speaker A
sache également comment est-ce qu'on va les traiter est-ce que on va les supprimer est-ce que c'est c'est des bruits et cetera donc tout ça c'est c'est des choses qu'on va essayer de faire mais comme aujourd'hui donc le temps il est
70:51
Speaker A
un peu très très serré je vais aller rapidement vers d'abord je vais dessiner le nuage de point alors pour cela pour avoir ce nuage de point je vais importer une librairie qui s'appelle mat plot lib ça c'est vous n'avez pas besoin
71:08
Speaker A
de l'installer mat plot mat plot lib P plot as PLT et puis on va utiliser PLT alors PLT tout simplement on utilise on utilise scatter scatter si vous voulez dessiner un nuage de point et puis vous donnez le X alors dans
71:36
Speaker A
notre cas le X c'est quoi c'est DF qu'est-ce qui nous intéresse dans DF c'esta c'està-dire en X je vais mettre la surface et en y c'est quoi c'est price bon après je fais ça si vous exécutez voyez ici donc j'ai mon nuage de point
71:58
Speaker A
donc les C points que j'ai ici alors après je vais choisir la couleur par exemple le rouge je vais choisir le ce qu'on appelle le le mar le marker par exemple je vais mettre un plus comme c'est des points c'est bien
72:21
Speaker A
de mettre des plus comme ça alors ça c'est monage de point mais moi dans euh le modèle que je vais créer de régression l'idée euh c'est de trouver qu quelle est la ligne qui va euh ajuster ces ces point alors maintenant
72:36
Speaker A
euh une fois que je fais ça je vais créer directement le modèle alors pour créer le le modèle de régression linéaire je vais importer je j'ai besoin d'installer une librairie qui s'appelle cycit learn l'ensemble des algorithmes de machine learning euh les plus
72:52
Speaker A
utilisés se trouvent dans cette librairie donc euh pour cela euh si vous voulez installer cycet learn donc vous utilisez install cycet learn ça s'écrit comme ça cy kit learn alors la même chose donc c'est c'est déjà installé et
73:11
Speaker A
maintenant ce que je vais faire c'est que from cyit Lear es learn je vais importer linéire modèle en fait Linéar modèle c'est là où il y a les modèles linéaires pour le moment je vais utiliser linéal modèle et sur linéal
73:29
Speaker A
modèle je vais utiliser la régression linéaire pour cela je vais créer un modèle ég linéaire modèle point voilà Liné régr exécuter donc qu'est-ce que je viens de faire donc je viens de de créer ça c'est l'algorithme de la de
73:50
Speaker A
régression linéaire maintenant cet algorithme là je dois l'entraîner n'est-ce pas ça veut dire quoi l'entraîner l'entraîner ça veut dire que je vais lui donner les inputs et les je vais lui dire par exemple pour cette valeur de la de surface voilà la sortie
74:05
Speaker A
pour cette valeur de de la surface voilà le prix et après il va ESS de de tourner jusquà ce qu'il trouve c'estàd cette droite qui qui va ajuster ces points alors pour faire cette opération on va utiliser modèle d'abord on va extraire le X comme
74:22
Speaker A
ça on peut être un peu plus clair alors pour x plutôt y d'abord la sortie c'est quoi c'est DF ça c'est quoi c'est Price et X alors le X c'estàd le reste c'estàdire prenez le y mais x le reste
74:48
Speaker A
des variables et pour avoir le reste des variables vous allez utiliser DF Dr je vais supprimer de DF colonnes et quels sont les les colonnes que je vais supprimer pour le moment je vais supprimer que le prix et ça c'est très
75:04
Speaker A
pratique parce que quand vous avez les autres variables toutes les autres variables il vont rester dans le X alors maintenant j'ai maintenant les inputs c'est le X et le output c'est y alors si vous regardez bien sûr y vous
75:19
Speaker A
pouvez voir ce qu'il contient il y a que le prix et le X voilà ce qu'il contient alors maintenant pour pour entraîner le modèle je vais utiliser modèle point fit alors fit fit c'est apprendre à partir de quoi je dois lui donner le
75:36
Speaker A
input et le output donc c'est X Y c'est très rapide bon il a il a il est entraîné alors du moment qu'il est entraîné on va essayer donc de si vous voulez faire maintenant la prédiction une fois qu'il a entraîné on va lui
75:51
Speaker A
demander de prédire alors pour faire la prédiction je vais lui demander modè je vais lui demander de prédire par exemple le prix le prix une maison de 120 m mais comme il faut donner une matrice donc ça doitrire
76:09
Speaker A
comme ça c'est une matemble alors je vais mettre ici 120 ici donc ça c'est pr si vous mettez on va afficher donc print voilà donc pour c'est-à-dire le modèle une fois qu'il a appris donc je lui demande de me donner le prix de de
76:37
Speaker A
c'està-dire de cette superficie il me donne une estimation alors maintenant ce que je veux faire c'est que je veux représenter cette c'est-à-dire je voudrais représenter cette cette droite dans les nuages de point pour avoir une une visibilité et pour
76:57
Speaker A
cela je vais encore faire la même chose ici voilà je prends ça alors pour faire pour faire mieux donc je vais d'abord euh alors plot vous pouvez créer un une figure alors si vous vous voulez donner la dimension de la
77:30
Speaker A
figure figure size par exemple ici je vais utiliser 10 x 5 encore pour l'axe des X vous utilisez x label par exemple x label je vais utiliser c'est area y label c'est Price et le titre c'est Linéar regression donc je peux mettre ici donc
77:54
Speaker A
ça ça peut être si j'exécute B je vais juste savoir ça ça va c'est comme ça c'est c'est toujours visible pour vous ok alors maintenant ce que je vais faire c'est que en même temps je vais utiliser PLT plot cette fois-ci parce que je je
78:15
Speaker A
vais faire un plot c'est quoi le PLT pltplot X donc c'est-à-dire si vous voulez bon j'ai un peu ché une étape alors pour faire la prédiction de toutes de toutes de tous les les points que j'ai je vais créer une variable que je vais
78:41
Speaker A
appeler predicted égal à quoi égal modèle point predict x c'est-à-dire je lui donne les X n'est-ce pas il va faire la prédiction don qu'est-ce que j'ai finalement conis mais jeé donner modè qu'il sont pas VO lestilis qui va nquer les perform de
79:14
Speaker A
notre mod alors don j'ai fait qu'estce que je vais représenter je vais représenter X alors j'exécute et vous voyez donc cette droite alors ici donc je vois bien c'est-à-dire mon modèle il a bien trouvé une droite qui est proche
79:35
Speaker A
des des points donc ici donc je viens d'entraîner si vous voulez pour vous ça va être le premier modèle que vous avez entraîné et qui permet de faire la prédiction alors maintenant si je lui donne une valeur qu'il n'a jamais vu
79:48
Speaker A
benah il va me donner par exemple pour 250 donc il va vous donner la la valeur ici 250 voilà donc ça vous donne l'estimation de de la valeur alors maintenant est-ce qu'on va faire confiance à ça non je le vois avec mes
80:08
Speaker A
yeux bon ça a l'air d'être d'être bon mais il faut des métriques alors dans le domaine de l'intelligence artificielle une fois qu'on va entraîner un modèle il faut l'évaluer alors maintenant quelles sont les métriques d'évaluation qu'on utilise dans la régression
80:35
Speaker A
alors donc vous avez ça c'est c'est important alors ici donc pour la fait la régression donc vous avez la métrique la première métrique qu'on va utiliser généralement qu'on va évaluer c'est r Carr al en fait r car ça ça s'exprime
80:53
Speaker A
comme ça c'est 1 moin ça c'est la somme de I é= 1 jusqu'à n de quoi c'est y y y c'est c'est-à-dire c'est le c'est le c'estàdire pour les données le output que j'ai dans le DataSet n'est-ce pas
81:13
Speaker A
moins la valeur qui a été prédite parce que vous savez vous avez la vraie valeur c'est celle là n'est-ce pas mais celle qui est prédite c'est C qui est sur la ligne vraie valeur et ça c'est la valeur
81:27
Speaker A
qui est prédite donc l'erreur n'est-ce pas donc c'est ça l'erreur alors parfois l'erreur il est positive il est négative comme ça donc nous on veut euh donc regarder ces erreurs là on va les les interpréter avec un score qui est compris entre 0 et
81:45
Speaker A
1 et ça va nous donner à peu près les performances du modèle et c'est ça donc r au carré c'est la somme euh en fait de de 1 à à N y i- y hat y hat c'est le
81:57
Speaker A
prédict précted au carré divisé par la variance et la variance c'est quoi c'est la somme de I é= à 1 jusqu'à n de y i moins la moyenne des y donc ça c'est tout simplement au niveau statique statistique c'est ce qu'on appelle la la
82:13
Speaker A
variance alors ce score- là R2 généralement il est suffisant pour vous donner déjà une indication sur les performances du du modèle mais si vous voulez encore aller plus loin vous avez ce qu'on appelle min absolute error c'est le le le c'est la moyenne absolue
82:31
Speaker A
des erreurs ça s'écrit comme ça c'est la somme de 1 jusqu'à n de la valeur absolue de y i moin igégate c'est-à-dire tout simplement c'est la somme de quoi des résidus c'est la somme des des des erreurs et puis
82:48
Speaker A
vous avez euh root min squareed error donc ça s'écrit euh comme ça c'est la racine de la somme de 1 jusqu'à n de Yi Mo y hat au carré et ça ça ça me donne une idée sur le sur c'est-à-dire sur
83:07
Speaker A
le la valeur de la quantité de de l'erreur que j'ai dans le le modèle alors donc ça c'est c'est des formules alors maintenant dans notre cas comment on va faire ça on va tout simplement importer from sakitlerur on va importer
83:30
Speaker A
matrix alors comme ça c'est mieux de faire comme ça comme ça vous avez toutes les les différentes métriques et donc parmi les métriques euh donc on va utiliser euh matrix tout simplement vous avez r euh plutôt voilà R2 score vous allez trouver donc toutes
83:53
Speaker A
les maétriques ce que je viens de vous montrer mis les autres métriques alors maintenant qu'est-ce qu'on va lui donner on va lui donner le le y ça c'est le c'est les données du nuage de point les données le output et les valeurs prédit
84:08
Speaker A
et prédit nous avons stocké ça dans quel variable predicted parce qu'en fait on avait prédit les les valeurs bah on calcule et vous voyez ici donc vous avez 0 94 et ça vous pouvez dire que j'ai un modèle qui est performant à hauteur de
84:27
Speaker A
94 pour pour c'est déjà pas mal n'est-ce pas c'est des données manuelles comme ça mais est-ce que je peux encore faire confiance non pourquoi parce qu'en réalité je suis en train de de le tester avec les mêmes données
84:45
Speaker A
d'entraînement c'est-à-dire j'ai pris les données d'entraînement je l'ai entraîné et quand je le teste je le teste avec les mêmes données qu'il a déjà vu dans l'entraînement mais ça ça devrait vous devrez avoir une bonne déjà parce que il faut le faire parce que on
84:59
Speaker A
va voir d'abord est-ce que le modèle a réussi à à en fait à euh à généraliser sur les données d'entraînement ça c'est bien mais il me faut maintenant les données de test donc c'est-à-dire euh les données de test c'est-à-dire il me
85:14
Speaker A
faut chercher des données euh de pour lesquelles le que le modèle n'a jamais vu donc ce qui fait généralement ce qu'on fait quand on a un dataset il va falloir qu'on le divise d'abord une partie c'est ce qu'on appelle les
85:27
Speaker A
données d'entraînement par exemple 70 % des données on va les garder pour l'entraînement et 30 % ou bien 20 % on va les garder pour les tests l'évaluation alors ici comme il y a que 5 il y a rien à diviser alors c'est pour
85:46
Speaker A
cela que je vais utiliser un autre de set que vous allez trouver c il y a pas encore beaucoup de données mais on va essayer d'appliquer maintenant notre démarche qui sur laquelle on va s'approcher maintenant de de quelque
85:56
Speaker A
chose de d'assez assez assez correct si vous voulez mais déjà si vous faites ça c'est déjà très bien c'est-à-dire vous commencez à avoir déjà à peu près le l'idée de de comment on va on va se on va faire ça alors comme je disais donc
86:13
Speaker A
ce qu'on va faire maintenant je je dois d'abord vous parler de de ça et ça c'est très intéressant si que dans le vous avez des le le le billet la variance underfitting overfiting alors d'abord il faut juste savoir que au
86:36
Speaker A
niveau statistique le le billet ce qu'on appelle bias ou bien le billet et la variance ce sont deux sources d'erreurs clé dans les modèles d'apprentissage automatique qui impacte directement les performances de ces modèles donc c'est-à-dire que les billet et la
86:55
Speaker A
variance il vous donne ce sont deux valeurs clés qui vous indiquent à quel niveau votre modèle il est performant et donc du coup donc on va essayer donc de de comprendre ce que c'est d'abord qu'est-ce qu'il mesure le le billet le
87:08
Speaker A
billet ça mesure quoi c'est la différence entre la prédiction dans notre modèle regardez bien entre la la prédiction dans notre modèle et la valeur correcte que nous essayons de prédire c'est-à-dire tout simplement c'est Y- y hat n'est-ce pas
87:25
Speaker A
donc un modèle avec un billet élevé si vous avez un billet qui est élevé accorde moins d'attention au données d'entraînement et surgénéralise donc c'est-à-dire quand vous avez dans votre modèle vous avez un B qui est très élevé voyez donc si vous
87:43
Speaker A
avez un bill très élevé ça veut dire que votre modèle il accorde moins d'importance aux données d'entraînement c'est-à-dire il n'a pas iessay vraiment parce que parfois voyez par exemple pour ce nuage de point qui serait l'idéal c'est-à-dire si vous cherchez la
88:00
Speaker A
la formule l'idéal c'est de trouver quelque chose comme ça n'est-ce pas c'est normal le modèle réel c'est ça n'est-ce pas ça c'est l'idéal mais si vous vous essayez de de faire ça alors si vous essayez de faire ça c'est que vous êtes en train
88:23
Speaker A
d'accorder beaucoup d'importance aux données d'entraînement c'est-à-dire vous cherchez vraiment la formule qui va passer sur l'ensemble des points et le problème si vous faites ça c'est que vous allez avoir au niveau de d'évaluation par les données d' si vous
88:37
Speaker A
faites les tests avec les données d'entraînement vous allez avoir 100 % c'est-à-dire et si vous voyez 100 % vous pouvez créer oh j'ai j'ai un modèle qui est très très bon mais quand vous lui donnez les données de test vous allez
88:50
Speaker A
tomber vers 50 % ou bien 20 % des choses comme ça c'est-à-dire que ça c'est c'est ce qu'on appelle quand vous avez un modèle comme ça c'est que vous êtes dans ce qu'on appelle overfitting alors overfitting c'est-à-dire c'est le surapentissage
89:03
Speaker A
c'est que votre modèle il a essayé vraiment de de trouver la la formule qui va lier tous les points de des données d'entraînement alors que l'inverse c'est que quand vous avez un vous avez ça c'est ce qu'on appelle le underfitting
89:17
Speaker A
le underfitting quand vous avez un billet qui est très très élevé c'est du underfitting c'est-à-dire que finalement vous avez une une droite qui est très loin de la réalité c'est-à-dire que on acccorde pas l'importance aux données d'entraînement c'est-à-dire si votre modèle il est déjà
89:36
Speaker A
mauvais pour les données d'entraînement B s'il est mauvais pour les données d'entraînement alors forcément pour les données de test il faut pas s'attendre à à grandchose n'est-ce pas donc ici pour ce genre de scénario qu'est-ce que vous voyez vous voyez si vous faites la somme
89:49
Speaker A
des erreurs des résidus ben ça va vous donner le le billet et le bill généralement il vous donne une idée sur est-ce que vous êtes dans le dans cette situation alors que la variance la variance et la valeur qui indique la
90:04
Speaker A
dispersion des données donc un modèle avec une variance élevée accorde beaucoup d'attention au données d'entraînement en captant aussi les bruits donc c'està-dire vous allez être dans cette situation si vous avez dans votre modèle une variance qui est très
90:21
Speaker A
forte ça veut dire que votre votre modèle il accorde beaucoup d'importance aux données d'entraînement c'est-à-dire vous allez trouver souvent un modèle qui est très bon au niveau de de l'entraînement mais généralement qui qui est mauvais pour les données de de test
90:37
Speaker A
et donc forcément euh c'est tout simplement avec le billet et les variances on peut parler tout simplement de des modèles donc ce genre de de situation c'est du underfitin c'est-à-dire ça on peut le voir facilement donc undererfitin vous avez
90:52
Speaker A
eu généralement le billet qui est très très élevé et vous pouvez le voir dans le tout simplement l'valuation pour les données d'entraînement overfitting c'est que vous avez une variance qui est très très très grande et forcément ici donc c'est un modèle
91:09
Speaker A
qui est très bon pour les données d'entraînement mais qui est qui qui est parfois mauvais pour les données de de test mais le meilleur modèle c'est ça best fit best fit ça veut dire quoi on va chercher un modèle qui va qui qui va
91:24
Speaker A
être proche qui va passer à côté de l'ensemble des des points et comme ça si vous le si vous testez par les données d'entraînement il va vous donner quelque chose de 95 ou bien 97 % parce qu'il y a
91:36
Speaker A
quand même des erreurs n'est-ce pas mais si vous vous vous vous le tester pour les données de test supposant que ce pointl il fait partie des données de test et ben tout simplement il va vous donner un résultat qui est proche donc
91:48
Speaker A
ça c'est l'idée l'idée principale donc forcément si vous voulez être sûr que vous avez un modèle qui est performant il faudrait l'évaluer avec les données d'entraînement et les données de de test si vous avez les scores les deux scores pour les données
92:06
Speaker A
d'entraînement vous avez 98 % les données de test vous avez 97 c'est très bon c'est-àdire vous n'avez pas de overfitting vous avez un modèle qui qui est bon mais si vous voyez que pour les données d'entraînement ça vous donne
92:19
Speaker A
quelque chose de 98 % et pour les données de test ça vous donne 60 % B vous allez dire que j'ai un problème de over fitting et je dois revenir vers l'entraînement du modèle je dois jouer sur ce qu'on app les hper paramètres
92:33
Speaker A
parce que ça il y a plein de paramètres dans le le modèle pour trouver un modèle qui qui qui représente mieux la réalité est-ce que c'est clair donc ça en tout cas ce qu'il faudrait retenir donc ça c'est des éléments importants vous
92:47
Speaker A
trouverez les les explications dans le le notebook alors je reviens ici maintenant pour pour pour regarder un peu ça ça serait la partie voilà on a encore un peu de temps donc je vais créer DF2 dataframe 2 é=
93:06
Speaker A
pondas read CSV et cette fois-ci je vais lire le fichier primison 2.csv alors DF2 alors cette fois-ci j'ai un Data pour lequel il y a les les variables indépendantes il y a la surface le nombre de de chambres l'âge
93:28
Speaker A
de de du bien de l'appartement et euh la ville et puis donc vous avez le prix alors par exemple pour ces caractéristiques là par exemple pour cet appartement euh c'est euh un5 millions et cetera et cetera donc vous avez des
93:42
Speaker A
valeurs alors la même chose donc j'ai tapé quelques valeurs comme ça mais ici j'ai exprès j'ai laissé ici vous voyez des valeurs mancantes c'est-à-dire il y a des données que je n'ai pas saisies alors on va essayer de voir
93:55
Speaker A
comment faire avec ça alors d'abord si on reprend la même démarche de tout à l'heure vous allez faire d'abord DF info DF2 alors vous allez remarquer déjà que les variables ici vous avez des variables ça c'est entier c'est float
94:16
Speaker A
int object ça veut dire c'est du string parce que ça c'est le c'est la ville c'est du texte et vous vous voyez ici par exemple pour era il y a combien de valeurs 18 mais ici pour le le pour les les les rooms il y a combien
94:34
Speaker A
il y a 15 15 non nul ça veut dire quoi ça peut déjà me donner une idée il y a des valeurs mon compte parce que il il y a des 18 partout sauf ici alors si je veux encore avoir plus de détail je vais
94:47
Speaker A
faire comme tout à l'heure cdf2 Ina isnal point som alors ça me donne ici donc 00 mais je vois bien rooms il y a TR alors maintenant comment traiter les données mon compte alors il faut soit soit on
95:11
Speaker A
supprime tous les échantillons avec les données mon compte ou tout simplement vous dites je vais remplacer par la médiane ou bien la moyenne donc ça dépend des cas alors ce qu'on va faire ici donc on va par exemple on va
95:25
Speaker A
regarder la médiane la médiane par exemple de DF2 rooms médian c'estàdire dans DF je vais voir je vais voir la la médiane il faut juste au niveau statistique il faut faire vous devrez pour les gens qui qui savent pas faire la différence entre la
95:46
Speaker A
moyenne et la Médi c'est hyper important donc vous regardez donc ici donc je vais utiliser la médiane alors la médiane je vais l'afficher voz donc la médiane ici c'est c'est 4 ça semble parceen fait je vois 3 je vois 5 je vois et ce et je vois en
96:08
Speaker A
tout cas ça me donne 4 alors maintenant moi ce que je vais faire c'est que valeurs manqu je vais les remplacer par par 4 c'est par la médian et pour cela donc je vais utiliser DF2 FF2 de la colonne
96:24
Speaker A
quelle est la colonne qui m'intéresse rooms fil filna donc c'est-à-dire les valeurs mancant je vais les les les remplacer par quoi par la médiane alors maintenant la médiane alors si vous mettez in place ég à true ça veut dire
96:49
Speaker A
il va modifier dans le Data dans le Data frame si vous mettez rien il va vous créer une autre une autre colonne qu'on va appeler par exemple euh pouvez l'appeler par exemple rooms 2 je sais pas quoi quelque chose comme ça
97:10
Speaker A
c'est-à-dire finalement il va vers cette colonne là il va la remplir mais il va pas écraser le le mon mon mon ancien mais il va me donner une nouvelle colonne et dans ce cas-là je vais faire quelque chose comme je vais encore moi
97:25
Speaker A
ce que je vais faire je vais le remplacer donc si vous voulez je peux faire c DF2 de ég à quoi voilà d la colonne é à quoi dans laquelle je vais remplacer les valeurs par quoi par la la médian et
97:51
Speaker A
dans ce cas si vous regardez2 vous allez voir cette fois-ci voyez donc pour le je vois que les valeurs mon compte il sont remplacé par par 4 ça c'est une étape important et puis on va commencer à à regarder par exemple ici je vois c
98:10
Speaker A
c'est une variable catégorique et du CP donc vous aurez besoin de de d'avoir plus de détail par exemple ici je vais utiliser DF C je vais faire appel à value count alors value ça c'est très intéressant parce que vous regarder une colonne il va vous
98:34
Speaker A
dire que dans cette colonne City il y a combien de valeurs possi K a Casablanca Marrakech et tangé il y a combien de lignes pour Casablanca il y en a 6 marakes c'est 6 Tanger c'est c'est 6 donc j'ai une idée bon après par la
98:48
Speaker A
suite quand on va entraîner ce modèle il faudrait qu'on remplace le texte par des nombres n'est-ce pas donc on aura besoin de de coder les les colonnes qui sont catégoriqu et après la même chose ici il y a des techniques
99:02
Speaker A
qu'on va qu'on va utiliser mais avant ça oui on va on va le faire tout de suite donc on va je vais importer from toujours vous avez quelque chose impimport pressing alors dans preprocessing on va créer alors on va utiliser le label
99:38
Speaker A
incoder en fait label encoder donc ça c'est le encoder vous pouvez continuer à faire des choses manuell comme ça je vais remplacer Casablanca par zé euh rab par 1 étangé par 2 vous pouvez commencer à faire mais ça il le fait c'est-à-dire l
100:00
Speaker A
encoder il va chercher les lavel et après il va il va les encoder bah comment on va on va essayer de de le faire et ben on va faire tout simplement incoder alors incoder fit transforme alors fit transform
100:24
Speaker A
donc c'est-à-dire fit voyez fit c'est apprendre parce qu'il va d'abord regarder pour apprendre et puis il va transformer tout simplement toutes les valeurs de City il va il va les transformer avec une variable qu'on va appeler euh attendez je vais
100:49
Speaker A
regarder je pense que c'est le bon alors je je regarde juste si je n'ai pas sorté des choses parce que je suis en train d'aller un peu plus vite donc ça c'est on a fait évaluation du modèle ça on a
101:00
Speaker A
fait bon je vous ai pas montré ça donc me rappelez parce que en fait quand vous avez créé le modèle on veut voir quel est le coefficient du modèle donc ça vous donne le coefficient et l'intercepte du modèle et puis donc si
101:16
Speaker A
vous voulez comparer votre modèle avec avec avec c'està-dire une équ c'està-dire parce que finalement votre modèle qu'on a créé au début c'est quoi c'est le coefficient multiplié par X plus l'intercepte alors si vous prenez le coefficient multiplié par 1000 plus
101:35
Speaker A
l'intercepte ça veut dire ça vous donne un prix 1 et si vous donnez le modèle prédict 1000 ça va vous donner le prix de techniquement parlant vous devrez avoir la même la même valeur c'est juste une façon de dire que finalement que
101:50
Speaker A
votre modèle il il reproduit exactement ce ce ce modèle mais ça c'est bon ça c'est le les données ça on l'a fait value donc là on va analyser donc on va regarder un peu le sur data visualisation et c'est après
102:15
Speaker A
que je fais voilà donc ici donc pour ici oui directement on va on va l'affecter ok alors est-ce que c'est le bon c'est pas le bon donc ici donc je vais ajouter dans DF2 je vais ajouter je vais ajouter une colonne que
102:47
Speaker A
je vais appeler City label n pas besoin d'ajouter ça voilà donc je répète qu'est-ce que je suis en train de faire donc je je suis en train de prendre City euh label encoder et je vais encoder et ça me
103:09
Speaker A
donne ça m'ajoute une autre colonne qui s'appelle City label alors maintenant si je vais voir DF2 qu'est-ce que je vois je vois ici la City c'est Casablanca mais si je vois c regardez par exemple pour Casablanca c'est quel quel la qu'il a donné c'est
103:24
Speaker A
zéro ça c'est un et c'est c'est tout simplement ça c'est une technique mais il y en a d'autres mais euh je vais pas parler de toutes ces techniques aujourd'hui euh mais ça ça peut être ça peut être une solution alors en tout cas
103:38
Speaker A
donc j'ai j'ai maintenant transformé euh c'est-à-dire mes données euh on va commencer à regarder un peu euh faire un peu de Data visualisation alors c'est pour cela vous aurez besoin de d'installer une librairie qui est très utile c'est
103:56
Speaker A
cor installe corn alors corn c'est une librairie qui est très puissante là vous avez beaucoup de de possibilités alors justement qu'est-ce qu'on veut faire on voudrait par exemple faire un histogramme avec je vais importer import corn as SNS SNS
104:26
Speaker A
is plot histogram par exemple vous voulez représenter l'histogramme de F2 je vais prendre la colonne la première colonne etèa donc ça c'est un histogramme donc ça vous donne une idée comment sur la répartition des des données par exemple pour C par exemple
104:54
Speaker A
pour cette marge là j'ai 3 entre entre 100 et 125 j'en ai 6 et cetera donc vous avez une idée sur la la distribution des des données et après si vous voulez faire quelque chose de mieux vous allez
105:07
Speaker A
utiliser donc alors 4D é= TR alors si vous faites 4 é= tr ça vous trace l'allure donc l'allure à dit ça peut être utile ça vous donne une idée sur le l'alure de et puis quoi d'autre alors maintenant si vous voulez faire ça pour
105:24
Speaker A
toutes les colonnes B qu'est-ce que je vais faire je vais d'abord je vais prendre les colonnes que je veux parce que maintenant j'ai quelque chose en plus dans mon mon datafame j'ai la colonne City n'estce pas alors maintenant je
105:41
Speaker A
vais prendre à quoi est ég y pour moi c'est DF2 DF2 de Price n'estce pas y c'est DF2 de Price et le X je vais supprimer quoi je vais supprimer le Price et et City pourquoi parce que regardez City
106:04
Speaker A
c'est du texte moi je l'ai déjà ici City lvel donc je prends mes données ici j'ai fait quelque chose c voilà alors ici donc euh j'ai donc X alors si je fais par exemple ici X de area j'ai ça alors maintenant pour le
106:28
Speaker A
faire pour toutes les colonnes je vais faire une boucle bon je vais faire for pour chaque colonne in DF in x colons alors col ça vous permet toutes les ça ça retourne quoi c'est la liste des des colonnes donc pour chaque
106:53
Speaker A
colonne des colons qu'est-ce que je vais faire ben je vais faire tout simplement ça je vais faire je vais représenter X de quoi de colonnes alors si si vous exécutez ça ça va vous donner mais le problème c'est que il me représente tout
107:08
Speaker A
ça dans le même graphique alors pour cela donc il faudrait faire PLT point figure exactement je supprime tout ça donc je fais la figure une figure par exemple de de 8 5 une fois que je termine je fais
107:44
Speaker A
plt.s voilà non quelque chose qui non c'est bon voilà alors ça vous donne alors je vais un peu zoomer voilà donc ça vous donne une idée une idée sur en fait chaque variable pour chaque variable vous avez la
108:07
Speaker A
distribution par exemple ça c'est pour area ça c'est rooms ça c'est l'â City alors maintenant vous savez que quand vous faites un histogramme vous avez une ce qu'on appelle une caractéristique qu'on appelle beans alors bein ça représente alors si vous regardez la la
108:27
Speaker A
la largeur ici de chaque de chaque rectangle c'est par exemple ici de 225 jusqu'à 260 alors maintenant si vous voulez représenter un histogramme vous pouvez configurer cette cette cette valeurlà alors c'est ce que je vais faire alors bein ici
108:54
Speaker A
alors bien ég à 20 par exemple voilà alors en tout cas ça c'est il y a une une science dans laquelle je vais revenir beaucoup sur cborn il y a plein de de choses que vous pouvez faire par exemple on voudrait
109:16
Speaker A
regarder le ce qu'on appelle la corrélation entre les variables ça c'est hyper important parce que vous avez X pour aussi des variables mais il se peut parfois qu'il il y a des dans les variables que vous que vous jugez
109:28
Speaker A
indépendantes il se peut qu'il y a des dépendances entre les les variables donc vous aurez besoin de de regarder ce qu'on appelle la corrélation et si pour le faire alors je vais commencer à faire copiercoller parce qu'on va aller plus
109:42
Speaker A
vite alors voilà ce qu'on va faire donc on va je représente le donc ça c'est le le y donc je l'ai déjà il y a pas de problème voilà alors je vais tracer une figure et donc si vous
110:18
Speaker A
voulez si vous voulez calculer en fait la matrice de ation entre les variables par exemple X X c'est une matrice ben vous avez une fonction qui s'appelle corrélation donc automatiquement il calcule la corrélation entre les les variables et donc cette corrélation
110:38
Speaker A
là je vais vous montrer ici si vous mettez uniquement corrélation regardez ce que ça vous ça vous donne ben ça vous donne regardez ça vous donne les C variable en fonction de cette variable c'est c'est 1 c'est normal entre cette variable et celle-l
110:58
Speaker A
donc vous avez une valeur et cetera alors maintenant ça c'est la table de c'est-à-dire c'est les la la corrélation entre les variables mais ça je vais pas le représenter comme ça je vais le représenter avec SNS hitmap hitmap c'est
111:12
Speaker A
une ça vous ça vous dessine une matrice en fait un graphique qui représente cette matrice là et pour cela donc je j'utilise tout simplement je vais annoter c'est-à-dire je mets les valeurs dans dans chaque case ici le format je
111:27
Speaker A
vais utiliser de de chiffres après la virgule et là donc je vais utiliser le format j'ai pas défini ici alors si vous exécutez ça ça va vous donner ça donc c'est-à-dire que ça vous ça vous donne une idée sur est-ce qu'il
111:42
Speaker A
y a une forte corrélation entre les variables par exemple entre area a c'est 1 c'est normal vous avez ici des1 n'est-ce pas mais est-ce que est-ce qu'il y a par exemple par exemple regardez ici vous avez 0 80
111:57
Speaker A
entre quoi et quoi entre entre rooms et AA donc vous vous constatez que rooms et AA il y a une forteation corrélation c'est assez logique parce que plus la surface est grande plus il y a le nombre de pièces mais c'est pas c'est pas une
112:13
Speaker A
règle générale n'est-ce pas donc ici c'est très intéressant parce que avec ça avec cette matrice de corrélation vous pouvez identifier peut-être surtout quand vous avez une colonne là vous avez 0,97 ou bien ver 95 et plus il faut se
112:31
Speaker A
poser la question il faut supprimer l'une ou l'autre dans votre data c'est très important parce que si vous gardez vous avez vous gardez deux variables qui sont fortement corrélées c'est que vous avez une variable en plus dans votre modèle vous
112:46
Speaker A
êtes en train de compliquer le le modèle donc qu'est-ce qui va vous vous dire qu'est-ce qui va vous vous vous donner une indication est-ce qu'il y a une forte corrélation ou pas bah c'est très simple vous avez ici la la la matrice de
113:00
Speaker A
corrélation alors on n pas encore créé le modèle mais tout ça c'est des des prétraitements c'est-à-dire c'est c'est data analysis c'est l'analyse des données euh alors aujourd'hui donc je me suis permis de de vous lancer quelques flash comme ça ça va vous vous réveiller
113:16
Speaker A
mais tous les les toutes les activités pratiques que vous allez faire après par la suite vous c'est toujours la même danse parce que c'est tellement une même danse qui va se répéter que un moment donné ça devient des des des des habitudes mais
113:29
Speaker A
bien sûr pour le moment donc on va essayer de d'apprécier un peu le ce ce démarrage comme ça alors donc j'ai le j'ai j'ai j'ai fait ça alors maintenant qu'est-ce que je vais faire je vais créer le modèle
113:41
Speaker A
donc je vais supposer que maintenant même s'il y a 0,80 ici donc je suppose que c'est c'est pas c'est pas une forte corrélation mais ça me donne déjà une idée sur sur le cette corrélation bon bien sûr si vous voulez changer les
113:55
Speaker A
couleurs et tout vous pouvez faire quelque chose vous pouvez toujours changer ici à ce niveau-là est-ce que c'est clair jusqu'à présent ça va ça va oui ça va oui j'ai une question euh juste est-ce que vous pouvez montrer comment supprimer par
114:17
Speaker A
exemple euh soit la colonne soit exactement soit une colonne bien bien une déjà bon pour dans notre cas ici c'est les colonnes voyez drop regarde c'est exactement ce qu'on a fait ici DF drop colonne il vous spécifiez la liste
114:35
Speaker A
des colonnes que vous voulez supprimer carrément donc ça c'est alors pour les liges je vais revenir sur dans un exemple ok drop c'est juste pour les alors euh non drop on peut l'utiliser pour les lignes pour les colonnes par plein de choses ici pour je
114:55
Speaker A
supprime les colonnes mais après si vous voulez supprimer les lignes je vais vous montrer la syntaxe mais ici c'est pas un bon exemple alors on va créer le modèle alors pour créer le modèle on refait le même travail de tout à l'heure je vais
115:08
Speaker A
voir si vous vous rappelez un petit peu alors on crée le modèle qu'est-ce qu'on va faire alors notre modèle modèle 2 égal à quoi égal linéaire linéire Moder linéire regression donc ça c'est le le notre modèle de régression linéaire et
115:26
Speaker A
puis je vais entraîner le modèle c'est modèle fit on a déjà x notre X et Y regardez on a déjà le X le y est-ceon div euh diviser c'est déjà ah oui oui vous avez raison alors ici donc j'ai saorté une
115:46
Speaker A
étape c'est justement cette fois-ci avant d'entraîner je dois je dois diviser les données d'entraînement et les données de test n'est-ce pas voyez ça c'est c'est important parce que sinon on va refaire le même alors ici donc avant même de créer
116:00
Speaker A
le modèle je vais d'abord importer alors from alors fromler voyez donc vous avez ici euh je vais importer model selection alors model selection from le et maintenant je vais CR je vais créer des variables X X X test
116:40
Speaker A
test virgule ygule y test égal à quoi ég mod selection et je fais appel à une fonction qui s'appelle TR test split je vais faire un split je vais découper mon dataset en en quoi alors c'est quoi d'abord le notre
117:07
Speaker A
le X c'est x le y c'est y test size c'est le pourcentage des données de test si vous mettez 02 ça veut dire que je vais garder dans X je vais garder combien 80% x test je vais avoir 20
117:25
Speaker A
% alors vous pouvez mettre 03 ou 02 et ici random state là c'est quelque chose que vous allez trouver dans toutes les fonctions alors vous savez que les algorithmes ils utilisent des nombres aléatoires parfois et du coup donc si
117:40
Speaker A
vous voulez garantir que à chaque fois vous réexécutez votre code ça va vous donner les mêmes résultats ben il vous faut spécifier random state vous lui donnez une valeur quelconque vous vous donnez par exemple 1 2 3 4 alors si vous donnez random state 1 2
117:58
Speaker A
3 4 et quand il va générer de nombre aléatoire il se base sur ce site pour générer les valeurs aléatoires et comme ça si vous réexécutez votre notebook plusieurs fois vous allez avoir le même résultat parce que si vous fixez pas le
118:10
Speaker A
random state il se peut parfois chaque exécution ça va donne des résultats qui sont différents donc ça c'est juste un petit détail alors regardez donc j'ai exécuté mes données alors maintenant si vous voulez voir par exemple xtrain ça je l'ai pas montré tout à
118:27
Speaker A
l'heure si vous mettez tapape chap ça vous donne les dimensions alors par exemple xtrain il y a combien de de de lignes 14 il y a combien de colonnes 4 et si vous regardez par exemple X X test vous avez 4 4 parce que 20 % donc
118:51
Speaker A
il on a pas beaucoup de données mais c'est juste mais l'essentiel c'est 20 %.
118:55
Speaker A
n'est-ce pas alors maintenant quand je vais entraîner le modèle je vais l'entraîner avec les données de d'entraînement donc c'est-à-dire je vais créer le modèle alors modèle 2 égal linéal Léal ligration et puis je vais utiliser modèle 2.
119:16
Speaker A
fit alors cette fois-ci c'est quoi je vais utiliser x train y train c'est-à-dire je vais lui donner le input c'est ça et le le output c'est c'est ça donc je l'ai maintenant j'ai entraîné le modèle avec les données d'entraînement
119:31
Speaker A
mais j'ai gardé j'ai gardé quelques données de test que je n'ai pas montré au au modèle et je vais voir est-ce qu'il est bon alors j'entraî fit c'est bon et maintenant je vais directement passer à l'évaluation pour cela je vais faire
119:51
Speaker A
predict prct ég modèle 2 predict x encore je lui donne x je vais lui dire fais-moi la prédiction de ces données et je vais lui demander cette fois-ci aussi predicted test j'ai c'estàdire test je vais lui donner quoi comme donnée de
120:16
Speaker A
input x test donc je lui a donné les données d'entraînement je fais la prédiction je lui donne les données de test et je vais faire la la prédiction alors maintenant je vais évaluer les les données d'entraînement plutôt je vais faire
120:32
Speaker A
l'évaluation donc pour cela donc je vais utiliser toujours matrix alors matrix r square score alors qu'est-ce que je vais lui donner le y y TR et qui'est plutôt le les les l'entraînement c'est predcted fr alors ça me donne un
120:56
Speaker A
taux voyez donc un taux de 97 % ça c'est pour les données d'entraînement alors maintenant je fais la même chose pour les données de test alors j'ai raté quelque chose y test il n'est pas défini donc je l'ai
121:22
Speaker A
mal je pe peut-être exécuter alors ça c'est fait voilà donc pour les les données de test vous avez 92 % c'est acceptable c'est-à-dire les données d'entraînement vous êtes à 97 les données de test 82 c'est c'est bon tant que vous êtes déjà les 90 là le
121:43
Speaker A
modèle il est il est très bon mais est-ce que est-ce qu'on peut pas l'améliorer oui quand on va revenir sur le sur plein d'investigations sur de de paramètres et ça c'est que la régression linéaire on va tester encore d'autres
121:57
Speaker A
modèles et peut-être on peut faire encore mieux mais euh ici donc ça vous donne une idée comment euh comment on peut faire la régression linéaire c'est clair alors donc je vais donc je vais regarder juste si je n'ai pas oublié des
122:18
Speaker A
choses donc je pense que ça on a on a vu bon vous avez le notebook il contient toutes C ces ces étapes oui effectivement l'exemple que dont j'ai parlé tout à l'heure c'est c'est exactement alors quand j'ai créé le le
122:35
Speaker A
modèle le premier euh le le premier modèle celui-là non mais c'est pas celui là je suant ici voilà alors ça c'est le premier modèle donc j'ai fait la prédiction [Musique] ok alors si vous faites modèle point coefficient donc ça vous don le
123:20
Speaker A
coefficient alorsf égalf et l'interceptte ég modèle intercepte donc ça c'est donc si vous voulez les afficher fait print al intercepte voilà donc ça c'est le coefficient euh et ça c'est interceptte alors maintenant euh réellement si vous voulez voir ce
124:07
Speaker A
que représente votre modèle euh comme j'ai fait tout à l'heure j'ai fait par exemple j'ai price 1 alors price price 1 égal modèle predict par exemple pour 100 c'estàdire 100 pour une superficie de 100 il va me prdire le
124:28
Speaker A
prix 1 et je veux je voudrais le faire autrement c'est pr 2 ég ça va être quoi c'est le coefficient multipli par combien 100 plus l'intercepte le modèle que vous avez entraîné cette boîte noire la boîte noire qu'on a
124:55
Speaker A
entraîné voilà il il me donne ça d'accord mais en réalité la boîte noire que j'ai créé il n'est pas aussi noir que ça c'est ça c'estàd en réalité ça c'est c'est que le modèle réel c'est quoi c'est le coefficient FO FO x plus
125:11
Speaker A
l'intercepte et je vais le vérifier bah j'exécute et j'affiche prix 1 et prix 2 alors prix price 1 price 2 alors voyez donc ce qu'on a prédit ici par le modèle et ce qu'on a produit par cette équation c'est la
125:36
Speaker A
même c'est la même chose donc c'est juste une façon de dire au finalement c'est ce que j'ai dit tout à l'heure pour quand le dans le cas où vous avez une seule variable vous avez la la régression linéaire ça revient à faire ça en
125:50
Speaker A
réalité quand vous avez une seule variable est-ce que vous avez besoin de l'intelligence artificielle pour ça le collège vous savez les étudiants au collège va leur donner ça ils vont tracer des points ils vont chercher la droite ils peuvent déterminer l'équation
126:05
Speaker A
de la droite il pas de problème mais pour nous on a commencer comme ça pour comprendre un peu le les choses est-ce que c'est clair alors mais si vous êtes par exemple dans un modèle de tout à l'heure si vous regardez les
126:19
Speaker A
coefficients euh le modèle ici modèle 2 alors modèle 2 point coefficient voyezci donc il a combien de coefficients 1 2 3 4 c'est normal parce qu'il y a combien de variables 4 variables c'estàdire c'est comme si vous avez une équation dans laquelle c'est
126:43
Speaker A
cette valeur là fois la superficie plus cette valeur FO t plus la valeur moins ça donc ça c'est à peu près après si vous voulez voir l'intercepte la même chose voilà la valeur donc ça vous donne une idée sur votre modèle linéaire
127:05
Speaker A
comment et mathématiquement votre modèle linéire il est comme ça mais comme nous il nous donne un une performance de 97 % bah ça veut dire que il est bon ça veut dire que les données les données qu'on a qu'on a construit à
127:20
Speaker A
la main ils sont assé assez logique c'est vrai ils sont assez logiques parce que c'est c'est moi qui a tapé ça mais quand vous prenez des données je sais pas KAG je sais pas quoi parfois vous tombez sur des données qui sont
127:32
Speaker A
bien faites et parfois faites attention parce que euh quand vous quand on voit on aura l'occasion de de discuter de ça mais souvent euh parfois les la qualité la quantité des données et la manière de de retoucher les données et la manière
127:49
Speaker A
d'évaluer les modèles alors si bien sûr c'est le le travail d'un d'un Data scientiste bah aujourd'hui donc je vous ai montré à peu près une première je vous ai fait rentrer dans un dans le vain donc il nous reste
128:04
Speaker A
encore d'autres séances maintenant si vous voulez vraiment ne pas être largué donc comme je disais donc regardez classroom euh donc vous allez trouver sur classroom alors vous allez trouver donc le support ça c'est les dataset et après je vous ai
128:29
Speaker A
donné un un notebook encore plus détaillé euh c'est le donc avec lequel il y a un dataset avec beaucoup de données beaucoup de caractéristiques et vous trouverez l'analyse complète c'est-à-dire ce que je viens de vous faire à peu près sur un problème réel
128:45
Speaker A
vous P donc je vous je vous invite parce que c'est vrai si j'ai beaucoup de temps on va à chaque séance travailler sur un un use case mais là on n'a pas le temps il a il y a beaucoup de choses qu'on va
128:54
Speaker A
faire donc moi je je je vous demande de de de travailler ça c'est-à-dire vous vous regardez les l'exemple qu'on a fait vous essayez de comprendre et euh en même temps euh vous essayez donc de de prendre ce ce ce notebook c'est
129:17
Speaker A
celui-là donc vous avez les les explications du du dataset c'est toujours la prédiction du prix de je pense des maisons comme ça mais vous allez trouver quelques les passages avec des modèles relativement différents moi je pense que quelqu'un qui fait ça c'est
129:36
Speaker A
que il sait ce que c'est la régression ça c'est ce qui est intéressant c'estàdire vous faites ça vous le comprenez bien je sais ce que c'est la régression et comme ça la prochaine fois on va passer à la
129:48
Speaker A
classification c'est clair alors je je pense que je vais rien ajouter sinon je vais on va on risque de faire tomber tout ce qu'on a fait alors s'il y a des question juste 5 minutes et après on va
130:02
Speaker A
on va s'arrêter mais avant de euh je vous demande d'abord de marquer votre présence dans la la zone dans la si vous vous met vous écrivez juste dans la zone chat présent comme ça j'ai rapidement une une liste ceux qui sont à
130:19
Speaker A
distance voilà comme ça ça voilà voilà on attendant que vous marquez votre présence dans la zone chat donc s'il y a une question il y a Hajar Hajar tu veux poser une question non est-ce qu'il y a quelqu'un qui veut
130:58
Speaker A
poser une question non non voilà donc bonne journée ou vous pouvez partir donc à la semaine prochaine monsieur juste une question s'il vous plaît pour l'enregistr ser disponible car il y a des points que j'aimerais ou euh revenir à des oui alors vous allez
131:29
Speaker A
trouver donc class l'enregistrement euh probablement soit ce soir soit demain d'accci ok euh oui monsieur pour la la la prochaine séance ça va être le même jour le le même jour pour le moment à moins s'il y a quelque chose qui change mais c'est le
131:49
Speaker A
même emploi qu'on va va respecter pour les semaines prochaines journ mer bonne journée bon weekend à tous
Topics:intelligence artificielleIA générativeapprentissage supervisérégressionclassification binairemodèles prédictifsdonnées d'entraînementnotebooksprojet pratiquecours débutant

Frequently Asked Questions

À qui s'adresse ce cours d'intelligence artificielle ?

Ce cours est destiné principalement aux débutants en intelligence artificielle, incluant des personnes de diverses disciplines, qu'elles soient familières ou non avec l'informatique.

Quels sont les supports mis à disposition pour ce cours ?

Les supports comprennent des fichiers PDF des slides, des notebooks, des fichiers de données pour les activités pratiques, ainsi que des enregistrements vidéo des séances disponibles sur la plateforme Classroom.

Quelle est la différence entre intelligence artificielle individuelle et distribuée ?

L'intelligence artificielle individuelle concerne un agent isolé doté de capacités intellectuelles, tandis que l'intelligence artificielle distribuée modélise les interactions entre plusieurs agents pour résoudre des problèmes complexes.

Get More with the Söz AI App

Transcribe recordings, audio files, and YouTube videos — with AI summaries, speaker detection, and unlimited transcriptions.

Or transcribe another YouTube video here →