Introduction à l’intelligence artificielle

Une brève excursion dans le monde du machine learning

Kévin Polisano

CNRS, Laboratoire Jean Kuntzmann

December 1, 2024

Introduction

Définitions

Intelligence artificielle et apprentissage statistique

  • Intelligence artificielle (IA) : ensemble de théories et de techniques visant à réaliser des machines capables de simuler l’intelligence humaine.

  • Apprentissage statistique ou Machine Learning (ML) : champ d’étude de l’intelligence artificielle qui se fonde sur des approches mathématiques et statistiques pour donner aux ordinateurs la capacité d’« apprendre » à partir de données, c’est-à-dire d’améliorer leurs performances à résoudre des tâches sans être explicitement programmés pour chacune.

Panorama de l’intelligence artificielle

Le machine learning est une branche de l’IA

La carte du Machine Learning

Les modèles linéaires

La régression linéaire

Prédiction du prix d’une maison en fonction de sa superficie

Des données d’entrainement \(\color{red} (x_1,y_1),\dotsc,(x_n,y_n)\)

  • \(x_i\) : superficie de la maison
  • \(y_i\) : prix de la maison
  • \(n\) : nombre de données

La régression linéaire

  • Un modèle de prédiction linéaire \(\color{blue} f_{w,b}\)
  • Une fonction de coût mesurant l’erreur (quadratique moyenne) : \[ {\color{red}J({\color{blue}w},{\color{blue}b})} = \frac{1}{n} \sum_{i=1}^n {\color{red}\ell({\color{orange}y_i}, {\color{blue}f_{w,b} ({\color{orange}x_i})})}, \quad {\color{red}\ell(y,\hat y)=(y-\hat y)^2} \]

La régression linéaire

  • Minimisation du coût : \(\displaystyle \color{red} (w^{\star},b^{\star})=\underset{w,b}{\mathrm{argmin}}\; J(w,b)\)

Visualisation de la descente de gradient

La régression linéaire

Une simple couche de neurone

Les 4 principaux ingrédients du ML

  1. Des données
  2. Un modèle
  3. Une fonction de coût
  4. Un algorithme d’optimisation

La régression polynomiale

Un autre modèle linéaire plus complexe

  • Fitting des données bruitées \({\color{blue}y_i}={\color{green}\sin(2\pi x_i)}+\epsilon_i\) avec un polynôme de degré \(M\) : \[ \color{red} f_{\boldsymbol{w}}(x) = w_0 + w_1 x + w_2 x^2 + \dotsc + w_M x^M = \boldsymbol{\psi}(x)^{\intercal} \boldsymbol{w}\]

  • \(\boldsymbol{\psi}(x)=[1,x,x^2,\dotsc,x^M]^{\intercal}\) est un feature mapping. On peut utiliser les moindres carrés puisque \(f_{\boldsymbol{w}}(x)=\boldsymbol{\psi}(x)^{\intercal} \boldsymbol{w}\) est linéaire en \(\boldsymbol{w}\).

La régression polynomiale

Underfitting (M=0,1) vs. bon modèle (M=3) vs. overfitting (M=9)

La régression polynomiale

  • Plus \(M\) augmente, plus les coefficients \(w_i^{\star}\) explosent.
  • Le polynôme \(\color{red} f_{\boldsymbol{w}}(x)\) finit par interpoler les données \(\color{blue} (x_i,y_i)\) (erreur de training nulle pour \(M=9\)), avec de fortes oscillations entre ces points.
  • Le modèle peine alors à généraliser sur les données de test (l’erreur grimpe pour \(M=9\)). Il faut ajuster l’hyperparamètre \(M\) sur données de validation (étape de sélection de modèle).

Partitionnement du dataset

Training vs. validation vs. testing

Types d’apprentissages

Supervisés, non-supervisés et par ré-enforcement

Généalogie des réseaux de neurones artificiels

L’invention des neurones artificiels

(McCulloch and Pitts 1943)

L’invention du Perceptron

(Rosenblatt 1958)

Classification à l’aide d’un Perceptron

La classification binaire

Classification à l’aide d’un Perceptron

La fonction d’activation (sigmoïde) et la fonction de coût (vraisemblance)

Le Perceptron Multicouche

… et la rétropropagation du gradient (Rumelhart, Hinton, and Williams 1986)

L’efficacité du Perceptron Multicouche

3 perceptrons pour créer une forme triangulaire

L’efficacité du Perceptron Multicouche

Linéariser les frontières de décision complexes

Représentation d’un Perceptron Multicouche

Un simple réseau de neurones à 3 couches

Formalisation d’un Perceptron Multicouche

Cascades de multiplication matricielles et d’activation

Formalisation d’un Perceptron Multicouche

Cascades de multiplication matricielles et d’activation

Que se passe-t-il dans un réseau de neurones ?

Visualisation de la linéarisation de la frontière de décision

L’efficacité du Perceptron Multicouche

Apprendre des frontières de décision complexes