Nouveau · Présidentielle 2027 : ce que les candidats proposent sur l'IA, citations sourcées. Explorer l'observatoire →

Dernière revue :

Qu'est-ce qu'un SLM (small language model) ? Définition, exemples et différence avec un LLM

Un SLM (small language model, petit modèle de langage) est un modèle de langage assez compact pour tourner sur un ordinateur, un téléphone ou un serveur modeste, en général sous 10 milliards de paramètres. Moins polyvalent qu'un grand LLM, il suffit pour beaucoup de tâches répétitives et cadrées, pour un coût et une latence bien plus faibles.

Il n'existe pas de seuil officiel. Des chercheurs de NVIDIA proposent en juin 2025, dans l'article « Small Language Models are the Future of Agentic AI », une définition pratique : un SLM tient sur un appareil grand public courant et répond assez vite pour servir les demandes d'un utilisateur. Ils ajoutent qu'en 2025, la plupart des modèles de moins de 10 milliards de paramètres entrent dans cette catégorie. Exemples : Ministral 3B et 8B de Mistral AI (octobre 2024), conçus pour l'inférence locale et respectueuse de la confidentialité, la famille Phi de Microsoft, SmolLM2 de Hugging Face ou les modèles Nemotron-H de NVIDIA. Beaucoup sont obtenus par distillation d'un grand modèle et publiés en poids ouverts. L'article de NVIDIA défend une thèse précise. Dans un agent, la plupart des appels au modèle sont des sous-tâches répétitives et étroites : extraire un champ, appeler un outil, formater une sortie. Un SLM spécialisé les traite aussi bien, et servir un SLM de 7 milliards de paramètres coûte selon les auteurs 10 à 30 fois moins (latence, énergie, calcul) qu'un LLM de 70 à 175 milliards. Sur trois agents open source étudiés, ils estiment qu'environ 40 % à 70 % des appels pourraient passer d'un LLM à un SLM. L'architecture qu'ils recommandent est hétérogène : des SLM pour le volume, un grand modèle appelé seulement quand la tâche l'exige. Il s'agit d'une prise de position argumentée, pas d'un consensus établi.

Exemple concret

Cas illustratif : un cabinet d'expertise comptable de 40 personnes veut extraire automatiquement les champs des factures fournisseurs de ses clients (SIRET, montants HT et TVA, échéance). Les documents sont confidentiels et le volume atteint 20 000 factures par mois. Plutôt qu'un grand modèle via API, le cabinet teste un SLM de 8 milliards de paramètres en poids ouverts, hébergé sur un serveur interne équipé d'un seul GPU. Sur 300 factures annotées, le SLM extrait les champs standards aussi bien que le grand modèle. Les factures atypiques (formats étrangers, scans dégradés) sont renvoyées vers un grand modèle, soit une petite fraction du volume. Les données courantes ne quittent plus le cabinet, et la facture d'API disparaît pour l'essentiel des documents.

Comparaison

SLM et LLM : les différences qui comptent pour l'entreprise
SLM (petit modèle)LLM de pointe
Taille indicativeMoins de 10 milliards de paramètresDizaines à centaines de milliards de paramètres
Où il tourneOrdinateur, téléphone, serveur interne à un GPUCentres de données du fournisseur (API)
Coût d'usageFaible, surtout à fort volumePlus élevé, facturé au token
LatenceFaiblePlus élevée, variable selon la charge
PolyvalenceBonne sur une tâche étroiteÉlevée, y compris sur les questions ouvertes
PersonnalisationFine-tuning plus simple et moins coûteuxPlus lourde, souvent limitée au prompt
ConfidentialitéDonnées gardées en interne si auto-hébergéDonnées envoyées au fournisseur, selon contrat

Questions fréquentes

C'est quoi un SLM (small language model) ?

Un petit modèle de langage, assez compact pour tourner sur un ordinateur, un téléphone ou un serveur modeste. Il n'y a pas de seuil officiel, mais la plupart des modèles de moins de 10 milliards de paramètres sont considérés comme des SLM en 2025 (définition de NVIDIA Research).

Quelle est la différence entre un SLM et un LLM ?

La taille, et ce qui en découle. Un LLM de pointe est plus polyvalent et meilleur sur les questions ouvertes, mais coûteux et hébergé chez un fournisseur. Un SLM est moins polyvalent, mais rapide, peu coûteux, et peut tourner dans vos murs. Pour une tâche étroite et répétitive, il fait souvent jeu égal.

Quels sont des exemples de small language models ?

Ministral 3B et 8B de Mistral AI (entreprise française, octobre 2024), la famille Phi de Microsoft, SmolLM2 de Hugging Face, les modèles Nemotron-H de NVIDIA, ou les versions distillées de DeepSeek-R1. Beaucoup sont disponibles en poids ouverts.

Pourquoi dit-on que les SLM sont l'avenir de l'IA agentique ?

C'est la thèse d'un article de NVIDIA Research (juin 2025). Un agent enchaîne surtout des sous-tâches étroites et répétitives, qu'un SLM spécialisé traite aussi bien, pour un coût de service 10 à 30 fois plus bas selon les auteurs. Ils recommandent des systèmes mixtes : SLM pour le volume, grand modèle en renfort.

Un SLM peut-il fonctionner sans connexion internet ?

Oui, s'il est installé sur un poste ou un serveur de l'entreprise. Mistral AI présentait ainsi ses Ministral pour des assistants sans connexion, de la traduction sur l'appareil ou de l'analyse locale. C'est un atout pour les sites isolés et les données sensibles.

Un SLM est-il plus sûr pour les données de l'entreprise ?

Il peut l'être, car hébergé en interne, il évite d'envoyer les données à un fournisseur externe. La sécurité dépend alors de votre propre infrastructure : contrôle des accès, mises à jour, journalisation. Un SLM mal exploité n'est pas plus sûr qu'une API bien encadrée.

À voir aussi

Pour aller plus loin

Small Language Models are the Future of Agentic AI, Belcak et al., NVIDIA Research, 2025 (ressource externe)

Sources

  1. Small Language Models are the Future of Agentic AI, Belcak, Heinrich et al., NVIDIA Research, arXiv, 2 juin 2025. https://arxiv.org/abs/2506.02153 (consulté le 2026-09-30)
  2. Small Language Models are the Future of Agentic AI, version HTML (définition WD1, coûts, études de cas MetaGPT, Open Operator, Cradle). https://arxiv.org/html/2506.02153v1 (consulté le 2026-09-30)
  3. Un Ministral, des Ministraux (Ministral 3B et 8B), Mistral AI, 16 octobre 2024. https://mistral.ai/news/ministraux (consulté le 2026-09-30)

← Retour au glossaire

Adresse copiée