Dernière revue :
Qu'est-ce qu'un SLM (small language model) ? Définition, exemples et différence avec un LLM
Un SLM (small language model, petit modèle de langage) est un modèle de langage assez compact pour tourner sur un ordinateur, un téléphone ou un serveur modeste, en général sous 10 milliards de paramètres. Moins polyvalent qu'un grand LLM, il suffit pour beaucoup de tâches répétitives et cadrées, pour un coût et une latence bien plus faibles.
Il n'existe pas de seuil officiel. Des chercheurs de NVIDIA proposent en juin 2025, dans l'article « Small Language Models are the Future of Agentic AI », une définition pratique : un SLM tient sur un appareil grand public courant et répond assez vite pour servir les demandes d'un utilisateur. Ils ajoutent qu'en 2025, la plupart des modèles de moins de 10 milliards de paramètres entrent dans cette catégorie. Exemples : Ministral 3B et 8B de Mistral AI (octobre 2024), conçus pour l'inférence locale et respectueuse de la confidentialité, la famille Phi de Microsoft, SmolLM2 de Hugging Face ou les modèles Nemotron-H de NVIDIA. Beaucoup sont obtenus par distillation d'un grand modèle et publiés en poids ouverts. L'article de NVIDIA défend une thèse précise. Dans un agent, la plupart des appels au modèle sont des sous-tâches répétitives et étroites : extraire un champ, appeler un outil, formater une sortie. Un SLM spécialisé les traite aussi bien, et servir un SLM de 7 milliards de paramètres coûte selon les auteurs 10 à 30 fois moins (latence, énergie, calcul) qu'un LLM de 70 à 175 milliards. Sur trois agents open source étudiés, ils estiment qu'environ 40 % à 70 % des appels pourraient passer d'un LLM à un SLM. L'architecture qu'ils recommandent est hétérogène : des SLM pour le volume, un grand modèle appelé seulement quand la tâche l'exige. Il s'agit d'une prise de position argumentée, pas d'un consensus établi.
Exemple concret
Cas illustratif : un cabinet d'expertise comptable de 40 personnes veut extraire automatiquement les champs des factures fournisseurs de ses clients (SIRET, montants HT et TVA, échéance). Les documents sont confidentiels et le volume atteint 20 000 factures par mois. Plutôt qu'un grand modèle via API, le cabinet teste un SLM de 8 milliards de paramètres en poids ouverts, hébergé sur un serveur interne équipé d'un seul GPU. Sur 300 factures annotées, le SLM extrait les champs standards aussi bien que le grand modèle. Les factures atypiques (formats étrangers, scans dégradés) sont renvoyées vers un grand modèle, soit une petite fraction du volume. Les données courantes ne quittent plus le cabinet, et la facture d'API disparaît pour l'essentiel des documents.
Comparaison
| SLM (petit modèle) | LLM de pointe | |
|---|---|---|
| Taille indicative | Moins de 10 milliards de paramètres | Dizaines à centaines de milliards de paramètres |
| Où il tourne | Ordinateur, téléphone, serveur interne à un GPU | Centres de données du fournisseur (API) |
| Coût d'usage | Faible, surtout à fort volume | Plus élevé, facturé au token |
| Latence | Faible | Plus élevée, variable selon la charge |
| Polyvalence | Bonne sur une tâche étroite | Élevée, y compris sur les questions ouvertes |
| Personnalisation | Fine-tuning plus simple et moins coûteux | Plus lourde, souvent limitée au prompt |
| Confidentialité | Données gardées en interne si auto-hébergé | Données envoyées au fournisseur, selon contrat |
Questions fréquentes
C'est quoi un SLM (small language model) ?
Un petit modèle de langage, assez compact pour tourner sur un ordinateur, un téléphone ou un serveur modeste. Il n'y a pas de seuil officiel, mais la plupart des modèles de moins de 10 milliards de paramètres sont considérés comme des SLM en 2025 (définition de NVIDIA Research).
Quelle est la différence entre un SLM et un LLM ?
La taille, et ce qui en découle. Un LLM de pointe est plus polyvalent et meilleur sur les questions ouvertes, mais coûteux et hébergé chez un fournisseur. Un SLM est moins polyvalent, mais rapide, peu coûteux, et peut tourner dans vos murs. Pour une tâche étroite et répétitive, il fait souvent jeu égal.
Quels sont des exemples de small language models ?
Ministral 3B et 8B de Mistral AI (entreprise française, octobre 2024), la famille Phi de Microsoft, SmolLM2 de Hugging Face, les modèles Nemotron-H de NVIDIA, ou les versions distillées de DeepSeek-R1. Beaucoup sont disponibles en poids ouverts.
Pourquoi dit-on que les SLM sont l'avenir de l'IA agentique ?
C'est la thèse d'un article de NVIDIA Research (juin 2025). Un agent enchaîne surtout des sous-tâches étroites et répétitives, qu'un SLM spécialisé traite aussi bien, pour un coût de service 10 à 30 fois plus bas selon les auteurs. Ils recommandent des systèmes mixtes : SLM pour le volume, grand modèle en renfort.
Un SLM peut-il fonctionner sans connexion internet ?
Oui, s'il est installé sur un poste ou un serveur de l'entreprise. Mistral AI présentait ainsi ses Ministral pour des assistants sans connexion, de la traduction sur l'appareil ou de l'analyse locale. C'est un atout pour les sites isolés et les données sensibles.
Un SLM est-il plus sûr pour les données de l'entreprise ?
Il peut l'être, car hébergé en interne, il évite d'envoyer les données à un fournisseur externe. La sécurité dépend alors de votre propre infrastructure : contrôle des accès, mises à jour, journalisation. Un SLM mal exploité n'est pas plus sûr qu'une API bien encadrée.
À voir aussi
Pour aller plus loin
Small Language Models are the Future of Agentic AI, Belcak et al., NVIDIA Research, 2025
Sources
- Small Language Models are the Future of Agentic AI, Belcak, Heinrich et al., NVIDIA Research, arXiv, 2 juin 2025. https://arxiv.org/abs/2506.02153
- Small Language Models are the Future of Agentic AI, version HTML (définition WD1, coûts, études de cas MetaGPT, Open Operator, Cradle). https://arxiv.org/html/2506.02153v1
- Un Ministral, des Ministraux (Ministral 3B et 8B), Mistral AI, 16 octobre 2024. https://mistral.ai/news/ministraux