Última revisión:
¿Qué es un SLM (small language model)? Definición, ejemplos y diferencia con un LLM
Un SLM (small language model, modelo de lenguaje pequeño) es un modelo de lenguaje lo bastante compacto para funcionar en un ordenador, un teléfono o un servidor modesto, en general con menos de 10 000 millones de parámetros. Menos versátil que un gran LLM, basta para muchas tareas repetitivas y acotadas, con un coste y una latencia mucho menores.
No existe un umbral oficial. En junio de 2025, investigadores de NVIDIA propusieron una definición práctica en el artículo «Small Language Models are the Future of Agentic AI»: un SLM cabe en un dispositivo de consumo habitual y responde lo bastante rápido para atender las solicitudes de un usuario. Añaden que en 2025 la mayoría de los modelos de menos de 10 000 millones de parámetros entran en esta categoría. Ejemplos: Ministral 3B y 8B de Mistral AI (octubre de 2024), diseñados para la inferencia local y respetuosa con la privacidad, la familia Phi de Microsoft, SmolLM2 de Hugging Face o los modelos Nemotron-H de NVIDIA. Muchos se obtienen por destilación de un gran modelo y se publican con pesos abiertos. El artículo de NVIDIA defiende una tesis concreta. En un agente, la mayoría de las llamadas al modelo son subtareas repetitivas y estrechas: extraer un campo, llamar a una herramienta, dar formato a una salida. Un SLM especializado las resuelve igual de bien y, según los autores, servir un SLM de 7 000 millones de parámetros cuesta entre 10 y 30 veces menos (latencia, energía, cálculo) que un LLM de 70 000 a 175 000 millones. En tres agentes de código abierto estudiados, estiman que entre un 40 % y un 70 % de las llamadas podrían pasar de un LLM a un SLM. La arquitectura que recomiendan es heterogénea: SLM para el volumen, un gran modelo llamado solo cuando la tarea lo exige. Se trata de una postura argumentada, no de un consenso establecido.
Ejemplo concreto
Caso ilustrativo: un despacho francés de contabilidad de 40 personas quiere extraer automáticamente los campos de las facturas de proveedores de sus clientes (identificador fiscal, importes sin IVA e IVA, vencimiento). Los documentos son confidenciales y el volumen alcanza 20 000 facturas al mes. En lugar de un gran modelo vía API, el despacho prueba un SLM de 8 000 millones de parámetros con pesos abiertos, alojado en un servidor interno con una sola GPU. En 300 facturas anotadas, el SLM extrae los campos estándar tan bien como el gran modelo. Las facturas atípicas (formatos extranjeros, escaneos deficientes) se envían a un gran modelo, una pequeña fracción del volumen. Los datos habituales ya no salen del despacho y la factura de API desaparece para la mayoría de los documentos.
Comparación
| SLM (modelo pequeño) | LLM puntero | |
|---|---|---|
| Tamaño orientativo | Menos de 10 000 millones de parámetros | Decenas a cientos de miles de millones de parámetros |
| Dónde funciona | Ordenador, teléfono, servidor interno con una GPU | Centros de datos del proveedor (API) |
| Coste de uso | Bajo, sobre todo con gran volumen | Más alto, facturado por token |
| Latencia | Baja | Más alta, variable según la carga |
| Versatilidad | Buena en una tarea estrecha | Alta, incluso en preguntas abiertas |
| Personalización | Fine-tuning más sencillo y barato | Más pesada, a menudo limitada al prompt |
| Confidencialidad | Datos conservados internamente si se autoaloja | Datos enviados al proveedor, según contrato |
Preguntas frecuentes
¿Qué es un SLM (small language model)?
Un modelo de lenguaje pequeño, lo bastante compacto para funcionar en un ordenador, un teléfono o un servidor modesto. No hay umbral oficial, pero la mayoría de los modelos de menos de 10 000 millones de parámetros se consideran SLM en 2025 (definición de NVIDIA Research).
¿Cuál es la diferencia entre un SLM y un LLM?
El tamaño, y lo que se deriva de él. Un LLM puntero es más versátil y mejor en preguntas abiertas, pero caro y alojado por un proveedor. Un SLM es menos versátil, pero rápido, barato y puede funcionar en sus instalaciones. En una tarea estrecha y repetitiva, a menudo rinde igual.
¿Qué ejemplos de small language models existen?
Ministral 3B y 8B de Mistral AI (empresa francesa, octubre de 2024), la familia Phi de Microsoft, SmolLM2 de Hugging Face, los modelos Nemotron-H de NVIDIA o las versiones destiladas de DeepSeek-R1. Muchos están disponibles con pesos abiertos.
¿Por qué se dice que los SLM son el futuro de la IA agéntica?
Es la tesis de un artículo de NVIDIA Research (junio de 2025). Un agente encadena sobre todo subtareas estrechas y repetitivas, que un SLM especializado resuelve igual de bien, con un coste de servicio entre 10 y 30 veces menor según los autores. Recomiendan sistemas mixtos: SLM para el volumen, gran modelo como refuerzo.
¿Puede un SLM funcionar sin conexión a internet?
Sí, si está instalado en un equipo o un servidor de la empresa. Mistral AI presentó sus Ministral para asistentes sin conexión, traducción en el dispositivo o análisis local. Es una ventaja para centros aislados y datos sensibles.
¿Es un SLM más seguro para los datos de la empresa?
Puede serlo: alojado internamente, evita enviar los datos a un proveedor externo. La seguridad depende entonces de su propia infraestructura: control de accesos, actualizaciones, registros. Un SLM mal gestionado no es más seguro que una API bien encuadrada.
Ver también
Para profundizar
Small Language Models are the Future of Agentic AI, Belcak et al., NVIDIA Research, 2025
Fuentes
- Small Language Models are the Future of Agentic AI, Belcak, Heinrich et al., NVIDIA Research, arXiv, 2 de junio de 2025. https://arxiv.org/abs/2506.02153
- Small Language Models are the Future of Agentic AI, versión HTML (definición WD1, costes, casos MetaGPT, Open Operator, Cradle). https://arxiv.org/html/2506.02153v1
- Un Ministral, des Ministraux (Ministral 3B y 8B), Mistral AI, 16 de octubre de 2024. https://mistral.ai/news/ministraux