Inférence
De Wiki du Numérique Responsable
L’inférence est la phase d’utilisation d’un modèle d’intelligence artificielle déjà entraîné : le moment où il applique ce qu’il a appris à une nouvelle requête.
Pourquoi elle compte
L’entraînement est coûteux mais ponctuel. L’inférence est unitairement bien moins coûteuse, mais répétée à chaque usage. Pour un service en production sollicité par de nombreux utilisateurs, l’inférence finit par représenter l’essentiel de la consommation liée au modèle.
Ce coût dépend de trois facteurs :
- la taille du modèle sollicité : un grand modèle généraliste consomme davantage qu’un modèle spécialisé plus petit, à résultat parfois équivalent ;
- la longueur de la requête et de la réponse ;
- le nombre d’appels, démultiplié dans les usages agentiques.
Levier de sobriété
Choisir le plus petit modèle qui répond au besoin est le levier le plus direct de l’IA frugale : il agit sur chaque requête, sans modifier l’usage.