L'inférence est l'utilisation d'un modèle déjà entraîné : on lui soumet une entrée, il produit sa sortie. Chaque réponse d'un chatbot est une inférence. Son coût (latence, énergie, prix par token) est un critère central pour dimensionner une solution IA destinée à la production.
En pratique chez Gensai
Gensai optimise les coûts d'inférence en choisissant la taille de modèle adaptée, jusqu'à l'inférence 100 % locale du dispositif des Océans.