← Lexique IA

Multimodalité

Langage, voix & vision

La multimodalité est la capacité d'un modèle à traiter plusieurs types de contenus (texte, image, son, vidéo) dans un même échange : décrire une photo, analyser un document scanné, commenter un graphique. Les modèles de fondation récents sont nativement multimodaux, ouvrant des usages impossibles au texte seul.

En pratique chez Gensai

Gensai combine les modalités selon le projet : voix et texte pour les agents vocaux, image et texte pour l'analyse documentaire.