CourionAI
FR
Newsletter
← Glossaire Modèle

Pixtral

Le composant de vision de Mistral, la partie qui permet à un modèle de regarder des images au lieu de simplement lire du texte.

Pixtral a commencé sa vie en tant que modèle multimodal de Mistral, c’est-à-dire un modèle qui gère les images et le texte ensemble. L’encodeur de vision est désormais réutilisé comme élément de base dans d’autres modèles Mistral, y compris le classificateur de sécurité Shieldstral.

Un encodeur de vision est l’élément qui transforme une image en le même type de représentation interne que le modèle utilise déjà pour les mots, afin que le reste du réseau puisse raisonner sur une photo et une phrase en une seule fois. Si un modèle Mistral peut voir, Pixtral en est généralement la raison.