CourionAI
DE
Newsletter
← Glossar Modell

Pixtral

Mistrals Vision-Komponente, der Teil, der es einem Model ermöglicht, Bilder zu betrachten, anstatt nur Text zu lesen.

Pixtral begann als multimodales Modell von Mistral, das heißt eines, das Bilder und Text gemeinsam verarbeitet. Der daraus gewonnene Vision-Encoder wird jetzt als Baustein in anderen Mistral-Modellen wiederverwendet, einschließlich des Shieldstral-Sicherheitsklassifikators.

Ein Vision-Encoder ist das Teil, das ein Bild in dieselbe Art interner Darstellung umwandelt, die das Modell bereits für Wörter verwendet, sodass der Rest des Netzwerks gleichzeitig über ein Foto und einen Satz nachdenken kann. Wenn ein Mistral-Modell sehen kann, ist Pixtral normalerweise der Grund dafür.