Omnimodal
Ein Modell, das Text, Bilder, Audio und Video zusammen in einem System verarbeitet, anstatt zwischen spezialisierten Tools zu wechseln.
Multimodal bedeutet normalerweise, dass ein Modell mehr als eine Art von Eingabe verarbeiten kann, häufig Text und Bilder. Omnimodal ist der darüber hinausgehende Marketingschritt: Text, Bilder, Audio und Video, alles nativ von einem einzigen Modell übernommen, statt erst konvertiert zu werden.
Der Unterschied ist nicht pedantisch. Der ältere Ansatz war ein Relais: Ein Tool transkribiert Sprache, ein anderes beschreibt die Videobilder und ein Sprachmodell begründet diese Beschreibungen. Bei jeder Übergabe gehen genau die Dinge verloren, die Bedeutung haben, etwa das Zögern einer Stimme oder das, was auf dem Bildschirm zu dem Zeitpunkt zu sehen war, als ein Satz gesprochen wurde. Ein Modell, das die rohen Audio- und Videodaten empfängt, behält dieses Material im Spiel, weshalb Labore das Wort „nativ“ immer wieder betonen.