CourionAI
DE
Newsletter
← Alle News
models 3 Min. Lesezeit

Ein Diffusionsmodell schreibt jetzt 1.100 Wörter pro Sekunde, und es kostet fast nichts

Inception Labs veröffentlichte Mercury 2.5, ein Sprachmodell, das auf die Art und Weise aufgebaut ist, wie Bildgeneratoren aufgebaut sind, und nicht auf die Art und Weise, wie ChatGPT aufgebaut ist. Es produziert 1.107 Token pro Sekunde auf gewöhnlichen Nvidia-Karten bei 20 Cent pro Million eingegebener Token.

Eine verstreute Wolke aus gedrucktem Korn, die sich auf einmal in Reihen klarer, schneller Linien auflöst, mit einer langsamen Perlenkette, die am unteren Rand entlang kriecht

Inception Labs hat am Montag Mercury 2.5 veröffentlicht und die Zahl, die alle nennen, ist 1.107 Token pro Sekunde. Token sind die kleinen Textblöcke, die ein Modell liest und schreibt, jeweils etwa drei Viertel eines Wortes, sodass ein einzelnes Modell auf weit verbreiteter Nvidia-Hardware etwa 800 Wörter pro Sekunde erzeugt. Zum Vergleich: Die meisten Chat-Modelle, die Sie heute verwenden, fühlen sich mit 50 bis 150 Token pro Sekunde schnell an.

Das Unternehmen gibt an, dass Mercury 2.5 bei internen Messungen etwa 40 Prozent leistungsfähiger ist als Mercury 2 und dass es in der gleichen Qualitätsstufe landet wie die billigen, schnellen Stufen der großen Labore: GPT-5.6 Luna bei niedriger Einstellung, Gemini 3.5 Flash-Lite, Claude Haiku 4.5. Es wird mit einem 260.000-Token-Kontextfenster geliefert, das angibt, wie viel Text das Modell gleichzeitig speichern kann, plus anpassbarem Argumentationsaufwand, parallelen Toolaufrufen und JSON-Ausgabe, die einem von Ihnen definierten Schema folgt. Der Standardpreis beträgt 0,20 Dollar pro Million Input-Token und 0,75 Dollar pro Million Output, mit einem Einführungsrabatt von 80 Prozent, der diese auf 0,04 und 0,15 senkt. Inception behauptet außerdem, dass die Zeit bis zum ersten Token für Sprachpipelines weniger als 170 ms beträgt, was der Verzögerung entspricht, bevor das erste Wort zurückkommt.

Was steckt dahinter

Fast jedes Sprachmodell, das Sie verwendet haben, funktioniert von links nach rechts. Es schreibt einen Token, schaut sich alles an, was es geschrieben hat, und schreibt dann den nächsten. Diese Reihenfolge ist der Grund, warum die Generierung eine Geschwindigkeitsobergrenze hat: Das Modell kann buchstäblich nicht mit Token 200 beginnen, bevor Token 199 existiert.

Ein Diffusionssprachenmodell funktioniert auf die gleiche Weise wie Bildgeneratoren wie Stable Diffusion. Es beginnt mit einem groben, lauten Entwurf der gesamten Antwort und verfeinert ihn dann schrittweise, wodurch viele Token gleichzeitig geschärft werden. Da die Verfeinerung parallel erfolgt, produziert dieselbe GPU weitaus mehr Text pro Sekunde. Der Kompromiss bestand in der Vergangenheit in der Qualität, da ein Modell, das sich frühzeitig auf eine grobe Form festlegt, mit langen Ketten sorgfältiger Überlegungen schwerer zu kämpfen hat. Mercury 2.5 ist das Argument von Inception, dass sich die Lücke so weit geschlossen hat, dass sie für die tägliche Arbeit von Bedeutung ist, und nach eigenen Angaben ist es das am weitesten verbreitete Sprachmodell, das jemals trainiert wurde. Diese Behauptung wurde noch nicht unabhängig überprüft, was im Hinterkopf behalten werden sollte.

Was das für Sie bedeutet: Wenn Sie nur neugierig auf KI sind, ändert sich heute nichts, aber es ist nützlich zu wissen: Geschwindigkeit und Preis sind keine festen Eigenschaften von KI, sie hängen davon ab, wie das Modell aufgebaut ist, und jemand hat gerade eine Abkürzung gefunden. Wenn Sie Dinge erstellen, ist der interessante Fall alles, wo das Warten das Problem und nicht die Brillanz ist: Autovervollständigung in einem Editor, ein Sprachassistent, der antworten muss, bevor die Pause unangenehm wird, Massenbereinigung von ein paar tausend Dokumenten. Bei 15 Cent pro Million Output-Token während des Einführungsrabatts sind Jobs, die zu teuer waren, um über ein ganzes Archiv laufen zu lassen, plötzlich nicht mehr verfügbar. Ein fairer Vorbehalt: Führen Sie Ihren eigenen Vergleich durch, bevor Sie etwas Wichtiges ändern, denn „vergleichbar mit der günstigen Stufe eines Grenzmodells“ ist eine Behauptung des Anbieters und kein Urteil aus der Praxis.

Quellen

Quellen: https://www.inceptionlabs.ai/blog/introducing-mercury-2-5

Nächster Artikel

Meta hört auf, Ingenieure danach zu bewerten, wie viel KI sie verwenden

Nachdem die Mitarbeiter in einer internen Token-Rangliste gegeneinander angetreten waren, teilte Meta den Ingenieuren mit, dass KI-Nutzungs-Dashboards und Token-Zählungen bei Leistungsüberprüfungen nicht mehr berücksichtigt werden. Die Episode hat jetzt einen Namen: tokenmaxxing.

Eine sich drehende mechanische Zählermaschine, die neben einem Messgerät mit abgebrochener Nadel Schwaden identischer Jetons über den Boden verschüttet