CourionAI
DE
Newsletter
← Alle News
models 2 Min. Lesezeit

Grok 4.7 denkt länger für das gleiche Geld und gewinnt einen ungeraden Benchmark

xAI hat am Montag Grok 4.7 zu unveränderten Preisen von 2 Dollar rein und 6 Dollar raus pro Million Token ausgeliefert. Es erzielt 71 Prozent bei DeepSWE und einen ungewöhnlich hohen Wert bei einem rechtlichen Benchmark, bei dem die Konkurrenten zusammenbrechen.

Eine waagrechte Waage, auf der einen Waagschale ein kleiner Stapel Münzen und auf der anderen ein Turm aus Zahnrädern

xAI hat am Montag Grok 4.7 veröffentlicht, und an der Schlagzeile hat sich nichts geändert: Es kostet genauso viel wie Grok 4.6, nämlich 2 Dollar pro Million Input-Tokens und 6 Dollar pro Million Output-Tokens, mit einer schnelleren Variante zum doppelten Preis und doppelter Geschwindigkeit. Ein Token besteht ungefähr aus drei Vierteln eines Wortes, eine Million davon ist also ein langer Arbeitsnachmittag für einen Codierungsassistenten. Unter der Haube handelt es sich um ein größeres Basismodell, das mit einem längeren Verstärkungslernlauf trainiert wird und sich auf Probleme konzentriert, die Stunden statt Minuten dauern.

Die Benchmark-Tabelle bietet ein gemischtes Bild, das nützlicher ist als ein sauberer Überblick. Beim DeepSWE v1.1, einem Software-Engineering-Test, erreicht Grok 4.7 bei hohem Aufwand 71,0 Prozent, gegenüber 65,2 beim Vorgänger und liegt mit 70,0 knapp vor Claude Fable 5.1 Max, während GPT-5.6 Sol Max mit 72,7 an der Spitze liegt. Beim Terminal-Bench 4.0, der mehrstündige Befehlszeilenarbeit misst, verdoppelt Grok 4.7 den Wert seines Vorgängers fast auf 38,0 Prozent, während Fable 5.1 Max mit 57,9 weit vorne liegt. Die seltsamste Zahl ist der Harvey Legal Agent Benchmark, bei dem Grok 4,7 19,6 Prozent gegenüber 2,5 für GPT-5.6 Sol und 6,7 für Fable 5.1 Max erzielt. Beim klinischen Denken bleibt es beiden hinterher. xAI sagt auch, dass dies sein bisher stärkstes Modell ist, wenn es darum geht, wirklich gefährliche Anfragen abzulehnen und gleichzeitig bei legitimen Sicherheitsarbeiten zu helfen. Bei seinem eigenen HackerBench-Test ließ es 3,3 Prozent der riskanten Eingabeaufforderungen durch.

Was steckt dahinter

Zwei Dinge sind es wert, hervorgehoben zu werden. Erstens sinken die Preise nicht so sehr, sondern die Leistungsfähigkeit steigt unter einen Festpreis. Dies ist dieses Jahr in der gesamten Branche der Fall und der Grund dafür, dass sich ein Modell von vor sechs Monaten eher teuer anfühlt als billiger zu werden. Zweitens verrät Ihnen die Streuung dieser Benchmarks etwas Echtes: Es gibt kein einzelnes „bestes Modell“ mehr, es gibt Modelle, die für bestimmte Aufgaben geeignet sind. Ein Wert von 19,6 Prozent bedeutet immer noch, dass vier von fünf juristischen Aufgaben gescheitert sind. Die richtige Lesart ist also, dass diese Agenten noch am Anfang ihrer beruflichen Tätigkeit stehen, und nicht, dass Grok das Recht gelöst hat. Benchmarks werden auch vom Anbieter durchgeführt, sofern nicht anders angegeben, und jedes Labor wählt die Tests dort aus, wo sie gut aussehen.

Was das für Sie bedeutet: Für die alltägliche Chat-Nutzung ändert sich dadurch kaum etwas. Wenn Sie Code schreiben oder KI per Token bezahlen, ist es einen Versuch wert, insbesondere weil es in Tools integriert ist, die Sie möglicherweise bereits verwenden, wie Cursor und die Grok-API, und weil sich bei einem Wechsel nichts an Ihrer Rechnung ändert. Die allgemeinere Lektion: Wenn ein Modell zum gleichen Preis besser wird, kauft Ihr vorhandenes Budget stillschweigend mehr, aber nur, wenn Sie tatsächlich umziehen. Überprüfen Sie alle paar Monate, welches Modell Ihre Tools standardmäßig verwenden.

Quellen

Quellen: https://x.ai/news/grok-4-7

Nächster Artikel

Als die Agenten gesprächig wurden, sanken die Margen dieses Startups auf minus 50 Prozent

Bloomberg berichtet, dass die juristische KI-Firma Harvey beobachtete, wie die Bruttomargen bis Juni von etwa 50 Prozent auf minus 50 Prozent sanken, da die Token-Nutzung um das Zwanzigfache stieg. Es erholte sich durch den Bau eines hauseigenen Modells auf der offenen Kimi K3 von Moonshot.

Ein gefaltetes Papierband in Form einer Diagrammlinie, das nach unten fällt und sich dann über einem Gitter wieder nach oben biegt