CourionAI
DE
Newsletter
← Alle News
ai-basics 2 Min. Lesezeit

Nvidias neues kostenloses Modell ist nicht das intelligenteste. Es ist einfach sehr, sehr schnell

Nemotron 3.5 Lightning entspricht bei den Intelligenzwerten mit einem Viertel der Parameter dem gpt-oss-120b von OpenAI und produziert etwa 670 Token pro Sekunde, das schnellste in seiner Vergleichsgruppe.

Eine kleine Lokomotive rast weit vor drei viel größeren Güterzuglokomotiven auf parallelen Gleisen, Geschwindigkeitsspuren folgen dahinter

Nvidia hat am Dienstag Nemotron 3.5 Lightning veröffentlicht, ein Open-Weight-Modell, das Sie herunterladen und selbst ausführen können. Es geht nicht darum, das intelligenteste Modell im Raum zu sein. Es versucht, der Schnellste zu sein, und nach diesem benchmark gewinnt es derzeit seine Klasse.

Die Zahlen stammen von der unabhängigen Benchmarking-Site Artificial Analysis: Lightning erreicht auf ihrem Intelligence Index einen Wert von 24, ein Sprung von neun Punkten gegenüber seinem Vorgänger und genau gleichauf mit dem gpt-oss-120b von OpenAI, einem Modell, das etwa viermal so groß ist. Wo es wegzieht, ist Geschwindigkeit. Lightning produziert knapp 670 Token pro Sekunde, was den höchsten gemessenen Durchsatz im gesamten Vergleich darstellt und mit 386 fast doppelt so schnell ist wie Googles Gemini 3.5 Flash-Lite. Eine typische Benchmark-Aufgabe dauert etwa eine halbe Minute. Qwen3.6 35B A3B benötigt für die gleiche Arbeit etwa 3,5 Minuten, Gemma 4 31B etwa 5,8.

Der Trick liegt in der Architektur. Lightning verfügt insgesamt über 31,6 Milliarden Parameter, von denen jedoch nur 3,6 Milliarden für einen bestimmten Schritt aktiviert sind. Parameter sind die einstellbaren Zahlen, die ein Modell während des Trainings lernt, und dieser „mixture of experts“-Entwurf bedeutet, dass das Modell über eine große Menge an Wissen verfügt, während bei jeder Antwort nur die Rechenkosten eines kleinen Modells anfallen. Es verarbeitet nur Text, liest bis zu einer Million Kontexttokens gleichzeitig und wird unter der freizügigen OpenMDW-1.1-Lizenz ausgeliefert.

Was dahintersteckt

Nvidia argumentiert seit über einem Jahr mit diesem Fall. In einem viel diskutierten Artikel behaupteten die Forscher, dass Modelle mit weniger als 10 Milliarden Parametern die meisten Agenten-Arbeitslasten ungefähr genauso gut bewältigen könnten wie zehn- bis dreißigmal größere Modelle, und das zu einem Bruchteil der Kosten. Lightning ist bisher das klarste Produkt, das auf diesem Argument basiert. Und die Agenten-Benchmarks bestätigen dies: Auf GDPval-AA v2 erreicht es eine Elo-Bewertung von 824 und schlägt damit sowohl gpt-oss-120b mit 800 als auch Nvidias eigenen, größeren Nemotron 3 Super mit 698.

Allerdings eine berechtigte Einschränkung. Es gibt intelligentere kleine Modelle. Qwen3.6 35B A3B erreicht 32 und Metas Muse Glimmer 35, beide deutlich vor Lightnings 24. Proprietäre Modelle liegen noch weiter vorne. Lightning ist für eine Aufgabe konzipiert: viele kleine Schritte schnell und kostengünstig zu erledigen, was genau das ist, was ein KI-Agent tut, der den ganzen Tag eine lange Aufgabe erledigt.

Was das für dich bedeutet: Wenn Sie noch nie selbst ein Modell betrieben haben, ändert sich heute nichts, und das ist in Ordnung. Wenn Sie bereits experimentieren, ist dies einen Blick wert, denn durch die Geschwindigkeit fühlen sich Agenten benutzerfreundlich und nicht träge an. Die Gewichte liegen bei Hugging Face, und mehrere Anbieter, darunter DeepInfra, Fireworks, Nebius und CoreWeave, bieten es bereits an, wenn Sie es lieber nicht selbst hosten möchten. Erwarten Sie nur nicht, dass es wie ein frontier model argumentiert. Dafür ist es nicht gedacht.

Quellen

Quellen: https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/

Nächster Artikel

Forscher haben einen Weg gefunden, die verborgenen Gedanken von Claude, ChatGPT und Gemini zu lesen

Ein auf stolen-thoughts.com veröffentlichter Artikel zeigt, wie verschlüsselte chain-of-thought-Blöcke aus frontier models in schwächere Geschwistermodelle zurückgespielt und dekodiert werden können. Alle drei Anbieter haben es inzwischen behoben.

Zwei Türen sehr unterschiedlicher Größe teilen sich ein Schlüsselloch, aus dem kleineren schlüpft ein versiegelter Umschlag, aus dem schwache Kritzeleien hervortreten