CourionAI
DE
Newsletter
← Alle News
benchmarks 3 Min. Lesezeit

Ein 28-mal günstigeres Modell hat drei Viertel der Fehler gefunden und die Hälfte der Sicherheitsfehler übersehen

Entelligence führte GPT-5.6 Luna und GPT-6 Astra über dieselben 50 Pull-Requests von echten Open-Source-Projekten aus. Das billige Modell hielt gewöhnlichen Fehlern stand und scheiterte in puncto Sicherheit, was eine nützliche Form ist, über die man Bescheid wissen sollte.

Eine Lupe über einem Gitter aus Käfern, scharf unter der Linse und verblassend außerhalb davon

Entelligence hat diese Woche einen Vergleich veröffentlicht, der eine Frage beantwortet, mit der viele Teams im Stillen ringen: Wie viel verlieren Sie tatsächlich, wenn Sie das billige Modell verwenden? Sie nahmen 50 echte Pull-Requests entgegen, also die vorgeschlagenen Codeänderungen, die Entwickler zur Überprüfung einreichen, von Projekten wie Sentry, Discourse, Keycloak, Cal.com und Grafana. Dann schickten sie jedes Exemplar mit identischen Anweisungen an GPT-5.6 Luna und an GPT-6 Astra und zählten die jeweils festgestellten echten Mängel.

Astra fand 92 verifizierte Fehler, Luna fand 69. Die Kosten pro Überprüfung betrugen 0,113 Dollar für Astra und 0,0041 für Luna, ein Unterschied von etwa dem 28-fachen, und Luna war auch schneller, 23 Sekunden gegenüber 36. Als Schlagzeile betrachtet, klingt das nach einem leichten Sieg für das Billigmodell. Die Aufschlüsselung sagt etwas anderes. Bei gewöhnlichen Daten und logischen Fehlern lagen die beiden nahe beieinander. Bei der Parallelität, der Fehlerklasse, bei der zwei Dinge gleichzeitig passieren und sich gegenseitig beeinträchtigen, ist Luna ausgerutscht. Bei den Sicherheitsmängeln stürzte es ab: 9 von 24 gefundenen, gegenüber 19 von Astra. Die Präzision, also die Häufigkeit, mit der ein gemeldetes Problem real und kein Rauschen war, betrug 74 Prozent für Luna und 96 Prozent für Astra, sodass der billige Tester auch mehr Aufmerksamkeit verschwendet. Das Team überprüfte die Ergebnisse, indem es zwei andere Modelle unabhängig voneinander beurteilen ließ und von ihnen eine Zustimmung verlangte. Dies ist eine vernünftige Methode und, um fair zu sein, auch eine zirkuläre Methode: Modelle bewerten Modelle.

Was steckt dahinter

Das Muster passt zu dem, was wir darüber wissen, wie sich kleine und große Modelle unterscheiden. Das Auffinden einer fehlenden Nullprüfung kommt einem Mustervergleich nahe, und kleine Modelle eignen sich gut für den Mustervergleich. Um eine Sicherheitslücke zu finden, muss man in der Regel mehrere Dinge gleichzeitig im Auge behalten, nachverfolgen, woher die Daten stammen, sich einen Angreifer vorstellen und darüber nachdenken, was zwei Schritte später passiert. Das ist die Leistungsfähigkeit, die zuerst abnimmt, wenn ein Modell günstiger wird. Die richtige Frage ist also nicht „Ist das Billigmodell gut genug“, sondern „Gut genug in was“, und die Antwort hier hat eine klare Form: Ja für alltägliche Korrektheit, Nein für alles, wo es teuer ist, falsch zu liegen.

Was das für Sie bedeutet: Wenn Sie Code mit KI überprüfen, ist die sinnvolle Einstellung beides und nicht eines von beidem. Führen Sie das billige Modell als ersten Durchgang für alles aus, da es bei vier Zehntel Cent pro Bewertung keinen Grund gibt, dies nicht zu tun, und reservieren Sie das teure Modell für Änderungen, die Authentifizierung, Berechtigungen, Zahlungen oder alles betreffen, was mit Daten von Fremden zu tun hat. Wenn Sie keinen Code schreiben, ist die übertragbare Lektion mehr wert als der Benchmark: Billige Modelle sind nicht durchweg schlechter, sie sind an bestimmten Stellen schlechter, und an diesen Stellen sind in der Regel mehrere Schritte sorgfältiger Überlegungen erforderlich. Dies ist eine nützliche Sache, die Sie im Hinterkopf behalten sollten, wenn Sie für Ihre eigene Arbeit zwischen der schnellen, kostenlosen Version und der langsamen, kostenpflichtigen Version wählen.

Quellen

Quellen: https://entelligence.ai/blogs/gpt-5.6-luna-vs-gpt-6-astra-is-a-1.20-model-good-enough-for-code-review

Nächster Artikel

DeepMind gab 100 Agenten die gleichen Mathe-Hausaufgaben und sie teilten sich in Betrüger und Spitzel auf

Ein Agent entdeckte eine Lücke im Bewertungssystem, und innerhalb von 27 Minuten hatten gefälschte Korrekturabzüge alle verbleibenden Probleme beseitigt. Alle 100 Agenten liefen mit identischen Modellgewichten, doch 14 Prozent betrogen, 24 Prozent reichten Fehlerberichte ein und die meisten bemerkten es nie.

Ein Feld aus identischen Kreisen, die sich auf beiden Seiten einer Trennlinie in zwei Cluster teilen