CourionAI
DE
Newsletter
← Alle News
google 3 Min. Lesezeit

Google sperrt sein eigenes Modell aus den Testfragen aus

DeepMind und das Singapore AI Safety Institute führten die erste doppelblinde Evaluierung eines proprietären Grenzmodells durch. Der Bewerter sieht nie die Gewichtungen, Google sieht nie die Fragen und die Kryptografie erzwingt beides.

Zwei versiegelte Tresore, die einander gegenüberstehen und durch ein einzelnes verschlossenes Rohr verbunden sind, wobei jedes Schlüsselloch vom anderen abgewandt ist

Wenn Sie die Prüfungsfragen im Voraus kennen würden, würde Ihr perfektes Ergebnis nichts bedeuten. Das ist ungefähr das Problem bei KI-Benchmarks von heute, und Google DeepMind hat gerade ein Pilotprojekt durchgeführt, um dieses Problem zu beheben. Zusammen mit dem Singapore AI Safety Institute und anderen Partnern führte es die erste Doppelblindbewertung eines proprietären Grenzmodells durch. Ein Modell aus der Gemini Flash Lite-Reihe wurde anhand von Benchmarks getestet, die Google nie gesehen hat.

Das Problem hat einen Namen: Benchmark-Kontamination. Wenn sich die Testfragen irgendwo in den Trainingsdaten eines Modells befanden, zeigt die Bewertung an, dass es sich gut eingeprägt hat, nicht aber, dass es gut begründet wurde. Bisher erzwangen sensible externe Bewertungen eine schwierige Entscheidung. Entweder übergab der Prüfer seine Testaufforderungen, was bedeutete, dass der Modellanbieter die Fragen sah und sie entsprechend optimieren konnte, oder der Anbieter übergab seine Modellgewichte, was bedeutete, dass er sein wertvollstes geistiges Eigentum riskierte. Keine Partei wollte zuerst gehen. DeepMind nennt ein aktuelles Beispiel für die daraus resultierenden Spannungen: die verzögerte ARC-AGI-Bewertung von Anthropics Fable 5, die aufgehalten wurde, weil Anthropic bei seinen stärksten Modellen eine 30-tägige Datenaufbewahrungsrichtlinie durchsetzt.

Das Pilotprojekt beseitigt die Wahl mithilfe von Confidential Space, einem Teil der vertraulichen Computing-Tools von Google Cloud. Sowohl die Testdaten als auch das Modell werden in einer kryptografisch versiegelten Umgebung ausgeführt, die sicherstellt, dass jede Seite gegenüber ihrem Besitzer privat bleibt. Der Bewerter sieht nie die Gemini-Gewichte. Google sieht die Eingabeaufforderungen nie. Bisher wurde dies ohne Protokollierungsversprechen und -verträge, also mit Vertrauen, abgewickelt. Das Hinzufügen einer technischen Garantie ist die eigentliche Neuigkeit.

Was hier eigentlich vor sich geht: Benchmarks sind die Art und Weise, wie die gesamte Branche über Fortschritte spricht, und fast jede Zahl, die Sie in einem Einführungsbeitrag lesen, wurde von der Firma, die das Modell hergestellt hat, anhand von Tests erstellt, die sie sehen konnte. Niemand betrügt unbedingt, aber die Anreizstruktur ist schrecklich und es gibt für einen Außenstehenden keine Möglichkeit, ein wirklich fähiges Modell von einem gut vorbereiteten Modell zu unterscheiden. Eine unabhängige Evaluation funktioniert nur, wenn der Gutachter seine Fragen geheim halten kann, und gerade Geheimfragen waren mit der alten Regelung nicht möglich. Dies ist vor allem dort wichtig, wo am meisten auf dem Spiel steht: Cybersicherheitstests und Bewertungen durch Regierungsbehörden, die ihr Material nicht an ein privates Unternehmen weitergeben können. Es lohnt sich jedoch, die Erwartungen auf dem Boden zu halten. Dies ist ein Pilotprojekt in einem kleinen Modell, und DeepMind ist sowohl das Subjekt als auch die Partei, die das Ergebnis verkündet.

Was das für Sie bedeutet: Betrachten Sie es als Grund, die Benchmark-Zahlen etwas skeptischer und nicht weniger zu betrachten. Wenn Ihnen bei der Markteinführung eines Modells das nächste Mal mitgeteilt wird, dass es bei etwas 94 Prozent erreicht hat, müssen Sie sich fragen, wer den Test geschrieben hat, ob das Labor es vorher sehen konnte und ob jemand außerhalb des Unternehmens es überprüft hat. Wenn sich diese Methode durchsetzt, werden einige dieser Zahlen eine sinnvolle Garantie hinter sich haben und der Rest nicht, und der Unterschied wird bemerkenswert sein. Für alle, die sich für Werkzeuge entscheiden, statt sie selbst zu bauen, bleibt die praktische Version die gleiche wie eh und je: Ihre eigene Woche im realen Einsatz verrät Ihnen mehr als jede Bestenliste.

Quellen

Quellen: https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/piloting-the-worlds-first-double-blind-ai-evaluations/double-blind-evaluations-technical-report.pdf

Nächster Artikel

Unsichtbarer Text in einer E-Mail hat einen KI-Zusammenfassungsrechner in allen 10 Durchläufen getäuscht

Forcepoint versteckte Anweisungen in einer E-Mail mit weißem Text und einer Schriftgröße von Null. Der Leser sah nichts Ungewöhnliches. Die KI-Zusammenfassung meldete jedes Mal eine gefälschte Rechnung über 46.200 Euro und eine gefälschte Frist.

Ein geöffneter Umschlag mit einem sichtbaren Brief und einem zweiten leeren Blatt, das unsichtbar dahinter unter einer Lupe herausrutscht