CourionAI
DE
Newsletter
← Alle News
ai-detection 2 Min. Lesezeit

KI könnte wie ein Mensch schreiben. Sicherheitstraining ist das, was es verrät

Der CTO von Pangram argumentiert, dass Sprachmodelle nicht deshalb erkennbar sind, weil es ihnen an Fähigkeiten mangelt, sondern weil die Art und Weise, wie sie sich ausdrücken, nach dem Training eingeschränkt wird. Der Effekt hat einen Namen: Mode Collapse.

Reihen identischer Schreibmaschinen, die sich zu einem schmalen Engpass zusammenfügen

Hier ist eine Behauptung, die es wert ist, bestätigt zu werden: Sprachmodelle könnten im Prinzip mit allen Arten von Menschen schreiben, und der Grund, warum sie das nicht tun, ist ein Nebeneffekt der Art und Weise, wie wir ihnen beibringen, sich zu verhalten. Das ist das Argument, das Bradley Emi, CTO des KI-Textdetektors Pangram, am 20. August in einem Beitrag vorbrachte, und es stellt neu dar, was die KI-Erkennung tatsächlich erkennt.

Der Mechanismus hat einen Namen: Moduskollaps. Während des Post-Trainings, der Phase, nachdem ein Modell das Internet gelesen und dort Verhaltensregeln gelernt hat, wird einem Modell beigebracht, gefährliche Ausgaben zu vermeiden, bestimmte Anfragen abzulehnen und innerhalb bestimmter Grenzen zu bleiben. Dieses Training beseitigt nicht nur die schlechten Optionen. Dadurch wird der gesamte Bereich eingegrenzt, sodass sich das Modell auf eine bevorzugte Art der Formulierung einstellt, anstatt seine Auswahlmöglichkeiten auf die vielen Arten zu verteilen, die eine Person denselben Satz sagen könnte. Der entgegengesetzte Zustand, bei dem die Wahrscheinlichkeit gleichmäßiger über die Formulierungen verteilt ist, wird als Modusabdeckung bezeichnet. Emis unterstützende Beweise sind die Ausnahme, die die Regel bestätigt: Basismodelle, die Rohversionen vor dem Training, schreiben mit genügend Vielfalt, dass Pangrams Detektor sie nicht markiert. Das Gleiche gilt für enge Feinabstimmungen, die nur auf Hemingway oder einem Subreddit trainiert wurden, und für fehlerhafte, inkohärente Ergebnisse.

Wenn das richtig ist, erklärt es viele Dinge, die sonst wie Zufall aussehen würden, einschließlich der Gedankenstrich-Gewohnheit, die laut Pews Untersuchung des Internets im Gleichschritt mit der KI-Nutzung zunahm. Es baut auch eine echte Spannung auf. Jede Sicherheitsabsperrung, die ein Labor hinzufügt, macht die Schrift des Modells ein wenig einheitlicher und daher etwas leichter zu erkennen. Man könnte das als einen glücklichen Zufall interpretieren, da die Erkennbarkeit nützlich ist. Man könnte es auch als Beweis dafür lesen, dass wir diese Systeme auf eine Weise verflachen, die niemand bewusst gewählt hat. Emi weist auf eine wichtige Einschränkung hin: All dies gilt nur für Text ohne Wasserzeichen, die unsichtbare statistische Signatur, die Anthropic Anfang dieses Monats in Claudes Ausgabe einzubetten begann. Wasserzeichen werden wahrscheinlich weiterhin funktionieren, unabhängig davon, wie vielfältig die Schrift eines Modells ist.

Was das für Sie bedeutet: Wenn Sie sich gefragt haben, warum KI-geschriebener Text einen „Sound“ hat, wissen Sie jetzt, dass dies keine Einschränkung der Technologie ist, sondern eine Folge der Schulung, die seine Verwendung sicher macht. Praktisch ist dies ein Grund, Detektoren in keiner Richtung blind zu vertrauen. Eine Person, die in einer sauberen, sorgfältigen und leicht formalen Sprache schreibt, wird sie stolpern lassen, und jemand, der ein ungefiltertes Modell verwendet, möglicherweise nicht. Wenn Sie in der Schule oder bei der Arbeit jemals Opfer des Urteils eines Detektors werden, sollten Sie auf diese Asymmetrie hinweisen.

Quellen

Quellen: https://pangram.substack.com/p/no-llms-dont-just-mimic-human-text

Nächster Artikel

Amazon hat gerade seinen KI-Assistenten auf Fire TV kostenlos zur Verfügung gestellt und die Gebühr von 19,99 Dollar stillschweigend gesenkt

Alexa+ wird kostenlos auf allen kompatiblen Fire TV-Geräten in den USA eingeführt, eine Prime-Mitgliedschaft ist nicht erforderlich. Das Upgrade erfolgt automatisch. Der Haken daran ist, dass das kostenlose Kontingent beim Fernseher endet.

Ein kastenförmiger Retro-Fernseher auf einem niedrigen Gestell, umgeben von Schallwellen, während ein Papierpreisschild davonschwebt