CourionAI
DE
Newsletter
← Glossar Begriff

KI-Forschungspräferenzmodell

Eine Methode von Meta FAIR, die vorgeschlagene maschinelle Lernexperimente miteinander vergleicht, anstatt Ergebnisse vorherzusagen, um zu entscheiden, für welche es sich lohnt, GPU-Zeit zu investieren.

Forschungsagenten können weit mehr Experimente vorschlagen, als sich irgendjemand leisten kann, weil das Vorschlagen Sekunden dauert und das Training Tage dauert. Ein RPM sitzt vor dieser Warteschlange, ordnet die Kandidaten in die richtige Reihenfolge und wählt dann den obersten aus, der tatsächlich ausgeführt wird.

Die Wahl des Designs, die dafür sorgt, dass es funktioniert, ist eine Ablehnung: Es wird nie versucht vorherzusagen, wie gut ein Experiment abschneiden wird, weil sich Sprachmodelle bei der Vorhersage absoluter Zahlen als unzuverlässig erweisen. Der Vergleich zweier Optionen ist eine viel einfachere Frage als die Bewertung einer der beiden Optionen. Dies ist ein Trick, den man sich immer dann zulegen sollte, wenn man ein Model bittet, etwas zu beurteilen.