FrontierCode
Ein Coding-Benchmark von Cognition, der die Qualität des Produktionscodes bewertet und nicht, ob er nur ausgeführt wird.
FrontierCode ist ein von Cognition entwickelter Benchmark, der Code so beurteilt, wie es ein Kollege, der einen Pull-Request überprüft, tun würde: Er funktioniert nicht nur, sondern ist es auch die Art von Code, die Sie in einem echten Projekt wünschen würden. Das ist eine höhere Messlatte als bei den älteren Tests, bei denen hauptsächlich überprüft wurde, ob eine kleine Funktion die richtige Ausgabe liefert.
Es taucht ständig in Modellankündigungen auf, weil der Unterschied zwischen „produziert funktionierenden Code“ und „produziert Code, der es wert ist, behalten zu werden“ genau dort liegt, wo die aktuelle Konkurrenz sitzt. Werte im Vierzigerbereich sind für starke Modelle normal, was ein nützlicher Realitätscheck gegen Behauptungen ist, dass die KI mit dem Schreiben von Software fertig ist.