FrontierCode
Un benchmark di codifica di Cognition che valuta la qualità del codice di produzione anziché semplicemente la sua esecuzione.
FrontierCode è un benchmark creato da Cognition che giudica il codice come farebbe un collega che esamina una richiesta pull: non solo funziona, ma è il tipo di codice che vorresti in un progetto reale. Si tratta di un livello più alto rispetto ai test più vecchi, che verificavano principalmente se una piccola funzione produceva l’output corretto.
Si presenta costantemente negli annunci dei modelli perché la differenza tra “produce codice funzionante” e “produce codice che vale la pena conservare” è esattamente dove si trova la concorrenza attuale. I punteggi intorno ai quaranta sono normali per modelli forti, il che costituisce un utile controllo della realtà rispetto alle affermazioni secondo cui l’intelligenza artificiale ha terminato il lavoro di scrittura del software.