LMArena
Una clasificación pública que ordena modelos de IA preguntando a la gente cuál de dos respuestas anónimas prefiere.
LMArena, antes Chatbot Arena, clasifica modelos por voto popular. Usted recibe la misma consulta respondida por dos modelos sin saber cuál es cuál, elige la mejor, y miles de esos votos se convierten en una puntuación Elo, el mismo sistema que se usa en ajedrez. Hay arenas separadas para texto, generación de imágenes y edición de imágenes.
Su fortaleza es que nadie puede empollar para ella, a diferencia de una prueba fija cuyas preguntas pueden filtrarse a los datos de entrenamiento. Su debilidad se deriva de lo que mide en realidad: qué respuesta prefiere la gente a primera vista. Eso premia una salida segura de sí misma, bien formateada y complaciente, y dice poco sobre si el contenido es correcto. Las diferencias pequeñas en la cabeza son sobre todo ruido, así que un modelo segundo por 20 puntos Elo no es significativamente peor que el primero.