La práctica estándar para puntuar modelos de lenguaje consiste en pedir a GPT-4 o a otro gran modelo cerrado que califique las salidas; el método funciona, pero es metodológicamente endeble de una forma que empeora con el tiempo. Reproducir un resultado dentro de dos años será imposible, porque el juez es un servicio cerrado con un ciclo de publicación opaco y actualizaciones periódicas de pesos. Prometheus y Prometheus 2 de Kim (autor principal, 2023–24) son un intento de dar a la comunidad un análogo abierto: un evaluador con pesos conocidos y un procedimiento de entrenamiento documentado, frente al cual la verificación independiente sí es posible.

Vale la pena seguirlo cuando
se planea evaluar LLM en investigación que debe seguir siendo reproducible, y se entiende que usar GPT como juez ata esa ciencia a la hoja de ruta de producto de otra persona.
Temas
evaluadores de LLM con pesos abiertos como alternativas a jueces cerrados; qué compara realmente un transformer cuando «puntúa» a otro; los límites del LLM como juez como metodología.
Obras clave
Prometheus (2023, autor principal); Prometheus 2 (2024, autor principal); CoT Collection (2023, autor principal).