Seungone Kim
Si el campo puede contar con una alternativa de evaluador de LLM con pesos abiertos, para que «una caja negra juzgando a otra caja negra» deje de ser la única opción disponible.
La práctica estándar para puntuar modelos de lenguaje consiste en pedir a GPT-4 o a otro gran modelo cerrado que califique las salidas; el método funciona, pero es metodológicamente endeble de una forma que empeora con el tiempo. Reproducir un resultado dentro de dos años será imposible, porque el juez es un servicio cerrado con un ciclo de publicación opaco y actualizaciones periódicas de pesos. Prometheus y Prometheus 2 de Kim (autor principal, 2023–24) son un intento de dar a la comunidad un análogo abierto: un evaluador con pesos conocidos y un procedimiento de entrenamiento documentado, frente al cual la verificación independiente sí es posible.