← Volver a la lista
Percy Liang
Cómo medir los modelos de lenguaje de modo que una medición hecha hoy siga significando algo el año próximo.
HELM salió de su grupo en Stanford: lo más cercano que tiene el lado académico a una tabla pública y contestable de referencia para modelos de lenguaje. La decisión que define el trabajo es que las funciones de puntuación, los conjuntos de datos y las plantillas de prompt están todos abiertos, de modo que se puede discrepar de la metodología en detalle. Esa postura —la metodología como artefacto, no como andamiaje alrededor de un número— es lo que la propia puntuación de ai100 intenta heredar.