HELM salió de su grupo en Stanford: lo más cercano que tiene el lado académico a una tabla pública y contestable de referencia para modelos de lenguaje. La decisión que define el trabajo es que las funciones de puntuación, los conjuntos de datos y las plantillas de prompt están todos abiertos, de modo que se puede discrepar de la metodología en detalle. Esa postura —la metodología como artefacto, no como andamiaje alrededor de un número— es lo que la propia puntuación de ai100 intenta heredar.

Vale la pena seguirlo cuando
se quiere leer una evaluación hecha por alguien que trata el cómo de la puntuación como la contribución en sí misma.
Temas
evaluación holística de LLM; pruebas conductuales de modelos fundacionales; lo que los benchmarks incentivan y lo que ocultan.
Obras clave
HELM (2022, en curso); benchmark de comprensión lectora SQuAD (2016, coautor); Foundation Model Transparency Index (2023, coautor).