Emmanuel Candès
Как построить корректные статистические интервалы неопределённости вокруг предсказаний любой модели — включая языковые модели — без предположения о том, какого распределения ошибок следует ждать.
Candès — одна из основополагающих фигур конформного предсказания, статистического фреймворка, который строит калиброванные интервалы предсказания: гарантированное покрытие истинного значения на заданном уровне доверия без допущений о распределении, лежащем в основе модели. Фреймворк на годы предшествует эпохе LLM и по сути не зависит от конкретной модели, а значит, переносится на языковые модели без модификаций: можно обернуть любую LLM конформным предсказанием и получить строгие утверждения о надёжности её выводов. Для ai100, который сообщает сравнительные оценки по AI-движкам, это статистический фундамент, необходимый, чтобы прикреплять к этим числам настоящие доверительные интервалы, а не полагаться на привычку области сообщать точечные оценки так, будто это факты.