1. Akari Asai Как языковая модель решает, что её собственного внутреннего знания недостаточно и вместо него нужно обратиться к внешнему источнику. Генерация с поиском (RAG) Методология оценки
  2. Amir Globerson Использует одну языковую модель как адверсариального оппонента-допросчика для другой, чтобы выявлять фактологические ошибки, которые ни одна из них не нашла бы в одиночку. Галлюцинации и фактологичность Методология оценки
  3. Ari Holtzman Как языковые модели на самом деле генерируют текст из своих вероятностных распределений — и что выбор метода сэмплирования делает с результатами оценки. Методология оценки Основоположники
  4. Ashish Sabharwal Что классические исследования формального рассуждения могут дать оценке того, действительно ли современные LLM рассуждают, — и как отличить это от языка, похожего на рассуждение, который просто случайно приводит к правильному ответу. Рассуждение и декомпозиция Основоположники
  5. Benno Stein Создание инфраструктуры оценки, которая превращает разногласия исследователей в технически разрешимую задачу. Прозрачность и управление Информационный поиск Методология оценки
  6. Björn Schuller Что языковая технология должна оценивать, когда входом является не текст, а речь — включая эмоциональные, паралингвистические и индивидуальные речевые сигналы, которые текстовые методы отбрасывают. Безопасность и устойчивость Речь и мультимодальность Методология оценки
  7. Charles L. A. Clarke Что требуется для систематической, воспроизводимой оценки вопросно-ответных систем теперь, когда оцениваемые системы — языковые модели, а не ретриверы. Информационный поиск Методология оценки
  8. Chelsea Finn Как языковые и обучающиеся системы адаптируются к новой задаче по очень малому числу примеров — и что теоретическая структура этой адаптации говорит о том, чему они на самом деле научились или не научились. Рассуждение и декомпозиция Системы и масштабирование Основоположники
  9. Chris Callison-Burch Могут ли читатели отличить текст, созданный языковой моделью, от текста, написанного человеком, — и как эта различимость снижается по мере улучшения моделей. Многоязычная оценка Методология оценки Основоположники
  10. Christof Monz Систематическая ежегодная оценка машинного перевода по десяткам языковых пар — и то, что такое отслеживание показывает о решаемых и нерешаемых проблемах перевода. Многоязычная оценка Методология оценки
  11. Christopher Manning Аргумент о том, что смысл — в том виде, в каком люди употребляют это слово, — не является тем, чем оперируют большие языковые модели. Методология оценки Интерпретируемость Основоположники
  12. Christopher Potts Какую лингвистическую структуру языковые модели действительно представляют — и какую лишь будто бы представляют. Методология оценки Основоположники
  13. Colin Raffel Может ли одна языковая модель выполнять все NLP-задачи сразу, если все они сформулированы как «текст на вход — текст на выход», — и сохраняется ли это объединение между языками. Многоязычная оценка Основоположники
  14. Dan Jurafsky Превращение обработки естественного языка в дисциплину, которую можно преподавать, — и использование этой перспективы, чтобы понять, где нынешние практики оценки области вписываются в её более долгую историю, а где нет. Методология оценки Основоположники
  15. Danqi Chen Проверяет, действительно ли языковая модель, которая выдаёт ответ со ссылками, основывает этот ответ на этих ссылках — или просто прикрепляет правдоподобные ссылки постфактум. Галлюцинации и фактологичность Генерация с поиском (RAG) Основоположники
  16. David Jurgens Могут ли языковые модели, хорошо справляющиеся с фактологическими вопросами, справляться и с тем социальным знанием, которое определяет, что люди на самом деле имеют в виду, когда что-то говорят. Безопасность и устойчивость Методология оценки Основоположники
  17. Daxin Jiang Как предобучить энкодер так, чтобы его эмбеддинги хорошо работали для поиска — даже если его никогда не обучали на поисковой задаче с разметкой. Генерация с поиском (RAG) Информационный поиск
  18. Diyi Yang Как языковые модели ведут себя, когда задача социальная, а не информационная — убеждение, поддержка, конфликт, вежливость. Методология оценки Диалог и агенты
  19. Dragan Gašević Действительно ли AI-инструменты, используемые в образовательных контекстах, помогают тем учащимся, для которых они построены, — и какая инфраструктура оценки нужна для этого сверх обычных ML-benchmark-ов. Прозрачность и управление Методология оценки Основоположники
  20. Ee-Peng Lim Улучшает ли рассуждение просьба к языковой модели сначала составить план решения, по сравнению с простой инструкцией думать step by step. Рассуждение и декомпозиция Методология оценки
  21. Emma Strubell Должны ли вычислительные и энергетические затраты на обучение и обслуживание языковых моделей попадать в заголовок оценки — туда, где сейчас в одиночку стоит точность. Прозрачность и управление Методология оценки
  22. Emmanuel Candès Как построить корректные статистические интервалы неопределённости вокруг предсказаний любой модели — включая языковые модели — без предположения о том, какого распределения ошибок следует ждать. Методология оценки Основоположники
  23. Eric Horvitz Качественная форма возможностей языковых моделей — как они выглядят как феномен и есть ли у нас словарь, чтобы описать их раньше, чем появится методология для измерения. Прозрачность и управление Методология оценки Основоположники
  24. Furu Wei Использует собственное параметрическое знание языковой модели, чтобы поиск находил документ, который пользователь на самом деле пытался найти. Генерация с поиском (RAG) Методология оценки
  25. George J. Pappas Как быстро автоматизированный атакующий может найти prompt-запросы, которые ломают выравнивание (alignment) безопасности языковой модели, — и что это означает для оценки устойчивости модели как таковой. Безопасность и устойчивость Методология оценки
  26. Gideon Mann Как выглядят языковые модели, обученные под одну высокоценную вертикаль — в данном случае финансы, — и какая оценка этой специализации нужна помимо универсальных benchmark. Прозрачность и управление Методология оценки Основоположники
  27. Graham Neubig Соединяет поиск, генерацию и оценку в единую работающую систему — и спрашивает, когда эти соединения действительно держатся. Генерация с поиском (RAG) Методология оценки Диалог и агенты
  28. Hannaneh Hajishirzi Когда языковой модели стоит обратиться к внешнему источнику знаний — и когда её собственной параметрической памяти достаточно. Галлюцинации и фактологичность Прозрачность и управление Методология оценки
  29. Igor Mordatch Что означает оценивать языковую модель, которая через свой текст совершает действия с последствиями, — не только выдаёт ответы, но и действует в средах, которые отвечают. Рассуждение и декомпозиция Системы и масштабирование Диалог и агенты
  30. Ion Stoica Распределённая вычислительная инфраструктура, на которой почти каждую современную LLM либо обучают, либо обслуживают, либо через которую её оценивают. Системы и масштабирование Основоположники
  31. Iryna Gurevych Создание энкодерной инфраструктуры, которая делает операцию «найти предложения, похожие на этот запрос» быстрой и надёжной в разных языках и задачах. Генерация с поиском (RAG) Информационный поиск Основоположники
  32. James Zou Как выглядит оценка, когда оцениваемый AI должен пройти регуляторные планки перед развёртыванием, — и чему общая оценка LLM должна научиться у области, которая занимается этим годами. Прозрачность и управление Методология оценки Основоположники
  33. Jamie Callan Как выглядит генерация с поиском, когда вы действительно знаете тридцатилетнюю историю информационного поиска, которую она заново изобретает. Генерация с поиском (RAG) Информационный поиск Основоположники
  34. Jared Kaplan Является ли функция потерь языковой модели гладкой функцией вычислений, данных и размера модели — и что эта гладкость позволяет предсказывать (и не предсказывать) о способностях на больших масштабах. Системы и масштабирование Методология оценки Основоположники
  35. Jennifer Wortman Vaughan Как люди на самом деле понимают результаты оценки языковых моделей и действуют на их основе — и где проходит разрыв между тем, что было измерено, и тем, во что в итоге поверили. Прозрачность и управление Методология оценки
  36. Jesse Dodge Что должно быть в статье о языковой модели, чтобы другая лаборатория могла проверить результат. Прозрачность и управление Методология оценки
  37. Ji-Rong Wen Организует литературу по LLM в форму, в которой другие исследователи китайскоязычного NLP действительно могут ориентироваться изнутри академической экосистемы. Многоязычная оценка Методология оценки Основоположники
  38. Jian-Guang Lou Производит ли языковая модель, генерирующая код, код, который действительно делает то, что просили, — и как выглядит оценка, когда у корректности наконец есть определённый ответ. Рассуждение и декомпозиция Методология оценки Основоположники
  39. Jian-Yun Nie Как поиск ведёт себя иначе, когда запрос — это разговор на неанглийском языке, и как языковые модели меняют эту картину. Генерация с поиском (RAG) Информационный поиск Многоязычная оценка
  40. Jianfeng Gao Что большие языковые модели представляют собой как класс систем — таксономически, архитектурно и с точки зрения того, что они реально наследуют от более долгой истории нейронного NLP. Методология оценки Основоположники Диалог и агенты
  41. Jie Zhou Можно ли доверять языковым моделям оценивать другие языковые модели в production NLP-конвейерах. Диалог и агенты LLM как судья
  42. Jimmy Lin Делает информационный поиск достаточно воспроизводимым, чтобы исследователь LLM и исследователь IR могли запустить один и тот же эксперимент и получить один и тот же ответ. Генерация с поиском (RAG) Прозрачность и управление Информационный поиск
  43. Jimmy Xiangji Huang Как информационный поиск работает при масштабировании на хаотичные операционные данные, которыми реально располагают организации, в отличие от чистых benchmark-корпусов, на которых область обычно публикует результаты. Информационный поиск Методология оценки
  44. Jindong Wang Что вообще означает «оценивать LLM» как исследовательскую процедуру — и как это стандартизировать. Безопасность и устойчивость Методология оценки
  45. Jochen Wirtz Что происходит, когда AI в клиентском сервисе заменяет, дополняет или начинает конкурировать с людьми в сервисных ролях, — и какая оценка для такого сдвига действительно нужна. Прозрачность и управление Методология оценки Диалог и агенты
  46. Jonathan Berant Действительно ли языковая модель выполняет шаги рассуждения, необходимые для ответа на вопрос, — или просто выдаёт ответ, который случайно оказывается правильным. Рассуждение и декомпозиция Методология оценки
  47. Juanzi Li Объединение структурированного знания из графов знаний со статистическими закономерностями, которые языковые модели извлекают из текста, — и что такая комбинация даёт для оценки. Галлюцинации и фактологичность Генерация с поиском (RAG) Основоположники
  48. Julian McAuley Выполняют ли языковые модели, обученные на открытом вебе, уже сейчас рекомендательную работу — и что это значит для продуктов, конкурирующих с традиционными рекомендательными системами. Информационный поиск Методология оценки Диалог и агенты
  49. Junichi Yamagishi Могут ли человеческие слушатели — или автоматические детекторы — отличить AI-сгенерированную речь от настоящей человеческой, и как эта различимость меняется по мере улучшения синтеза речи. Безопасность и устойчивость Речь и мультимодальность Методология оценки
  50. Jure Leskovec Что графовая структура добавляет к тем задачам рассуждения и поиска, с которыми языковые модели сейчас справляются без неё, — и что теряется, когда отношения в данных сплющивают в текст. Информационный поиск Основоположники
  51. Kevin Chen-Chuan Chang Организует быстро растущую литературу о рассуждении языковых моделей в форму, в которой исследователь, новый для области, действительно может ориентироваться. Рассуждение и декомпозиция Методология оценки
  52. Kyle Lo Что на самом деле находится в обучающем корпусе, когда вы садитесь и смотрите на него документ за документом. Прозрачность и управление Методология оценки
  53. Luke Zettlemoyer Можно ли строить языковые модели с открытыми весами на фронтирном масштабе и можно ли измерять их фактологичность с тонким разрешением. Галлюцинации и фактологичность Основоположники
  54. Maarten de Rijke Должен ли информационный поиск выполняться системой, которая «пишет ID документа», а не системой, которая ищет в векторном индексе. Генерация с поиском (RAG) Информационный поиск
  55. Maarten Sap Могут ли языковые модели производить социальное знание или рассуждать о нём с той же компетентностью, которую они показывают на фактологических задачах, — и что поставлено на карту, когда они не могут. Безопасность и устойчивость Методология оценки Диалог и агенты
  56. Maosong Sun Как выглядит экосистема открытых LLM, когда она вырастает из китайского академического NLP, а не из западных некоммерческих организаций вроде AI2. Прозрачность и управление Многоязычная оценка Основоположники
  57. Marco Baroni Могут ли нейронные языковые модели компоновать выученное в новые комбинации, которых они никогда не видели, — или на самом деле они лишь выполняют сложную интерполяцию внутри обучающего распределения. Рассуждение и декомпозиция Многоязычная оценка Основоположники
  58. Mari Ostendorf Как выглядит языковая технология, когда вы отвечали за неё как за развёртываемую инженерию тридцать лет до того, как LLM пришли переделывать область. Речь и мультимодальность Методология оценки Основоположники
  59. Mark Gales Обнаруживает галлюцинации языковой модели без доступа ни к её весам, ни к эталонным данным. Галлюцинации и фактологичность Речь и мультимодальность
  60. Martin Potthast Можно ли использовать языковые модели, чтобы судить, релевантен ли документ запросу, — и что меняется, когда они заменяют человеческих ассессоров в этой роли. Информационный поиск Методология оценки LLM как судья
  61. Mengnan Du Какие объяснения можно получить для выходов языковой модели — и какие из этих объяснений оказываются надёжными. Интерпретируемость Методология оценки
  62. Michihiro Yasunaga Может ли языковая модель правильно перевести вопрос на естественном языке в точный структурированный запрос — и что такой перевод показывает о рассуждении над знаниями. Рассуждение и декомпозиция Методология оценки
  63. Minlie Huang Переносятся ли категории «вредного», используемые для оценки безопасности языковых моделей, из западного контекста в китайскоязычное развёртывание, где регуляторная рамка и культурные категории устроены иначе. Безопасность и устойчивость Многоязычная оценка Диалог и агенты
  64. Mohit Bansal Продолжают ли работать методы, которыми мы оцениваем модели только для текста, когда той же модели приходится одновременно обрабатывать изображения, речь или другие модальности, — и что ломается первым при их объединении. Речь и мультимодальность Методология оценки Основоположники
  65. Nan Duan Переписывает пользовательский запрос перед поиском так, чтобы у ретривера появился шанс вернуть полезные документы. Генерация с поиском (RAG)
  66. Nathan Lambert Что происходит с языковой моделью между «обучена на интернете» и «отвечает на ваш вопрос именно так» — и как изучать этот шаг публично. Прозрачность и управление Методология оценки
  67. Noah A. Smith Может ли языковая модель производить собственные обучающие данные — и каковы методологические последствия, когда это становится стандартной практикой. Прозрачность и управление Методология оценки Основоположники
  68. Norbert Fuhr Что в оценке информационного поиска десятилетиями делалось неправильно — в опубликованном виде — и почему каждое новое поколение исследователей повторяет те же ошибки. Информационный поиск Методология оценки Основоположники
  69. Omer Levy Может ли языковая модель вывести задачу только из примеров — без явного указания, что делать, — и что эта способность говорит о том, как она представляет инструкции. Рассуждение и декомпозиция Методология оценки Основоположники
  70. Pang Wei Koh Что происходит, когда языковая модель сталкивается с такими данными, которых она не видела при обучении, — и как измерить этот разрыв строго, а не просто заметить его после развёртывания. Безопасность и устойчивость Прозрачность и управление Методология оценки
  71. Paolo Rosso Строит оценочные кампании, которые работают для иберо-романских языков — испанского, каталанского, португальского, — вместо того чтобы переносить англоцентричную методологию и мириться с возникающими слепыми зонами. Безопасность и устойчивость Многоязычная оценка Методология оценки
  72. Pascale Fung Выполняет ли одна и та же языковая модель одну и ту же работу в разных языках — и не вводит ли нас в заблуждение методология оценки, построенная для английского, относительно того, что модели делают во всём остальном. Многоязычная оценка Методология оценки
  73. Percy Liang Как измерять языковые модели так, чтобы измерение, сделанное сегодня, что-то значило и в следующем году. Методология оценки
  74. Peter Henderson Где технические результаты о поведении языковых моделей действительно имеют значение — в аудитах, регулировании и юридической ответственности — и как выглядит разрыв между «мы это измерили» и «это меняет то, что разрешено». Прозрачность и управление Методология оценки
  75. Philip S. Yu Связать четыре десятилетия методологии интеллектуального анализа данных с вопросом о том, как оценивать большие языковые модели, не переизобретая техники, которые у области уже есть. Информационный поиск Методология оценки Основоположники
  76. Prateek Mittal Как визуальные входы становятся новой поверхностью атаки для языковых моделей с выравниванием (alignment) по безопасности, которые принимают мультимодальные запросы. Безопасность и устойчивость Речь и мультимодальность
  77. Qiang Yang Может ли полезное машинное обучение происходить, когда данные, на которых вы обучали бы или оценивали систему, нельзя переместить в одно место — по юридическим причинам, из-за требований приватности или по коммерческим причинам. Прозрачность и управление Методология оценки Основоположники
  78. Quoc V. Le Архитектурные блоки и рецепты обучения, поверх которых была построена современная эпоха LLM. Рассуждение и декомпозиция Основоположники
  79. Rishi Bommasani Что разработчики языковых моделей рассказывают и не рассказывают нам о собственных моделях — и как измерять это систематически. Прозрачность и управление Методология оценки
  80. Roi Reichart Что означает «домен» для языковой модели — когда её обучающее распределение перестаёт совпадать с контекстом применения — и как строго оценивать такое несовпадение. Методология оценки Основоположники
  81. Seungone Kim Может ли у области появиться альтернатива в виде LLM-оценщика с открытыми весами, чтобы «один чёрный ящик судит другой чёрный ящик» перестало быть единственным доступным вариантом. Прозрачность и управление Методология оценки LLM как судья
  82. Shafiq Joty Методология оценки языковых моделей, когда контекст применения — корпоративное ПО, а не исследовательская демонстрация. Методология оценки Диалог и агенты
  83. Shayne Longpre Что на самом деле находится внутри данных, на которых обучаются языковые модели, — и кто может или не может это узнать. Прозрачность и управление Методология оценки
  84. Shinji Watanabe Инфраструктура обработки речи с открытым исходным кодом, которая позволяет академическим и индустриальным группам обучать, оценивать и сравнивать языковые системы с речевым вводом или речевым выводом на равных условиях. Речь и мультимодальность Методология оценки Основоположники
  85. Shuming Shi Как выглядит «галлюцинация языковой модели», когда вы отвечаете за поставку продуктов на базе LLM на поверхность с миллиардом пользователей. Галлюцинации и фактологичность
  86. Steven Schockaert Как оценивать систему генерации с поиском end-to-end, когда каждая её часть может отказывать по-разному. Генерация с поиском (RAG) Методология оценки
  87. Tatsunori Hashimoto Являются ли числа, которые сообщают о языковых моделях, статистическими результатами или методологическими артефактами. Методология оценки
  88. Tom Mitchell Есть ли у языковой модели внутреннее представление о том, говорит ли она правду, — отделимое от того, что она фактически выводит наружу. Галлюцинации и фактологичность Интерпретируемость Основоположники
  89. Torsten Hoefler Обобщение рассуждений языковых моделей за пределы линейных цепочек рассуждений — к ветвлению, откату и рекомбинации промежуточных шагов рассуждения. Рассуждение и декомпозиция Системы и масштабирование
  90. Tushar Khot Что «способность к рассуждению» означает как объект, который можно поместить в benchmark, — и что меняется, когда вы также пытаетесь направлять модель к рассуждению через структурированный prompting. Рассуждение и декомпозиция Методология оценки
  91. Wayne Xin Zhao Синтетическая сторона исследований LLM — что нужно, чтобы прочитать все актуальные статьи момента и произвести что-то, в чём другие исследователи смогут ориентироваться. Информационный поиск Методология оценки Основоположники
  92. Weijia Shi Как заставить генерацию с поиском работать, когда сама языковая модель — закрытый чёрный ящик, который нельзя дообучить. Генерация с поиском (RAG) Информационный поиск
  93. Wen-tau Yih Делает этап поиска внутри систем генерации с поиском достаточно хорошим, чтобы этапу генерации было с чем работать. Галлюцинации и фактологичность Генерация с поиском (RAG) Информационный поиск
  94. Wenjie Li Как генеративный поиск соотносится с другими задачами генерации — суммаризацией и ответами на вопросы, — которые приходится решать той же системной архитектуре. Генерация с поиском (RAG) Информационный поиск
  95. Xia Hu Можно ли передовой академический уровень по языковым моделям превратить во что-то, что практик — а не исследовательская лаборатория — действительно сможет внедрить и чему сможет доверять. Методология оценки Интерпретируемость Основоположники
  96. Xing Xie Связывает традицию рекомендательных систем, где измеряют поведение пользовательского AI, с новыми вызовами оценки, которые ставят современные LLM. Информационный поиск Методология оценки Основоположники
  97. Xipeng Qiu Строит открытую китайскоязычную большую языковую модель, которую академическое сообщество действительно может изучать изнутри, — и инструменты вокруг неё. Многоязычная оценка Основоположники
  98. Xueqi Cheng Что утверждали исследования информационного поиска изнутри китайской IR-традиции — и чем их взгляд на генеративный поиск отличается от западного канона. Генерация с поиском (RAG) Информационный поиск
  99. Yang Liu Можно ли использовать более сильную языковую модель для оценки результатов более слабой — и как делать это, не обманывая себя. Методология оценки LLM как судья
  100. Yann LeCun Какими должны быть системы машинного обучения — в противовес тому, чем они являются сейчас. Рассуждение и декомпозиция Основоположники
  101. Yarin Gal Количественно оценивать, когда языковые модели не знают, что говорят. Галлюцинации и фактологичность Методология оценки
  102. Yejin Choi Что потребовалось бы, чтобы у языковой модели появилось то, чего у людей с избытком и чего LLM стабильно не хватает, — здравый смысл. Рассуждение и декомпозиция Методология оценки Основоположники
  103. Yoav Goldberg Является ли цепочка рассуждений, которую выдаёт языковая модель, той цепочкой рассуждений, которой она действительно следовала. Галлюцинации и фактологичность Интерпретируемость Основоположники
  104. Yoav Shoham Что можно измерить о состоянии AI извне любой отдельной компании — и как выглядит дополнение поиском, когда ничего не нужно переобучать. Генерация с поиском (RAG) Прозрачность и управление Основоположники
  105. Yonatan Belinkov Что на самом деле находится в скрытых представлениях языковой модели — и какие из этих внутренних состояний соответствуют тому, что человек назвал бы знанием. Интерпретируемость Методология оценки
  106. Yue Zhang Разводит то, что область называет «галлюцинацией», на категории, которые действительно означают разные вещи. Галлюцинации и фактологичность Методология оценки
  107. Yulia Tsvetkov Как предвзятость и вред выглядят в выводах языковых моделей на разных языках — особенно для языков и сообществ, которые стандартная оценка области исторически игнорировала. Безопасность и устойчивость Многоязычная оценка Методология оценки
  108. Zhaochun Ren Можно ли доверить языковой модели работу, которую сейчас выполняет система информационного поиска, — и какие части этой работы у неё действительно получаются. Генерация с поиском (RAG) Информационный поиск
  109. Zhiting Hu Рассматривать языковую модель как один компонент более крупной системы планирования — вместо того чтобы просить её выполнять рассуждение end-to-end у себя «в голове». Рассуждение и декомпозиция Диалог и агенты