1. Akari Asai Wie ein Sprachmodell entscheidet, dass sein eigenes internes Wissen nicht ausreicht und dass es stattdessen zu einer externen Quelle greifen sollte. Retrieval-augmentierte Generierung (RAG) Bewertungsmethodik
  2. Amir Globerson Ein Sprachmodell als adversariellen Befrager eines anderen zu nutzen, um faktische Fehler sichtbar zu machen, die keines der beiden allein finden könnte. Halluzination und Faktentreue Bewertungsmethodik
  3. Ari Holtzman Wie Sprachmodelle tatsächlich Text aus ihren Wahrscheinlichkeitsverteilungen generieren — und was die Wahl des Sampling-Verfahrens mit Evaluationsergebnissen macht. Grundlegende Persönlichkeiten Bewertungsmethodik
  4. Ashish Sabharwal Was klassische Forschung zu formalem logischem Schließen (Reasoning) dazu beitragen kann, zu evaluieren, ob moderne LLMs tatsächlich logisch schließen — und wie man das von Sprache unterscheidet, die nur nach Reasoning aussieht und zufällig bei der richtigen Antwort landet. Grundlegende Persönlichkeiten Schlussfolgern und Zerlegung
  5. Benno Stein Evaluationsinfrastruktur zu bauen, die Uneinigkeit unter Forschenden in etwas technisch Auflösbares verwandelt. Transparenz und Governance Information Retrieval Bewertungsmethodik
  6. Björn Schuller Was Sprachtechnologie evaluieren muss, wenn die Eingabe nicht Text, sondern gesprochene Sprache ist — einschließlich der emotionalen, paralinguistischen und individuellen Sprechersignale, die text-only-Methoden verwerfen. Sprache und Multimodalität Sicherheit und Robustheit Bewertungsmethodik
  7. Charles L. A. Clarke Was systematische, replizierbare Evaluation von Frage-Antwort-Systemen verlangt — jetzt, da die zu evaluierenden Systeme Sprachmodelle und nicht Retriever sind. Information Retrieval Bewertungsmethodik
  8. Chelsea Finn Wie Sprach- und Lernsysteme sich mit sehr wenigen Beispielen an eine neue Aufgabe anpassen — und was die theoretische Struktur dieser Anpassung darüber aussagt, was sie tatsächlich gelernt oder nicht gelernt haben. Grundlegende Persönlichkeiten Schlussfolgern und Zerlegung Systeme und Skalierung
  9. Chris Callison-Burch Ob menschliche Leser Text, den ein Sprachmodell erzeugt hat, von Text unterscheiden können, den Menschen verfasst haben — und wie diese Unterscheidbarkeit abnimmt, wenn Modelle besser werden. Grundlegende Persönlichkeiten Mehrsprachige Bewertung Bewertungsmethodik
  10. Christof Monz Jahr für Jahr systematische Evaluation maschineller Übersetzung über Dutzende von Sprachpaaren hinweg — und was diese Nachverfolgung darüber zeigt, welche Übersetzungsprobleme gelöst werden und welche nicht. Mehrsprachige Bewertung Bewertungsmethodik
  11. Christopher Manning Das Argument, dass Bedeutung, wie Menschen das Wort verwenden, nicht das ist, womit große Sprachmodelle arbeiten. Grundlegende Persönlichkeiten Interpretierbarkeit Bewertungsmethodik
  12. Christopher Potts Welche linguistische Struktur Sprachmodelle tatsächlich repräsentieren — und welche sie nur zu repräsentieren scheinen. Grundlegende Persönlichkeiten Bewertungsmethodik
  13. Colin Raffel Ob ein einziges Sprachmodell alle NLP-Aufgaben gleichzeitig bearbeiten kann, wenn sie alle als Text-in-Text-out gerahmt werden — und ob diese Vereinheitlichung über Sprachen hinweg trägt. Grundlegende Persönlichkeiten Mehrsprachige Bewertung
  14. Dan Jurafsky Natural Language Processing zu einer lehrbaren Disziplin zu machen — und aus dieser Perspektive zu lesen, wo die aktuellen Evaluationspraktiken des Feldes in seine längere Geschichte passen und wo nicht. Grundlegende Persönlichkeiten Bewertungsmethodik
  15. Danqi Chen Ob ein Sprachmodell, das eine Antwort mit Zitaten erzeugt, die Antwort tatsächlich in diesen Zitaten fundiert — oder nur nachträglich plausible Referenzen anheftet. Retrieval-augmentierte Generierung (RAG) Grundlegende Persönlichkeiten Halluzination und Faktentreue
  16. David Jurgens Ob Sprachmodelle, die faktische Fragen sauber behandeln, auch jene Art sozialen Wissens bewältigen können, die bestimmt, was Menschen eigentlich meinen, wenn sie etwas sagen. Grundlegende Persönlichkeiten Sicherheit und Robustheit Bewertungsmethodik
  17. Daxin Jiang Wie man einen Encoder so vortrainiert, dass die Embeddings, die er erzeugt, für Retrieval gut geeignet sind — ohne jemals auf einer Retrieval-Aufgabe überwacht trainiert zu werden. Retrieval-augmentierte Generierung (RAG) Information Retrieval
  18. Diyi Yang Wie Sprachmodelle sich verhalten, wenn die Aufgabe sozial statt informativ ist — Überzeugung, Unterstützung, Konflikt, Höflichkeit. Bewertungsmethodik Dialog und Agenten
  19. Dragan Gašević Ob KI-Tools im Bildungsbereich den Lernenden, für die sie gebaut sind, tatsächlich helfen — und welche Evaluationsinfrastruktur diese Frage jenseits konventioneller ML-Benchmarks erfordert. Grundlegende Persönlichkeiten Transparenz und Governance Bewertungsmethodik
  20. Ee-Peng Lim Ob ein Sprachmodell, das gebeten wird, vor dem Lösen eines Problems einen Plan zu erstellen, besseres logisches Schließen (Reasoning) erzeugt, als ihm zu sagen, Schritt für Schritt zu denken. Schlussfolgern und Zerlegung Bewertungsmethodik
  21. Emma Strubell Ob die Rechen- und Energiekosten des Trainings und Servings von Sprachmodellen in die Überschrift einer Evaluation gehören, wo derzeit die Genauigkeit allein steht. Transparenz und Governance Bewertungsmethodik
  22. Emmanuel Candès Wie man gültige statistische Unsicherheitsintervalle um die Vorhersagen eines beliebigen Modells legt — einschließlich Sprachmodellen — ohne anzunehmen, welche Fehlerverteilung zu erwarten ist. Grundlegende Persönlichkeiten Bewertungsmethodik
  23. Eric Horvitz Die qualitative Gestalt von Sprachmodellfähigkeiten — wie sie als Phänomen aussehen und ob wir das Vokabular haben, sie zu beschreiben, bevor wir die Methodik haben, sie zu messen. Grundlegende Persönlichkeiten Transparenz und Governance Bewertungsmethodik
  24. Furu Wei Das parametrische Wissen eines Sprachmodells zu nutzen, damit Retrieval das Dokument findet, das der Nutzer eigentlich gesucht hat. Retrieval-augmentierte Generierung (RAG) Bewertungsmethodik
  25. George J. Pappas Wie schnell ein automatisierter Angreifer prompts finden kann, die das Sicherheits-Alignment eines Sprachmodells brechen — und was das für die Bewertung von Modellrobustheit als solcher bedeutet. Sicherheit und Robustheit Bewertungsmethodik
  26. Gideon Mann Wie Sprachmodelle aussehen, wenn sie für eine einzige hochwertige Vertikale trainiert werden — in diesem Fall Finanzwesen — und welche Evaluation diese Spezialisierung jenseits allgemeiner Benchmarks erfordert. Grundlegende Persönlichkeiten Transparenz und Governance Bewertungsmethodik
  27. Graham Neubig Retrieval, Generierung und Evaluation zu einem einzigen funktionierenden System zu verbinden — und zu fragen, wann diese Verbindungen tatsächlich halten. Retrieval-augmentierte Generierung (RAG) Bewertungsmethodik Dialog und Agenten
  28. Hannaneh Hajishirzi Wann ein Sprachmodell auf eine externe Wissensquelle zurückgreifen sollte — und wann sein eigenes parametrisches Gedächtnis genügt. Halluzination und Faktentreue Transparenz und Governance Bewertungsmethodik
  29. Igor Mordatch Was es bedeutet, ein Sprachmodell zu evaluieren, das durch seinen Text folgenreiche Handlungen ausführt — nicht nur Antworten produziert, sondern in Umgebungen operiert, die reagieren. Schlussfolgern und Zerlegung Systeme und Skalierung Dialog und Agenten
  30. Ion Stoica Die Infrastruktur für verteiltes Rechnen, auf der fast jedes moderne LLM entweder trainiert, bereitgestellt oder evaluiert wird. Grundlegende Persönlichkeiten Systeme und Skalierung
  31. Iryna Gurevych Die Encoder-Infrastruktur zu bauen, die „Sätze finden, die dieser Anfrage ähnlich sind“ über Sprachen und Aufgaben hinweg zu einer schnellen und zuverlässigen Operation macht. Retrieval-augmentierte Generierung (RAG) Grundlegende Persönlichkeiten Information Retrieval
  32. James Zou Wie Evaluation aussieht, wenn die bewertete KI vor dem Deployment regulatorische Hürden nehmen muss — und was allgemeine LLM-Evaluation von einem Feld lernen sollte, das dies seit Jahren tut. Grundlegende Persönlichkeiten Transparenz und Governance Bewertungsmethodik
  33. Jamie Callan Wie retrieval-augmentierte Generierung aussieht, wenn man die dreißigjährige Geschichte des Information Retrieval, die sie neu erfindet, tatsächlich kennt. Retrieval-augmentierte Generierung (RAG) Grundlegende Persönlichkeiten Information Retrieval
  34. Jared Kaplan Ob der Loss eines Sprachmodells eine glatte Funktion von Compute, Daten und Modellgröße ist — und was diese Glattheit erlaubt, über Fähigkeiten bei größerem Maßstab vorherzusagen (und nicht vorherzusagen). Grundlegende Persönlichkeiten Systeme und Skalierung Bewertungsmethodik
  35. Jennifer Wortman Vaughan Wie Menschen Ergebnisse der Sprachmodell-Evaluation tatsächlich verstehen und in Handlungen übersetzen — und wo die Lücke zwischen dem liegt, was gemessen wurde, und dem, was geglaubt wird. Transparenz und Governance Bewertungsmethodik
  36. Jesse Dodge Was in einem Paper über ein Sprachmodell stehen muss, damit ein anderes Lab das Ergebnis überprüfen kann. Transparenz und Governance Bewertungsmethodik
  37. Ji-Rong Wen Die LLM-Literatur so zu ordnen, dass andere chinesischsprachige NLP-Forscher sie aus dem akademischen Ökosystem heraus tatsächlich navigieren können. Grundlegende Persönlichkeiten Mehrsprachige Bewertung Bewertungsmethodik
  38. Jian-Guang Lou Ob ein Sprachmodell, das Code erzeugt, tatsächlich Code erzeugt, der tut, was die Anfrage verlangt hat — und wie Evaluation aussieht, wenn Korrektheit ausnahmsweise eine eindeutige Antwort hat. Grundlegende Persönlichkeiten Schlussfolgern und Zerlegung Bewertungsmethodik
  39. Jian-Yun Nie Wie Suche sich anders verhält, wenn die Anfrage ein Gespräch in einer nicht-englischen Sprache ist — und wie Sprachmodelle dieses Bild verändern. Retrieval-augmentierte Generierung (RAG) Mehrsprachige Bewertung Information Retrieval
  40. Jianfeng Gao Was große Sprachmodelle als Systemklasse sind — taxonomisch, architektonisch und im Hinblick darauf, was sie tatsächlich aus der längeren Geschichte des neuronalen NLP erben. Grundlegende Persönlichkeiten Bewertungsmethodik Dialog und Agenten
  41. Jie Zhou Ob Sprachmodellen zuzutrauen ist, andere Sprachmodelle in produktiven NLP-Pipelines zu evaluieren. LLM-as-Judge-Methodik Dialog und Agenten
  42. Jimmy Lin Information Retrieval so reproduzierbar zu machen, dass ein LLM-Forscher und ein IR-Forscher dasselbe Experiment ausführen und dieselbe Antwort erhalten können. Retrieval-augmentierte Generierung (RAG) Transparenz und Governance Information Retrieval
  43. Jimmy Xiangji Huang Wie Information Retrieval über die unordentlichen Betriebsdaten skaliert, die reale Organisationen besitzen — im Gegensatz zu den sauberen Benchmark-Korpora, auf denen das Feld tatsächlich publiziert. Information Retrieval Bewertungsmethodik
  44. Jindong Wang Zu standardisieren, was „ein LLM evaluieren“ als Forschungsprozedur überhaupt bedeutet. Sicherheit und Robustheit Bewertungsmethodik
  45. Jochen Wirtz Was passiert, wenn kundennahe Service-KI menschliche Servicekräfte ersetzt, ergänzt oder mit ihnen konkurriert — und welche Arten von Evaluation diese Veränderung tatsächlich erfordert. Transparenz und Governance Bewertungsmethodik Dialog und Agenten
  46. Jonathan Berant Ob ein Sprachmodell tatsächlich die Schritte des logischen Schließens (Reasoning) ausführt, die nötig sind, um eine Frage zu beantworten — oder nur eine Antwort produziert, die zufällig richtig ist. Schlussfolgern und Zerlegung Bewertungsmethodik
  47. Juanzi Li Strukturiertes Wissen aus Knowledge Graphs mit den statistischen Mustern zu verbinden, die Sprachmodelle aus Text lernen — und was diese Kombination für Evaluation bringt. Retrieval-augmentierte Generierung (RAG) Grundlegende Persönlichkeiten Halluzination und Faktentreue
  48. Julian McAuley Ob Sprachmodelle, die auf dem offenen Web trainiert wurden, bereits Empfehlungen erzeugen — und was das für Produkte bedeutet, die mit traditionellen Recommendern konkurrieren. Information Retrieval Dialog und Agenten Bewertungsmethodik
  49. Junichi Yamagishi Ob menschliche Hörer — oder automatisierte Detektoren — KI-generierte gesprochene Sprache von echter menschlicher Sprache unterscheiden können, und wie sich diese Unterscheidbarkeit verändert, wenn Sprachsynthese besser wird. Sprache und Multimodalität Sicherheit und Robustheit Bewertungsmethodik
  50. Jure Leskovec Was Graphstruktur zu den Arten von logischem Schließen (Reasoning) und Retrieval-Problemen beiträgt, die Sprachmodelle derzeit ohne sie bearbeiten — und was übersehen wird, wenn Beziehungen in Daten zu Text verflacht werden. Grundlegende Persönlichkeiten Information Retrieval
  51. Kevin Chen-Chuan Chang Die rasant wachsende Literatur zum logischen Schließen (Reasoning) von Sprachmodellen so zu ordnen, dass ein neu einsteigender Forscher sich darin tatsächlich orientieren kann. Schlussfolgern und Zerlegung Bewertungsmethodik
  52. Kyle Lo Was tatsächlich in einem Trainingskorpus steckt, wenn man sich hinsetzt und ihn Dokument für Dokument ansieht. Transparenz und Governance Bewertungsmethodik
  53. Luke Zettlemoyer Ob Sprachmodelle mit offenen Gewichten im Frontier-Maßstab gebaut werden können und ob ihre Faktentreue mit feiner Auflösung gemessen werden kann. Halluzination und Faktentreue Grundlegende Persönlichkeiten
  54. Maarten de Rijke Ob Information Retrieval von einem System erledigt werden sollte, das die „Dokument-ID schreibt“, statt von einem, das einen Vektorindex durchsucht. Retrieval-augmentierte Generierung (RAG) Information Retrieval
  55. Maarten Sap Ob Sprachmodelle soziales Wissen mit derselben Kompetenz erzeugen oder darüber logisch schließen können, wie sie sie bei faktischen Aufgaben zeigen — und was auf dem Spiel steht, wenn sie es nicht können. Sicherheit und Robustheit Bewertungsmethodik Dialog und Agenten
  56. Maosong Sun Wie das offene LLM-Ökosystem aussieht, wenn es aus chinesischem akademischem NLP heraus wächst statt aus westlichen Nonprofits wie AI2. Grundlegende Persönlichkeiten Transparenz und Governance Mehrsprachige Bewertung
  57. Marco Baroni Ob neuronale Sprachmodelle Gelerntes zu neuen Kombinationen zusammensetzen können, die sie nie gesehen haben — oder ob sie in Wahrheit nur ausgefeilt innerhalb ihrer Trainingsverteilung interpolieren. Grundlegende Persönlichkeiten Schlussfolgern und Zerlegung Mehrsprachige Bewertung
  58. Mari Ostendorf Wie Sprachtechnologie aussieht, wenn man sie dreißig Jahre lang als deploybares Engineering verantwortet hat, bevor LLMs kamen, um das Feld neu zu schreiben. Grundlegende Persönlichkeiten Sprache und Multimodalität Bewertungsmethodik
  59. Mark Gales Halluzinationen in einem Sprachmodell zu erkennen, ohne Zugriff auf seine Gewichte oder auf Ground Truth zu haben. Halluzination und Faktentreue Sprache und Multimodalität
  60. Martin Potthast Ob Sprachmodelle genutzt werden können, um zu beurteilen, ob ein Dokument für eine Anfrage relevant ist — und was sich ändert, wenn sie in dieser Rolle menschliche Assessoren ersetzen. Information Retrieval LLM-as-Judge-Methodik Bewertungsmethodik
  61. Mengnan Du Welche Arten von Erklärungen für Outputs von Sprachmodellen gewonnen werden können — und welche dieser Erklärungen sich als verlässlich erweisen. Interpretierbarkeit Bewertungsmethodik
  62. Michihiro Yasunaga Ob ein Sprachmodell eine natürlichsprachliche Frage korrekt in eine präzise strukturierte Abfrage übersetzen kann — und was diese Übersetzung über logisches Schließen (Reasoning) über Wissen verrät. Schlussfolgern und Zerlegung Bewertungsmethodik
  63. Minlie Huang Ob die Kategorien von „schädlich“, die zur Bewertung der Sicherheit von Sprachmodellen genutzt werden, aus westlichen in chinesischsprachige Deployment-Kontexte übertragbar sind, in denen der regulatorische Rahmen und die kulturellen Kategorien anders sind. Sicherheit und Robustheit Mehrsprachige Bewertung Dialog und Agenten
  64. Mohit Bansal Ob die Methoden, mit denen wir reine Sprachmodelle evaluieren, noch funktionieren, wenn dasselbe Modell gleichzeitig Bilder, gesprochene Sprache oder andere Modalitäten verarbeiten muss — und was zuerst versagt, wenn Modalitäten kombiniert werden. Grundlegende Persönlichkeiten Sprache und Multimodalität Bewertungsmethodik
  65. Nan Duan Die Anfrage des Nutzers vor dem Retrieval umzuschreiben, damit der Retriever überhaupt eine Chance hat, nützliche Dokumente zurückzugeben. Retrieval-augmentierte Generierung (RAG)
  66. Nathan Lambert Was mit einem Sprachmodell zwischen „auf Internetdaten trainiert“ und „beantwortet eine Frage so, wie es sie beantwortet“ geschieht — und wie man diesen Schritt öffentlich untersucht. Transparenz und Governance Bewertungsmethodik
  67. Noah A. Smith Ob ein Sprachmodell seine eigenen Trainingsdaten erzeugen kann — und welche methodischen Folgen es hat, wenn das zur Standardpraxis wird. Grundlegende Persönlichkeiten Transparenz und Governance Bewertungsmethodik
  68. Norbert Fuhr Was die Evaluation im Information Retrieval seit mehreren Jahrzehnten nachweislich falsch macht — und warum jede neue Forschergeneration dieselben Fehler wiederholt. Grundlegende Persönlichkeiten Information Retrieval Bewertungsmethodik
  69. Omer Levy Ob ein Sprachmodell eine Aufgabe allein aus Beispielen erschließen kann — ohne dass ihm gesagt wird, was es tun soll — und was diese Fähigkeit darüber verrät, wie es Instruktionen repräsentiert. Grundlegende Persönlichkeiten Schlussfolgern und Zerlegung Bewertungsmethodik
  70. Pang Wei Koh Was passiert, wenn ein Sprachmodell auf Daten trifft, wie es sie im Training nicht gesehen hat — und wie man diese Lücke rigoros misst, statt sie erst nach dem Deployment zu bemerken. Transparenz und Governance Sicherheit und Robustheit Bewertungsmethodik
  71. Paolo Rosso Evaluationskampagnen aufzubauen, die für iberoromanische Sprachen funktionieren — Spanisch, Katalanisch, Portugiesisch — statt englischzentrierte Methodik zu übertragen und die daraus entstehenden blinden Flecken hinzunehmen. Sicherheit und Robustheit Mehrsprachige Bewertung Bewertungsmethodik
  72. Pascale Fung Ob dasselbe Sprachmodell über verschiedene Sprachen hinweg dieselbe Art von Arbeit leistet — und ob Bewertungsmethodik, die für Englisch gebaut wurde, uns darüber täuscht, was Modelle in allen anderen Sprachen tun. Mehrsprachige Bewertung Bewertungsmethodik
  73. Percy Liang Wie man Sprachmodelle so misst, dass eine heute vorgenommene Messung auch im nächsten Jahr noch etwas bedeutet. Bewertungsmethodik
  74. Peter Henderson Wo technische Befunde über das Verhalten von Sprachmodellen tatsächlich relevant werden — in Audits, Regulierung und rechtlicher Haftung — und wie die Lücke zwischen „wir haben das gemessen“ und „das ändert, was erlaubt ist“ aussieht. Transparenz und Governance Bewertungsmethodik
  75. Philip S. Yu Vier Jahrzehnte Data-Mining-Methodik mit der Frage zu verbinden, wie große Sprachmodelle evaluiert werden können, ohne Techniken neu zu erfinden, die das Feld bereits besitzt. Grundlegende Persönlichkeiten Information Retrieval Bewertungsmethodik
  76. Prateek Mittal Wie visuelle Eingaben zu einer neuen Angriffsfläche für sicherheitsausgerichtete Sprachmodelle werden, die multimodale Anfragen akzeptieren. Sprache und Multimodalität Sicherheit und Robustheit
  77. Qiang Yang Ob nützliches maschinelles Lernen möglich ist, wenn die Daten, auf denen trainiert oder evaluiert würde, nicht an einen einzigen Ort bewegt werden können — aus rechtlichen, Datenschutz- oder kommerziellen Gründen. Grundlegende Persönlichkeiten Transparenz und Governance Bewertungsmethodik
  78. Quoc V. Le Die architektonischen und trainingsrezeptartigen Bausteine, auf denen die moderne LLM-Ära aufgebaut wurde. Grundlegende Persönlichkeiten Schlussfolgern und Zerlegung
  79. Rishi Bommasani Was Entwickler von Sprachmodellen über ihre eigenen Modelle mitteilen und was nicht — und wie man das systematisch misst. Transparenz und Governance Bewertungsmethodik
  80. Roi Reichart Was „Domäne“ für ein Sprachmodell bedeutet — wenn seine Trainingsverteilung nicht mehr zum Einsatzkontext passt — und wie man diese Diskrepanz rigoros evaluiert. Grundlegende Persönlichkeiten Bewertungsmethodik
  81. Seungone Kim Ob das Feld eine LLM-Evaluator-Alternative mit offenen Gewichten bekommen kann, damit „eine Blackbox bewertet eine andere Blackbox“ nicht die einzige verfügbare Option bleibt. Transparenz und Governance LLM-as-Judge-Methodik Bewertungsmethodik
  82. Shafiq Joty Bewertungsmethodik für Sprachmodelle, wenn der Einsatzkontext Enterprise-Software ist und nicht eine Forschungsdemo. Bewertungsmethodik Dialog und Agenten
  83. Shayne Longpre Was tatsächlich in den Daten steckt, auf denen Sprachmodelle trainieren — und wer das erkennen kann oder nicht. Transparenz und Governance Bewertungsmethodik
  84. Shinji Watanabe Die Open-Source-Infrastruktur für die Verarbeitung gesprochener Sprache, mit der akademische und industrielle Gruppen Sprachsysteme mit Spracheingabe oder Sprachausgabe auf gleicher Grundlage trainieren, evaluieren und vergleichen können. Grundlegende Persönlichkeiten Sprache und Multimodalität Bewertungsmethodik
  85. Shuming Shi Wie „Halluzination“ bei Sprachmodellen aussieht, wenn man für die Auslieferung LLM-gestützter Produkte auf einer Oberfläche mit ungefähr einer Milliarde Nutzern verantwortlich ist. Halluzination und Faktentreue
  86. Steven Schockaert Wie ein retrieval-augmentiertes System end-to-end evaluiert wird, wenn jeder seiner Teile auf andere Weise versagen kann. Retrieval-augmentierte Generierung (RAG) Bewertungsmethodik
  87. Tatsunori Hashimoto Ob die über Sprachmodelle berichteten Zahlen statistische Befunde oder methodische Artefakte sind. Bewertungsmethodik
  88. Tom Mitchell Ob ein Sprachmodell eine interne Repräsentation davon hat, ob es die Wahrheit sagt — trennbar von dem, was es tatsächlich ausgibt. Halluzination und Faktentreue Grundlegende Persönlichkeiten Interpretierbarkeit
  89. Torsten Hoefler Logisches Schließen (Reasoning) von Sprachmodellen über lineare Gedankenketten (Chain-of-Thought) hinaus zu verallgemeinern — hin zu Verzweigung, Backtracking und Rekombination von Zwischenschritten des logischen Schließens. Schlussfolgern und Zerlegung Systeme und Skalierung
  90. Tushar Khot Was „Reasoning-Fähigkeit“ tatsächlich bedeutet, wenn man sie auf einen Benchmark bringen will — und was sich ändert, wenn man zugleich versucht, das Modell durch strukturiertes Prompting zum logischen Schließen (Reasoning) anzuleiten. Schlussfolgern und Zerlegung Bewertungsmethodik
  91. Wayne Xin Zhao Die Syntheseseite der LLM-Forschung — was nötig ist, um jedes Paper des Moments zu lesen und etwas zu erzeugen, das andere Forschende navigieren können. Grundlegende Persönlichkeiten Information Retrieval Bewertungsmethodik
  92. Weijia Shi Retrieval-augmentierte Generierung zum Funktionieren zu bringen, wenn das Sprachmodell selbst ein geschlossenes System ist, das man nicht per Feinabstimmung (Fine-Tuning) anpassen kann. Retrieval-augmentierte Generierung (RAG) Information Retrieval
  93. Wen-tau Yih Den Retrieval-Schritt in retrieval-augmentierten Systemen so gut zu machen, dass der Generierungsschritt überhaupt etwas hat, womit er arbeiten kann. Retrieval-augmentierte Generierung (RAG) Halluzination und Faktentreue Information Retrieval
  94. Wenjie Li Wie generatives Retrieval mit den anderen Generierungsaufgaben zusammenhängt — Zusammenfassung und Fragebeantwortung —, die dieselbe Systemarchitektur ebenfalls bewältigen muss. Retrieval-augmentierte Generierung (RAG) Information Retrieval
  95. Xia Hu Ob der akademische Stand der Technik bei Sprachmodellen in etwas verwandelt werden kann, das ein Praktiker — nicht ein Forschungslabor — tatsächlich deployen und dem er vertrauen kann. Grundlegende Persönlichkeiten Interpretierbarkeit Bewertungsmethodik
  96. Xing Xie Die Verbindung zwischen der Tradition der Recommender-Systeme, nutzerseitiges KI-Verhalten zu messen, und den neuen Bewertungsproblemen, die moderne LLMs aufwerfen. Grundlegende Persönlichkeiten Information Retrieval Bewertungsmethodik
  97. Xipeng Qiu Ein offenes chinesischsprachiges großes Sprachmodell zu bauen, das die akademische Community tatsächlich unter der Haube untersuchen kann — und die Werkzeuge darum herum. Grundlegende Persönlichkeiten Mehrsprachige Bewertung
  98. Xueqi Cheng Was Information-Retrieval-Forschung aus der chinesischen IR-Tradition heraus argumentiert — und wie sich ihre Perspektive auf generatives Retrieval vom westlichen Kanon unterscheidet. Retrieval-augmentierte Generierung (RAG) Information Retrieval
  99. Yang Liu Ob ein leistungsfähigeres Sprachmodell genutzt werden kann, um die Ausgaben eines weniger leistungsfähigen zu bewerten — und wie man das tut, ohne sich selbst zu täuschen. LLM-as-Judge-Methodik Bewertungsmethodik
  100. Yann LeCun Wie Systeme des maschinellen Lernens aussehen sollten — im Gegensatz zu dem, was sie derzeit sind. Grundlegende Persönlichkeiten Schlussfolgern und Zerlegung
  101. Yarin Gal Zu quantifizieren, wann Sprachmodelle nicht wissen, was sie sagen. Halluzination und Faktentreue Bewertungsmethodik
  102. Yejin Choi Was nötig wäre, damit ein Sprachmodell das besitzt, was Menschen im Überfluss haben und was LLMs zuverlässig fehlt — gesunden Menschenverstand. Grundlegende Persönlichkeiten Schlussfolgern und Zerlegung Bewertungsmethodik
  103. Yoav Goldberg Ob die Kette logischen Schließens (Reasoning), die ein Sprachmodell produziert, tatsächlich die Kette ist, der es gefolgt ist. Halluzination und Faktentreue Grundlegende Persönlichkeiten Interpretierbarkeit
  104. Yoav Shoham Was sich über den Zustand der KI von außerhalb eines einzelnen Unternehmens messen lässt — und wie Retrieval-Augmentation aussieht, wenn man nichts neu trainieren muss. Retrieval-augmentierte Generierung (RAG) Grundlegende Persönlichkeiten Transparenz und Governance
  105. Yonatan Belinkov Was tatsächlich in den verborgenen Repräsentationen eines Sprachmodells steckt — und welche dieser internen Zustände auf Dinge abbilden, die Menschen als Wissen erkennen würden. Interpretierbarkeit Bewertungsmethodik
  106. Yue Zhang Das, was das Feld „Halluzination“ nennt, in Kategorien zu ordnen, die tatsächlich Unterschiedliches bedeuten. Halluzination und Faktentreue Bewertungsmethodik
  107. Yulia Tsvetkov Welche Formen von Bias und Schaden in Ausgaben von Sprachmodellen über Sprachen hinweg annehmen — besonders in den Sprachen und Communities, die die Standard-Evaluation des Feldes historisch ignoriert hat. Sicherheit und Robustheit Mehrsprachige Bewertung Bewertungsmethodik
  108. Zhaochun Ren Ob man einem Sprachmodell die Aufgabe anvertrauen kann, die derzeit von einem Information-Retrieval-System erledigt wird — und welche Teile dieser Aufgabe es tatsächlich gut erledigt. Retrieval-augmentierte Generierung (RAG) Information Retrieval
  109. Zhiting Hu Ein Sprachmodell als eine Komponente in einem größeren Planungssystem zu behandeln — statt es das logische Schließen (Reasoning) End-to-End im eigenen Kopf erledigen zu lassen. Schlussfolgern und Zerlegung Dialog und Agenten