Jotys frühere veröffentlichte Arbeit liegt im Diskursstruktur-Parsing — jener Art von NLP, bei der man fragt, ob ein Absatz als Argument zusammenhält, nicht nur, ob jeder einzelne Satz syntaktisch analysierbar ist. Diese Denkgewohnheit trägt sich in seine jüngeren LLM-Evaluationspublikationen hinein: Eine Enterprise-LLM-Anwendung muss Ausgaben erzeugen, die über Multi-Turn-Nutzung hinweg ihre argumentative Form behalten, und standardmäßige Single-Shot-Benchmarks erfassen das nicht. Der Werkkomplex liest sich als stete Erinnerung daran, dass „das Modell besteht einen Benchmark“ und „das Modell hält unter Enterprise-Traffic stand“ nicht dieselbe Behauptung sind.

Lesenswert, wenn
man eine Evaluationsperspektive braucht, die davon geprägt ist, was die Auslieferung von LLM-Funktionen an Enterprise-Kunden der zugrunde liegenden Methodik tatsächlich abverlangt.
Themen
Diskursstruktur als Linse auf Langform-LLM-Ausgaben; Multi-Turn-Evaluation jenseits von Single-Shot-Benchmarks; die Lücke zwischen Forschungsbenchmarks und Enterprise-Deployment.
Zentrale Arbeiten
frühere grundlegende Arbeit zu Diskursparsing (RST und darüber hinaus); laufende Publikationen zu Multi-Turn-LLM-Evaluation und Zuverlässigkeit.