Shafiq Joty
Bewertungsmethodik für Sprachmodelle, wenn der Einsatzkontext Enterprise-Software ist und nicht eine Forschungsdemo.
Jotys frühere veröffentlichte Arbeit liegt im Diskursstruktur-Parsing — jener Art von NLP, bei der man fragt, ob ein Absatz als Argument zusammenhält, nicht nur, ob jeder einzelne Satz syntaktisch analysierbar ist. Diese Denkgewohnheit trägt sich in seine jüngeren LLM-Evaluationspublikationen hinein: Eine Enterprise-LLM-Anwendung muss Ausgaben erzeugen, die über Multi-Turn-Nutzung hinweg ihre argumentative Form behalten, und standardmäßige Single-Shot-Benchmarks erfassen das nicht. Der Werkkomplex liest sich als stete Erinnerung daran, dass „das Modell besteht einen Benchmark“ und „das Modell hält unter Enterprise-Traffic stand“ nicht dieselbe Behauptung sind.