Junichi Yamagishi
Ob menschliche Hörer — oder automatisierte Detektoren — KI-generierte gesprochene Sprache von echter menschlicher Sprache unterscheiden können, und wie sich diese Unterscheidbarkeit verändert, wenn Sprachsynthese besser wird.
Yamagishi ist seit der ersten Ausgabe 2015 der wichtigste Organisator von ASVspoof, der internationalen Challenge, die verfolgt, wie gut automatisierte Systeme gespoofte oder synthetische Sprache erkennen können. Die über die Challenge-Serie angesammelte Historie ist einer der wenigen longitudinalen Datensätze in der Erkennung von KI-Inhalten, der eine ganze Technologiegeneration abdeckt — von früher konkatenativer Synthese bis zu aktuellem neuronalen Stimmenklonen. Parallel dazu koorganisiert er die VoiceMOS-Challenge zur Evaluation der Qualität synthetischer Sprache, was ihn auf beiden Seiten der Frage ungewöhnlich gut positioniert: Wie gut ist Synthese geworden, und wie erkennbar bleibt diese Güte? Für ai100 ist das, während AI-Engines sich in Richtung Sprachausgabe bewegen, der Methodik-Stack zur Evaluation dessen, wie es klingt, wenn ein LLM spricht.