Junichi Yamagishi
La question de savoir si des auditeurs humains — ou des détecteurs automatisés — peuvent distinguer une parole générée par IA d'une vraie parole humaine, et comment cette distinguabilité change à mesure que la synthèse vocale progresse.
Yamagishi est l'organisateur principal d'ASVspoof, le défi international qui suit la capacité des systèmes automatisés à détecter la parole usurpée ou synthétique, depuis sa première édition en 2015. Le corpus accumulé par la série de défis est l'un des rares jeux de données longitudinaux en détection de contenu IA couvrant toute une génération technologique — de la synthèse concaténative ancienne au clonage vocal neuronal actuel. Il co-organise le défi parallèle VoiceMOS pour l'évaluation de la qualité de la parole synthétique, ce qui le place dans une position unique des deux côtés de la question : jusqu'où la synthèse s'est-elle améliorée, et dans quelle mesure cette amélioration reste-t-elle détectable ? Pour ai100, à mesure que les moteurs d'IA se déplacent vers la sortie vocale, c'est la pile méthodologique pour évaluer ce que donne, à l'écoute, un LLM qui parle.