ɫɫÀ²

Informaatio- ja tietoliikennetekniikan laitos

Puhesynteesi

Puhesynteesin tutkimusryhmä tutkii syviä generatiivisia malleja ja differentioituvia signaalinkäsittelymenetelmiä sovellettuna puheeseen ja ääneen. Lisäksi tutkimusintresseihin kuuluvat äänikloonaus, deepfake-tunnistus ja generoidun puheen vesileimaaminen.
graph

Puhesynteesin tutkimusryhmä tutkii syviä generatiivisia malleja ja differentioituvia signaalinkäsittelymenetelmiä sovellettuna puheeseen ja ääneen. Lisäksi tutkimusintresseihin kuuluvat äänikloonaus, deepfake-tunnistus ja generoidun puheen vesileimaaminen.

Puhuvat koneet ovat pitkään olleet puheenkäsittelyn ja koneoppimisen keskeisiä tutkimusaiheita. Puhesynteesiä käyttäviä teknologita ovat esimerkiksi henkilökohtaiset digitaaliset avustajat (kuten Siri ja Alexa), äänikirjat, sekä apuvälineet, kuten  näytönlukuohjelmat ja ääniproteesit. Nykyaikaiset puhesynteesimenetelmät kuulostavat lähes yhtä luonnollisilta kuin ihmispuhujat. Tämä saavutetaan käyttämällä syviä generatiivisia malleja, kuten WaveNet, GANit, diffuusiomallit ja Transformer-kielimallit.

Nykyiset tekniset haasteet puheen synteesissä liittyvät tehokkuuteen, hallittavuuteen ja tulkittavuuteen. Parhaat nykymenetelmät käyttävät suuria neuroverkkomalleja, jotka ovat laskennallisesti kalliita mustia laatikoita. Aalto-yliopiston puhesynteesiryhmän tutkimus rakentaa tehokasta ja tulkittavaa puhesynteesiä yhdistämällä perinteisiä digitaalisen signaalinkäsittelyn menetelmiä differentioituvan laskennan kanssa.

Äänikloonaus on hiljattain paljon huomiota saanut puhesynteesin sovellus. Äänikloonauksessa uusi ääni voidaan luoda vain muutaman sekunnin äänitallenteesta, mikä mahdollistaa monia sovelluksia, mutta luo samalla kasvavan tarpeen synteettisen puheen tunnistukselle. Aallon puhesynteesin tutkimusryhmä pyrkii rakentamaan vastuullista puhesynteesiä ja tutkii generoidun puheen vesileimaamista osana synteesiprosessia. 

Lue lisää aiheesta YLE:n artikkelista:

Aalto-yliopiston puhesynteesin tutkimusryhmä tekee aktiivisesti yhteistyötä kansainvälisesti, yheistyökumppaneihin lukeutuvat mm. KTH Royal Institute of Technology, Tukholmassa; ja National Institute of Informatics (NII), Tokiossa

Tutkimusaiheita

  • Puhesynteesin generatiiviset mallit: GANit, WaveNet, diffuusiomallit, representaatio-oppiminen ja kielimallit äänelle
  • Differentioituva DSP: digitaalinen signaalinkasittely rakennusaineena tehokkaille teköälypohjaisille puhesynteesijärjestelmille
  • Generatiivisten mallien vesileimaus; Deepfake-tunnistus puheessa, vastatoimet ja yleinen tietoisuus aiheesta

Puhesynteesin tutkimusryhmää johtaa professori Lauri Juvela

Ryhmän jäsenet

Viimeisimmät julkaisut

Yicheng Gu, Junan Zhang, Chaoren Wang, Jerry Li, Zhizheng Wu, Lauri Juvela 2026 IEEE Transactions on Audio, Speech and Language Processing

Yicheng Gu, Chaoren Wang, Zhizheng Wu, Lauri Juvela 2025 Proceedings of the Interspeech

Yicheng Gu, Runsong Zhang, Lauri Juvela, Zhizheng Wu 2025 Proceedings of the 28th International Conference on Digital Audio Effects

Lauri Juvela, Xin Wang 2025 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing, ICASSP 2025 - Proceedings

Zirui Li, Lauri Juvela, Mikko Kurimo 2025 13th edition of the Speech Synthesis Workshop

Eloi Moliner Juanpere, Michal Švento, Alec Wright, Lauri Juvela, Pavel Rajmic, Vesa Välimäki 2025 Proceedings of the 28th International Conference on Digital Audio Effects

Michal Švento, Eloi Moliner Juanpere, Lauri Juvela, Alec Wright, Vesa Välimäki 2025 Journal of the Audio Engineering Society

Alec Wright, Alistair Carson, Lauri Juvela 2025 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing, ICASSP 2025 - Proceedings

Ville Huhtala, Lauri Juvela, Sebastian J. Schlecht 2024 IEEE Signal Processing Letters

Nicolas Jonason, Xin Wang, Erica Cooper, Lauri Juvela, Bob L.T. Sturm, Junichi Yamagishi 2024 Proceedings of the 27th International Conference on Digital Audio Effects (DAFx24)
Lisää tietoa tutkimuksestamme löytyy Aallon tutkimusportaalista.
  • ±Êä¾±±¹¾±³Ù±ð³Ù³Ù²â:
  • Julkaistu:
Jaa
URL kopioitu