selitetty.com

Kuva-, ääni- ja videogeneraattorit

Äänen kloonaus ja puhesynteesi: näin tekoääni tehdään

Tekoääni ei ole nauhoitettujen sanojen liimaamista peräkkäin. Malli tuottaa aaltomuodon alusta asti, ja siksi lyhytkin näyte riittää tunnistettavan äänen jäljittelyyn.

Lyhyt vastaus

Puhesynteesi muuttaa tekstin puheeksi kolmessa vaiheessa: teksti tulkitaan äänteiksi, äänteistä tuotetaan äänen taajuuskuva ja siitä muodostetaan kuunneltava aaltomuoto. Äänen kloonauksessa malli saa lisäksi näytteen tietystä puhujasta ja tuottaa uutta puhetta hänen äänensävyllään. Näytettä tarvitaan vähän, tyypillisesti minuutteja tai vähemmän, joten tekninen este on käytännössä poistunut. Ratkaisevaksi jää lupa: äänitallenne on henkilötieto, ja toisen äänen käyttöön tarvitaan peruste, kun taas oman äänen kloonaus on sopimuskysymys palvelun kanssa.

Sisällys
  1. Puhesynteesi ja kloonaus ovat kaksi eri asiaa
  2. Näin teksti muuttuu ääneksi kolmessa vaiheessa
  3. Kuinka vähän näytettä kloonaus vaatii
  4. Mikä tekoäänessä vielä pettää
  5. Ääni on henkilötieto, ja siihen tarvitaan peruste
  6. Merkintävelvoite koskee myös ääntä
  7. Mihin tekoääntä käytetään laillisesti
  8. Näin otat tekoäänen käyttöön ilman ongelmia
  9. Usein kysytyt kysymykset
  10. Lähteet ja lisälukemista

Vanha puhesynteesi kuulosti robotilta, koska se oli sitä. Ohjelma poimi tallennetusta puheesta lyhyitä paloja ja liitti ne peräkkäin, jolloin jokainen sauma kuului. Nykyinen tekoääni toimii toisin: malli tuottaa äänen alusta asti, äänenpaine kerrallaan, sen sijaan että kokoaisi sen valmiista osista. Tämä ero selittää sekä laadun että sen, miksi kloonaus onnistuu pienellä näytteellä.

Tässä artikkelissa käydään läpi tekniikka ja luvat. Sitä, miten tekoäänellä tehtyyn huijauspuheluun reagoidaan, käsitellään erikseen artikkelissa ääniväärennös puhelimessa.

Puhesynteesi ja kloonaus ovat kaksi eri asiaa

Puhesynteesi tarkoittaa tekstin muuttamista puheeksi millä tahansa äänellä. Se on ollut käytössä vuosikymmeniä ruudunlukuohjelmissa ja navigaattoreissa.

Äänen kloonaus on tämän erikoistapaus. Mallille annetaan näyte tietystä ihmisestä, ja se tuottaa uutta puhetta niin, että kuulija tunnistaa puhujan. Kloonaus ei siis opeta mallille puhumista alusta, vaan malli osaa puhua jo valmiiksi. Näytteestä poimitaan vain se, mikä tekee juuri tästä äänestä tunnistettavan: äänen korkeus, sointi, artikulaation tapa ja puherytmi.

Syy siihen, että kloonaus onnistuu pienellä näytteellä, on juuri tässä. Malli on jo opetettu valtavalla määrällä eri ihmisten puhetta, joten se tuntee sen, miten äänteet muodostuvat ja miten puhe etenee. Näytteestä tarvitaan vain se tieto, joka erottaa yhden puhujan muista, ja se on määrältään pieni verrattuna puhumisen osaamiseen. Tämä on sama ilmiö kuin kuvapuolella: yleismalli osaa piirtää ihmisen, ja muutama näyte riittää ohjaamaan sen tiettyihin kasvoihin.

Kolmas käsite on äänenmuunnos, jossa lähtökohtana on puhe eikä teksti. Ihminen puhuu itse, ja malli muuttaa lopputuloksen kuulostamaan toiselta. Tämä on huijauksissa tehokas, koska tunneilmaisu ja ajoitus tulevat oikealta ihmiseltä ja vain sointi vaihdetaan.

Näin teksti muuttuu ääneksi kolmessa vaiheessa

Nykyinen putki on lähes aina kolmiosainen. Vaiheiden erottaminen kannattaa, koska laatuongelmat syntyvät eri vaiheissa ja kuuluvat eri tavalla.

  1. Tekstin tulkinta. Malli normalisoi tekstin ja päättää, miten se luetaan. Tässä ratkaistaan lyhenteet, numerot, päivämäärät ja vieraskieliset nimet. Suomessa ongelmia tuottavat yhdyssanat, sijamuodot ja se, että sama kirjoitusasu voi tarkoittaa eri asioita.
  2. Akustinen mallinnus. Äänteistä tuotetaan spektrogrammi eli kuva siitä, mitkä taajuudet soivat milläkin hetkellä ja kuinka voimakkaasti. Tässä vaiheessa syntyy myös prosodia: painotukset, tauot ja lauseen sävelkulku. Kloonauksessa puhujan tunnistetiedot vaikuttavat juuri tähän vaiheeseen.
  3. Aaltomuodon tuottaminen. Vokoderi muuttaa taajuuskuvan varsinaiseksi ääniaalloksi, jonka kaiutin voi toistaa. Tämä vaihe ratkaisee, kuulostaako tulos luonnolliselta vai metalliselta.

Putken viimeinen vaihe ratkaisee myös sen, voiko puhetta tuottaa reaaliajassa. Kun teksti on valmiina etukäteen, mallia voi ajaa rauhassa ja lopputulos voidaan tarkistaa ennen julkaisua. Suorassa keskustelussa puhe pitää tuottaa palasina sitä mukaa kun sanat syntyvät, mikä rajoittaa laatua ja tekee pitkien lauseiden painotuksesta vaikeampaa. Ero kuuluu: valmiiksi tuotettu ääni on yleensä sujuvampaa kuin reaaliaikainen.

Vaiheiden erottelu selittää tavallisen havainnon. Kun tekoääni lausuu suomalaisen sukunimen väärin, vika on ensimmäisessä vaiheessa eikä äänenlaadussa. Kun ääni kuulostaa oikealta mutta lause painottuu väärin, vika on toisessa. Kolmannen vaiheen virheet kuuluvat rätinänä tai puuromaisena soundina.

Kuinka vähän näytettä kloonaus vaatii

Näytteen määrä vaikuttaa vähemmän kuin useimmat olettavat. Tunnistettavuus syntyy nopeasti, ilmaisun rikkaus hitaasti.

Näytteen määrä Mitä yleensä saa Mihin ei riitä
Muutamia sekunteja Karkeasti tunnistettava sointi, tasainen puhetapa Tunteet, painotukset, pitkä kuunneltavuus
Noin minuutti puhdasta puhetta Tunnistettava ääni, joka kestää lyhyen kuuntelun Laulu, huuto, murre, vahva tunneilmaisu
Useita minuutteja hyvälaatuista puhetta Luonteva puherytmi ja vaihteleva painotus Erikoistilanteet ja tarkka näyttelijäntyö
Tunteja studiolaatuista aineistoa Tuotantokelpoinen ääni ammattikäyttöön Ei juuri mitään, mutta vaatii sopimuksen ja ohjauksen

Rajat vaihtelevat mallin ja palvelun mukaan, eikä tarkkoja lukuja kannata pitää sääntönä. Olennaista on suuruusluokka: kloonaukseen ei tarvita erikoisaineistoa, vaan tavallinen haastattelu, kokoustallenne, puhelinvastaajan tervehdys tai videon ääniraita riittää usein sellaisenaan.

Näytteen laatu ratkaisee enemmän kuin sen pituus. Puhdas, tasainen ja taustameluton puhe tuottaa paremman tuloksen kuin moninkertainen määrä hälyistä aineistoa. Sama koskee kieltä: suomenkielinen näyte antaa paremman suomenkielisen tuloksen kuin englanninkielinen, vaikka sointi siirtyisikin kielirajan yli.

Mikä tekoäänessä vielä pettää

Tekoäänen tunnistaminen kuulemalla on epävarmaa, ja se muuttuu koko ajan epävarmemmaksi. Vihjeitä kannattaa silti tuntea, koska ne kertovat samalla siitä, mitä malli ei vielä osaa.

  • Hengitys. Ihminen hengittää lauseiden välissä ja joskus keskellä lausetta. Tekoäänessä hengitys joko puuttuu tai toistuu liian säännöllisenä samanlaisena äänenä.
  • Painotus pitkässä lauseessa. Malli painottaa yleensä oikein muutaman sanan matkalla mutta menettää lauseen logiikan pitkissä, monilauseisissa virkkeissä.
  • Tunteen ja sisällön ristiriita. Kiireinen tai järkyttynyt asia luetaan tasaisella äänellä, koska mallilla ei ole käsitystä siitä, mitä se sanoo.
  • Tilan puuttuminen. Aito puhelu tuo mukanaan huoneen kaiun ja taustaäänet. Kloonattu puhe on usein epäluonnollisen puhdasta tai siihen on lisätty tausta, joka pysyy samana koko puhelun ajan.
  • Keskeytyksen käsittely. Kun puhuja keskeytetään, ihminen sekoittaa sanansa. Nauhoitettu tai generoitu puhe jatkaa omaa linjaansa.

Nämä vihjeet katoavat puhelinlinjassa, koska puhelun pakkaus poistaa juuri hienoimmat yksityiskohdat. Siksi tunnistaminen ei ole toimiva suojakeino, vaan varmistus pitää tehdä toista kanavaa pitkin. Sama päätelmä koskee kaikkea manipuloitua sisältöä, kuten syväväärennöksiä käsittelevässä artikkelissa todetaan.

Ääni on henkilötieto, ja siihen tarvitaan peruste

Puhetallenne, josta henkilö on tunnistettavissa, on henkilötieto. Sen käsittelyyn tarvitaan tietosuoja-asetuksen mukainen oikeusperuste, ja mallin opettaminen näytteellä on käsittelyä siinä missä tallentaminenkin. Jos äänestä muodostetaan tunniste, jolla henkilö voidaan yksilöidä, kyse on biometrisesta tiedosta, jonka käsittelyyn asetus asettaa selvästi tiukemmat ehdot.

Käytännössä on erotettava kaksi eri lupaa, ja ne annetaan eri hetkinä:

  • Lupa opettaa. Saako tämän ihmisen äänestä ylipäätään tehdä mallin, kuka mallin säilyttää ja kuinka kauan.
  • Lupa julkaista. Mitä tuotetulla äänellä saa sanoa, missä yhteydessä ja kuinka pitkään.

Toinen ei sisälly ensimmäiseen. Näyttelijä voi antaa äänensä yhteen tuotantoon ilman että antaa sitä kaikkeen tulevaan käyttöön, ja juuri tästä rajauksesta alan sopimuksissa kiistellään. Yleiset rekisteröidyn oikeudet on käyty läpi artikkelissa GDPR ja rekisteröidyn oikeudet, ja se, mitä tekoälypalvelu tekee syöttämälläsi aineistolla, artikkelissa tekoäly ja tietosuoja.

Työelämässä on lisäksi oma mutkansa. Työnantajan pyytämä suostumus on harvoin pätevä peruste, koska suostumuksen pitää olla vapaaehtoinen eikä työsuhteessa yleensä ole aitoa valinnanvapautta. Siksi äänen käyttöä koskevat ehdot kirjataan sopimukseen ja rajataan käyttötarkoitus tarkasti.

Tekijänoikeus on erillinen kysymys. Ihmisen ääni sinänsä ei ole teos, mutta tallenne, jolla malli opetetaan, on aineistoa, jolla on oikeudenhaltija, ja esittävällä taiteilijalla on esitykseensä omat oikeutensa. Aihepiirin perusteet käsitellään artikkelissa tekijänoikeus arjessa.

Merkintävelvoite koskee myös ääntä

EU:n tekoälyasetus asettaa keinotekoisesti tuotetulle sisällölle läpinäkyvyysvelvoitteita. Käytännössä tämä tarkoittaa kahta asiaa. Käyttäjälle on kerrottava, kun hän on tekemisissä tekoälyn kanssa esimerkiksi puhelinpalvelussa, ja keinotekoisesti tuotettu tai muunneltu sisältö on merkittävä koneluettavasti. Yksityiskohdat ja poikkeukset on koottu artikkeliin tekoälysisällön merkintä.

Äänen merkitseminen on teknisesti hankalampaa kuin kuvan. Tiedostoon liitettävä alkuperätieto katoaa, kun ääni muunnetaan toiseen muotoon tai kun se soitetaan kaiuttimesta ja nauhoitetaan uudelleen. Kuultavissa oleva merkintä puolestaan häiritsee käyttöä. Siksi merkintä on hyödyllinen jakeluketjussa mutta ei ratkaise huijauksia, joissa tekijä ei halua noudattaa mitään velvoitetta.

Mihin tekoääntä käytetään laillisesti

Kloonaus on saanut näkyvyyttä väärinkäytösten kautta, mutta valtaosa käytöstä on arkista. Ääni yhdistetään usein kuvaan, ja kuvapuolen rajoitteet kannattaa tuntea samalla, sillä ne on käyty läpi artikkelissa videogeneraattoreiden rajoista.

Käyttökohde Mitä siinä tavoitellaan Mikä on rajoite
Saavutettavuus Verkkosivun, asiakirjan tai kirjan kuunteleminen Vaikeat nimet ja termit vaativat oikoluvun
Oman äänen varmuuskopio Sairauden vuoksi puhekykynsä menettävän oma ääni käyttöön Vaatii näytteen ennen äänen menetystä
Jälkiäänitys ja kääntäminen Sama puhuja toiselle kielelle tuotannossa Sopimus esiintyjän kanssa ja käyttöoikeuden rajaus
Koulutus- ja ohjevideot Nopea päivitys, kun teksti muuttuu Ei sovi tilanteisiin, joissa äänen pitää olla nimetty asiantuntija
Puhelin- ja opastuspalvelut Yhtenäinen ääni ja nopea muutos Käyttäjälle on kerrottava, että vastassa on kone
Podcastin ja luennon korjaukset Yksittäisen virheen korjaus ilman uutta äänitystä Läpinäkyvyys yleisölle, jos korjaus muuttaa sisältöä

Nämä käyttökohteet jakavat saman piirteen: kuulija tietää tai voi tietää, että ääni on tuotettu koneella, eikä kukaan esitä olevansa toinen ihminen. Kun tämä ehto rikkoutuu, ollaan huijauksen puolella riippumatta siitä, kuinka hyvältä lopputulos kuulostaa tai kuinka hyvä tarkoitus tekijällä oli.

Näin otat tekoäänen käyttöön ilman ongelmia

Käytännön muistilista, kun harkitset kloonausta työssä tai omassa projektissa.

  1. Päätä ensin kenen ääni. Oma ääni on selvästi yksinkertaisin tapaus. Toisen ääni vaatii kirjallisen luvan ennen kuin näytettä edes ladataan palveluun.
  2. Rajaa käyttötarkoitus lupaan. Kirjaa mihin tuotoksiin, millä kielillä ja kuinka pitkäksi ajaksi lupa annetaan sekä miten se voidaan perua.
  3. Tarkista palvelun ehdot. Selvitä, säilyttääkö palvelu äänimallin, käyttääkö se näytettä omien mallien opettamiseen ja saako mallin poistaa.
  4. Kerro kuulijalle. Lisää maininta tekoäänen käytöstä sinne, missä kuulija sen näkee, ja säilytä koneluettava merkintä, jos työkalu sellaisen tuottaa.
  5. Kuuntele tulos ääneen. Nimet, numerot ja lyhenteet ovat tavallisimmat virhepaikat, eivätkä ne näy tekstistä.
  6. Älä käytä ääntä tunnistautumiseen. Puheentunnistukseen perustuva puhelinvarmennus ei ole enää luotettava, ja sama koskee tuttua ääntä puhelun päässä.
  7. Sovi mitä tehdään väärinkäytöstilanteessa. Jos äänelläsi tehdään huijauksia, valmis toimintaohje ja tehty rikosilmoitus nopeuttavat asian selvittämistä.

Tekniikka on jo halpaa ja helppoa, joten kloonauksen riski ei ole siinä, että joku pystyy tekemään sen. Ero laillisen ja vahingollisen käytön välillä syntyy luvasta ja siitä, tietääkö kuulija kenelle puhuu. Nämä kaksi asiaa kannattaa ratkaista ennen ensimmäistäkin näytettä.

Usein kysytyt kysymykset

Kuinka pitkä äänite tarvitaan äänen kloonaukseen?

Tunnistettavaan lopputulokseen riittää usein alle minuutti puhdasta puhetta, ja luontevaan ilmaisuun muutama minuutti. Tarkat rajat vaihtelevat mallin mukaan, eikä lisäaineisto paranna tunnistettavuutta vaan lähinnä painotusta ja tunneilmaisua. Näytteen laatu vaikuttaa enemmän kuin sen pituus.

Onko oman äänen kloonaus laillista?

Oman äänen kloonaus on lähtökohtaisesti sallittua, ja kysymys on lähinnä palvelun käyttöehdoista sekä siitä, mitä palvelu tekee näytteelläsi. Toisen ihmisen ääni vaatii luvan, koska tunnistettava äänitallenne on henkilötieto. Julkaisuun tarvitaan lisäksi oma sopimuksensa siitä, mitä äänellä saa sanoa.

Voiko tekoäänen tunnistaa kuulemalla?

Ei luotettavasti, ja mahdollisuus heikkenee jatkuvasti. Hengityksen puuttuminen, tasainen tunneilmaisu ja epäluonnollisen puhdas tausta ovat vihjeitä, mutta ne katoavat puhelinlinjan pakkauksessa. Varmistus kannattaa tehdä soittamalla takaisin tunnettuun numeroon.

Toimiiko äänen kloonaus suomeksi?

Toimii, mutta laatu on yleensä heikompi kuin suurilla kielillä, koska opetusaineistoa on vähemmän. Tyypillisiä ongelmia ovat sijamuodot, yhdyssanat ja erisnimien painotus. Suomenkielinen näyte antaa selvästi paremman tuloksen kuin vieraskielinen.

Voiko tekoäänellä ohittaa pankin äänitunnistuksen?

Puheeseen perustuvaa tunnistusta ei voi enää pitää yksinään riittävänä, ja siksi sitä käytetään yleensä vain yhtenä tekijänä muiden joukossa. Tärkeämpi käytännön riski on ihminen puhelimen toisessa päässä, joka luottaa tuttuun ääneen. Sovi läheisten kanssa tapa varmistaa yllättävä pyyntö.

Pitääkö tekoäänen käytöstä kertoa kuulijalle?

EU:n tekoälyasetus edellyttää läpinäkyvyyttä sekä silloin, kun ihminen keskustelee tekoälyn kanssa, että keinotekoisesti tuotetun sisällön merkitsemistä. Käytännön toteutus riippuu käyttötilanteesta, mutta selkeä maininta on aina turvallisin ratkaisu. Merkintävelvoite koskee sisällön tuottajaa ja julkaisijaa.

Mitä teen, jos äänelläni on tehty huijauksia?

Tee rikosilmoitus poliisille ja säilytä kaikki todisteet, kuten tallenteet, viestit ja ajankohdat. Kerro asiasta niille, joihin huijari on ottanut yhteyttä, ja sovi läheisten kanssa varmistustapa jatkoa varten. Jos ääntä on käytetty palvelussa, tee ilmoitus myös sinne, jotta sisältö saadaan poistettua.

Takaisin ylös