selitetty.com

Mitä tekoäly on

Mistä tekoäly on opetettu? Opetusaineisto ja sen sokeat pisteet

Kielimalli osaa vain sen, mitä sen opetusaineistossa oli. Tässä käydään läpi, mistä teksti kerätään, mitä siitä suodatetaan pois ja miksi suomi jää aineistossa pieneen osaan.

Lyhyt vastaus

Suurten kielimallien opetusaineisto on pääosin julkisesta verkosta ryömimällä kerättyä tekstiä, jota täydennetään kirjoilla, koodilla, tietosanakirjoilla ja erikseen hankituilla aineistoilla. Raakakokoelmasta poistetaan roskaa, päällekkäisyyksiä ja ei-toivottua sisältöä, ja jokainen suodatusvalinta muokkaa sitä, mitä malli lopulta osaa. Aineisto painottuu voimakkaasti englantiin ja verkossa julkaistuun tekstiin, joten suomalaiset ja paikalliset aiheet jäävät ohuiksi. Tarkkaa aineistoluetteloa ei yleensä julkaista, joten aukkoja pitää arvioida testaamalla mallia itse.

Sisällys
  1. Mistä opetusteksti oikeasti kerätään
  2. Suodatus on arvovalintojen sarja
  3. Miksi päällekkäisyyksien poisto ratkaisee laadun
  4. Kielijakauma: englanti hallitsee, suomi on marginaalissa
  5. Synteettinen aineisto: malli opettaa mallia
  6. Vapaasti kerättävä teksti ei ole loputon
  7. Miksi aineistoluetteloa ei yleensä julkaista
  8. Näin arvioit mallin sokeat pisteet itse
  9. Usein kysytyt kysymykset
  10. Lähteet ja lisälukemista

Kysyt kielimallilta jotain, ja se vastaa sujuvasti. Vastaus vaikuttaa siltä, että jossain on tietokanta, josta asia on haettu. Näin se ei toimi. Malli on käynyt kertaalleen läpi kiinteän tekstikokoelman ja säätänyt sen perusteella sisäisiä lukujaan. Kaikki mitä malli osaa, on peräisin siitä kokoelmasta ja siitä, miten kokoelmaa on ennen opetusta karsittu.

Siksi kysymys aineiston alkuperästä ei ole akateeminen. Se selittää, miksi malli tuntee yhdysvaltalaisen sopimuskäytännön paremmin kuin suomalaisen kunnan kaavoitusprosessin, ja miksi se puhuu vaivatonta suomea mutta sekoittaa suomalaisten palveluiden nimet keskenään. Se, miten aineisto ylipäätään muuttuu mallin sisäisiksi luvuiksi, on selitetty artikkelissa koneoppiminen selitettynä. Tässä katsotaan yhtä kerrosta aiemmin: mistä teksti tulee, mitä siitä poistetaan ja mitä prosessi jättää jälkeensä.

Mistä opetusteksti oikeasti kerätään

Suurin yksittäinen lähde on julkinen verkko. Sivustoja kerätään ryömimällä eli seuraamalla linkkejä sivulta toiselle ja tallentamalla löydetyt sivut. Osa mallien tekijöistä ryömii itse, osa käyttää valmiita julkisia ryömintäarkistoja, kuten Common Crawlia. Lopputulos on suunnaton kokoelma HTML-sivuja, joista suurin osa on mallin kannalta arvotonta.

Verkkotekstin päälle lisätään yleensä aineistoja, joiden laatu on tasaisempi:

  • tietosanakirjat ja avoimet viitetietokannat, joista Wikipedia on tunnetuin
  • avoimen lähdekoodin ohjelmakoodi julkisista koodivarastoista
  • digitoidut kirjat, sanoma- ja aikakauslehdet sekä arkistoaineistot
  • viranomaisten ja tutkimuslaitosten avoimet julkaisut ja tilastot
  • keskustelupalstat ja kysymys-vastaus-sivustot, joilla on paljon arkikieltä
  • erikseen lisensoidut aineistot, joista on tehty sopimus oikeudenhaltijan kanssa

Tästä listasta seuraa yksi tärkeä asia. Aineisto ei ole otos maailmasta vaan otos siitä, mikä on kirjoitettu tekstiksi, julkaistu verkossa ja ollut koneellisesti haettavissa. Puhelimessa käyty keskustelu, työpaikan sisäinen ohje ja maksumuurin takana oleva paikallislehti eivät ole mukana. Malli ei tiedä niistä mitään, eikä se osaa kertoa, ettei tiedä.

Suodatus on arvovalintojen sarja

Raaka verkkokokoelma ei kelpaa sellaisenaan. Se sisältää navigaatiovalikoita, evästeilmoituksia, hakukoneille kirjoitettua avainsanaroskaa, automaattikäännöksiä ja suoraa roskapostia. Suodatusputki karsii nämä, mutta jokainen suodatin on samalla päätös siitä, millainen teksti kelpaa.

Suodatusvaihe Mitä tehdään Mitä samalla katoaa
Kielentunnistus Valitaan halutut kielet automaattisella tunnistimella Lyhyet tekstit, kielten sekakäyttö ja murteet tunnistuvat väärin
Rakenteen siivous Poistetaan valikot, mainokset ja toistuvat pohjatekstit Osa sisällöstä, joka on upotettu sivun rakenteeseen
Laatuluokittelu Arvioidaan, muistuttaako teksti hyväksi katsottua kieltä Epämuodollinen kieli, harvinaiset aihepiirit, pienten yhteisöjen teksti
Haitallisen sisällön poisto Suodatetaan sanalistoilla ja luokittimilla Asiallinen teksti aiheista, joissa esiintyy suodatettuja sanoja
Henkilötietojen karsinta Peitetään tunnistetietoja, kuten yhteystietoja Suodatus on epätäydellistä, eikä se poista kaikkea

Laatuluokittelu ansaitsee erillisen huomion. Käytännössä luokitin opetetaan tunnistamaan, muistuttaako teksti jotakin vertailuaineistoa, joka on usein toimitettua ja huoliteltua kieltä. Menetelmä toimii roskan poistossa, mutta se painottaa samalla virallista rekisteriä. Puhekielinen, harvinaisen aiheen tai pienen kieliyhteisön teksti näyttää luokittimen silmissä samalta kuin huono teksti.

Henkilötietojen osalta kannattaa muistaa, että verkossa julkaistu tieto sinusta voi päätyä aineistoon riippumatta siitä, oletko itse julkaissut sen. Omien tietojen käsittelyyn liittyvät oikeudet on käyty läpi artikkelissa GDPR ja rekisteröidyn oikeudet, ja oman keskusteluhistorian käytön voi useissa palveluissa estää erikseen, kuten kuvataan artikkelissa näin estät tietojesi käytön opettamiseen.

Miksi päällekkäisyyksien poisto ratkaisee laadun

Verkko on täynnä kopioita. Sama uutinen julkaistaan kymmenillä sivustoilla, sama lakiteksti toistuu sadoilla sivuilla, sama tuotekuvaus kopioidaan verkkokaupasta toiseen. Jos aineistoa ei siivota, malli näkee osan teksteistä valtavan monta kertaa ja osan kerran.

Tällä on kolme seurausta. Ensinnäkin moninkertainen teksti painottuu opetuksessa liikaa, jolloin malli oppii sen sanatarkasti eikä opi yleistämään. Toiseksi juuri sanatarkka muistaminen on se mekanismi, jolla malli voi toistaa opetusaineiston pätkiä ulkomuistista, mikä on ongelma sekä tekijänoikeuden että henkilötietojen kannalta. Kolmanneksi laskentateho kuluu saman asian toistamiseen sen sijaan, että malli näkisi uutta.

Siksi aineistosta poistetaan sekä täysin identtiset että lähes identtiset tekstit. Lähes identtisten löytäminen tehdään menetelmillä, jotka vertaavat tekstien osittaisia tiivisteitä keskenään, koska kaikkien tekstiparien vertailu keskenään olisi liian raskasta. Samalla poistetaan mahdollisuuksien mukaan arviointitehtävät, jotka ovat vuotaneet verkkoon. Jos mallin koe on ollut opetusaineistossa, koetulos ei kerro osaamisesta mitään.

Kielijakauma: englanti hallitsee, suomi on marginaalissa

Laajassa verkkoaineistossa englanti on ylivoimaisesti suurin kieli. Suomen osuus jää tyypillisesti alle prosenttiin, ja tarkka luku riippuu siitä, mistä aineistosta ja millä kielentunnistimella se on mitattu. Syy ei ole salaliitto vaan aritmetiikka: suomea puhuu äidinkielenään noin viisi miljoonaa ihmistä, ja verkkoon julkaistun tekstin määrä seuraa karkeasti puhujamäärää ja julkaisukulttuuria.

Suomen tilannetta kaventaa lisäksi kaksi asiaa. Merkittävä osa laadukkaasta suomenkielisestä tekstistä on kaupallisen median maksumuurin takana tai arkistoissa, joiden käyttöoikeudet eivät salli vapaata jakelua. Toisaalta osa verkosta löytyvästä suomesta on konekäännettyä sisältöä, joka on tuotettu hakukoneita varten. Se on kielellisesti kelvotonta ja voi opettaa malliin käännöksenomaisia rakenteita.

Malli osaa silti vastata suomeksi, koska kyvyt siirtyvät osittain kielten välillä. Sama sisäinen esitys palvelee montaa kieltä, joten englanniksi opittu päättelytapa toimii myös suomeksi kysyttäessä. Se, mikä ei siirry, on paikallinen faktatieto: Suomen lainsäädäntö, viranomaisten nimet ja menettelyt, kotimaiset palvelut ja alueellinen tieto. Lisäksi suomen taivutus pilkkoutuu useiksi tokeneiksi, mikä vaikuttaa sekä hintaan että laatuun. Tämä on avattu erikseen artikkelissa tokenit ja suomen kieli.

Näin puute näkyy vastauksissa

Tyypillinen oire ei ole kankea kieli vaan itsevarma sekaannus. Malli tuottaa uskottavan kuuloisen kuvauksen suomalaisesta etuudesta, hakemusmenettelystä tai virastosta, mutta yksityiskohdat ovat sekoitus useasta lähteestä ja osin vanhentuneita. Sujuvuus tulee kielimallin yleisestä kyvystä, sisältö ohuesta aineistosta, eikä käyttäjä näe eroa vastauksen pinnasta.

Synteettinen aineisto: malli opettaa mallia

Aineiston niukkuutta paikataan yhä useammin tekstillä, jonka toinen malli on tuottanut. Tätä kutsutaan synteettiseksi aineistoksi, ja sitä käytetään erityisesti hienosäätövaiheessa, jossa mallille opetetaan haluttu vastaustapa. Vaiheiden ero on kuvattu artikkelissa näin kielimalli koulutetaan.

Synteettisellä aineistolla on selviä etuja. Sitä voi tuottaa juuri niistä tehtävistä ja kielistä, joista aitoa aineistoa on vähän, sen muoto on hallittavissa eikä siihen liity samanlaisia tekijänoikeuskysymyksiä kuin verkosta kerättyyn tekstiin. Suomen kaltaiselle pienelle kielelle tämä on käytännössä yksi harvoista tavoista lisätä opetusmateriaalin määrää.

Riskit ovat yhtä selviä. Synteettinen teksti perii lähdemallin virheet, tyylitottumukset ja sokeat pisteet, ja se on keskimääräisempää kuin ihmisen kirjoittama teksti. Jos kierrosta toistetaan, aineiston kirjo kapenee ja harvinaiset ilmaisut katoavat, koska malli tuottaa todennäköisiä jatkoja eikä epätodennäköisiä. Käännetystä aineistosta puolestaan seuraa suomea, joka on kieliopillisesti oikein mutta rakenteeltaan englantia.

Vapaasti kerättävä teksti ei ole loputon

Pitkään aineiston hankinta oli lähinnä tekninen kysymys: mitä enemmän tekstiä, sitä parempi malli. Tilanne on muuttunut kahdesta suunnasta. Julkaisijat ovat alkaneet rajoittaa ryömintää sivustojensa asetuksilla ja varata oikeutensa koneelliseen louhintaan, ja samalla mallien tekijät ovat siirtyneet tekemään maksullisia sopimuksia arkistoista ja kuva-aineistoista. Verkosta vapaasti kerättävän laadukkaan tekstin osuus siis pienenee, vaikka verkon kokonaismäärä kasvaa.

Toinen muutos on hitaampi mutta merkittävämpi. Yhä suurempi osa uudesta verkkotekstistä on itsekin koneellisesti tuotettua. Kun seuraavan sukupolven aineistoa kerätään, siihen päätyy väistämättä edellisen sukupolven mallien tuotoksia, eikä niitä pysty erottamaan luotettavasti. Käytännössä tämä korostaa kahta asiaa: ennen laajaa tekoälykäyttöä syntyneen aineiston arvoa ja sellaisten aineistojen arvoa, joiden alkuperä on dokumentoitu ja sopimuksin varmistettu.

Miksi aineistoluetteloa ei yleensä julkaista

Malleista kerrotaan usein parametrien määrä ja arkkitehtuuri, mutta harvoin täsmällinen aineistoluettelo. Syyt ovat käytännöllisiä eivätkä pelkästään salamyhkäisyyttä:

  • Tekijänoikeus. Tarkka luettelo lähteistä on samalla luettelo mahdollisista vaatimuksista, ja aineiston uudelleenjakelu olisi usein lisenssien vastaista.
  • Henkilötiedot. Aineiston julkaiseminen levittäisi siihen päätyneet henkilötiedot uudelleen.
  • Kilpailuetu. Aineiston koostumus ja sekoitussuhteet ovat iso osa mallin laatua, ja ne on helppo kopioida.
  • Arviointien luotettavuus. Julkinen luettelo helpottaisi mallin virittämistä juuri niitä testejä varten, joilla sitä mitataan.

EU:n tekoälyasetus siirtää tätä hieman avoimempaan suuntaan. Yleiskäyttöisten mallien tarjoajilta edellytetään riittävän yksityiskohtaista tiivistelmää opetuksessa käytetystä sisällöstä sekä tekijänoikeuskäytäntöä. Kyse on tiivistelmästä, ei aineiston julkaisemisesta. Velvoitteet on käyty tarkemmin läpi artikkelissa yleiskäyttöisten mallien velvoitteet, ja aineiston vinoumien vaikutus vastauksiin artikkelissa tekoälyn vinoumat.

Näin arvioit mallin sokeat pisteet itse

Koska aineistoa ei voi lukea, sitä pitää koestaa. Tämä vie muutaman minuutin ja kertoo enemmän kuin yksikään markkinointilupaus.

  1. Selvitä aikaraja. Kysy, mihin asti mallin tiedot ulottuvat, ja muista että vastaus on itsekin epävarma. Ilmiö on selitetty artikkelissa tiedon katkaisupäivä.
  2. Kysy kolme asiaa, jotka tiedät varmasti. Valitse oman alasi tai oman kuntasi tarkkoja yksityiskohtia, joiden oikean vastauksen tunnistat heti.
  3. Kysy sama asia suomeksi ja englanniksi. Jos vastaukset eroavat sisällöllisesti, kyse on aineiston kielijakaumasta eikä sattumasta.
  4. Pyydä lähteet ja avaa ne. Jos linkit eivät aukea tai eivät sisällä väitettyä tietoa, aihealue on aineistossa ohut.
  5. Testaa harvinainen tapaus. Yleinen kysymys onnistuu lähes aina. Ero syntyy reunatapauksissa, joissa esimerkkejä on ollut vähän.
  6. Älä lue varmuutta osaamiseksi. Vastauksen sävy ei kerro aineiston kattavuudesta mitään, joten tarkastus on tehtävä sisällöstä.

Käytännön johtopäätös on yksinkertainen. Malli on hyvä siellä, missä maailma on kirjoittanut paljon tekstiä, ja epäluotettava siellä, missä tekstiä on vähän. Suomalainen paikallistieto kuuluu jälkimmäiseen ryhmään, joten sen kohdalla kannattaa käyttää mallia luonnostelijana ja hakea varmistus alkuperäisestä lähteestä.

Usein kysytyt kysymykset

Onko oma verkkosivuni tai someviestini käytetty tekoälyn opettamiseen?

Julkisesti verkossa oleva teksti on voinut päätyä ryömintäaineistoon, eikä siitä ilmoiteta erikseen. Varmuutta yksittäisen sivun kohdalla ei yleensä ole saatavilla, koska aineistoluetteloita ei julkaista. Sivuston ylläpitäjä voi rajoittaa ryömintää sivuston omilla asetuksilla, mutta se vaikuttaa vain jatkossa kerättävään aineistoon.

Miksi tekoäly puhuu hyvää suomea mutta erehtyy suomalaisissa asioissa?

Kielen sujuvuus opitaan rakenteesta, joka siirtyy osin kielten välillä, kun taas paikallinen faktatieto vaatii nimenomaan suomenkielisiä tekstejä aiheesta. Suomenkielistä aineistoa on aineistoissa vähän, ja osa siitä on konekäännettyä. Siksi kieli kuulostaa oikealta silloinkin, kun sisältö ei ole.

Muuttuuko malli, kun kirjoitan sille?

Ei automaattisesti. Keskustelu vaikuttaa vain käynnissä olevaan istuntoon, ja mallin parametrit pysyvät samoina. Palvelu voi kuitenkin tallentaa keskustelut ja käyttää niitä myöhemmin uuden version opettamiseen, jos käyttöehdot sen sallivat ja et ole kieltänyt sitä asetuksista.

Voiko malli toistaa opetusaineistoa sanatarkasti?

Voi, jos sama teksti on esiintynyt aineistossa hyvin monta kertaa. Tämä on yksi tärkeimmistä syistä poistaa päällekkäisyydet ennen opetusta. Ilmiö on harvinainen tavallisessa käytössä, mutta se on todellinen tekijänoikeuden ja henkilötietojen kannalta.

Onko synteettinen aineisto huonompaa kuin ihmisen kirjoittama?

Ei suoraan huonompaa, vaan erilaista. Se on tasalaatuisempaa ja helpommin kohdennettavaa, mutta samalla keskimääräisempää ja se perii lähdemallin virheet. Parhaat tulokset saadaan yleensä yhdistelmästä, jossa synteettinen aineisto täydentää aitoa eikä korvaa sitä.

Mistä tiedän, millaisella aineistolla käyttämäni malli on opetettu?

Katso palveluntarjoajan julkaisemat mallikortit ja dokumentaatio, joissa kuvataan aineiston tyypit yleisellä tasolla. EU:n tekoälyasetus edellyttää yleiskäyttöisten mallien tarjoajilta tiivistelmää opetussisällöstä, mutta tiivistelmä ei kerro yksittäisistä lähteistä. Käytännön arvio syntyy testaamalla mallia oman aihealueesi kysymyksillä.

Takaisin ylös