Tekoälysisällön tunnistaminen
Tekoälyllä kirjoitettu teksti: mistä sen todella tunnistaa
Tekoälytekstin tunnistamista myydään havaintotehtävänä, jossa tarkka lukija näkee koneen kädenjäljen. Todellisuudessa tyyli kertoo vähän ja sisältö paljon, eikä kumpikaan riitä syytökseksi.
Lyhyt vastaus
Tekstistä ei voi luotettavasti päätellä, kirjoittiko sen kone vai ihminen. Tyypilliset rakennepiirteet, kuten tasapainoinen kappalejako ja kolmen sarjat, ovat peräisin ihmisten kirjoittamasta aineistosta ja katoavat yhdellä muokkauskierroksella. Käyttökelpoisin merkki on sisällön tyhjyys eli konkretian puute, mutta sekään ei ole todiste vaan laatuhavainto. Tarkista siis teksti faktojen kautta, älä tyylin, ja jos tarvitset varmuuden kirjoittajasta, kysy prosessista.
Sisällys
- Miksi tyyli ei kelpaa todisteeksi
- Rakennepiirteet, jotka toistuvat koneen tekstissä
- Sisällön tyhjyys on parempi mittari kuin tyyli
- Suomen kielessä näkyy käännöksen jälki
- Näin tarkistat tekstin faktojen kautta
- Miksi vaikutelmaan ei voi perustaa syytöstä
- Kun tekstin tarkoitus on huijata
- Mitä tunnistamisesta jää käteen
- Usein kysytyt kysymykset
- Lähteet ja lisälukemista
Tekoälytekstin tunnistamisesta puhutaan kuin se olisi havaintotehtävä. Katso tarkkaan, niin näet koneen kädenjäljen. Näin se ei toimi, ja syy on menetelmässä. Kielimalli on opetettu ennustamaan, miten ihmisten kirjoittama teksti jatkuu, joten se osuu tavanomaiseen ilmaisuun paremmin kuin useimmat ihmiset. Jokainen piirre, jota pidät koneen merkkinä, on alun perin poimittu ihmisten teksteistä.
Tässä artikkelissa käsitellään vain tekstiä. Kuvan, videon ja äänen tunnistaminen toimii eri logiikalla, ja se käydään läpi artikkelissa tekoälyllä tehdyn kuvan, videon ja tekstin tunnistaminen. Ohjelmat, jotka lupaavat prosenttiluvun tekstin alkuperästä, ovat oma lukunsa, ja niitä käsitellään artikkelissa tekoälytunnistimet ja niiden väärät syytökset.
Miksi tyyli ei kelpaa todisteeksi
Malli valitsee seuraavan sananpalan sen mukaan, mikä on aineiston perusteella todennäköisin jatko. Yksityiskohtainen selitys löytyy artikkelista miten kielimalli toimii, mutta tunnistamisen kannalta olennaista on yksi seuraus: todennäköinen teksti on keskimääräistä tekstiä. Se ei ole outoa, ei erikoista eikä persoonallista. Se on sitä, mitä kaikki muutkin kirjoittavat.
Tähän tulee päälle hienosäätö. Avustajaksi viritetty malli on opetettu palautteen avulla kirjoittamaan kohteliaasti, tasapainoisesti ja jäsennellysti. Nämä piirteet eivät ole koneen sormenjälki vaan tuotepäätös, ja ne muuttuvat versiosta toiseen. Sama vaikutus saadaan aikaan kehotteella: yksi lause promptissa vaihtaa rekisterin toiseksi. Myös asetukset vaikuttavat, sillä lämpötilaksi kutsuttu säätö ratkaisee, kuinka tavanomaisia sanavalintoja malli tekee. Matalalla asetuksella teksti on tasaista ja ennustettavaa, korkealla se rönsyilee. Kumpikin on saman mallin tuotos.
Looginen ongelma on yleisyydessä. Vaikka valtaosassa koneen kirjoittamista teksteistä olisi piirre X, se ei auta, jos piirre X on yleinen myös ihmisten teksteissä. Suurin osa maailman asiatekstistä on tylsää, tasapainoista ja mallipohjan mukaista, koska ihmiset kirjoittavat työkseen raportteja, hakemuksia ja tiedotteita. Kun tällaista tekstiä lukee epäilevin silmin, jokainen sen tavanomaisuus alkaa näyttää todisteelta.
Käytännössä vastassa on vielä kolmas ongelma. Suuri osa teksteistä on syntynyt yhteistyössä: ihminen on kirjoittanut rungon ja pyytänyt mallilta muotoilua, tai malli on tuottanut luonnoksen, jonka ihminen on kirjoittanut uusiksi. Näissä ei ole kahta luokkaa vaan jatkumo, eikä jatkumon keskeltä voi tunnistaa rajaa, jota ei ole.
Rakennepiirteet, jotka toistuvat koneen tekstissä
Piirteitä kannattaa silti tuntea, kunhan ymmärtää niiden arvon. Tyypillisiä ovat seuraavat.
Epäluonnollinen tasapaino. Jokainen kappale on suunnilleen yhtä pitkä ja jokainen osio saa yhtä paljon tilaa, vaikka aiheet olisivat eriarvoisia. Ihminen kirjoittaa pitkästi siitä, mistä hän tietää eniten.
Kolmen sarjat ja vastakkainasettelut. Luetteloissa on kolme kohtaa, ja lauseet rakentuvat pareiksi tyyliin "ei vain tämä, vaan myös tuo". Rakenne on kaunis mutta tyhjä.
Kehämäinen jäsennys. Aloitus kertoo, mitä tullaan käsittelemään, lopetus kertoo, mitä käsiteltiin, ja väliin jää vähemmän kuin kehykset lupaavat.
Kohteettomat varaukset. Tekstissä esiintyvät "monet asiantuntijat", "tutkimusten mukaan" ja "on tärkeää huomata", mutta asiantuntijaa, tutkimusta tai huomion syytä ei nimetä.
Kaiken tasapuolinen esittäminen. Myös selvä asia saa vastapuolen. Malli on opetettu välttämään kantaa, joten se tuottaa symmetriaa sinnekin, missä sitä ei ole.
| Piirre | Miksi se syntyy | Mitä se ei kerro |
|---|---|---|
| Tasapituiset kappaleet | Malli tuottaa tekstiä tasaisella rytmillä ilman painotusta | Ei kerro mitään kirjoittajasta, sillä sama syntyy mallipohjasta |
| Kolmen sarjat | Luettelon todennäköisin pituus opetusaineistossa | Yleinen myös retoriikan oppineilla ihmisillä |
| Kohteettomat varaukset | Hienosäätö palkitsee varovaisuudesta | Sama piirre on kiireessä kirjoitetussa ihmistekstissä |
| Ylikohtelias sävy | Avustajaksi viritetty vastaustyyli | Katoaa yhdellä kehotteella tai editoinnilla |
| Otsikot ilman väitettä | Malli jäsentää aiheittain, ei argumentin mukaan | Tavallista myös oppikirjoissa ja raporteissa |
Kaikilla näillä on sama heikkous. Ne katoavat, kun tekstiä muokataan viisi minuuttia tai kun kirjoittaja pyytää mallilta toisenlaista tyyliä. Piirteet siis rankaisevat sitä, joka käyttää työkalua avoimesti ja huolimattomasti, eivätkä osu siihen, joka peittelee.
Sisällön tyhjyys on parempi mittari kuin tyyli
Käyttökelpoisin havainto ei ole se, miltä teksti kuulostaa, vaan se, kuinka paljon siinä on tarkistettavaa. Kielimalli tuottaa kieliopillisesti täyden lauseen ilman, että sillä on asiaa. Ihmisasiantuntijan tekstissä on kitkaa: rajauksia, poikkeuksia, yksittäistapauksia ja kohtia, joissa yleinen sääntö ei päde.
Tee tekstille yksinkertainen koe. Käy kappaleet läpi ja yritä tiivistää jokainen yhdeksi väitteeksi, jonka voisi periaatteessa osoittaa vääräksi. Jos tiivistys on "aihe on monitahoinen ja vaatii huolellista harkintaa", kappale ei sanonut mitään. Jos moni kappale menee samoin, teksti on tyhjä riippumatta siitä, kuka sen kirjoitti.
Konkretian puute näkyy erityisesti näissä kohdissa: paikkakunnat, päivämäärät, viranomaisten oikeat nimet, hinnat ja määrät, prosessin todelliset vaiheet, poikkeukset sääntöön, ja se mitä tapahtuu kun asia menee pieleen. Malli tuottaa mieluummin kategorian kuin yksityiskohdan, koska kategoria on todennäköisempi.
Toinen sisällöllinen merkki ovat viitteet. Kun teksti viittaa lähteeseen, avaa se. Keksityt lähteet ja linkit ovat kielimallien tunnetuin sisällöllinen virhe, koska viitteen muoto on mallille helppo tuottaa mutta sen olemassaolo ei ole. Sama koskee sitaatteja, pykäliä ja tutkimusten nimiä.
Kysymys ei lopulta ole siitä, kuka tekstin kirjoitti, vaan siitä, pitääkö se paikkansa.
Suomen kielessä näkyy käännöksen jälki
Suomenkielisessä tekstissä on merkkejä, joita englanninkielisessä ei ole. Ne johtuvat siitä, että opetusaineisto on valtaosin englantia ja että suomen taivutus pilkkoutuu malleissa moneksi palaksi. Ilmiö on selitetty artikkelissa tokenit ja suomen kieli, ja sen käytännön seuraus on, että suomi on mallille kalliimpaa ja epävarmempaa kuin englanti.
Tyypillisiä jälkiä ovat englannin lauserakenteen läpi kuultaminen ("on tärkeää huomata, että"), tarpeettomat persoonapronominit omistusliitteen rinnalla, sanasta sanaan käännetyt idiomit, verbien rektiot väärin harvinaisissa yhteyksissä, yhdyssanojen kirjoittaminen erikseen ja otsikot, joissa jokainen sana alkaa isolla kirjaimella englannin tapaan. Joskus sanavalinta on sanakirjan mukaan oikea mutta väärässä rekisterissä, esimerkiksi juhlava sana arkisessa ohjeessa.
Merkit ovat myös epävakaita. Suomea käsittelevät mallit paranevat, ja moni edellä mainituista piirteistä on jo harvinaisempi kuin se oli aiemmissa versioissa. Vinkkilista, joka toimi viime vuonna, voi tänä vuonna osoittaa vain sen, että käytössä on ollut halvempi tai vanhempi työkalu.
Näiden merkkien tulkinnassa on kuitenkin vakava ongelma. Täsmälleen samat piirteet esiintyvät tekstissä, jonka on kirjoittanut ihminen, joka lukee paljon englantia, kääntää konekääntimellä, kirjoittaa kiireessä tai puhuu suomea toisena kielenä. Kielivirheisiin perustuva epäily osuu siis järjestelmällisesti niihin, joiden asema on jo valmiiksi heikoin.
Näin tarkistat tekstin faktojen kautta
Tämä menettely toimii riippumatta siitä, kuka tekstin kirjoitti, ja se on ainoa osa tunnistamista, joka tuottaa varmaa tietoa.
- Poimi väitteet. Merkitse jokainen lause, joka väittää jotain tarkistettavaa. Jäljelle jäävä osa on täytettä, ja sen määrä kertoo tekstin laadusta.
- Avaa jokainen linkki ja viite. Katso, vastaako kohdesivu sitä, mitä teksti väittää sen sanovan. Väärä sivu on painavampi havainto kuin mikään tyylipiirre.
- Tarkista nimet ja numerot alkuperäisestä lähteestä. Erityisen paljastavia ovat viranomaisten nimet, pykälänumerot ja päivämäärät, koska ne on helppo todentaa.
- Katso paikallinen yksityiskohta. Suomea koskevassa tekstissä virheelliset palvelut, väärät toimivaltuudet tai muualta lainattu käytäntö paljastuvat nopeasti.
- Arvioi ajantasaisuus. Jos teksti kuvaa vanhentunutta käytäntöä täydellisen varmasti, kyse voi olla mallin tiedon katkeamisesta tai vanhasta lähteestä.
- Kysy kirjoittajalta sisällöstä. Pyydä perustelemaan yksi kohta tarkemmin. Ymmärretty teksti kestää jatkokysymyksen, kopioitu ei.
Miksi vaikutelmaan ei voi perustaa syytöstä
Epäily syntyy helposti, mutta sen seuraukset ovat epäsymmetriset. Syytetty ei voi todistaa, ettei ole käyttänyt työkalua, koska kielteisen väitteen todistaminen ei ole mahdollista. Käytännössä epäily kääntää todistustaakan väärinpäin ja jättää ihmisen puolustautumaan tuntemattomalta vastustajalta.
Vaikutelma on lisäksi altis sille, kuka kirjoittaja on. Sujuvasti kirjoittava kokenut työntekijä ei joudu epäilyksen kohteeksi yhtä helposti kuin opiskelija tai vieraskielinen hakija, vaikka teksti olisi samanlaista. Tämä on syytä tunnistaa ennen kuin epäilyn lausuu ääneen.
Toimiva vaihtoehto on kysyä prosessista eikä tuloksesta. Miten teksti syntyi, mitä lähteitä käytettiin, mitä ensin kirjoitettiin ja miksi jokin kohta jätettiin pois. Luonnokset ja asiakirjan versiohistoria kertovat työn kulusta enemmän kuin lopputulos, ja niiden käyttö on tuttua kaikille, jotka ovat lukeneet miten tiedostojen jakaminen ja versiot työssä toimivat. Oppilaitoksissa ja työpaikoilla ratkaisu on sopia etukäteen, mikä käyttö on sallittua ja mitä pitää ilmoittaa. Aihetta käsitellään tarkemmin artikkelissa tekoäly opiskelussa.
Kun tekstin tarkoitus on huijata
Osassa tapauksia kysymys kirjoittajasta on väärä. Huijausviesteissä, tekaistuissa arvosteluissa ja massana tuotetussa sisällössä ei ole väliä, tuottiko tekstin kone vai ihminen. Merkitystä on sillä, kuka hyötyy ja mitä sinun halutaan tekevän.
Tämä on tärkeä rajaus, koska iso osa tekoälytekstistä käytävästä keskustelusta sekoittaa kaksi eri asiaa. Toinen on kysymys tekijästä, joka koskee kouluja ja työpaikkoja ja jossa ratkaisu on sopimus ja keskustelu. Toinen on kysymys petoksesta, jossa ratkaisu on sama kuin ennenkin: älä toimi viestin pyytämällä tavalla, vaan tarkista asia toista reittiä.
Näissä tapauksissa hyödyllisimmät havainnot ovat määrä ja ajoitus. Sama rakenne toistuu kymmenissä viesteissä, tilit ovat uusia ja historiattomia, ja viestin kärki on aina toiminnassa: klikkaa, maksa, vahvista. Kieli on nykyään sujuvaa, joten vanha neuvo tunnistaa huijaus kielivirheistä on vanhentunut. Tätä muutosta käsitellään artikkelissa tekoäly huijarin työkaluna.
Mitä tunnistamisesta jää käteen
Realistinen lopputulos on epämukava mutta selkeä. Tekstin alkuperää ei voi todeta tekstistä, ja mitä paremmaksi mallit tulevat, sitä varmemmin näin on. Sen sijaan tekstin laadun voi todeta, ja se on useimmissa tilanteissa se asia, jolla on merkitystä.
Käy nämä läpi ennen kuin teet johtopäätöksen:
- Kuinka monta tarkistettavaa väitettä tekstissä on suhteessa sen pituuteen?
- Pitävätkö viitteet, nimet ja numerot paikkansa alkuperäisessä lähteessä?
- Onko tekstissä yksityiskohtia, joita ulkopuolinen ei voisi keksiä?
- Kestääkö kirjoittaja jatkokysymyksen sisällöstä?
- Onko sinulla mitään todistetta pelkän vaikutelman lisäksi?
Jos vastaus viimeiseen on ei, älä esitä syytöstä. Puhu tekstistä.
Usein kysytyt kysymykset
Voiko tekoälytekstin tunnistaa varmasti?
Ei voi. Yksikään tekstistä tehty havainto ei erottele luotettavasti konetta ihmisestä, koska malli on opetettu jäljittelemään ihmisten kirjoitusta ja koska muokkaus poistaa tyypilliset piirteet. Varmuus edellyttäisi tietoa kirjoitusprosessista, ei tekstistä.
Onko ajatusviivan käyttö merkki tekoälystä?
Ei sinänsä. Yksittäinen välimerkki on tyylipiirre, joka on yleinen myös englannista vaikutteita saaneessa ihmistekstissä. Välimerkkiin perustuva päättely on juuri sen tyyppinen havainto, joka tuottaa vääriä syytöksiä.
Miksi teksti tuntuu tekoälyltä, vaikka en osaa sanoa miksi?
Vaikutelma syntyy yleensä sisällön tyhjyydestä eikä yksittäisistä sanoista. Teksti etenee sujuvasti mutta ei sano mitään tarkistettavaa. Sama tunne tulee myös huolimattomasti kirjoitetusta ihmistekstistä.
Auttaako tekstin syöttäminen tunnistinohjelmaan?
Ei riittävästi. Tunnistin antaa prosenttiluvun, joka ei ole todennäköisyys eikä todiste, ja se merkitsee järjestelmällisesti väärin selkeästi ja yksinkertaisesti kirjoitettuja tekstejä. Aihetta käsitellään erikseen tunnistimia koskevassa artikkelissa.
Miten opettaja tai esihenkilö voi toimia epäilytilanteessa?
Keskustelemalla sisällöstä ja prosessista. Pyydä selittämään yksi kohta tarkemmin, näyttämään luonnokset tai lähteet ja kertomaan, miten teksti syntyi. Päätös on perusteltava näillä havainnoilla, ei vaikutelmalla tai ohjelman antamalla luvulla.
Kannattaako tekoälyn käyttö ilmoittaa itse?
Kannattaa, jos säännöt sitä edellyttävät tai jos et tiedä miten niihin suhtaudutaan. Avoin maininta käytöstä siirtää keskustelun tekstin laatuun, ja se poistaa riskin siitä, että sinua epäillään jälkikäteen ilman mahdollisuutta osoittaa toisin.
Muuttuvatko nämä tunnistusvinkit ajan myötä?
Muuttuvat, ja nopeasti. Tyylipiirteet ovat sidoksissa siihen, millaiseksi mallit on kulloinkin viritetty, joten julkinen tunnistusvinkki on samalla korjauslista kehittäjille. Sisältöön ja faktoihin perustuva tarkistus ei vanhene samalla tavalla.