Hallusinaatiot ja virheet
Tiedon katkaisupäivä: miksi tekoäly ei tunne viime viikkoa
Kielimallin tieto loppuu johonkin ajankohtaan, mutta raja ei ole terävä eikä malli tunne sitä itse. Tästä syntyy virheitä, jotka eivät näytä virheiltä.
Lyhyt vastaus
Kielimalli on oppinut aineistosta, joka on kerätty ennen mallin julkaisua. Sen jälkeisistä tapahtumista sillä ei ole tietoa, eikä se saa niistä tietoa käytön aikana, koska keskustelu ei muuta mallia. Raja ei kuitenkaan ole tarkka päivä: aineistoa on kerätty eri lähteistä eri aikoina, ja aivan viimeisistä kuukausista on selvästi vähemmän tekstiä kuin sitä aiemmasta ajasta. Malli ei myöskään tiedä nykyistä päivämäärää ellei sitä kerrota sille, joten se voi vastata vanhentuneella tiedolla täysin varmaan sävyyn.
Sisällys
- Mikä katkaisupäivä oikeasti on
- Miksi raja ei ole terävä
- Viimeiset kuukaudet ovat heikointa tietoa
- Miksi malli ei tiedä omaa päivämääräänsä
- Mitkä tiedot vanhenevat nopeasti
- Verkkohaku korjaa osan, ei kaikkea
- Varmuus ei kerro tiedon iästä
- Näin kysyt niin, että tiedon ikä tulee näkyviin
- Usein kysytyt kysymykset
- Lähteet ja lisälukemista
Kysyt tekoälyltä, mikä on jonkin palvelun nykyinen hinta tai kuka hoitaa tiettyä tehtävää. Saat vastauksen, joka on täsmällinen, sujuva ja auttavainen. Se on myös vanhentunut, eikä vastauksessa ole mitään, mikä kertoisi siitä. Tämä on kielimallin ajallinen rajoite, ja se on eri asia kuin keksiminen. Tässä käsitellään vain vanhentunutta tietoa. Sepittäminen, jossa väite ei ollut koskaan totta, on oma ilmiönsä ja se selitetään artikkelissa miksi tekoäly keksii asioita.
Ero on käytännössä tärkeä. Keksitty väite hajoaa yleensä heti, kun sitä yrittää tarkistaa. Vanhentunut väite ei hajoa: siitä löytyy lähteitä, keskustelua ja vanhoja ohjeita, jotka kaikki tukevat sitä. Se oli oikein silloin kun se kirjoitettiin.
Mikä katkaisupäivä oikeasti on
Kielimalli syntyy kahdessa vaiheessa. Ensin se oppii valtavasta tekstiaineistosta ennustamaan tekstin jatkoa, ja sitten sitä hienosäädetään käyttäytymään avustajana. Molemmat vaiheet on tehty ennen kuin malli julkaistaan, ja aineisto on kerätty ennen niitä. Vaiheet käydään tarkemmin läpi artikkelissa näin kielimalli koulutetaan.
Katkaisupäivä tarkoittaa sitä ajankohtaa, johon asti opetusaineisto ulottuu. Sen jälkeen tapahtuneesta mallilla ei ole tekstiä, josta oppia. Käytön aikana tilanne ei muutu, koska yksittäinen keskustelu ei muuta mallin parametreja. Malli voi lukea sen mitä liität keskusteluun, mutta se ei jää muistiin seuraavaa käyttäjää varten.
Katkaisupäivä ei myöskään ole sama asia kuin julkaisupäivä. Aineiston keruun ja julkaisun väliin jää koulutus, testaus ja turvallisuusarviointi. Siksi uusikin malli on ajallisesti jäljessä jo silloin kun se otetaan käyttöön.
Miksi raja ei ole terävä
Katkaisupäivä ilmoitetaan yleensä yhtenä kuukautena, mikä antaa harhaanjohtavan kuvan tarkkuudesta. Todellisuudessa aineisto on koottu monesta lähteestä, joilla on eri keruuajat. Osa kokoelmista on vuosia vanhoja, osa tuoreita. Hienosäätövaiheessa on voitu lisätä uudempaa materiaalia. Lopputulos on epätasainen: malli voi tuntea jonkin katkaisun jälkeisen asian, koska se sattui olemaan mukana myöhemmässä aineistossa, ja olla tuntematta jotain selvästi aiempaa, koska siitä ei ollut tekstiä lainkaan.
Tämä epätasaisuus on sama ilmiö kuin muutkin aineiston sokeat pisteet, joita käsitellään artikkelissa mistä tekoäly on opetettu. Ajallinen raja on vain yksi aineiston reuna muiden joukossa. Kielien, alojen ja maantieteen reunat toimivat samalla tavalla.
Toinen syy epätarkkuuteen on se, että saman nimisen palvelun takana oleva malli vaihtuu. Kun palveluntarjoaja ottaa käyttöön uuden mallin, katkaisupäivä siirtyy, vaikka käyttöliittymä näyttäisi täsmälleen samalta. Käyttäjän kannalta tämä tarkoittaa, ettei kerran havaittua rajaa voi pitää pysyvänä. Sama kysymys voi saada kuukauden päästä paremman tai vain toisella tavalla puutteellisen vastauksen.
Käytännön seuraus: älä päättele katkaisupäivästä liikaa. Se kertoo, mihin asti tietoa voi olla, ei sitä mitä mallille todella jäi.
Viimeiset kuukaudet ovat heikointa tietoa
Tässä on kohta, joka yllättää monet. Tuoreinta tietoa mallissa on vähemmän kuin muutamaa vuotta vanhempaa tietoa, vaikka molemmat ovat katkaisupäivän sisällä.
Syy on aineiston kertymisen viive. Tapahtumasta kirjoitetaan ensin lyhyesti, sitten laajemmin, ja lopulta se päätyy koosteisiin, oppaisiin, tietosanakirjoihin ja keskusteluihin. Tämä kertyminen kestää kuukausia tai vuosia. Kun aineisto kerätään, viimeisistä kuukausista on olemassa vasta ensimmäinen ohut kerros tekstiä, ja siitä kerroksesta osa on virheellistä, koska varhaiset tiedot ovat usein keskeneräisiä.
Käytännössä tämä tarkoittaa kolmea asiaa:
- Katkaisua edeltävien kuukausien tapahtumat tunnetaan huonosti ja epätarkasti.
- Niistä puuttuvat korjaukset ja täsmennykset, jotka olisivat tulleet myöhemmin.
- Malli painottaa vanhempaa ja runsaammin edustettua tietoa, joten se voi kertoa vanhentuneen käytännön ohi tuoreemman.
Sama viive selittää sen, miksi malli tuntee vakiintuneet asiat, kuten viranomaisen tehtävät tai lain rakenteen, huomattavasti paremmin kuin äskettäin muuttuneet yksityiskohdat.
Miksi malli ei tiedä omaa päivämääräänsä
Mallissa ei ole kelloa. Se ei havaitse ajan kulumista kutsujen välillä, eikä sillä ole pääsyä laitteesi kalenteriin. Jos palvelu haluaa mallin tietävän päivämäärän, se kirjoittaa sen keskustelun alkuun taustaohjeeseen. Tämä on yksi järjestelmäkehotteen tavallisimmista tehtävistä, ja se on syy siihen, miksi jotkin assistentit tietävät päivän ja toiset eivät.
Ilman tuota tietoa malli päättelee ajankohdan aineistostaan. Päättely menee tyypillisesti liian aikaiseen suuntaan, koska viimeisin vuosi esiintyy aineistossa harvemmin kuin sitä edeltäneet vuodet. Malli siis arvaa sen ajan, joka näyttää sen tekstien perusteella nykyhetkeltä.
Tästä seuraa virheitä, joita ei osaa odottaa. Ikälaskut menevät pieleen, "viimeisin versio" tarkoittaa vanhaa versiota, ja "tällä hetkellä" viittaa hetkeen, joka on ohi. Kun kysyt aikaan sidottua asiaa, kerro päivämäärä kehotteessa. Se ei tee mallista ajantasaista, mutta se poistaa yhden virhelähteen kokonaan.
Mitkä tiedot vanhenevat nopeasti
Kaikki tieto ei vanhene samaa vauhtia. Tämä taulukko auttaa arvioimaan, milloin tarkistus on pakollinen.
| Aihe | Vanheneminen | Mistä tarkistat |
|---|---|---|
| Hinnat, kampanjat ja kiintiöt | Erittäin nopeaa | Palveluntarjoajan oma sivu |
| Lait, verokannat ja määräajat | Nopeaa | Finlex ja viranomaisen sivu |
| Ohjelmistoversiot ja tuen päättyminen | Nopeaa | Valmistajan tukisivu |
| Sovellusten valikkopolut ja asetukset | Nopeaa | Sovellus itse |
| Henkilöt ja organisaatioiden tehtävät | Keskinopeaa | Organisaation verkkosivu |
| Standardit ja protokollat | Hidasta | Standardin julkaisija |
| Käsitteet, mekanismit ja historia | Hyvin hidasta | Ei yleensä tarvetta |
Taulukon alaosa on se, mihin kielimalli sopii hyvin. Kun kysyt miten jokin toimii ja miksi, ajallinen rajoite ei juuri haittaa. Kun kysyt mitä juuri nyt on voimassa, rajoite ratkaisee vastauksen laadun.
Erityisen petollisia ovat valikkopolut. Ohje "avaa asetukset, valitse tietosuoja ja sieltä sijainti" kuulostaa täsmälliseltä, mutta käyttöliittymät muuttuvat päivitysten myötä. Jos ohje ei täsmää näkemääsi, syy on usein tämä eikä se, että teet väärin. Sama koskee laitteiden tukiaikoja, joita käsitellään artikkelissa tuen päättyminen.
Verkkohaku korjaa osan, ei kaikkea
Moni assistentti osaa hakea verkosta ja liittää löydetyn tekstin vastauksen pohjaksi. Menetelmän rakenne selitetään artikkelissa RAG vai hienosäätö. Ajantasaisuuden kannalta se on merkittävä parannus, mutta siihen jää neljä aukkoa.
- Hakua ei aina tehdä. Malli päättää itse, tarvitaanko hakua. Jos kysymys näyttää yleistiedolta, se voi vastata muistista, vaikka vastaus olisi vanhentunut.
- Haku löytää vanhaa sisältöä. Verkossa on paljon sivuja, joita ei ole päivitetty. Hakutulos voi olla vuosien takainen opas, jonka päivämäärä ei näy tekstissä.
- Haettu ja muistettu sekoittuvat. Vastauksessa voi olla sekä hausta tullutta että aineistosta muistettua tietoa, eikä niitä yleensä erotella lukijalle.
- Tuoreimmat tapahtumat ovat epäselviä myös verkossa. Aivan tuoreesta asiasta ensimmäiset kirjoitukset ovat keskeneräisiä, ja malli tiivistää ne itsevarmaan muotoon.
Milloin haku kannattaa ja milloin tavallinen hakukone on parempi, on oma kysymyksensä, jota käsitellään artikkelissa tekoälyhaku vai hakukone. Nyrkkisääntö: mitä lähempänä kysymys on tätä päivää, sitä varmemmin kannattaa mennä suoraan alkuperäiselle sivulle.
Varmuus ei kerro tiedon iästä
Vanhentuneen vastauksen tunnistaa harvoin sävystä. Malli kirjoittaa vanhan tiedon täsmälleen yhtä vakuuttavasti kuin ajantasaisen, koska kumpikin on sille pelkkää todennäköistä tekstiä. Vastauksessa ei ole aikaleimoja, eikä siinä ole eroa muistin ja tuoreen havainnon välillä.
Vanhentunut tieto on tekoälyn vaarallisin virhelaji juuri siksi, että se on tarkistettavissa. Se löytyy verkosta, se on ollut totta, ja se johtaa silti väärään toimintaan tänään.
Moni assistentti kyllä varoittaa ajantasaisuudesta, mutta varoitus tulee epäjohdonmukaisesti. Se voi ilmestyä kysymykseen, jossa tieto ei ole muuttunut vuosikymmeneen, ja jäädä pois kysymyksestä, jossa käytäntö muuttui viime kuussa. Varoitus on osa vastauksen tyyliä, ei tulos siitä, että malli olisi arvioinut oman tietonsa ikää. Sen puuttumisesta ei siis voi päätellä mitään.
Käytännön ero näkyy tarkistuksessa. Kun tarkistat sepitettyä väitettä, etsit onko lähdettä olemassa. Kun tarkistat vanhentunutta väitettä, etsit milloin lähde on kirjoitettu. Julkaisupäivä on siksi ensimmäinen asia, joka sivulta kannattaa katsoa.
Näin kysyt niin, että tiedon ikä tulee näkyviin
Nämä ovat pieniä muutoksia kysymykseen, ja ne siirtävät ajan näkyväksi osaksi vastausta.
- Kerro päivämäärä. Aloita kehote toteamalla tämän päivän päivämäärä. Se korjaa ikälaskut ja määräajat ilman muuta vaivaa.
- Pyydä ajankohta jokaiselle aikaan sidotulle väitteelle. Ohje "merkitse jokaiseen kohtaan, minkä ajan tilanteesta puhut" paljastaa, mitkä kohdat ovat muistinvaraisia.
- Kysy erikseen, mikä tässä on voinut muuttua. Malli osaa usein nimetä juuri ne kohdat, jotka tyypillisesti päivittyvät, vaikka se ei tiedä niiden nykytilaa.
- Pyydä lähteen julkaisupäivä. Jos assistentti hakee verkosta, pyydä se merkitsemään jokaisen käytetyn sivun päivämäärä.
- Käytä mallia jäsentämiseen ja viranomaista lukuihin. Anna mallin selittää, miten asia toimii, ja hae voimassa oleva yksityiskohta itse. Mistä mikäkin asia hoituu, kerrotaan artikkelissa viranomaisasiointi verkossa.
Nämä kysymykset kannattaa aina tarkistaa muualta: rahasummat ja hinnat, määräajat ja voimassaoloajat, lakien ja tukien ehdot, terveystiedot, aukioloajat ja yhteystiedot sekä ohjelmistojen ja laitteiden tukitilanne. Yhteistä näille on se, että vanha vastaus on uskottava ja väärä toiminta maksaa. Kaikessa muussa ajallinen rajoite on lähinnä tiedostettava reunaehto, ei este.
Usein kysytyt kysymykset
Mikä on tekoälyn tiedon katkaisupäivä?
Se on ajankohta, johon asti mallin opetusaineisto ulottuu. Sen jälkeisistä tapahtumista mallilla ei ole tietoa, ellei se hae niitä verkosta käytön aikana. Raja ei ole tarkka, koska aineisto on kerätty useasta lähteestä eri aikoina.
Oppiiko tekoäly keskusteluista uutta tietoa?
Ei kesken keskustelun. Malli voi käyttää sitä mitä liität keskusteluun, mutta sen parametrit eivät muutu käytön aikana. Palvelu voi tallentaa keskusteluja myöhempää kehitystyötä varten, mutta sekään ei päivitä käytössä olevaa mallia reaaliajassa.
Miksi tekoäly luulee, että eletään eri vuotta?
Mallilla ei ole kelloa, joten se päättelee ajankohdan aineistostaan. Uusin vuosi on aineistossa aliedustettu, joten arvaus osuu tyypillisesti liian aikaiseen. Jos palvelu kertoo päivämäärän taustaohjeessa, ongelma poistuu.
Voiko katkaisupäivän kysyä mallilta itseltään?
Voi, mutta vastaukseen ei kannata luottaa sellaisenaan. Malli kertoo sen mitä sen ohjeissa lukee tai mitä se päättelee aineistostaan, ja arvio voi olla kuukausia pielessä. Luotettava tieto löytyy palvelun omasta dokumentaatiosta.
Auttaako verkkohaku siihen, että vastaus on ajan tasalla?
Auttaa merkittävästi, mutta ei aina. Malli päättää itse hakeeko se, hakutulos voi olla vanha sivu, ja vastauksessa haettu ja muistettu tieto sekoittuvat helposti. Tarkista siis silti lähteen päivämäärä.
Mistä huomaan, että vastaus on vanhentunut eikä keksitty?
Vanhentuneelle väitteelle löytyy lähteitä, mutta ne on kirjoitettu aikaisemmin. Keksitylle väitteelle ei löydy mitään. Käytännössä katso ensin löytyykö lähde, sitten milloin se on julkaistu.
Mihin kielimallia voi käyttää huoletta ajantasaisuuden suhteen?
Käsitteiden selittämiseen, tekstin muokkaamiseen, jäsentämiseen ja siihen, että ymmärrät miten jokin asia toimii. Nämä eivät muutu kuukausissa. Voimassa olevat luvut, ehdot ja versiot haetaan muualta.