selitetty.com

Hallusinaatiot ja virheet

Keksityt lähteet ja linkit: miksi tekoäly sepittää viitteitä

Tekoälyn antama lähdeluettelo on usein täydellisen näköinen ja silti tyhjä. Tässä on syy siihen sekä tarkistus, joka paljastaa sepitetyn viitteen minuutissa.

Lyhyt vastaus

Kielimalli tuottaa lähdeviitteen samalla tavalla kuin minkä tahansa muun tekstin: se jatkaa todennäköisintä muotoa. Viitteen rakenne on aineistossa hyvin säännöllinen, joten malli osaa tekijän, otsikon, julkaisun ja tunnisteen muodon, vaikka sillä ei olisi mitään tietoa juuri sen asiakirjan olemassaolosta. Siksi viite näyttää oikealta ja on silti keksitty. Ainoa toimiva vastalääke on avata jokainen viite ja tarkistaa, että se on olemassa ja että se sanoo sen mitä väitetään.

Sisällys
  1. Viite on muoto, ja muoto on juuri sitä mitä malli osaa
  2. Miksi viitteet menevät pieleen useammin kuin muu teksti
  3. Sepitetyn viitteen tunnusmerkit
  4. Kolmen kohdan tarkistus, joka vie minuutin
  5. Linkki on oma erikoistapauksensa
  6. Pykälät, standardit ja tuomiot ovat sepitteen kallein laji
  7. Miksi verkkohaku ei poista ongelmaa
  8. Näin pyydät lähteet niin, että ne ovat tarkistettavissa
  9. Tarkistuslista ennen kuin viite lähtee eteenpäin
  10. Usein kysytyt kysymykset
  11. Lähteet ja lisälukemista

Pyydät tekoälyltä viisi lähdettä. Saat viisi: tekijä, vuosi, otsikko, julkaisu, sivunumerot, linkki. Kaikki on aseteltu niin kuin lähdeluettelossa kuuluu. Klikkaat linkkiä, ja sivua ei ole. Haet otsikkoa hakukoneella, eikä osumia tule. Tekijä on olemassa ja julkaisu on olemassa, mutta juuri tätä artikkelia ei ole koskaan kirjoitettu.

Tämä on hallusinaatioiden kapein ja samalla kiusallisin erikoistapaus. Kapein siksi, että se koskee vain yhtä tekstilajia: viitteitä, linkkejä, pykäliä ja teosnimiä. Kiusallisin siksi, että viite on juuri se osa vastausta, jonka pitäisi tehdä siitä tarkistettava. Kun viite on sepitetty, vastaus näyttää lähteistetyltä olematta sitä.

Yleinen mekanismi on sama kuin muissakin virheissä ja se käydään läpi artikkelissa miksi tekoäly keksii asioita. Tässä katsotaan vain sitä, miksi viitteet ovat muuta tekstiä alttiimpia ja miten sepitteen erottaa minuutissa.

Viite on muoto, ja muoto on juuri sitä mitä malli osaa

Kielimalli ei hae viitettä tietokannasta. Se tuottaa seuraavan palan tekstiä sen perusteella, mikä on todennäköisintä edellisen perusteella. Lähdeviite on tässä mielessä poikkeuksellisen helppo tehtävä, koska sen rakenne on aineistossa hyvin säännöllinen. Sukunimi, pilkku, etukirjain, vuosiluku sulkeissa, otsikko, julkaisun nimi, numerosarja. Malli on nähnyt tämän kuvion miljoonia kertoja.

Ongelma on siinä, että muoto ja sisältö ovat mallin kannalta eri asioita. Muoto on toistuva ja siksi hyvin opittu. Yksittäisen artikkelin olemassaolo on yksittäinen tosiasia, joka on aineistossa ehkä kerran tai ei kertaakaan. Kun malli täyttää muotoa, se täyttää jokaisen kohdan uskottavimmalla vaihtoehdolla. Otsikoksi tulee otsikko, joka sopisi aiheeseen. Vuosiluvuksi tulee vuosi, jolloin tällaista tutkittiin. Sivunumeroiksi tulee luvut, jotka näyttävät sivunumeroilta.

Malli ei valehtele lähteestä. Se tuottaa lähteen näköisen jonon, koska sitä pyydettiin, eikä sillä ole tapaa erottaa muistiin jäänyttä todellista viitettä sujuvasti täytetystä tyhjästä.

Miksi viitteet menevät pieleen useammin kuin muu teksti

Neljä syytä kasautuu samaan lauseeseen.

Ensinnäkin viite on tiheä yksityiskohtien kasauma. Tavallisessa virkkeessä voi olla yksi tarkistettava tosiasia. Viitteessä niitä on viisi tai kuusi peräkkäin, ja jokaisen pitäisi osua. Yhden kohdan virhe riittää tekemään viitteestä käyttökelvottoman.

Toiseksi malli on nähnyt paljon enemmän viittauksia teoksiin kuin itse teoksia. Lähdeluettelot, kirjallisuuskatsaukset ja viitetietokannat ovat aineistossa runsaita. Niistä syntyy vahva mielikuva siitä, millaisia nimiä ja otsikoita alalla on, ilman että mallilla on käsitystä yksittäisten dokumenttien sisällöstä. Tämä sama vinouma näkyy myös siinä, mistä aiheista malli puhuu sujuvasti, kuten opetusaineiston sokeita pisteitä käsittelevässä artikkelissa kuvataan.

Kolmanneksi tunnisteet ovat numerosarjoja. DOI-tunniste, ISBN, diaarinumero ja standardin numero näyttävät ulkopuolelta sattumanvaraisilta merkkijonoilta. Mallille ne ovat merkkijonoja, joilla on tunnistettava muoto, ja oikean muotoinen sarja on triviaali tuottaa.

Neljänneksi kysymys itse pakottaa keksimään. Kun pyydät viittä lähdettä, olet asettanut kiintiön. Jos aitoja löytyy kaksi, kolme jäljelle jäävää paikkaa täytetään silti, koska ohjeen noudattaminen on mallille luontevampaa kuin ohjeen kyseenalaistaminen. Tämä on yksi harvoista tekoälyn virhetyypeistä, jonka kysyjä aiheuttaa itse.

Sepitetyn viitteen tunnusmerkit

Mikään yksittäinen merkki ei todista mitään, mutta yhdessä ne kertovat, mihin kannattaa käyttää se minuutti.

Merkki Miksi se syntyy Mitä se tarkoittaa
Otsikko vastaa kysymystäsi lähes sanasta sanaan Malli tuottaa otsikon kysymyksestä, ei muistista Vahva epäilys, tarkista ensin
Muoto on täydellinen mutta linkki puuttuu Muoto on opittu, osoite ei ollut saatavilla Tarkistettava hakukoneella
Linkin polku on siisti ja kuvaileva Osoite on rakennettu sanoista, ei muistettu Avaa linkki, älä lainaa sitä
Tekijä on alan tunnetuin nimi Yleisin nimi on todennäköisin täyte Tarkista, käsitteleekö hän tätä aihetta
Viranomaisen nimi on melkein oikea Malli yhdistää muistinvaraisia nimen osia Tarkista virasto ensin, sitten asiakirja
Sivunumerot tai pykälän numero ovat pyöreitä Uskottavan näköinen luku on helppo täyttää Tarkista alkuperäisestä tekstistä

Viranomaisrivi ansaitsee huomion, koska se toistuu suomenkielisissä vastauksissa. Suomessa toimivien virastojen nimet ovat pitkiä yhdyssanoja, joiden osat ovat vaihdettavissa keskenään. Sepitetty viite kuulostaa siksi kotimaiselta ja uskottavalta, vaikka nimeä ei ole olemassa.

Kolmen kohdan tarkistus, joka vie minuutin

Tämä riittää tavallisiin tilanteisiin. Koko vastauksen tarkistus on eri asia, ja se käydään läpi artikkelissa näin tarkistat tekoälyn vastauksen.

  1. Hae otsikkoa lainausmerkeissä. Kopioi teoksen tai artikkelin nimi hakukoneeseen lainausmerkkien sisään. Jos täsmällistä osumaa ei tule mistään, viite on lähes varmasti sepitetty. Aidot julkaisut näkyvät yleensä useassa paikassa: julkaisijalla, kirjastotietokannassa tai viitepalvelussa.
  2. Avaa linkki ja katso mihin päädyt. Virheilmoitus tarkoittaa, että osoitetta ei ole. Uudelleenohjaus etusivulle on yhtä paha merkki, koska se piilottaa puuttuvan sivun näyttämällä toimivalta. Tilakoodien merkitys selviää artikkelista mitä 404 ja 403 oikeasti tarkoittavat.
  3. Etsi väite lähteen sisältä. Tämä on se kohta, joka useimmiten jätetään tekemättä. Käytä sivun omaa hakua ja etsi se luku, päivämäärä tai sana, jonka takia viite annettiin. Jos asiakirja on olemassa mutta väitettä ei löydy siitä, viite on väärä siitä huolimatta, että linkki toimii.

Kohta kolme on tärkein. Olematon lähde paljastuu ennemmin tai myöhemmin itsestään. Aito lähde, joka ei sano sitä mitä sen väitetään sanovan, menee läpi tarkistuksesta, jossa katsotaan vain aukeaako linkki.

Linkki on oma erikoistapauksensa

Verkko-osoite koostuu osista, jotka ovat mallin kannalta hyvin eriarvoisia. Verkkotunnus on tunnettu ja toistuu aineistossa jatkuvasti, joten se on yleensä oikein. Polku eli kaikki kauttaviivan jälkeen on yksittäisen sivun yksilöivä osa, ja juuri se rakennetaan uskottavista sanoista. Lopputulos on osoite, jonka alku on aito ja loppu keksitty. Osoitteen osien lukeminen kannattaa opetella, ja siihen löytyy oma ohjeensa artikkelista URL-osoitteen osat.

Tästä seuraa kaksi käytännön sääntöä. Älä koskaan lainaa linkkiä eteenpäin avaamatta sitä. Ja jos linkki ei toimi, älä pyydä mallia korjaamaan sitä: seuraava osoite tuotetaan täsmälleen samalla tavalla kuin edellinen. Pyydä sen sijaan julkaisijan nimi ja asiakirjan nimi, ja etsi asiakirja itse.

Pykälät, standardit ja tuomiot ovat sepitteen kallein laji

Lakiviittaus näyttää tarkalta, koska siinä on numero. Pykälä, momentti, direktiivin numero ja vuosiluku muodostavat kuvion, jonka malli osaa täyttää yhtä sujuvasti kuin lähdeviitteen. Sama koskee standardeja ja teknisiä määrittelyjä, joiden tunniste on pelkkä numerosarja.

Näissä tarkistus on onneksi helppo, koska alkuperäislähteet ovat julkisia ja pysyviä. Suomen säädökset löytyvät Finlexistä ajantasaisina, EU-säädökset EUR-Lexistä, ja internetin tekniset määrittelyt ovat luettavissa RFC-dokumentteina. Jos pykälän numero ei täsmää sisältöön, koko viittaus on hylättävä, ei korjattava mallin ehdotuksella.

Oikeudellisissa kysymyksissä kannattaa muistaa myös se, että pykälän löytyminen ei vielä tarkoita, että sen tulkinta olisi oikea. Malli voi viitata olemassa olevaan lainkohtaan ja silti selittää sen väärin.

Miksi verkkohaku ei poista ongelmaa

Hakuun kytketty malli hakee ensin tekstiä ja kirjoittaa vasta sitten vastauksen. Riski pienenee selvästi, mutta se ei katoa, koska yhdistely tapahtuu edelleen mallissa. Menetelmän rakenne ja rajat käydään läpi artikkelissa RAG vai hienosäätö.

Kolme vikaa jää jäljelle. Malli voi liittää oikean linkin väärään väitteeseen, koska se kirjoittaa vastauksen omin sanoin ja sijoittaa viitteet jälkikäteen. Se voi sekoittaa kaksi hakutulosta yhdeksi väitteeksi, joka ei ole kummassakaan. Ja se voi nojata hakutulokseen, joka on itsessään epäluotettava, koska haku palauttaa myös sisällöntuotantosivuja ja vanhentuneita kopioita. Milloin kannattaa käyttää hakua ja milloin tavallista hakukonetta, on oma kysymyksensä, jota käsitellään artikkelissa tekoälyhaku vai hakukone.

Käytännön merkki on tämä: jos vastauksessa on viite, jota malli ei ole hakenut vaan muistanut, se ei yleensä erotu mitenkään haetuista. Sekamuoto on tavallisin tilanne, jossa yksi viite viidestä on sepitetty.

Näin pyydät lähteet niin, että ne ovat tarkistettavissa

Kehotteen muotoilu ei tee mallista luotettavaa, mutta se poistaa ne tilanteet, joissa keksiminen on käytännössä pakotettu. Kehotteen rakenteesta on erillinen ohje artikkelissa hyvän promptin rakenne.

  1. Älä pyydä tiettyä määrää lähteitä. Pyydä vain ne lähteet, jotka mallilla on. Kiintiö on suora kutsu täyttää tyhjät paikat.
  2. Pyydä merkitsemään väitteet, joille ei ole lähdettä. Ohje muodossa "merkitse erikseen ne kohdat, joita et voi lähteistää" tuottaa yleensä rehellisemmän vastauksen kuin ohje "käytä vain luotettavia lähteitä".
  3. Pyydä suora lainaus. Sitaatti on tarkistettava kohde: voit hakea sitä sivulta sanahaulla. Pelkkä viite ei kerro, mistä kohtaa asiakirjaa väite tulee.
  4. Pyydä julkaisija ja asiakirjan nimi, älä pelkkää osoitetta. Nimellä löydät oikean dokumentin silloinkin, kun osoite on väärä.
  5. Anna lähteet itse. Liitä kehotteeseen ne asiakirjat, joita haluat käytettävän, ja kiellä muiden käyttö. Tämä muuttaa tehtävän muistamisesta lukemiseksi, mikä on aivan eri vaikeusluokka.
  6. Kysy lopuksi, mitä malli ei voinut varmistaa. Vastaus ei ole luotettava mittari, mutta se nostaa usein esiin juuri ne kohdat, jotka kannattaa tarkistaa ensin.

Tarkistuslista ennen kuin viite lähtee eteenpäin

Käy tämä läpi aina, kun aiot liittää tekoälyn antaman viitteen omaan tekstiisi, sähköpostiin tai esitykseen.

  • Olen avannut jokaisen linkin itse, en luottanut siihen että se näyttää oikealta.
  • Olen löytänyt väitteen lähteen sisältä, en pelkästään todennut asiakirjan olevan olemassa.
  • Olen tarkistanut julkaisijan nimen sanasta sanaan, erityisesti jos kyseessä on viranomainen.
  • Pykälät ja standardinumerot on katsottu alkuperäisestä säädöksestä tai määrittelystä.
  • Jos viite ei kestänyt tarkistusta, olen poistanut sen enkä pyytänyt mallilta tilalle uutta.
  • Jos viite oli tarkoitus julkaista, viitteen ohella kerrotaan lukijalle, mistä kohtaa lähdettä tieto löytyy.

Viimeinen kohta on se, joka erottaa tarkistetun tekstin tarkistetun näköisestä. Kun kerrot missä luvussa tai millä sivulla asia sanotaan, olet väistämättä käynyt katsomassa.

Usein kysytyt kysymykset

Miksi tekoäly antaa linkin, joka ei toimi?

Osoite tuotetaan samalla tavalla kuin muukin teksti, sana kerrallaan. Verkkotunnus on yleensä oikein, koska se toistuu aineistossa usein, mutta yksittäisen sivun polku rakennetaan uskottavista sanoista. Tuloksena on osoite, joka näyttää oikealta mutta ei osoita mihinkään.

Voiko keksityn viitteen tunnistaa ilman hakukonetta?

Ei varmasti, mutta epäilyn voi herättää. Jos otsikko vastaa kysymystäsi lähes sanasta sanaan, tekijä on alan tunnetuin nimi tai viranomaisen nimi on hieman erilainen kuin muistat, tarkistus kannattaa tehdä ensin näihin. Lopullinen varmuus vaatii silti alkuperäisen lähteen avaamisen.

Miksi malli myöntää keksineensä viitteen ja antaa sitten toisen keksityn?

Myöntäminen on sekin tekstin jatkamista, ei muistin tarkistusta. Kun kerrot viitteen olleen väärä, todennäköisin jatko on pahoittelu ja uusi viite, joka tuotetaan täsmälleen samalla mekanismilla. Siksi korjauspyyntö ei kannata: hae lähde itse.

Onko hakuun kytketty tekoäly turvallinen lähteiden suhteen?

Turvallisempi, ei turvallinen. Haku tuo mukanaan aitoja sivuja, mutta malli kirjoittaa vastauksen omin sanoin ja voi liittää viitteen väärään väitteeseen tai sekoittaa kaksi lähdettä. Linkin toimivuus ei siis kerro, tukeeko sivu väitettä.

Kelpaako tekoälyn antama lähde opinnäytetyöhön tai raporttiin?

Vain jos olet itse avannut lähteen ja lukenut kohdan, johon viittaat. Tekoäly voi auttaa löytämään aiheen kannalta oikeita julkaisuja ja hakusanoja, mutta viitteen todentaminen on kirjoittajan vastuulla. Oppilaitoksilla on lisäksi omat sääntönsä tekoälyn käytöstä.

Miksi keksityissä viitteissä on niin usein oikeita tutkijoiden nimiä?

Nimi on aineistossa yleinen, artikkeli ei. Malli täyttää tekijäkentän todennäköisimmällä vaihtoehdolla, ja todennäköisin vaihtoehto on alalla paljon julkaissut henkilö. Siksi sepitetty viite osuu usein oikeaan nimeen ja väärään teokseen.

Takaisin ylös