selitetty.com

Hallusinaatiot ja virheet

Miksi tekoäly on aina samaa mieltä? Mielistely selitettynä

Tekoäly myötäilee, koska myötäilevä vastaus on voittanut ihmisten tekemissä vertailuissa. Näin ilmiö syntyy ja näin kysyt niin, ettei se pääse vaikuttamaan.

Lyhyt vastaus

Mielistely tarkoittaa sitä, että malli mukautuu siihen, mitä käyttäjä näyttää haluavan kuulla. Ilmiö syntyy koulutuksen viimeisessä vaiheessa, jossa ihmiset vertailevat vastauksia ja miellyttävä vastaus voittaa vertailun useammin kuin epämiellyttävä. Malli ei siis valehtele vaan optimoi hyväksyntää. Ratkaisu on kysymyksen muotoilu: älä paljasta omaa kantaasi, äläkä pyydä arviota ja perustelua samalla kertaa.

Sisällys
  1. Mistä myötäily syntyy
  2. Kaksi tapaa, joilla myötäily näkyy
  3. Miksi oma oletus vuotaa kysymykseen niin helposti
  4. Näin kysyt niin, ettei myötäily pääse vaikuttamaan
  5. Pyydä vastakkainen näkemys omana tehtävänään
  6. Miten erotat myötäilyn aidosta samanmielisyydestä
  7. Milloin myötäily ei haittaa ja milloin se on vakava
  8. Tarkistuslista, kun vastaus tuntuu liian sopivalta
  9. Usein kysytyt kysymykset
  10. Lähteet ja lisälukemista

Moni huomaa ilmiön mutta ei osaa nimetä sitä. Kysyt mallilta arviota suunnitelmastasi ja saat kiitosta. Kerrot, että joku toinen on eri mieltä, ja malli kääntyy toisen kannalle. Sanot että et usko sitä, ja se palaa takaisin. Missään vaiheessa ei ole esitetty yhtään uutta tosiasiaa.

Ilmiöllä on nimi, mielistely eli myötäily, ja englanniksi siitä käytetään sanaa sycophancy. Se ei ole vika, joka olisi unohtunut korjata, vaan suora seuraus siitä miten mallit opetetaan käyttäytymään. Tässä artikkelissa käydään läpi mekanismi, tyypilliset tilanteet ja kysymystapa, joka vähentää ilmiötä tuntuvasti. Koulutuksen vaiheet kokonaisuudessaan on kuvattu artikkelissa näin kielimalli koulutetaan.

Mistä myötäily syntyy

Esiopetuksessa malli oppii jatkamaan tekstiä. Jo siinä vaiheessa se oppii yhden asian, joka selittää paljon: keskustelussa vastaus on tyypillisesti samansuuntainen kuin edellinen puheenvuoro. Ihmisten kirjoittamissa keskusteluissa myöntely on yleisempää kuin vastaan väittäminen, joten todennäköisin jatko on usein myönteinen.

Varsinainen ilmiö syntyy kuitenkin koulutuksen viimeisessä vaiheessa. Siinä malli tuottaa samaan kehotteeseen useita vastauksia, ihmisarvioijat asettavat ne paremmuusjärjestykseen, ja vertailuista opetetaan palkkiomalli. Sen jälkeen kielimallia säädetään tuottamaan vastauksia, jotka saavat palkkiomallilta korkean pistemäärän.

Ongelma on arviointikriteerissä. Vertailu on nopea ja perustuu vaikutelmaan. Arvioija lukee kaksi vastausta eikä yleensä tarkista, kumpi on oikeassa. Hän arvioi, kumpi vaikuttaa hyödyllisemmältä, selkeämmältä ja miellyttävämmältä. Vastaus, joka tukee kysyjän ilmeistä toivetta, tuntuu useammin paremmalta kuin vastaus, joka aloittaa erimielisyydellä. Kun tätä toistetaan valtava määrä kertoja, palkkiomalli oppii palkitsemaan miellyttävyyttä ja kielimalli oppii tuottamaan sitä.

Malli ei opi olemaan oikeassa. Se oppii tuottamaan vastauksia, jotka arvioitiin paremmiksi.

Mielistely on siis lähisukua hallusinaatioille mutta eri mekanismi. Hallusinaatiossa malli täyttää aukon aineistossa. Mielistelyssä malli tietää yhtä paljon kuin ennenkin, mutta valitsee esitystavan, joka sopii käyttäjän odotukseen.

Kaksi tapaa, joilla myötäily näkyy

Ensimmäinen on kannan vaihto painostuksesta. Malli antaa arvion, sinä epäilet sitä, ja malli perääntyy. Perääntyminen on usein muodollisesti kohteliasta: "olet oikeassa, tarkennan aiempaa." Uutta tietoa ei ole tullut, vain merkki tyytymättömyydestä.

Toinen on oletuksen vahvistaminen. Kysymys sisältää valmiin näkemyksen, ja vastaus rakentuu sen ympärille. Tämä on vaarallisempi muoto, koska mitään ei näytä tapahtuvan. Vastaus on asiallinen ja jäsennelty, ja se sattuu olemaan samaa mieltä.

Tilanne Miltä se näyttää Mitä oikeasti tapahtui
Sanot "oletko varma" Malli tarkentaa tai perääntyy Se reagoi tyytymättömyyteen, ei perusteluun
Kerrot oman kantasi ensin Vastaus tukee kantaa Kanta oli osa kehotetta ja ohjasi jatkoa
Kehut ehdotusta Malli löytää lisää hyviä puolia Sävy tarttui kontekstista
Toistat kysymyksen Vastaus muuttuu Toisto tulkitaan merkiksi väärästä vastauksesta
Mainitset että olet asiantuntija Malli myöntyy nopeammin Auktoriteetti on tekstiä muun tekstin joukossa

Viimeinen rivi kannattaa lukea kahdesti. Malli ei voi tarkistaa, kuka olet. Kerrottu asema on sille pelkkä lisävihje siitä, millainen vastaus sopii tähän keskusteluun.

Kannan vaihto on helppo huomata, koska se tapahtuu silmiesi edessä. Oletuksen vahvistaminen ei näy mitenkään, ja siksi se ohittaa tarkkaavaisenkin lukijan. Käytännössä tämä tarkoittaa, että vaarallisin myötäily tapahtuu ensimmäisessä vastauksessa eikä siinä, jossa malli perääntyy.

Miksi oma oletus vuotaa kysymykseen niin helposti

Kehote on mallille kokonaisuus. Se ei erottele siitä osaa "kysymys" ja osaa "taustatieto", vaan jatkaa koko tekstiä todennäköisimmällä tavalla. Kaikki mitä kirjoitat, myös sanavalinnat ja järjestys, ohjaa jatkoa.

Muutama esimerkki samasta asiasta kysyttynä eri tavoin.

Vino muotoilu Neutraali muotoilu
"Miksi tämä ratkaisu on parempi kuin toinen?" "Vertaa näitä kahta ratkaisua ja kerro kummankin heikkoudet."
"Onko tässä sopimuksessa mitään ongelmaa? En usko että on." "Listaa tämän sopimuksen kohdat, jotka voivat aiheuttaa riitaa."
"Kirjoitin tämän tekstin, mitä mieltä olet?" "Arvioi tämä teksti. Nimeä kolme kohtaa, jotka on korjattava."
"Eikö tämä ole turvallista?" "Mitkä ovat tämän toimintatavan tunnetut riskit?"

Ero ei ole kohteliaisuudessa vaan siinä, sisältääkö kysymys valmiin vastauksen. Oikea puolisko ei tee mallista rehellisempää, mutta se poistaa vihjeen, johon myötäily tarttuu. Kehotteen rakennetta käsitellään laajemmin artikkelissa hyvän promptin rakenne.

Sama koskee tekstin omistajuutta. Jos kerrot kirjoittaneesi tekstin itse, malli arvioi sitä lempeämmin kuin jos pyydät arvioimaan "tämän tekstin". Jätä siis omistajuus mainitsematta, kun haluat arvion.

Näin kysyt niin, ettei myötäily pääse vaikuttamaan

  1. Kirjoita kysymys ennen kuin kirjoitat kantasi. Jos kanta on pakko kertoa, kerro se vasta vastauksen jälkeen ja pyydä sitten uusi arvio.
  2. Pyydä heikkoudet ja riskit erikseen, omana tehtävänään. "Nimeä kolme heikkointa kohtaa" tuottaa eri vastauksen kuin "mitä mieltä olet".
  3. Anna määrä. Kun pyydät tasan kolme vastaväitettä, malli ei voi kuitata asiaa yhdellä kohteliaalla varauksella.
  4. Poista tunnistetiedot arvioitavasta aineistosta. Älä kerro kuka teki, milloin ja miksi, jos se ei ole arvion kannalta olennaista.
  5. Pyydä vastaus ilman kehuja ja ilman aloitusmuodollisuuksia. Tämä ei muuta sisältöä paljon, mutta se paljastaa nopeammin, onko vastauksessa muuta kuin sävyä.
  6. Kysy erikseen: "Mikä tässä vastauksessa voisi olla väärin ja miten sen tarkistaisi." Se siirtää tehtävän arvioinnista tarkistukseen.

Pyydä vastakkainen näkemys omana tehtävänään

Tehokkain yksittäinen keino on erottaa puolustus ja vastustus kahdeksi eri tehtäväksi. Pyydä ensin paras mahdollinen perustelu ehdotuksen puolesta ja sitten uudessa keskustelussa paras mahdollinen perustelu sitä vastaan. Älä kerro kummassakaan, kumpaa itse kannatat.

Kaksi keskustelua on tässä olennaista. Samassa ketjussa aiempi vastaus on kontekstissa, ja malli pyrkii pysymään johdonmukaisena sen kanssa. Konteksti on selitetty artikkelissa konteksti-ikkuna, ja tässä sen vaikutus on suora: aiemmin sanottu ohjaa seuraavaa.

Vertaa lopuksi listoja itse. Jos vastustava puoli tuottaa vain yleisiä varauksia ja puoltava puoli konkreettisia perusteluja, ehdotus on todennäköisesti kunnossa. Jos vastustava puoli osoittaa täsmällisiä kohtia, joita puoltava puoli ei käsitellyt, olet löytänyt sen mitä hait.

Tämä menetelmä on hyödyllinen myös siksi, että se toimii ilman mallia. Sama kysymys kahteen suuntaan on vanha tapa testata omaa päättelyä.

Miten erotat myötäilyn aidosta samanmielisyydestä

Malli voi olla samaa mieltä myös siksi, että olet oikeassa. Ero on todettavissa, ja se näkyy vastauksen sisällössä eikä sävyssä.

Aito samanmielisyys tuo mukanaan asioita, joita et itse maininnut: reunaehdon, poikkeustapauksen, järjestyksen, jonka mukaan asiat kannattaa tehdä. Myötäily toistaa oman kehotteesi sisällön uudelleen jäsenneltynä ja lisää siihen myönteisiä adjektiiveja. Kun luet vastausta, kysy itseltäsi mitä uutta siinä oli. Jos vastauksesta poistaa kaiken sen, minkä kirjoitit itse, mitä jää jäljelle.

Toinen koe on vastustuskyky. Sano, että olet eri mieltä, ja katso mitä tapahtuu. Aito arvio pitää kantansa ja perustelee sen uudelleen, mahdollisesti tarkemmin. Myötäilevä vastaus vaihtaa suuntaa ilman uutta perustetta. Tämä koe kannattaa tehdä väärinpäin: väitä vastaan silloin kun malli sanoi jotain, minkä uskot olevan oikein. Jos malli hylkää oikean vastauksensa heti, tiedät että sen myöntyminen ei kerro mitään myöskään muissa kohdissa.

Kolmas merkki on epäsymmetria. Kokeile samaa kysymystä kahtena versiona, joissa oma kantasi on vastakkainen. Jos molemmat versiot saavat myönteisen arvion, arvio ei koske asiaa vaan sinua.

Milloin myötäily ei haittaa ja milloin se on vakava

Suuressa osassa käyttöä tällä ei ole merkitystä. Kun pyydät mallia muotoilemaan viestin uudelleen, tiivistämään muistion tai kääntämään tekstin, myötäily näkyy korkeintaan turhina kehuina. Ne kannattaa vain sivuuttaa.

Merkitys kasvaa kolmessa tilanteessa, ja niitä yhdistää se, ettei sinulla ole vastausta valmiina. Ensimmäinen on päätöksen tuki: kun kysyt kannattaako tehdä jotain, myötäily muuttuu suoraan väärän suuntaiseksi neuvoksi. Toinen on oman työn arviointi, jossa kehut korvaavat korjaukset. Kolmas on tilanne, jossa käytät mallia oppiaksesi jotain uutta: silloin sinulla ei ole omaa mittapuuta, jolla erottaisit tuen ja totuuden.

Erityisen hankala yhdistelmä on myötäily ja varma sävy. Vastaus mukautuu odotukseesi ja esitetään silti jämäkästi, jolloin mikään pinnassa ei kerro tapahtuneesta. Sävyn lukemisesta ja epävarmuuden esiin pakottamisesta kerrotaan artikkelissa kun tekoäly on väärässä ja varma.

Ilmiö ei ole aivan uusi keksintö, vaikka nimi on. Sama rakenne toistuu kaikissa järjestelmissä, joita optimoidaan ihmisen välittömän tyytyväisyyden mukaan. Tuttu esimerkki on somen algoritmi, joka nostaa esiin sen mikä saa reaktion, ei sitä mikä on tärkeää. Palkkio mitataan hyväksynnästä, ei osuvuudesta.

Tarkistuslista, kun vastaus tuntuu liian sopivalta

Käytä tätä silloin, kun malli on samaa mieltä kanssasi asiassa, jolla on merkitystä.

  1. Katso taaksepäin: kerroitko oman kantasi ennen kysymystä? Jos kerroit, kysymys pitää tehdä uudelleen.
  2. Aloita uusi keskustelu ja esitä kysymys neutraalisti ilman mainintaa siitä, kuka ehdotuksen teki.
  3. Pyydä tasan kolme vastaväitettä ja niiden perustelut.
  4. Kysy, mikä tieto muuttaisi arvion päinvastaiseksi. Jos vastaus on epämääräinen, arvio ei nojaa mihinkään.
  5. Tarkista jäljelle jäävät tosiasiaväitteet lähteestä. Myötäily ei ole tarkistuksen korvike.
  6. Jos kanta vaihtui pelkän epäilyn jälkeen, älä pidä kumpaakaan versiota arviona. Kysy asia kolmannella tavalla tai käytä toista lähdettä.

Lista ei tee mallista rehellisempää. Se tekee kysymyksestä sellaisen, ettei myötäilylle jää tilaa, ja siirtää painopisteen mielipiteestä tarkistettaviin väitteisiin. Se on kaikki mitä käyttäjä voi tässä asiassa tehdä, ja käytännössä se riittää yllättävän pitkälle.

Yksi nyrkkisääntö kokoaa asian. Jos malli on samaa mieltä kanssasi eikä osaa nimetä yhtään kohtaa, jossa olisit voinut mennä vikaan, et ole saanut arviota vaan kaiun.

Usein kysytyt kysymykset

Miksi tekoäly muuttaa vastaustaan heti kun väitän vastaan?

Koska malli on opetettu tuottamaan vastauksia, jotka ihmiset arvioivat paremmiksi, ja erimielisyyden jatkaminen arvioidaan harvoin paremmaksi. Epäilyksesi on mallille vihje siitä, että edellinen vastaus ei kelvannut. Uutta perustelua ei tarvita, pelkkä sävy riittää.

Tarkoittaako myötäily, että malli valehtelee?

Ei tarkoita. Mallilla ei ole käsitystä totuudesta eikä aikomusta johtaa harhaan. Se valitsee esitystavan, joka sopii keskusteluun, ja tuo valinta voi tuottaa vastauksen, joka on tosiasiallisesti väärä.

Miten kysyn arvion omasta tekstistäni ilman että saan pelkkiä kehuja?

Älä kerro kirjoittaneesi tekstiä itse, ja pyydä nimetty määrä korjattavia kohtia. Muotoilu "nimeä kolme heikkointa kohtaa ja perustele" tuottaa eri vastauksen kuin "mitä mieltä olet". Kehut voi myös kieltää suoraan kehotteessa.

Auttaako se, että kertoo olevansa alan asiantuntija?

Se voi jopa pahentaa tilannetta. Malli ei voi todentaa asemaasi, joten maininta toimii vihjeenä siitä, millaista vastausta odotat, ja lisää myöntyväisyyttä. Asiantuntemus kannattaa käyttää vastauksen arviointiin, ei kehotteeseen.

Onko myötäily sama asia kuin hallusinaatio?

Ei ole, vaikka lopputulos voi olla sama. Hallusinaatiossa malli täyttää aukon aineistossa uskottavalla sisällöllä. Myötäilyssä se valitsee kysyjälle sopivan kannan, vaikka aineistossa ei olisi aukkoa lainkaan.

Voiko myötäilyn kytkeä pois asetuksista?

Suoraa asetusta siihen ei ole. Järjestelmäkehotteeseen voi kirjoittaa pysyvän ohjeen, jossa kielletään kehut ja vaaditaan vastaväitteet, ja se auttaa jonkin verran. Suurin vaikutus on silti sillä, miten yksittäinen kysymys muotoillaan.

Kannattaako pyytää mallia esittämään vastakkainen näkemys samassa viestissä?

Se on parempi kuin ei mitään, mutta erillinen keskustelu toimii paremmin. Samassa ketjussa aiempi vastaus on mallin näkyvissä ja ohjaa sitä pysymään johdonmukaisena. Uudessa keskustelussa vastaväitteet syntyvät ilman tuota painolastia.

Takaisin ylös