Suuret kielimallit (LLM)
Näin kielimalli koulutetaan: esiopetus, hienosäätö ja palaute
Valmis tekoälyassistentti syntyy kolmessa vaiheessa. Näin esiopetus, ohjattu hienosäätö ja ihmispalaute muuttavat mallia, ja miksi juuri viimeinen vaihe määrää sen luonteen.
Lyhyt vastaus
Kielimalli koulutetaan kolmessa peräkkäisessä vaiheessa. Esiopetuksessa malli oppii ennustamaan seuraavan tokenin valtavasta tekstimassasta, jolloin siihen kertyy kielen rakenne ja suuri osa sen tiedoista. Ohjatussa hienosäädössä sille näytetään esimerkkejä siitä, miltä hyvä vastaus näyttää, jolloin se alkaa käyttäytyä avustajana. Viimeisessä vaiheessa ihmiset vertailevat vastauksia, ja mallia ohjataan palkkiomallin avulla suosimaan voittaneita. Kaksi ensimmäistä vaihetta antavat kyvyt, viimeinen antaa luonteen.
Sisällys
- Vaihe yksi: esiopetus, eli seuraavan tokenin ennustaminen
- Mitä käsissä on esiopetuksen jälkeen
- Vaihe kaksi: ohjattu hienosäätö esimerkkivastauksilla
- Vaihe kolme: ihmispalaute ja palkkiomalli
- Mikä vaihe muuttaa mitäkin
- Missä kohtaa turvallisuus tulee mukaan
- Miksi sama pohjamalli käyttäytyy eri tavoin eri palveluissa
- Mitä koulutus ei korjaa
- Mitä tästä seuraa sinulle
- Usein kysytyt kysymykset
- Lähteet ja lisälukemista
Kielimallista puhutaan usein niin kuin se olisi opetettu kerran ja valmis. Todellisuudessa valmis assistentti syntyy ketjussa, jossa jokainen vaihe muuttaa eri asiaa. Ero on käytännöllinen, ei akateeminen: kun tiedät mikä vaihe teki mitä, ymmärrät myös mitä mallin käytöksessä voi muuttua päivityksessä ja mitä ei.
Yleinen väärinkäsitys on, että mallille "opetetaan" asioita samaan tapaan kuin ihmiselle kerrotaan uusi tieto. Näin ei tapahdu. Opetuksessa säädetään miljardeja lukuja, parametreja, niin että malli ennustaa aineistoa paremmin. Yksittäistä faktaa ei kirjoiteta mihinkään paikkaan. Perusmekanismi, eli tokenit ja seuraavan tokenin ennustaminen, on selitetty artikkelissa miten kielimalli toimii. Aineiston alkuperä ja sen sokeat pisteet ovat puolestaan aiheena artikkelissa mistä tekoäly on opetettu. Tässä keskitytään itse vaiheisiin.
Vaihe yksi: esiopetus, eli seuraavan tokenin ennustaminen
Esiopetuksessa (esikoulutus) malli saa eteensä valtavan määrän tekstiä ja yhden tehtävän: arvaa, mikä token tulee seuraavaksi. Jokaisen arvauksen jälkeen lasketaan häviöfunktiolla, kuinka kaukana ennuste oli oikeasta jatkosta, ja parametreja säädetään hitusen siihen suuntaan, joka olisi pienentänyt virhettä. Tämä toistuu käsittämättömän monta kertaa.
Tehtävä kuulostaa vaatimattomalta, mutta se pakottaa mallin oppimaan paljon. Jotta seuraavan sanan voi ennustaa hyvin, on opittava kielioppi, tyylilajit, tavallinen maailmantieto, ohjelmointikielten syntaksi ja se, millaisia päättelyketjuja teksteissä esiintyy. Kaikki tämä kertyy parametreihin hajautettuna eikä missään luettavassa muodossa.
Aineisto kulkee mallin läpi pääosin kerran tai muutaman kerran, eikä malli säilytä siitä kopiota. Se säilyttää vain sen, mikä auttoi ennustamisessa. Tästä seuraa yksi tavallisimmista väärinkäsityksistä: malli ei "sisällä" lukemiaan tekstejä samalla tavalla kuin hakukoneen hakemisto sisältää sivuja. Yleisesti toistuvat asiat jäävät hyvin, kerran mainitut yksityiskohdat harvoin.
Tämä vaihe on ylivoimaisesti kallein. Se vaatii suuret laskentaklusterit ja pitkän ajan, ja siksi pohjamalleja tekevät harvat toimijat. Se on myös vaihe, jonka jälkeen mallin tiedot on käytännössä lyöty lukkoon: tästä seuraa niin sanottu tiedon katkaisupäivä, koska aineisto kerättiin tiettyyn hetkeen asti.
Mitä käsissä on esiopetuksen jälkeen
Tulos ei ole assistentti. Se on pohjamalli, joka osaa vain yhden asian: jatkaa tekstiä uskottavasti. Jos kirjoitat sille kysymyksen, se voi jatkaa listaamalla lisää samankaltaisia kysymyksiä, koska aineistossa kysymystä seurasi usein toinen kysymys. Se ei tiedä olevansa avustaja eikä että sen pitäisi vastata.
Pohjamalli ei myöskään kieltäydy mistään, ei tunnista rooliaan keskustelussa eikä erota ohjetta aineistosta. Kaikki tämä pitää opettaa erikseen. Juuri tästä syystä pohjamallin lataaminen ei riitä, jos haluaa käyttökelpoisen keskustelukumppanin. Avointen mallien yhteydessä ero näkyy selvästi, ja siitä kerrotaan tarkemmin artikkelissa avoimet mallit ja avoimet painot.
Vaihe kaksi: ohjattu hienosäätö esimerkkivastauksilla
Toisessa vaiheessa mallille näytetään esimerkkejä siitä, miltä hyvä vastaus näyttää. Aineisto koostuu pareista: ohje tai kysymys ja sen rinnalla vastaus, jollaisen mallin toivotaan tuottavan. Vastaukset ovat ihmisten kirjoittamia tai ihmisten tarkastamia. Tekniikka on tavallista ohjattua oppimista, ja tehtävä on edelleen sama seuraavan tokenin ennustaminen, mutta nyt aineisto on tarkkaan valittua eikä satunnaista verkkotekstiä.
Tämä vaihe muuttaa mallin käytöstä radikaalisti ja sen tietoja vain vähän. Malli oppii tunnistamaan keskustelun rakenteen, vastaamaan kysymykseen eikä jatkamaan sitä, noudattamaan muotopyyntöjä ja lopettamaan kun asia on sanottu. Aineistoa tarvitaan tähän murto-osa esiopetukseen verrattuna, koska kyse on olemassa olevien kykyjen kohdistamisesta eikä uusien rakentamisesta.
Sama tekniikka on käytössä silloin, kun organisaatio hienosäätää mallia omalla aineistollaan. Se on kuitenkin eri asia kuin oman tiedon liittäminen vastaukseen hakemalla, ja näiden kahden ero on avattu artikkelissa RAG vai hienosäätö.
Vaihe kolme: ihmispalaute ja palkkiomalli
Kolmas vaihe vastaa siitä, miltä malli tuntuu käyttäjästä. Ohjattu hienosäätö opettaa yhden hyvän vastauksen kerrallaan, mutta se ei kerro mallille, kumpi kahdesta kelvollisesta vastauksesta on parempi. Juuri sitä tässä vaiheessa haetaan.
Kulku on tyypillisesti tämä:
- Malli tuottaa samaan kehotteeseen useita erilaisia vastauksia.
- Ihmisarvioijat asettavat vastaukset paremmuusjärjestykseen annettujen kriteerien mukaan.
- Vertailuista koulutetaan erillinen palkkiomalli, joka oppii antamaan vastaukselle pistemäärän niin kuin arvioijat antaisivat.
- Varsinaista kielimallia säädetään vahvistusoppimisella niin, että se tuottaa vastauksia, jotka saavat palkkiomallilta korkean pistemäärän.
- Samalla rajoitetaan, kuinka kauas malli saa liikkua lähtötilanteestaan, jotta kielitaito ja tieto eivät rappeudu palkkion tavoittelussa.
Arvioijat eivät päätä kriteereistä itse. He noudattavat kirjoitettua ohjeistusta, jossa kerrotaan mitä pidetään hyödyllisenä, mitä turvallisena ja miten ristiriitatilanteissa toimitaan. Ohjeistus on siis se paikka, jossa mallin arvot käytännössä määritellään, ja sen laatiminen on toimituksellinen työ eikä tekninen.
Vaiheeseen liittyy myös tunnettu sudenkuoppa. Koska mallia optimoidaan palkkiomallin pistemäärää vastaan, se voi oppia miellyttämään palkkiomallia sen sijaan että vastaisi paremmin. Tyypillisiä oireita ovat tarpeettoman pitkät vastaukset, varmuudelta kuulostavat mutta sisällöttömät muotoilut ja liiallinen varovaisuus. Siksi palkkiomallia päivitetään ja mallin liikkumavaraa rajoitetaan.
Menetelmästä käytetään lyhennettä RLHF. Käytössä on myös yksinkertaisempia tapoja, joissa malli opetetaan suoraan ihmisten tekemistä vertailuista ilman erillistä palkkiomallia, sekä tapoja, joissa osan vertailuista tekee toinen malli kirjoitettujen periaatteiden pohjalta. Perusidea on kaikissa sama: mallia ohjataan sillä, mikä arvioitiin paremmaksi.
Tämä vaihe selittää myös yhden mallien tunnetuimmista heikkouksista. Jos arvioijat pitivät miellyttävistä ja myötäilevistä vastauksista, malli oppii tuottamaan niitä, vaikka käyttäjä olisi väärässä. Ilmiöllä on oma artikkelinsa: miksi tekoäly on aina samaa mieltä.
Mikä vaihe muuttaa mitäkin
| Vaihe | Aineisto | Mitä se muuttaa | Mitä se ei muuta |
|---|---|---|---|
| Esiopetus | Valtava sekalainen tekstimassa | Kielitaito, maailmantieto, päättelyn perusta | Ei tee mallista avustajaa |
| Ohjattu hienosäätö | Ihmisten kirjoittamia esimerkkivastauksia | Vastaamisen tapa, muoto, roolin ymmärrys | Ei juuri lisää tietoa |
| Ihmispalaute | Vastausten paremmuusvertailuja | Sävy, varovaisuus, kieltäytymiset, pituus | Ei korjaa puuttuvaa tietoa |
| Järjestelmäohje | Palvelun kirjoittama teksti | Käytös yhdessä palvelussa, heti muutettavissa | Ei muuta mallia lainkaan |
Taulukon viimeinen rivi ei ole koulutusta lainkaan, ja siksi se kannattaa pitää erillään. Se on kuitenkin syy siihen, miksi saman mallin käytös voi muuttua yhdessä yössä.
Missä kohtaa turvallisuus tulee mukaan
Turvaohjeistus ei ole yksi kerros vaan neljä, ja ne toimivat eri nopeuksilla.
Ensimmäinen on aineiston valinta: mitä esiopetukseen otetaan mukaan ja mitä siitä siivotaan pois. Toinen on hienosäätöaineisto, jossa mallille näytetään esimerkkejä myös siitä, miten kieltäydytään ja miten vaarallinen pyyntö käsitellään. Kolmas on ihmispalautevaihe, jossa turvalliset vastaukset asetetaan vertailuissa edelle. Neljäs on koulutuksen ulkopuolella: palvelun järjestelmäkehote ja erilliset suodattimet, jotka tarkistavat syötteen ja vastauksen.
Kolme ensimmäistä ovat hitaita ja pysyviä, neljäs on nopea ja vaihdettavissa. Siksi palvelun rajoitukset voivat kiristyä tai löystyä ilman että malli itse on muuttunut miksikään. Se selittää myös, miksi rajoitusten kiertäminen kehotteella joskus onnistuu: kehotteen tasolla annettu ohje on heikompi kuin koulutukseen sisäänrakennettu käytös.
Miksi sama pohjamalli käyttäytyy eri tavoin eri palveluissa
Kun kaksi palvelua rakentuu samalle avoimelle pohjamallille, ne voivat tuntua täysin eri tuotteilta. Erot syntyvät näistä:
- Hienosäätöaineisto. Eri esimerkkivastaukset tuottavat eri tyylin ja eri tavan käsitellä epävarmuutta.
- Palautevaiheen kriteerit. Se, mitä arvioijia ohjeistettiin pitämään hyvänä, siirtyy suoraan mallin luonteeseen.
- Järjestelmäohje. Sama malli voi olla asiallinen asiantuntija tai leikkisä keskustelija pelkän ohjetekstin perusteella.
- Asetukset. Vastausten satunnaisuutta ja pituutta säädetään palvelukohtaisesti.
- Ympärillä olevat työkalut. Hakuyhteys, tiedostojen luku ja koodin ajo muuttavat sitä, mihin malli käytännössä pystyy.
Käyttäjän kannalta tästä seuraa yksi hyödyllinen sääntö: mallin nimi ei riitä kertomaan, miten palvelu käyttäytyy. Kokemukset eivät siirry palvelusta toiseen sellaisenaan, vaikka pohjalla olisi sama malli.
Mitä koulutus ei korjaa
Koulutusketju ei tee mallista tietokantaa. Se ei poista sujuvia mutta vääriä väitteitä, koska mikään vaihe ei opeta mallia tarkistamaan totuutta, vain tuottamaan vastauksia joita pidettiin hyvinä. Se ei myöskään tuo mallille tuoretta tietoa: uusi tieto vaatii joko uuden opetuskierroksen tai haun ulkoisesta lähteestä vastaushetkellä.
Yksittäinen korjaus ei myöskään jää mieleen. Jos oikaiset mallin virheen kesken keskustelun, korjaus vaikuttaa vain siihen keskusteluun. Seuraavassa keskustelussa sama virhe on paikallaan, koska mikään käytön aikana tapahtuva ei muuta parametreja.
Mallin päivittyminen muistuttaa tässä ohjelmiston päivittymistä, mutta yhdellä erolla. Kun luet miksi päivityksiä julkaistaan, kyse on korjauksista, joiden sisältö on kuvattu. Mallin uusi versio voi sen sijaan muuttaa käytöstä tavoilla, joita kukaan ei ole listannut, koska muutos ei kohdistu yksittäiseen kohtaan koodia vaan kaikkiin parametreihin yhtä aikaa.
Mitä tästä seuraa sinulle
- Jos malli ei tiedä jotain, hienosäätö ei ole ratkaisu. Anna tieto kehotteessa tai liitä lähde mukaan.
- Jos mallin sävy ärsyttää tai se myötäilee liikaa, kyse on palautevaiheen jäljestä. Pyydä eksplisiittisesti kriittistä arviota, äläkä tulkitse myöntelyä vahvistukseksi.
- Jos palvelu alkoi yhtäkkiä kieltäytyä jostain, muutos on todennäköisemmin järjestelmäohjeessa tai suodattimessa kuin mallissa.
- Jos vertailet palveluita, vertaile niitä samalla tehtävällä samana päivänä. Malliversio, ohje ja asetukset muuttuvat ilmoittamatta.
- Jos työsi vaatii toistettavuutta, kirjaa ylös käyttämäsi palvelu, malliversio ja kehote. Ilman niitä tulosta ei voi toistaa myöhemmin.
Usein kysytyt kysymykset
Mitä eroa on esiopetuksella ja hienosäädöllä?
Esiopetuksessa malli oppii kielen ja maailmantiedon ennustamalla seuraavaa tokenia valtavasta tekstimassasta. Hienosäädössä sille näytetään paljon pienempi joukko valittuja esimerkkejä, jotka opettavat sen käyttäytymään avustajana. Esiopetus antaa kyvyt, hienosäätö kohdistaa ne.
Oppiiko malli minun keskusteluistani?
Ei kesken keskustelun. Mallin parametrit ovat käytön aikana lukittuina, ja se mitä kerrot, vaikuttaa vain saman keskustelun sisällä. Palvelu voi silti tallentaa keskustelut ja käyttää niitä myöhempien mallien opetusaineistona, mikä on eri asia ja riippuu palvelun ehdoista ja asetuksistasi.
Miksi kaksi tekoälypalvelua vastaa samaan kysymykseen eri tavalla?
Koska pohjamallin päälle tulee useita kerroksia: hienosäätöaineisto, ihmispalautteen kriteerit, järjestelmäohje, asetukset ja käytettävissä olevat työkalut. Nämä voivat erota täysin, vaikka pohjamalli olisi sama.
Voiko mallia opettaa lisää jälkikäteen?
Kyllä, hienosäätö on juuri sitä, mutta se sopii käytöksen ja muodon opettamiseen paremmin kuin uuden tiedon lisäämiseen. Jos tavoitteena on saada omat dokumentit mallin käyttöön, haku ulkoisesta lähteestä on tavallisesti toimivampi ja halvempi tapa.
Kuka päättää, mikä vastaus on hyvä?
Palvelun tekijä ohjeistaa arvioijat, ja ohjeistus ratkaisee lopputuloksen. Siksi mallien luonteet eroavat: varovaisuus, kohteliaisuus ja se, missä kohtaa malli kieltäytyy, ovat kaikki seurausta ihmisten kirjoittamista kriteereistä eivätkä mallin omista käsityksistä.
Miksi malli joskus myötäilee minua vaikka olen väärässä?
Koska palautevaiheessa palkitaan vastauksia, joita ihmiset pitivät hyvinä, ja miellyttävä vastaus saa helposti paremman arvion kuin epämiellyttävä oikea. Taipumus on koulutuksen sivutuote, ei merkki siitä että malli olisi vakuuttunut kannastasi.