Suuret kielimallit (LLM)
Mallin koko ja parametrit: kertooko miljardien määrä laadusta
Parametrien määrä kertoo mallin kapasiteetista, ei sen hyödyllisyydestä. Näin luet kokoluvun oikein ja tunnistat tilanteet, joissa pienempi malli on parempi valinta.
Lyhyt vastaus
Parametrien määrä kertoo, kuinka monta säädettävää lukua mallissa on. Se ennustaa melko luotettavasti muistintarpeen, käyttökustannuksen ja vastausnopeuden, mutta vain heikosti vastausten laadun. Laatuun vaikuttavat vähintään yhtä paljon opetusaineiston määrä ja laatu, opetuksen jälkeinen hienosäätö ja se, kuinka hyvin malli sopii juuri sinun tehtävääsi. Siksi kahta mallia ei voi laittaa paremmuusjärjestykseen pelkän miljardimäärän perusteella.
Sisällys
- Parametri on säädettävä luku, ei tiedon palanen
- Miksi kaksi yhtä suurta mallia ei ole yhtä hyvä
- Koko ja aineisto ovat saman budjetin kaksi puoliskoa
- Jälkikäsittely muuttaa saman mallin tunnistamattomaksi
- Miksi vertailutestien pisteet eivät siirry omaan käyttöösi
- Milloin pieni erikoistunut malli voittaa suuren
- Mitä koko tarkoittaa muistin, nopeuden ja hinnan kannalta
- Näin luet kokoluvun omaa valintaasi varten
- Usein kysytyt kysymykset
- Lähteet ja lisälukemista
Kun uusi kielimalli julkaistaan, ensimmäinen luku jonka näet on usein parametrien määrä. Se esitetään kuin moottorin tilavuus: mitä isompi luku, sitä parempi kone. Vertailu on houkutteleva, koska se tiivistää monimutkaisen järjestelmän yhteen numeroon, jolla mallit voi laittaa riviin.
Vertailu vain ei toimi. Parametrimäärä kertoo tarkasti sen, kuinka paljon muistia malli vie ja kuinka kalliiksi sen ajaminen tulee. Vastausten laadusta se kertoo yllättävän vähän, ja omasta käyttötapauksestasi vielä vähemmän. Tässä artikkelissa käydään läpi, mitä luku oikeasti mittaa, mitkä muut tekijät ratkaisevat laadun ja millä perusteella mallin voi valita järkevämmin.
Parametri on säädettävä luku, ei tiedon palanen
Malli koostuu numeroista. Kun teksti kulkee mallin läpi, sitä kerrotaan ja lasketaan yhteen valtavalla määrällä lukuja, joita kutsutaan parametreiksi tai painokertoimiksi. Opetuksessa näitä lukuja säädetään pikkuhiljaa siihen suuntaan, että malli ennustaa opetusaineiston tekstiä yhä paremmin. Kun opetus loppuu, luvut lukitaan. Sen jälkeen malli vain laskee, eikä yksittäinen keskustelu muuta niitä mihinkään. Tarkempi kuvaus laskennasta on artikkelissa siitä, miten kielimalli toimii.
Tästä seuraa kaksi asiaa, jotka kannattaa pitää mielessä aina kun näet parametriluvun.
Ensimmäinen: yksittäistä parametria ei voi tulkita. Mallissa ei ole kohtaa, jossa lukisi Suomen pääkaupunki. Tieto on hajautunut miljoonien lukujen yhteisvaikutukseen, ja siksi mallia ei voi selata, korjata kohdasta eikä auditoida rivi kerrallaan.
Toinen: parametrimäärä on kapasiteetin yläraja, ei sen käytön mitta. Hyllymetrit kertovat, kuinka paljon kirjahyllyyn mahtuu. Ne eivät kerro, mitä hyllyssä on tai onko se puoliksi tyhjä. Malli voi olla suuri ja silti opetettu huolimattomasti, jolloin kapasiteetti jää käyttämättä.
Käytön aikana eli päättelyvaiheessa parametrit ovat siis lukittuina. Malli ei opi keskustelustasi mitään pysyvää, eikä se hae vastausta tietokannasta, vaan laskee sen samoista luvuista joka kerta uudelleen. Tämä selittää, miksi mallin sisältöä ei voi päivittää lisäämällä siihen yhtä tiedostoa: uuden tiedon saaminen mukaan vaatii joko lukujen säätämistä uudelleen opetuksella tai tiedon antamista mallille kysymyksen mukana.
Miksi kaksi yhtä suurta mallia ei ole yhtä hyvä
Kaksi mallia, joissa on saman verran parametreja, voivat erota toisistaan enemmän kuin kaksi mallia, joiden kokoero on kymmenkertainen. Erot syntyvät kohdista, joita ei ilmoiteta otsikossa.
Opetusaineiston määrä ja laatu vaihtelee. Sama rakenne opetettuna huolellisesti siivotulla aineistolla tuottaa selvästi paremman mallin kuin sama rakenne opetettuna sekalaisella verkkoromulla. Aineisto määrää myös sen, mitä malli ei tiedä, ja tätä käsitellään erikseen artikkelissa tekoälyn opetusaineistosta.
Opetuksen kesto vaihtelee. Sama malli voidaan opettaa lyhyesti tai pitkään, ja pidempi opetus samalla aineistolla parantaa tulosta tiettyyn rajaan asti.
Arkkitehtuuri vaihtelee. Osa nykyisistä malleista on rakennettu niin, että vain osa parametreista osallistuu yhden tokenin käsittelyyn. Tällaisessa mallissa kokonaisparametrimäärä voi olla moninkertainen siihen verrattuna, mikä on kerralla käytössä. Jos vertaat mallia, jonka kaikki parametrit ovat aktiivisia, malliin jossa aktiivinen osa on murto-osa kokonaismäärästä, vertaat kahta eri asiaa. Ilmoitettu luku voi olla kumpi tahansa, eikä sitä aina kerrota.
Koko ja aineisto ovat saman budjetin kaksi puoliskoa
Mallin opettamiseen on aina rajallinen laskentabudjetti. Se voidaan käyttää joko suurempaan malliin tai suurempaan määrään opetusaineistoa, mutta ei molempiin.
Alan tutkimuksessa on havaittu säännönmukaisuuksia, joita kutsutaan skaalauslaeiksi: mallin ennustusvirhe pienenee melko ennustettavasti, kun parametrien määrää, aineiston määrää ja laskentaa kasvatetaan yhdessä. Olennainen havainto oli, että aiempi sukupolvi malleja oli suhteessa liian suuria opetusaineistoonsa nähden. Sama laskentabudjetti tuotti paremman mallin, kun malli tehtiin pienemmäksi ja aineistoa syötettiin enemmän.
Tällä on suora seuraus sinulle käyttäjänä. Uudempi ja pienempi malli voi olla parempi kuin vanhempi ja suurempi, koska sen kapasiteetti on käytetty tehokkaammin. Pelkkä miljardiluku ei kerro, kummasta on kyse, koska se ei sisällä tietoa opetuksen määrästä.
Pienemmällä mallilla on lisäksi yksi rakenteellinen etu: se on halvempi ja nopeampi käyttää joka ainoalla kerralla, kun taas opetuskustannus maksetaan vain kerran. Siksi kehityksen suunta on ollut kohti malleja, jotka on opetettu raskaammin mutta ajetaan kevyemmin.
Jälkikäsittely muuttaa saman mallin tunnistamattomaksi
Esiopetuksen jälkeen mallista tehdään avustaja. Se opetetaan noudattamaan ohjeita, vastaamaan kysymyksiin keskustelumuodossa, kieltäytymään tietyistä pyynnöistä ja muotoilemaan vastauksensa luettavasti. Tämä vaihe on kokonaan erillinen mallin koosta, ja sen laatu näkyy käyttäjälle välittömästi. Vaiheet käydään läpi artikkelissa näin kielimalli koulutetaan.
Käytännössä suuri osa siitä, mikä tuntuu mallin älykkyydeltä, on jälkikäsittelyn tulosta: se osaa lukea mitä pyysit, kysyä tarkennusta, pysyä annetussa muodossa ja myöntää kun ei tiedä. Näissä kahden mallin ero voi olla suuri, vaikka kokoluku olisi sama.
Miksi vertailutestien pisteet eivät siirry omaan käyttöösi
Malleja mitataan vertailutesteillä, jotka koostuvat sadoista tai tuhansista valmiista tehtävistä. Tulos on yksi prosenttiluku. Luku on hyödyllinen mallin kehittäjälle, mutta sen siirtäminen omaan arkeen tuottaa toistuvasti pettymyksiä, ja syitä on useita.
Testit ovat kapeita. Ne mittaavat sitä, mikä on helppo pisteyttää automaattisesti: monivalintoja, matematiikan tehtäviä, ohjelmointipulmia. Suurin osa oikeasta työstä ei ole tällaista.
Testit vuotavat opetusaineistoon. Kun testitehtävät ovat julkisia, ne päätyvät ennen pitkää verkkoon ja sitä kautta seuraavan mallin opetusaineistoon. Malli voi silloin saada hyvät pisteet ilman, että sen kyky yleistyä uusiin tehtäviin olisi parantunut lainkaan.
Keskiarvo piilottaa hajonnan. Malli voi olla erinomainen yhdeksässä tehtävätyypissä kymmenestä ja surkea juuri siinä, jota sinä tarvitset.
Kieli vaikuttaa. Valtaosa testeistä on englanniksi. Suomenkielinen suoritus voi poiketa selvästi, ja sitä kannattaa mitata itse, kuten artikkelissa mikä tekoäly osaa suomea parhaiten neuvotaan.
Lisäksi testituloksia julkaisee useimmiten se, joka on mallin tehnyt. Se ei tarkoita vilppiä, mutta se tarkoittaa valikointia: julkaistaan ne testit, joissa malli pärjää. Riippumattomia ja toistettavia vertailuja on vähän, ja niiden tuloksista on harvoin yksimielisyyttä.
Vertailutesti kertoo, miten malli pärjää testissä. Se on eri kysymys kuin se, pärjääkö malli sinun työssäsi.
Milloin pieni erikoistunut malli voittaa suuren
Pieni malli on huonompi yleissivistyksessä ja monimutkaisessa päättelyssä. Se ei kuitenkaan ole huonompi kaikessa, ja monessa arjen tehtävässä ero katoaa kokonaan.
Rajatuissa, toistuvissa tehtävissä pieni malli riittää usein täysin: tekstin luokittelu kategorioihin, tiettyjen tietojen poiminta lomakkeista, kiinteän muodon täyttäminen, lyhyt tiivistys, oikoluku. Näissä tehtävä on kapea ja oikea vastaus on lähellä syötettä.
Pieni malli voidaan myös opettaa suuremman mallin vastauksilla, jolloin osa suuren mallin käytöksestä siirtyy pieneen. Lopputulos on kapea mutta omassa lajissaan hyvä.
Pienten mallien saatavuus on myös parempi. Ne julkaistaan useammin niin, että painot voi ladata itselleen, jolloin mallin voi ajaa omalla laitteistolla ilman ulkopuolista palvelua. Mitä avoimuus tarkoittaa ja mitä se ei lupaa, käydään läpi artikkelissa avoimet mallit ja avoimet painot.
Kolme muuta syytä puoltaa pientä mallia riippumatta laadusta. Se vastaa nopeammin, mikä ratkaisee kun malli on osa käyttöliittymää. Se maksaa vähemmän jokaisella kutsulla. Ja se mahtuu omalle koneelle, jolloin tiedot eivät lähde mihinkään. Muistivaatimuksia ja tallennustarkkuuden pienentämistä käsitellään tarkemmin artikkelissa paikallinen tekoäly omalla koneella.
Mitä koko tarkoittaa muistin, nopeuden ja hinnan kannalta
Tässä kokoluku on käyttökelpoinen. Mallin muistintarve saadaan suoraan kertolaskuna: parametrien määrä kerrottuna sillä, kuinka monta tavua yhden parametrin tallentamiseen käytetään. Sama luku selittää myös hitauden, koska jokainen tuotettu token vaatii koko aktiivisen parametrijoukon läpikäynnin.
| Mihin koko vaikuttaa | Miten | Mikä vaikuttaa enemmän |
|---|---|---|
| Muistintarve | Kasvaa suoraan parametrimäärän mukana | Tallennustarkkuus eli kvantisointi |
| Vastausnopeus | Suuri malli tuottaa tokeneita hitaammin | Vastauksen pituus ja palvelimen kuorma |
| Käyttökustannus | Suuri malli maksaa enemmän per token | Kehotteen ja vastauksen tokenimäärä |
| Harvinaisten aiheiden tuntemus | Paranee koon myötä | Opetusaineiston kattavuus |
| Ohjeiden noudattaminen | Vaikuttaa vain vähän | Jälkikäsittelyn laatu |
| Tarkkuus omissa dokumenteissa | Ei juuri vaikuta | Onko tieto annettu mallille lainkaan |
| Suomen sujuvuus | Vaikuttaa jonkin verran | Suomenkielisen aineiston osuus |
Taulukon kaksi alinta riviä ovat käytännössä tärkeimmät. Jos malli ei tiedä yrityksesi asioita, suurempi malli ei auta, koska tietoa ei ole missään mallin sisällä. Silloin ratkaisu on antaa tieto mallille kehotteessa tai hakea se erikseen, ei vaihtaa isompaan malliin.
Näin luet kokoluvun omaa valintaasi varten
Käy nämä kohdat läpi, kun vertailet malleja tai luet julkaisutiedotetta.
- Katso, mistä luvusta puhutaan. Onko kyse kokonaisparametrimäärästä vai kerralla aktiivisesta osasta. Jos tätä ei kerrota, luku ei ole vertailukelpoinen.
- Selvitä, ajetaanko malli pilvessä vai omalla laitteella. Pilvessä koko näkyy sinulle vain hintana ja viiveenä. Omalla koneella se on ehdoton raja, jonka muistin määrä asettaa.
- Tunnista tehtäväsi tyyppi. Kapea ja toistuva tehtävä ei tarvitse suurta mallia. Avoin päättely, pitkä konteksti ja monimutkainen ohjeistus tarvitsevat.
- Testaa omalla aineistollasi. Kokoa kymmenkunta oikeaa tehtävää työstäsi, aja ne molemmilla malleilla ja vertaa itse. Tämä on ainoa vertailu, joka koskee sinua.
- Vertaa hintaa suoritukseen, älä kokoon. Jos pienempi malli hoitaa tehtävän riittävän hyvin, ero suureen malliin on pelkkää kustannusta. Hinnoittelun logiikka avataan artikkelissa tekoälypalvelun hinnoittelu.
- Muista laitteiston rajat. Muistin määrä on paikallisessa käytössä sitovampi rajoite kuin prosessorin nopeus, mikä selviää artikkelista prosessori ja muisti selitettynä.
Kokoluku ei siis ole hyödytön. Se on hyvä ennuste kustannuksesta ja huono ennuste laadusta, ja tämän eron tunteminen riittää yllättävän pitkälle.
Usein kysytyt kysymykset
Onko suurempi kielimalli aina parempi?
Ei. Suurempi malli osaa keskimäärin enemmän yleistietoa ja pärjää paremmin monimutkaisessa päättelyssä, mutta se on myös hitaampi ja kalliimpi. Monessa rajatussa tehtävässä pienempi malli antaa saman lopputuloksen murto-osalla kustannuksesta.
Mitä miljardi parametria oikeastaan tarkoittaa?
Se tarkoittaa, että mallissa on miljardi säädettävää lukua, joita opetus on virittänyt. Luvut eivät ole faktoja eivätkä sääntöjä, vaan kertoimia, joiden yhteisvaikutuksesta vastaus syntyy. Yksittäisestä parametrista ei voi lukea mitään.
Miksi sama malli tuntuu joskus tyhmemmältä kuin ennen?
Palveluntarjoaja voi vaihtaa taustalla käytettävää mallia tai sen asetuksia ilman, että käyttöliittymässä näkyy mitään. Myös oma kehotteesi ja keskustelun pituus vaikuttavat: pitkässä keskustelussa alkupää voi pudota kontekstista pois.
Voiko mallin koon päätellä siitä, kuinka nopeasti se vastaa?
Vain karkeasti. Suuri malli tuottaa tokeneita hitaammin, mutta viiveeseen vaikuttavat myös palvelimen kuormitus, vastauksen pituus ja se, tekeekö malli välissä päättelyä tai hakuja. Nopeus on siis vihje, ei mittari.
Kannattaako minun ajaa mallia omalla koneella, jos parametreja on vähän?
Se on mahdollista, kun muistia riittää. Muistintarve saadaan parametrimäärästä ja tallennustarkkuudesta, ja tarkkuutta pienentämällä isokin malli voidaan puristaa pienempään tilaan laadun kustannuksella.
Miksi mallit saavat vertailutesteissä hyviä pisteitä mutta epäonnistuvat työssäni?
Vertailutestit mittaavat kapeaa joukkoa automaattisesti pisteytettäviä tehtäviä, usein englanniksi. Testitehtävät voivat myös vuotaa opetusaineistoon, jolloin hyvä pistemäärä ei kerro yleistyskyvystä. Oma testijoukko omilla tehtävilläsi on luotettavampi mittari.