Mallien ja palveluiden valinta
Tekoälypalvelun hinnoittelu: tokenit, kiintiöt ja piilokulut
Kuukausimaksu, tokenihinta ja käyttöraja mittaavat kolmea eri asiaa. Kun tietää mistä laskutusyksikkö syntyy, hinnaston lukeminen ja oman kulutuksen arviointi muuttuu suoraviivaiseksi.
Lyhyt vastaus
Tekoälypalveluita myydään kahdella tavalla: kiinteällä kuukausitilauksella, jossa raja on käyttömäärä, ja käyttöperusteisella hinnoittelulla, jossa maksat jokaisesta käsitellystä tekstinpalasta eli tokenista. Syöte ja tuloste hinnoitellaan erikseen, ja tuloste on yleensä selvästi kalliimpi. Lasku kasvaa huomaamatta silloin, kun sama syöte lähetetään yhä uudelleen: pitkässä keskustelussa koko historia menee mukana joka kierroksella. Kuukausitilauksessa vastaava ilmiö näkyy rahan sijaan kiintiön loppumisena ja hitaampana palveluna.
Sisällys
- Kaksi hinnoittelumallia, jotka mittaavat eri asiaa
- Token on laskutusyksikkö, ei sana
- Miksi syöte ja tuloste maksavat eri verran
- Mikä kasvattaa syötettä huomaamatta
- Välimuisti leikkaa toistuvan syötteen hinnan
- Päättelymallit laskuttavat ajattelusta
- Kiintiöt ja jonot: kun raja ei ole raha vaan aika
- Näin arvioit oman kulutuksesi ja rajaat laskun
- Usein kysytyt kysymykset
- Lähteet ja lisälukemista
Tekoälypalvelun hinnasto näyttää yksinkertaiselta, kunnes yrittää arvioida etukäteen mitä oma käyttö maksaa. Kuukausitilaus lupaa käytön "rajoituksin", ja käyttöperusteinen hinnasto ilmoittaa hinnan miljoonaa tokenia kohti. Kumpikaan luku ei kerro suoraan mitään ennen kuin tietää, mikä kulutusta oikeasti kasvattaa.
Tässä artikkelissa käydään läpi hinnoittelun rakenne: mistä laskutusyksikkö syntyy, miksi syöte ja tuloste maksavat eri verran, mikä paisuttaa syötettä huomaamatta ja mitä kiintiöt tarkoittavat arjessa. Euromääriä ei mainita, koska ne muuttuvat nopeasti ja vanhenevat heti. Kysymykseen siitä, kannattaako maksullinen versio ylipäätään, vastaa artikkeli kannattaako tekoälyn maksullinen versio. Tämä artikkeli käsittelee sitä, miten hinta muodostuu, kun olet jo päättänyt maksaa.
Kaksi hinnoittelumallia, jotka mittaavat eri asiaa
Kuukausitilauksessa maksat pääsystä. Hinta on kiinteä, ja palvelu suojaa itseään rajoilla: viestimäärä tietyssä aikaikkunassa, tiedostojen koko, kuvien määrä tai pääsy raskaimpiin malleihin. Kun raja tulee vastaan, et saa lisälaskua vaan huonompaa palvelua. Tämä sopii ihmiselle, jonka käyttö on epäsäännöllistä ja jonka aika on kalliimpaa kuin muutaman euron heitto suuntaan tai toiseen.
Käyttöperusteisessa hinnoittelussa maksat työstä. Jokainen pyyntö laskutetaan käsitellyn tekstimäärän mukaan, eikä ylärajaa ole ellei sellaista itse aseta. Tämä on rajapintojen ja automaatioiden malli. Se on läpinäkyvä siinä mielessä, että kustannus on suoraan verrannollinen tehtyyn työhön, ja arvaamaton siinä mielessä, että virheellinen silmukka voi tuottaa työtä yön yli.
Kolmas malli on näiden yhdistelmä, jossa kuukausimaksu sisältää tietyn määrän käyttöä ja ylimenevä osa laskutetaan erikseen. Sen kanssa kannattaa katsoa erityisen tarkkaan, mitä sisältyvä määrä mittaa ja siirtyykö käyttämätön osuus seuraavalle kaudelle. Yleisemmin tilausmuotoisten ohjelmistojen ehdoista kerrotaan artikkelissa tilausperusteiset ohjelmistot.
| Piirre | Kuukausitilaus | Käyttöperusteinen |
|---|---|---|
| Mitä maksat | Pääsy ja kiintiö | Käsitelty tekstimäärä |
| Ennustettavuus | Hyvä, hinta on kiinteä | Huono ilman omaa seurantaa |
| Mitä tapahtuu rajalla | Palvelu hidastuu tai estyy | Lasku kasvaa |
| Sopii | Vaihtelevaan ihmiskäyttöön | Automaatioon ja mitattavaan työhön |
| Suurin riski | Maksat käytöstä jota ei tule | Yksi virhe tuottaa ison laskun |
Token on laskutusyksikkö, ei sana
Kielimalli ei käsittele sanoja vaan tokeneita, eli tekstin paloja. Yleinen sana voi olla yksi token, harvinainen sana pilkkoutuu useaan, ja välimerkit sekä rivinvaihdot ovat omia yksiköitään. Laskutus perustuu näihin paloihin, koska juuri ne kulkevat mallin läpi.
Tästä seuraa suomen kannalta ikävä asia. Tokenisaattorien sanastot on rakennettu aineistolla, jossa englanti on ylivoimaisesti suurin kieli, joten suomenkielinen teksti pilkkoutuu keskimäärin useampaan palaan kuin sama sisältö englanniksi. Sama tehtävä maksaa siis suomeksi enemmän ja on myös hieman hitaampi. Ilmiön syyt ja suuruusluokka käydään läpi artikkelissa tokenit ja suomen kieli.
Käytännön johtopäätös ei ole se, että pitäisi vaihtaa kieltä. Se on se, että englanninkielisistä hinnastoista laskettu arvio ei päde suomenkieliseen käyttöön sellaisenaan. Jos teet arviota, tee se omalla aineistollasi.
Miksi syöte ja tuloste maksavat eri verran
Hinnastossa on lähes aina kaksi hintaa: yksi sisään menevälle tekstille ja toinen ulos tulevalle. Ero ei ole mielivaltainen vaan seuraa siitä, miten malli laskee.
Sisään menevä teksti voidaan käsitellä rinnakkain. Malli lukee koko kehotteen kerralla ja laskee siitä sisäisen esityksen yhdessä tehokkaassa vaiheessa. Ulos tuleva teksti syntyy sen sijaan yksi token kerrallaan, ja jokaista uutta tokenia varten koko malli käydään uudelleen läpi. Tuloste on siksi laskennallisesti raskaampaa yksikköä kohti, ja hinnoittelu heijastaa tätä.
Tästä seuraa kaksi käytännön asiaa. Ensinnäkin pitkän vastauksen pyytäminen maksaa enemmän kuin pitkän aineiston antaminen. Toiseksi tulosteen pituuden rajaaminen on tehokkain yksittäinen keino leikata kustannusta: pyyntö tuottaa tiivistelmä kolmella virkkeellä on halvempi kuin sama pyyntö ilman rajausta. Sama koskee latenssia, eli vastauksen odotusaikaa, joka riippuu ennen kaikkea tulostettavien tokenien määrästä.
Mikä kasvattaa syötettä huomaamatta
Suurin osa yllättävistä laskuista syntyy syötepuolella, koska syöte kasvaa ilman että käyttäjä tekee mitään näkyvää.
Keskusteluhistoria. Malli ei muista mitään pyyntöjen välillä. Jotta keskustelu jatkuisi, sovellus lähettää koko aiemman keskustelun uudelleen jokaisen viestin mukana. Kymmenennessä viestissä maksat siis myös yhdeksästä ensimmäisestä. Kustannus kasvaa keskustelun pituuden mukana kiihtyvästi, ei tasaisesti. Sama mekanismi selittää konteksti-ikkunan täyttymisen, ja se on käyty läpi artikkelissa konteksti-ikkuna selitettynä.
Liitteet ja tiedostot. Liitetty dokumentti muuttuu tekstiksi ja menee syötteeseen. Pitkä pdf voi täyttää suuren osan ikkunasta, ja jos keskustelu jatkuu, se lähetetään uudelleen jokaisella kierroksella. Kuvat ja ääni muunnetaan omiksi yksiköikseen, ja niiden hinnoitteluperuste on eri kuin tekstillä.
Järjestelmäkehote ja työkalukuvaukset. Sovellukseen kirjoitettu pysyvä ohje kulkee mukana joka pyynnössä. Jos sovellus tarjoaa mallille työkaluja, myös niiden kuvaukset ovat syötettä. Nämä ovat pieniä yksittäin ja merkittäviä silloin, kun pyyntöjä on paljon.
Haetut tekstinpalat. Kun palvelu hakee vastauksen tueksi aineistoa omasta tietokannasta, haetut palat liitetään kehotteeseen. Menetelmä on hyödyllinen, mutta se on myös suora kustannustekijä: mitä enemmän paloja haetaan varmuuden vuoksi, sitä suurempi syöte. Menetelmän toimintaperiaate on selitetty artikkelissa RAG vai hienosäätö.
Ero maksutapojen välillä näkyy tässä selvästi. Käyttöperusteisessa hinnoittelussa nämä näkyvät laskuna. Kuukausitilauksessa ne näkyvät siinä, että pitkä keskustelu alkaa hidastua, vastaukset lyhenevät tai palvelu ilmoittaa rajan tulleen vastaan aiemmin kuin odotit.
Välimuisti leikkaa toistuvan syötteen hinnan
Koska sama alkuosa lähetetään yhä uudelleen, palvelut ovat rakentaneet siihen välimuistin. Kun pyynnön alku on tarkalleen sama kuin edellisessä pyynnössä, palvelin voi käyttää jo laskettua sisäistä esitystä uudelleen sen sijaan että laskisi sen alusta. Tämä sekä nopeuttaa vastausta että laskee syötteen hintaa, ja hinnastoissa välimuistista luettu syöte on omalla rivillään halvempana.
Välimuistilla on kaksi ehtoa, jotka kannattaa tietää. Osuma vaatii tarkan vastaavuuden alusta lähtien, joten yksikin muutettu merkki kehotteen alussa mitätöi hyödyn. Ja välimuisti on voimassa rajallisen ajan, joten harvakseltaan tehtävät pyynnöt eivät siitä hyödy. Käytännön ohje seuraa suoraan: pidä pysyvä ohje ja kiinteä aineisto kehotteen alussa ja vaihtuva osuus lopussa.
Päättelymallit laskuttavat ajattelusta
Päättelemään koulutettu malli tuottaa ennen vastausta pitkän välivaiheiden ketjun. Ketju on tekstiä siinä missä vastauskin, ja se lasketaan tulosteeksi, vaikka sitä ei näytettäisi sinulle kokonaan. Sama kysymys voi siksi maksaa moninkertaisesti sen mukaan, kuinka paljon malli päätti miettiä.
Tämä on merkittävin yksittäinen syy siihen, miksi kustannusarvio pettää. Tavallisen mallin tuloste on suunnilleen sen mittainen kuin vastaus näyttää, päättelymallin ei. Osassa palveluista päättelyn määrää voi säätää, ja silloin säädin on käytännössä hintasäädin. Milloin ylimääräinen päättely kannattaa ja milloin ei, on käyty läpi artikkelissa päättelymallit.
Yleisemmin inference eli mallin ajaminen vastaushetkellä on se, mistä koko laskutus muodostuu. Mallin kouluttaminen on palveluntarjoajan kustannus, sinä maksat vain ajosta. Siksi mallin valinta tehtävän mukaan on tehokkaampi säästökeino kuin kehotteen hienosäätö: kevyempi kielimalli riittää luokitteluun ja muotoiluun, ja raskaampi kannattaa varata sinne, missä sen ero näkyy.
Kiintiöt ja jonot: kun raja ei ole raha vaan aika
Kuukausitilauksen rajat ovat harvoin yksi luku. Tyypillisesti käytössä on useita samaan aikaan: viestimäärä aikaikkunassa, pyyntöjen tiheys, tiedostojen koko ja erikseen raskaimpien toimintojen kuten kuvien luonnin tai pitkien dokumenttien käsittelyn kiintiö. Rajat myös nollautuvat eri tahtiin, mikä tekee niistä vaikeasti ennakoitavia.
Arjessa raja näkyy neljällä tavalla, ja ne kannattaa osata tunnistaa:
- Palvelu ilmoittaa suoraan rajan täyttymisestä ja kertoo, milloin se nollautuu.
- Palvelu vaihtaa hiljaisesti kevyempään malliin. Vastaukset muuttuvat lyhyemmiksi ja pinnallisemmiksi ilman erillistä ilmoitusta.
- Vastaus alkaa tulla hitaammin, koska maksavat asiakkaat menevät jonossa edelle ruuhka-aikana.
- Yksittäinen toiminto lakkaa olemasta käytettävissä, vaikka keskustelu muuten toimii.
Hinnastoon kuuluu usein myös eriä, jotka eivät ole tokeneita eivätkä kuulu kuukausimaksuun. Tällaisia ovat tyypillisesti aineiston tallennus haettavassa muodossa, tiedostojen muunnos tekstiksi, äänen käsittely kestoon perustuen ja työtilan maksu jokaisesta käyttäjästä erikseen. Yrityskäytössä myös vuosisitoumus ja irtisanomisehto ovat osa hintaa, vaikka ne eivät näy yksikköhinnassa. Kuluttajana kannattaa tarkistaa, ilmoitetaanko hinta arvonlisäveroineen ja missä valuutassa se veloitetaan, koska ulkomaisessa palvelussa kortin valuutanmuunnos tulee päälle.
Rajapintakäytössä vastaava rajoite on pyyntöjen määrä aikayksikössä. Kun raja ylittyy, palvelu vastaa virheellä ja odottaa, että pyyntöjä hidastetaan. Automaatiossa tämä pitää käsitellä ohjelmallisesti, koska muuten työ keskeytyy kesken erän.
Näin arvioit oman kulutuksesi ja rajaat laskun
Arvio kannattaa tehdä mittaamalla eikä laskemalla, koska omat käyttötavat eroavat keskimääräisestä enemmän kuin uskoisi. Kulutus keskittyy lähes aina muutamaan toistuvaan tehtävään, ja niiden mittaaminen kertoo kokonaisuudesta enemmän kuin hinnaston lukeminen.
- Seuraa omaa käyttöäsi viikko normaalisti ja merkitse muistiin, montako kertaa törmäät rajaan tai joudut odottamaan. Tämä kertoo tarvitsetko lisää kiintiötä vai et.
- Ota käyttöperusteisessa palvelussa kolme tyypillistä tehtävääsi ja aja ne kerran. Palvelun käyttöraportista näet niiden todellisen kulutuksen, ja voit kertoa sen arvioidulla määrällä.
- Katso raportista syötteen ja tulosteen suhde. Jos syöte on moninkertainen, ongelma on turhassa aineistossa. Jos tuloste on suuri, rajaa vastauksen pituutta.
- Aseta kustannuskatto ja hälytys, jos palvelu tarjoaa niitä. Tämä on ainoa suoja silmukkaan jääneelle automaatiolle.
- Säilytä rajapinta-avain kuin salasana. Vuotanut avain on toisen ihmisen käyttöoikeus sinun laskuusi, eikä sitä huomaa mitenkään muuten kuin laskusta.
- Tarkista, laskutetaanko sinua myös silloin kun pyyntö epäonnistuu tai kun keskeytät vastauksen kesken. Käytäntö vaihtelee, ja tieto löytyy hinnaston tarkennuksista.
Lopuksi kannattaa muistaa, että osa työstä ei maksa mitään. Puhelimen omat toiminnot, kuten sanelu ja käännös, tehdään usein laitteessa ilman erillistä veloitusta, ja niiden rajat ovat aivan toisenlaiset. Missä raja kulkee, on selitetty artikkelissa tekoäly puhelimessa. Kaikkein halvin pyyntö on se, jota ei tarvitse tehdä ollenkaan.
Usein kysytyt kysymykset
Mikä on token ja miksi siitä laskutetaan?
Token on pala tekstiä, jonka kielimalli käsittelee yhtenä yksikkönä. Se voi olla kokonainen sana, sanan osa tai välimerkki. Laskutus perustuu tokeneihin, koska mallin tekemä työ on suoraan verrannollinen niiden määrään, ei sanojen tai merkkien määrään.
Miksi tulostetokenit ovat kalliimpia kuin syötetokenit?
Syöte voidaan käsitellä rinnakkain yhdellä laskentavaiheella, mutta tuloste syntyy yksi token kerrallaan ja jokaista varten koko malli käydään läpi uudelleen. Tuloste on siis laskennallisesti raskaampaa, ja hinnoittelu seuraa tätä eroa. Käytännössä vastauksen pituuden rajaaminen säästää enemmän kuin syötteen karsiminen.
Miksi pitkä keskustelu maksaa enemmän kuin uusi keskustelu?
Malli ei muista aiempaa, joten sovellus lähettää koko keskusteluhistorian mukana jokaisessa viestissä. Mitä pidemmälle keskustelu etenee, sitä enemmän tekstiä kulkee mukana joka kierroksella. Uuden keskustelun aloittaminen erillisestä aiheesta on siksi sekä halvempaa että usein laadun kannalta parempi.
Mitä välimuisti tarkoittaa tekoälypalvelun hinnastossa?
Se tarkoittaa, että pyynnön alkuosa voidaan lukea aiemmin lasketusta muodosta sen sijaan että se laskettaisiin uudelleen. Välimuistista luettu syöte on hinnastossa halvempaa ja myös nopeampaa. Osuma edellyttää, että kehotteen alku on tarkalleen sama, joten pysyvä ohje kannattaa pitää alussa ja vaihtuva osuus lopussa.
Miksi sama kysymys maksaa eri verran eri kerroilla?
Yleisin syy on tulosteen pituuden vaihtelu. Päättelemään koulutetuilla malleilla vaihtelu on suurempaa, koska välivaiheiden ketju lasketaan tulosteeksi, vaikka sitä ei näytettäisi. Myös välimuistiosuma tai sen puuttuminen muuttaa hintaa saman kysymyksen eri kerroilla.
Maksaako suomeksi kysyminen enemmän kuin englanniksi?
Kyllä, keskimäärin. Suomenkielinen teksti pilkkoutuu useampaan tokeniin kuin sama sisältö englanniksi, koska tokenisaattorien sanastot on rakennettu englantipainotteisella aineistolla. Ero on tyypillisesti maltillinen yksittäisessä kysymyksessä, mutta se kertautuu suurissa määrissä.
Miten estän yllättävän suuren laskun?
Aseta kustannuskatto ja hälytys, jos palvelu tarjoaa ne, ja käsittele automaatiossa myös virhetilanteet niin ettei sama pyyntö toistu loputtomasti. Säilytä rajapinta-avain salasanan tapaan, koska vuotanut avain näkyy vain laskussa. Kiinteä kuukausitilaus on turvallisin vaihtoehto silloin, kun ennustettavuus on tärkeämpää kuin tarkka hinta.