selitetty.com

Mitä tekoäly on

Tekoälyagentit selitettynä: kun malli alkaa käyttää työkaluja

Agentti ei ole älykkäämpi malli vaan tavallinen kielimalli, joka on kytketty työkaluihin ja päästetty toimimaan silmukassa. Kun tämän mekanismin ymmärtää, sekä agentin kyvyt että sen tyypilliset epäonnistumiset muuttuvat ennustettaviksi.

Lyhyt vastaus

Tekoälyagentti on kielimalli, jolle on annettu joukko työkaluja ja lupa käyttää niitä toistuvasti: malli valitsee työkalun, ohjelmisto suorittaa sen, tulos palautetaan mallille ja kierros alkaa alusta, kunnes tehtävä on valmis tai raja tulee vastaan. Mallin sisäinen toiminta ei muutu miksikään, vaan uutta on silmukka ja pääsy ulkomaailmaan. Siksi agentin suurin ero tavalliseen chattiin ei ole älykkyys vaan seuraukset: väärä vastaus on kiusallinen, mutta väärä toimi voi olla peruuttamaton.

Sisällys
  1. Agentti ei ole älykkäämpi malli
  2. Työkalukutsu: mitä malli oikeasti lähettää
  3. Silmukka ja lopetusehto
  4. Miksi virhe kasvaa pitkissä ketjuissa
  5. Peruuttamattomat toimet ja hyväksyntäkohdat
  6. Kehoteinjektio muuttuu agentin kanssa vakavammaksi
  7. Mistä tunnistat oikean agentin markkinointipuheen takaa
  8. Mihin agentti oikeasti sopii arjessa
  9. Näin otat agentin käyttöön ilman ikäviä yllätyksiä
  10. Usein kysytyt kysymykset
  11. Lähteet ja lisälukemista

Agentti on tällä hetkellä tekoälyn ylikäytetyin sana. Sillä myydään kaikkea automaattisesta sähköpostivastauksesta kokonaisiin digitaalisiin työntekijöihin, eikä esittelyistä yleensä käy ilmi, mitä järjestelmä oikeasti tekee. Mekanismi on kuitenkin yksinkertainen, ja se selittää sekä sen, mihin agentit pystyvät, että sen, missä ne kaatuvat toistuvasti samalla tavalla.

Tässä ei selitetä uudelleen, miten kielimalli tuottaa tekstiä. Tokenit, ennustaminen ja huomiomekanismi on käyty läpi artikkelissa miten kielimalli toimii. Tässä kysytään, mitä tapahtuu, kun sama malli saa luvan tehdä eikä vain vastata.

Agentti ei ole älykkäämpi malli

Aloitetaan siitä, mitä agentti ei ole. Se ei ole erityinen mallityyppi, jolla olisi enemmän ymmärrystä tai tavoitteita kuin chattiin vastaavalla mallilla. Sama malli voi toimia molemmissa rooleissa. Ero on ympäröivässä ohjelmistossa.

Tavallisessa keskustelussa kulku on suora: kysyt, malli tuottaa vastauksen, keskustelu päättyy. Agenttiasetelmassa mallin ja käyttäjän väliin lisätään kaksi asiaa. Ensimmäinen on työkaluluettelo: kuvaus siitä, mitä toimintoja malli saa pyytää ja millaisilla tiedoilla. Toinen on silmukka: ohjelma, joka suorittaa mallin pyytämän toiminnon, palauttaa tuloksen mallille ja antaa sen jatkaa.

Tästä seuraa suoraan, että agentin kyvyt ovat täsmälleen sen työkalujen kyvyt. Agentti, jolla on hakutyökalu, osaa hakea. Agentti, jolla on kalenterityökalu, osaa varata ajan. Se ei osaa mitään, mihin sillä ei ole työkalua, vaikka se osaisi kuvailla toimintaa vakuuttavasti tekstinä.

Työkalukutsu: mitä malli oikeasti lähettää

Työkalu kuvataan mallille etukäteen jäsenneltynä määrittelynä: nimi, kuvaus siitä mihin sitä käytetään, ja luettelo parametreista tietotyyppeineen. Kun malli päättää käyttää työkalua, se ei suorita mitään. Se tuottaa tekstin, joka on muotoiltu sovitun rakenteen mukaan ja joka sisältää työkalun nimen ja parametrien arvot.

Ympäröivä ohjelmisto lukee tämän pyynnön, tarkistaa sen muodon, suorittaa varsinaisen toiminnon tavallisella koodilla ja liittää tuloksen keskusteluun uutena viestinä. Malli näkee tuloksen samalla tavalla kuin näkisi käyttäjän kirjoittaman tekstin.

Määrittelyn laatu vaikuttaa tuloksiin enemmän kuin useimmat odottavat. Malli valitsee työkalun sen kuvauksen perusteella, joten epäselvästi kuvatut työkalut sekoittuvat keskenään. Jos kaksi työkalua tekee lähes samaa asiaa, malli valitsee niistä välillä väärän, eikä syy ole mallissa vaan kuvauksissa.

Tämä työnjako on tärkeä kahdesta syystä. Ensinnäkin se kertoo, kuka on vastuussa turvarajoista: rajat ovat ohjelmistossa, eivät mallissa. Jos ohjelmisto suorittaa kaiken mitä malli pyytää, mitään rajaa ei ole. Toiseksi se selittää tyypillisen virheen. Malli voi tuottaa kelvollisen näköisen kutsun työkalulle, jota ei ole olemassa, tai antaa parametrille arvon, jonka se on päätellyt eikä lukenut mistään. Tämä on sama ilmiö kuin hallusinaatiot tekstivastauksissa, mutta nyt se johtaa toimintaan eikä väärään lauseeseen.

Silmukka ja lopetusehto

Silmukka on agentin ydin, ja se on yksinkertaisempi kuin miltä kuulostaa.

  1. Malli saa tehtävän, työkaluluettelon ja keskusteluhistorian.
  2. Malli tuottaa joko vastauksen käyttäjälle tai työkalukutsun.
  3. Jos tuloksena oli työkalukutsu, ohjelmisto suorittaa sen ja liittää tuloksen historiaan.
  4. Kierros toistetaan kohdasta 1.
  5. Silmukka päättyy, kun malli tuottaa vastauksen ilman työkalukutsua tai kun jokin ulkoinen raja täyttyy.

Silmukan ainoa muisti on keskusteluhistoria. Malli itse ei muutu ajon aikana lainkaan, vaan sen parametrit pysyvät koko ajan samoina. Kaikki, mitä agentti on tehnyt ja oppinut tehtävän aikana, on siis tekstiä sen kontekstissa. Kun ajo päättyy, tuo muisti häviää, ellei ohjelmisto tallenna sitä erikseen johonkin.

Kohta 5 on se, joka erottaa toimivan agentin sekoilevasta. Malli päättää itse, milloin tehtävä on valmis, ja se on huono arvioimaan sitä. Siksi silmukkaan asetetaan aina myös ulkoisia rajoja: enimmäismäärä kierroksia, aikaraja, kustannuskatto tai ehto, jonka toteutuminen tarkistetaan koodilla. Ilman niitä agentti voi jäädä toistamaan samaa epäonnistuvaa askelta tai ajautua kauas alkuperäisestä tehtävästä.

Kierrosten kertyessä myös keskusteluhistoria kasvaa, koska jokainen työkalun tulos liitetään siihen. Kun historia täyttää mallin konteksti-ikkunan, vanhinta osaa aletaan karsia tai tiivistää, ja alkuperäinen ohje voi kadota matkalla. Tämä on yleinen syy siihen, että pitkä agenttiajo alkaa hyvin ja päättyy oudosti.

Miksi virhe kasvaa pitkissä ketjuissa

Agenttien käytännön rajoitus on aritmeettinen. Jos jokainen askel onnistuu itsenäisesti todennäköisyydellä p, koko ketju onnistuu todennäköisyydellä p korotettuna askelten määrällä. Alla on pelkkä laskuesimerkki, ei mittaustulos, mutta se näyttää suuruusluokan.

Askeleen onnistumistodennäköisyys 3 askelta 10 askelta 20 askelta
0,99 noin 0,97 noin 0,90 noin 0,82
0,95 noin 0,86 noin 0,60 noin 0,36
0,90 noin 0,73 noin 0,35 noin 0,12

Todellisuudessa askeleet eivät ole riippumattomia, ja tilanne on tätä huonompi yhdestä syystä: agentti ei aloita jokaista askelta puhtaalta pöydältä vaan aiemman askeleen tuloksesta. Väärä välitulos ei jää yksittäiseksi virheeksi vaan muuttuu lähtötiedoksi seuraavalle päätökselle. Malli myös perustelee virheellisen välivaiheen uskottavasti, koska sen tehtävä on tuottaa johdonmukaista tekstiä.

Käytännön johtopäätös on sama kuin promptien ketjutuksessa: lyhennä ketjua, tarkista välitulokset ja anna agentille mieluummin monta pientä tehtävää kuin yksi pitkä. Toinen keino on tehdä askeleista helposti tarkistettavia. Jos jokainen välivaihe tuottaa jotain, jonka voit silmäillä sekunnissa, pitkäkin ajo pysyy hallinnassa. Jos välivaiheet ovat näkymättömiä ja näet vain lopputuloksen, joudut luottamaan siihen, että kaikki kymmenen askelta menivät oikein.

Peruuttamattomat toimet ja hyväksyntäkohdat

Agenttien riskiarvio kannattaa tehdä yhdellä kysymyksellä: mitä tapahtuu, jos tämä askel menee väärin, ja voiko sen perua?

Toimen laji Esimerkki Peruttavuus Suositeltu käytäntö
Lukeva Haku, tiedoston avaus, kalenterin katselu Täysi Voi ajaa automaattisesti
Luova Luonnoksen kirjoitus, tiedoston luonti omaan kansioon Helppo Voi ajaa automaattisesti, tarkistus lopuksi
Muuttava Tiedoston muokkaus, tapahtuman siirto Vaihteleva Näytä muutos ennen tallennusta
Ulos menevä Sähköpostin lähetys, viesti asiakkaalle, julkaisu Ei käytännössä Vaadi ihmisen hyväksyntä
Rahaan tai oikeuksiin liittyvä Maksu, tilaus, käyttöoikeuden myöntäminen Ei Vaadi ihmisen hyväksyntä, kirjaa lokiin

Jako on karkea mutta riittää suunnitteluun. Olennaista on, että hyväksyntä sijoitetaan juuri ennen peruuttamatonta askelta eikä ajon alkuun. Alussa annettu yleinen lupa ei ole hyväksyntä vaan luopuminen siitä.

EU:n tekoälyasetus lähtee samasta ajatuksesta korkean riskin järjestelmissä: niiden on oltava suunniteltu niin, että ihminen voi tosiasiallisesti valvoa toimintaa ja keskeyttää sen. Sääntelyn pääpiirteet on käyty läpi artikkelissa EU:n tekoälyasetus. Tavallisessa toimistokäytössä velvoite ei useimmiten sido, mutta periaate on silti järkevä.

Kehoteinjektio muuttuu agentin kanssa vakavammaksi

Kun agentti lukee verkkosivuja, sähköposteja tai tiedostoja, kaikki lukemansa päätyy sen kontekstiin. Malli ei erottele luotettavasti sitä, mikä osa tekstistä on ohje sinulta ja mikä osa on sisältöä, jota se vain lukee. Tähän perustuu kehoteinjektio: sivulle tai viestiin piilotettu ohje, joka on kirjoitettu agentin luettavaksi.

Pelkässä chatissa seuraus on väärä vastaus. Agentilla, jolla on työkaluja, seuraus voi olla toimi: tietojen lähetys ulos, ostoksen tekeminen tai tiedoston muokkaus. Tästä syystä yleisin suositeltu rakenne on, että agentin luku- ja kirjoitusoikeudet pidetään mahdollisimman kapeina ja että ulos lähtevä liikenne kulkee aina ihmisen läpi. Työpaikalla kannattaa lisäksi sopia, mitä tietoja agentille ylipäätään syötetään, mikä on käsitelty artikkelissa tekoäly työpaikalla.

Mistä tunnistat oikean agentin markkinointipuheen takaa

Sana agentti on myyntikelpoinen, joten sitä käytetään myös järjestelmistä, joissa mitään silmukkaa ei ole. Ero on käytännössä helppo selvittää kolmella kysymyksellä.

Ensimmäinen kysymys on, tekeekö järjestelmä useamman kuin yhden askeleen ilman että käyttäjä painaa väliin mitään. Jos ei, kyseessä on tavallinen kehote, jonka tulos vain muotoillaan valmiiksi. Toinen kysymys on, saako se tietoa takaisin. Järjestelmä, joka lähettää tiedon eteenpäin mutta ei koskaan lue tulosta, on automaatioputki eikä agentti. Kolmas kysymys on, kuka päättää seuraavan askeleen. Jos askeleet on kiinnitetty etukäteen tiettyyn järjestykseen, kyseessä on tavallinen työnkulku, johon on lisätty kielimalli yhteen kohtaan.

Erottelu ei ole pilkunviilausta. Kiinteä työnkulku on ennustettava ja testattava, kun taas aidon agentin polku vaihtelee ajokerrasta toiseen. Jos tarvitset saman lopputuloksen joka kerta, kiinteä työnkulku on yleensä parempi ratkaisu, ja kielimallia kannattaa käyttää siinä yhdessä kohdassa, jossa tarvitaan kielen ymmärtämistä.

Mihin agentti oikeasti sopii arjessa

Realistinen käyttöalue on kapeampi kuin markkinointi antaa ymmärtää, mutta se ei ole olematon. Agentti toimii parhaiten silloin, kun tehtävä on monivaiheinen mutta jokainen vaihe on tarkistettavissa, ja kun virheen hinta on pieni.

Tällaisia ovat esimerkiksi tiedon kokoaminen useasta lähteestä yhteen muistioon, aineiston järjestäminen ja nimeäminen sovitun kaavan mukaan, luonnosten tuottaminen toistuvista vastauksista tai pitkän dokumentin läpikäynti tiettyjen kohtien etsimiseksi. Sähköpostin ja kalenterin hallinnassa agentti sopii lajitteluun ja luonnosteluun, mutta lähetys kannattaa pitää itsellä, ja työn taustalla vaikuttavat samat käytännöt kuin sähköpostin ja kalenterin hallinnassa muutenkin.

Yhteistä näille on se, että virheen huomaa nopeasti ja korjaus maksaa vähän. Jos agentti nimeää sata tiedostoa väärin, huomaat sen yhdellä silmäyksellä ja ajat korjauksen. Jos se lähettää sata väärää viestiä, mitään ei voi peruuttaa.

Huonosti agentti sopii tehtäviin, joissa oikeaa vastausta ei voi tarkistaa nopeasti, joissa vaaditaan pääsyä moneen järjestelmään kerralla tai joissa yksikin virhe on kallis. Rahaliikenne, sopimukset, terveystiedot ja asiakasviestintä kuuluvat tähän joukkoon.

Näin otat agentin käyttöön ilman ikäviä yllätyksiä

  1. Kirjaa ylös, mitä työkaluja agentilla on ja mihin kukin niistä pääsee käsiksi. Jos et saa listaa, et voi arvioida riskiä.
  2. Anna kapein mahdollinen oikeus. Lukuoikeus riittää useimpiin hyödyllisiin tehtäviin.
  3. Aseta ulkoiset rajat: kierrosten enimmäismäärä, aikaraja ja kustannuskatto.
  4. Merkitse peruuttamattomat askeleet ja vaadi niihin erillinen hyväksyntä juuri ennen suoritusta.
  5. Aja ensin harjoitustilassa, jossa työkalut vain kertovat mitä tekisivät mutta eivät tee sitä.
  6. Tarkista lokista, mitä agentti todella teki, älä pelkkää loppuraporttia. Malli kirjoittaa yhteenvedon, ja yhteenveto voi olla optimistisempi kuin tapahtumat.
  7. Pidä ketju lyhyenä. Kaksi kolmen askeleen ajoa on luotettavampi kuin yksi kuuden askeleen ajo.

Agentti ei vaadi luottamusta älykkyyteen vaan hallittua pääsyä. Kun pääsy on rajattu ja peruuttamattomat kohdat kulkevat ihmisen kautta, agentista tulee hyödyllinen apuri. Ilman niitä siitä tulee nopea tapa tehdä virhe monta kertaa peräkkäin.

Usein kysytyt kysymykset

Mitä eroa on tekoälyagentilla ja tavallisella chatbotilla?

Chatbot tuottaa tekstiä, agentti tuottaa tekstiä ja lisäksi toimia. Tekninen ero on siinä, että agentti on kytketty työkaluihin ja se saa käyttää niitä toistuvasti silmukassa, kunnes tehtävä on valmis. Itse malli on molemmissa sama.

Osaako agentti oikeasti käyttää tietokonettani?

Se osaa käyttää täsmälleen niitä toimintoja, jotka sille on annettu, eikä mitään muuta. Jos agentille on annettu pääsy tiedostoihin tai selaimeen, se voi käyttää niitä annettujen oikeuksien rajoissa. Ilman erikseen myönnettyä pääsyä se ei voi tehdä koneellasi mitään.

Miksi agentti jää välillä jumiin toistamaan samaa asiaa?

Malli päättää itse, milloin tehtävä on valmis, ja se arvioi sen huonosti. Jos työkalu palauttaa virheen, malli yrittää usein samaa lähestymistapaa uudelleen hieman muutettuna. Tämän vuoksi silmukkaan asetetaan ulkoinen kierrosraja, joka katkaisee ajon.

Voiko agentti tehdä ostoksia tai lähettää viestejä ilman lupaani?

Se voi, jos sille on annettu siihen työkalu eikä hyväksyntää ole vaadittu. Tämä on suunnittelupäätös, ei mallin ominaisuus. Rahaan, viestien lähetykseen ja käyttöoikeuksiin liittyvät toimet kannattaa aina asettaa erillisen vahvistuksen taakse.

Onko agentin käyttö turvallista, jos se lukee verkkosivuja?

Lukeminen itsessään on turvallista, mutta luettu sisältö voi sisältää agentille tarkoitettuja piilo-ohjeita. Riski realisoituu vasta, jos agentilla on työkaluja, joilla ohje voidaan panna toimeen. Pidä siis ulos menevät toiminnot hyväksynnän takana, kun agentti käsittelee sisältöä, jota et ole itse kirjoittanut.

Kannattaako agentille antaa yksi iso tehtävä vai monta pientä?

Monta pientä. Onnistumistodennäköisyys pienenee askelten määrän mukana, ja lyhyessä ajossa näet välituloksen ennen kuin virhe ehtii kertautua. Pilkkominen on sama periaate kuin kehotteiden ketjutuksessa.

Tarvitseeko agentti internetyhteyden?

Ei välttämättä. Agentti tarvitsee mallin ja työkalut, ja molemmat voivat periaatteessa toimia paikallisesti. Käytännössä useimmat hyödylliset työkalut, kuten haku ja pilvipalveluiden käyttö, edellyttävät verkkoyhteyttä.

Takaisin ylös