selitetty.com

Mitä tekoäly on

Tekoälyn historia: kaksi tekoälytalvea ja nykyinen nousu

Tekoälyn tutkimus on lähes seitsemänkymmentä vuotta vanha, ja sen rahoitus on romahtanut matkan varrella kahdesti. Tässä on kehityskulku ja ne syyt, jotka selittävät sekä romahdukset että nykyisen nousun.

Lyhyt vastaus

Tekoälytutkimus alkoi 1950-luvulla ja eteni ensin sääntöpohjaisilla järjestelmillä, joissa ihminen kirjoitti tiedon koneelle käsin. Tämä lähestymistapa törmäsi rajaansa kahdesti, ja molemmilla kerroilla rahoitus romahti niin sanotuksi tekoälytalveksi. Nykyinen nousu perustuu siihen, että sääntöjen kirjoittamisesta luovuttiin: mallit opetetaan valtavasta aineistosta, laskentateho riittää siihen vasta nyt, ja transformer-arkkitehtuuri teki opetuksesta rinnakkaistuvaa. Ero aiempiin aaltoihin on se, että tuotteet ovat tällä kertaa miljoonien ihmisten päivittäisessä käytössä eivätkä pelkkiä laboratoriodemoja.

Sisällys
  1. Miksi ala liikkuu aalloissa eikä tasaisesti
  2. Sääntöpohjainen kausi: äly kirjoitettiin käsin
  3. Ensimmäinen tekoälytalvi: lupaus oli isompi kuin kone
  4. Asiantuntijajärjestelmät ja toinen talvi
  5. Hiljaiset vuodet, joina koneoppiminen otti vallan
  6. Kolme asiaa muuttui 2010-luvulla
  7. Transformer: miksi arkkitehtuurilla oli väliä
  8. Mikä nykyisessä nousussa on oikeasti toisin
  9. Näin luet seuraavan tekoälyuutisen
  10. Usein kysytyt kysymykset
  11. Lähteet ja lisälukemista

Tekoälystä puhutaan usein kuin se olisi ilmestynyt muutama vuosi sitten. Tutkimusala sai nimensä kuitenkin jo 1950-luvulla, ja sen jälkeen se on käynyt läpi ainakin kaksi jaksoa, joiden aikana rahoitus kuivui ja koko sanaa vältettiin apurahahakemuksissa. Kehitys ei ole ollut tasainen nousu vaan sarja liian suuria lupauksia, pettymyksiä ja hiljaisia vuosia, joiden aikana perustyö silti jatkui.

Tämä artikkeli ei määrittele käsitteitä uudelleen. Jos haluat tietää, mitä sanat tekoäly, koneoppiminen ja syväoppiminen tarkoittavat ja miten ne suhtautuvat toisiinsa, käsitteiden erot on selitetty omassa artikkelissaan. Tässä kysytään toista asiaa: miksi ala on liikkunut aaltoina ja mikä viimeisimmässä aallossa on oikeasti toisin.

Miksi ala liikkuu aalloissa eikä tasaisesti

Aaltoliikkeellä on tunnistettava kaava, ja se on toistunut riittävän monta kertaa, jotta sitä voi käyttää tulkintavälineenä myös tänään.

Ensin syntyy vaikuttava demo, joka ratkaisee kapean tehtävän odotettua paremmin. Demo tulkitaan näytöksi yleisestä kyvystä, koska ihmisen kokemuksessa juuri tuo tehtävä vaatii yleistä älykkyyttä. Rahoittajat, olivat ne sitten puolustusministeriöitä tai sijoittajia, laajentavat lupauksen koskemaan kaikkea. Sitten järjestelmä viedään laboratorion ulkopuolelle, jossa syötteet ovat sotkuisia ja reunatapauksia on loputtomasti. Tulos ei kestä, luottamus katoaa, ja rahoitus siirtyy muualle.

Huomaa, ettei kaava vaadi huijausta. Jokaisessa aallossa tulokset olivat aitoja. Virhe oli siinä, mihin tuloksen arveltiin yleistyvän.

Kausi Hallitseva ajatus Miksi se pysähtyi
1950- ja 1960-luku Äly on symbolien käsittelyä sääntöjen mukaan Laskentateho ja muisti eivät riittäneet, ongelmat kasvoivat räjähdysmäisesti
1970-luku Ensimmäinen tekoälytalvi Rahoittajat totesivat, että luvattua yleistä osaamista ei tullut
1980-luku Asiantuntijajärjestelmät tuovat tiedon yrityksiin Sääntöjen ylläpito kävi kalliimmaksi kuin niistä saatu hyöty
1990-luvun alku Toinen tekoälytalvi Erikoislaitteistojen markkina romahti, ala vaihtoi nimeä
1990- ja 2000-luku Tilastolliset menetelmät ja koneoppiminen Ei pysähtynyt, mutta eteni ilman julkisuutta
2010-luvulta alkaen Syväoppiminen ja suuret opetusaineistot Käynnissä

Sääntöpohjainen kausi: äly kirjoitettiin käsin

Alan nimi vakiintui vuonna 1956 pidetyssä Dartmouth-työpajassa, jossa joukko tutkijoita esitti, että oppimista ja älykkyyttä voi kuvata niin täsmällisesti, että kone voi jäljitellä sitä. Lähtökohta oli symbolinen: äly on symbolien käsittelyä sääntöjen mukaan, ja jos säännöt kirjoitetaan riittävän tarkasti, kone päättelee loput.

Kaudella syntyi tuloksia, jotka näyttivät hämmästyttäviltä. Ohjelmat todistivat logiikan lauseita, ratkaisivat pulmatehtäviä ja pelasivat lautapelejä. Vuonna 1966 julkaistu ELIZA jäljitteli psykoterapeutin keskustelua muutamalla yksinkertaisella tekstisäännöllä, ja osa käyttäjistä puhui sille kuin ihmiselle, vaikka ohjelma ei ymmärtänyt sanaakaan. Sama ilmiö toistuu tänään: sujuva kieli tulkitaan ymmärryksen merkiksi.

Rinnalla kehitettiin myös oppivia rakenteita. Vuonna 1958 esitelty perseptroni oli varhainen yhden kerroksen neuroverkko, joka säätyi esimerkkien perusteella. Vuonna 1969 julkaistu kirja osoitti, ettei yksikerroksinen perseptroni pysty edes yksinkertaiseen loogiseen tehtävään, jossa vastaus riippuu kahden syötteen erilaisuudesta. Kritiikki oli matemaattisesti oikea ja käytännössä liian tehokas: se ohjasi rahoitusta pois neuroverkoista vuosikymmeneksi, vaikka rajoitus koski vain yksikerroksista tapausta. Miten monikerroksinen verkko korjaa tuon puutteen, on selitetty tarkemmin neuroverkkojen rakennetta käsittelevässä artikkelissa.

Ensimmäinen tekoälytalvi: lupaus oli isompi kuin kone

1970-luvun alkupuolella rahoittajat alkoivat kysyä tuloksia. Britanniassa tilattu riippumaton arvio totesi vuonna 1973, etteivät alan tulokset olleet lähelläkään sitä, mitä oli luvattu, ja että menetelmät toimivat vain pienissä leluongelmissa. Yhdysvalloissa puolustushallinnon rahoitusta suunnattiin uudelleen samoista syistä. Konekääntäminen oli jo aiemmin tuottanut pettymyksen: kääntäminen osoittautui vaativan maailmantietoa eikä pelkkää sanakirjaa ja kielioppia.

Tekninen syy oli yksinkertainen. Sääntöpohjainen haku kasvaa räjähdysmäisesti, kun ongelman koko kasvaa. Shakkilaudan mahdollisten jatkojen määrä kasvaa niin nopeasti, ettei kaikkia voi käydä läpi millään laitteistolla. Laboratoriossa ongelmat pidettiin pieninä, joten raja ei näkynyt ennen kuin ulos mentiin.

Asiantuntijajärjestelmät ja toinen talvi

1980-luvulla ala nousi uudelleen käytännöllisemmällä lupauksella. Asiantuntijajärjestelmä ei yrittänyt olla yleisesti älykäs vaan koodasi yhden ammattilaisen osaamisen sääntökokoelmaksi: jos oireet ovat nämä, todennäköinen syy on tämä. Sairaaloissa kokeiltiin diagnoosin tukijärjestelmiä, ja teollisuudessa järjestelmiä käytettiin esimerkiksi tietokonetilausten kokoonpanojen tarkistamiseen. Japani käynnisti vuonna 1982 laajan kansallisen ohjelman, joka tähtäsi uuden sukupolven päättelevään tietotekniikkaan, ja muut maat vastasivat omilla ohjelmillaan.

Tällä kertaa raja ei ollut laskentateho vaan ylläpito. Sääntökokoelma, jossa on tuhansia sääntöjä, muuttuu ristiriitaiseksi. Jokainen uusi poikkeus vaatii uuden säännön, ja säännöt alkavat kumota toisiaan tavalla, jota kukaan ei enää hahmota. Järjestelmä ei myöskään opi itse: kun maailma muuttuu, joku ihminen joutuu kirjoittamaan muutoksen sisään. Kun tähän lisättiin se, että järjestelmät vaativat kalliita erikoistyöasemia, jotka tavallinen työpöytäkone ohitti hinta-tehosuhteessa 1980-luvun lopulla, koko markkina katosi muutamassa vuodessa.

Toinen talvi näkyi myös kielessä. Tutkijat alkoivat puhua hahmontunnistuksesta, tilastollisesta mallintamisesta ja koneoppimisesta, koska sana tekoäly oli rahoittajien silmissä palanut.

Hiljaiset vuodet, joina koneoppiminen otti vallan

1990- ja 2000-luvut olivat julkisuudessa hiljaisia mutta menetelmällisesti ratkaisevia. Painopiste siirtyi käsin kirjoitetuista säännöistä aineistoon: sen sijaan että ihminen kertoisi koneelle, miltä roskaposti näyttää, kone laskee sen tuhansista esimerkeistä. Tämä on se sama perusidea, jota koneoppimisen toimintaperiaate kuvaa tarkemmin.

Kaudella syntyi myös se yleisön mielikuva, että tekoäly voittaa ihmisen peleissä. Vuonna 1997 shakin maailmanmestari hävisi tietokoneelle. Voitto ei kuitenkaan perustunut oppimiseen vaan valtavaan hakuun ja käsin viritettyyn arviointifunktioon, eli se oli sääntöpohjaisen kauden huipennus eikä uuden kauden alku. Ero on tärkeä: kone oli erinomainen yhdessä tehtävässä eikä osannut mitään muuta.

Menetelmien lisäksi muuttui myös ajattelutapa. Alettiin mitata. Kun mallin hyvyys määriteltiin ennalta sovitulla testiaineistolla saavutettuna tuloksena, tutkimus muuttui vertailukelpoiseksi ja edistyminen näkyväksi. Tämä on hiljainen mutta merkittävä ero aiempaan kauteen, jossa onnistumista arvioitiin sillä, vaikuttiko ohjelman toiminta älykkäältä. Samalla ala menetti osan lupauksestaan: mitattava tulos yhdessä kapeassa tehtävässä ei kuulosta yhtä suurelta kuin ajatteleva kone.

Samaan aikaan internet tuotti sivutuotteena jotain, jota kukaan ei ollut varta vasten rakentanut: valtavan määrän digitaalista tekstiä, kuvaa ja käyttäjien tekemiä merkintöjä. Tästä tuli seuraavan aallon polttoaine. Aineiston koostumus määrää myös mallien sokeat pisteet, mikä on käsitelty erikseen artikkelissa mistä tekoäly on opetettu.

Kolme asiaa muuttui 2010-luvulla

Nykyistä nousua ei selitä yksi keksintö. Kolme kehityskulkua, jotka olivat kypsyneet erikseen, osuivat samaan hetkeen.

Tekijä Mikä muuttui Miksi sillä oli väliä
Aineisto Verkkoon kertyi valmiiksi digitaalista tekstiä ja kuvaa sekä laajoja merkittyjä kuva-aineistoja Suuri malli tarvitsee suuren aineiston, muuten se vain opettelee esimerkit ulkoa
Laskenta Näytönohjaimet osoittautuivat halvaksi tavaksi tehdä samaa laskutoimitusta miljoonasti rinnakkain Neuroverkon opetus on juuri tällaista toistuvaa matriisilaskentaa
Menetelmä Monikerroksisten verkkojen opetus saatiin toimimaan käytännössä, ei vain teoriassa Malli voitiin tehdä syväksi, jolloin se oppii piirteet itse ilman ihmisen käsityötä

Käännekohtana pidetään yleisesti vuotta 2012, jolloin syvä neuroverkko voitti laajan kuvantunnistuskilpailun selvällä erolla aiempiin menetelmiin nähden. Tulos oli tekninen mutta viesti oli taloudellinen: kannattaa ostaa lisää laskentaa ja lisää dataa. Sama havainto ohjaa alaa yhä, ja se on myös syy siihen, miksi tekoälyn energiankulutus nousi keskustelunaiheeksi vasta tällä vuosikymmenellä. Jos laskennan rooli tuntuu abstraktilta, taustalla on sama työnjako, jota prosessorin ja muistin ero kuvaa tavallisessa tietokoneessa.

Transformer: miksi arkkitehtuurilla oli väliä

Vuonna 2017 esitelty transformer-arkkitehtuuri on lähin asia yksittäiselle käänteentekevälle keksinnölle. Sitä ennen tekstiä käsiteltiin verkoilla, jotka lukivat syötteen sana kerrallaan järjestyksessä ja kantoivat muistiaan mukanaan. Se on hidasta, koska seuraavaa askelta ei voi laskea ennen edellistä, ja kaukana toisistaan olevien sanojen yhteys haalistuu matkalla.

Transformer käsittelee koko syötteen kerralla ja painottaa sen osia huomiomekanismilla. Kaksi seurausta ratkaisi asian. Ensinnäkin sanan yhteys kaukanakin olevaan sanaan on suora eikä välity ketjun läpi, mikä paransi laatua pitkissä teksteissä. Toiseksi laskenta rinnakkaistuu, joten opetus voidaan jakaa tuhansille laskentayksiköille. Juuri tämä teki mallien kasvattamisesta mahdollista: aiemmalla arkkitehtuurilla nykyisen kokoisen mallin opettaminen olisi kestänyt kohtuuttoman kauan. Mekanismi itsessään on kuvattu artikkelissa miten kielimalli toimii.

Arkkitehtuurin merkitystä korostaa se, että sen perusidea on sama riippumatta siitä, käsitelläänkö tekstiä, kuvaa vai ääntä. Sama rakenne siirtyi tehtävästä toiseen, jolloin yhdessä käyttökohteessa opitut käytännöt hyödyttivät kaikkia muita. Aiemmin jokainen ala oli kehittänyt omat menetelmänsä erikseen.

Toinen, vähemmän huomattu muutos oli opetustavan yksinkertaisuus. Mallia ei tarvitse opettaa ihmisen merkitsemällä aineistolla, vaan se harjoittelee ennustamaan tekstin seuraavaa palasta. Merkintätyö oli aiemmin ollut pullonkaula, ja se poistui.

Mikä nykyisessä nousussa on oikeasti toisin

Rehellinen vastaus on, että osa kaavasta toistuu ja osa ei.

Toistuvaa on lupauksen laajeneminen. Kapeasta mutta vaikuttavasta kyvystä, tässä tapauksessa sujuvan tekstin tuottamisesta, päätellään yleistä osaamista, jota mallilla ei ole. Toistuvaa on myös se, että virheet keskittyvät reunatapauksiin ja tulevat näkyviin vasta laajassa käytössä.

Aidosti uutta on kolme asiaa. Ensinnäkin tekniikka on tuotteistettu tavallisten ihmisten käyttöön, joten palaute tulee miljoonilta käyttäjiltä eikä rahoittajien arviointiraporteista. Toiseksi sama malli tekee monta eri tehtävää ilman erillistä uudelleenopetusta, mikä ei aiemmissa aalloissa ollut mahdollista. Kolmanneksi ala on tullut sääntelyn piiriin: aiemmat aallot kuolivat ennen kuin lainsäätäjä ehti reagoida.

Neljäs ero on rahoituksen lähde. Aiemmat aallot elivät julkisesta tutkimusrahasta, joka voitiin katkaista yhdellä päätöksellä. Nykyinen nousu rahoitetaan pääosin yritysten tuloilla ja sijoituksilla, joten se reagoi eri tavalla: pettymys ei näy yhtenä leikkauksena vaan hitaampana investointien vähenemisenä.

Tästä ei kuitenkaan seuraa, että nousu jatkuisi automaattisesti. Kasvun ehtona on ollut aineiston ja laskennan lisääminen, ja molemmilla on rajansa. Siitä, kuinka lähellä rajoja ollaan, ei ole asiantuntijoiden kesken yksimielisyyttä, ja aihe kietoutuu kysymykseen yleisestä tekoälystä eli AGI:sta.

Näin luet seuraavan tekoälyuutisen

Historia antaa käytännön työkalun. Kun näet uutisen läpimurrosta, käy läpi nämä kohdat.

  1. Katso, mitä järjestelmä tarkalleen teki. Yksi mitattu tehtävä ei ole sama asia kuin kyky, jonka nimi tehtävällä on.
  2. Kysy, missä olosuhteissa tulos syntyi. Kilpailuaineisto ja valvottu koeasetelma ovat siistimpiä kuin oikea käyttö.
  3. Erota tulos ja tulkinta. Tutkimusryhmän mittaus voi olla pätevä, vaikka siitä tehty otsikko ei olisi.
  4. Katso, mitä järjestelmä tekee ollessaan väärässä. Nouseeko virhe esiin vai meneekö se läpi uskottavan näköisenä.
  5. Tarkista, onko kyseessä uusi kyky vai vanha kyky halvemmalla. Molemmat ovat merkittäviä, mutta ne johtavat eri päätelmiin.

Aaltoliike ei tarkoita, että tekoäly olisi huijausta. Se tarkoittaa, että alan tulokset ovat olleet aitoja ja niiden tulkinnat liian avokätisiä. Sama pätee tähänkin aaltoon, ja se on syy lukea sekä innostuneita että tuomitsevia arvioita samalla varauksella.

Usein kysytyt kysymykset

Milloin tekoäly keksittiin?

Termi vakiintui vuonna 1956 pidetyssä Dartmouth-työpajassa, mutta ajatus laskennallisesta älykkyydestä on vanhempi. Käytännön menetelmiä on kehitetty siitä lähtien katkonaisesti, joten yhtä keksimishetkeä ei ole. Nykyinen kielimalleihin perustuva tekniikka rakentuu 2010-luvun menetelmille.

Mikä on tekoälytalvi?

Tekoälytalvi tarkoittaa jaksoa, jolloin alan rahoitus ja kiinnostus romahtavat, koska luvatut tulokset jäivät saavuttamatta. Näitä on ollut kaksi, 1970-luvulla ja 1980-luvun lopulta 1990-luvun alkuun. Tutkimus ei kummallakaan kerralla loppunut, vaan se jatkui muilla nimillä ja pienemmällä rahoituksella.

Miksi tekoäly kehittyi juuri 2010-luvulla niin nopeasti?

Kolme asiaa kypsyi yhtä aikaa: verkkoon oli kertynyt valtava määrä digitaalista aineistoa, näytönohjaimet tekivät rinnakkaislaskennasta halpaa ja monikerroksisten neuroverkkojen opetus saatiin toimimaan käytännössä. Mikään niistä ei yksin olisi riittänyt.

Onko nykyinen tekoälybuumi kolmas kupla?

Tästä ei ole yksimielisyyttä. Aiemmista aalloista poiketen tekniikka on laajassa arkikäytössä ja tuottaa mitattavaa hyötyä, mikä puhuu kuplaa vastaan. Toisaalta odotukset ovat jälleen kasvaneet nopeammin kuin todennetut kyvyt, mikä on juuri se kaava, joka johti aiempiin romahduksiin.

Mikä on transformer ja miksi siitä puhutaan?

Transformer on vuonna 2017 esitelty neuroverkkoarkkitehtuuri, joka käsittelee koko tekstisyötteen kerralla ja painottaa sen osia huomiomekanismilla. Sen merkitys on kahtalainen: laatu pitkissä teksteissä parani ja opetus saatiin rinnakkaistettua, mikä teki suurten mallien kouluttamisesta käytännössä mahdollista.

Voiko uusi tekoälytalvi tulla?

Se on mahdollista, jos odotukset karkaavat selvästi todellisista kyvyistä ja rahoittajat pettyvät. Aiemmista kerroista poiketen tekniikkaa käytetään nyt laajasti tuotannossa, joten täydellinen pysähdys on epätodennäköisempi kuin rahoituksen ja innostuksen tasaantuminen.

Miksi vanhat asiantuntijajärjestelmät epäonnistuivat, jos ne kerran toimivat?

Ne toimivat kapeasti ja niin kauan kuin joku ylläpiti sääntöjä. Sääntöjen määrän kasvaessa kokonaisuudesta tuli ristiriitainen ja kallis ylläpitää, eikä järjestelmä oppinut muutoksia itse. Hyöty jäi pienemmäksi kuin ylläpidon kustannus.

Takaisin ylös