selitetty.com

Kuva-, ääni- ja videogeneraattorit

Videogeneraattorit: mihin ne pystyvät ja mistä ne kompastuvat

Videogeneraattori ei tuota videota vaan kuvasarjan, jonka jokaisen ruudun pitää sopia yhteen edellisen kanssa. Tämä yksi vaatimus selittää melkein kaikki tekoälyvideon ongelmat.

Lyhyt vastaus

Videogeneraattori tuottaa peräkkäisiä ruutuja niin, että ne muodostavat uskottavan liikkeen. Vaikein osa ei ole yksittäisen ruudun laatu vaan ajallinen johdonmukaisuus: sama hahmo, sama vaate ja sama valo pitää säilyttää ruudusta toiseen, vaikka malli ei tallenna kohtauksesta pysyvää mallia. Siksi otokset ovat lyhyitä, hahmot muuttuvat pidemmissä pätkissä ja laskenta-aika kasvaa nopeasti keston ja tarkkuuden mukana. Laatu riittää jo kuvituskuvaan, taustamateriaaliin ja hahmotelmiin, mutta ei kohtaukseen, jossa sama henkilö esiintyy uskottavasti pitkään.

Sisällys
  1. Video on kuvasarja, jonka jokaisen ruudun pitää muistaa edellinen
  2. Miten liike tuotetaan: aika on mallille kolmas ulottuvuus
  3. Miksi hahmo muuttuu kesken oton
  4. Kesto, tarkkuus ja laskenta ottavat samasta budjetista
  5. Ääni ei tule samasta putkesta kuin kuva
  6. Odotusaika ja hylätyt otot ratkaisevat kustannuksen
  7. Mihin laatu riittää nyt ja mihin ei
  8. Merkintä, oikeudet ja vastuu kuuluvat suunnitteluun
  9. Näin arvioit ennen kuin aloitat
  10. Usein kysytyt kysymykset
  11. Lähteet ja lisälukemista

Kuvageneraattorin pitää saada aikaan yksi uskottava ruutu. Videogeneraattorin pitää saada aikaan sata tai kaksisataa ruutua, jotka ovat uskottavia myös suhteessa toisiinsa. Nämä ovat eri vaikeusluokan tehtäviä, ja ero selittää lähes kaiken siitä, mihin tekoälyvideo tällä hetkellä pystyy ja mistä se kompastuu.

Tavallinen väärinkäsitys on, että video olisi vain hitaampi kuva. Kun ymmärrät, mitä johdonmukaisuuden ylläpito vaatii, osaat myös arvioida etukäteen, mikä pyyntö tulee onnistumaan ja mikä ei. Sama ymmärrys auttaa arvioimaan väitteitä siitä, että kokonaiset elokuvat syntyisivät pian kehotteesta.

Video on kuvasarja, jonka jokaisen ruudun pitää muistaa edellinen

Liikkuva kuva on peräkkäisiä pysäytyskuvia riittävän tiheässä. Tavallisimmat kuvataajuudet ovat 24, 25 ja 30 ruutua sekunnissa, joten viiden sekunnin otos tarkoittaa toistasataa erillistä kuvaa. Jokaisen niistä pitää olla teknisesti kelvollinen, ja lisäksi niiden pitää muodostaa yhtenäinen kohtaus.

Ihmissilmä on tässä armoton. Yksittäisessä kuvassa katsoja ei huomaa, jos taustan kyltin teksti on merkityksetöntä sotkua. Videossa hän huomaa heti, jos sama kyltti vaihtaa tekstiä kesken oton. Sama koskee vaatteen kuviota, korvakorua, kellon paikkaa ranteessa ja taustalla kävelevien ihmisten määrää. Katse hakeutuu muutokseen, ja väärä muutos on häiritsevämpi kuin puuttuva yksityiskohta.

Tästä syystä videon laatua ei voi arvioida katsomalla yhtä pysäytyskuvaa. Ruutu voi olla moitteeton, vaikka kymmenen ruudun päässä sama hahmo on jo eri ihminen.

Miten liike tuotetaan: aika on mallille kolmas ulottuvuus

Nykyiset videogeneraattorit rakentuvat samalle perusidealle kuin kuvamallit. Malli on opetettu poistamaan kohinaa, ja tuottaessaan uutta sisältöä se aloittaa satunnaisesta kohinasta ja puhdistaa siitä askel askeleelta lopputuloksen. Kuvapuolen mekanismi on selitetty tarkemmin artikkelissa miten tekoäly tekee kuvan, ja videossa se laajenee yhdellä ratkaisevalla tavalla.

Kuvamalli käsittelee kaksiulotteista ruudukkoa. Videomalli käsittelee pinoa, jossa kolmas ulottuvuus on aika. Kohinanpoisto tehdään koko pinolle yhtä aikaa, ei ruutu kerrallaan, ja malli vertaa jokaista kohtaa myös ajassa lähellä oleviin kohtiin. Juuri tämä vertailu tuottaa liikkeen: malli ei siirrä esinettä vaan tuottaa jokaiseen ruutuun version, joka on opitun tilastollisen säännönmukaisuuden mukaan uskottava jatko edelliselle.

Käytännön käyttöliittymässä tämä näkyy kahtena eri tapana pyytää video. Tekstistä videoksi tarkoittaa, että annat pelkän kehotteen ja malli päättää kaiken muun. Kuvasta videoksi tarkoittaa, että annat ensimmäisen ruudun valmiina ja malli jatkaa siitä. Jälkimmäinen on selvästi hallittavampi, koska hahmon ulkonäkö, rajaus ja valo on lukittu jo lähtökohdassa. Kehotteen kirjoittamisen periaatteet ovat samat kuin kuvissa, ja ne on käyty läpi artikkelissa kuvakehotteen kirjoittaminen.

Miksi hahmo muuttuu kesken oton

Malli ei pidä kirjaa kohtauksen esineistä. Se ei tallenna tietoa "tämä nainen, punainen takki, hopeinen rannekoru" ja piirrä sitä uudelleen jokaiseen ruutuun. Se tuottaa jokaisen ruudun uudelleen ja luottaa siihen, että lähiruutujen välinen vertailu pitää lopputuloksen samana. Se toimii hyvin lyhyellä matkalla ja huonosti pitkällä.

Ilmiöllä on kolme tavallista muotoa:

  • Vähittäinen ajautuminen. Piirteet muuttuvat pikkuhiljaa niin, että peräkkäiset ruudut näyttävät oikeilta mutta oton ensimmäinen ja viimeinen ruutu esittävät eri ihmistä.
  • Peittymisen jälkeinen virhe. Kun käsi menee taskuun, kasvot kääntyvät pois tai esine katoaa hetkeksi näkyvistä, mallilla ei ole muistia siitä, millainen se oli. Takaisin tullessaan se on usein erilainen.
  • Fysiikan pettäminen. Nesteet, kankaat, hiukset, portaat ja monimutkaiset kosketukset menevät helposti pieleen, koska malli ei laske voimia vaan tuottaa sitä, miltä liike tyypillisesti näyttää.

Sama syy tuottaa myös kummallisia leikkauksia: jos kehote on epämääräinen, malli saattaa vaihtaa kuvakulmaa tai kohtausta kesken oton, koska opetusaineiston videoissa leikkaus on tavallinen tapahtuma.

Käytännön johtopäätös on selvä. Jos tarvitset saman hahmon useaan otokseen, älä yritä saada sitä yhdellä pitkällä pyynnöllä. Lukitse ulkonäkö lähtökuvalla ja rakenna kokonaisuus lyhyistä otoksista, kuten oikeassakin kuvauksessa tehdään.

Kesto, tarkkuus ja laskenta ottavat samasta budjetista

Videon generointi on raskasta, koska työmäärä kasvaa sekä ruutujen määrän että ruudun koon mukana. Tämä on syy siihen, miksi palvelut rajaavat otoksen pituutta ja tarkkuutta eivätkä vain anna käyttäjän valita vapaasti.

Rajoite Miksi se sitoo Mitä käyttäjä huomaa
Kesto Ruutujen määrä kasvaa suoraan keston mukana, ja johdonmukaisuuden ylläpito vaikeutuu matkan pidetessä Otokset ovat lyhyitä, ja pidempi pyyntö joko epäonnistuu tai ajautuu
Kuvan tarkkuus Jokainen ruutu maksaa enemmän laskentaa, kun kuvapisteitä on enemmän Esikatselu tehdään pienemmällä tarkkuudella, lopullinen versio erikseen
Kuvataajuus Tiheämpi ruudutus tarkoittaa enemmän tuotettavia ruutuja sekuntia kohti Liike voi näyttää nykivältä, jos ruutuja on täydennetty jälkikäteen
Laskenta-aika Mallin ajaminen eli inference vie muistia ja aikaa suhteessa koko pinon kokoon Odotat minuutteja, et sekunteja, ja ruuhka-aikaan pidempään

Monissa palveluissa lopullinen tarkkuus nostetaan erillisellä ylösskaalauksella sen jälkeen, kun liike on tuotettu pienemmässä koossa. Se on tehokas kompromissi, mutta se ei korjaa johdonmukaisuuden virheitä, koska virheet ovat jo valmiiksi kuvassa. Tarkkuuden ja tiedostokoon suhde on sama kuin muussakin videossa, ja sen taustaa avaa suoratoistopalvelun toimintaa käsittelevä artikkeli.

Ääni ei tule samasta putkesta kuin kuva

Kuvamalli ei tuota ääntä. Vaikka palvelu antaisi valmiin videon ääniraidan kanssa, taustalla on yleensä useampi erillinen malli: yksi kuvalle, toinen puheelle, kolmas tehosteille tai musiikille. Ne yhdistetään jälkikäteen, ja juuri yhdistäminen on se kohta, jossa lopputulos paljastuu.

Vaikeuksia on kolme. Huulten liikkeen pitää vastata puhuttuja äänteitä, mikä on eri tehtävä kuin uskottavan puheen tuottaminen. Tehosteiden pitää osua tapahtumaan sadasosien tarkkuudella, tai askel kuuluu ennen kuin jalka osuu maahan. Tilan pitää kuulostaa samalta kuin se näyttää, eli pieni huone ei saa kaikua kuin kirkko. Puheen tuottamisen tekniikka ja siihen liittyvät luvat on käsitelty erikseen artikkelissa äänen kloonaus ja puhesynteesi.

Käytännössä ammattimainen työnkulku muistuttaa siis tavallista jälkituotantoa. Kuva tehdään ensin, ääni rakennetaan päälle, ja korjaukset tehdään leikkauspöydässä eikä kehotteessa.

Odotusaika ja hylätyt otot ratkaisevat kustannuksen

Tekstin generointi tuntuu ilmaiselta, koska vastaus tulee sekunneissa. Video ei tunnu, koska yhden oton tuottaminen kestää ja koska suurin osa otoista hylätään. Tämä muuttaa työtavan enemmän kuin yksittäisen oton hinta.

Kustannus kannattaa laskea kolmesta osasta. Ensimmäinen on onnistuneen oton hinta, joka on yleensä pieni. Toinen on hylkysuhde eli montako yritystä tarvitaan yhtä käyttökelpoista otosta kohti. Kolmas on ihmisen työaika, joka kuluu kehotteiden hiomiseen, tulosten katseluun ja leikkaamiseen. Kun tulos ei ole ohjattavissa tarkasti, kaksi jälkimmäistä kasvavat nopeasti.

Odotusaika vaikuttaa myös laatuun. Kun palautetta joutuu odottamaan, kokeilukierroksia tulee vähemmän ja kehotteesta tehdään kerralla monimutkaisempi. Se on väärä suunta: pitkä kehote antaa mallille enemmän ristiriitaisia vaatimuksia, joista se valitsee itse. Toimivampi tapa on tehdä lyhyitä pyyntöjä ja lukita yksi asia kerrallaan.

Mihin laatu riittää nyt ja mihin ei

Rehellinen arvio riippuu siitä, kuinka kauan katsoja katsoo ja kuinka tarkasti hän tuntee kohteen.

Käyttö Toimii yleensä Miksi
Lyhyt kuvituspätkä, tausta, siirtymä Kyllä Katsoja ei tutki yksityiskohtia, ja otos on lyhyt
Abstrakti tai tyylitelty animaatio Kyllä Ei realismivaatimusta, jolloin virheet luetaan tyyliksi
Kuvakäsikirjoitus ja hahmotelma tuotannon tueksi Kyllä Tarkoitus on näyttää idea, ei olla lopputuote
Tuotekuvaus, jossa esine pitää esittää oikein Ei luotettavasti Malli muuttaa muotoja ja tekstejä, ja mainonnassa virhe on vastuukysymys
Puhuva pää pitkässä otossa Ei luotettavasti Huulisynkronointi ja kasvojen pysyvyys pettävät ensimmäisenä
Kohtaus, jossa sama hahmo esiintyy useasti Ei ilman raskasta jälkityötä Ajautuminen näkyy heti, kun katsoja vertaa otoksia

Rajat siirtyvät, mutta ne siirtyvät epätasaisesti. Yksittäisen ruudun laatu on parantunut nopeammin kuin johdonmukaisuus, joten näyttävä demo ei kerro paljon siitä, miten malli pärjää kymmenen otoksen kohtauksessa.

Merkintä, oikeudet ja vastuu kuuluvat suunnitteluun

Generoitu video on sisältöä, jolla on tekijä ja vastuullinen julkaisija. EU:n tekoälyasetus asettaa läpinäkyvyysvelvoitteita keinotekoisesti tuotetulle sisällölle, ja käytännön vaatimukset on käyty läpi artikkelissa tekoälysisällön merkintä. Tekninen puoli, eli miten alkuperätieto liitetään tiedostoon ja miten se kestää jakelun, käsitellään artikkelissa vesileimat ja C2PA.

Palvelun käyttöehdot ratkaisevat sen, mihin valmista videota saa käyttää. Ehdot vaihtelevat palveluittain ja käyttäjätasoittain, ja kaupallinen käyttö on niissä oma kysymyksensä. Sama koskee sitä, saako lopputulokseen ylipäätään tekijänoikeutta.

Jos videossa esiintyy tunnistettava todellinen ihminen, kyse ei ole enää pelkästä tuotannosta. Tällöin sovelletaan samoja periaatteita kuin syväväärennöksissä: tarvitaan lupa, ja harhaanjohtava esitys voi täyttää rikoksen tunnusmerkit riippumatta siitä, kuinka hyvältä jälki näyttää.

Näin arvioit ennen kuin aloitat

Käy pyyntö läpi tässä järjestyksessä, niin säästät suurimman osan turhista yrityksistä.

  1. Määritä oton pituus ensin. Jos tarvitset yli muutaman sekunnin, suunnittele se useaksi otokseksi jo lähtökohtaisesti.
  2. Lukitse ulkonäkö lähtökuvalla. Aloita kuvasta videoksi aina kun hahmon tai tuotteen pitää pysyä samana.
  3. Poista kehotteesta ristiriidat. Yksi kamera-ajo, yksi tapahtuma, yksi valaistus. Monta samanaikaista vaatimusta tuottaa satunnaisen tuloksen.
  4. Katso tulos kahdesti. Ensin normaalilla nopeudella, sitten hitaasti tai ruutu kerrallaan. Ajautuminen näkyy vasta jälkimmäisellä katselulla.
  5. Tarkista riskikohdat erikseen. Tekstit, kädet, logot, kellot ja heijastukset ovat tavallisimmat virhepaikat.
  6. Päätä ääni erikseen. Älä oleta, että kuvan mukana tuleva ääniraita kelpaa julkaisuun ilman sovitusta.
  7. Merkitse ja dokumentoi. Kirjaa mitä työkalua käytit ja mihin ehtoihin nojaat, ja lisää merkintä ennen julkaisua eikä sen jälkeen.

Videogeneraattori on tässä vaiheessa hyvä työkalu lyhyeen, hallittuun ja ei-realistiseen materiaaliin sekä nopeaan hahmotteluun. Se on huono työkalu silloin, kun katsojan pitää tunnistaa sama ihminen tai sama esine oikein kahdessa peräkkäisessä otoksessa. Ero ei ole makuasia vaan seuraus siitä, miten malli tuottaa liikkeen.

Usein kysytyt kysymykset

Miksi tekoälyvideot ovat niin lyhyitä?

Koska ruutujen määrä ja johdonmukaisuuden ylläpito kasvattavat laskentaa nopeasti ja koska virheet kertyvät matkan varrella. Pidemmässä otoksessa hahmo ehtii ajautua tunnistamattomaksi. Käytännön ratkaisu on tehdä useita lyhyitä otoksia ja leikata ne yhteen.

Miksi hahmon kasvot muuttuvat kesken videon?

Malli ei tallenna kohtauksesta pysyvää mallia vaan tuottaa jokaisen ruudun uudelleen ja pyrkii pitämään sen samankaltaisena kuin viereiset ruudut. Pienet poikkeamat kertyvät, ja erityisesti kääntymisen tai peittymisen jälkeen piirteet palaavat väärin. Sama syy tuottaa vaihtuvat vaatteiden yksityiskohdat ja taustatekstit.

Tuottaako videogeneraattori myös äänen?

Ääni tulee lähes aina eri mallista kuin kuva, vaikka palvelu näyttäisi tekevän molemmat kerralla. Puhe, tehosteet ja musiikki tuotetaan erikseen ja synkronoidaan jälkikäteen. Siksi huulten liike ja tehosteiden ajoitus ovat tavallisimmat virhekohdat.

Voinko käyttää generoitua videota mainoksessa?

Se riippuu palvelun käyttöehdoista ja siitä, mitä video esittää. Kaupallisen käytön oikeudet ja vastuu virheellisestä tuotekuvauksesta ovat eri asioita, ja markkinoinnissa harhaanjohtava esitys on aina julkaisijan vastuulla. Tarkista ehdot ennen kuvausta, ei sen jälkeen.

Pitääkö tekoälyllä tehty video merkitä?

EU:n tekoälyasetus asettaa keinotekoisesti tuotetulle sisällölle läpinäkyvyysvelvoitteita, ja erityisesti todellista henkilöä esittävä sisältö on merkittävä. Merkintä voi olla näkyvä maininta tai tiedostoon liitettävä alkuperätieto. Velvoite kohdistuu sisällön tekijään ja julkaisijaan.

Miksi sama kehote antaa joka kerta eri videon?

Generointi alkaa satunnaisesta kohinasta, joten lopputulos vaihtelee, vaikka kehote olisi sanasta sanaan sama. Osa palveluista antaa kiinnittää satunnaisluvun, jolloin sama pyyntö toistuu lähes samanlaisena. Se on käytännössä ainoa tapa saada vertailukelpoisia versioita.

Kannattaako video tehdä kuvasta vai pelkästä tekstistä?

Kuvasta videoksi antaa selvästi paremman hallinnan, koska hahmo, rajaus ja valo on lukittu ensimmäiseen ruutuun. Pelkkä teksti sopii tilanteeseen, jossa lopputulos saa olla vapaa. Ammattimaisessa työssä lähtökuva tehdään yleensä ensin erikseen.

Takaisin ylös