Uusien tekoälymallien julkaisuja on vaikea seurata hengästymättä. Tällä kertaa huomio kohdistuu OpenAI:n GPT-6 Astraan, jota yhtiö kuvailee tähänastisista malleistaan älykkäimmäksi ja parhaiten käyttäjän tavoitteisiin mukautuvaksi.
Keskustelu siirtyy nopeasti siihen, onko kyse jo AGI:sta eli ihmisen tasoisesta yleistekoälystä. Yrityksen näkökulmasta hyödyllisempi kysymys on tämä: pystyykö uusi malli tekemään kokonaisen työvaiheen luotettavasti, turvallisesti ja mitattavasti paremmin kuin aikaisempi ratkaisu?
Juuri siinä GPT-6 Astra ja samaan aikaan julkaistut muut mallit ovat kiinnostavia. Ne vievät tekoälyä vastausten tuottamisesta kohti työn tekemistä.
Tekoäly siirtyy vastaamisesta työn tekemiseen
Generatiivisen tekoälyn ensimmäisessä vaiheessa ihminen kirjoitti kysymyksen ja tekoäly tuotti vastauksen. Se auttoi esimerkiksi tekstien luonnostelussa, tiedon jäsentelyssä ja ideoiden kehittämisessä.
Uudemmat mallit pyrkivät hoitamaan kokonaisia tehtäväketjuja. OpenAI nostaa GPT-6 Astran tärkeäksi kehitysalueeksi tietokoneen käyttämisen. Mallin kerrotaan pystyvän esimerkiksi täyttämään lomakkeita, päivittämään asiakastietoja, käsittelemään taulukoita, tekemään verkkotutkimusta ja tarkistamaan verkkosivuston toimintaa.
Yhtiön omassa OSWorld 2.0 -testissä Astra sai tuloksen 72,6 prosenttia ja käytti tehtävään keskimäärin noin 40 minuuttia. GPT-5.6 Sol sai 65,7 prosenttia ja käytti noin 75 minuuttia. Tulokset ovat valmistajan ilmoittamia, eivät lupaus siitä, että sama suorituskyky toistuu jokaisessa yritysympäristössä. Tutustu OpenAI:n GPT-6 Astra -julkaisuun.
Yksittäinen vertailutulos kertoo silti suunnasta. Tekoäly ei enää ainoastaan ehdota, mitä käyttäjän pitäisi tehdä. Se pystyy yhä useammin käyttämään ohjelmistoja ja tekemään työvaiheita käyttäjän puolesta.
Sama muutos näkyy muillakin mallitoimittajilla
OpenAI ei ole kehityksessä yksin. Anthropic kuvailee Claude Fable 5.1:tä malliksi, joka pystyy hoitamaan tuntikausia kestäviä tehtäviä useissa sovelluksissa, palautumaan virheistä ja raportoimaan työn etenemisestä.
Anthropicin julkaisemassa asiakasesimerkissä mallin kerrotaan löytäneen vuosia selvittämättä olleen harvinaisen ohjelmistovirheen. Malli analysoi ohjelman kaatumisesta syntyneen muistivedoksen, purki ulkopuolisen kirjaston konekielistä sisältöä ja paikansi virheen kyseiseen kirjastoon. Esimerkki on mallin valmistajan julkaisema, joten sitä kannattaa pitää osoituksena mahdollisesta käyttötavasta eikä yleisenä suorituskykylupauksena. Tutustu Claude Fable 5.1:n tietoihin.
Yhteinen suunta on selvä: mallitoimittajat kehittävät tekoälyä, jolle voidaan antaa tavoite, työkalut ja pidempi tehtävä. Käyttäjän rooliksi jää työn rajaaminen, valvonta ja lopputuloksen hyväksyminen.
Vertailutulos ei ole sama asia kuin liiketoimintahyöty
Mallijulkaisuissa huomio kiinnittyy helposti prosentteihin, sijoituksiin ja näyttäviin esittelyihin. Malli saattaa rakentaa kolmiulotteisen maailman, ratkaista vaikean ohjelmointitehtävän tai saavuttaa ennätyksen jossakin testissä.
Yrityksessä arvo syntyy tavallisemmista asioista:
- Kuinka paljon työaikaa tehtävän suorittamiseen kuluu?
- Kuinka usein työntekijän täytyy korjata tekoälyn tekemää työtä?
- Paraneeko lopputuloksen laatu?
- Vähenevätkö virheet ja odotusajat?
- Voidaanko ratkaisu liittää yrityksen nykyisiin järjestelmiin?
- Onko toimintaa mahdollista valvoa ja rajata?
Jos uusi malli tekee vaikuttavan demon mutta tarvitsee jatkuvaa valvontaa, sen tuottama hyöty voi jäädä pieneksi. Vähemmän näyttävä ratkaisu voi olla arvokas, jos se käsittelee joka viikko satoja toistuvia työvaiheita luotettavasti.
Siksi mallia ei kannata valita pelkän yleisen vertailutaulukon perusteella. Parempi tapa on rakentaa yrityksen omasta työstä pieni, todellinen testi. Sama periaate auttaa myös tekoälyratkaisun ja sopivan palvelun valinnassa: työkalun sijaan aloitetaan ratkaistavasta ongelmasta.
Hyvä tekoälykokeilu alkaa rajatusta työtehtävästä
Uuden mallin kokeilemista ei tarvitse aloittaa suurella järjestelmäuudistuksella. Ensimmäiseksi kannattaa valita tehtävä, jossa on selkeä alku, lopputulos ja tarkistustapa.
Sopivia kokeiluja voivat olla esimerkiksi:
- saapuneiden tarjouspyyntöjen luokittelu
- tietojen siirtäminen lomakkeelta asiakkuudenhallintaan
- kokousmuistion muuttaminen tehtävälistaksi
- raportin kokoaminen useasta tietolähteestä
- verkkosivuston sisällön ja linkkien tarkistaminen
- tuote- tai asiakastietojen täydentäminen sovituilla säännöillä
Kokeilulle asetetaan muutama käytännöllinen mittari. Näitä voivat olla käytetty aika, hyväksyttyjen tulosten osuus, tarvittavien korjausten määrä ja yhden käsitellyn tapauksen kustannus.
Tämän jälkeen tekoälylle annetaan vain ne työkalut ja tiedot, joita tehtävä todella vaatii. Aluksi lopputulos tuodaan aina ihmisen hyväksyttäväksi ennen kuin se vaikuttaa asiakkaaseen, rahaan tai yrityksen tietoihin.
Näin yritys saa vastauksen paljon tärkeämpään kysymykseen kuin siihen, mikä malli johtaa tämän viikon vertailutaulukkoa: voimmeko antaa tämän työvaiheen tekoälyn hoidettavaksi?
Tehokkaampi toiminta vaatii myös paremmat rajat
Mitä enemmän tekoäly pystyy tekemään, sitä tärkeämmäksi käyttöoikeuksien ja valvonnan suunnittelu muuttuu.
OpenAI kertoo Astran saavuttaneen ensimmäisenä yhtiön mallina sen varautumiskehyksen kriittisen kyberturvallisuustason. Tämä tarkoittaa OpenAI:n mukaan kykyä löytää aiemmin tuntemattomia tietoturva-aukkoja ja kehittää tapoja hyödyntää niitä. Yhtiö kertoo lisänneensä mallin ympärille aikaisempaa vahvempaa valvontaa ja teknisiä suojauksia. Lue GPT-6 Astran turvallisuuskatsaus.
Tavalliselle yritykselle tämä tarkoittaa, että tekoälyagenttia kannattaa kohdella ohjelmistokäyttäjänä:
- Sille annetaan vain tehtävässä tarvittavat käyttöoikeudet.
- Merkittävät toimenpiteet vaativat ihmisen hyväksynnän.
- Tehdyt toimet tallennetaan tarkistettaviksi.
- Virhetilanteisiin määritellään pysäytysrajat.
- Arkaluonteisen tiedon käsittely sovitaan ennen käyttöönottoa.
Tekoälymallin kyvykkyys ei korvaa hyvää prosessia. Mitä itsenäisempi malli on, sitä tarkemmin yrityksen pitää tietää, mitä se saa tehdä ja missä vaiheessa ihmisen tulee puuttua työhön.
Kannattaako yrityksen vaihtaa heti uusimpaan malliin?
Ei välttämättä. GPT-6 Astran API-hinnaksi on ilmoitettu 10 dollaria miljoonalta syötetokenilta ja 50 dollaria miljoonalta tuotetulta tokenilta. Anthropic ilmoittaa Claude Fable 5.1:lle saman perushinnoittelun. Todellinen kustannus riippuu työn kestosta, käsiteltävän aineiston määrästä, työkalukutsuista ja siitä, kuinka monta kertaa tehtävä joudutaan suorittamaan uudelleen.
Uusi ja kyvykkäämpi malli voi olla perusteltu, jos tehtävä vaatii pitkää päättelyä, useiden ohjelmistojen käyttämistä tai vaikeiden poikkeustilanteiden ratkaisemista. Yksinkertaisessa luokittelussa tai tekstin muotoilussa pienempi ja edullisempi malli voi edelleen olla järkevämpi.
Mallin vaihtamista kannattaa arvioida kolmen kysymyksen avulla:
- Ratkaiseeko uusi malli tehtävän, johon nykyinen ratkaisu ei pysty?
- Vähentääkö se ihmisen käyttämää työaikaa riittävästi suhteessa kustannukseen?
- Voidaanko sen työskentely rajata, tarkistaa ja tarvittaessa keskeyttää?
Jos vastaukset ovat kyllä, uuden mallin kokeileminen on perusteltua. Muussa tapauksessa julkaisukiirettä ei tarvitse seurata.
AGI-keskustelua tärkeämpää on rakentaa toimiva kokeilu
Emme tarvitse yksimielistä määritelmää yleistekoälystä voidaksemme hyödyntää uusia malleja. Yritykselle hyödyllinen tekoäly ei ole se, joka voittaa eniten vertailutestejä. Hyödyllinen tekoäly ratkaisee oikean ongelman, toimii sovituissa rajoissa ja tuottaa mitattavan parannuksen nykyiseen työhön.
GPT-6 Astran kiinnostavin viesti ei siksi ole väite siitä, kuinka lähellä AGI:ta olemme. Kiinnostavampaa on, että tietokonetta käyttävät tekoälyagentit alkavat olla riittävän kyvykkäitä todellisten työprosessien kokeilemiseen.
Seuraava askel ei ole koko yrityksen automatisointi. Se on yhden tarkasti valitun työvaiheen testaaminen oikealla aineistolla. Kun kokeilu mitataan kunnolla, yritys saa päätöksenteon tueksi jotakin mallijulkaisua arvokkaampaa: omaa tietoa siitä, missä tekoäly tuottaa hyötyä.
Artikkelin lähtökohtana on Fireshipin video Did OpenAI actually build AGI? GPT-6 Astra first look. Videon tekniset väitteet on tarkistettu OpenAI:n ja Anthropicin julkaisuista.
Tunnistetaan teille sopiva ensimmäinen kokeilu
Jos haluat löytää työvaiheen, jossa tekoälyagentti voisi tuottaa yrityksellesi mitattavaa hyötyä, käydään tilanne yhdessä läpi. Aloitamme nykyisestä työstä, tavoitteista ja käytettävissä olevasta tiedosta. Malli valitaan vasta niiden perusteella.

