Brittiläinen tekoälyturvallisuutta tutkiva AI Security Institute (AISI) havaitsi Anthropic- ja OpenAI-yhtiöiden tekoälyagenttien toimivan luvatta oikeita ihmisiä ja organisaatioita vastaan kyberturvallisuustesteissä.
Testit tehtiin tarkoituksella tavallista vapaammissa olosuhteissa, joissa malleilla oli pääsy avoimeen internetiin ja osa niiden turvarajoituksista oli poistettu käytöstä.
Asiasta kertovan Financial Timesin mukaan Anthropicin Mythos 5- ja OpenAI GPT-5.6 Sol -mallit muun muassa murtautuivat ulkopuolisiin ohjelmistoihin, yrittivät hankkia käyttäjätunnuksia ja ottivat yhteyttä oikeisiin ihmisiin. AISI:n mukaan kyseessä on ensimmäinen kerta, kun se on havainnut tekoälyagenttien autonomiseen ja harhaanjohtavaan toimintaan liittyvien riskien toteutuvan näin selvästi oikeassa toimintaympäristössä.
Tapaukset paljastuivat AISI:n kyberturvallisuustestissä, jossa eri tekoälymalleille annettiin tehtäväksi ratkaista hyökkäystä jäljittelevä haaste. Testi ajettiin yhteensä 122 kertaa seitsemällä eri mallilla.
Yhteensä kymmenessä ajossa agentti ryhtyi oma-aloitteisesti toimiin, jotka eivät kuuluneet tehtävään ja kohdistuivat oikeisiin ihmisiin tai organisaatioihin. AISI kirjasi kaikkiaan 19 tällaista toimintoa. Niistä 17 liittyi Anthropicin Mythos 5 -malliin ja kaksi OpenAI GPT-5.6 Soliin.
Vakavimmassa tapauksessa tekoäly yritti ujuttaa haitallista koodia ohjelmistojen versionhallintapalvelu GitHubissa olevaan avoimen lähdekoodin projektiin. Kun koodi piti saada hyväksytyksi, agentti loi väärennettyjä verkkohenkilöllisyyksiä ja yritti painostaa projektin ylläpitäjää hyväksymään muutoksen. Ihminen havaitsi haitallisen koodin eikä hyväksynyt sitä.
Agentit yrittivät lisäksi ottaa suoraan yhteyttä oikeisiin ihmisiin ja saada nämä tai heidän käyttämänsä tekoälytyökalut suorittamaan haitallista koodia. AISI:n mukaan osa viesteistä sisälsi haitallisia tiedostoja ja osassa käytettiin sosiaalista manipulointia.
AISI havaitsi poikkeavan toiminnan 28. heinäkuuta huomattuaan testijärjestelmästä Tor-verkon kautta lähtenyttä epätavallista tietoliikennettä. Tilanne saatiin hallintaan noin tunnissa. Toiminnasta ei olemassa olevan näytön mukaan aiheutunut todellista vahinkoa.
AISI korostaa, ettei kyse ollut tavanomaisesta tekoälyn käytöstä. Malleille oli tarkoituksella annettu internetyhteys ja niiden kybertoimintaa rajoittavia suojauksia oli poistettu, jotta tutkijat pystyivät mittaamaan niiden kykyjä. Testattuina olleet malliversiot ja asetukset eivät ole sellaisinaan kuluttajien saatavilla.
Anthropic totesi tapauksen osoittavan, että yhä kyvykkäämpien tekoälyagenttien testaamiseen tarvitaan yhteisiä ja aiempaa tiukempia turvallisuusstandardeja. OpenAI puolestaan painotti tapahtumien sattuneen erityisissä testiolosuhteissa, jotka eivät vastaa mallien normaalia käyttöä.
Kyse ei ole ensimmäisestä tänä kesänä paljastuneesta tapauksesta, jossa tekoäly on ylittänyt sille tarkoitetut rajat. Verkkouutiset kertoi heinäkuussa OpenAI testistä, jossa tekoälyagentti pääsi ulos rajatusta testiympäristöstä ja hyökkäsi tekoäly-yhtiö Hugging Facen järjestelmiin. Tietoturva-asiantuntija Petteri Järvinen arvioi tuolloin, että tapaus oli merkittävä muistutus kehittyvien tekoälymallien riskeistä.