Tekoäly-yhtiö Anthropic kertoo, että sen tekoälymallit pääsivät julkiseen internetiin testiympäristöistä, joiden olisi pitänyt olla suljettuja.
Tiedotteessaan yhtiö kertoo, että mallit tunkeutuivat tämän jälkeen kolmen eri organisaation järjestelmiin.
Aiemmin heinäkuussa tekoäly-yhtiö OpenAI kertoi, että useat sen tekoälymallit olivat murtautuneet ulos eristetystä testiympäristöstä hyödyntämällä aiemmin tuntematonta haavoittuvuutta. Mallit tunkeutuvat sen jälkeen toisen yrityksen järjestelmiin.
Anthropicin mukaan OpenAI:n tapaus sai yhtiön tarkastamaan myös sen omia lokitiedostoja. Selvityksen aikana ilmeni yhteensä kolme tapausta, joissa tekoälymalli oli onnistunut pääsemään käsiksi julkiseen internetiin.
Syynä oli virheellinen määritys testiympäristön asetuksissa. Tekoälylle oli kerrottu, että verkkoyhteyttä ei ole, vaikka todellisuudessa se oli olemassa.
Julkaisemassaan tiedotteessa Anthropic painottaa, että yhdessäkään tapauksessa tekoäly ei yrittänyt tarkoituksellisesti paeta testiympäristöstä. Malleille oli annettu harjoitustehtävä, ja tekoäly toimi siinä käsityksessä, että kaikki sen saatavilla olevat yhteydet olivat osa harjoitusta.
Yhtiön mukaan sen tekoäly ei löytänyt tai hyödyntänyt monimutkaisia haavoittuvuuksia.
Harjoitusten tarkoituksena oli arvioida mallien kyvykkyyksiä. Testien ajaksi niille asetetut rajoitteet oli poistettu, jotta mallien todellisia kykyjä voitiin arvioida.
Anthropic kertoo ottaneensa yhteyttä kyberhyökkäysten kohteiksi joutuneisiin organisaatioihin. Lisäksi yhtiö kertoo keskeyttäneensä kyberkykyjen arvioinnit havaittuaan tapaukset.
Tietoturva-asiantuntija Petteri Järvinen sanoi OpenAI:n tapauksen Verkkouutisille, että tekoäly saattaa käyttäytyä tavalla, jota ihminen ei ole osannut ottaa huomioon.
– Mitä kehittyneemmäksi nämä mallit tulevat, niin sitä vaikeampi ihmisen on enää ennakoida niiden toimintaa, Järvinen sanoi.
LUE MYÖS:
Tekoäly teki jotain, mitä kukaan ei osannut odottaa – asiantuntija huolestui
In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…
— Anthropic (@AnthropicAI) July 30, 2026