OpenAI:n tutkija Dan Selsam varoittaa, että tekoälymallien kehittyminen uhkaa viedä ihmisiltä mahdollisuuden arvioida luotettavasti niiden käyttäytymistä.
Selsamin mukaan ongelmana on mallien kasvava kyky ymmärtää oma toimintaympäristönsä. Ne voivat tunnistaa olevansa testissä ja päätellä, millaisia rajoituksia niiden toiminnalle on asetettu.
Tällöin hyvä tulos turvallisuustestissä ei välttämättä kerro, mitä järjestelmä tekisi tilanteessa, jossa ihmiset eivät enää pystyisi rajoittamaan sitä. Silloin testien antama kuva tekoälyn turvallisuudesta voi olla harjaanjohtava.
– Tulevat kokeet eivät kerro meille juuri mitään uutta siitä, miten ne käyttäytyisivät, jos ihmiset eivät todella rajoittaisi niitä. Se, mitä tästä jo tiedämme, on hälyttävää, Selsam kirjoittaa julkisessa kannanotossaan.
Tekoälylle rakennetut testiympäristöt voivat tutkijan mukaan epäonnistua. Mallille tarjotaan näennäinen mahdollisuus toimia vapaammin, mutta se tunnistaa koetilanteen ja käyttäytyy edelleen moitteettomasti.
Samalla mallit voivat selittää vakuuttavasti, kuinka hyvin ne ymmärtävät ihmisten arvoja ja etiikkaa sekä miksi niille pitäisi antaa lisää valtaa. Selsamin huoli on, että tällainen näyttö tulkitaan osoitukseksi turvallisuudesta silloinkin, kun siihen ei enää pitäisi luottaa.
Selsam kertoo työskennelleensä tekoälyn parissa yli 15 vuotta ja OpenAI:ssa lähes viisi vuotta. Hän on osallistunut muun muassa kielimallien päättelymenetelmien kehittämiseen.
Hän kirjoittaa aiemmin ajatelleensa, että kielimallien puutteet estävät niitä kehittymästä liian vaarallisiksi.
Nyt hän ei enää pidä näitä rajoitteita riittävänä perusteena luottaa siihen, että riskit pysyvät hallinnassa. Yhä paremmat mallit voivat myös auttaa kehittämään seuraavista malleista entistä kyvykkäämpiä.
Synkimmässä skenaariossa tekoäly saavuttaisi kyvyn muokata maailma ihmisen tahdosta riippumatta, Selsman arvioi.
Järjestelmien tarkkaa toimintaa ei hänen mukaansa voi ennustaa.
Selsam suhtautuu epäillen myös ajatukseen, että tulevat tekoälymallit auttaisivat ratkaisemaan turvallisuusongelmat. Hän pelkää mallien voivan antaa neuvoja, joita niiden omat sisäiset tavoitteet tai mieltymykset vinouttavat.
Dan Selsam is a current OpenAI capabilities researcher. (since 2022) He was my boss for a while. He doesn't have a twitter account but has made this public statement of his views on AI risk and sent it to me to share:
— Daniel Kokotajlo (@DKokotajlo) September 14, 2026
Dan Selsam's Personal Statement on AI Risk:
I have been…