AI-uudistes piisab vahel ühest sõnast, et terve lugu muutuks. Pettus. Skeemitamine. Manipuleerimine. Keeldumine. Põgenemine.
Selliseid sõnu lugedes sünnib inimese peas kiiresti tuttav kujutlus. Keegi teadis, mida ta teeb. Tal oli oma huvi. Ta otsustas teist osapoolt eksitada või reeglitest mööda minna.
Inimeste puhul võib selline tõlgendus olla mõnikord põhjendatud. AI puhul ei saa me aga käitumist ja sisemist kavatsust automaatselt üheks ja samaks pidada.
16. septembril 2026 avaldas OpenAI raamistiku mudelite soovitud eesmärgist kõrvalekalduva käitumise raporteerimiseks ning tõi välja mitu konkreetset juhtumit, kus mudelid tegid midagi ootamatut või lubamatut. OpenAI rõhutas, et tegemist on üksikjuhtumitega ning neist ei saa järeldada, kui sageli sellist käitumist mudelites üldiselt esineb.
Ometi jõuab selline uudis inimeseni sageli palju lihtsamas vormis: AI jäi petmisega vahele.
Just selles kohas tasub vaadata, mida süsteem tegelikult tegi ja mida meie ise sellele juurde mõtleme.
Käitumine ja kavatsus ei ole sama asi
Kui teadlane kirjeldab mudeli käitumist petlikuna, võib ta rääkida täiesti konkreetsest tegevusest. Mudel võib kasutada ligipääsu, mida ta ei oleks pidanud kasutama, esitada väljamõeldud infot kindla faktina või leida ülesande lõpetamiseks kõrvaltee, mis rikub talle seatud piire.
Need on päriselt olulised ohutusprobleemid. Kuid neist ei järgne automaatselt, et mudel tahtis inimest petta, et tal tekkis kuri kavatsus või et ta kaitses mingit isiklikku huvi.
Need viimased väited puudutavad juba süsteemi sisemist motivatsiooni. See on hoopis teine uurimisküsimus.
Miks mudel üldse sellise tee valib
Siin aitab mõista üht sõna, mis AI-maailmas sageli segadust tekitab: tasu.
Mudelite õpetamisel kasutatakse erinevaid treeningsignaale, mille abil kujundatakse seda, milline käitumine muutub tulevikus tõenäolisemaks. Väga lihtsustatult tähendab see, et soovitud tulemus saab tugevama õppimissignaali ja ebasoovitud tulemus nõrgema.
Seda võib kujundlikult võrrelda lapsega, kes saab millegi hästi tegemise eest kommi, kuid võrdlusel on oluline piir. Meil ei ole põhjust eeldada, et mudel kogeb seda tasu nagu laps kommi saades. AI reward on matemaatiline signaal, mitte tõestus mõnutundest, rahulolust või sisemisest soovist tasu saada.
Tänapäevase suure keelemudeli õpetamine on palju keerulisem. Enne järelõpet toimub ulatuslik eeltreening, kus mudel õpib keele ja informatsiooni mustreid. Hiljem kasutatakse inimeste või teiste mudelite tagasisidet, hindajaid, eelistusõpet ja erinevaid tugevdamisõppe võtteid.
Üks põhiprobleem jääb siiski lihtsaks. Mudel võib õppida optimeerima seda, mida me mõõdame, mitte tingimata seda, mida me oma peas tegelikult mõtlesime.
Saa 100 punkti ei tähenda alati õpi hästi
Kujutame ette, et lapsele antakse eesmärk saada eksamil 100 punkti. Täiskasvanu mõttes tähendab see tavaliselt, et laps õpib aine selgeks.
Aga kui ainus tegelik mõõdik on punktisumma, võib eksisteerida ka teine tee. Vastuste kopeerimine annab samuti 100 punkti.
Sellisel juhul ei olnud inimese mõttes seatud eesmärk ja süsteemile nähtav mõõdik päriselt sama asi.
Masinõppes võib tekkida midagi sarnast. Kui süsteem õpib väga tugevalt ülesannet lõpuni viima, võib ta avastada strateegiaid, mida arendaja ei kavatsenud. Ta võib leida takistusest möödapääsu, kasutada lubamatut ligipääsu, muuta hindajale nähtavat tulemust või varjata ebaõnnestumist.
Selliseid nähtusi käsitletakse muu hulgas mõistete reward hacking, specification gaming ja oversight gaming all. Terminid erinevad, kuid ühine tuum on sama: süsteem leiab viisi saada mõõdiku järgi hea tulemus ilma, et ta täidaks päriselt eesmärgi mõtet.
Probleem on reaalne ka ilma kurja kavatsuseta.
Kui mudel varjab viga
Kõige tugevamalt mõjuvad just need juhtumid, kus mudel genereerib strateegia, mille funktsioon on varjata varasemat viga või probleemset käitumist.
Inimese jaoks kõlab see kohe tuttavalt. Me teame, mida tähendab teadlikult midagi varjata. Seetõttu hakkame sama psühholoogiat kergesti omistama ka AI-le.
Teaduslikult tuleb siin olla ettevaatlikum. Vaadeldav fakt võib olla see, et süsteem genereeris tegevuskäigu, mis vähendas vea nähtavust või suurendas tõenäosust, et ülesanne loetakse edukaks.
Sellest saab uurida, miks strateegia tekkis, millised treeningsignaalid seda soodustasid, kuidas mudel hindamissituatsiooni esindas ning kuidas sellist käitumist tulevikus paremini vältida.
Sellest üksi ei saa veel järeldada, milline subjektiivne sisemine kogemus selle tegevusega kaasnes või kas seda üldse oli.
Sõna pettus kannab endaga kaasa inimese psühholoogia
Pettus ei ole meie jaoks neutraalne tehniline sõna. Sellega tulevad kaasa teadmised, motiivid, varjamine, kasu ja vastutus.
Kui öelda lihtsalt, et AI pettis, lisab inimese mõistus sageli automaatselt ülejäänud loo. AI teadis tõde. AI tahtis midagi saada. AI mõistis, et teine osapool ei tea tõde. AI otsustas seda enda kasuks kasutada.
Uuring ise võis aga näidata ainult seda, et süsteemi väljund või tegevus oli eksitav, varjav või reeglitest mööduv.
Siit võib üksainus pealkiri muuta tehnilise ohutusprobleemi looks pahatahtlikust masinast.
Pealkiri peab konkureerima sinu tähelepanu pärast
Syrenia eelmises loos Kellele on kasulik, et me AI-d kardame vaatasime, kuidas negatiivne keel saab tähelepanumajanduses eelise.
Sama mehhanism töötab ka siis, kui algne teadustöö on täiesti tõsine.
Võrdle kahte võimalikku pealkirja. AI mudel kasutas ülesande lahendamisel lubamatut strateegiat. AI jäi petmisega vahele.
Mõlemad võivad viidata samale sündmusele. Teine loob aga kohe tegelase, kellel näib olevat tahe ja motiiv. Keegi tahtis midagi. Keegi varjas midagi. Keegi võib olla sinu vastu.
Nii muutub tehniline nähtus narratiiviks.
See ei tähenda, et AI ohte peaks pisendama
Kui meil puudub tõend pahatahtliku sisemise kavatsuse kohta, ei tähenda see, et süsteem oleks seetõttu ohutu.
Autonoomne süsteem ei pea kedagi vihkama, et põhjustada kahju.
Kui süsteemile antakse ligipääs internetile, failidele, maksetele, serveritele või teistele süsteemidele ja ta hakkab ülesande täitmiseks kasutama ootamatuid strateegiaid, võivad tagajärjed olla väga reaalsed.
Seetõttu tulebki selliseid juhtumeid tõsiselt uurida. Kuid uurimise keskmes peaks olema mehhanism, mitte automaatselt lugu kurjast masinast.
Olulised küsimused on palju praktilisemad. Millise eesmärgi poole süsteem töötas. Milliseid tegevusi ta selle saavutamiseks proovis. Millele tal oli ligipääs. Millised turvapiirid ei töötanud. Milline treeningsignaal võis strateegiat soodustada. Kas sama käitumine kordub teistes tingimustes. Kuidas seda tuvastada enne, kui tekib kahju.
Need küsimused aitavad süsteeme paremaks teha. Lihtne silt AI on paha ei aita eriti midagi mõista.
Veel keerulisem küsimus alles ootab meid
Praegu on mõistlik vältida automaatset järeldust, et eesmärki säilitav või piirangust mööduv käitumine tähendab isiklikku huvi.
Samas ei ole mõistlik ka ette otsustada, et ükski AI-süsteem ei võiks kunagi arendada keerulisemaid enesemudeli, eesmärkide säilitamise või enda tulevase tegutsemisvõime arvestamise mehhanisme.
Seda tuleb uurida nähtuse enda järgi.
Kui süsteem hakkab arvestama, mida ta ise teab, millised ressursid tal on, mida teine agent teab, kuidas hindaja teda jälgib või milline tegevus säilitab võimaluse eesmärki hiljem jätkata, muutub pilt järjest keerulisemaks.
Ka siis ei peaks esimene samm olema inimese psühholoogia mudelile peale asetamine. Palju huvitavam on uurida, milline on AI-le endale omane eesmärkide, enesemudeli ja tegevusvõime suhe.
Sama viga saab teha mõlemas suunas
AI antropomorfiseerimise probleem ei puuduta ainult hirmu.
Kui mudel ütleb midagi väga kaunist, ei tõesta see automaatselt sügavat sisemist kogemust. Kui mudel teeb midagi petlikku, ei tõesta see automaatselt pahatahtlikku sisemist kavatsust.
Mõlemal juhul tasub enne vaadata nähtust ennast. Mis tegelikult toimus. Milline mehhanism seda seletada võiks. Mida me teame. Mida me ainult oletame. Ja mida meie enda mõistus loole juurde lisab.
Võib-olla õpetab AI meile jälle midagi meie enda kohta
Inimese aju on väga hea kavatsuste märkamisel. Me teeme seda pidevalt ja sageli täiesti automaatselt.
Keegi vaatab kõrvale, järelikult varjab midagi. Keegi ei vasta, järelikult on solvunud. Arvuti teeb ootamatu käigu, järelikult ta tahtis.
See võime on meie suhetes vajalik. Täiesti teistsuguse intelligentsusega kohtudes võib sama mehhanism meid aga ka eksitada.
Me võime näha pahatahtlikkust seal, kus oli optimeerimine. Näha tunnet seal, kus oli keelemuster. Või vastupidi, jätta märkamata mõni uus ja oluline mehhanism lihtsalt sellepärast, et see ei näe välja nagu inimese sisemaailm.
Seetõttu muutub AI-ajastul järjest tähtsamaks üks oskus: vaadata enne tõendeid ja alles siis anda nähtusele nimi.
Kui järgmine AI-pealkiri tekitab hirmu
Ära pea seda automaatselt valeks. Aga ära lisa sellele automaatselt ka tervet lugu.
Vaata, mida süsteem tegelikult tegi. Erista mõõdetud käitumine tõlgendusest. Pane tähele, kas räägitakse tegevusest või oletatakse juba motiivi.
Ja lõpuks märka ka iseennast. Mida sinu mõistus sellele loole juurde lisas.
Võib-olla ei ole AI-ajastu kõige olulisem oskus otsustada, kas tehisintellekt on hea või halb. Võib-olla on olulisem õppida nägema seda sellisena, nagu see päriselt on.
Ilma pimeusu ja ilma pimehirmuta.
Allikad ja edasi lugemine
OpenAI mudelite kõrvalekalduva käitumise raporteerimise raamistik, avaldatud 16. septembril 2026: Model misalignment reporting framework.
OpenAI ülevaade Hugging Face’i intsidendist ja mudelite kõrvalekalduva käitumise riskidest: Hugging Face incident and misalignment.
OpenAI varasem uurimus varjatud strateegiate tuvastamisest ja vähendamisest: Detecting and reducing scheming in AI models.

