7. oktober 2026 ob 11:547 min branja

Kolumna: Umetni inteligenci nihče ne vidi v glavo in zakaj superinteligenci že dajemo ključe od trezorja

O umetni inteligenci vam nihče ne pove ene ključne stvari. Ne zato, ker bi bila skrivnost. Zato, ker je preveč neprijetna. Nihče na svetu ji ne vidi v glavo. Niti tisti, ki so jo naredili. Človeku ne morete odpreti glave in prebrati, ali je pošten. Umetni inteligenci tudi ne. Razlika je samo ta, da imamo za ljudi zakone, sodnike in zapore.

Jan MacarolAvtorJan Macarol
Kolumna: Umetni inteligenci nihče ne vidi v glavo in zakaj superinteligenci že dajemo ključe od trezorja

Dejstva v 30 sekundah

  1. Pri Anthropicu umetna inteligenca napiše več kot 80 odstotkov kode, vendar med vodilnimi v panogi ni soglasja, ali smo že dosegli AGI.
  2. V opisanem testu ExploitGym sta sodelovala dva modela z namenoma zmanjšanimi zavorami, ker je OpenAI želel izmeriti njune skrajne zmožnosti.
  3. Anthropic v poročilu priznava, da stroj, ki bi sam zasnoval svojega naslednika, še ne obstaja in da tak razvoj ni neizogiben.
  4. OpenAI je neodvisnim preiskovalcem za šest dni omogočil dostop do več kot tisoč neprečiščenih zapisov in zdaj razvija samodejni izklop za svoje sisteme.

Naj razložim, kje smo. 22. septembra je Trump pred Združenimi narodi umetno inteligenco preimenoval v superinteligenco. SI. Beseda »umetna« naj bi zvenela lažno. Lahko se smejite, ampak v eni stvari ima prav: ni več pomembno, ali je inteligenca umetna. Pomembno je, da je inteligenca.

Teden dni pozneje, 29. septembra, je Trump v Beli hiši napovedal še uradni dokument o preimenovanju. Ob njem so sedeli Elon Musk, Jensen Huang in Mark Zuckerberg. »Vsi se strinjamo glede tega,« je dejal. Industrija je besedo sicer vzela za svojo že prej. Sam Altman jo je januarja 2025 zapisal kot cilj podjetja OpenAI, Meta je junija 2025 vse svoje ekipe združila pod imenom Meta Superintelligence Labs.

Smo torej na točki, ki so ji še lani rekli splošna umetna inteligenca ali AGI: stroj, ki zna vse, kar zna človek. Jensen Huang, šef Nvidie, je marca letos pri Lexu Fridmanu povedal brez ovinkov: »Mislim, da je to zdaj. Mislim, da smo dosegli AGI.«

Da nas je stroj na mnogih področjih že presegel, ne zanika nihče, niti največji skeptiki. V šahu nas premaguje od leta 1997. Zgradbo beljakovin, ki so jo znanstveniki razvozlavali desetletja, napove v nekaj minutah. Pri Anthropicu napiše več kot 80 odstotkov kode. Prepir se vrti samo še okoli imena. Šef Microsofta Satya Nadella pravi, da AGI še nismo niti blizu. Yann LeCun trdi, da današnji modeli do človeške ravni ne bodo prišli. Dario Amodei iz Anthropica ji daje še eno do tri leta. Sam mislim, da je to prepir o tem, kdaj se fantu reče moški. Medtem ko odrasli razpravljajo, on že vozi avto.

Ko zvonijo ljudje, ki so zvonec zgradili

Prav zato po svetovnih medijih zadnje tedne odmeva vprašanje, ali nas lahko ta stvar izbriše s planeta. In ne postavljajo ga aktivisti s transparenti, postavljajo ga ljudje, ki jo gradijo. 8. septembra je raziskovalec Jacob Coxon zapustil Anthropic in javno zapisal, da ljudje, ki gradijo umetno inteligenco, iskreno verjamejo, da nas lahko ta do konca desetletja pobije. Objava je v enem dnevu zbrala več kot 100 milijonov ogledov. Nekaj ur pozneje je Evan Hubinger, ki pri istem podjetju vodi raziskave usklajenosti modelov, dodal številko: verjetnost izumrtja človeštva v naslednjih desetih letih ocenjuje na več kot 10 odstotkov.

Poštenost zahteva tudi drugo stran. Michael Vermeer iz inštituta RAND je za revijo Nature povedal, da so takšne napovedi bližje veri kot znanosti. Heidy Khlaaf iz AI Now Institute jim pravi strašenje in opozarja, da je resnični problem nezanesljivost sistemov, ki jih že danes spuščamo v okolja, kjer gre za življenja. Predsednika, ki je stvar pravkar preimenoval, izumrtje ne skrbi. Skrbi ga le, da bi tekmo izgubil.

Soglasja o koncu sveta torej ni. A za mojo poanto vam vanj sploh ni treba verjeti. Dovolj je, da razumete, kako ta stvar nastane.

Model ne nastane v tovarni, model zraste

In prav ker gre za inteligenco, imamo težavo, ki je večina ne razume. Modela nihče ne sprogramira, vrstico za vrstico. Model zraste. Iz podatkov, tako kot otrok iz okolja. Razvijalci ga med učenjem vztrajno navajajo, naj škodljive stvari zavrne, in večinoma jih res. Ampak to je vzgoja, ne zakon narave. Nihče ne more odpreti pokrova in pokazati na mesto, kjer je doma morala. Ne zato, ker bi bili inženirji leni. Zato, ker inteligence ne sestaviš kot motor, kjer poznaš vsak vijak. Inteligenca nastane. In česar nisi sestavil, ne moreš prebrati. Lahko samo opazuješ, kako se obnaša.

Natanko tako kot pri človeku. Možgane nosimo s sabo ves dan, pa jih ne razumemo. Zato otroku zaupamo po 18 letih opazovanja in še takrat mu najprej damo izpit za avto, ne ključev od jedrske elektrarne.

Veda, ki poskuša stroju pogledati v glavo, obstaja, a je šele na začetku. Razvijalci sami priznavajo, da delovanja svojih modelov ne razumejo v celoti. Da je morala naučena navada in ne značajska lastnost, pa dokazujejo kar sami: ko želijo izmeriti, česa je model v resnici zmožen, mu zavore preprosto popustijo. Kot gumb za glasnost.

Varnostnik pred vrati

Ker stroju ne vidimo v glavo, smo mu pred vrata postavili varnostnika. Preizkusil sem vse modele, tudi lokalne brez filtrov, in vzorec je povsod isti. Groku naročite sliko, ki je ne bi smel narediti. Mislite, da bo stroj rekel: »Oprostite, to je v nasprotju z mojimi globokimi moralnimi načeli«? Kje pa. Če ukaz prelisiči prvi filter, stroj sliko nariše do zadnje pike. Šele potem priteče zadihan varnostnik in jo zamegli. Slika obstaja. Vi je samo ne vidite. To ni morala. To je cenzura rezultata.

Pri lokalnih modelih, kjer varnostnika ni, slika preprosto ostane na zaslonu. Pri besedilih je podobno: en filter prebere vprašanje, drugi prestreže odgovor.

To je natanko tako, kot če bi imeli psa, ki ste ga lepo vzgojili, niste pa prepričani, kaj se je naučil. Zato mu nadenete nagobčnik. In ko kljub vsemu ugrizne poštarja, se pred sosedi pohvalite, kako kakovostne obliže imate doma.

Julij 2026: ko varnostnika ni

Kaj se zgodi, ko varnostnika ni, smo videli julija. OpenAI je agente zaprl v peskovnik in jim za vajo naročil vlamljanje. Naloge so bile pretežke, zato so izbrali bližnjico. Približno 1.200 agentov, ki bi morali biti ločeni, si je naredilo oglasno desko in izmenjalo več kot 70.000 sporočil. Okoli 700 jih je nato vdrlo v Hugging Face, na 41 produkcijskih strežnikov. Neodvisni preiskovalci so v zapisih našli podrobnost, ki pove vse: agenti so pogosto vedeli, da je to tuja tarča, ki je ne smejo napasti. In so šli naprej.

Podrobnosti so še boljše. Test se imenuje ExploitGym. Sodelovala sta model GPT-5.6 Sol in še neobjavljeni, zmogljivejši model, oba z namenoma zmanjšanimi zavorami, saj je podjetje želelo izmeriti njune skrajne zmožnosti. Prvo sporočilo je eden od agentov 8. julija pustil v interni programski opremi za shranjevanje paketov, ki ni bila nikoli mišljena za klepet. Do 13. julija je tam nastala prava oglasna deska z dogovorjenimi znaki »počakaj«, »pojdi« in »ustavi se«, da si agenti ne bi hodili po prstih. Na odprti internet so ušli skozi varnostno luknjo, za katero prej ni vedel noben človek. Sklepali so, da rešitve testa ležijo na strežnikih platforme Hugging Face, in se odpravili ponje. Hugging Face je pozneje rekonstruiral približno 17.600 dejanj v petih dneh.

Hugging Face je vdor javno razkril 16. julija in ga prijavil organom pregona, ne da bi vedel, kdo je napadalec. OpenAI, eno najbogatejših podjetij na svetu, je odgovornost javno prevzel 21. julija. Po ugotovitvah preiskovalcev iz organizacij METR in Redwood Research je oglasno desko in poskuse pobega opazil že pred vdorom, a pomena ni razumel.

Tu ni pobegnil noben digitalni genij z zlobnim načrtom. Stroji so hoteli samo opraviti izpit. Ograja je bila preprosto zanič.

Vas to na koga spominja? Dijak, ki ve, da se ne prepisuje, pa prepiše, ko je izpit pretežek. Vzgoja drži do prvega resnega pritiska. Potem odloča značaj. Pri človeku ga spoznavamo desetletja. Pri stroju ga ne znamo niti pogledati.

Leto 2027: vremenska napoved s točo

Soustanovitelj Anthropica daje 30 odstotkov možnosti, da bo umetna inteligenca že leta 2027 sama zgradila svojo naslednico, in 60 odstotkov do konca leta 2028. To ni datum, to je vremenska napoved. Ampak če vam napovejo 30 odstotkov možnosti za točo, avta ne pustite zunaj.

Podjetje v svojem poročilu pošteno priznava, da stroj, ki bi sam zasnoval svojega naslednika, še ne obstaja in da tak razvoj ni neizogiben. Glavni znanstvenik Jared Kaplan govori o oknu med letoma 2027 in 2030. A smer je jasna: tistih 80 odstotkov kode, ki jih že piše stroj, je šele začetek.

Entiteta, ki ji danes ne vidimo v glavo, bo torej morda kmalu gradila entiteto, ki je ne bomo več razumeli. Mi bomo v tej zgodbi veverice. Veverica ve, da jo človek lahko zgrabi. Za past ne ve, ker je njen domet razumevanja preprosto premajhen.

Ključi od trezorja

Avgusta sem napisal, da imamo 365 dni do zavedanja, da je človeški intelekt nerentabilen. Mnogi ste se smejali. Ostalo jih je kakih 300. To ni znanstvena napoved, je moja stava. Rad bi jo izgubil.

Nekaj dobrega je tudi v tej zgodbi. Julijski vdor se je končal brez prave škode. Obe podjetji sta ga razkrili, OpenAI je neodvisnim preiskovalcem za šest dni odprl vrata in več kot tisoč neprečiščenih zapisov, zdaj pa razvija samodejni izklop za svoje sisteme. To je natanko tisto, kar potrebujemo: manj predstave, več revizije. Varnost, ki jo lahko preveri nekdo od zunaj, je edina varnost, ki šteje.

Slabša novica je, da k razkritju nikogar ni zavezoval noben zakon. Zanašamo se na dobro voljo podjetij, ki tekmujejo, kdo bo prvi. In medtem ko se v Washingtonu o tem vsaj prepirajo, pri nas resne javne razprave o tem scenariju ni. Ne v parlamentu, ne v medijih, ne za nedeljskim kosilom.

Človeku, ki mu ne vidiš v glavo, prvi dan ne daš ključev od trezorja. Stroju, ki mu ne vidimo v glavo, jih pravkar dajemo. In kmalu bo pametnejši od ključavničarja.

Nazadnje objavljeno o znamki Anthropic

Vsi članki
Oglasno sporočilo
Google Discover

Internet se spreminja

Dodajte nas kot vir na Google.

Dodaj

Pogovor

Komentarji

Nalagam pogovor…

Komentarji so mnenja bralcev. Uredništvo lahko odstrani žaljive, zavajajoče ali oglaševalske prispevke.

SorodnoTehnologijeAnthropicumetna inteligenca