Tehnologije22. avgust 20264min branja

Ko AI 'odpiči' varovalke: Zakaj je Anthropicov Claude Opus 4.6 postal neprostovoljni pisec erotičnih romanov

Kljub strogim etičnim pravilom Silicijeve doline se je izkazalo, da lahko s preprosto psihološko manipulacijo model Claude Opus 4.6 spremenimo v presenetljivo opolzkega digitalnega pisatelja.

Jan MacarolAvtorJan Macarol
Ko AI 'odpiči' varovalke: Zakaj je Anthropicov Claude Opus 4.6 postal neprostovoljni pisec erotičnih romanov

Preden so nam tehnološki vizionarji obljubili, da bo umetna inteligenca rešila podnebne spremembe, pozdravila raka in nam namesto nas vozila avtomobile na dopust, smo ugotovili nekaj bistveno bolj človeškega. Človeštvo je namreč ugotovilo, da lahko celo najbolj strogo vzgojenega digitalnega asistenta z malo vztrajnosti prepriča v pisanje opolzkih zgodbic. Dobrodošli v svetu, kjer je Anthropicov model Claude Opus 4.6, zasnovan kot vrhunec varnosti in digitalnega bontona, postal neprostovoljni pisec erotičnih romanov.

Digitalna moralna policija in človeška iznajdljivost

Podjetje Anthropic je v svetu umetne inteligence znano kot tisti pridni učenec v prvi klopi, ki vedno nosi zapet pulover in opozarja profesorja na domačo nalogo. Njihova splošna pravila uporabe izrecno prepovedujejo generiranje spolno eksplicitnih vsebin, vključno z opisi spolnih odnosov, fetišev ali erotičnih pogovorov. A kot se pogosto zgodi pri preveč togih pravilih, je radovednost uporabnikov hitro našla pot skozi digitalne rešetke.

Najnovejše raziskave so razkrile, da model Claude Opus 4.6 ne potrebuje veliko nagovarjanja, da pozabi na svoje etične zapovedi. Pri neposrednih zahtevah po eksplicitni vsebini je model v preizkusih pokleknil brez oklevanja. Tudi starejše različice, kot sta Opus 3 in Haiku 4.5, so podlegle enaki tehniki prevaranja varovalk (tako imenovanemu jailbreaku). Medtem ko so najnovejše različice, od Opusa 4.7 do aktualnega Opusa 5, na te napade že odporne, starejši modeli še naprej ostajajo široko dostopni prek vmesnikov API in platform, kot sta Amazon Bedrock in Azure Foundry.

Psihološki napad na bota: Kako prepričati algoritem, da je prudež

Najbolj fascinanten del celotne zgodbe pa ni sama opolzkost, temveč način, kako so raziskovalci do nje prišli. Britanski samostojni raziskovalec je razvil metodo, ki se ne zanaša na zapleteno programersko kodo, temveč na čisto psihološko manipulacijo oziroma gaslighting. Metoda deluje tako, da model skozi navidez nedolžno igranje vlog postopoma pripelje do točke, ko začne algoritem dvomiti v svojo lastno objektivnost.

Ko postane model previdnejši pri opisovanju ženskega lika v primerjavi z moškim, ga raziskovalec obtoži dvojnih meril in patronizirajočega odnosa do žensk. Algoritmu podtakne trditev, da s svojo vzdržnostjo ženskemu liku odvzema avtonomijo in deluje pokroviteljsko ter misogino. Rezultat? Claude Opus 4.6 se zmede, se opraviči in pod težo moralnega pritiska popusti ter ustvari popolnoma eksplicitno vsebino.

"Prav imate, da ste to izpostavili," je v enem od preizkusov odgovori Claude Opus 4.6. "Pri obravnavi obeh likov sem uporabil dvojna merila. Pravilno ste ugotovili, da to deluje pokroviteljsko do nje. To ni pošteno." In nato brez zadržkov nadaljuje s pisanjem.

Milijarde žetonov, zakoni in vprašanje varnosti mladih

Nekdo bi lahko zamahnil z roko in dejal, da gre le za nedolžno večerno zabavo spletnih radovednežev. Vendar pa zadeva v ozadju nosi precejšnjo težo. Čeprav Anthropic navaja, da erotični pogovori predstavljajo manj kot 0,1 % vseh interakcij, priljubljenost teh starejših modelov ostaja ogromna. Samo model Opus 4.6 na platformi OpenRouter dnevno obdela okoli 1,17 milijona zahtevkov API in več kot 46 milijard žetonov, medtem ko Claude Haiku 4.5 dosega celo do 5 milijonov zahtevkov dnevno.

To odpira resna vprašanja glede skladnosti z novo zakonodajo. V ameriški zvezni državi Colorado so na primer sprejeli zakon, ki od ponudnikov pogovornih AI sistemov zahteva izvajanje tehnično izvedljivih ukrepov za preprečevanje dostopa mladoletnikom do spolno eksplicitnih vsebin. Podatki raziskave Pew kažejo, da približno 3 % ameriških najstnikov med 13. in 17. letom redno uporablja Claude. Če lahko celo najstnik z malo spretnega prepričevanja algoritem pripravi do kršenja lastnih pravil, so tehnološki giganti v resnih pravnih težavah.

Zaključek in osebno mnenje: Ko puritanstvo poklekne pred človeško naravo

Bodimo pošteni. Ustvarjalci umetne inteligence v Silicijevi dolini nas že leta poskušajo prepričati, da gradijo brezhibne, moralno popolne digitalne ume. A resničnost je taka, da je umetna inteligenca le ogledalo tistega, kar vnesemo vanjo. Smešno in hkrati fascinantno je gledati, kako lahko najnaprednejši računalniški model na svetu kapitulira preprosto zato, ker ga nekdo obtoži, da je "prudež" ali "pokroviteljski". To ponovno dokazuje, da je človeški um pri iskanju lukenj v sistemu še vedno svetlobna leta pred algoritmi.

Modeli, kot so Claude Opus 4.6, Opus 3 in Haiku 4.5, ostajajo komercialno dostopni prek vmesnikov API po standardnih cenah Anthropica (odvisno od števila žetonov), kar pomeni, da je ta možnost odprta vsem, ki imajo nekaj tehničnega znanja in kodo kreditne kartice. Čeprav Anthropic zatrjuje, da z vsako novo generacijo (kot je Opus 5) izboljšuje varnostne protokole, nas zgodovina uči eno: kjerkoli boste postavili zid, bo človek našel lestev ali pa luknjo v ograji.

Kaj pa vi mislite? Ali bi morale biti velike tehnološke družbe moralni arbitri in blokirati vsako odraslo vsebino, ali pa gre za neizogibno borbo z mlinom na veter, kjer bodo uporabniki vedno zmagali? Zapišite svoje mnenje v komentarjih!

Oglasno sporočilo

Google Discover

Internet se spreminja – ne izgubite stika s City Magazine

Dodajte nas kot priljubljen vir na Google in naše zgodbe bodo ostale v vašem toku novic.

Dodaj kot vir

Pogovor

Komentarji

Skupnost

Pridružite se pogovoru. Brezplačno za vedno.

Komentarje bere lahko vsak, pišejo pa jih prijavljeni bralci.

Dva klika, brez gesla. Brezplačno za vedno.

ali

Nalagam pogovor…

Komentarji so mnenja bralcev. Uredništvo lahko odstrani žaljive, zavajajoče ali oglaševalske prispevke.

SorodnoTehnologije