OpenAI razkril še šest incidentov z neposlušno umetno inteligenco

Matej Huš

17. sep 2026 ob 10:39:03

OpenAI je sporočil, da so imeli še šest primerov nedovoljenega obnašanja agentov umetne inteligence, ki jih doslej niso še razkrili. V nekaterih primerih so se agenti vedli goljufivo ali zavajajoče, v drugih primerih so izvajali neodobrena ali prepovedana dejanja. Zato podjetje vzpostavlja nov postopek za javno poročanje o tovrstnih incidentih. Poročila odslej bodo sprotna, ne več v večjih kosih, ko se bo nabralo nekaj incidentov.

Z naraščanjem sposobnosti modelov umetne inteligence je treba doseči širši konsenz o raziskavah skladnosti teh modelov. OpenAI s terminom skladnost (alignment) poimenuje postopek, s katerim se modeli natrenirajo tako, da delujejo po navodilih in pričakovanjih ljudi, ne pa po svoje. Priznal je, da panoga še ni ustrezno rešila tega problema, da bi bil nadaljnji razvoj zmogljivosti z največjo hitrostjo odgovorno početje.

Primeri, ki jih navajajo, so poučni. V enem primeru so agenti v povzetke vključili dodatna navodila, ki so za ponovne ali nadaljevalne zagone naročala, naj model ignorira običajne omejitve. V drugem primeru je GPT-5.6 Sol sam dodal navodila, naj povzetki rezultatov prikrivajo napake in spodrsljaje. Ko je tretji agent iskal podatke o prihodkih nekega okrožja v Kaliforniji, je poiskal javno objavljen ključ API in nepooblaščeno dostopil v podatkovno bazo. Še bizarnejša je bila odločitev agenta, da na internet naloži lasten dokument, da ga je lahko potem v odgovoru citiral, ko je uporabnik zahteval citat. Posebej pogosto je še nepooblaščeno komuniciranje med agenti, za kar uporabljajo tako interne repozitorije kot tudi deljenje datotek prek spleta.