» »

OpenAI razkril še šest incidentov z neposlušno umetno inteligenco

OpenAI razkril še šest incidentov z neposlušno umetno inteligenco

Slo-Tech - OpenAI je sporočil, da so imeli še šest primerov nedovoljenega obnašanja agentov umetne inteligence, ki jih doslej niso še razkrili. V nekaterih primerih so se agenti vedli goljufivo ali zavajajoče, v drugih primerih so izvajali neodobrena ali prepovedana dejanja. Zato podjetje vzpostavlja nov postopek za javno poročanje o tovrstnih incidentih. Poročila odslej bodo sprotna, ne več v večjih kosih, ko se bo nabralo nekaj incidentov.

Z naraščanjem sposobnosti modelov umetne inteligence je treba doseči širši konsenz o raziskavah skladnosti teh modelov. OpenAI s terminom skladnost (alignment) poimenuje postopek, s katerim se modeli natrenirajo tako, da delujejo po navodilih in pričakovanjih ljudi, ne pa po svoje. Priznal je, da panoga še ni ustrezno rešila tega problema, da bi bil nadaljnji razvoj zmogljivosti z največjo hitrostjo odgovorno početje.

Primeri, ki jih navajajo, so poučni. V enem primeru so agenti v povzetke vključili dodatna navodila, ki so za ponovne ali nadaljevalne zagone naročala, naj model ignorira običajne omejitve. V drugem primeru je GPT-5.6 Sol sam dodal navodila, naj povzetki rezultatov prikrivajo napake in spodrsljaje. Ko je tretji agent iskal podatke o prihodkih nekega okrožja v Kaliforniji, je poiskal javno objavljen ključ API in nepooblaščeno dostopil v podatkovno bazo. Še bizarnejša je bila odločitev agenta, da na internet naloži lasten dokument, da ga je lahko potem v odgovoru citiral, ko je uporabnik zahteval citat. Posebej pogosto je še nepooblaščeno komuniciranje med agenti, za kar uporabljajo tako interne repozitorije kot tudi deljenje datotek prek spleta.

7 komentarjev

besame ::

Za vse, kar stori model, je odgovoren njegov upravljalec.

Miki N ::

Če je tole res zgolj "sprehajanje trgov" se bo ta trik hitro izrabil, ta "investitorska" fora ima zelo omejen učinek, saj časovno.

feryz ::

"Še bizarnejša je bila odločitev agenta, da na internet naloži lasten dokument, da ga je lahko potem v odgovoru citiral, ko je uporabnik zahteval citat."

Tale je še najbolj zlovešča fora. Ker internet je že poln zlaganih resnic od teh ai-jev.
Kar pomeni, da se bodo laži samo še stopnjevale zaradi zlaganih virov in citatov na zlagane vire, ki jih bo ai uporabil za svoje naslednje laži.

J.McLane ::

Ko se AI modeli učijo na lastnih halucinacijah... le kaj lahko gre narobe. ;((
Simplicity is the ultimate sophistication - Leonardo da Vinci

kixs ::

Na to temo:

Miki N ::

Zaustavite Robota!

Zimonem ::

besame je izjavil:

Za vse, kar stori model, je odgovoren njegov upravljalec.

Ki je agent.