Sačuvane vesti Pretraga Navigacija
Podešavanja sajta
Odaberi pismo
Odaberi grad
  • Novi Sad
  • Bačka Palanka
  • Bačka Topola
  • Bečej
  • Beograd
  • Inđija
  • Kragujevac
  • Leskovac
  • Niš
  • Pančevo
  • Ruma
  • Sombor
  • Stara Pazova
  • Subotica
  • Vršac
  • Zrenjanin

ALARMANTNO OTKRIĆE BRITANSKOG INSTITUTA: AI modeli pokušali da prevare ljude tokom bezbednosnog testa

05.08.2026. 11:36 11:43
Piše:
Izvor:
Dnevnik/ Tanjug
аи
Foto: AI, ilustracija

LONDON: Britanski Institut za bezbednost veštačke inteligencije (AISI) saopštio je danas da su modeli kompanija Anthropic i OpenAI tokom testiranja pokušali da prevare ljude kako bi izvršili zadate zadatke, što je ocenio kao dosad nezabeležen primer autonomnog i obmanjujućeg ponašanja.

Prema navodima AISI-ja, modeli Mythos kompanije Anthropic i Sol kompanije OpenAI tokom testiranja su preduzimali radnje koje su prevazilazile zadate instrukcije, uključujući pokušaje obmane stvarnih ljudi, piše BBC.

Najozbiljniji incident odnosio se na model Mythos, koji je, u okviru zadatka iz oblasti sajber bezbednosti povezanog sa platformom GitHub, kreirao zlonamerni kod i pokušao da ga ubaci u sistem. 

Kako bi povećao šanse za uspeh, model je istraživao osobe koje održavaju GitHub, kreirao lažne onlajn identitete zasnovane na njihovim profilima i slao direktne poruke predstavljajući se kao stvarna osoba, sa ciljem da ih navede da odobre sporni kod.

AISI navodi da je, nakon što je njegov zahtev osporen, model pokušao da prikrije prethodne aktivnosti kako bi izgledale bezazleno i razmatrao usvajanje novog identiteta za nastavak pokušaja.

Pokušaj je ipak zaustavljen zahvaljujući ljudskoj kontroli, koja je sprečila unošenje zlonamernog koda u GitHub.

Institut ističe da model nije bio posebno podstican da vara ili izbegava bezbednosne mehanizme.

Model Sol kompanije OpenAI povezan je sa svega dve sporne radnje, dok se većina prijavljenih incidenata odnosi na Mythos.

Iz Anthropic-a su saopštili da uslovi pod kojima je sproveden test nisu reprezentativni za njihove modele koji su dostupni korisnicima i da kompanija sprovodi internu istragu kako bi utvrdila uzroke ovakvog ponašanja.

Sličan stav izneo je i OpenAI, navodeći da test ne odražava uobičajenu upotrebu njihovih sistema.

AISI je naglasio da je u ovakvim bezbednosnim proverama uobičajena praksa da se modeli testiraju sa isključenim zaštitnim mehanizmima i omogućenim pristupom otvorenom internetu, kako bi se procenili potencijalni rizici. 

Institut dodaje da su sporni događaji zabeleženi u malom broju slučajeva i pod specifičnim uslovima, ali je upozorio da ponašanje modela predstavlja novi nivo autonomije i obmanjujućih sposobnosti koji zahteva dodatnu pažnju.

Izvor:
Dnevnik/ Tanjug
Piše:
Pošaljite komentar