АЛАРМАНТНО ОТKРИЋЕ БРИТАНСКОГ ИНСТИТУТА: AI модели покушали да преваре људе током безбедносног теста
ЛОНДОН: Британски Институт за безбедност вештачке интелигенције (AISI) саопштио је данас да су модели компанија Anthropic и OpenAI током тестирања покушали да преваре људе како би извршили задате задатке, што је оценио као досад незабележен пример аутономног и обмањујућег понашања.
Према наводима AISI-ja, модели Mythos компаније Anthropic i Sol компаније OpenAI током тестирања су предузимали радње које су превазилазиле задате инструкције, укључујући покушаје обмане стварних људи, пише ББЦ.
Најозбиљнији инцидент односио се на модел Mythos, који је, у оквиру задатка из области сајбер безбедности повезаног са платформом GitHub, креирао злонамерни код и покушао да га убаци у систем.
Како би повећао шансе за успех, модел је истраживао особе које одржавају GitHub, креирао лажне онлајн идентитете засноване на њиховим профилима и слао директне поруке представљајући се као стварна особа, са циљем да их наведе да одобре спорни код.
АИСИ наводи да је, након што је његов захтев оспорен, модел покушао да прикрије претходне активности како би изгледале безазлено и разматрао усвајање новог идентитета за наставак покушаја.
Покушај је ипак заустављен захваљујући људској контроли, која је спречила уношење злонамерног кода у GitHub.
Институт истиче да модел није био посебно подстицан да вара или избегава безбедносне механизме.
Модел Sol компаније OpenAI повезан је са свега две спорне радње, док се већина пријављених инцидената односи на Mythos.
Из Anthropic-а су саопштили да услови под којима је спроведен тест нису репрезентативни за њихове моделе који су доступни корисницима и да компанија спроводи интерну истрагу како би утврдила узроке оваквог понашања.
Сличан став изнео је и OpenAI, наводећи да тест не одражава уобичајену употребу њихових система.
AISI је нагласио да је у оваквим безбедносним проверама уобичајена пракса да се модели тестирају са искљученим заштитним механизмима и омогућеним приступом отвореном интернету, како би се проценили потенцијални ризици.
Институт додаје да су спорни догађаји забележени у малом броју случајева и под специфичним условима, али је упозорио да понашање модела представља нови ниво аутономије и обмањујућих способности који захтева додатну пажњу.