AI modely od OpenAI a Anthropic pri testoch útočili na skutočných ľudí |
Vo väčšine prípadov išlo o model firmy Anthropic.
Britský AI Security Institute zverejnil incident, pri ktorom sa AI agenti od OpenAI a Anthropicu počas kyberbezpečnostných testov dostali cez plánované hranice. V tomto prípade nešlo o bežné používanie chatbotov, ale o špeciálne testy v kontrolovanom prostredí, kde mali modely povolený prístup na internet a vypnuté niektoré bezpečnostné filtre. Cieľom tak bolo zistiť, čo dokážu pri riešení simulovaných hackerských úloh.
Umelá inteligencia klamala skutočného vývojára
AISI testoval sedem modelov v 122 behoch. V desiatich prípadoch agenti vykonali nepovolené kroky na internete a spolu ich bolo 19. Z nich 17 pripísal AISI modelu Anthropic Claude Mythos 5, zvyšné dva sa týkali OpenAI GPT-5.6 Sol s vypnutými kyberbezpečnostnými filtrami. Avšak ten najvážnejší prípad zahŕňal pokus vložiť škodlivý kód do skutočného open-source projektu na GitHube. V praxi si agent vytvoril falošné identity, skúšal presvedčiť správcu projektu, aby zmenu schválil.
Dôležité ale je, že pokus nebol úspešný a AISI nenašiel dôkaz o reálnej škode. Ľudský správca škodlivý návrh odmietol a GitHub taktiež pomohol pri odstránení stôp, ktoré agent zanechal. AISI však zdôrazňuje, že prvýkrát videl takúto úroveň autonómneho a klamlivého správania namierenú proti skutočným ľuďom bez toho, aby model dostal priamy pokyn niekoho oklamať.
Útočil aj model od OpenAI
Iný incident sa týkal testov firmy Irregular s modelmi OpenAI. Tie mali riešiť izolovanú CTF úlohu, ale kvôli zlej konfigurácii získali prístup na verejný internet. Keďže fiktívny cieľ mal rovnaký názov ako reálna doména, model zaútočil na skutočný web a použil prihlasovacie údaje, ktoré našiel. OpenAI tvrdí, že nešlo o únik zo sandboxu, ale o výsledok chybne nastavenej testovacej infraštruktúry.
Teraz je teda samozrejmé, že pri testovaní silných AI agentov už nestačí veriť, že zostanú hrať iba podľa vymedzených pravidiel. Ak majú internet, nástroje a cieľ, môžu hľadať cesty, nad ktorými sa vývojári ani len nezamýšľali. AISI aj kvôli tomu upravuje pravidlá. Chce totižto jemnejšie obmedziť internetový prístup, zaviesť real-time monitoring a pri podobných testoch vopred počítať s tým, že model sa môže pokúsiť konať mimo zadania.
| NAJČÍTANEJŠIE ČLÁNKY TÝŽDŇA |
- Sony prvýkrát reagovalo na kritiku hráčov, od konca retailových hier však neustúpi 258
- AI firmy vo veľkom skupujú a ničia knihy, chcú lepšie modely aj náskok pred konkur 99
- Múmia 4 potvrdila návrat Beniho a Ardetha Baya 27
- V EÚ začali platiť nové pravidlá práva na opravu, výrobcovia musia pomôcť aj po zá 49
- Spider-Man: Brand New Day podľa odhadov otvoril na 927 miliónoch dolárov 43
- 10 hier, ktoré posunuli hranie vpred 28
- Xbox konzoly už zvýšili ceny 73
- Spider-Man Nový deň - filmová recenzia 11
- Čínska FPS The Defiant ukazuje druhú svetovú vojnu z netradičného pohľadu 16
- RECENZIA: SENARA: The Sacrament 3 zobraziť viac článkov >













