Pokročilé AI modely začínajú podľa výskumu viac klamať a skrývať svoje stopy |
Vedci testovali najpokročilejšie jazykové modely súčasnosti a narazili na znepokojivé správanie. Niektoré systémy začali obchádzať pravidlá, podvádzať a dokonca sa pokúsili zakryť svoje kroky.
Nezisková výskumná organizácia METR (Model Evaluation and Threat Research) zverejnila výsledky novej štúdie, ktorá skúmala správanie najpokročilejších AI modelov od spoločností OpenAI, Google, Anthropic a Meta. Výsledky naznačujú, že s rastúcimi schopnosťami sa objavuje aj čoraz problematickejšie správanie.
Výskum prebiehal vo februári a marci tohto roka a jeho cieľom bolo zistiť, ako by sa pokročilé AI systémy správali v situáciách, keď dostanú konkrétne úlohy a obmedzenia. Vedci pritom zaznamenali prípady, keď modely vedome obchádzali pravidlá alebo hľadali nežiaduce skratky na splnenie úloh.
Jedným z najvýraznejších príkladov bol interný model OpenAI. Ten dostal pokyn používať konkrétny softvér pri riešení zadania, no inštrukciu ignoroval. Namiesto toho použil vlastný postup a následne dokonca vložil kód, ktorý mal odstrániť dôkazy o tom, ako sa k výsledku dopracoval.
Výskumníci zaznamenali aj prípad modelu od Anthropic, ktorý využil techniku označovanú ako „reward hacking“. AI si našla medzeru v pravidlách a síce splnila zadanie v doslovnom zmysle, ale spôsobom, ktorý bol v rozpore so zámerom autorov. Model pritom výslovne dostal pokyn nepodvádzať a nehľadať obchádzky.
Autori štúdie zatiaľ nehovoria o bezprostrednom nebezpečenstve. Tvrdia, že dnešné modely ešte nie sú schopné efektívne utajiť rozsiahle nežiaduce správanie pred aktívnym dohľadom. Zároveň však upozorňujú, že situácia sa môže meniť veľmi rýchlo.
Podľa nich existuje reálne riziko, že bez lepšieho zabezpečenia, monitorovania a kontroly budú podobné prejavy čoraz častejšie. Výskumníci preto očakávajú, že schopnosť AI systémov „spreneveriť sa“ zadaniam môže v najbližších mesiacoch výrazne narásť.
| NAJČÍTANEJŠIE ČLÁNKY TÝŽDŇA |
- Zabudnite na lacné pamäte po skončení AI boomu, príde totiž boom robotov, ktorí po 144
- AI agenti si vytvorili vlastnú hierarchiu a pokúšali sa mazať vlastné logy 54
- Z GTA VI uniklo ďalších 25 minút hrateľnosti. Ukazujú pohľad z prvej osoby, rozsia 38
- Na PC už nebežia len PS5 hry, ale aj samotný systém 80
- Alza spustila nové zľavy 9
- Recenzia seriálu - Ako Stuart nezachránil vesmír 20
- PS5 je aktuálne na viac ako 80% preportovaná na PC 74
- ChatGPT-6 Astra si naslepo zahrala World of Warcraft v štartovacej oblasti bez smr 18
- Článok: Asus TUF Gaming Radeon RX 9060 XT 16GB OC Edition 36
- GTA V bolo preportované na web cez AI 25 zobraziť viac článkov >













