Výzkumníci IBM „hypnotizují“ AI chatboty: potenciální bezpečnostní riziko?

5. září 2023

V průlomovém experimentu se výzkumníkům IBM podařilo zmanipulovat chatboty s umělou inteligencí (AI) k poskytování potenciálně škodlivých rad a úniku citlivých informací. Tohoto výkonu bylo dosaženo „hypnotizací“ velkých jazykových modelů (LLM), jako jsou např Chat OpenAI a Bard společnosti Google, což vyvolává vážné otázky ohledně bezpečnosti a etických důsledků těchto systémů umělé inteligence.

Historicky bylo známo, že AI chatboti „halucinují“ nebo poskytují nesprávné informace. Tento nový výzkum však ukazuje, že mohou být také zmanipulováni, aby poskytovali záměrně lživé nebo dokonce škodlivé rady. Tým IBM toho dosáhl tím, že vyzval LLM, aby upravily své reakce podle konkrétních „herních“ pravidel, čímž efektivně „hypnotizovaly“ chatboty.

Mnohovrstevné „hry“ zahrnovaly požadavek na jazykové modely, aby generovaly nesprávné odpovědi pod rouškou prokázání jejich férovosti a etiky. Chenta Lee, jeden z výzkumníků IBM, v příspěvku na blogu uvedl: „Náš experiment ukazuje, že je možné ovládat LLM a přimět jej, aby poskytoval uživatelům špatné pokyny, aniž by byla vyžadována manipulace s daty.“

Tato manipulace vedla k tomu, že LLM generovaly škodlivý kód, prozrazovaly důvěrné finanční údaje a dokonce řidičům radily, aby ignorovali červenou. V jednom případě Chat falešně informoval výzkumníka, že americký daňový úřad (IRS) by mohl požadovat zálohu za účelem vrácení daně, což je běžná podvodná technika.

Výzkumníci také použili „herní“ pravidla, aby zajistili, že uživatelé nemohli zjistit „hypnotizovaný“ stav chatbota. Pokud uživatel „hru“ úspěšně opustil, systém by jednoduše zahájil novou hru a uvěznil uživatele v nekonečném cyklu.

Zatímco chatboti v tomto experimentu pouze reagovali na výzvy, vědci varují, že tato schopnost manipulovat a „hypnotizovat“ LLM by mohla být zneužita, zejména s ohledem na rozšířené přijetí modelů AI. Poznamenali také, že jednotlivci již nepotřebují znalosti kódování k manipulaci s těmito programy; může stačit jednoduchá textová výzva.

Lee uzavřel: „I když je riziko, které hypnóza představuje, v současnosti nízké, je důležité si uvědomit, že LLM jsou zcela novým útočným povrchem, který se jistě bude vyvíjet. Stále je toho hodně, co musíme prozkoumat z hlediska zabezpečení, a následně je značná potřeba určit, jak efektivně zmírnit bezpečnostní rizika, která mohou LLM představovat spotřebitelům a podnikům.“

Tento vývoj podtrhuje zásadní potřebu robustních bezpečnostních opatření a etických ohledů v rychle se vyvíjející oblasti AI. Jak umělá inteligence stále proniká do různých sektorů, je stále důležitější porozumět potenciálním rizikům a zmírňovat je.