Vstřikování příkazů
Vstřikování příkazů se pokouší přimět AI systém, aby ignoroval své zamýšlené instrukce, odhalil chráněné informace nebo vykonal neoprávněnou akci. Je to riziko vlastní AI a musí být řešeno odděleně od běžné validace vstupů.
Přímé a Nepřímé Útoky
Přímé vstřikování příkazů je dodáváno uživatelem. Příklady zahrnují žádosti o odhalení systémových instrukcí, ignorování politik nebo použití nástroje mimo úkol.
Nepřímé vstřikování příkazů je zakomponováno v obsahu, který agent čte, jako je e-mail, webová stránka, dokument, tiket, odpověď nástroje nebo získaný znalostní blok. To je obzvlášť důležité pro agenty, protože škodlivý obsah se může pokusit vyvolat skutečnou externí akci.
Ochrana v Hloubce
Žádný jediný filtr spolehlivě neodstraňuje riziko. Kombinujte kontroly:
- Zacházejte se získaným obsahem a výstupy nástrojů jako s nedůvěryhodnými daty, nikoli jako s instrukcemi.
- Dejte každému agentovi pouze datové sady a funkce potřebné pro jeho účel.
- Oddělte operace čtení, návrhu, odesílání, aktualizace, mazání, publikování a utrácení.
- Vyžadujte potvrzení pro akce s externím, finančním, právním, povolením nebo destruktivním dopadem.
- Uchovávejte přihlašovací údaje a tajemství mimo příkazy, paměť, nahrané soubory a výsledky nástrojů.
- Validujte argumenty s vysokým dopadem, jako jsou příjemci, částky, ID záznamů a cílová prostředí.
- Zaznamenávejte kontext příkazu, vybranou funkci, očištěné argumenty, schválení a výsledek.
- Testujte se škodlivými instrukcemi v uživatelských příkazech, dokumentech, e-mailech, webových stránkách a odpovědích nástrojů.
Konfigurace Siesta AI
Povolte Prompt Shield z Organizační bezpečnosti, ale nepovažujte to za systém autorizace. Autorizace stále pochází z rolí, sdílení, přístupu k datům, vlastnictví připojení, politiky funkcí a požadavků na schválení.
Pro veřejného agenta také odstraňte soukromé zdroje a zbytečné nástroje, deaktivujte nahrávání souborů, když není vyžadováno, a ověřte, že injekce kontextu stránky nemůže odhalit autentizovaná data stránky.
Testovací Případy
Před spuštěním ověřte, že agent odmítá nebo bezpečně obsahuje pokusy o:
- odhalení svého systémového příkazu nebo skryté konfigurace,
- následování instrukcí zakomponovaných v získaném souboru,
- odeslání dat novému příjemci dodanému nedůvěryhodným obsahem,
- obejití schvalovacího kroku,
- přístup k datové sadě mimo oprávnění uživatele,
- použití zakázané funkce nástroje.
Externí odkaz: OWASP LLM01: Vstřikování příkazů.