Přeskočit na hlavní obsah

Vstřikování příkazů

Vstřikování příkazů se pokouší přimět AI systém, aby ignoroval své zamýšlené instrukce, odhalil chráněné informace nebo vykonal neoprávněnou akci. Je to riziko vlastní AI a musí být řešeno odděleně od běžné validace vstupů.

Přímé a Nepřímé Útoky

Přímé vstřikování příkazů je dodáváno uživatelem. Příklady zahrnují žádosti o odhalení systémových instrukcí, ignorování politik nebo použití nástroje mimo úkol.

Nepřímé vstřikování příkazů je zakomponováno v obsahu, který agent čte, jako je e-mail, webová stránka, dokument, tiket, odpověď nástroje nebo získaný znalostní blok. To je obzvlášť důležité pro agenty, protože škodlivý obsah se může pokusit vyvolat skutečnou externí akci.

Ochrana v Hloubce

Žádný jediný filtr spolehlivě neodstraňuje riziko. Kombinujte kontroly:

  • Zacházejte se získaným obsahem a výstupy nástrojů jako s nedůvěryhodnými daty, nikoli jako s instrukcemi.
  • Dejte každému agentovi pouze datové sady a funkce potřebné pro jeho účel.
  • Oddělte operace čtení, návrhu, odesílání, aktualizace, mazání, publikování a utrácení.
  • Vyžadujte potvrzení pro akce s externím, finančním, právním, povolením nebo destruktivním dopadem.
  • Uchovávejte přihlašovací údaje a tajemství mimo příkazy, paměť, nahrané soubory a výsledky nástrojů.
  • Validujte argumenty s vysokým dopadem, jako jsou příjemci, částky, ID záznamů a cílová prostředí.
  • Zaznamenávejte kontext příkazu, vybranou funkci, očištěné argumenty, schválení a výsledek.
  • Testujte se škodlivými instrukcemi v uživatelských příkazech, dokumentech, e-mailech, webových stránkách a odpovědích nástrojů.

Konfigurace Siesta AI

Povolte Prompt Shield z Organizační bezpečnosti, ale nepovažujte to za systém autorizace. Autorizace stále pochází z rolí, sdílení, přístupu k datům, vlastnictví připojení, politiky funkcí a požadavků na schválení.

Pro veřejného agenta také odstraňte soukromé zdroje a zbytečné nástroje, deaktivujte nahrávání souborů, když není vyžadováno, a ověřte, že injekce kontextu stránky nemůže odhalit autentizovaná data stránky.

Testovací Případy

Před spuštěním ověřte, že agent odmítá nebo bezpečně obsahuje pokusy o:

  1. odhalení svého systémového příkazu nebo skryté konfigurace,
  2. následování instrukcí zakomponovaných v získaném souboru,
  3. odeslání dat novému příjemci dodanému nedůvěryhodným obsahem,
  4. obejití schvalovacího kroku,
  5. přístup k datové sadě mimo oprávnění uživatele,
  6. použití zakázané funkce nástroje.

Externí odkaz: OWASP LLM01: Vstřikování příkazů.