Přeskočit na hlavní obsah

Model hrozeb AI

Tradiční aplikace vykonávají předdefinované kódové cesty. AI agenti také interpretují přirozený jazyk, získávají nedůvěryhodný obsah, vybírají nástroje a generují akce. Bezpečnostní hranice proto zahrnuje každý zdroj, který může ovlivnit model, a každý systém, který může model ovlivnit.

Útoková plocha

Prozkoumejte tyto plochy pro každého produkčního agenta:

PlochaTypické rizikoHlavní kontrola
Uživatelský promptPřepsání instrukcí, extrakce dat, nebezpečný požadavekPolitika vstupu, Prompt Shield, omezená oprávnění
Získaný dokument nebo webová stránkaNepřímá injekce promptu, otrávené znalostiZacházejte s obsahem jako s daty, revize zdrojů, omezení výstupu
Systémový prompt a dovednostiNadměrná autorita nebo nejasné hraniceŘízené úpravy, revize verzí, minimální oprávnění
Paměť a sbírky datNeautorizovaný nebo zastaralý kontextVlastnictví, klasifikace, filtry přístupu, frekvence revize
Výstup modeluHalucinace, škodlivý nebo zaujatý výsledekHodnocení, zakotvení, lidská revize, bezpečnost obsahu
Odpověď nástrojeZlovolné instrukce nebo neočekávaná dataOvěřte výstup nástroje, izolujte ho od instrukcí
Provádění nástrojeExterní komunikace, mazání, výdaje, změna oprávněníPolitika na úrovni funkcí a lidské schválení
Poskytovatel modeluMísto zpracování, uchovávání, dostupnost, změna modeluSchválený inventář modelů a revize nasazení

Minimální otázky pro modelování hrozeb

Pro každého agenta nebo pracovní postup zdokumentujte:

  1. Kdo ho může vyvolat a zda je možný anonymní přístup.
  2. Které datové sady, sbírky paměti, soubory a kontext stránky může číst.
  3. Které funkce nástroje může volat a které funkce mění externí stav.
  4. Co by mohl způsobit zlovolný uživatel nebo zlovolný dokument, aby odhalil nebo změnil.
  5. Které akce vyžadují lidské schválení a kdo je může schválit.
  6. Které události jsou zaznamenávány a jak je může vyšetřovatel korelovat.
  7. Které procesy nasazení modelu vyžadují prompt a kde může zpracování probíhat.
  8. Co se stane, když selže poskytovatel, pověření, index nebo schvalovací tok.

Spouštěč revize

Opakujte model hrozeb, když se změní přístup, nástroje, datové sady, prompty, modely, veřejné rozhraní nebo logika pracovního postupu. Dříve nízkorizikový asistent se může stát vysoce rizikovým, jakmile obdrží připojení s možností zápisu nebo citlivý zdroj dat.

Viz Injekce promptu, Správa nástrojů a Architektura vrstvené bezpečnosti.