Model hrozeb AI
Tradiční aplikace vykonávají předdefinované kódové cesty. AI agenti také interpretují přirozený jazyk, získávají nedůvěryhodný obsah, vybírají nástroje a generují akce. Bezpečnostní hranice proto zahrnuje každý zdroj, který může ovlivnit model, a každý systém, který může model ovlivnit.
Útoková plocha
Prozkoumejte tyto plochy pro každého produkčního agenta:
| Plocha | Typické riziko | Hlavní kontrola |
|---|---|---|
| Uživatelský prompt | Přepsání instrukcí, extrakce dat, nebezpečný požadavek | Politika vstupu, Prompt Shield, omezená oprávnění |
| Získaný dokument nebo webová stránka | Nepřímá injekce promptu, otrávené znalosti | Zacházejte s obsahem jako s daty, revize zdrojů, omezení výstupu |
| Systémový prompt a dovednosti | Nadměrná autorita nebo nejasné hranice | Řízené úpravy, revize verzí, minimální oprávnění |
| Paměť a sbírky dat | Neautorizovaný nebo zastaralý kontext | Vlastnictví, klasifikace, filtry přístupu, frekvence revize |
| Výstup modelu | Halucinace, škodlivý nebo zaujatý výsledek | Hodnocení, zakotvení, lidská revize, bezpečnost obsahu |
| Odpověď nástroje | Zlovolné instrukce nebo neočekávaná data | Ověřte výstup nástroje, izolujte ho od instrukcí |
| Provádění nástroje | Externí komunikace, mazání, výdaje, změna oprávnění | Politika na úrovni funkcí a lidské schválení |
| Poskytovatel modelu | Místo zpracování, uchovávání, dostupnost, změna modelu | Schválený inventář modelů a revize nasazení |
Minimální otázky pro modelování hrozeb
Pro každého agenta nebo pracovní postup zdokumentujte:
- Kdo ho může vyvolat a zda je možný anonymní přístup.
- Které datové sady, sbírky paměti, soubory a kontext stránky může číst.
- Které funkce nástroje může volat a které funkce mění externí stav.
- Co by mohl způsobit zlovolný uživatel nebo zlovolný dokument, aby odhalil nebo změnil.
- Které akce vyžadují lidské schválení a kdo je může schválit.
- Které události jsou zaznamenávány a jak je může vyšetřovatel korelovat.
- Které procesy nasazení modelu vyžadují prompt a kde může zpracování probíhat.
- Co se stane, když selže poskytovatel, pověření, index nebo schvalovací tok.
Spouštěč revize
Opakujte model hrozeb, když se změní přístup, nástroje, datové sady, prompty, modely, veřejné rozhraní nebo logika pracovního postupu. Dříve nízkorizikový asistent se může stát vysoce rizikovým, jakmile obdrží připojení s možností zápisu nebo citlivý zdroj dat.
Viz Injekce promptu, Správa nástrojů a Architektura vrstvené bezpečnosti.