Přeskočit na hlavní obsah

Zpracování, synchronizace a řešení potíží

Rozsah zdroje určuje, co do kolekce vstoupí. Processing určuje, jak se obsah stane prohledávatelným. Retrieval určuje, které chunky dostane agent. Výchozí hodnoty měňte pouze proti opakovatelnému evaluation setu.

JSON Features a JSON Metadata Definitions​

Když datový zdroj importuje JSON, tato dvě nastavení určují roli pojmenovaných polí:

NastaveníPraktická otázkaDoporučené použitíTypické klíče
JSON FeaturesZ jakého obsahu má AI čerpat?Významový text, který má podporovat vyhledávání a odpovědititle, description, summary, content, normalizovaný text komentářů
JSON Metadata DefinitionsPodle čeho má systém dokument poznat, zařadit nebo případně filtrovat?Stabilní identifikátory a řízené klasifikační hodnotyid, category, author, language, createdAt, customerId

Pole jsou dostupná v aktuálních formulářích pro vytvoření Manual Upload, Google Drive, OneDrive, SharePoint, Azure Storage Account a Azure File Share. Stejný klíč nevkládejte do obou seznamů bez konkrétního důvodu a retrieval testu.

Připravte JSON kontrakt​

Před konfigurací kteréhokoli seznamu shromážděte:

  • jeden až tři reprezentativní JSON objekty,
  • příklady otázek, které budou uživatelé pokládat,
  • klasifikace nebo filtry, které chtějí používat,
  • příklady vnořených, volitelných nebo strukturálně nekonzistentních objektů.

Pro features upřednostněte stručný text s obchodním významem, pro metadata stabilní a normalizované skalární hodnoty. Vynechte binární obsah, přístupové tokeny nebo podepsané URL, interní hodnoty zpracování, duplicitní text a rozsáhlé objekty bez jasného přínosu pro retrieval.

Vnořené objekty, seznamy, chybějící hodnoty a klíč, který mezi záznamy mění datový typ, vyžadují stabilní upstream kontrakt. Vnořené hodnoty zploštěte do zdokumentovaných klíčů, normalizujte data a identifikátory a užitečné seznamy nebo komentáře v případě potřeby spojte do záměrného textového pole. Nepředpokládejte, že neotestovaná vnořená cesta bude interpretována požadovaným způsobem.

Příklad konfigurace​

Uvažujte tento reprezentativní objekt:

{
"id": "policy-1042",
"title": "Password reset policy",
"summary": "Rules for resetting an employee account password.",
"content": "After a reset, the employee must create a new password and confirm multifactor authentication.",
"category": "Identity",
"author": "Security Operations",
"language": "en",
"createdAt": "2026-08-01T09:30:00Z",
"_etag": "internal-revision-value"
}

Doporučené hodnoty:

JSON Features: title, summary, content
JSON Metadata Definitions: id, category, author, language, createdAt
KlíčSeznamDůvod a očekávaný dopad
titleFeaturesPřidá předmět a terminologii dokumentu do prohledávatelného obsahu.
summaryFeaturesPoskytne stručný popis, který může zlepšit retrieval u obecných otázek.
contentFeaturesObsahuje fakta, ze kterých se mají vytvářet odpovědi.
idMetadataPoskytne stabilní identifikátor logického záznamu.
categoryMetadataKlasifikuje záznam pro kontrolu a zamýšlené filtrování podle kategorie.
authorMetadataZaznamená odpovědný zdroj nebo tým.
languageMetadataPoskytne normalizovanou jazykovou klasifikaci pro zamýšlené filtrování.
createdAtMetadataZachová seřaditelné normalizované časové razítko, pokud je RAG služba podporuje.
_etagAni jedenJde o interní hodnotu zpracování bez přínosu pro uživatelské vyhledávání.

Toto rozdělení má podporovat obsahovou otázku například „Co musí zaměstnanec udělat po resetování hesla?“ a je zamýšlené pro filtr například „Dokumenty k identitě v angličtině“. Než se na toto chování spolehnete, otestujte obojí proti nasazené RAG službě.

Ověřené chování backendu

Frontend zobrazuje obě nastavení jako opakovatelné seznamy názvů polí a před vytvořením datového zdroje odstraňuje položky, jejichž obsah tvoří pouze mezery. Aplikační backend neověřuje, že název existuje v importovaném JSON, a přijaté seznamy beze změny předává do vlastností JsonFeatures a MetadataDefinitions RAG klienta.

Aplikační backend odesílá tyto hodnoty při vytvoření datového zdroje. Samostatně je neukládá do své databáze, nevrací je v aktuálním detailu datového zdroje ani je nepřijímá přes současný update endpoint. Seznamy definujte a otestujte před vytvořením produkčního zdroje.

Chování RAG je nutné ověřit

Aplikace ani backend neurčují přesně, jak samostatná RAG služba indexuje vybrané features, aplikuje metadata filtry, vyhodnocuje vnořené cesty, zpracovává chybějící hodnoty nebo smíšené datové typy ani jak řeší klíč přítomný v obou seznamech. Výše uvedená doporučení považujte za kvalifikovaný výchozí bod. Pilotně importujte reprezentativní záznamy, zkontrolujte extrahované dokumenty a chunky a otestujte alespoň jednu obsahovou otázku a jeden zamýšlený metadata filtr.

Společná pole integračních zdrojů​

Každý připojený zdroj vyžaduje Name, volitelný Description, Connection ID a frekvenci synchronizace. Connection ID vybírá uloženou autentizaci; nikdy není polem pro secret.

Frekvence synchronizace​

FrekvencePoužití
On DemandPodepsané politiky, kontrolovaná vydání, čtvrtletní exporty
DailyProvozní dokumentace, aktivní projekty a měněné sdílené složky
WeeklyUdržované, ale neurgentní znalosti
MonthlyPomalu měněné archivy a reference

Manual Upload nemá upstream systém k synchronizaci. Vyšší frekvence není automaticky lepší: spotřebuje kapacitu poskytovatele i zpracování a dříve zpřístupní nezkontrolované změny.

Retriever settings​

Většina formulářů nabízí Skip query rewrite, Skip LLM ranking a Maximum result count (1 až 15). Query rewrite může zlepšit vybavení při konverzačních otázkách, zatímco vypnutí pomáhá přesným identifikátorům. LLM ranking může zlepšit relevanci za cenu latence. Výchozí hodnoty ponechte, dokud měření neprokáže opak.

OneDrive a Confluence aktuálně nezobrazují stejnou Retriever sekci.

Processing settings​

Podle zdroje UI nabízí filtry typů souborů, advanced extraction, JSON Features a JSON Metadata Definitions, strategii chunkingu, velikost vektoru a kvantizaci. Aktuální formuláře mají výchozí vector size 3072 a quantization None.

  • Jira a Firecrawl nenabízejí filtr typů souborů.
  • Confluence nenabízí volbu chunkingu.
  • Manual Upload aktuálně volbu chunkingu skrývá.
  • OneDrive nemá společnou Retriever sekci.

Advanced extraction může pomoci tabulkám, layoutu a obrázkům, ale musí se otestovat. Změna vektorů či chunkingu může vyžadovat nové zpracování a zneplatnit předchozí porovnání kvality.

Kontrola před produkcí​

V Overview zkontrolujte plán, počty a poslední/příští sync; ve Files dokumenty a příznaky indexed/readable; v Logs výsledky běhů; v detailu dokumentu extrahované chunky.

Otestujte známou přítomnou odpověď, známou chybějící odpověď, rozporné verze, nedávno změněnou položku a očekávanou výjimku.

Řešení potíží​

PříznakPrvní kontrola
Connection ID je prázdnéKompatibilní Connection existuje a je správně viditelné či sdílené
Úspěšný zdroj má nula souborůPravopis selektoru/cesty/klíče, oprávnění účtu, typy souborů
Chybí Google složkaFolder ID, Shared Drive/subfolder přepínače a přístup účtu
Chybí Microsoft složkaPřesná relativní cesta, drive/site/library a přístup účtu
Azure zdroj je prázdnýSelektor blobu nebo přesný share name a platnost credentials
Jira nebo Confluence je prázdnáProject/Space Key a oprávnění servisního účtu
Firecrawl obsahuje balastZúžit include regex, přidat výjimky, snížit limit
Dokument existuje, ale agent jej nepoužijeIndexed/Readable, chunky, přiřazení kolekce, retrieval settings
Plánovaný refresh se zastavilStav Connection, expirace tokenu, Logs, schedule a kvóta

Pokud chybný obsah představuje významné riziko, odpojte kolekci od produkčních agentů, zachovejte netajné diagnostické podklady, určete zda selhalo oprávnění, selektor, sync, extrakce, indexace či retrieval, opravte na testovacím agentovi a před obnovením znovu spusťte evaluation set.

Související návody​

Reference dokumentů v odpovědi​

Po úspěšném search může interní chat uchovat strukturované odkazy na vrácené Data dokumenty. Identifikují kolekci, zdroj a dokument, ale neobcházejí oprávnění ani nenahrazují důkaz o zpracování. Viz Dokumenty použité v odpovědi; sem se vraťte, pokud je odkazovaný dokument chybějící, zastaralý, nečitelný nebo se špatně vyhledává.

Pokročilá extrakce obsahu PDF​

Advanced content extraction je processing cesta určená výhradně pro PDF, jejichž význam závisí na layoutu stránky, tabulkách nebo obrázcích. Pokud je přepínač zapnutý a nalezený dokument je PDF, Siesta AI jej odešle do Azure Document Intelligence, použije model prebuilt-layout a vyžádá Markdown i data obrázků. Word, Excel, PowerPoint, JSON a textové soubory pokračují přes své standardní readery.

Nastavení Processing u Manual Upload s přepínačem Advanced content extraction

Výsledkem je layout-aware Markdown, samostatné tabulkové prvky s hlavičkou a obrázkové prvky s obrazovými daty, pokud je služba vrátí. Při chunkování se tabulky a obrázky umístí poblíž původní pozice, vytvoří se jejich textový popis a ten se vloží jako searchable chunk s embeddingem. Každý významný vizuální údaj proto ověřte proti zdrojové stránce.

Aktuální PDF cesta je implementována pro Manual Upload, Google Drive, OneDrive, SharePoint, Azure Storage Account a Azure File Share. Neobchází oprávnění poskytovatele, scope zdroje, filtry ani chyby connection.

Azure Document Intelligence se účtuje podle analyzovaných stránek. Počet se zvýší po vrácení analýzy, i když pozdější filtr, nezměněný hash, prázdný obsah nebo jiné ingestion rozhodnutí dokument přeskočí. Opakovaný sync PDF tedy může zvýšit počet stránek bez nové indexované verze. Sledujte Overview zdroje a limit analyzovaných stránek.

Funkci zapněte pro skenovaná PDF, vícesloupcové dokumenty, složité tabulky a důležité diagramy. U běžných textových PDF ji ponechte vypnutou, pokud standardní reader vytváří čistý a úplný text.

Před nasazením na velký zdroj otestujte reprezentativní textové, skenované, table-heavy a figure-heavy PDF. Ve Files ověřte stavy Indexed a Readable, zkontrolujte reading order a chunky a položte otázky vyžadující přesné tabulkové i vizuální údaje. Zaznamenejte také nárůst analyzovaných stránek.

PříznakPrvní kontrola
PDF je přeskočeno s User analyzed pages limit exceededEfektivní limit vlastníka a součet napříč všemi jeho datovými zdroji
Tabulky nebo obrázky se špatně vyhledávajíExtrahované chunky, vygenerované popisy, reading order a retrieval test
Počet stránek vzrostl bez nové indexované verzeZda analýza proběhla před pozdějším filtrem, kontrolou hashe nebo validací obsahu
Zdroj obsahuje jen soubory jiné než PDFPoužijí se standardní readery; Advanced content extraction se na ně nevztahuje
Synchronizované PDF nelze analyzovatOprávnění, selector/path, stav connection, čitelnost souboru, Logs a dostupnost Azure processingu

Vyšší storage limit neřeší vyčerpaný limit analyzovaných stránek; obě kvóty se vynucují samostatně.