Přeskočit na hlavní obsah

Data

Datové kolekce mění soubory a záznamy z externích systémů na opakovaně použitelné a prohledávatelné znalosti pro agenty Siesta AI. Tato sekce popisuje všechny datové zdroje dostupné v aktuální dev aplikaci a přesně vysvětluje, co patří do jednotlivých polí.

Datový model​

  1. Connection uchovává přihlášení k externímu systému.
  2. Data collection je obchodní kontejner s vlastním řízením přístupu.
  3. Data source určuje, co přesně se má přes Connection importovat.
  4. Documents and chunks jsou zpracovaný obsah pro vyhledávání.
  5. Agent vyhledává v jedné nebo více přiřazených kolekcích.

Přihlašovací údaje patří do Connections. ID složek, cesty, selektory blobů, klíče projektů a prostorů a URL patří do formuláře datového zdroje.

Kde začít​

CílNávod
Porovnat zdroje a rozhodnout, kam obsah patříVýběr datového zdroje
Nahrát řízený snapshot souborůRuční nahrání
Nastavit výchozí nebo individuální limit nahrávání datLimity nahrávání dat
Nastavit výchozí nebo individuální limit nahrávání datLimity nahrávání dat
Nastavit výchozí nebo individuální limit nahrávání datLimity nahrávání dat
Synchronizovat složky Google nebo Shared DrivesGoogle Drive
Synchronizovat OneDrive nebo SharePointMicrosoft 365
Číst bloby nebo Azure file sharesAzure Storage
Automatizovat řízený lokální nebo on-premises dokumentový feedAutomatizovaný příjem souborů přes Azure File Share
Importovat Jira projekty nebo Confluence prostoryAtlassian
Načíst stránku nebo omezenou část webuFirecrawl
Nastavit zpracování, vyhledávání, synchronizaci a řešit chybyZpracování, synchronizace a řešení potíží

Co je aktuálně dostupné​

Dev aplikace nabízí devět typů: Manual Upload, Google Drive, OneDrive, SharePoint, Azure Storage Account, Azure File Share, Jira, Confluence a Firecrawl. Identifikátory Gmail, Outlook a Slack existují v kódu aplikace, ale nemají formulář pro vytvoření datového zdroje, a proto nejsou vydanými Data zdroji.

ZdrojNejvhodnější použitíKonfigurace v Data
Manual UploadMalé nebo testovací sady, schválené snapshoty a soubory bez živého provideraNahrajte jeden nebo více lokálních souborů
Google DriveŽivé Google složky a Shared DrivesFolder ID z URL Drive a přepínače podsložek a Shared Drive
OneDriveSoubory vlastněné nebo sdílené s jedním Microsoft uživatelemJedna nebo více relativních cest v disku
SharePointČasto měněný obsah týmového webu nebo knihovny dokumentůPřesné cesty knihovny/složek dostupné připojenému účtu
Azure Storage AccountVelké blob repozitáře a feedy publikované externími systémy nebo pipelineJeden nebo více názvů, cest či selektorů blobů
Azure File ShareVelké repozitáře z lokálních/on-premises serverů zpřístupněné přes Azure FilesJeden nebo více přesných názvů Azure file shares
JiraAktuální issues z jednoho projektuJeden Jira Project Key, například SUP
ConfluenceUdržované stránky jednoho knowledge-base prostoruJeden Confluence Space Key, například HELP
FirecrawlVeřejný nebo schválený web bez nativního zdrojeVýchozí URL, režim Scrape/Crawl, limit a volitelné regexy cest

Pro Google Drive URL https://drive.google.com/drive/folders/1AbCDefGh zadejte jako Folder ID pouze 1AbCDefGh. Přihlašovací údaje a tajné hodnoty vždy patří do Connections, nikoli do těchto polí v Data.

Pro automatickou synchronizaci interního repozitáře použijte Azure File Share ingestion vzor. Odděluje lokální uploader od čtečky Siesta AI a definuje výběr, metadata, aktualizace, mazání a pilotní testy.

Kdy použít Data​

Kolekci použijte, když má stejný schválený obsah opakovaně využívat více uživatelů či agentů, má se synchronizovat, potřebujete kontrolovat zpracování a logy nebo vyžadujete hranici přístupu pro soukromý obsah, tým či celou organizaci.

Pro jeden dočasný soubor je jednodušší příloha v chatu. Pro trvalé znalosti použijte kolekci.

Vytvoření kolekce​

Otevřete Data a zvolte Create collection.

  • Name: trvalý obchodní název, například Customer Support — Approved Knowledge.
  • Description: rozsah, vlastník, výjimky a zamýšlení agenti.
  • Access: Private, Entire organization nebo konkrétní týmy.

Kolekce je hranice přístupu. Nemíchejte důvěrné HR dokumenty s veřejnou produktovou dokumentací jen proto, že jsou oba zdroje na Google Drive.

Dialog pro vytvoření kolekce

Přidání datového zdroje​

Otevřete kolekci a vyberte Add data source. Manual Upload nepotřebuje Connection. Každý integrační zdroj nejprve vyžaduje odpovídající položku v Connections.

Společná pole jsou Name, volitelný Description, Connection ID a Sync frequency (On Demand, Daily, Weekly nebo Monthly). Pokud je Connection ID prázdné, vytvořte nebo si vyžádejte správné Connection. Tajný údaj do tohoto výběru nikdy nevkládejte.

Dostupné typy datových zdrojů

Kontrola před použitím agentem​

Zkontrolujte stav zdroje, reprezentativní soubory, příznaky Indexed a Readable, extrahované chunky a Logs. Úspěšný běh potvrzuje dokončení zpracování, nikoli správnost, úplnost, aktuálnost nebo bezpečnost obsahu.

Související návody​

Diagnostika pomocí Analytics​

Pro přehled celého organizačního inventáře otevřete Analytics > Data. Může odhalit nečekaně malou kolekci, chybějící typ zdroje, dominantní zdroj nebo neobvyklou skladbu souborů. RAG Data Ingested Over Time by User chápejte jako aktuální indexovaný objem seskupený podle data prvního objevení a autora zdroje, nikoli jako počet synchronizačních běhů nebo reprocessovaných bajtů. Podrobnosti ověřte v kolekci, stavech dokumentů a Logs.

Ukládání zdrojových souborů​

Store source files určuje, zda Siesta AI kromě reprezentací potřebných pro retrieval uchová také kopii každého původního vzdáleného souboru. Volba se nastavuje při vytvoření zdroje.

ZdrojChování při vytvoření
Manual UploadPůvodní nahrané soubory se ukládají vždy; volitelný přepínač se nezobrazuje.
Google DriveVolitelný přepínač v části Processing, ve výchozím stavu vypnutý.
OneDriveVolitelný přepínač v části Processing, ve výchozím stavu vypnutý.
SharePointVolitelný přepínač v části Processing, ve výchozím stavu vypnutý.
Azure File ShareVolitelný přepínač v části Processing, ve výchozím stavu vypnutý.
Azure Storage AccountVolitelný přepínač v části Processing, ve výchozím stavu vypnutý.

Původní binární soubor, extrahovaný text s metadaty a searchable chunky/index jsou tři odlišné reprezentace. Vypnutí volby u vzdáleného zdroje nebrání discovery, parsování, chunkování, embeddingu ani indexaci podporovaného obsahu; pouze se nepožaduje samostatná uložená kopie originálu. Zapnutí proto přidává storage originálních binárních souborů nad zpracovanou retrieval reprezentaci.

V Overview se u nemanuálního zdroje vytvořeného se zapnutou volbou zobrazí Source files stored. Badge potvrzuje konfiguraci, nikoli úspěšné zpracování každého dokumentu; to ověřte ve Files, stavech a Logs.

Pokud vytvoření selže po založení předběžného záznamu, služba naplánuje smazání odpovídajícího RAG zdroje a vrátí předběžný záznam zpět. Jde o cleanup neúspěšného vytvoření, nikoli zveřejněný retenční plán. Z dokumentace proto neodvozujte dobu uchování úspěšných originálů ani chování po vzdáleném smazání.

Volbu zapněte, pokud je vyžadován původní binární soubor nebo nezávislost reprocessingu na dostupnosti poskytovatele. Vypnutou ji ponechte, pokud stačí retrieval a kopie velkého vzdáleného korpusu by přidala zbytečný storage, governance nebo residency dopad. Protože je nastavení součástí vytvoření zdroje, potvrďte je před založením velkého zdroje.