Přeskočit na hlavní obsah

Data

Datové kolekce mění soubory a záznamy z externích systémů na opakovaně použitelné a prohledávatelné znalosti pro agenty Siesta AI. Tato sekce popisuje všechny datové zdroje dostupné v aktuální dev aplikaci a přesně vysvětluje, co patří do jednotlivých polí.

Datový model

  1. Connection uchovává přihlášení k externímu systému.
  2. Data collection je obchodní kontejner s vlastním řízením přístupu.
  3. Data source určuje, co přesně se má přes Connection importovat.
  4. Documents and chunks jsou zpracovaný obsah pro vyhledávání.
  5. Agent vyhledává v jedné nebo více přiřazených kolekcích.

Přihlašovací údaje patří do Connections. ID složek, cesty, selektory blobů, klíče projektů a prostorů a URL patří do formuláře datového zdroje.

Kde začít

CílNávod
Porovnat zdroje a rozhodnout, kam obsah patříVýběr datového zdroje
Nahrát řízený snapshot souborůRuční nahrání
Nastavit výchozí nebo individuální limit nahrávání datLimity nahrávání dat
Nastavit výchozí nebo individuální limit nahrávání datLimity nahrávání dat
Nastavit výchozí nebo individuální limit nahrávání datLimity nahrávání dat
Synchronizovat složky Google nebo Shared DrivesGoogle Drive
Synchronizovat OneDrive nebo SharePointMicrosoft 365
Číst bloby nebo Azure file sharesAzure Storage
Automatizovat řízený lokální nebo on-premises dokumentový feedAutomatizovaný příjem souborů přes Azure File Share
Importovat Jira projekty nebo Confluence prostoryAtlassian
Načíst stránku nebo omezenou část webuFirecrawl
Nastavit zpracování, vyhledávání, synchronizaci a řešit chybyZpracování, synchronizace a řešení potíží

Co je aktuálně dostupné

Dev aplikace nabízí devět typů: Manual Upload, Google Drive, OneDrive, SharePoint, Azure Storage Account, Azure File Share, Jira, Confluence a Firecrawl. Identifikátory Gmail, Outlook a Slack existují v kódu aplikace, ale nemají formulář pro vytvoření datového zdroje, a proto nejsou vydanými Data zdroji.

ZdrojNejvhodnější použitíKonfigurace v Data
Manual UploadMalé nebo testovací sady, schválené snapshoty a soubory bez živého provideraNahrajte jeden nebo více lokálních souborů
Google DriveŽivé Google složky a Shared DrivesFolder ID z URL Drive a přepínače podsložek a Shared Drive
OneDriveSoubory vlastněné nebo sdílené s jedním Microsoft uživatelemJedna nebo více relativních cest v disku
SharePointČasto měněný obsah týmového webu nebo knihovny dokumentůPřesné cesty knihovny/složek dostupné připojenému účtu
Azure Storage AccountVelké blob repozitáře a feedy publikované externími systémy nebo pipelineJeden nebo více názvů, cest či selektorů blobů
Azure File ShareVelké repozitáře z lokálních/on-premises serverů zpřístupněné přes Azure FilesJeden nebo více přesných názvů Azure file shares
JiraAktuální issues z jednoho projektuJeden Jira Project Key, například SUP
ConfluenceUdržované stránky jednoho knowledge-base prostoruJeden Confluence Space Key, například HELP
FirecrawlVeřejný nebo schválený web bez nativního zdrojeVýchozí URL, režim Scrape/Crawl, limit a volitelné regexy cest

Pro Google Drive URL https://drive.google.com/drive/folders/1AbCDefGh zadejte jako Folder ID pouze 1AbCDefGh. Přihlašovací údaje a tajné hodnoty vždy patří do Connections, nikoli do těchto polí v Data.

Pro automatickou synchronizaci interního repozitáře použijte Azure File Share ingestion vzor. Odděluje lokální uploader od čtečky Siesta AI a definuje výběr, metadata, aktualizace, mazání a pilotní testy.

Kdy použít Data

Kolekci použijte, když má stejný schválený obsah opakovaně využívat více uživatelů či agentů, má se synchronizovat, potřebujete kontrolovat zpracování a logy nebo vyžadujete hranici přístupu pro soukromý obsah, tým či celou organizaci.

Pro jeden dočasný soubor je jednodušší příloha v chatu. Pro trvalé znalosti použijte kolekci.

Vytvoření kolekce

Otevřete Data a zvolte Create collection.

  • Name: trvalý obchodní název, například Customer Support — Approved Knowledge.
  • Description: rozsah, vlastník, výjimky a zamýšlení agenti.
  • Access: Private, Entire organization nebo konkrétní týmy.

Kolekce je hranice přístupu. Nemíchejte důvěrné HR dokumenty s veřejnou produktovou dokumentací jen proto, že jsou oba zdroje na Google Drive.

Dialog pro vytvoření kolekce

Přidání datového zdroje

Otevřete kolekci a vyberte Add data source. Manual Upload nepotřebuje Connection. Každý integrační zdroj nejprve vyžaduje odpovídající položku v Connections.

Společná pole jsou Name, volitelný Description, Connection ID a Sync frequency (On Demand, Daily, Weekly nebo Monthly). Pokud je Connection ID prázdné, vytvořte nebo si vyžádejte správné Connection. Tajný údaj do tohoto výběru nikdy nevkládejte.

Dostupné typy datových zdrojů

Kontrola před použitím agentem

Zkontrolujte stav zdroje, reprezentativní soubory, příznaky Indexed a Readable, extrahované chunky a Logs. Úspěšný běh potvrzuje dokončení zpracování, nikoli správnost, úplnost, aktuálnost nebo bezpečnost obsahu.

Související návody