#
Datenimport
Über die Endpunkte unter /corpora, /documents, /chunks und /data-imports verwalten Sie programmatisch dieselbe
Datenbasis, die Sie im aiStudio unter
Datenimport
einsehen und pflegen. Damit können
Sie z. B. eigene Inhalte ohne Crawling oder Datei-Upload direkt anlegen, bestehende Einträge pflegen oder eigene
Import-Pipelines an die Kauz-Plattform anbinden.
Voraussetzungen für alle Anfragen (Basis-URL, Authorization- und kauz-chatbot-Header) finden Sie im
Überblick
.
#
Hierarchie: Korpus, Dokument, Chunk
Ein Korpus kann aus mehreren Dokumenten bestehen – bei einer Website sind dies die einzelnen Unterseiten, bei einer PDF-Sammlung die einzelnen PDF-Dateien. Ein Dokument wiederum besteht aus mehreren Chunks: den Textabschnitten, für die Embeddings berechnet werden und die für die Beantwortung von Fragen herangezogen werden. Die ausführliche Erklärung dieses Modells aus Sicht der aiStudio-Oberfläche finden Sie unter Datenbasis erstellen .
#
source-Werte eines Korpus
Der Wert source beschreibt die Herkunft eines Korpus. Beim Filtern (GET /corpora) sind alle folgenden Werte gültig:
chat, cms, email, file, legacyfactsheet, manual, sharepoint, website
Beim direkten Anlegen (POST /corpora) ist legacyfactsheet nicht wählbar – dieser Wert kennzeichnet ausschließlich
historisch migrierte Korpora.
Um Dateien per
URL-Datei-Import
in ein bestehendes Korpus zu
extrahieren, muss dessen source den Wert file haben.
#
ignore und prefer
#
Pagination
GET /corpora, GET /documents und GET /chunks unterstützen dieselben Parameter:
Die Antwort enthält neben der jeweiligen Ergebnisliste (corpora, documents bzw. chunks) stets total (Gesamtzahl
der Treffer, unabhängig von limit/offset), limit und offset.