Zum Inhalt springen
DeutschlandGPT

WissensquellenBeta

Den Bot aus Ihrer Website und aus hochgeladenen Dokumenten antworten lassen

Diese Funktion ist in der Beta-Phase. Sie ist nutzbar, einzelne Details können sich aber noch ändern.

Ein Widget antwortet am besten aus Ihren eigenen Inhalten. Es hat zwei Quellen: Ihre Website, die der Einrichtungs-Assistent für Sie liest, und Dokumente, die Sie hochladen. Beide finden Sie im Bereich Wissen.

Wie der Bot sein Wissen nutzt

Ist Wissensabruf (RAG) eingeschaltet, durchsucht der Bot vor dem Antworten die Wissensbasis und stützt seine Antwort auf das, was er findet. Besucher sehen das als kurzen Schritt „Wissensdatenbank wird durchsucht“ über der Antwort, mit der Zahl der gefundenen Quellen.

Das Ein- und Ausschalten wirkt sofort, ohne Veröffentlichen. Die Wissensbasis gehört zu genau diesem Widget; kein anderes Widget und kein anderes Produkt kann sie lesen.

Dokumente hochladen

Laden Sie im Bereich Wissen PDFs, Word-Dateien und andere Dokumente hoch. Dort steht auch, wie viele Dokumente möglich sind und wie groß jedes sein darf. Jeder Upload wird im Hintergrund verarbeitet und durchläuft diese Zustände:

StatusBedeutung
In Warteschlangewartet auf die Verarbeitung
Wird extrahiertder Text wird aus der Datei gelesen
Wird verarbeitetder Text wird für die Suche aufbereitet
Bereitder Bot kann daraus antworten
Kein Text gefundendie Datei enthält keinen lesbaren Text, etwa ein Scan ohne Texterkennung
Fehlgeschlagendie Verarbeitung hat nicht geklappt; Dokument löschen und neu hochladen

Für PDFs, auf die Ihre Website verlinkt, etwa Formulare und Satzungen, ist der Upload der richtige Weg: Der Website-Crawler überspringt PDFs.

Ihre Website als Quelle

Sie müssen nichts hochladen, um anzufangen. Nennen Sie dem Einrichtungs-Assistenten Ihre Website; er liest sie, zeigt Ihnen, was er gefunden hat, und nimmt die Seiten auf, die Sie auswählen.

In fünf Schritten

  1. Widget anlegen. Öffnen Sie Chatbot-Widgets → Neues Widget. Rechts öffnet sich der Einrichtungs-Assistent.
  2. Website nennen. bocholt.de genügt, https://www.bocholt.de geht genauso.
  3. Sehen, was er findet. Er ruft die Startseite, die robots.txt und, falls vorhanden, die Sitemap ab und zeigt Ihnen die Seiten nach Bereichen gruppiert („Bürgerservice: 41 Seiten“, „Aktuelles: 120 Seiten“). Indexiert ist zu diesem Zeitpunkt nichts. Etwa die Hälfte aller Websites hat keine Sitemap; dann folgt der Assistent stattdessen den Links der Startseite.
  4. Auswählen und aufnehmen lassen. Sagen Sie ihm, welche Bereiche wichtig sind, etwa „Bürgerservice und Abfall ja, Pressemitteilungen nein“. Er liest diese Seiten, legt sie in der Wissensbasis ab und sagt Ihnen, wie viele Seiten der Website damit abgedeckt sind.
  5. Ausprobieren. Stellen Sie im Test-Widget eine Frage, deren Antwort auf einer dieser Seiten steht.

Im Bereich Wissen sehen Sie dieselbe Website-Quelle mit allen aufgenommenen Seiten und können sie dort auch wieder entfernen.

Was gelesen werden kann

Der Crawler liest ganz normale Webseiten, so wie ein Besucher ohne JavaScript sie sähe.

Wird gelesenWird übersprungen
HTML-Seiten Ihrer WebsitePDFs, Word-Dateien, Bilder, Videos
öffentlich erreichbare Seitenalles hinter Login, Bezahlschranke oder Formular
Text, Überschriften, Listen, TabellenInhalte, die erst durch JavaScript im Browser entstehen
Seiten auf der genannten DomainLinks auf fremde Domains, auch wenn sie in Ihrer Sitemap stehen

Lässt sich eine Seite nicht lesen, nennt der Assistent den Grund, statt sie stillschweigend zu überspringen. Die Gründe und was dagegen hilft, stehen unter Fehlerbehebung.

Wie viele Seiten

ZustandHöchstzahl Seiten
ohne Bestätigung der Domain150
nach Bestätigung der Domain2.500

Das Limit ist eine Kostenbremse. Jede aufgenommene Seite wird ausgewertet, und das kostet Guthaben, bevor das Widget eine einzige Besucherfrage beantwortet hat. Eine Website mit 40.000 Seiten soll man nicht versehentlich komplett einlesen können.

Für die meisten Auftritte reichen 150 Seiten ohne Weiteres: Über 59 kommunale Websites gemessen liegt die typische Sitemap bei etwa 100 Seiten. Wichtiger als die Zahl ist ohnehin die Auswahl. Dreißig gute Seiten beantworten mehr Fragen als 2.000 Pressemitteilungen aus zehn Jahren. Um das Limit anzuheben, bestätigen Sie Ihre Domain.

Aktuell halten

Eine aufgenommene Seite ist eine Momentaufnahme. Ändert sich Ihre Website, zieht die Wissensbasis nicht von selbst nach.

Bitten Sie den Assistenten, die Seiten neu einzulesen, wenn sich inhaltlich etwas Wesentliches getan hat: neue Öffnungszeiten, neue Gebühren, ein umgebauter Bereich. Unveränderte Seiten werden erkannt und kosten beim erneuten Einlesen fast nichts. Für eine Seite, die sich täglich ändert, ist eine Wissensbasis das falsche Werkzeug.

Was das Einlesen kostet

Das Aufnehmen von Seiten und Dokumenten wird vom Guthaben Ihres Workspace abgebucht, und zwar einmal bei der Verarbeitung, nicht pro Besucherfrage. Ein üblicher Auftritt mit ein paar hundert Seiten bewegt sich im Bereich weniger Euro. Die laufenden Kosten entstehen später durch die Antworten; siehe Limits und Abrechnung.

War diese Seite hilfreich?