WissensquellenBeta
Den Bot aus Ihrer Website und aus hochgeladenen Dokumenten antworten lassen
Diese Funktion ist in der Beta-Phase. Sie ist nutzbar, einzelne Details können sich aber noch ändern.
Ein Widget antwortet am besten aus Ihren eigenen Inhalten. Es hat zwei Quellen: Ihre Website, die der Einrichtungs-Assistent für Sie liest, und Dokumente, die Sie hochladen. Beide finden Sie im Bereich Wissen.
Wie der Bot sein Wissen nutzt
Ist Wissensabruf (RAG) eingeschaltet, durchsucht der Bot vor dem Antworten die Wissensbasis und stützt seine Antwort auf das, was er findet. Besucher sehen das als kurzen Schritt „Wissensdatenbank wird durchsucht“ über der Antwort, mit der Zahl der gefundenen Quellen.
Das Ein- und Ausschalten wirkt sofort, ohne Veröffentlichen. Die Wissensbasis gehört zu genau diesem Widget; kein anderes Widget und kein anderes Produkt kann sie lesen.
Dokumente hochladen
Laden Sie im Bereich Wissen PDFs, Word-Dateien und andere Dokumente hoch. Dort steht auch, wie viele Dokumente möglich sind und wie groß jedes sein darf. Jeder Upload wird im Hintergrund verarbeitet und durchläuft diese Zustände:
| Status | Bedeutung |
|---|---|
| In Warteschlange | wartet auf die Verarbeitung |
| Wird extrahiert | der Text wird aus der Datei gelesen |
| Wird verarbeitet | der Text wird für die Suche aufbereitet |
| Bereit | der Bot kann daraus antworten |
| Kein Text gefunden | die Datei enthält keinen lesbaren Text, etwa ein Scan ohne Texterkennung |
| Fehlgeschlagen | die Verarbeitung hat nicht geklappt; Dokument löschen und neu hochladen |
Für PDFs, auf die Ihre Website verlinkt, etwa Formulare und Satzungen, ist der Upload der richtige Weg: Der Website-Crawler überspringt PDFs.
Ihre Website als Quelle
Sie müssen nichts hochladen, um anzufangen. Nennen Sie dem Einrichtungs-Assistenten Ihre Website; er liest sie, zeigt Ihnen, was er gefunden hat, und nimmt die Seiten auf, die Sie auswählen.
In fünf Schritten
- Widget anlegen. Öffnen Sie Chatbot-Widgets → Neues Widget. Rechts öffnet sich der Einrichtungs-Assistent.
- Website nennen.
bocholt.degenügt,https://www.bocholt.degeht genauso. - Sehen, was er findet. Er ruft die Startseite, die
robots.txtund, falls vorhanden, die Sitemap ab und zeigt Ihnen die Seiten nach Bereichen gruppiert („Bürgerservice: 41 Seiten“, „Aktuelles: 120 Seiten“). Indexiert ist zu diesem Zeitpunkt nichts. Etwa die Hälfte aller Websites hat keine Sitemap; dann folgt der Assistent stattdessen den Links der Startseite. - Auswählen und aufnehmen lassen. Sagen Sie ihm, welche Bereiche wichtig sind, etwa „Bürgerservice und Abfall ja, Pressemitteilungen nein“. Er liest diese Seiten, legt sie in der Wissensbasis ab und sagt Ihnen, wie viele Seiten der Website damit abgedeckt sind.
- Ausprobieren. Stellen Sie im Test-Widget eine Frage, deren Antwort auf einer dieser Seiten steht.
Im Bereich Wissen sehen Sie dieselbe Website-Quelle mit allen aufgenommenen Seiten und können sie dort auch wieder entfernen.
Was gelesen werden kann
Der Crawler liest ganz normale Webseiten, so wie ein Besucher ohne JavaScript sie sähe.
| Wird gelesen | Wird übersprungen |
|---|---|
| HTML-Seiten Ihrer Website | PDFs, Word-Dateien, Bilder, Videos |
| öffentlich erreichbare Seiten | alles hinter Login, Bezahlschranke oder Formular |
| Text, Überschriften, Listen, Tabellen | Inhalte, die erst durch JavaScript im Browser entstehen |
| Seiten auf der genannten Domain | Links auf fremde Domains, auch wenn sie in Ihrer Sitemap stehen |
Lässt sich eine Seite nicht lesen, nennt der Assistent den Grund, statt sie stillschweigend zu überspringen. Die Gründe und was dagegen hilft, stehen unter Fehlerbehebung.
Wie viele Seiten
| Zustand | Höchstzahl Seiten |
|---|---|
| ohne Bestätigung der Domain | 150 |
| nach Bestätigung der Domain | 2.500 |
Das Limit ist eine Kostenbremse. Jede aufgenommene Seite wird ausgewertet, und das kostet Guthaben, bevor das Widget eine einzige Besucherfrage beantwortet hat. Eine Website mit 40.000 Seiten soll man nicht versehentlich komplett einlesen können.
Für die meisten Auftritte reichen 150 Seiten ohne Weiteres: Über 59 kommunale Websites gemessen liegt die typische Sitemap bei etwa 100 Seiten. Wichtiger als die Zahl ist ohnehin die Auswahl. Dreißig gute Seiten beantworten mehr Fragen als 2.000 Pressemitteilungen aus zehn Jahren. Um das Limit anzuheben, bestätigen Sie Ihre Domain.
Aktuell halten
Eine aufgenommene Seite ist eine Momentaufnahme. Ändert sich Ihre Website, zieht die Wissensbasis nicht von selbst nach.
Bitten Sie den Assistenten, die Seiten neu einzulesen, wenn sich inhaltlich etwas Wesentliches getan hat: neue Öffnungszeiten, neue Gebühren, ein umgebauter Bereich. Unveränderte Seiten werden erkannt und kosten beim erneuten Einlesen fast nichts. Für eine Seite, die sich täglich ändert, ist eine Wissensbasis das falsche Werkzeug.
Was das Einlesen kostet
Das Aufnehmen von Seiten und Dokumenten wird vom Guthaben Ihres Workspace abgebucht, und zwar einmal bei der Verarbeitung, nicht pro Besucherfrage. Ein üblicher Auftritt mit ein paar hundert Seiten bewegt sich im Bereich weniger Euro. Die laufenden Kosten entstehen später durch die Antworten; siehe Limits und Abrechnung.