robots.txt und Domain-BestätigungBeta
Woran sich der Widget-Crawler hält, und wie eine bestätigte Domain das Seitenlimit anhebt und die robots.txt übergehen lässt
Diese Funktion ist in der Beta-Phase. Sie ist nutzbar, einzelne Details können sich aber noch ändern.
Der Crawler, der Ihre Website für die Wissensbasis liest, benimmt sich wie ein höflicher Gast. Wenn Sie bestätigen, dass die Website Ihnen gehört, darf er mehr.
Wir halten uns an Ihre robots.txt
Unser Crawler meldet sich als DeutschlandGPT-Widget-Bot und befolgt die robots.txt Ihrer Website. Er ruft eine Seite nach der anderen ab, mit einer halben Sekunde Pause. So sieht ein Widget-Crawl für einen kleinen Server nie wie ein Lasttest aus.
Werden Seiten wegen der robots.txt übersprungen, sagt Ihnen der Assistent das und nennt den Grund. Das ist oft überraschend: Viele Websites sperren Crawler pauschal aus, ohne dass jemand das bewusst entschieden hat. Kommunale Websites sperren KI-Crawler zudem oft namentlich. Diese Regel zielt auf Fremde, die Trainingsdaten sammeln, nicht auf Sie beim Lesen Ihrer eigenen Website. Sie haben zwei Möglichkeiten:
- Die
robots.txtIhrer Website anpassen. Das ist die saubere Lösung und gilt dann für alle Crawler. - Ihre Domain bestätigen und die
robots.txtfür diesen Bot gezielt übergehen. Das geht nur für Websites, die Ihnen nachweislich gehören.
Wenn die robots.txt zu groß ist
Wir lesen höchstens 512 KB einer robots.txt und höchstens 1.000 Regeln pro User-Agent-Gruppe. Ist der Teil, der für uns gilt, abgeschnitten, wissen wir nicht, was die fehlenden Regeln verbieten. Dann überspringen wir diese Seiten, statt gegen ein halbes Regelwerk zu crawlen. Der Assistent meldet das schon vor dem Crawl. Es ist unsere Lesegrenze, keine Sperre durch Ihre Website. Eine bestätigte Domain schaltet die robots.txt für diese Quelle ab, danach spielt die Grenze keine Rolle mehr.
Ihre Domain bestätigen
Zwei Dinge hängen daran: das Seitenlimit, das von 150 auf 2.500 steigt, und die Möglichkeit, die robots.txt zu übergehen. Es gibt zwei Wege, und Sie brauchen nur einen.
Weg 1: ein Meta-Tag auf der Startseite. Ihre Redaktion oder Agentur fügt im <head> der Startseite eine Zeile ein:
<meta name="dgpt-site-verification" content="IHR-TOKEN" />
Weg 2: ein DNS-Eintrag. Wer Zugriff auf die Domainverwaltung hat, legt einen TXT-Eintrag an:
TXT dgpt-site-verification=IHR-TOKEN
Bitten Sie den Assistenten, die Domain zu bestätigen; er nennt Ihnen das Token, das zu genau dieser Website-Quelle gehört. Sagen Sie ihm danach „jetzt prüfen“, dann sieht er nach und schaltet frei. Das Meta-Tag ist meist schneller, weil jede Redaktion es selbst einbauen kann. Der DNS-Eintrag ist der sauberere Weg, bedeutet aber oft ein Ticket an die IT.
Schon für die Anmeldung bestätigt
Hat Ihre Organisation diese Domain bereits für die Anmeldung per SSO bestätigt, gilt das auch hier, und es ist nichts weiter zu tun. Umgekehrt gilt das nicht: Eine hier bestätigte Website-Quelle schaltet keine Anmelde-Funktionen frei.
Die Bestätigung wird bei jedem Crawl geprüft
Vor jedem Crawl wird die Bestätigung erneut geprüft. Verliert die Domain sie, weil der Eintrag entfernt wurde oder sich die Adresse geändert hat, wird die robots.txt wieder befolgt, und der Assistent sagt Ihnen, warum sich das Verhalten geändert hat.