Zum Inhalt springen
DeutschlandGPT

robots.txt und Domain-BestätigungBeta

Woran sich der Widget-Crawler hält, und wie eine bestätigte Domain das Seitenlimit anhebt und die robots.txt übergehen lässt

Diese Funktion ist in der Beta-Phase. Sie ist nutzbar, einzelne Details können sich aber noch ändern.

Der Crawler, der Ihre Website für die Wissensbasis liest, benimmt sich wie ein höflicher Gast. Wenn Sie bestätigen, dass die Website Ihnen gehört, darf er mehr.

Wir halten uns an Ihre robots.txt

Unser Crawler meldet sich als DeutschlandGPT-Widget-Bot und befolgt die robots.txt Ihrer Website. Er ruft eine Seite nach der anderen ab, mit einer halben Sekunde Pause. So sieht ein Widget-Crawl für einen kleinen Server nie wie ein Lasttest aus.

Werden Seiten wegen der robots.txt übersprungen, sagt Ihnen der Assistent das und nennt den Grund. Das ist oft überraschend: Viele Websites sperren Crawler pauschal aus, ohne dass jemand das bewusst entschieden hat. Kommunale Websites sperren KI-Crawler zudem oft namentlich. Diese Regel zielt auf Fremde, die Trainingsdaten sammeln, nicht auf Sie beim Lesen Ihrer eigenen Website. Sie haben zwei Möglichkeiten:

  • Die robots.txt Ihrer Website anpassen. Das ist die saubere Lösung und gilt dann für alle Crawler.
  • Ihre Domain bestätigen und die robots.txt für diesen Bot gezielt übergehen. Das geht nur für Websites, die Ihnen nachweislich gehören.

Wenn die robots.txt zu groß ist

Wir lesen höchstens 512 KB einer robots.txt und höchstens 1.000 Regeln pro User-Agent-Gruppe. Ist der Teil, der für uns gilt, abgeschnitten, wissen wir nicht, was die fehlenden Regeln verbieten. Dann überspringen wir diese Seiten, statt gegen ein halbes Regelwerk zu crawlen. Der Assistent meldet das schon vor dem Crawl. Es ist unsere Lesegrenze, keine Sperre durch Ihre Website. Eine bestätigte Domain schaltet die robots.txt für diese Quelle ab, danach spielt die Grenze keine Rolle mehr.

Ihre Domain bestätigen

Zwei Dinge hängen daran: das Seitenlimit, das von 150 auf 2.500 steigt, und die Möglichkeit, die robots.txt zu übergehen. Es gibt zwei Wege, und Sie brauchen nur einen.

Weg 1: ein Meta-Tag auf der Startseite. Ihre Redaktion oder Agentur fügt im <head> der Startseite eine Zeile ein:

HTML
<meta name="dgpt-site-verification" content="IHR-TOKEN" />

Weg 2: ein DNS-Eintrag. Wer Zugriff auf die Domainverwaltung hat, legt einen TXT-Eintrag an:

TEXT
TXT  dgpt-site-verification=IHR-TOKEN

Bitten Sie den Assistenten, die Domain zu bestätigen; er nennt Ihnen das Token, das zu genau dieser Website-Quelle gehört. Sagen Sie ihm danach „jetzt prüfen“, dann sieht er nach und schaltet frei. Das Meta-Tag ist meist schneller, weil jede Redaktion es selbst einbauen kann. Der DNS-Eintrag ist der sauberere Weg, bedeutet aber oft ein Ticket an die IT.

Schon für die Anmeldung bestätigt

Hat Ihre Organisation diese Domain bereits für die Anmeldung per SSO bestätigt, gilt das auch hier, und es ist nichts weiter zu tun. Umgekehrt gilt das nicht: Eine hier bestätigte Website-Quelle schaltet keine Anmelde-Funktionen frei.

Die Bestätigung wird bei jedem Crawl geprüft

Vor jedem Crawl wird die Bestätigung erneut geprüft. Verliert die Domain sie, weil der Eintrag entfernt wurde oder sich die Adresse geändert hat, wird die robots.txt wieder befolgt, und der Assistent sagt Ihnen, warum sich das Verhalten geändert hat.

War diese Seite hilfreich?