Was ist die Robots.txt?
Die Robots.txt ist eine kleine Textdatei im Wurzelverzeichnis einer Website, die Suchmaschinen Anweisungen für das Crawling gibt. Sie legt fest, welche Bereiche einer Website ein Crawler betreten darf und welche nicht. Bevor ein Bot eine Seite erfasst, ruft er zunächst die Robots.txt ab und richtet sich nach den dort hinterlegten Regeln.
Die Datei ist eines der grundlegendsten Werkzeuge im technischen SEO. Mit ihr steuerst du, wie Suchmaschinen mit deiner Website umgehen, und schützt Bereiche, die nicht im Fokus des Crawlings stehen sollen, etwa interne Verzeichnisse oder Funktionsseiten ohne Mehrwert für die Suche.
Was die Robots.txt kann
Crawling erlauben oder verbieten ist die Hauptfunktion. Über einfache Anweisungen lässt sich festlegen, welche Verzeichnisse oder Seiten ein Bot nicht crawlen soll. So lenkst du die Aufmerksamkeit der Crawler auf die wirklich wichtigen Inhalte.
Crawl-Budget schonen ist ein wichtiger Nebeneffekt. Indem du unwichtige Bereiche vom Crawling ausschließt, sorgst du dafür, dass Suchmaschinen ihre begrenzten Ressourcen auf deine relevanten Seiten konzentrieren.
Auf die Sitemap verweisen ist ebenfalls möglich. In der Robots.txt kann die Adresse der Sitemap hinterlegt werden, damit Crawler sie schnell finden.
Ein wichtiges Missverständnis
Ein häufiger Irrtum ist, dass die Robots.txt Seiten aus dem Google-Index fernhält. Das stimmt so nicht. Die Datei steuert das Crawling, nicht die Indexierung. Eine Seite, die per Robots.txt vom Crawling ausgeschlossen ist, kann in Einzelfällen trotzdem im Index landen, etwa wenn andere Seiten auf sie verlinken.
Wer eine Seite zuverlässig aus den Suchergebnissen heraushalten will, nutzt dafür die „noindex“-Anweisung, nicht die Robots.txt. Beide Werkzeuge haben unterschiedliche Aufgaben und sollten bewusst eingesetzt werden. Ein falsch gesetzter Eintrag in der Robots.txt kann im schlimmsten Fall eine ganze Website für Suchmaschinen unsichtbar machen.
Sichere Konfiguration mit Klickx.de
Die Robots.txt ist mächtig und fehleranfällig zugleich. Ein einziger falscher Eintrag kann gravierende Folgen für die Sichtbarkeit haben. Genau deshalb prüfen wir bei Klickx.de deine Konfiguration sorgfältig. Wir stellen sicher, dass Suchmaschinen genau das crawlen, was sie sollen, und nichts Wichtiges versehentlich blockiert wird.
Häufige Fragen zu Robots.txt
Was ist die Robots.txt?
Die Robots.txt ist eine Textdatei im Wurzelverzeichnis einer Website, die Suchmaschinen Anweisungen für das Crawling gibt. Sie legt fest, welche Bereiche ein Crawler betreten darf und welche nicht.
Wozu dient die Robots.txt?
Sie steuert das Crawling, schont das Crawl-Budget, indem sie unwichtige Bereiche ausschließt, und kann auf die Sitemap verweisen.
Verhindert die Robots.txt die Indexierung?
Nein. Die Robots.txt steuert das Crawling, nicht die Indexierung. Eine blockierte Seite kann in Einzelfällen trotzdem im Index landen. Für den Ausschluss aus der Suche dient die 'noindex'-Anweisung.
Welche Fehler sollte man vermeiden?
Ein falsch gesetzter Eintrag kann im schlimmsten Fall eine ganze Website für Suchmaschinen unsichtbar machen. Die Datei sollte deshalb sorgfältig geprüft werden.