# ============================================= # AKTUELL: vor Go-Live. Nicht auffindbar sein besorgt das noindex in JEDER # Seite (BaseLayout.astro via SITE_INDEXING_ENABLED = false, plus drei # statische Seiten in public/ mit fest verdrahtetem Tag) - NICHT diese Datei. # # WARUM HIER KEIN "Disallow: /" MEHR STEHT (nicht zurueckaendern): # robots.txt steuert das CRAWLEN, nicht das INDEXIEREN. Kennt Google eine URL # aus einer anderen Quelle (externer Link, Zertifikatseintrag, Search Console, # Browserdaten), nimmt es sie trotzdem in den Index auf - nur ohne Inhalt, # als Treffer mit "Fuer diese Seite sind keine Informationen verfuegbar". # Und weil Googlebot die Seite nicht abrufen durfte, hat er das noindex nie # gesehen. Die Sperre verhinderte also nicht den Eintrag, sondern genau seine # Entfernung. Google dokumentiert das ausdruecklich: damit noindex wirkt, darf # die Seite nicht per robots.txt gesperrt sein. # # Real passiert am 15.09.2026: knusperbyte.com stand mit leerem Snippet in # Google, obwohl jede Seite noindex trug und robots.txt alles sperrte. # # Crawlen ist deshalb erlaubt, damit das noindex gelesen wird und die URLs # aus dem Index fallen. Auffindbar wird die Seite dadurch nicht. # ============================================= User-agent: * Allow: / Crawl-delay: 1 # ============================================= # NUTZUNGSVORBEHALT Text- und Data-Mining / KI-Training # # Bleibt beim Go-Live AKTIV - nicht mit dem Block oben entfernen. # Der Vorbehalt gilt unabhaengig davon, ob Suchmaschinen indexieren # duerfen: gewoehnliches Indexieren ist gewollt, das Abgreifen zum # Trainieren von KI-Modellen nicht. # # Warum maschinenlesbar und nicht nur in den AGB: Art. 4 Abs. 3 der # RL (EU) 2019/790 (in AT ยง 42h UrhG) erlaubt Text- und Data-Mining # ohne Zustimmung, SOFERN sich der Rechteinhaber es nicht ausdruecklich # und - bei online zugaenglichen Inhalten - maschinenlesbar vorbehalten # hat. Ohne diesen Block greift die Ausnahme und das Auslesen zum # KI-Training waere erlaubt, obwohl die AGB es verbieten. # # Textliche Entsprechung (bei Aenderung beide Seiten pflegen): # src/content/legal/website-agb-de.md Ziffer 5.4 # src/content/legal/quickzr0-agb-de.md Ziffer 5.5 # Zusaetzlich als tdmrep-Standard: public/.well-known/tdmrep.json # # Google-Extended und Applebot-Extended steuern NUR die KI-Nutzung, # nicht das Indexieren - Googlebot/Applebot bleiben davon unberuehrt. # Neue Bots hier ergaenzen, sobald sie bekannt werden. # ============================================= User-agent: GPTBot User-agent: OAI-SearchBot User-agent: ChatGPT-User User-agent: ClaudeBot User-agent: Claude-Web User-agent: anthropic-ai User-agent: Google-Extended User-agent: Applebot-Extended User-agent: CCBot User-agent: Bytespider User-agent: PerplexityBot User-agent: Amazonbot User-agent: meta-externalagent User-agent: FacebookBot User-agent: cohere-ai User-agent: Diffbot User-agent: Omgilibot User-agent: ImagesiftBot User-agent: Timpibot Disallow: / # ============================================= # GO-LIVE Konfiguration # Zu tun ist dann nur EINES: SITE_INDEXING_ENABLED in # src/lib/site-indexing.ts auf true setzen. Damit faellt das globale noindex, # und die Sitemap wird aktiv. An dieser Datei ist nichts zu aendern - # "Allow: /" oben gilt schon jetzt und ist auch danach richtig. # Nur die Sitemap-Zeile unten einkommentieren. # ============================================= # Rechtsseiten NICHT hier sperren - Ziffernblock bewusst entfernt. # Sie tragen dauerhaft noindex/nofollow (isKnownNoindexPath in # src/lib/legal-noindex-paths.ts) und sind aus der sitemap.xml ausgeschlossen. # Ein "Disallow: /agb" hier drueber wuerde genau den Fehler wiederholen, der # oben beschrieben ist: Google darf die Seite dann nicht abrufen, sieht das # noindex nicht und kann die URL ohne Inhalt im Index behalten. # Ein Disallow ist nur fuer Dinge sinnvoll, die gar nicht abgerufen werden # sollen (Crawl-Budget, technische Pfade) - nicht fuer "soll nicht in Google". # Interne/technische Dateien blockieren # Disallow: /open-source-licenses.json # Technische Bereiche blockieren # Disallow: /admin/ # Disallow: /api/ # Disallow: /_astro/ # Disallow: /dist/ # Wichtige Dateien erlauben # Allow: /sitemap.xml # Allow: /favicon.svg # Crawl-Delay # Crawl-delay: 1 # Sitemap # Sitemap: https://www.knusperbyte.com/sitemap-index.xml