Woher haben KI-Assistenten ihre Antworten?
Aus zwei Quellen: aus dem, was das Modell im Training gelernt hat, und aus einer Websuche im Moment der Frage. Nur die zweite führt zu einem Zitat mit Link auf Ihre Website.
Fragt jemand nach einem Coiffeur mit Online-Buchung in Winterthur, sucht der Assistent im Web, liest einige Seiten und nennt die, aus denen seine Antwort stammt. Was das Modell im Training über Ihre Firma gelernt hat, ist dagegen Monate alt und erscheint ohne Quelle.
Woher die Suche kommt, ist je nach Assistent verschieden:
- Google AI Overviews und AI Mode bauen auf dem normalen Google-Index auf. Laut Google braucht es dafür weder besondere Optimierungen noch besonderes Markup.[5]
- ChatGPT, Claude und Perplexity betreiben eigene Crawler für ihre Suche.[1][2][3] ChatGPT arbeitet laut OpenAI teils auch mit anderen Suchanbietern zusammen.[18]
- Microsoft Copilot und die KI-Antworten in Bing nennen ebenfalls Quellen. Wie oft Ihre Seiten darunter sind, zeigen die Bing Webmaster Tools.[14]
Für Ihre Website heisst das: Sie muss in diese Suchindizes gelangen, und die Antwort muss auf der Seite selbst stehen.
Welche Crawler müssen auf Ihre Website dürfen?
Die Crawler für Antworten und Suche: OAI-SearchBot und ChatGPT-User von OpenAI, Claude-SearchBot und Claude-User von Anthropic, PerplexityBot und Perplexity-User von Perplexity, dazu Googlebot und Bingbot. Wer sie sperrt, wird in diesen Assistenten kaum noch zitiert.
Die Crawler für das Training sind eine eigene Entscheidung. Sperren Sie sie, dürfen die Anbieter Ihre Seiten nicht mehr fürs Training verwenden; in ChatGPT, Claude und Perplexity bleiben Sie zitierbar. OpenAI nennt das für GPTBot und OAI-SearchBot ausdrücklich.[1] Eine Ausnahme ist Google-Extended: Er steuert neben dem Training auch, ob die Gemini-App Ihre Seiten für Antworten nutzt.[4]
Unsere eigene robots.txt gibt zehn KI-Crawler namentlich frei, für das Training wie für die Suche:
| Crawler | Betreiber | Wofür |
|---|---|---|
| GPTBot | OpenAI | Training Sammelt Inhalte für das Training der Modelle von OpenAI. |
| ClaudeBot | Anthropic | Training Sammelt Inhalte für das Training der Claude-Modelle. |
| Google-Extended | Training Kein eigener Crawler, sondern ein Schalter in der robots.txt: ob Google Ihre Inhalte für das Training von Gemini und für Antworten in der Gemini-App verwenden darf. Auf die Google-Suche hat er keinen Einfluss. | |
| Applebot-Extended | Apple | Training Ebenfalls ein Schalter: ob Apple Ihre Inhalte für das Training seiner Modelle verwenden darf, etwa für Apple Intelligence. Gelesen wird mit dem Applebot. |
| OAI-SearchBot | OpenAI | Antwort und Suche Nimmt Seiten in die Suche von ChatGPT auf. |
| ChatGPT-User | OpenAI | Antwort und Suche Ruft eine Seite ab, wenn jemand in ChatGPT danach fragt. Laut OpenAI gilt die robots.txt dabei nicht in jedem Fall. |
| Claude-SearchBot | Anthropic | Antwort und Suche Liest Seiten, um die Suchergebnisse in Claude zu verbessern. |
| Claude-User | Anthropic | Antwort und Suche Ruft eine Seite ab, wenn jemand in Claude danach fragt. |
| PerplexityBot | Perplexity | Antwort und Suche Nimmt Seiten in die Suchergebnisse von Perplexity auf, laut Perplexity nicht für das Training von KI-Grundmodellen. |
| Perplexity-User | Perplexity | Antwort und Suche Ruft eine Seite ab, wenn jemand in Perplexity danach fragt. Hält sich laut Perplexity in der Regel nicht an die robots.txt. |
Bei Google gibt es seit dem 31. August 2026 einen zweiten Schalter: In der Search Console lässt sich eine Website von AI Overviews und AI Mode ausschliessen. Ab Werk ist sie eingeschlossen; auf das Training hat diese Einstellung keinen Einfluss.[7]
Reicht die robots.txt?
Nein. Die robots.txt sagt, was ein Crawler darf. Ob er tatsächlich durchkommt, entscheidet auch Ihr Hoster: Firewalls und CDNs filtern automatisierte Zugriffe teils von sich aus.
- Cloudflare hat am 15. September 2026 die Einstellung «Block AI Bots» durch drei getrennte ersetzt: Suche, Training und KI-Agenten. Bei neuen Websites ohne Werbung sind ab Werk alle drei erlaubt. Wer früher KI-Bots gesperrt hat, sollte prüfen, was heute eingestellt ist.[10]
- Hostinger zeigt im hPanel unter Performance, CDN, «AI Audit», welche KI-Crawler eine Website besuchen, und lässt sie sperren.[11]
Eine Erfahrung aus unserer eigenen Prüfung: Ein Test mit einem nachgeahmten Crawler-Namen sagt wenig. Wir haben unsere Website unter dem Namen «GPTBot» abgerufen und wurden mit dem Status 429 abgewiesen. Unsere Anfrage kam aber nicht von OpenAI, und CDNs prüfen, ob ein Crawler wirklich von seinem Betreiber kommt, zum Beispiel über die Adresslisten, die die Betreiber veröffentlichen.[20] Verlässlich sind nur die Protokolle echter Besuche: in der Verwaltung des Hosters oder in den Zugriffsprotokollen des Servers.
Wie muss ein Text geschrieben sein, damit eine KI ihn zitiert?
So, dass ein einzelner Abschnitt die Frage beantwortet, auch ohne den Rest der Seite. Assistenten übernehmen Abschnitte, nicht ganze Seiten.
- Die Überschrift ist eine Frage, wie Ihre Kunden sie stellen: «Was kostet ein Pneuwechsel?» statt «Unsere Preise».
- Der erste Satz darunter beantwortet sie vollständig. Die Details folgen danach.
- Zahlen statt Adjektive: «Termin innert drei Tagen» statt «schnell».
- Fakten als Text: Preise, Öffnungszeiten, Einzugsgebiet. Was nur in einem Bild steht, existiert für die Suche nicht als Text.
- Wo Sie Zahlen von anderen übernehmen, nennen Sie die Quelle.
Das letzte ist messbar: Forscher des IIT Delhi und der Princeton University haben 2024 in einer Studie gemessen, dass Quellenangaben, Zitate und Statistiken die Sichtbarkeit eines Textes in den Antworten generativer Suchmaschinen um bis zu 40 Prozent erhöhten.[12] Darum stehen auf dieser Seite die Quellen am Schluss.
Was bringen strukturierte Daten?
Sie machen Ihre Firma für Maschinen unverwechselbar, sind für Google AI Overviews aber keine Bedingung.[5]
Strukturierte Daten beschreiben Name, Adresse, Telefon, Leistungen, Preise, Öffnungszeiten und die Profile, die zu Ihnen gehören, so, dass eine Maschine nicht raten muss. Sie stehen als JSON-LD nach schema.org im HTML und sind für Besucher unsichtbar.[17] Die aufklappbaren FAQ-Ergebnisse zeigt Google seit Mai 2026 für keine Website mehr an.[9]
Wir setzen strukturierte Daten trotzdem auf jede Seite. Sie machen keine zusätzliche Arbeit, wenn die Website sie aus denselben Daten erzeugt wie den sichtbaren Text, und dann können die beiden auch nie voneinander abweichen.
Braucht meine Website eine llms.txt?
Nein. Sie schadet nicht, aber kein grosser Anbieter hat bestätigt, dass er sie für seine Suche nutzt. Die llms.txt ist ein Vorschlag von Jeremy Howard vom September 2024: eine Textdatei im Stammverzeichnis, die Sprachmodellen eine Übersicht der Website gibt.[13]
Google schreibt ausdrücklich, dass die Google-Suche sie nicht verwendet; sie helfe der Sichtbarkeit weder, noch schade sie.[6] Von OpenAI und Anthropic ist keine Aussage bekannt, dass sie die Datei für ihre Suche nutzen. Wir erzeugen unsere llms.txt trotzdem, automatisch aus denselben Daten wie die Website. Der Aufwand ist klein, und sie kann der Website nie widersprechen.
Warum zählt, was andere Websites über Sie schreiben?
Weil eine Firma, die nur auf der eigenen Website vorkommt, für Assistenten schwerer einzuordnen ist als eine, die auch in Verzeichnissen, Bewertungen und Artikeln steht.
- ein Google-Unternehmensprofil mit Bewertungen
- Einträge in Verzeichnissen wie local.ch und search.ch
- Profile auf LinkedIn oder Instagram, über die strukturierten Daten mit der Website verknüpft
- Name, Adresse und Telefonnummer überall genau gleich geschrieben
- Erwähnungen bei Verbänden, Partnern und in Lokalmedien
Wie prüfen Sie, ob Ihre Website zitiert wird?
Mit zwei Berichten, einem Blick in die Besucherstatistik und einer festen Liste von Fragen, die Sie jeden Monat stellen.
- Google Search Console: Ein eigener Bericht zeigt seit dem 31. August 2026 für alle Websites, wie oft Ihre Seiten in AI Overviews und AI Mode erscheinen, nur als Impressionen.[8]
- Bing Webmaster Tools: Der Bericht «AI Performance» zeigt seit Februar 2026 als öffentliche Vorschau, wie oft Copilot und die KI-Antworten in Bing Ihre Seiten zitieren.[14]
- Besucherstatistik: Besuche von chatgpt.com, perplexity.ai, claude.ai, gemini.google.com und copilot.microsoft.com. ChatGPT hängt an seine Links
utm_source=chatgpt.coman.[15] - Feste Fragen: zehn bis zwanzig Fragen Ihrer Kunden, jeden Monat in ChatGPT, Claude, Perplexity und Gemini gestellt, die Antworten mit Datum festgehalten.
Bei jedem Livegang stellen wir ChatGPT, Claude und Perplexity die Fragen aus dem Briefing, halten die Antworten fest und stellen dieselben Fragen nach vier bis acht Wochen noch einmal.
Checkliste: KI-Sichtbarkeit in zehn Punkten
Zehn Punkte, die Sie an Ihrer Website selbst prüfen können.
- Die Crawler für Antworten und Suche sind in der robots.txt erlaubt.
- Hoster und CDN lassen sie durch, geprüft an den Protokollen echter Besuche.
- Alle Inhalte stehen im ausgelieferten HTML, nicht erst nach JavaScript. Am schnellsten prüfen Sie das so: Seitenquelltext anzeigen (
Ctrl+U, auf dem Mac⌥+⌘+U) und nach einem Satz der Seite suchen. - Überschriften sind Fragen, der erste Satz darunter beantwortet sie.
- Preise, Zeiten und Einzugsgebiet stehen als Text.
- Firma, Leistungen und Fragen sind als JSON-LD beschrieben, gleich wie im Text.
- Jede Seite hat genau eine Hauptüberschrift (h1).
- Die Sitemap ist bei Google und Bing eingereicht, neue Seiten meldet IndexNow.[16]
- Google-Unternehmensprofil und Verzeichnisse zeigen dieselben Angaben wie die Website.
- Feste Fragen werden jeden Monat in den Assistenten geprüft.
Die Punkte 1 und 3 bis 7 gehören zu jeder Website, die wir bauen. Wie das aussieht, zeigt diese Website selbst: die robots.txt, die llms.txt und die strukturierten Daten im Quelltext. Beispiele nach Branche: Websites für Coiffeure, Websites für Garagen, Websites für Autohändler, Websites für Velohändler, Websites für Hotels, Websites für Architekten.
Quellen
- OpenAI: Overview of OpenAI Crawlers
- Anthropic: Does Anthropic crawl data from the web, and how can site owners block the crawler?
- Perplexity: Perplexity Crawlers
- Google: Google-Extended und die weiteren Crawler von Google
- Google: AI features and your website
- Google: Leitfaden zur Optimierung für KI-Funktionen der Suche
- Google Search Console: Website von KI-Funktionen ausschliessen
- Google Search Console: Bericht zur Leistung in generativer KI
- Google: Änderungen an der Dokumentation, FAQ-Ergebnisse eingestellt
- Cloudflare: Getrennte Einstellungen für Suche, Training und Agenten (2026)
- Hostinger: AI Audit im CDN
- Aggarwal et al.: GEO, Generative Engine Optimization (KDD 2024)
- llmstxt.org: The /llms.txt file
- Bing: AI Performance in den Bing Webmaster Tools
- OpenAI: Publishers and Developers FAQ
- IndexNow
- schema.org: LocalBusiness
- OpenAI: Searching the web with ChatGPT
- Apple: About Applebot
- Hostinger: CDN, search engine crawlers and SEO