Welche Quellen nutzt ChatGPT? 63 deutsche Websites im Test und was davon in die Antwort kommt
Welche Quellen nutzt ChatGPT: fünf Arten von Seiten und ein enges Nadelöhr
ChatGPT sucht für aktuelle Fragen live im Netz und zieht dabei aus fünf wiederkehrenden Arten von Seiten: Nachschlagewerke, Foren und Bewertungsportale, Nachrichtenmedien, Videoplattformen und Unternehmensseiten. Welche Quellen KI-Modelle nutzen, fällt je System auseinander: ChatGPT greift stark auf einzelne reichweitenstarke Adressen zu, Google AI Overview und Perplexity streuen breiter. Abgerufen wird dabei sehr viel mehr, als am Ende zu sehen ist. Von 548.534 abgerufenen Seiten landeten nur 15 Prozent in der Antwort. GEO, kurz für Generative Engine Optimization, ist die Arbeit daran, dass Ihre Seite zu diesen 15 Prozent gehört.
1. Einführung
Welche Quellen nutzt ChatGPT? Die Frage wird praktisch, sobald eine Antwort Ihre Branche betrifft. Sichtbar sind drei, vier Links. Dahinter liegen Hunderte gelesener Seiten. Wer dort fehlt, kommt in der Antwort nicht vor. Stand September 2026 lässt sich dieser Weg erstmals nachrechnen.
Die bislang größte veröffentlichte Untersuchung dazu stammt von AirOps: 15.000 Prompts (Textanfragen in KI-Assistenten), aus denen ChatGPT 43.233 eigene Suchanfragen bildete, und 548.534 abgerufene Seiten. In der fertigen Antwort standen davon 15 Prozent (AirOps, März 2026). Der Rest wurde gelesen und verworfen. Ähnlich wie bei einer Redaktionssitzung sichtet das System viel Material, und wenig davon kommt ins Blatt.
Gefragt wird das in zwei Bedeutungen: Woher nimmt ChatGPT Nachrichten allgemein, und woher die Nachrichten über künstliche Intelligenz selbst? Beides läuft über denselben Weg, deshalb behandelt dieser Beitrag beide. Er sortiert die Quellen nach Art, zeigt die Auswahl Schritt für Schritt und nennt, was eine Seite mitbringen muss. Wer den Status quo der KI-Sichtbarkeit messen will, bevor er etwas ändert, beginnt am besten mit einer Bestandsaufnahme.
Auf einen Blick
Die Quellen von ChatGPT sind die Webseiten, die das System während einer Antwort live abruft und anschließend auswählt: Nachschlagewerke, Foren und Bewertungsportale, Nachrichtenmedien, Videoplattformen und Unternehmensseiten. Der Abruf läuft über einen eigenen Suchdienst, die Auswahl danach über Passung, Belegbarkeit und Aktualität. Verlinkt wird nur ein kleiner Teil des Abgerufenen.
Was das für Sie heißt
Betrifft Sie das? Ja, sobald jemand Ihre Leistung beschreibt, statt Ihren Namen zu tippen. Was kostet Abwarten? Jede Antwort ohne Ihre Marke ist eine Anfrage, die woanders landet. Bei zehn Kundenfragen und drei genannten Anbietern je Antwort sind das dreißig Nennungen, an denen Sie nicht beteiligt sind (Schätzung, je nach Ausgangslage). Erster Schritt: zehn eigene Kundenfragen notieren und stellen.
2. Welche fünf Arten von Quellen zieht ChatGPT heran?
Die Quellen lassen sich in fünf Arten sortieren, und jede wird für einen anderen Zweck gezogen. Nachschlagewerke liefern Definitionen, Foren liefern Erfahrungen, Nachrichtenmedien liefern das Datum. Unternehmensseiten sind die einzige Art, über die Sie selbst bestimmen. Welche Quellen nutzen die Systeme also wofür? Ein Blick auf die am häufigsten zitierten Adressen beantwortet das schneller als jede Theorie.
|
Art der Quelle |
Typische Vertreter |
Wofür nutzen KI-Suchmaschinen sie |
|---|---|---|
|
Nachschlagewerke |
Wikipedia, Fachlexika |
Definitionen und Einordnung; in KI-Ergebnissen oft der erste Beleg |
|
Foren und Bewertungen |
Reddit, Bewertungsportale |
Erfahrungen und Vergleiche; besonders auf Reddit holen sich Sprachmodelle Meinungsbilder |
|
Nachrichtenmedien |
Tageszeitungen, Fachdienste |
aktuelle Ereignisse und Zahlen mit Datum; hier zitieren KI-Chatbots für Nachrichten am engsten |
|
Videoplattformen |
YouTube und Reddit als Nachbarn |
Anleitungen und Vorführungen; Googles AI Overviews stützen sich stark auf YouTube |
|
Unternehmensseiten |
Ihre Website, Firmenblogs |
Leistungen, Preise, Regionen; Unternehmenswebsites stellen der Masse nach den größten Anteil an Inhalten |
Perplexity, Claude und Google AI Overviews mischen diese fünf Arten anders. ChatGPT gewichtet einzelne reichweitenstarke Adressen stärker, die übrigen KI-Modelle streuen breiter. Auf Reddit, Wikipedia, YouTube und LinkedIn greifen alle Chatbots zurück, nur in unterschiedlichem Maß. Wie unterschiedlich die Gewichtung ausfällt und woher KI-Assistenten ihre Belege nehmen, hängt weniger vom Thema ab als vom System.
Ein Ergebnis aus einem einzigen KI-Chatbot ist noch kein Befund.
3. Wie haben wir die Auswahl geprüft?
Drei Belege tragen die Frage, wie ChatGPT Quellen auswählt: eine Messung an einer halben Million abgerufener Seiten, eine Erhebung über 129,3 Millionen Zitate aus sieben KI-Systemen und die Dokumentation von OpenAI selbst. Dazu kommt eine eigene Stichprobe. Sie prüft nicht, wer zitiert wird, sondern wer überhaupt gelesen werden darf.
Häufig heißt es, wer den Crawler GPTBot aussperrt, sei damit aus ChatGPT verschwunden. Sogenannte Crawler sind Abrufprogramme, die Seiten selbsttätig herunterladen. Das trifft nicht zu, weil OpenAI zwei getrennte davon betreibt: GPTBot sammelt Material für das Training der Modelle, OAI-SearchBot holt die Seiten für die Antworten der Suchfunktion. In der Dokumentation von OpenAI steht dazu: „Seiten, die sich von OAI-SearchBot abgemeldet haben, werden in den Antworten der ChatGPT-Suche nicht gezeigt, können aber weiterhin als Navigationslink erscheinen.“
Im Original lautet der Satz: „Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links.“
Eine robots.txt ist wie ein Schild an der Tür: Sie regelt, wer hereindarf, und sagt nichts darüber, wer am Ende zitiert wird. Für die eigene Stichprobe haben wir am 25. September aus der Tranco-Liste der eine Million meistbesuchten Domains alle deutschen Adressen gefiltert und systematisch jede 310. gezogen, also 90 Domains. 63 davon lieferten eine auswertbare robots.txt.
Der Abruf selbst läuft nicht über Googles Index. ChatGPT stützt seine Websuche auf Bing und eigene Partnerquellen, bildet daraus mehrere Suchanfragen je Frage und lädt die Treffer nach. Die Google-Position bleibt trotzdem ein guter Anhaltspunkt: Seiten auf Platz eins wurden in KI-generierten Antworten 3,5-mal häufiger zitiert als Seiten jenseits der ersten zwanzig Treffer.
Sechs dieser 63 Websites nennen einen der sechs geprüften KI-Crawler überhaupt beim Namen, und fünf davon sperren GPTBot, wobei vier zugleich OAI-SearchBot zulassen und die Unterscheidung damit bewusst treffen. Vier weitere sperren GPTBot nur, weil ihre robots.txt jeden Abruf verbietet. Die übrigen 57 haben keine Regel dazu und lassen damit alles zu, ohne es entschieden zu haben.
4. Welche Quellen nutzt ChatGPT für KI-News?
Nachrichten sind der Sonderfall in dieser Aufstellung, weil die Auswahl dort am engsten ausfällt. Für die Studie der Berliner Denkfabrik Agora Digitale Transformation wurden 675 Nachrichtenanfragen an sechs KI-Systeme ausgewertet, insgesamt 4.811 Quellenverweise, verteilt auf nur 544 Domains. Bei ChatGPT entfielen 34 Prozent der Verweise auf eine einzige Adresse, welt.de. Die Studie führt das auf die Kooperation zwischen OpenAI und Axel Springer zurück (Juli 2026).
Übertragen auf Nachrichten über künstliche Intelligenz ändert sich das Muster nicht, nur die Namen: Fachdienste und Wirtschaftstitel treten an die Stelle der Politikressorts. ChatGPT zitiert auffällig oft dieselben Adressen und greift dabei auf einen engen Kreis von Quellen zurück, während Google AI Overviews und Perplexity breitere Listen bevorzugen. In einem Durchgang mit 3.000 Anfragen an vier KI-Systeme durch Bernstein Analytics stand tagesschau.de an der Spitze der deutschen Nachrichtenquellen, und nur 26 Prozent aller zitierten Quellen waren überhaupt deutschsprachige Nachrichtenmedien (Oktober 2025). Die Gewichtung der Nachrichtenquellen haben wir an anderer Stelle im Detail durchgezählt.
Die Autorinnen der Studie halten fest, dass immer mehr Menschen nutzen, was KI-Systeme ihnen als Nachricht vorlegen, und dass diese Systeme bestehende Aufmerksamkeitsverteilungen eher verstärken als aufbrechen. Neben journalistischen Quellen stehen dort Foren, Videoplattformen und Unternehmensseiten. Der Anteil journalistischer Quellen fällt je System sehr unterschiedlich aus, bei ChatGPT höher als bei Google Gemini oder bei Claude von Anthropic. Eine fundierte Antwort entsteht daraus nicht automatisch.
Für einen Betrieb außerhalb der Medienbranche ist das trotzdem relevant. Wenn eine Handvoll Adressen den Nachrichtenteil einer Antwort trägt, entscheidet eine Erwähnung in genau diesen Adressen darüber, ob Ihr Name mitläuft. Wer dort nie vorkommt, taucht auch in der KI-Suche nicht als Beleg auf, sondern höchstens als Randnotiz.
Taucht Ihre Seite in den Quellen von ChatGPT auf?
Der Kurzcheck für 990 Euro liefert innerhalb von fünf Werktagen eine dokumentierte Ausgangsmessung plus drei Sofortmaßnahmen.
5. Was ändert ein Lizenzvertrag an der Rangfolge?
Verträge zwischen KI-Anbietern und Verlagen verschieben die Auswahl messbar. Press Ranger und OtterlyAI glichen 129,3 Millionen Zitate aus sieben KI-Systemen gegen 91 bestätigte Lizenzvereinbarungen ab. Nachrichtenseiten von Verlagen mit OpenAI-Vertrag bekamen im Juni im Schnitt 10,2 Zitate je Seite, Seiten ohne Vertrag 6,9, ein Abstand von 48 Prozent (August 2026). Ein Lizenzvertrag wirkt damit ähnlich wie ein fester Listenplatz im Sortiment eines Händlers.
Ein Lizenzvertrag verschiebt die Auswahl, er ersetzt sie nicht. Wer keinen hat, konkurriert nicht um den Platz im Sortiment, sondern um die eine überprüfbare Aussage, die in der Antwort gebraucht wird.
Für alle anderen bleibt der Weg über die Sache selbst.
Der Geschäftsführer von OtterlyAI fasst den Befund so zusammen: „Ein Lizenzvertrag bewirkt eines ganz klar: Er kippt Ihre Zitate in Richtung ChatGPT.“ Im Original: „A licensing deal does one clear thing: it tilts your citations toward ChatGPT.“
Einordnung gehört dazu: Die Erhebung stammt von zwei Anbietern mit eigenem Geschäftsinteresse, deckt nur einen Monat ab und veröffentlicht keine geprüfte Methodik, weshalb sie einen Zusammenhang zeigt und keinen Nachweis einer Ursache.
6. Was muss Ihre Seite mitbringen, um zitiert zu werden?
Vier Dinge entscheiden darüber, ob eine Seite die Auswahl übersteht, und keines davon ist Textmenge. Erstens eine überprüfbare Aussage: eine Zahl, ein Datum, eine Herkunft, alles im selben Satz. Zweitens Text, der ohne JavaScript im ausgelieferten Quelltext steht. Drittens eine eindeutige Zuordnung, damit ein System Ihren Betrieb als Entität erkennen kann. Viertens Belege außerhalb der eigenen Seite.
Der dritte Punkt ist der, an dem es im Mittelstand am häufigsten hakt, und er ist vergleichbar mit einem Namensschild, das an jeder Tür anders beschriftet ist. Firmenname, Ort und Leistungsbezeichnung müssen auf der Website, im Verzeichnis und im Unternehmensprofil identisch lauten. Gerade für den Mittelstand zahlt sich dieser kleine Aufwand aus, weil er nicht von Budget abhängt, sondern von Sorgfalt.
Der vierte Punkt lässt sich nicht auf der eigenen Seite lösen. Redaktionelle Erwähnungen in verlässlichen Medien tragen die Prüfung, die eine Selbstbeschreibung nicht leisten kann. Eine Fachmeldung mit vollständigem Firmennamen wiegt dabei schwerer als zehn zusätzliche Absätze auf der Startseite.
Und die robots.txt? Prüfen, einmal, dauert zwei Minuten. Sperren Sie GPTBot, wenn Sie kein Trainingsmaterial für die Arbeit an KI-Modellen liefern wollen, und lassen Sie OAI-SearchBot zu, wenn Sie in den Antworten vorkommen möchten.
7. Fazit
Die Quellenauswahl von ChatGPT ist kein Zufall und kein Ranking im klassischen Sinn. Abgerufen wird breit, zitiert wird schmal, und zwischen beidem liegt eine Prüfung auf Belegbarkeit. Nachrichten laufen dabei über eine besonders kleine Zahl von Adressen, Unternehmensseiten über eine sehr große. Das Ziel: eine Seite, die eine überprüfbare Aussage liefert, die ohne Zusatzarbeit in eine Antwort passt.
Wer heute anfängt, beginnt nicht mit Text, sondern mit Messung. Zehn Fragen, zwei Durchgänge, notiert wird, wer genannt und wer verlinkt wird. Dass viele Nutzer danach gar nicht mehr klicken, gehört zum Bild und steht unter wenn die Antwort genügt. Alles Weitere folgt aus dieser Liste.
Sichtbarkeit in KI-Antworten entsteht nicht durch mehr Text, sondern durch bessere Belege.
8. Anhang: Checkliste für die eigene Seite
Erst messen, dann entscheiden
In einem Gespräch klären wir, was ChatGPT, Gemini und Perplexity heute über Ihr Unternehmen sagen, woher diese Antworten stammen und an welcher Stelle Sie nachlegen können. Reicht dafür eine einmalige Messung, sagen wir Ihnen auch das.
9. Häufige Fragen zu den Quellen von ChatGPT
Autor: Simon Hubert ist Gründer von Hubert Strategies in Göttingen und arbeitet an generativer Suchmaschinenoptimierung, Knowledge-Graph-Strukturen und KI-Sichtbarkeit in ChatGPT und Co. Seine erste Digitalagentur gründete er 2011. Er hält einen Master in Business Informatics der Universität Mannheim und ist seit über 20 Jahren in Digitalisierung und IT unterwegs, mehrere Jahre davon in Großkonzernen.
Stand September 2026. Der Beitrag gibt den Stand zum Zeitpunkt der Veröffentlichung wieder. Die Antworten der genannten KI-Systeme, ihre Dokumentation und die zitierten Erhebungen ändern sich laufend; alle Werte stammen aus den verlinkten Quellen. Die eigene Stichprobe ist eine Momentaufnahme und nicht repräsentativ.
