Was ist eine Sentiment Analyse der KI‑Antworten? Definition, Beispiel und die Grenzen, die kein Tool wegrechnet
Sentiment Analyse: aus Stimmung wird eine Zahl, und die Zahl hat Grenzen
Eine Sentiment Analyse ist die automatische Auswertung von Texten nach der Stimmung, die in ihnen steckt: positiv, negativ oder neutral, z. B. von Antworten einer KI über Ihr Unternehmen. Aus Bewertungen, Kommentaren und Umfragen entsteht ein Stimmungsbild, verdichtet zu einer Kennzahl. Wie belastbar diese Kennzahl ist, hängt an Sprache und Textsorte. Auf deutschen Tweets kam ein verbreitetes Sprachmodell in einer Untersuchung vom Januar 2026 auf einen gewichteten F1-Wert von 0,72, einem Genauigkeitsmaß zwischen 0 und 1; auf englischen Filmkritiken waren es 0,93 (arXiv).
1. Sentiment Analyse: was misst die Stimmungsmessung wirklich?
Sentiment Analyse macht aus Meinungen eine Zahl, ein wenig wie ein Stimmungsbarometer, das statt Luftdruck Sätze misst. Eine Maschine wie z. B. ChatGPT liest Texte und sortiert sie in drei Schubladen: positiv, negativ oder neutral. Firmen analysieren damit Bewertungen, Kundenfeedback aus Umfragen und Beiträge in sozialen Netzwerken, und Stand September 2026 steckt das Verfahren in fast jedem Marketing-Werkzeug. Gemessen wird dabei nie das Gefühl eines Menschen, sondern nur die Wertung in seinem Text.
Laut der im Januar 2026 veröffentlichten Untersuchung von Schmitt, Schwerk und Lempert (arXiv) erreichte GPT-4o-mini mit der jeweils besten Prompt-Technik auf deutschen Tweets einen gewichteten F1-Wert von 0,72, auf englischen Filmkritiken dagegen 0,93. Der F1-Wert ist eine Art Trefferquote zwischen 0 und 1. Wer die Zahl aus einem Dashboard übernimmt, ohne die Textsorte zu kennen, übernimmt diese 21 Punkte Abstand gleich mit.
Der Beitrag klärt Definition, Beispiel und Grenzen und zeigt in vier Schritten, wie Sie selbst messen. An der Börse meint Sentiment-Analyse übrigens die Stimmung der Anleger, etwa in der wöchentlichen Umfrage der AAII, und da geht es eher um Nervosität als um Marken. Hier geht es um Texte über Marken und Produkte, auch Sentiment Detection oder Sentiment Analysis genannt.
Auf einen Blick
Sentiment Analyse ist ein Verfahren der automatischen Textauswertung, das Aussagen in geschriebener Sprache als positiv oder negativ kennzeichnet und neutrale Aussagen davon abgrenzt. Zum Einsatz kommen Wörterbücher, Modelle aus dem Machine Learning oder eine Kombination der beiden. Aus Bewertungen, Kundenrezensionen und Umfrageantworten entsteht so eine vergleichbare Kennzahl für die vorherrschende Stimmung zu einer Marke oder einem Produkt.
Was das für Sie heißt
Betrifft Sie das? Ja, sobald Kunden öffentlich über Sie schreiben. Was kostet Nichtstun? Ärger bemerken Sie erst, wenn er im Umsatz ankommt, und eine schlechte Bewertung, die drei Monate unbeantwortet stehen bleibt, liest jeder, der Sie sucht. Ihr erster Schritt kostet kein Geld: Sammeln Sie einen Monat lang an einer Stelle, was ohnehin über Sie geschrieben wird. Erst dann lohnt sich ein Werkzeug.
Die Stimmungsmessung ist dabei kein Selbstzweck, sondern Teil der größeren Frage, wie Ihr Ruf in KI-Antworten aussieht. Wo Sie heute stehen, zeigt eine dokumentierte Ausgangsmessung der KI-Sichtbarkeit.
2. Wie funktioniert Sentiment Analyse technisch?
Sentiment Analyse kennt drei Ansätze. Der erste arbeitet mit einem Wörterbuch: Jedes Wort trägt einen Stimmungswert, Algorithmen zählen zusammen. Das funktioniert wie ein Kassenzettel: Aus positiven und negativen Wörtern, etwa „großartig“ und „Reklamation“, entsteht unter dem Strich eine Summe, im Fachjargon Polarität genannt. Der zweite Ansatz ist maschinell: Ein Modell lernt an Datensätzen, die Menschen vorher von Hand als positiv, negativ oder neutral gekennzeichnet haben. Der dritte kombiniert beides.
Alle drei gehören zur natürlichen Sprachverarbeitung, im Fachjargon Natural Language Processing oder kurz NLP, und damit in dieselbe Familie wie Text Mining und Machine Learning. Sentimentanalysen sind dort ein Teilbereich unter vielen. Der Unterschied liegt im Aufwand: Ein Wörterbuch ist schnell gebaut, stolpert aber über jedes neue Modewort. Ein Modell aus maschinellem Lernen braucht Trainingsdaten, versteht dafür auch Formulierungen, die in keinem Wörterbuch stehen. Für Produktbewertungen genügt meist die automatisierte Auswertung, bei heiklen Themen sollte ein Mensch eine Stichprobe manuell gegenlesen.
3. Beispiel: Wie sieht ein Sentiment-Wert konkret aus?
Ein Sentiment-Wert besteht meist aus zwei Angaben, und genau deshalb wird er so oft falsch gelesen. Die Dokumentation von Google Cloud beschreibt einen Wert zwischen minus 1,0 und plus 1,0 für die Richtung und eine zweite Angabe für die Stärke der Gefühlsäußerung, die bei 0,0 beginnt und nach oben offen ist. Die Richtung sagt, wohin ein Text kippt, die Stärke, wie laut er dabei wird.
Der Unterschied ist der ganze Trick. Google nennt für einen eindeutig positiven Text die Werte 0,8 und 3,0, für einen neutralen Text 0,1 und 0,0 und für einen gemischten Text 0,0 und 4,0. Ein Mittelwert von null heißt also entweder, dass nichts passiert, oder dass sich Lob und Beschwerde lautstark streiten, so wie bei einem Familienessen, bei dem alle gleichzeitig reden. „Die Stärke des Sentiments eines Dokuments zeigt an, wie viel emotionaler Gehalt im Dokument steckt“. Berichtet wird meist nur der Durchschnitt, und damit bleibt die Klassifizierung in positiv, neutral oder negativ die halbe Information. Aussagekräftige Auswertungen brauchen beide Angaben.
Wie spricht die KI über Ihre Marke?
Der KI-Setiments-Kurzcheck liefert innerhalb von fünf Werktagen eine dokumentierte Ausgangsmessung plus drei Sofortmaßnahmen.
4. Wo liegen die Grenzen der Sentiment Analyse?
Die Grenzen der Sentiment Analyse liegen dort, wo Sprache mehrdeutig wird, und Ironie ist der Klassiker. Ein „Na toll, schon wieder kaputt“ enthält ein freundliches Wort und meint das Gegenteil. In der Untersuchung von Schmitt, Schwerk und Lempert kam Gemini-1.5-flash bei der Ironie-Erkennung auch mit der besten Anweisung nur auf einen gewichteten F1-Wert von 0,60, GPT-4o-mini erreichte 0,76. Ein Verfahren, das bei jeder vierten ironischen Aussage danebenliegt, taugt für eine Schlagzeile nicht.
Die zweite Grenze ist die Textsorte. Die Modellkarte des für Deutsch trainierten Modells german-sentiment-bert weist einen F1-Wert von 0,9568 auf Hotelbewertungen aus, aber nur 0,6780 auf dem Datensatz PotTS. Bewertungstexte sind ausformuliert, ein Kommentar in sozialen Netzwerken ist knapp und voller Anspielungen, ähnlich wie ein Insiderwitz unter Kollegen. Je nach Branche verschiebt sich das Vokabular zusätzlich, und negatives Sentiment in ironischer Verpackung rutscht besonders oft durch.
Die dritte Grenze ist die Messlatte selbst. Über 2.667 Annotationsaufgaben aus 1.603 Fachaufsätzen hinweg kommen zwei menschliche Kodierer auf ein Krippendorff-Alpha von 0,585, ein Maß für Übereinstimmung, bei dem 1,0 vollständige Einigkeit bedeutet (arXiv, Juni 2026). Schon zwei Menschen sind sich bei der Stimmung eines Textes also nur ungefähr einig. In der Studie heißt es: „Das beste Modell erreicht eine mit Menschen vergleichbare Übereinstimmung mit geprüften Etiketten, mit einem Krippendorff-Alpha von 0,606 gegenüber 0,585 zwischen zwei Menschen“. Kein automatisches Verfahren kann eindeutiger sein als das Urteil, an dem es gemessen wird.
Praktisch heißt das: Eine Genauigkeit von 100 Prozent ist kein realistisches Ziel. Jeder Bericht sollte deshalb eine Fehlerspanne mitführen, denn ohne sie misst man mit dem Küchenthermometer im Backofen: Zahlen kommen heraus, richtig sind sie nicht. Wer die Kennzahl sauber konstruieren will, hat den halben Weg zur brauchbaren Auswertung schon geschafft.
Eine Stimmungszahl ist nur so viel wert wie die hundert Texte, die jemand einmal selbst gelesen hat.
5. Schritt für Schritt: So führen Sie eine Sentiment Analyse durch
Eine Sentiment Analyse beginnt nicht mit dem Werkzeug, sondern mit der Frage, welche Texte überhaupt zählen. Die folgenden vier Schritte schaffen Sie in einer Woche, und am Ende steht eine Zahl, die Sie erklären können.
Schritt 1: Quellen festlegen
Legen Sie fest, welche Texte in die Auswertung gehören: Bewertungen auf Portalen, Kundenrezensionen im eigenen Shop, offene Antworten aus Umfragen, Erwähnungen aus dem Social Listening. Drei Quellen reichen. Notieren Sie je Quelle, wie viele Texte pro Monat entstehen, denn ohne diese Grundmenge lässt sich später keine Veränderung belegen.
Schritt 2: Stichprobe von Hand einordnen
Ziehen Sie 100 Texte zufällig und kennzeichnen Sie jeden selbst als positiv, negativ oder neutral. Dieselben 100 Texte bewertet danach eine zweite Person, das kostet einen Nachmittag und eine Kanne Kaffee. Die Abweichung zwischen Ihnen beiden ist Ihre realistische Messlatte und später der Prüfstein für jedes Werkzeug, das man Ihnen verkaufen will.
Schritt 3: Verfahren wählen und gegen die Stichprobe prüfen
Lassen Sie die Kandidaten, ob Wörterbuch, fertiges Modell oder eingekauftes Tool, dieselben 100 Texte bewerten. Viele Tools zur Sentimentanalyse werben mit Genauigkeitswerten aus dem Datenblatt, verglichen wird aber mit Ihrer Handauswertung, festgehalten die Trefferquote je Kategorie. Ein Werkzeug, das negative Texte zuverlässig findet und bei neutralen schwächelt, kann trotzdem gut passen.
Schritt 4: Ergebnisse regelmäßig nachmessen
Wiederholen Sie die Messung in festen Abständen, monatlich reicht meist. Einmal im Quartal prüfen Sie 50 frische Texte von Hand nach, denn Sprachgebrauch und Themen verschieben sich. Dokumentieren Sie jede Änderung mit Datum, sonst erklären Sie einen Sprung in der Kurve mit dem Markt, obwohl nur das Modell gewechselt hat.
6. Was hat Sentiment Analyse mit KI-Antworten zu tun?
Sentiment Analyse gilt in den meisten Ratgebern als Thema für soziale Medien und Umfragen. Diese Sicht greift zu kurz, denn ein Teil Ihrer Kundschaft liest keine Bewertungen mehr, sondern fragt gleich einen KI-Assistenten, und dessen Antwort ist selbst verdichtete Stimmung. Systeme mit künstlicher Intelligenz geben damit Einblicke in die Stimmung, die so niemand erhoben hat.
Wie wenig diese Tonlage mit Ihren Quellen zu tun hat, zeigt eine Auswertung von tryanalyze.ai vom August 2026: 22.295 Antworten aus ChatGPT, Perplexity und Google AI Mode, 115.843 Zitatvorgänge. Bei 985 Paaren aus zitierter Seite und Antwort lag die Rangkorrelation nach Spearman bei 0,00, die Tonlage der Quelle sagte die Tonlage der Antwort also überhaupt nicht vorher. Freundlich waren die Antworten trotzdem: 58,3 Prozent positiv, 39,1 Prozent neutral, 0,9 Prozent negativ. Es handelt sich um eine Anbieterauswertung mit offengelegter Stichprobe.
Hier widersprechen wir der üblichen Empfehlung: Der größere Hebel liegt nicht darin, die Stimmung in Ihren Quellen zu polieren, sondern darin, überhaupt ein wertendes Signal maschinenlesbar bereitzustellen. Das stützt unsere Stichprobe vom 20. September mit 30 Startseiten verbrauchernaher Betriebe aus OpenStreetMap. 15 banden ein Bewertungs-Widget ein, dessen Inhalt erst nachgeladen wird, und 29 von 30 lieferten weder als sichtbaren Text noch im Datenformat einen Bewertungswert. Für ein Textmodell, das die Seite ohne Nachladen liest, existieren diese Kundenstimmen nicht, als ob das schönste Lob in einem verschlossenen Schrank läge. Wer das ändern will, braucht eindeutige Angaben über die Marke und Belege in verlässlichen Medien, und er sollte seine Nennungen laufend beobachten.
7. Fazit
Sentiment Analyse ist ein nützliches Werkzeug mit klar benennbaren Grenzen. Sie liefert eine Richtung, keine Wahrheit, und ihre Genauigkeit hängt an Sprache, Textsorte und Aufgabe. Wer sie ohne eigene Stichprobe einsetzt, kauft eine Zahl ohne Maßstab, so wie einen Zollstock ohne Striche.
Dazu kommt: Die Stimmung über Sie wandert künftig auch in KI-Antworten, und dort zählt, was maschinenlesbar vorliegt. Ziel ist deshalb nicht der perfekte Stimmungswert, sondern eine Messung, die Sie erklären können. Gerade für kleinere Unternehmen ist das mit überschaubarem Aufwand zu schaffen, und es macht sogar ein bisschen Spaß, wenn die eigene Handauswertung dem teuren Dashboard auf die Finger schaut.
8. Anhang: Checkliste für die eigene Messung
Erst messen, dann entscheiden
In einem Gespräch klären wir, was ChatGPT, Gemini und Perplexity heute über Ihr Unternehmen sagen, woher diese Antworten stammen und an welcher Stelle Sie nachlegen können. Reicht dafür eine einmalige Messung, sagen wir Ihnen auch das.
9. Häufige Fragen zur Sentiment Analyse
Autor: Simon Hubert ist Gründer von Hubert Strategies in Göttingen und arbeitet an generativer Suchmaschinenoptimierung, Knowledge-Graph-Strukturen und KI-Sichtbarkeit in ChatGPT und Co. Seine erste Digitalagentur gründete er 2011. Er hält einen Master in Business Informatics der Universität Mannheim und ist seit über 20 Jahren in Digitalisierung und IT unterwegs, mehrere Jahre davon in Großkonzernen.
Stand September 2026. Dieser Beitrag gibt den Stand zum Zeitpunkt der Veröffentlichung wieder. Studienergebnisse, Modellversionen und die Angaben in der Dokumentation der Anbieter ändern sich laufend; genannte Werte sind den verlinkten Quellen entnommen. Die eigene Stichprobe ist eine Momentaufnahme und nicht repräsentativ.
