Das Wichtigste in Kürze
- Eine Zusammenfassung kann durch Auslassungen irreführen, ohne offensichtliche Fakten zu erfinden.
- Studien belegen Probleme bei Überverallgemeinerungen und Gesprächszuordnungen, nicht heutige allgemeine KI-Fehlerraten.
- Automatische Qualitätsmetriken haben auf bestimmten Benchmarks Grenzen; Korrekturfeedback kann dennoch helfen.
- Bei relevanten Entscheidungen ist zu prüfen, was im Original steht und in der Kurzfassung fehlt.
Im Protokoll steht: „Die Einführung wurde beschlossen.“ Tatsächlich hatte das Team in seiner Besprechung nur vereinbart, zunächst die Kosten zu prüfen. Die KI-Zusammenfassung liest sich klar und professionell. Trotzdem macht sie aus einer noch offenen Frage eine Entscheidung.
Bei fehlerhaften KI-Texten denken viele zuerst an erfundene Daten oder frei erfundene Zitate. Das passiert. Aber das interessantere Problem ist oft weniger auffällig. Eine Kurzfassung kann nahezu nur plausible Sätze enthalten und dennoch den Sinn des Originals verändern: weil eine Einschränkung fehlt, ein Widerspruch nicht mehr vorkommt oder eine vorläufige Einschätzung als Beschluss erscheint.
Die Forschung zu KI-Zusammenfassungen ist inzwischen konkreter als der Allgemeinplatz „KI halluziniert“. Mehrere Studien zeigen, welche Arten von Informationsverlust auftreten und weshalb auch automatische Prüfverfahren Grenzen haben. Die zentrale Frage lautet: Was darf eine Zusammenfassung nicht weglassen, damit die Aussage des Originals erhalten bleibt?
Eine richtige Aussage kann ein falsches Bild erzeugen
Eine Zusammenfassung muss Informationen auswählen. Andernfalls wäre sie keine. Die Auswahl soll ein Thema erschließen und das Lesen erleichtern. Daraus folgen zwei verschiedene Qualitätsanforderungen. Die übernommenen Aussagen müssen korrekt sein. Und das, was ausgewählt wurde, muss zusammen noch den Zusammenhang wiedergeben, in dem die Aussagen ursprünglich standen.
Man denke an eine Studie, die bei einer bestimmten Patientengruppe unter bestimmten Bedingungen einen positiven Effekt beobachtet. In der Kurzfassung bleibt nur stehen: „Die Behandlung wirkt.“ Das könnte für die untersuchte Gruppe zutreffen. Ohne den Vorbehalt klingt der Satz aber wie ein allgemeiner medizinischer Befund. Es wurde keine Zahl erfunden. Trotzdem hat der Text dem Leser etwas anderes vermittelt.
Bei solchen Fällen hilft die schlichte Frage „Ist dieser Satz wahr?“ nur begrenzt. Man muss auch fragen: „Unter welchen Bedingungen war er im Original wahr?“ und „Welche Informationen fehlen, die seine Reichweite begrenzen?“ Die erste Frage kann sich auf die Kurzfassung richten. Die zweite verlangt den Blick zurück zur Quelle.
Was eine Studie an wissenschaftlichen Kurzfassungen fand
Uwe Peters und Benjamin Chin-Yee haben diesen Mechanismus systematisch untersucht. Ihre 2025 in Royal Society Open Science veröffentlichte Studie vergleicht 4.900 KI-generierte Zusammenfassungen wissenschaftlicher Texte aus zehn ausgewählten Modellen mit den jeweiligen Originalen. Untersucht wurde unter anderem, ob Schlussfolgerungen weiter gefasst werden, als es die Quellen zulassen.
Die Autoren fanden in den untersuchten Texten verbreitete Überverallgemeinerungen. Im Vergleich mit menschlich geschriebenen Zusammenfassungen traten solche Fehler bei den KI-Fassungen deutlich häufiger auf. Die angegebene Odds Ratio beträgt 4,85. Diese statistische Kennzahl beschreibt den Vergleich in der Studie. Sie ist weder eine allgemeine KI-Fehlerquote noch darf sie einfach als relatives Risiko für heutige Zusammenfassungsprodukte gelesen werden.
Überverallgemeinerung in einer Originalstudie
untersuchte KI-Zusammenfassungen wissenschaftlicher Quellen
Odds Ratio gegenüber menschlichen Wissenschaftszusammenfassungen
Peters und Chin-Yee, Royal Society Open Science, 2025. Die Werte gelten nur für das untersuchte Modell- und Textset.
Interessant ist, dass man die entscheidenden Fehler oft nicht durch eine offensichtliche Falschaussage erkennt. Sie entstehen, wenn Vorbehalte, der Kreis der untersuchten Personen oder die Bedingungen eines Befunds fehlen. Bei einer internen Pilotstudie könnte derselbe Mechanismus auftreten, wenn aus „bei den getesteten Standorten wirksam“ ein allgemeines „funktioniert überall“ wird. Das ist eine begründete Übertragung des Mechanismus, keine gemessene Fehlerquote aus Unternehmen.
Die Untersuchung ist ein Beleg für ein konkretes Risiko, nicht für die Aussage, jedes aktuelle Sprachmodell arbeite in jeder Domäne so. Modelle ändern sich, und wissenschaftliche Texte unterscheiden sich von Besprechungen oder Verträgen. Genau deshalb lohnt der Blick auf weitere Forschung, die ganz andere Anforderungen an eine Kurzfassung stellt.
Im Meeting muss die KI auch verstehen, wer etwas gesagt hat
Gespräche bestehen nicht aus sauber ausgearbeiteten Sätzen. Menschen entwickeln Positionen, widersprechen, machen Vorschläge und ziehen sie zurück. Eine brauchbare Zusammenfassung muss deshalb auch Beziehungen erhalten. Wer hat eine Aussage getroffen? Wer hat sie bestritten? Was ist Beschluss, was Prüfauftrag und was bloß eine Idee?
In einer 2024 bei NAACL veröffentlichten Originalstudie prüften Shuaijie She und Kollegen Sprachmodelle mit Dialogzusammenfassungen. Dabei zeigten sich faktische Inkonsistenzen. Unter den untersuchten Schwierigkeiten war das korrekte Verständnis von Subjekt und Objekt, also wer in einer Gesprächssituation wem etwas zuschreibt oder was mit wem geschieht. Das betrifft genau die Informationen, die ein Protokoll für andere brauchbar machen.
Das Forschungsprojekt TofuEval untersuchte thematisch fokussierte Gesprächszusammenfassungen. Die Autorinnen und Autoren ließen einzelne Sätze menschlich auf ihre Faktentreue prüfen und unterschieden mehrere Arten von Fehlern. Sie untersuchten auch, wie gut große Sprachmodelle selbst als Faktenprüfer arbeiten. Im getesteten Setup schnitten diese binären KI-Prüfer teilweise schwächer ab als spezialisierte Prüfmetriken.
Eine weitere Studie von Frederic Kirstein, Terry Ruas und Bela Gipp ließ 200 automatisch erzeugte Meeting-Zusammenfassungen anhand von neun Fehlertypen von Menschen annotieren. Darunter waren Auslassungen, Probleme der Struktur und irrelevante Informationen. Das zeigt, warum ein gut formulierter Text noch kein gutes Protokoll ist. Er kann den richtigen Ton treffen und ausgerechnet die entscheidende Ausnahme verschweigen.
Diese Studien stammen aus konkreten Benchmarks und von früheren Modellständen. Man darf aus ihnen keine durchschnittliche Fehlerrate eines beliebigen Meeting-Assistenten im Oktober 2026 ableiten. Aber sie liefern eine belastbare Erklärung dafür, warum bei Protokollen sprachliche Flüssigkeit mit sachlicher Zuverlässigkeit verwechselt werden kann.
Das größte Problem lässt sich nicht im Ergebnis finden
Eine falsch wiedergegebene Zahl kann auffallen, wenn jemand die Originalquelle danebenlegt. Eine ausgelassene Ausnahme ist tückischer. Sie fehlt gerade dort, wo ein Leser nach ihr suchen würde. Wer nur die Kurzfassung sieht, erhält keinen Hinweis darauf, was ausgelassen wurde. Das Weglassen erscheint wie eine neutrale redaktionelle Auswahl.
Ein hypothetischer Projektstatusbericht macht das deutlich. In der Originalfassung steht: „Der Testbetrieb verlief an den drei teilnehmenden Standorten stabil. Andere Standorte wurden nicht untersucht. Die Freigabe hängt von einer noch ausstehenden Sicherheitsprüfung ab.“ Die KI schreibt: „Der Testbetrieb verlief stabil.“ Der Satz ist für sich genommen nicht erfunden. Wer damit einen flächendeckenden Rollout genehmigen soll, bekommt aber gerade die beiden entscheidenden Grenzen nicht mit.
Das macht nicht jede Verkürzung gefährlich. Wer für sich selbst den groben Verlauf einer langen Rede verstehen möchte, darf mit einer selektiven Kurzfassung zufrieden sein. Bei einer Entscheidungsvorlage liegt die Schwelle anders. Dort kann der nicht erwähnte Vorbehalt mehr Gewicht haben als alle korrekt zusammengefassten Details.
Auch automatische Prüfungen können sich irren
Was liegt näher, als die fertige Kurzfassung von einer zweiten KI kontrollieren zu lassen? Solche Kontrollverfahren können nützlich sein. Doch sie müssen erkennen, ob die Aussagen im Original dieselbe Bedeutung haben – selbst wenn sie sprachlich anders formuliert sind oder ihre Belege über weit entfernte Textstellen verteilt liegen.
Eine ACL-Studie vom Juli 2026 untersuchte die Robustheit von sechs verbreiteten Faktenkonsistenzmetriken bei langen Zusammenfassungen. Zain Muhammad Mujahid, Dustin Wright und Isabelle Augenstein veränderten Testtexte durch bedeutungserhaltende Umformulierungen, Vereinfachungen und verwandte Eingriffe. Obwohl der Sinn erhalten bleiben sollte, fielen die Bewertungen der untersuchten Metriken teilweise unterschiedlich aus. Informationsreiche Aussagen und lange Dokumente erwiesen sich als besonders schwierig.
Die Ergebnisse widerlegen nicht jede technische Methode zur Qualitätssicherung. Sie beziehen sich auf ausgewählte Metriken und Datensätze. Sie zeigen aber, weshalb ein einzelner hoher Prüfwert nicht beweist, dass eine Langtext-Zusammenfassung alle entscheidenden Vorbehalte erhalten hat. Eine gute Kontrolle muss mit Bedeutung, Kontext und Auslassungen umgehen, nicht bloß mit Ähnlichkeit zwischen zwei Texten.
Die offene Aufgabe ist also anspruchsvoller als ein zweiter Prompt. Das ursprüngliche Dokument kann selbst widersprüchlich sein. Gesprächsbeiträge können mehrdeutig bleiben. Ein Punkt kann für die spätere Entscheidung wichtig sein, obwohl er im Meeting nur kurz erwähnt wurde. Auch ein automatischer Prüfer braucht Kriterien, welche dieser Unterschiede relevant sind.
Der Einwand ist berechtigt: Automatische Zusammenfassungen können besser werden
Die bisherigen Befunde sind kein vernünftiges Argument für ein pauschales KI-Verbot. Zusammenfassungen können große Dokumente erschließen, Themen auffindbar machen und Kollegen den Einstieg in einen Gesprächsverlauf erleichtern. Man muss nicht jede Aufzeichnung vollständig ansehen, wenn zunächst nur eine Orientierung benötigt wird.
Auch die Forschung zeigt Verbesserungschancen. Kirstein, Ruas und Gipp testeten einen Ansatz, bei dem Fehler in einer Meeting-Zusammenfassung identifiziert und mithilfe dieses Feedbacks korrigiert werden. Ihre Untersuchung fand bessere Werte unter anderem für Relevanz und Informationsgehalt. Das ist eine substanziell positive Gegenposition: Ein KI-Ergebnis muss nicht beim ersten Entwurf stehen bleiben.
Aber auch dieser Befund gilt für die untersuchte Aufgabe. Eine nachbearbeitete Meeting-Zusammenfassung ist damit nicht automatisch ein rechtssicheres Protokoll, eine freigegebene Entscheidungsvorlage oder eine fehlerfreie Darstellung aller Gesprächsinhalte. Genau diese Unterscheidung entscheidet, wie eine Organisation den Text weiterverwenden sollte.
Was vor einer wichtigen Entscheidung geprüft werden sollte
Wer eine Kurzfassung auf ihre Tauglichkeit prüfen will, sollte zuerst ihren Zweck kennen. Für einen schnellen Überblick darf vieles wegfallen. Für einen Beschluss müssen gerade die Informationen erhalten bleiben, die eine Entscheidung begrenzen oder in Frage stellen. Aus den beschriebenen Fehlerklassen lässt sich deshalb ein zweckgebundener Quellenabgleich ableiten. Er ist eine redaktionelle Empfehlung, kein extern validierter Standard.
Reichweite: Stimmt die Aussage nur unter bestimmten Bedingungen oder für einen begrenzten Fall? Sind diese Grenzen erhalten geblieben?
Status und Person: Wer hat einen Vorschlag gemacht, wer widersprochen, und was ist tatsächlich entschieden worden?
Fehlendes: Welche Ausnahmen, Gegenargumente und offenen Prüfungen stehen in der Quelle, tauchen aber im Ergebnis nicht auf?
Diese Prüfung ist etwas anderes als die Aufforderung, jedes Dokument ein zweites Mal vollständig zu schreiben. Sie setzt dort an, wo ein Fehler wirkliche Folgen hätte. Wenn eine Zusammenfassung eine Sicherheitsfreigabe begründen soll, ist die offene Sicherheitsprüfung relevant. Wenn sie lediglich einen Kollegen über die Themen eines Treffens informiert, ist vielleicht ein kurzer Hinweis auf den vorläufigen Status ausreichend.
Der Empfänger sollte außerdem erkennen können, ob er eine automatisch erzeugte Orientierung oder eine bereits überprüfte Arbeitsgrundlage vor sich hat. „Zusammengefasst“, „quellengeprüft“ und „verbindlich entschieden“ sind unterschiedliche Zustände. Werden sie gleichgesetzt, entstehen Fehler, die man dem Text allein nicht ansehen kann.
Die Zusammenfassung ist der Einstieg, nicht das Original
Das Paradox ist einfach: Eine gute Zusammenfassung macht Informationen überschaubar, indem sie etwas weglässt. Genau dadurch kann sie den Sinn verschieben. Im Alltag ist die gefährlichste Abweichung deshalb nicht immer der frei erfundene Satz. Es kann gerade der Satz sein, der im Original stand und im Ergebnis nicht mehr vorkommt.
Die genannten Studien belegen unterschiedliche Fehler unter konkreten Modell- und Testbedingungen, keine allgemeine heutige Fehlerrate. Sie zeigen auch, dass gezielte Nachbearbeitung helfen kann. Beides spricht für eine bessere Arbeitsteilung statt für einen Generalverdacht gegen KI.
Bei folgenreichen Kurzfassungen bleibt dennoch eine Frage offen, bis jemand die Quelle geprüft hat: Was müsste ich wissen, das hier nicht steht? Die Antwort lässt sich nicht aus dem glatten Ergebnis allein herauslesen.
Quellen
- Peters and Chin-Yee: Generalization bias in large language model summarization of scientific research — Royal Society Open Science · 2025
- She et al.: Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models — Association for Computational Linguistics
- Tang et al.: TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization — Association for Computational Linguistics
- Kirstein et al.: What's Wrong? Refining Meeting Summaries with LLM Feedback — Association for Computational Linguistics
- Mujahid et al.: Stress Testing Factual Consistency Metrics for Long-Document Summarization — Association for Computational Linguistics