KI, die Kreative Intelligenz jetzt in der neuesten Folge SMART&nerdy! Podcastfolge #23.

Echt ist nicht gleich wahr: Drei Säulen gegen die neue Macht der Desinformation
Illustration eines digitalen Prüfprozesses, bei dem Herkunft, Forensik und Inhalt eines Medienbeitrags analysiert und miteinander verknüpft werden.

Echt ist nicht gleich wahr:

Drei Säulen gegen die neue Macht der Desinformation

Jakob Tesch, Gretchen AI

(Titelbild: © Gretchen AI GmbH )

Kurz und Bündig

Multimodale Verifikation stützt sich auf drei Säulen: Herkunft, Forensik und Inhalt. Herkunftsprüfungen und kryptografische Nachweise geben Aufschluss über die Entstehung eines Mediums, forensische Verfahren suchen nach technischen Spuren und Claim-Checking überprüft die darin transportierten Behauptungen. Keine dieser Methoden liefert allein Gewissheit. Ihre Kombination ermöglicht jedoch eine belastbarere Einordnung digitaler Inhalte und macht Verifikation skalierbarer, ohne menschliche Urteilskraft vollständig zu ersetzen.

Die perfekte Fälschung ist nicht das größte Problem. Gefährlicher wird es, wenn ihre bloße Möglichkeit genügt, um auch echte Bilder, Stimmen und Videos anzuzweifeln. In einem Informationsraum voller KI-generierter Inhalte gerät damit nicht nur die Wahrheit unter Druck, sondern das Vertrauen in Belege selbst. Die Antwort darauf ist keine Wahrheitsmaschine, sondern eine neue Kultur der Verifikation.

„The real opposition is the media. And the way to deal with them is to flood the zone with shit.“ Dieser Satz von Steve Bannon ist 2020 durch einen viel zitierten Essay bekannt geworden. In einer aktualisierten Fassung müsste er heute lauten: flood the zone with AI slop – flute die Zone mit KI-Müll. Angesichts des Zustands der digitalen Informationswelt im Jahr 2026 dürfte Bannon heute sehr zufrieden sein. Denn das Ziel der Strategie war nie, eine einzelne überzeugende Lüge zu platzieren. Ihr Ziel ist die Erschöpfung: so viel widersprüchliches, teils falsches, teils echtes Material in Umlauf zu bringen, dass das Publikum irgendwann aufgibt, zwischen Wahr und Falsch zu unterscheiden. Nicht die perfekte Fälschung ist die eigentliche Gefahr, sondern der Vertrauensverlust, den ihre bloße Möglichkeit auslöst.

Die falsche Frage: „Ist das echt?“

Generative Modelle haben die Produktionskosten für synthetischen Content gegen null gedrückt. Ein Foto, ein Videoclip, eine geklonte Stimme mit passender Beschreibung, Emojis und Hashtags – all das entsteht heute schneller, als eine Redaktion es prüfen kann. Daraus wird gern der Schluss gezogen, man brauche nur ein zuverlässiges Werkzeug, das per Knopfdruck „echt“ oder „gefälscht“ ausgibt. Dieser Wunsch führt in die Irre, und zwar aus einem grundlegenden Grund: Manipulierbarkeit und Wahrheitsgehalt sind zwei verschiedene Dinge.

Ein vollständig KI-generiertes Bild kann einen realen Sachverhalt korrekt illustrieren. Eine unbearbeitete Originalaufnahme kann, aus dem Kontext gerissen, grob in die Irre führen – man denke an ein authentisches Foto, das mit falschem Ort und falschem Datum verbreitet wird. Die Feststellung „synthetisch erzeugt“ ist deshalb kein Urteil über Wahr oder Falsch, sondern nur ein Hinweis auf die Entstehungsweise. Umgekehrt beweist „technisch unmanipuliert“ nicht, dass eine Darstellung die Realität zutreffend wiedergibt. Darüber hinaus beziehen sich die großen Desinformationskampagnen heutzutage weniger auf konkrete Ereignisse, sondern versuchen subtiler, eben genau durch ihre Masse, Wiederholung, und teilweise versteckte Kernbotschaften Wirkung zu entfalten. Die technische Authentizität eines Inhalts und die Wahrheit seiner Aussage müssen deshalb getrennt voneinander betrachtet werden.


Wer Desinformation ernsthaft einordnen will, muss die Frage „Ist das echt?“ durch drei präzisere ersetzen: Woher stammt der Content? Was verrät das Signal selbst? Und passt es zu allem, was wir sonst über das Ereignis wissen? Herkunft, Forensik und Inhalt sind also die drei Säulen der multimodalen Verifikation. Keine trägt allein; erst ihr Zusammenspiel erlaubt belastbare Einordnung.

Säule 1: Herkunft (Provenance)

Die Herkunft eines Inhalts lässt sich dabei auf zwei Wegen prüfen: reaktiv, indem seine Entstehungs- und Verbreitungsgeschichte rekonstruiert wird, oder proaktiv, indem Herkunftsinformationen bereits bei der Erstellung technisch abgesichert werden. Der reaktive Ansatz verlagert den Blick vom Pixel auf die Welt. Open-Source-Intelligence-Methoden, wie sie Recherchekollektive à la Bellingcat etabliert haben, prüfen nicht, wie ein Medium erzeugt wurde, sondern ob es zur Realität passt. Die Rückwärtssuche über Google, Baidu oder TinEye deckt auf, ob ein angeblich aktuelles Bild schon Jahre älter ist. Die Geolokalisierung verankert eine Aufnahme im Raum und gleicht sie mit Satellitenbildern ab. Die Chronolokalisierung bestimmt die Zeit über Schattenwurf und Sonnenstand oder den Abgleich mit historischen Wetterdaten. Über allem steht die Quellentriangulation: die Bestätigung durch mehrere voneinander unabhängige Belege statt eines Einzelfunds. Das funktioniert und kann in vielen Fällen erheblich zur Aufklärung beitragen, hat aber seine Grenzen in der schlechten Durchsuchbarkeit einiger sozialer Netzwerke- so kann genau der wichtigste Bereich des Netzes nicht vollständig durchsucht werden.


Zusätzlich lässt sich proaktiv am Entstehungszeitpunkt ansetzen. Statt dem fertigen Content nachträglich seine Geschichte abzuringen, wird die Herkunft von Anfang an kryptografisch eingeschrieben. Der maßgebliche Standard ist C2PA (Coalition for Content Provenance and Authenticity) mit der Endnutzer-Kennzeichnung Content Credentials, oft als „Nährwerttabelle für digitale Medien“ beschrieben. Dabei werden Informationen zur Herkunft und Bearbeitung eines Inhalts kryptografisch abgesichert, sodass spätere Veränderungen nachvollziehbar werden.

Die Trägerschaft ist prominent: Adobe, Microsoft, BBC, Sony, OpenAI und andere. OpenAI kennzeichnet Bilder aus DALL·E und Videos aus Sora entsprechend; Googles Pixel 10 brachte 2025 Content Credentials erstmals serienmäßig in ein Consumer-Smartphone; Sony bietet mit „Camera Verify“ seit 2025 eine Signaturlösung für Pressefotografie. Parallel verfolgt Google DeepMind mit SynthID einen Wasserzeichen-Ansatz, der unsichtbare bzw. unhörbare Marker direkt in KI-erzeugte Bilder, Videos, Audios und Texte einbettet und maschinell auslesbar macht.


So verlässlich der proaktive Ansatz ist, seine Schwächen sind strukturell. Erstens die Verbreitung: Bis 2025 trug nur ein verschwindend geringer Teil der Online-Inhalte C2PA-Daten. Zweitens die Angreifbarkeit: Signaturen lassen sich entfernen oder als “Qualitätssiegel” absichtlich hinzufügen, kurz, Metadaten können falsch sein, denn man vertraut dem Signierenden, nicht dem Inhalt. Die 2025 bei der Nikon Z6 III aufgedeckte Lücke, über die sich unauthentische Bilder mit gültiger Signatur versehen ließen, zeigte das exemplarisch. Provenance ist also ein starkes Fundament, aber keines, auf das man sich blind verlassen darf.

Säule 2: Forensik und Detektion

Ein wesentlicher Baustein bleibt deshalb, dem Signal selbst seine Geschichte zu entlocken. Die klassische Bildforensik verfügt bspw. mit PRNU-Analyse, Error Level Analysis, EXIF-Metadatenprüfung über ein etabliertes Instrumentarium. Diese Verfahren sind teilweise nicht robust und bei KI-generierten Inhalten nur bedingt hilfreich.


In diesem Feld treten zunehmend KI-basierte Detektoren an – und bringen einen echten Mehrwert. Ihre Stärke liegt in der Massenanwendung. Regelmäßig nachtrainiert und um Visualisierung ihrer Ergebnisse ergänzt, können sie Spuren von KI-Generatoren in Audio, Bild und Video kennzeichnen und aus dem Datenstrom der menschlichen Überprüfung zuführen. Klar, sie haben auch Schwächen, sie sind anfällig für gezielte Störungen (adversariale Robustheit), und sie stecken in einem strukturellen Wettlauf – jeder neue Generator fordert die Detektoren heraus. Untersuchungen zeigen, dass die Leistungsfähigkeit von Detektoren ohne regelmäßiges Nachtraining erheblich abnehmen kann. Dennoch: gerade auf großen Plattformen und im Journalismus führt kein Weg an den Detektoren vorbei. Forensik ist somit ein wesentlicher Baustein: ihre Anwendung wird sich noch vervielfachen und in alle Bereiche einziehen, in denen weitreichende Entscheidungen auf digitalem Content basieren, (beispielsweise Militär, Gerichte). Sie liefert wichtige Indizien und wird so zum unverzichtbaren Sparringspartner für Analysten, Journalistinnen, Moderatoren und Sachverständige.

Säule 3: Inhalt und Claims

Herkunft und Signal sagen noch nichts darüber aus, was ein Beitrag eigentlich behauptet. Die dritte Säule prüft deshalb den Claim selbst – die konkrete, überprüfbare Aussage (ggf. automatisiert extrahiert auch aus Bild-, gesprochener- oder per Text-Overlay eingefügter Sprache). Genau hier setzt automatisiertes Claim-Checking an: Systeme extrahieren die Behauptungen aus Text, Transkript oder Untertitel, gleichen sie mit Faktendatenbanken, Primärquellen und bereits geprüften Aussagen ab und liefern eine Einordnung samt Belegen. Erste Anbieter tun das inzwischen nahezu in Echtzeit – live während einer TV-Debatte oder direkt im Feed, wo eine Aussage markiert wird, kaum dass sie gepostet ist. Der Reiz liegt in der Skalierung: Wo OSINT-Handarbeit den Einzelfall klärt, sichtet die Automatik Behauptungen in der Masse. Ihre Grenze bleibt die Urteilskraft – Ironie, Kontext und gänzlich neue Behauptungen überfordern sie, weshalb sie vorsortiert, aber nicht letztinstanzlich entscheidet.

Der Preis dieses Ansatzes ist Aufwand – Kontextprüfung ist Handarbeit und skaliert schlecht. Sein Vorteil ist Robustheit: Sie funktioniert auch dann, wenn Herkunftsdaten fehlen und die Forensik ratlos bleibt. Kommerzielle Anbieter sind zunehmend erfolgreich dabei, diese Forschungsergebnisse in Produkte zu überführen.

Was die Praxis lehrt

Und das ist notwendig, denn die politische Sprengkraft ist längst dokumentiert. Zwei Tage vor der Vorwahl in New Hampshire verbreiteten im Januar 2024 automatisierte Anrufe eine KI-geklonte Stimme von Joe Biden, die Wähler vom Urnengang abhalten sollte; die US-Regulierungsbehörde FCC schlug daraufhin eine Strafe von sechs Millionen Dollar gegen den Verantwortlichen vor und stellte klar, dass KI-Stimmen als „künstlich“ im Sinne des Telefonwerberechts gelten. Schon im September 2023 kursierte kurz vor der slowakischen Parlamentswahl ein gefälschter Audioclip, der einen Spitzenkandidaten scheinbar über Wahlmanipulation sprechen ließ – lanciert im Kommunikationsmoratorium, in dem eine Richtigstellung kaum noch Wirkung entfalten konnte. Aktuell tauchen in sozialen Netzwerken Videos in englischer Sprache und mit (gefälschtem) Logo deutscher Medien auf, die unverhohlen Politikerinnen der anstehenden Landtagswahlen im September zu diskreditieren versuchen.


Diese Fälle eint, dass keine einzelne Methode sie geknackt hätte. Der Robocall wurde über die Telekommunikationsspur zurückverfolgt, der slowakische Clip über Kontext und Timing eingeordnet. Mittlerweile sind viele Akteure und Initiativen dabei, im Informationsraum dagegen zu halten. Verifikation ist selten ein forensischer Volltreffer, sondern meist geduldige Indizienarbeit im Team über mehrere Säulen hinweg.

Die eigentliche Front: das Vertrauen

Der gefährlichste Effekt ist nicht die gelungene Fälschung, sondern das, was die Rechtswissenschaftler Robert Chesney und Danielle Citron die „Liar’s Dividend“ nennen – die Dividende des Lügners. Wenn jeder weiß, dass Stimmen und Videos fälschbar sind, kann sich jeder auf diese Möglichkeit berufen: Echte, belastende Aufnahmen lassen sich pauschal als „KI-Fake“ abtun. Genau hier schließt sich der Kreis zu Bannons Strategie. Sie braucht keine perfekte Fälschung. Sie braucht nur genug Rauschen, damit am Ende alles anzweifelbar wird – auch das Echte.

Gegen diese Erosion hilft kein einzelnes Tool, sondern eine Haltung: Herkunft prüfen, wo Provenance vorhanden ist; das Signal forensisch analysieren und den Inhalt prüfen, Multimodale Verifikation ist damit weniger eine Technologie als eine Methodik – transparent, nachvollziehbar und ehrlich in Bezug auf ihre Unsicherheiten. Sie liefert keine Wahrheitsmaschine. Aber sie ist das beste Mittel, um die Zone nicht dem Müll zu überlassen. Die entscheidende Herausforderung liegt deshalb darin, diese Form der Verifikation aus dem Kreis spezialisierter Fachleute in den digitalen Alltag zu übertragen.

LinkedIn
WhatsApp
Telegram
Facebook

August-Wilhelm Scheer Institut

Weitere Artikel entdecken

Entdecken Sie unsere neusten Ausgaben

Digitaler Angriff auf die Realität