Eine KI-Halluzination ist keine Fehlfunktion, sondern die Kehrseite dessen, was Sprachmodelle tun: Sie erzeugen den wahrscheinlichsten nächsten Text, nicht die geprüfte Wahrheit. Deshalb verschwindet das Problem auch nicht mit dem nächsten Modell. Was du dagegen tun kannst, ist es erkennbar zu machen – und genau das ist erlernbar. Hier steht, wie. Stand: September 2026.
Warum das passiert
Ein Sprachmodell hat keine Datenbank, in der es nachschlägt. Es hat ein statistisches Bild davon, welche Wörter aufeinander folgen. Auf die Frage nach einem Paragrafen erzeugt es deshalb etwas, das aussieht wie eine Paragrafenangabe – richtiges Format, plausible Nummer, passendes Gesetz. Ob es diesen Paragrafen gibt, ist eine andere Frage, und sie wird beim Erzeugen gar nicht gestellt.
Daraus folgen drei Eigenschaften, die man kennen sollte:
Erfundenes sieht aus wie Gewusstes. Es gibt keinen Tonfallwechsel, keine Unsicherheitsmarkierung. Genau das macht es gefährlich.
Es trifft bevorzugt das Überprüfbare. Zahlen, Daten, Namen, Paragrafen, Studien, Zitate – also ausgerechnet die Bestandteile, auf die man sich stützen möchte.
Nachfragen hilft nur begrenzt. „Bist du sicher?“ führt oft dazu, dass das Modell seine Antwort ändert – unabhängig davon, ob sie richtig war. Bestätigung ist kein Beleg.
„Die neuen Modelle machen das nicht mehr.“ Neuere Modelle halluzinieren seltener und, was schlimmer ist, überzeugender. Der Anteil offensichtlicher Fehler sinkt, der Anteil plausibler bleibt. Für die Praxis heißt das: Der Prüfaufwand sinkt nicht, er verschiebt sich.

Wo es typischerweise auftritt
| Situation | Risiko | Typische Form |
|---|---|---|
| Frage zu Nischen- oder Lokalwissen | hoch | plausible, aber falsche Details |
| Quellen, Studien, Zitate | sehr hoch | existierende Autoren, erfundene Titel |
| Paragrafen und Aktenzeichen | sehr hoch | richtiges Format, falsche Nummer |
| Aktuelle Ereignisse ohne Websuche | hoch | Stand des Trainings statt Gegenwart |
| Rechnen über mehrere Schritte | mittel | ein Zwischenschritt kippt, der Rest folgt sauber |
| Zusammenfassen eines vorliegenden Textes | niedrig bis mittel | Ergänzungen, die im Original fehlen |
| Umformulieren, Struktur, Stil | sehr niedrig | kaum Faktenanteil |
Die letzte Zeile ist die praktische Konsequenz: Aufgaben, bei denen du das Wissen mitbringst und die KI nur die Form beisteuert, sind fast risikofrei. Das Risiko steigt in dem Maß, in dem du Inhalte erwartest, die du selbst nicht hast.
Ein Muster, das uns in der Redaktion regelmäßig begegnet: Auf die Frage nach einer Rechtsgrundlage kommt eine Antwort im Format „§ 12 Absatz 3 des [passend klingenden Gesetzes]“ – richtige Struktur, plausible Nummer, thematisch stimmiges Gesetz. Beim Nachschlagen im Normtext regelt der Absatz etwas völlig anderes, oder es gibt ihn nicht. Der Fehler ist von außen nicht erkennbar, weil Formulierung und Selbstsicherheit identisch sind mit denen einer richtigen Antwort. Wir haben deshalb die Regel, dass jede Paragrafenangabe vor der Veröffentlichung am Gesetzestext gegengeprüft wird – nicht in Zweifelsfällen, sondern immer.
Fünf Signale, an denen du es erkennst
- Auffällig runde oder auffällig präzise Zahlen. „Rund 30 Prozent“ ist unverdächtig. „31,7 Prozent“ ohne Quelle ist ein Warnsignal – Präzision suggeriert Beleg, wo keiner ist.
- Quellen ohne prüfbaren Anker. Eine Studie ohne Jahr, Institut oder Link ist erst einmal nichts. Prüfen heißt: den Titel suchen, nicht den Namen.
- Passt zu gut zur Frage. Wenn eine Antwort deine These exakt bestätigt, ist Skepsis angebracht. Modelle neigen dazu, die erwartete Antwort zu liefern.
- Details, nach denen du nicht gefragt hast. Ungefragte Zusatzangaben – eine Jahreszahl, ein Ort, ein Name – sind häufiger erfunden als der Kern der Antwort.
- Die Antwort ändert sich beim zweiten Fragen. Stell dieselbe Frage in einem neuen Chat. Weichen die Antworten inhaltlich ab, weißt du, dass keine feste Wissensbasis dahintersteht.
Was das Risiko wirklich senkt
Material mitliefern statt abfragen. Der wirksamste Hebel überhaupt. Ein Modell, das aus einem hochgeladenen Dokument antwortet, erfindet deutlich seltener als eines, das aus dem Gedächtnis antwortet. Wie das mit Dokumenten funktioniert, steht im Guide PDF zusammenfassen lassen.
Fundstellen verlangen. „Nenne zu jeder Aussage die Seite“ oder „zitiere den Satz, auf dem das beruht“. Kostet nichts und macht Prüfen zur Zehn-Sekunden-Aufgabe.
Die Erlaubnis geben, nichts zu wissen. Ein Satz im Prompt wirkt erstaunlich stark: „Wenn du es nicht sicher weißt, schreib das, statt zu schätzen.“ Ohne diese Erlaubnis füllt das Modell Lücken.
Websuche einschalten, wenn Aktualität zählt. Modelle mit Suchzugriff belegen ihre Aussagen mit Links – die kann man anklicken. Das verlagert das Problem von „stimmt das?“ zu „taugt die Quelle?“, und das ist eine Frage, die Menschen gut beantworten können.
Technisch: an Quellen binden. In Unternehmen läuft das über Systeme, die Antworten an eine eigene Dokumentenbasis koppeln – erklärt im Guide RAG.
„Antworte nur auf Basis der beigefügten Dokumente. Nenne zu jeder Aussage die Fundstelle. Wenn etwas in den Unterlagen nicht steht, schreib ausdrücklich, dass es dort nicht steht – schätze nicht.“
Drei Sätze, die zusammen mehr bewirken als jeder Modellwechsel. Der letzte ist der wichtigste.Wer haftet, wenn es schiefgeht
Kurz: der Mensch, der es verwendet. Es gibt keine Konstellation, in der „das hat die KI so geschrieben“ eine Verteidigung ist – weder gegenüber Kundinnen noch gegenüber Behörden noch arbeitsrechtlich. Daraus folgen drei betriebliche Konsequenzen:
Ergebnisse brauchen eine Prüfinstanz. Wer den KI-Output freigibt, muss ihn beurteilen können. Wenn niemand im Haus das kann, ist die Aufgabe falsch verteilt.
Der Prüfschritt gehört in den Prozess, nicht in die gute Absicht. „Wir schauen natürlich drüber“ ist kein Verfahren. Wer prüft was, woran, bevor es rausgeht – das gehört aufgeschrieben.
Nach außen gilt Transparenz. Der europäische Rechtsrahmen sieht Kennzeichnungspflichten für KI-erzeugte Inhalte vor; der Überblick steht im Guide AI Act. Und Beschäftigte müssen wissen, wie sie mit den Werkzeugen umgehen sollen – dazu der Guide KI-Kompetenz im Betrieb.
Häufige Fragen
Was ist eine KI-Halluzination?
Eine Ausgabe, die plausibel formuliert, aber sachlich falsch oder frei erfunden ist. Sie entsteht, weil Sprachmodelle den wahrscheinlichsten nächsten Text erzeugen und nicht in einer Faktenbasis nachschlagen.
Warum erfindet KI Quellen und Studien?
Weil Quellenangaben ein sehr regelmäßiges Textmuster haben. Das Modell erzeugt etwas, das die Form einer Quelle hat – Autor, Jahr, Titel – ohne zu prüfen, ob es die Arbeit gibt. Häufig sind die Autoren echt und der Titel erfunden.
Halluzinieren neuere Modelle weniger?
Sie halluzinieren seltener und dabei überzeugender. Offensichtliche Fehler nehmen ab, plausible bleiben. Der Prüfaufwand verschwindet dadurch nicht, er verlagert sich auf schwerer erkennbare Fälle.
Wie kann ich Halluzinationen vermeiden?
Material mitliefern statt abfragen, Fundstellen verlangen, die Erlaubnis geben, etwas nicht zu wissen, und bei Aktualitätsfragen die Websuche nutzen. In Unternehmen zusätzlich über eine Bindung an die eigene Dokumentenbasis.
Hilft es, die KI zu fragen, ob sie sicher ist?
Kaum. Auf Nachfragen ändern Modelle ihre Antwort oft unabhängig davon, ob sie richtig war. Eine Selbstbestätigung ist kein Beleg; nur eine überprüfbare Fundstelle ist einer.
Wer haftet für falsche KI-Ergebnisse?
Wer sie verwendet. Ein Verweis auf das Werkzeug entlastet weder gegenüber Kunden noch gegenüber Behörden. Deshalb gehört ein benannter Prüfschritt in den Arbeitsablauf und nicht in die gute Absicht.
Prüfen ist die Kompetenz, die zählt
Ergebnisse erzeugen kann inzwischen jeder. Beurteilen zu können, ob eines stimmt, ist der Unterschied – und genau das üben wir in unserer geförderten Weiterbildung an echten Aufgaben aus deinem Berufsfeld. Ob eine Förderung in Betracht kommt, klären wir im kostenlosen Erstgespräch; entschieden wird sie von der Agentur für Arbeit.
Kostenloses Erstgespräch sichern
Paul Niebler – Gründer der Scaly Academy. Über zehn Jahre IT-Consulting mit Schwerpunkt KI, unter anderem bei IBM und mit seinem zweiten Unternehmen Pexon Consulting. Er setzt die hier beschriebenen Werkzeuge selbst täglich ein und schreibt auf, was davon im Betrieb trägt – und was nicht. Einschätzung, keine Rechtsberatung. Paul auf LinkedIn