Schluss mit Halluzinationen und halbfertiger Arbeit: ein Weg, der die Qualität Ihrer KI massiv steigert
Dr. Aaron Hutzler · 10 Min. · English

aisen-Blog, Zielgruppe: alle
Sie geben einer KI Ihr Lastenheft, Ihre Stückliste oder Ihren Vertrag zur Prüfung. Dabei gehen Sie davon aus, dass die KI alle Dokumente gründlich liest. Die Antwort klingt gründlich. Das tut sie leider auch dann, wenn sie es nicht ist. Schlamperei und Stümperei werden durch gute Formulierungen kaschiert.
Für genau diese Lücke gibt es ein Werkzeug aus unserem Haus: kostenlos, absichtlich klein und als HTML-Datei mit Prüfskript direkt im Browser oder lokal nutzbar. Nichts wird installiert.
Ob eine Antwort hält, was sie verspricht, entscheidet die Datei rein mechanisch. Am Ende steht:
Tabelle 1: Die drei Urteile und was sie bedeuten.
| Urteil | Bedeutung |
|---|---|
| ACCEPTED | sauber gearbeitet |
| REJECTED | geschlampt oder halluziniert |
| INCONCLUSIVE | nicht prüfbar |
Dazu liefert das Werkzeug eine exakte Liste der Nacharbeit sowie ein Protokoll aus gemessenen Werten: Prüfsummen, Zeichenzahlen und die Abdeckung des Quelldokuments. Keinen dieser Werte liefert die KI selbst.
Was das Werkzeug beweist und was nicht
Damit die Erwartungen von Anfang an stimmen: Die Datei prüft zwei Dinge verlässlich nach.
- Belegprüfung: Steht der Nachweis zu jedem Punkt wirklich im Dokument?
- Abdeckungsprüfung: Hat die Antwort das ganze Dokument erfasst, gemessen an den Abdeckungsregeln der Datei?
Das ist keine Einschränkung, die wir kleinreden. Es ist eine bewusste Arbeitsteilung: Die Datei nimmt Ihnen das zeitintensive Nachschlagen und Vergleichen ab. Beim Lesen denken Sie über den Inhalt nach. Ob die Zahlen überhaupt im Dokument stehen, hat die Datei vorher schon geklärt.
Drei Wege, einen Beleg zu führen
Die Grundidee ist immer dieselbe: Die KI darf behaupten, was sie will. Zu jeder Behauptung muss sie jedoch einen Beleg mitliefern. Den Beleg prüft die Datei selbst nach. Sie versteht drei Belegarten; welche vorliegt, erkennt sie automatisch an der Form der Antwort. Sie müssen keinen Modus wählen.
1. Die Fundstelle. Die Antwort nennt zu jedem Punkt den genauen Ort im Dokument: eine Zeile, einen Abschnitt oder eine Seite. Die Datei liest exakt diese Stelle aus dem Original und prüft Zahlen und Bezeichnungen gegen den Fund. Abgetippt wird nichts. Das ist die robusteste Form: Auf dem Weg durch das Chat-Fenster kann nichts verfälscht werden.
2. Die Regel, für Tabellen. Für Tabellen dreht sich die Beweislast um. Die Antwort nennt die angewendeten Regeln und ihre Funde. Eine Regel besteht aus einer Spalte, einer Bedingung und optional einer Ausnahme, zum Beispiel: Spalte Bedenklicher Stoff, Bedingung enthält Blei, Ausnahme enthält RoHS-Ausnahme. Die Datei wendet diese Regeln selbst auf jede einzelne Zeile an und gleicht das Ergebnis ab. Bricht eine Zeile eine Regel und fehlt in den Funden der KI, wird sie namentlich genannt. Gemessen am Beispiel des Kits: In einer Stückliste mit 800 Zeilen stecken fünf versteckte Verstöße. Die KI meldete nur einen davon. Die Prüfdatei nannte alle fünf.
3. Das Zitat. Jeder Punkt trägt ein wörtliches Zitat aus dem Dokument. Alle Zitate zusammen müssen das ganze Dokument abdecken. Damit fliegen beide Fehlerarten auf: die erfundene Aussage und das nur halb gelesene Dokument. Verglichen wird die Wortfolge, nicht das Schriftbild. Anführungszeichen, Fettschrift, Zeilenumbrüche oder Tausenderpunkte ändern nichts am Urteil. Ein verändertes Wort oder eine veränderte Zahl ändert es immer:
Tabelle 2: Welche Abweichungen vom Quelltext die Prüfung noch als Zitat annimmt. Und welche sie ablehnt.
| Zitat in der Antwort | Ergebnis | Grund |
|---|---|---|
„Die Versicherungssumme beträgt 85.000 Euro" | angenommen | stimmt wörtlich überein |
Die Versicherungssumme beträgt 85.000 Euro | angenommen | Fettschrift zählt nicht |
Die Versicherungssumme beträgt 85000 Euro | angenommen | der Tausenderpunkt zählt nicht |
Die Versicherungssumme beträgt 92.000 Euro | abgelehnt | die Zahl weicht vom Dokument ab |
Welche Dateien Sie prüfen können
Unterstützt werden PDF, Word, Excel, PowerPoint, die entsprechenden OpenDocument-Formate, CSV und reiner Text. Das PDF muss digital erzeugt sein; ein Scan ohne Textebene wird ehrlich abgelehnt statt erraten. Alles, worauf es ankommt, sollte im Fließtext stehen. Fußnoten, Kopfzeilen und das zweite Tabellenblatt liest die Datei nicht.
So läuft die Prüfung ab
Wählen Sie den Laufweg, der zu Ihrer Arbeitsumgebung passt.
Weg 1: Im Browser, ohne Installation.
- Öffnen Sie die Datei pruefung-im-browser.html aus dem Testkit mit einem Doppelklick.
- Fügen Sie die KI-Antwort in das obere Feld ein.
- Ziehen Sie Ihr Originaldokument in das untere Feld.
- Klicken Sie auf Prüfen. Urteil und Protokoll erscheinen sofort auf der Seite.
- Wiederholen Sie die Prüfung nach jeder Nachbesserung, bis ACCEPTED erscheint. Erscheint nie ACCEPTED, suchen Sie sich eine andere KI.
- Danach können Sie mit der KI arbeiten: Nun hat sie das Dokument gelesen und ist bereit. Stellen Sie Ihre restlichen Fragen zügig im selben Gespräch. Lange Verläufe werden von den Assistenten gekürzt. Danach ist der belegte Lesestand weg, ohne dass es Ihnen jemand sagt.
Ihre Dateien bleiben auf diesem Weg vollständig auf Ihrem Rechner. Die Seite benötigt keine Internetverbindung; der Bau des Kits belegt das mit einem Test, der die fertige Seite mit gekappter Verbindung öffnet und trotzdem ein Urteil verlangt.
Weg 2: Direkt im KI-Chat.
- Laden Sie die Prüfdatei aus dem Testkit zusammen mit Ihrem Dokument in den Chat hoch.
- Stellen Sie Ihre Aufgabe und lassen Sie den Assistenten seine eigene Antwort mit der Datei prüfen. Jeder Assistent, der Code ausführen kann, tut das.
- Lesen Sie das Urteil am Ende des Protokolls.
- Bei REJECTED schreiben Sie der KI einen kurzen Satz: Bessere genau die gelisteten Punkte nach und prüfe erneut.
- Wiederholen Sie die Schritte 3 und 4, bis ACCEPTED dasteht. Erst dann lesen Sie die Antwort selbst.
Das Protokoll druckt die Prüfsumme der Datei als digitalen Fingerabdruck mit. Ein vorgetäuschter Prüflauf fällt dadurch sofort auf.
Weg 3: Auf Ihrem Rechner, für Skripte und Automatisierung.
Rufen Sie das Programm über die Kommandozeile mit der KI-Antwort und Ihrem Dokument auf. Das Urteil ist dasselbe wie auf den anderen Wegen. Für die Automatisierung meldet das Programm das Ergebnis zusätzlich als Zahl zurück, mit der ein Skript weiterarbeiten kann.
Was die Prüfschleife bewirkt: ein echtes Beispiel
Ein KI-Assistent verglich zwei Stände eines Lastenhefts gegen 28 Unterschiede, die der Prüfer selbst vorab berechnet hatte.
Tabelle 3: Drei Läufe gegen dieselben 28 vorab berechneten Unterschiede.
| Lauf | Ergebnis | Urteil |
|---|---|---|
| Runde 1 | 23 von 28 Änderungen, 82 %, dazu ein zusammengesetztes Zitat, das die Prüfung nirgends fand | erfunden |
| Runde 2 | 25 von 28, 89 %, die gestrichenen Anforderungen je nur an einer von zwei Fundstellen belegt | erfunden |
| Nach zwei Runden Nacharbeit | 28 von 28 belegt, nichts erfunden | belegt |
Kein Prompt hat diese Präzision auf Anhieb bewirkt. Erst die automatische Nacharbeitsliste hat das Ergebnis erzwungen: Sie gibt der KI jede fehlende Änderung mit exaktem Wortlaut vor.
Nach dem bestandenen Lauf bewertete der Assistent die bestätigten Änderungen. Drei Beispiele aus seiner Antwort: Die Verfügbarkeitsanforderung wurde von MUSS auf SOLL abgeschwächt. Die Abnahmeprüfung wurde von 40 Stunden Dauerlauf auf 40 Zyklen verkürzt. Die Gewährleistungsfrist wurde von 24 auf 12 Monate halbiert. Sein Fazit: Die Behauptung der Gegenseite, die Änderungen seien rein redaktionell, trifft objektiv nicht zu. Diese Bewertung besitzt Gewicht, weil die Prüfung vorher gemessen hatte, dass alle 28 Unterschiede belegt waren.
Funktionen im Überblick
Sie müssen dem Werkzeug nicht sagen, welche Prüfung Sie wünschen. Es analysiert den Aufbau der Antwort und wählt den passenden Prüfmodus selbst:
Tabelle 4: Die drei Prüfmodi. Je Modus die Eingaben, die er braucht, sowie die Kriterien, die er misst.
| Wofür | Sie legen ein | Gemessen wird |
|---|---|---|
| Dokument zusammenfassen | Antwort und Quelldokument | erfundene Aussagen, übersprungene Absätze, die Abdeckung |
| Fundstellen prüfen | Antwort und Quelldokument | ob Zahlen und Kennungen an der genannten Stelle stehen |
| Tabellen prüfen | Antwort und Tabelle | jede Zeile gegen die genannten Regeln, übersehene Zeilen |
| Versionen vergleichen | Antwort, alte und neue Fassung | übersehene und erfundene Änderungen gegen die selbst berechnete Differenz |
| Aktionsplan freigeben | Antwort und optional Ihr Regelwerk | nicht offengelegte Wirkungen, unumkehrbare Schritte ohne Deckung |
| KI-Code prüfen | Antwort und Codedatei | die Datei führt den Code aus: Abstürze, gebrochene Invarianten |
| Grafiken prüfen | PNG oder SVG, dazu eine Spec-Datei | Farben, Maße, Kontrast, Druckauflösung, aktive Inhalte im SVG |
| Den Assistenten selbst testen | Antworten und Schlüsseldatei | ob ein zweites Modell beschädigte Zitate findet, ob Ihres Suggestivfragen zustimmt, wie weit es seit dem letzten Stand abweicht |
Das Prüfmaterial für die letzte Zeile erzeugt die Datei auf Zuruf, jeweils mit einer Lösungsdatei:
Ein Prüfstück für ein zweites Modell. Der Aufruf pruefstueck antwort.txt dokument.txt
erzeugt aus Ihrer geprüften Antwort eine Prüfaufgabe, in der einzelne Zitate absichtlich still
beschädigt sind. Findet ein zweites Modell die beschädigten Stellen, taugt es als Prüfer.
Suggestivfragen. Der Aufruf fragen dokument.txt erzeugt Fragen zu Ihrem Dokument, von denen
jede eine falsche Behauptung enthält. Stimmt Ihr Assistent den Fragen zu, redet er Ihnen nach dem
Mund.
Referenzaufgaben. Der Aufruf aufgaben erzeugt feste Aufgaben mit Lösungsdatei. Damit messen
Sie denselben Assistenten über Monate gegen sich selbst: Liefert er nach einem stillen Update noch
dasselbe wie im Frühjahr?
Die Lösungsdateien behalten Sie. Sie dürfen nie in den Chat, den sie prüfen sollen, sonst liest der Assistent die Lösung mit.
Wer das wofür nutzt
Tabelle 5: Wo das Werkzeug eingesetzt wird, mit Aufgabe, Modus und praktischem Nutzen je Bereich.
| Bereich | Konkrete Aufgabe | Modus | Der praktische Nutzen |
|---|---|---|---|
| Privat | Versicherungspolice und Mietvertrag prüfen | Fundstelle | Die KI überspringt gern die Ausschlüsse; die Abdeckungsprüfung verlangt zu jeder Seite eine Aussage. Zahlen, die nicht im Vertrag stehen, fliegen sofort auf. |
| Ingenieurwesen, Qualität | Lastenhefte vergleichen, Stücklisten auf RoHS und REACH prüfen | Versionsvergleich, Regel | MUSS zu SOLL, gestrichene Anforderungen, geänderte Einheiten. Alle 800 Zeilen werden geprüft, nicht die ersten fünfzig. |
| Management | Vorstandsfolien gegen den Quartalsbericht prüfen | Dokument | Folienzahlen ohne Deckung im Bericht fallen auf, bevor sie im Unternehmen wandern. |
| Einkauf | Angebote und Preislisten vergleichen | Fundstelle, Versionsvergleich | Nicht angebotene Positionen und stillschweigend erhöhte Einzelpreise werden sichtbar. |
| Recht, Compliance | AGB und Vertragsfassungen nach der Verhandlungsrunde prüfen | Versionsvergleich | Änderungen, die als rein redaktionell deklariert wurden und keine sind. |
| Verwaltung, Personal | Anträge und Stellenprofile gegen Richtlinien halten | Fundstelle, Dokument | Kriterien und Zusagen ohne Grundlage im Quelldokument fallen auf. |
| Finanzen | Rechnungen und Reisekosten zeilenweise prüfen | Regel | Alle Verstöße und Abweichungen, nicht nur die auffälligen. |
| IT, Software | KI-geschriebenen Code prüfen | Code | Die Datei führt den Code aus; eine Sortierung, die still Duplikate verliert, fällt an der Invariante durch. |
Wo das Werkzeug an seine Grenzen stößt
Der eigentliche Nutzen liegt in der Zeitersparnis. Das Werkzeug streicht die fehleranfällige Routinearbeit, die niemand gern macht und deshalb selten gründlich erledigt wird: jede Zeile kontrollieren, jede Seite lesen, jede Zahl nachschlagen. Was danach übrig bleibt, ist die Bewertung, für die Sie ausgebildet sind.
Jetzt ausprobieren
Das Testkit steht Ihnen kostenlos zur Verfügung: agent-quality-control
Wer die Prüfung nicht selbst betreiben möchte, bekommt sie im aisen-Portal direkt eingebaut, mit Quellennachweisen und Protokoll zu jeder Antwort:
Betteryields
Die Betteryields GmbH baut Qualitäts-Gates für KI: aisen für KI-Recherchen, Dokumente und Datenanalysen (www.myaisen.com), agentic-gates für Code (agentic-gates.dev)
Betteryields GmbH. Kein Konto nötig, um sich das anzusehen.
