BetteryieldsBetteryieldsBetteryields GmbH
← Blog

Schluss mit Halluzinationen und halbfertiger Arbeit: ein Weg, der die Qualität Ihrer KI massiv steigert

Dr. Aaron Hutzler · 10 Min. · English

Ein Ingenieur von hinten am Schreibtisch hält ein einzelnes Blatt gegen das Fensterlicht, davor ein aufgeschlagener Ordner mit technischen Zeichnungen und ein Laptop
Dieses Bild wurde mit KI erzeugt.

aisen-Blog, Zielgruppe: alle

Sie geben einer KI Ihr Lastenheft, Ihre Stückliste oder Ihren Vertrag zur Prüfung. Dabei gehen Sie davon aus, dass die KI alle Dokumente gründlich liest. Die Antwort klingt gründlich. Das tut sie leider auch dann, wenn sie es nicht ist. Schlamperei und Stümperei werden durch gute Formulierungen kaschiert.

Für genau diese Lücke gibt es ein Werkzeug aus unserem Haus: kostenlos, absichtlich klein und als HTML-Datei mit Prüfskript direkt im Browser oder lokal nutzbar. Nichts wird installiert.

Ob eine Antwort hält, was sie verspricht, entscheidet die Datei rein mechanisch. Am Ende steht:

Tabelle 1: Die drei Urteile und was sie bedeuten.

UrteilBedeutung
ACCEPTEDsauber gearbeitet
REJECTEDgeschlampt oder halluziniert
INCONCLUSIVEnicht prüfbar

Dazu liefert das Werkzeug eine exakte Liste der Nacharbeit sowie ein Protokoll aus gemessenen Werten: Prüfsummen, Zeichenzahlen und die Abdeckung des Quelldokuments. Keinen dieser Werte liefert die KI selbst.

Was das Werkzeug beweist und was nicht

Damit die Erwartungen von Anfang an stimmen: Die Datei prüft zwei Dinge verlässlich nach.

  1. Belegprüfung: Steht der Nachweis zu jedem Punkt wirklich im Dokument?
  2. Abdeckungsprüfung: Hat die Antwort das ganze Dokument erfasst, gemessen an den Abdeckungsregeln der Datei?
Was sie nicht bewertet
Ob die Antwort inhaltlich richtig, klug, rechtssicher oder fachlich geeignet ist, entscheidet die Datei nicht. Ein echtes, aber völlig belangloses Zitat besteht die Prüfung. Einheiten versteht sie nicht, rechnen kann sie nicht.

Das ist keine Einschränkung, die wir kleinreden. Es ist eine bewusste Arbeitsteilung: Die Datei nimmt Ihnen das zeitintensive Nachschlagen und Vergleichen ab. Beim Lesen denken Sie über den Inhalt nach. Ob die Zahlen überhaupt im Dokument stehen, hat die Datei vorher schon geklärt.

Drei Wege, einen Beleg zu führen

Die Grundidee ist immer dieselbe: Die KI darf behaupten, was sie will. Zu jeder Behauptung muss sie jedoch einen Beleg mitliefern. Den Beleg prüft die Datei selbst nach. Sie versteht drei Belegarten; welche vorliegt, erkennt sie automatisch an der Form der Antwort. Sie müssen keinen Modus wählen.

1. Die Fundstelle. Die Antwort nennt zu jedem Punkt den genauen Ort im Dokument: eine Zeile, einen Abschnitt oder eine Seite. Die Datei liest exakt diese Stelle aus dem Original und prüft Zahlen und Bezeichnungen gegen den Fund. Abgetippt wird nichts. Das ist die robusteste Form: Auf dem Weg durch das Chat-Fenster kann nichts verfälscht werden.

2. Die Regel, für Tabellen. Für Tabellen dreht sich die Beweislast um. Die Antwort nennt die angewendeten Regeln und ihre Funde. Eine Regel besteht aus einer Spalte, einer Bedingung und optional einer Ausnahme, zum Beispiel: Spalte Bedenklicher Stoff, Bedingung enthält Blei, Ausnahme enthält RoHS-Ausnahme. Die Datei wendet diese Regeln selbst auf jede einzelne Zeile an und gleicht das Ergebnis ab. Bricht eine Zeile eine Regel und fehlt in den Funden der KI, wird sie namentlich genannt. Gemessen am Beispiel des Kits: In einer Stückliste mit 800 Zeilen stecken fünf versteckte Verstöße. Die KI meldete nur einen davon. Die Prüfdatei nannte alle fünf.

3. Das Zitat. Jeder Punkt trägt ein wörtliches Zitat aus dem Dokument. Alle Zitate zusammen müssen das ganze Dokument abdecken. Damit fliegen beide Fehlerarten auf: die erfundene Aussage und das nur halb gelesene Dokument. Verglichen wird die Wortfolge, nicht das Schriftbild. Anführungszeichen, Fettschrift, Zeilenumbrüche oder Tausenderpunkte ändern nichts am Urteil. Ein verändertes Wort oder eine veränderte Zahl ändert es immer:

Tabelle 2: Welche Abweichungen vom Quelltext die Prüfung noch als Zitat annimmt. Und welche sie ablehnt.

Zitat in der AntwortErgebnisGrund
„Die Versicherungssumme beträgt 85.000 Euro" angenommenstimmt wörtlich überein
Die Versicherungssumme beträgt 85.000 Euro angenommenFettschrift zählt nicht
Die Versicherungssumme beträgt 85000 Euro angenommender Tausenderpunkt zählt nicht
Die Versicherungssumme beträgt 92.000 Euro abgelehntdie Zahl weicht vom Dokument ab

Welche Dateien Sie prüfen können

Unterstützt werden PDF, Word, Excel, PowerPoint, die entsprechenden OpenDocument-Formate, CSV und reiner Text. Das PDF muss digital erzeugt sein; ein Scan ohne Textebene wird ehrlich abgelehnt statt erraten. Alles, worauf es ankommt, sollte im Fließtext stehen. Fußnoten, Kopfzeilen und das zweite Tabellenblatt liest die Datei nicht.

So läuft die Prüfung ab

Wählen Sie den Laufweg, der zu Ihrer Arbeitsumgebung passt.

Weg 1: Im Browser, ohne Installation.

  1. Öffnen Sie die Datei pruefung-im-browser.html aus dem Testkit mit einem Doppelklick.
  2. Fügen Sie die KI-Antwort in das obere Feld ein.
  3. Ziehen Sie Ihr Originaldokument in das untere Feld.
  4. Klicken Sie auf Prüfen. Urteil und Protokoll erscheinen sofort auf der Seite.
  5. Wiederholen Sie die Prüfung nach jeder Nachbesserung, bis ACCEPTED erscheint. Erscheint nie ACCEPTED, suchen Sie sich eine andere KI.
  6. Danach können Sie mit der KI arbeiten: Nun hat sie das Dokument gelesen und ist bereit. Stellen Sie Ihre restlichen Fragen zügig im selben Gespräch. Lange Verläufe werden von den Assistenten gekürzt. Danach ist der belegte Lesestand weg, ohne dass es Ihnen jemand sagt.

Ihre Dateien bleiben auf diesem Weg vollständig auf Ihrem Rechner. Die Seite benötigt keine Internetverbindung; der Bau des Kits belegt das mit einem Test, der die fertige Seite mit gekappter Verbindung öffnet und trotzdem ein Urteil verlangt.

Weg 2: Direkt im KI-Chat.

  1. Laden Sie die Prüfdatei aus dem Testkit zusammen mit Ihrem Dokument in den Chat hoch.
  2. Stellen Sie Ihre Aufgabe und lassen Sie den Assistenten seine eigene Antwort mit der Datei prüfen. Jeder Assistent, der Code ausführen kann, tut das.
  3. Lesen Sie das Urteil am Ende des Protokolls.
  4. Bei REJECTED schreiben Sie der KI einen kurzen Satz: Bessere genau die gelisteten Punkte nach und prüfe erneut.
  5. Wiederholen Sie die Schritte 3 und 4, bis ACCEPTED dasteht. Erst dann lesen Sie die Antwort selbst.

Das Protokoll druckt die Prüfsumme der Datei als digitalen Fingerabdruck mit. Ein vorgetäuschter Prüflauf fällt dadurch sofort auf.

Weg 3: Auf Ihrem Rechner, für Skripte und Automatisierung.

Rufen Sie das Programm über die Kommandozeile mit der KI-Antwort und Ihrem Dokument auf. Das Urteil ist dasselbe wie auf den anderen Wegen. Für die Automatisierung meldet das Programm das Ergebnis zusätzlich als Zahl zurück, mit der ein Skript weiterarbeiten kann.

Was die Prüfschleife bewirkt: ein echtes Beispiel

Ein KI-Assistent verglich zwei Stände eines Lastenhefts gegen 28 Unterschiede, die der Prüfer selbst vorab berechnet hatte.

Tabelle 3: Drei Läufe gegen dieselben 28 vorab berechneten Unterschiede.

LaufErgebnisUrteil
Runde 123 von 28 Änderungen, 82 %, dazu ein zusammengesetztes Zitat, das die Prüfung nirgends fand erfunden
Runde 225 von 28, 89 %, die gestrichenen Anforderungen je nur an einer von zwei Fundstellen belegt erfunden
Nach zwei Runden Nacharbeit28 von 28 belegt, nichts erfunden belegt

Kein Prompt hat diese Präzision auf Anhieb bewirkt. Erst die automatische Nacharbeitsliste hat das Ergebnis erzwungen: Sie gibt der KI jede fehlende Änderung mit exaktem Wortlaut vor.

Nach dem bestandenen Lauf bewertete der Assistent die bestätigten Änderungen. Drei Beispiele aus seiner Antwort: Die Verfügbarkeitsanforderung wurde von MUSS auf SOLL abgeschwächt. Die Abnahmeprüfung wurde von 40 Stunden Dauerlauf auf 40 Zyklen verkürzt. Die Gewährleistungsfrist wurde von 24 auf 12 Monate halbiert. Sein Fazit: Die Behauptung der Gegenseite, die Änderungen seien rein redaktionell, trifft objektiv nicht zu. Diese Bewertung besitzt Gewicht, weil die Prüfung vorher gemessen hatte, dass alle 28 Unterschiede belegt waren.

Funktionen im Überblick

Sie müssen dem Werkzeug nicht sagen, welche Prüfung Sie wünschen. Es analysiert den Aufbau der Antwort und wählt den passenden Prüfmodus selbst:

Tabelle 4: Die drei Prüfmodi. Je Modus die Eingaben, die er braucht, sowie die Kriterien, die er misst.

WofürSie legen einGemessen wird
Dokument zusammenfassenAntwort und Quelldokumenterfundene Aussagen, übersprungene Absätze, die Abdeckung
Fundstellen prüfenAntwort und Quelldokumentob Zahlen und Kennungen an der genannten Stelle stehen
Tabellen prüfenAntwort und Tabellejede Zeile gegen die genannten Regeln, übersehene Zeilen
Versionen vergleichenAntwort, alte und neue Fassungübersehene und erfundene Änderungen gegen die selbst berechnete Differenz
Aktionsplan freigebenAntwort und optional Ihr Regelwerknicht offengelegte Wirkungen, unumkehrbare Schritte ohne Deckung
KI-Code prüfenAntwort und Codedateidie Datei führt den Code aus: Abstürze, gebrochene Invarianten
Grafiken prüfenPNG oder SVG, dazu eine Spec-DateiFarben, Maße, Kontrast, Druckauflösung, aktive Inhalte im SVG
Den Assistenten selbst testenAntworten und Schlüsseldateiob ein zweites Modell beschädigte Zitate findet, ob Ihres Suggestivfragen zustimmt, wie weit es seit dem letzten Stand abweicht

Das Prüfmaterial für die letzte Zeile erzeugt die Datei auf Zuruf, jeweils mit einer Lösungsdatei:

Ein Prüfstück für ein zweites Modell. Der Aufruf pruefstueck antwort.txt dokument.txt erzeugt aus Ihrer geprüften Antwort eine Prüfaufgabe, in der einzelne Zitate absichtlich still beschädigt sind. Findet ein zweites Modell die beschädigten Stellen, taugt es als Prüfer.

Suggestivfragen. Der Aufruf fragen dokument.txt erzeugt Fragen zu Ihrem Dokument, von denen jede eine falsche Behauptung enthält. Stimmt Ihr Assistent den Fragen zu, redet er Ihnen nach dem Mund.

Referenzaufgaben. Der Aufruf aufgaben erzeugt feste Aufgaben mit Lösungsdatei. Damit messen Sie denselben Assistenten über Monate gegen sich selbst: Liefert er nach einem stillen Update noch dasselbe wie im Frühjahr?

Die Lösungsdateien behalten Sie. Sie dürfen nie in den Chat, den sie prüfen sollen, sonst liest der Assistent die Lösung mit.

Wer das wofür nutzt

Tabelle 5: Wo das Werkzeug eingesetzt wird, mit Aufgabe, Modus und praktischem Nutzen je Bereich.

BereichKonkrete AufgabeModusDer praktische Nutzen
PrivatVersicherungspolice und Mietvertrag prüfenFundstelleDie KI überspringt gern die Ausschlüsse; die Abdeckungsprüfung verlangt zu jeder Seite eine Aussage. Zahlen, die nicht im Vertrag stehen, fliegen sofort auf.
Ingenieurwesen, QualitätLastenhefte vergleichen, Stücklisten auf RoHS und REACH prüfenVersionsvergleich, RegelMUSS zu SOLL, gestrichene Anforderungen, geänderte Einheiten. Alle 800 Zeilen werden geprüft, nicht die ersten fünfzig.
ManagementVorstandsfolien gegen den Quartalsbericht prüfenDokumentFolienzahlen ohne Deckung im Bericht fallen auf, bevor sie im Unternehmen wandern.
EinkaufAngebote und Preislisten vergleichenFundstelle, VersionsvergleichNicht angebotene Positionen und stillschweigend erhöhte Einzelpreise werden sichtbar.
Recht, ComplianceAGB und Vertragsfassungen nach der Verhandlungsrunde prüfenVersionsvergleichÄnderungen, die als rein redaktionell deklariert wurden und keine sind.
Verwaltung, PersonalAnträge und Stellenprofile gegen Richtlinien haltenFundstelle, DokumentKriterien und Zusagen ohne Grundlage im Quelldokument fallen auf.
FinanzenRechnungen und Reisekosten zeilenweise prüfenRegelAlle Verstöße und Abweichungen, nicht nur die auffälligen.
IT, SoftwareKI-geschriebenen Code prüfenCodeDie Datei führt den Code aus; eine Sortierung, die still Duplikate verliert, fällt an der Invariante durch.

Wo das Werkzeug an seine Grenzen stößt

Was sie nicht ersetzt
Die Prüfdatei sagt Ihnen, dass eine Zahl im Dokument steht, nicht, ob das Dokument recht hat. Rechnen und Einheiten umrechnen kann sie nicht, eine falsch umgerechnete Angabe fällt nicht auf, solange beide Zahlen im Text stehen. Und sie ersetzt keine fachliche Freigabe: Bei Entscheidungen, die Menschen, Geld oder Zulassungen betreffen, bleibt die Verantwortung bei der qualifizierten Fachkraft.

Der eigentliche Nutzen liegt in der Zeitersparnis. Das Werkzeug streicht die fehleranfällige Routinearbeit, die niemand gern macht und deshalb selten gründlich erledigt wird: jede Zeile kontrollieren, jede Seite lesen, jede Zahl nachschlagen. Was danach übrig bleibt, ist die Bewertung, für die Sie ausgebildet sind.

Jetzt ausprobieren

Das Testkit steht Ihnen kostenlos zur Verfügung: agent-quality-control

Wer die Prüfung nicht selbst betreiben möchte, bekommt sie im aisen-Portal direkt eingebaut, mit Quellennachweisen und Protokoll zu jeder Antwort:

Betteryields

Die Betteryields GmbH baut Qualitäts-Gates für KI: aisen für KI-Recherchen, Dokumente und Datenanalysen (www.myaisen.com), agentic-gates für Code (agentic-gates.dev)

Betteryields GmbH. Kein Konto nötig, um sich das anzusehen.