BetteryieldsBetteryieldsBetteryields GmbH
← Blog

Kritische Dokumenten-Reviews mit KI: Wie Hardware-Ingenieure falsche Zahlen im Keim ersticken

Dr. Aaron Hutzler · 4 Min. · English

Zwei Hände halten ein gedrucktes Datenblatt neben einem kleinen Servomotor auf der Werkbank, ein Finger zeigt auf eine Zeile der Seite
Dieses Bild wurde mit KI erzeugt.

aisen Blog, Artikel 1, Zielgruppe: Qualitäts- und Hardware-Ingenieure

Ein Beispiel aus der Praxis: Im Datenblatt eines Sensors steht die minimale Versorgungsspannung mit 2,7 Volt. In der KI-Zusammenfassung fürs Design-Review stehen 3,3. Beide Zahlen lesen sich gleich plausibel und nur eine von beiden steht in der Quelle.

Tabelle 1: Das Datenblatt gegen die KI-Zusammenfassung, Wort für Wort geprüft.

PrüfpunktDatenblattKI-Zusammenfassung
Minimale Versorgungsspannung: 2,7 Volt gegen 3,3 Volt belegt erfunden

Diesen Fehlertyp muss niemand erahnen, er ist gemessen:

  • Eine Handauswertung maschineller Zusammenfassungen fand erhebliche Anteile an Inhalten ohne Beleg in der Quelle, über alle untersuchten Modelle hinweg [1].
  • Eine Vorstudie an einem damals führenden neuronalen Zusammenfassungssystem fand bei fast 30 % der Ausgaben erfundene Fakten [2].
  • Eine Übersichtsarbeit zu Halluzinationen in großen Sprachmodellen beschreibt das Erfinden als Eigenschaft der Technik: mindern lässt es sich, abstellen nicht [3].

1. Warum eine einzige falsche Zahl im Hardware-Design entscheidet

Ein Versorgungsspannungsbereich ist eine grundlegende Auslegungsentscheidung. Wer 3,3 V statt der echten 2,7 V liest, streicht ungewollt eine ganze Klasse von Niederspannungs-Designs. Eine vertauschte Ziffer in einem 40-seitigen Dokument reicht für eine Fehlentscheidung. Mit dem Auge fängt man sie kaum, denn das Lesen der 40 Seiten hat man ja an die KI abgegeben.

Die Position ist ein zusätzlicher Risikofaktor. Steht die entscheidende Toleranz in der Mitte eines langen Dokuments, sinkt die Abruf-Leistung von Sprachmodellen messbar [4].

Gerade weil sie souverän klingt, ist eine flüssig formulierte Zusammenfassung gefährlich. Der falsche Wert wandert in die Notizen, ins Review-Protokoll und am Ende in die Spezifikation der Baugruppe.

2. Die eine Frage, die Ihr Design wirklich schützt

Bevor Sie einer KI-Zusammenfassung eines technischen Dokuments trauen, brauchen Sie den Beweis für genau eine Sache:

Stammt jeder einzelne Wert in der Antwort tatsächlich Wort für Wort aus dem Quelldokument?

Wie elegant die Antwort klingt, ist ohne Belang. Was zählt: Steht jede Zahl, jede Einheit und jede Kennung exakt so im Quelltext? Diese Frage lässt sich mechanisch prüfen. Sie ist konkreter als die vage Frage "ist die Zusammenfassung gut" und genau das macht sie prüfbar.

3. Der Prüfweg in drei Schritten

Zwei Pakete laufen unter einem Torbogen mit der Aufschrift GATES auf einem Förderband. Das Paket mit der Markierung ZITAT läuft durch ein grünes Tor mit Haken, das Paket mit der Markierung KEIN ZITAT läuft auf ein rotes Tor mit Kreuz zu.

Abbildung 1: Die Prüfung als Bild: eine Aussage mit Zitat kommt durch, eine ohne Zitat wird gestoppt.

Bild maschinell erzeugt

Genau für diese Lücke haben wir ein kleines, kostenloses Prüfwerkzeug gebaut. Der Ablauf:

  1. Zitatpflicht vorgeben. Ihr Prompt verlangt für jeden Befund ein wörtliches Zitat aus dem Dokument.
  2. Antwort erzeugen lassen. Die KI liefert ihre Punkte samt der angeforderten Zitate.
  3. Lokal prüfen. Ein Befehl prüft jedes Zitat auf Ihrem Rechner gegen die Originaldatei. Jeder belegte Punkt kommt als ACCEPTED zurück. Jeder Punkt ohne exakte Fundstelle kommt als REJECTED zurück.

Im Eingangsbeispiel fliegt die erfundene 3,3-Volt-Angabe sofort auf: REJECTED. Der Ausdruck steht an keiner Stelle der Datei. Dort steht unverändert 2,7.

4. Ehrlichkeit: Was das Werkzeug leistet und was nicht

Das Werkzeug erfüllt eine klar umrissene Aufgabe. Es prüft nur eines: Sind die genannten Werte echt? Nicht mehr, nicht weniger:

Was es nicht leistet
Vollständigkeit prüft es nicht, ob wichtige Abschnitte fehlen, sagt es Ihnen nicht. Auch ein echtes Zitat kann in die Irre führen, wenn der Kontext fehlt. Und ob die technische Schlussfolgerung trägt, bewerten weiterhin Sie.

Es beseitigt den einen stillen Fehler. Von Hand ist er am schwersten zu finden: der veränderte oder erfundene Wert. Bevor Sie ein KI-gelesenes Dokument abzeichnen, sind diese zwei Minuten gut angelegt.

Jetzt auf der eigenen Maschine ausprobieren

Laden Sie das Werkzeug kostenlos herunter, es läuft auf Ihrem Rechner. Prüfen Sie die nächste KI-Zusammenfassung direkt gegen das Originaldokument: agent-quality-control

Quellen

[1] J. Maynez, S. Narayan, B. Bohnet und R. McDonald, "On Faithfulness and Factuality in Abstractive Summarization", Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 2020, arXiv:2005.00661.

[2] Z. Cao, F. Wei, W. Li und S. Li, "Faithful to the Original: Fact Aware Neural Abstractive Summarization", Proceedings of the AAAI Conference on Artificial Intelligence, 2018, arXiv:1711.04434.

[3] L. Huang, W. Yu, W. Ma, W. Zhong, Z. Feng, H. Wang, Q. Chen, W. Peng, X. Feng, B. Qin und T. Liu, "A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions", 2023, arXiv:2311.05232.

[4] N. F. Liu, K. Lin, J. Hewitt, A. Paranjape, M. Bevilacqua, F. Petroni und P. Liang, "Lost in the Middle: How Language Models Use Long Contexts", Transactions of the Association for Computational Linguistics, Bd. 12, 2024, arXiv:2307.03172.

Betteryields

Die Betteryields GmbH baut Qualitäts-Gates für KI: aisen für KI-Recherchen, Dokumente und Datenanalysen (www.myaisen.com), agentic-gates für Code (agentic-gates.dev)

Betteryields GmbH. Kein Konto nötig, um sich das anzusehen.