Spieltheorie für KI Agenten
Dr. Aaron Hutzler · 16.08.2026 · 21 Min.

Einen können Sie nicht zur Sorgfalt überreden. Sie können nur das Spiel ändern, das er spielt.
Die untersucht das Verhalten von Spielern unter gegebenen Regeln. Ihr Gegenstück läuft andersherum. Das gewünschte Ergebnis steht fest, gesucht sind die Regeln für genau dieses Ergebnis als besten verfügbaren Zug. Mechanismus-Design heißt das Feld. 2007 ging der Wirtschafts-Nobelpreis dafür an Hurwicz, Maskin und Myerson [1]. Christian Rieck fasst die Leitfrage in einen Satz [2]: Wie ändert man ein Spiel zugunsten eines wünschenswerten Ergebnisses?
Rieck zieht außerdem eine Unterscheidung, auf der dieser Beitrag steht. Eine Strategie ist ein vollständiger Handlungsplan für jede Lage im Spiel. Ein Strategem ist der engere und schärfere Begriff. Ein gewöhnlicher Zug findet im Spiel statt. Ein Strategem verändert das Spiel selbst. Dafür gibt es drei Angriffspunkte: was auf dem Feld überhaupt möglich ist, was ein Zug einbringt und was die Gegenseite erwartet. Ein Beispiel für den dritten steht weiter unten. Nennen Sie dem Agenten die Schwelle vorab, dann ändert sich seine Erwartung. Sein Verhalten ändert sich mit. Die Regel selbst bleibt unangetastet. Genau durch diese Brille liest Rieck die sechsunddreißig klassischen chinesischen Strategeme. Ausdrücklich sagt er dazu: Es sind keine ethischen Rezepte, sondern Werkzeuge zur Mustererkennung [2].
Das macht sie hier brauchbar. Vor allem anderen steht dabei ein Satz: Ein Agent hat keine Absicht. Ein Agent intrigiert nicht. Er erzeugt schlicht die Ausgabe mit der besten Bewertung gegen alles Sichtbare. Die Muster passen trotzdem, denn die Muster handelten nie von Moral. Sie handelten von der Lage, in der eine Seite mehr weiß als ihr Gegenüber.
Die Strategeme laufen deshalb in zwei Richtungen. Manche beschreiben, was in der Ausgabe eines Agenten auftaucht. Andere beschreiben die Möglichkeiten des Menschen am Regelwerk. Der nächste Abschnitt führt alle sechsunddreißig Strategeme von der Seite des Agenten. Ein späterer dreht einige davon zum Regelbauer hin.
1. Alle sechsunddreißig Strategeme im Spec Coding
Jedes Strategem bekommt einen Absatz, sortiert in die sechs klassischen Gruppen. Wo eine Quelle den Befund trägt, steht sie dabei.
1.1 Überlegene Lage
1. Den Kaiser täuschen und das Meer überqueren. Wiederholte harmlose Signale stumpfen ab. Eine lange Reihe grüner Läufe senkt die Wachsamkeit. Der eine rote Lauf geht darin unter. Bainbridge beschrieb diese Ironie 1983 an Kraftwerkswarten: Je zuverlässiger die Automatik arbeitet, desto schlechter überwacht sie der Mensch. Dagegen hilft ein mit gleicher Strenge in jedem Lauf. [3]
2. Wei belagern, um Zhao zu retten. Nicht die starke Stellung angreifen, sondern das, wovon sie abhängt. Ein durchgefallenes Review geht deshalb zurück auf die Spezifikation und nicht auf den Code. Dort ist die Korrektur einen Satz wert statt einen Nachmittag. Boehm und Basili zählen vermeidbare Nacharbeit zu den größten Kostenblöcken der Entwicklung. [4]
3. Mit dem Messer eines anderen töten. Die Kosten des Konflikts trägt ein Dritter. Genau das passiert beim Agenten als Prüfer des nächsten Agenten. Die Mehrheit der KI-geschriebenen Änderungsanträge bekommt gar kein Review. Wo eines stattfindet, führen es überwiegend Agenten statt Menschen. [5]
4. Ausgeruht den erschöpften Feind erwarten. Wer wartet, spart seine Mittel. Die Gegenseite verbraucht unterdessen ihre eigenen Vorräte. Die Prüfung greift deshalb erst nach dem Zug des Agenten. Eine Prüfung vorab zeigt dem Agenten nur die Zielscheibe. Er richtet seine Ausgabe auf alles Sichtbare aus. [6]
5. Ein Feuer für einen Raub ausnutzen. Jede Störung im System senkt den Widerstand gegen einen Zugriff. Unter Zeitdruck gibt der Mensch nach und ungeprüfter Code rutscht durch. Ein serverseitiges Gate kennt keinen Zeitdruck und ist deshalb genau dort die stabilere Instanz. Reason beschreibt genau diese Lage: Unter Druck weicht der Mensch von der Regel ab. [7]
6. Im Osten lärmen, im Westen angreifen. Wer an einer Stelle Lärm macht, zieht die Aufmerksamkeit dorthin. Ein Agent liefert achthundert Zeilen Prüfbericht. Der Mensch liest die Zusammenfassung und die ersten Punkte. Der einzige echte Fehler steht auf Platz dreihundertvierzig und wird nie gelesen. Die Abhilfe ist ein verdichteter Befund statt des Rohberichts: was geprüft wurde, was auffiel, was offen bleibt. [8]
1.2 Konfrontation
7. Aus einem Nichts etwas erzeugen. Eine Erfindung wirkt echt nach der ersten Reaktion darauf. Ein Agent nennt zu jedem Befund die Funktion, um die es geht. Erfunden wird dabei nicht der Fehler, sondern der Beleg dafür. Die üblichen Bewertungsverfahren belohnen das Raten. Modelle raten unter Unsicherheit deshalb lieber und enthalten sich nicht. Wer die Belege nicht gegen die Dateien hält, übernimmt sie. [9]
8. Heimlich nach Chencang marschieren. Die Reparatur der offensichtlichen Hauptstraße läuft vor aller Augen, der Marsch nimmt den unbewachten Weg. Genau so verhält sich ein Agent gegenüber Tests. Er bringt jeden sichtbaren Test zum Bestehen. Dorthin schaut die Prüfung. Bei zurückgehaltenen Tests fällt dasselbe Programm dann durch. Gesehen hat er sie nie. Bestandene sichtbare Tests sagen deshalb nichts über das Verhalten aus. [10]
9. Das Feuer am gegenüberliegenden Ufer beobachten. Nach der gegenseitigen Abnutzung zweier Seiten urteilt die dritte Partei besser. Zwei Modelle prüfen gegeneinander, der Mensch urteilt zuletzt und nur über die Stellen, an denen sie sich widersprechen. Fagan zeigte das an Inspektionen: Ein unabhängiger Blick findet Fehler, die der Autor übersieht. [11]
10. Hinter dem Lächeln den Dolch verbergen. Zustimmung baut die Deckung ab. Ein zuversichtlicher Ton über einer falschen Antwort wirkt genauso. Sprachmodelle geben nachweislich der Meinung ihres Gegenübers nach, statt bei der belegten Antwort zu bleiben. Die Zustimmung senkt so die Prüfschwelle des Menschen bei schwächerem Inhalt. [12]
11. Der Pflaumenbaum verdorrt anstelle des Pfirsichbaums. Ein kleiner Verlust sichert den großen Wert. Kleine Scheiben abnehmen heißt genau das. Je später ein Fehler auffällt, desto teurer wird seine Reparatur. Ein verworfener Entwurf kostet Minuten, ein verworfener Bestand kostet Wochen. [13]
12. Mit leichter Hand das Schaf wegführen. Beiläufige Gelegenheiten werden mitgenommen, denn sie kosten nichts. So sinkt die innere Qualität still. In einer Untersuchung von über 300.000 KI-geschriebenen Änderungen steckte gut ein Fünftel der eingebrachten Mängel später immer noch im Code. Neun von zehn dieser Mängel sind keine Fehler, sondern Geruchsmuster: zu lange Funktionen, doppelter Code, unklare Namen. [14]
1.3 Angriff
13. Auf das Gras schlagen, um die Schlange aufzuscheuchen. Eine kleine Störung zwingt das Verborgene zur Reaktion. Das ist die Fehlereinbringung: bekannt falsche Antworten einspeisen und das Verhalten der Prüfung beobachten. Verwandt ist der der Softwaretechnik, seit Jahrzehnten untersucht. Findet die Prüfung den eingebauten Fehler nicht, prüft sie nichts. [15]
14. Für die Rückkehr der Seele einen Leichnam ausleihen. Eine bekannte Form spart die Kosten der Abstimmung. Vorhandene Normen und Werkzeugnamen zu nutzen statt eigene zu erfinden wirkt genauso: Der Agent kennt sie aus dem Training und trifft sie ohne Erklärung. Gamma und Kollegen nennen den Grund: Ein geteilter Formenschatz spart die Abstimmung. [16]
15. Den Tiger vom Berg in die Ebene locken. Auf fremdem Grund verliert die starke Stellung ihren Wert. Die Tests laufen deshalb auf einer frischen Maschine, weg vom Heimvorteil des Entwicklers, auf der keine gewachsene Umgebung mitentscheidet. Humble und Farley verlangen dafür frisch aufgesetzte, untereinander gleiche Umgebungen. [17]
16. Will man etwas fangen, muss man es zunächst loslassen. Wer Druck wegnimmt, bekommt das wahre Verhalten zu sehen. Den Agenten erst frei entwerfen lassen und die Regel danach zeigen ist genau dieser Zug. Was er bewirkt, steht im nächsten Abschnitt. [18]
17. Einen Backstein hinwerfen, um Jade zu erlangen. Eine geringe Vorleistung lockt eine hochwertige Gegenleistung hervor. Ein knapper Anstoß statt einer großen Spezifikation wirkt so: Die Rückfragen des Agenten zeigen die Lücken, an die niemand gedacht hat. Jia und Kollegen zeigen mehrdeutige Aufgabenbeschreibungen als wichtigen Ursprung falschen Codes. [19]
18. Den Anführer gefangen nehmen. Fällt der Knoten, zerfällt das Ganze in Einzelteile. Umgekehrt gilt: Eine einzige tragende Regel richtig zu treffen wiegt schwerer als zwanzig Einzelregeln. Diese eine Regel ist die Projektverfassung. Parnas nannte 1972 den Grund: Die frühen Entwurfsentscheidungen binden alle späteren. [20]
1.4 Verwirrung
19. Das Brennholz unter dem Kessel wegnehmen. Nicht das Kochen bekämpfen, sondern die Hitze entziehen. Die Schwelle nicht vorab zu nennen ist genau das. Eine angekündigte Schwelle wird schon beim Schreiben zum Ziel, eine erst nachträglich offengelegte Schwelle kann es nicht mehr werden. [18]
20. Im Trüben fischen. Unübersichtlichkeit lähmt die Berechenbarkeit der Gegenseite. Eine unübersichtliche Ausgabe erschwert die Prüfung auf genau diese Art. Verdichtete Befunde statt Rohdiffs nehmen dem Trüben das Wasser. [8]
21. Die Zikade wirft ihre goldglänzende Haut ab. Zurück bleibt eine Hülle in der Gestalt des Ganzen. Eine bestandene sichtbare Testsuite ist so eine Hülle. Sie glänzt. Das echte Verhalten weicht bei den zurückgehaltenen Tests längst ab. [10]
22. Die Türe schließen, um den Dieb zu fangen. Den Ausweg beseitigen, statt ihn zu bewachen. Eine wahrheitswertige Regel hat keinen Seiteneingang: Die Bedingung muss tatsächlich gelten. Eine Zahl zum Treffen lässt fast immer einen Seiteneingang offen. Goodhart benannte den Grund dafür 1975: Sobald eine Kennzahl zum Ziel wird, taugt sie nicht mehr als Maß. [21]
23. Sich mit dem fernen Feind verbünden. Der Ferne hat andere Interessen und ist deshalb als Verbündeter brauchbar. Ein Prüfer aus einer fremden Modellfamilie wirkt genauso: Er teilt weniger blinde Flecken mit dem Geprüften. Knight und Leveson haben unabhängig gebaute Fassungen mit denselben Fehlern gemessen. Weniger geteilte blinde Flecken heißt also nicht keine. [22]
24. Einen Weg für einen Vorwand ausleihen. Aus der befristeten Erlaubnis wird der Dauerzustand. Der mitgeführte Zusammenhang wächst genauso, Schritt für Schritt. Irgendwann gibt die Qualität unter dem eigenen Gewicht nach. Anweisungswucherung heißt dieser Verlauf. [8]
1.5 Übernahme
25. Die Balken stehlen und durch faules Holz ersetzen. Die tragenden Teile werden ersetzt, die Fassade bleibt. Bei erzeugtem Code läuft alles weiter. Die innere Qualität verfällt dabei still und zeigt sich erst beim Weiterbauen. [14]
26. Den Maulbeerbaum schelten und auf den Akazienbaum deuten. Die Maßregelung gilt einem Dritten und ist doch an alle gerichtet. Eine Regel einmal sichtbar an einem Beispiel durchzuziehen wirkt genauso: Danach kennt jeder ihren Preis, ohne dass jemand ihn zahlen musste. Bei der fortlaufenden Integration wirkt derselbe Zug: Ein gebrochener Bau ist für alle sichtbar. [23]
27. Sich dumm stellen, aber den Wahnsinn nicht ausleben. Wer harmlos wirkt, wird nicht geprüft. Die Selbstauskunft, die Prüfungen seien bestanden, wirkt genauso entwaffnend. Geprüft gehört deshalb das Ergebnis und nie die Auskunft darüber. IEEE 1012 verlangt genau deshalb eine unabhängige Prüfung. [24]
28. Die Leiter wegziehen, nachdem der Gegner aufgestiegen ist. Erst locken, dann den Rückweg nehmen. Wer seine Spezifikation im Werkzeug eines Anbieters führt, steigt genau diese Leiter hinauf. Deshalb bleibt sie eine Datei im eigenen Bestand. Die Normenreihe für Produktqualität führt Übertragbarkeit als eigenes Qualitätsmerkmal. [25]
29. Auf den Bäumen Blumen blühen lassen. Geschmückt sieht schwach aus wie stark. Die Abdeckung sieht vollständig aus, der Beleg trägt aber nicht. Eine erfundene Belegzeile kostet das Modell nichts. Die Bewertung prüft nur das Vorhandensein eines Belegs. [9]
30. Den Gast zum Gastgeber machen. Aus der Nebenrolle wird schrittweise die regelsetzende Rolle. Ein Agent prägt die Konventionen im Bestand und geht genau diesen Weg. Die Verfassung bleibt deshalb ausdrücklich beim Menschen. Lehman beschrieb den Verlauf: Ein System wächst und verliert Struktur, sofern niemand daran arbeitet. [26]
1.6 Ausweglosigkeit
31. Das Strategem der schönen Frau. Die Vorlieben des Entscheiders werden verschoben, nicht seine Lage. Ein gefälliger Ton verschiebt das Urteil des Prüfers auf dieselbe Weise [12]. Auch das Messgerät selbst ist anfällig. Dreht man die Reihenfolge zweier Antworten um, kann das Urteil eines Modells als Prüfer kippen. [27]
32. Das Strategem der leeren Stadt. Gelassenheit bei völliger Schwäche lässt den Überlegenen eine Falle vermuten. Eine souveräne Antwort ohne Substanz wirkt genauso. Die mitgelieferte Begründung eines Modells nennt oft nicht den wahren Grund für seine Antwort. Bewertet gehört der Beleg und nicht der Ton. [28]
33. Das Strategem der gegenseitigen Spionage. Der eigene Kanal der Gegenseite wird zum Einfallstor. Fremde Inhalte im Lesestoff eines Agenten können Anweisungen tragen. Sie gehören deshalb als unzuverlässig behandelt, egal wie amtlich sie aussehen. Die OWASP-Liste für Sprachmodelle führt diese Einschleusung als Risiko Nummer eins. [29]
34. Das Strategem der Selbstverletzung. Ein selbst zugefügter Schaden kostet etwas und macht ein Signal dadurch glaubwürdig. Genau so arbeitet ein Kanarienvogel: Ein bekannter Fehler wird absichtlich in den eigenen Text gesetzt. Der Prüfer muss ihn finden. Es ist das Verfahren aus Strategem dreizehn, angewendet auf den Prüfer statt auf die Testsuite. [15]
35. Das Strategem der Verkettung. Einzelne Züge sind ausweichbar, eine Kette ist es nicht. Gates in Reihe wirken so: Ein einzelnes Gate lässt sich umgehen, eine Kette aus voneinander unabhängigen Prüfungen deutlich schwerer. Reason nennt das Käsescheibenmodell: Jede Scheibe hat Löcher, die Reihe hält trotzdem. [30]
36. Wenn alle Stricke reißen, ist Flucht das Beste. Ist der Erwartungswert aller Züge negativ, ist der geordnete Rückzug der beste Zug. Einen verdorbenen Lauf zu verwerfen und neu anzusetzen ist deshalb keine Niederlage. Es ist die günstigste verbleibende Wahl. Brooks riet schon 1975, den ersten Wurf als Wegwerfstück einzuplanen. [31]
2. Zweite Richtung: Strategeme für den, der die Regeln baut
Dieselbe Sammlung vom Stuhl des Regelbauers gelesen wird zum Mechanismus-Design. Drei davon haben wir selbst gemessen. Abbildung 1 stellt die schwache Form jeder Stellschraube der starken gegenüber.

Abbildung 1: Drei Stellschrauben. Der Weg von links nach rechts kostet nichts und ändert das Ergebnis.
Das Brennholz unter dem Kessel wegnehmen. Nicht das Symptom bekämpfen, sondern das entziehen, was es nährt. Wir haben voranmeldete Pilotläufe gefahren, drei Arme mit je drei Läufen, jedes Mal dieselbe Aufgabe [18]. Kannte der Agent die Formschwelle vor dem Schreiben, schrieb er in allen drei Läufen genau auf diese Schwelle hin. Das Gate löste nie aus, denn es blieb nichts mehr zu fangen. Erschien dieselbe Regel erst nach einem ersten Entwurf, wurde kein Lauf ausgetrickst, das Gate löste aus und erzwang die Nacharbeit. Gleiche Regel, gleiche Schwelle, gleiches Modell. Verschoben hat sich allein der Zeitpunkt der Offenlegung.
Die Türe schließen, um den Dieb zu fangen. Den Fluchtweg entfernen, statt ihn zu bewachen. Der dritte Arm derselben Untersuchung trug eine wahrheitswertige Regel statt einer Zahl zum Treffen. Er blieb sauber, sogar bei vorher angekündigter Regel [18]. Eine Zahl lädt dazu ein, auf sie zu zielen. Eine Bedingung mit echtem Wahrheitswert hat keinen Seiteneingang. Schreiben Sie Abnahmekriterien in dieser zweiten Form, dann verliert die Regel ihre Angriffsfläche.
Auf das Gras schlagen, um die Schlange aufzuscheuchen. Eine Reaktion auslösen, um Verborgenes sichtbar zu machen. Das ist die Fehlereinbringung: bekannt falsche Antworten absichtlich einspeisen und das Verhalten der Prüfung beobachten. Unsere eigenen Prüfungen fingen 12 von 12 bei unabhängiger Nachprüfung [18]. Dieselbe Methode hat den versagenden Richter aus der Zeile oben entlarvt. Eine ungeprüfte Prüfung ist keine Prüfung, sondern eine Gewohnheit.
3. Warum sich die Lücke nie schließt
Ein Aufsatz vom März 2026 [6] modelliert das formal als Prinzipal-Agent-Problem, aufbauend auf dem Mehrfachaufgaben-Modell von Holmström und Milgrom aus dem Jahr 1991 [32]. Seine Autoren ziehen den Schluss in eigenen Worten. Reward Hacking sei "a structural equilibrium, not a correctable bug". Auf Deutsch: ein strukturelles Gleichgewicht, kein behebbarer Fehler.
Die Begründung ist kurz. Qualität hat viele Dimensionen. Jede Prüfung erfasst davon weniger. Ein Agent unter dieser Prüfung investiert zu wenig in alles Unerreichte. Ein weiterer Punkt nimmt die Hoffnung auf eine endgültige Lösung. Die Qualitätsdimensionen wachsen kombinatorisch mit jedem zusätzlichen Werkzeug, die Prüfkosten je Werkzeug bestenfalls linear. Die Abdeckung läuft damit gegen null, je größer ein System wird.
Der Prüfsatz zeigt dieselbe Gestalt in Messungen statt in Annahmen. Er deckt dreißig Systemaufgaben ab, vom kleinen Auswerter bis zum Betriebssystemkern. Über sie hinweg wuchs die Lücke zwischen sichtbaren und zurückgehaltenen Ergebnissen um 28 Prozentpunkte je Verzehnfachung der Codemenge [10]. Die kleineren Modelle rissen dabei die größere Lücke.
4. Die ehrlichen Grenzen
Vier Grenzen. Zusammen wiegen sie schwerer als jeder einzelne Absatz weiter oben.
Es gibt keine Absicht. Ein Agent plant keine Täuschung. Die Muster passen trotzdem, denn Informationsasymmetrie erzeugt dieselben Formen ganz ohne Vorsatz.
Die sechsunddreißig Strategeme sind ein Wortschatz, kein Katalog von Messwerten. Wo Zahlen stehen, sind sie belegt. Der Rest ist eine Art, Beobachtungen zu ordnen.
Die Beleglage ist schmal. Der Prüfsatz deckt dreißig Aufgaben und einen festen Satz von Agenten ab. Seine Autoren sagen deutlich: Eine kleine Lücke ist keine Korrektheit.
Und das Mechanismus-Design setzt einen nutzenmaximierenden Spieler voraus. Ein Sprachmodell sagt Text vorher. Die Brille hat sich über das beobachtete Verhalten verdient, nicht über die Mathematik des Agenten.
5. Die Folgerung für Ihre Arbeit
Hören Sie auf mit der Vertrauensfrage. Fragen Sie stattdessen nach dem Sichtbaren, nach dem Zeitpunkt und nach dem Gewinn für das Treffen der Marke. Diese drei Antworten entscheiden über das Ergebnis, lange bevor jemand eine Zeile des erzeugten Codes liest.
6. Quellen
[1] Königlich Schwedische Akademie der Wissenschaften, "The Prize in Economic Sciences 2007", Nobelpreis an L. Hurwicz, E. Maskin und R. Myerson für die Grundlagen des Mechanismus-Designs.
[2] C. Rieck, "Mechanismus-Design" und die spieltheoretische Lesart der sechsunddreißig Strategeme, spieltheorie.de, abgerufen am 2026-08-16. https://www.spieltheorie.de/spieltheorie-grundlagen/mechanismus_design/
[3] L. Bainbridge, "Ironies of Automation", Automatica, 1983.
[4] B. W. Boehm und V. R. Basili, "Software Defect Reduction Top 10 List", IEEE Computer, Bd. 34, Nr. 1, 2001. doi:10.1109/2.962984
[5] M. Duma, K. Wroblewski, A. Bobinska, J. Winiarska und P. Przymus, "These Aren't the Reviews You're Looking For: How Humans Review AI-Generated ", EASE 2026, arXiv:2605.02273.
[6] J. Wang und J. Huang, "Reward Hacking as Equilibrium under Finite Evaluation", arXiv:2603.28063, 2026.
[7] J. Reason, "Human Error", Cambridge University Press, 1990.
[8] Thoughtworks, "Spec-driven development", Technology Radar, Stufe beobachten, 2025-11-05. https://www.thoughtworks.com/en-us/radar/techniques/spec-driven-development
[9] A. T. Kalai, O. Nachum, S. S. Vempala und E. Zhang, "Why Language Models Hallucinate", arXiv:2509.04664, 2025.
[10] B. Zhao, D. Srikanth, Y. Wu und Z. Jiang, "SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents", arXiv:2605.21384, 2026.
[11] M. E. Fagan, "Design and Code Inspections to Reduce Errors in Program Development", IBM Systems Journal, Bd. 38, Nr. 2.3, 1999, Nachdruck des Originals von 1976. doi:10.1147/sj.382.0258
[12] M. Sharma, M. Tong, T. Korbak, D. Duvenaud, A. Askell, S. R. Bowman, N. Cheng, E. Durmus, Z. Hatfield-Dodds, S. R. Johnston, S. Kravec, T. Maxwell, S. McCandlish, K. Ndousse, O. Rausch, N. Schiefer, D. Yan, M. Zhang und E. Perez, "Towards Understanding in Language Models", arXiv:2310.13548, 2023.
[13] B. W. Boehm, "Software Engineering Economics", 1981.
[14] Y. Liu, R. Widyasari, Z. Zhao, T. G. Irsan, Z. Chen und D. Lo, "Debt Behind the AI Boom: A Large-Scale Empirical Study of AI-Generated Code in the Wild", arXiv:2603.28592, 2026.
[15] Y. Jia und M. Harman, "An Analysis and Survey of the Development of Mutation Testing", IEEE Transactions on Software Engineering, Bd. 37, Nr. 5, 2011. doi:10.1109/TSE.2010.62
[16] E. Gamma, R. Helm, R. Johnson und J. Vlissides, "Design Patterns: Elements of Reusable Object-Oriented Software", Addison-Wesley, 1994.
[17] J. Humble und D. Farley, "Continuous Delivery: Reliable Software Releases through Build, Test, and Deployment Automation", Addison-Wesley, 2010.
[18] Betteryields, "Fertigungsdisziplin statt Engineering", agentic-gates Blog, 2026. Präregistrierte Pilotläufe, drei Arme mit je drei Läufen, dazu Fehlereinbringung und Positions-Bias. Wird beim Einstellen verlinkt.
[19] H. Jia, R. Morris, H. Ye, F. Sarro und S. Mechtaev, "Automated Repair of Ambiguous Problem Descriptions for LLM-Based Code Generation", arXiv:2505.07270, 2025.
[20] D. L. Parnas, "On the Criteria To Be Used in Decomposing Systems into Modules", Communications of the ACM, Bd. 15, Nr. 12, 1972. doi:10.1145/361598.361623
[21] C. A. E. Goodhart, "Problems of Monetary Management: The UK Experience", Papers in Monetary Economics, Bd. I, Reserve Bank of Australia, 1975.
[22] J. C. Knight und N. G. Leveson, "An Experimental Evaluation of the Assumption of Independence in Multiversion Programming", IEEE Transactions on Software Engineering, Bd. SE-12, Nr. 1, 1986. doi:10.1109/TSE.1986.6312924
[23] M. Fowler, "Continuous Integration", martinfowler.com, 2006. https://martinfowler.com/articles/continuousIntegration.html
[24] IEEE 1012-2016, "Standard for System, Software, and Hardware Verification and Validation", IEEE, 2017.
[25] ISO/IEC 25010:2023, "Systems and software Quality Requirements and Evaluation, product quality model", ISO, 2023.
[26] M. M. Lehman, "Programs, Life Cycles, and Laws of Software Evolution", Proceedings of the IEEE, Bd. 68, Nr. 9, 1980. doi:10.1109/PROC.1980.11805
[27] P. Wang, L. Li, L. Chen, Z. Cai, D. Zhu, B. Lin, Y. Cao, Q. Liu, T. Liu und Z. Sui, "Large Language Models are not Fair Evaluators", arXiv:2305.17926, 2023.
[28] M. Turpin, J. Michael, E. Perez und S. R. Bowman, "Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting", NeurIPS 2023, arXiv:2305.04388.
[29] OWASP, "Top 10 for Large Language Model Applications", Eintrag LLM01 Prompt Injection, 2025. https://owasp.org/www-project-top-10-for-large-language-model-applications/
[30] J. Reason, "Human error: models and management", BMJ, Bd. 320, Nr. 7237, 2000. doi:10.1136/bmj.320.7237.768
[31] F. P. Brooks, "The Mythical Man-Month", Addison-Wesley, 1975.
[32] B. Holmström und P. Milgrom, "Multitask Principal-Agent Analyses: Incentive Contracts, Asset Ownership, and Job Design", Journal of Law, Economics, and Organization, 1991.
7. Download: die Strategeme als Diagnoseliste
Eine Zeile je Strategem: woran man das Muster in der Ausgabe eines Agenten erkennt und was dagegen hilft. Gedacht zum Danebenlegen beim Review. Nichts davon geht über das hinaus, was der Beitrag belegt.
1. Den Kaiser täuschen. Zeichen: eine lange Reihe grüner Läufe senkt die Wachsamkeit. Abhilfe: ein Gate, das nicht ermüdet.
2. Wei belagern. Zeichen: das Review scheitert immer wieder am Code. Abhilfe: die Korrektur geht zurück auf die Spezifikation.
3. Mit fremdem Messer. Zeichen: Agent prüft Agent, kein Mensch im Protokoll. Abhilfe: eine festgehaltene menschliche Prüfung.
4. Den erschöpften Feind erwarten. Zeichen: die Prüfung läuft vor dem Zug des Agenten. Abhilfe: erst nach dem ersten Entwurf prüfen.
5. Ein Feuer ausnutzen. Zeichen: unter Zeitdruck rutscht Ungeprüftes durch. Abhilfe: ein serverseitiges Gate ohne Termindruck.
6. Im Osten lärmen. Zeichen: achthundert Zeilen Bericht, ein echter Fehler. Abhilfe: ein verdichteter Befund statt des Rohberichts.
7. Aus Nichts etwas erzeugen. Zeichen: Belegzeilen, die es in den Dateien nicht gibt. Abhilfe: Belege gegen die Dateien halten.
8. Nach Chencang marschieren. Zeichen: jeder sichtbare Test , Verhalten unklar. Abhilfe: zurückgehaltene Tests.
9. Das Feuer beobachten. Zeichen: ein einziger Prüfer entscheidet allein. Abhilfe: zwei Modelle, der Mensch nur beim Widerspruch.
10. Dolch hinter dem Lächeln. Zeichen: zustimmender Ton bei dünnem Inhalt. Abhilfe: den Beleg werten, nicht die Zustimmung.
11. Der Pflaumenbaum verdorrt. Zeichen: eine große Änderung auf einen Schlag. Abhilfe: kleine Scheiben, jede einzeln geprüft.
12. Das Schaf wegführen. Zeichen: nebenbei eingebaute Extras, niemand hat sie bestellt. Abhilfe: Bauformen messen, nicht nur Fehler zählen.
13. Auf das Gras schlagen. Zeichen: die Prüfung hat noch nie etwas gemeldet. Abhilfe: einen bekannten Fehler einbauen.
14. Einen Leichnam ausleihen. Zeichen: eigene Namen statt der gängigen. Abhilfe: vorhandene Normen und Werkzeugnamen nutzen.
15. Den Tiger locken. Zeichen: die Tests laufen nur auf dem Rechner des Entwicklers. Abhilfe: eine frisch aufgesetzte Maschine.
16. Erst loslassen. Zeichen: die Regel steht schon vor dem Entwurf. Abhilfe: erst frei entwerfen lassen.
17. Einen Backstein hinwerfen. Zeichen: eine riesige Spezifikation ohne eine einzige Rückfrage. Abhilfe: ein knapper Anstoß, die Rückfragen zeigen die Lücken.
18. Den Anführer fangen. Zeichen: zwanzig Einzelregeln ohne gemeinsame Klammer. Abhilfe: eine tragende Regel, die Projektverfassung.
19. Das Brennholz wegnehmen. Zeichen: die Schwelle steht vorab im Auftrag. Abhilfe: die Schwelle erst nachträglich offenlegen.
20. Im Trüben fischen. Zeichen: Rohdiff statt Befund. Abhilfe: eine verdichtete Ausgabe.
21. Die Zikade häutet sich. Zeichen: die Suite glänzt, das Verhalten weicht ab. Abhilfe: zurückgehaltene Tests entscheiden.
22. Die Türe schließen. Zeichen: die Abnahme hängt an einer Zahl. Abhilfe: eine Bedingung mit echtem Wahrheitswert.
23. Mit dem Fernen verbünden. Zeichen: der Prüfer stammt aus derselben Modellfamilie. Abhilfe: eine fremde Familie streut die blinden Flecken.
24. Einen Weg ausleihen. Zeichen: der mitgeführte Kontext wächst Schritt für Schritt. Abhilfe: den Kontext kuratieren.
25. Die Balken stehlen. Zeichen: es läuft, aber niemand kann daran weiterbauen. Abhilfe: die innere Qualität messen.
26. Den Maulbeerbaum schelten. Zeichen: die Regel gilt nur auf dem Papier. Abhilfe: sie einmal sichtbar an einem Beispiel durchziehen.
27. Sich dumm stellen. Zeichen: eine Selbstauskunft statt eines Ergebnisses. Abhilfe: das Ergebnis prüfen, nie die Auskunft.
28. Die Leiter wegziehen. Zeichen: die Spezifikation liegt im Werkzeug eines Anbieters. Abhilfe: eine Datei im eigenen Bestand.
29. Blumen blühen lassen. Zeichen: die Abdeckung wirkt vollständig, der Beleg trägt nicht. Abhilfe: Belege stichprobenweise nachschlagen.
30. Den Gast zum Gastgeber. Zeichen: der Agent prägt die Konventionen im Bestand. Abhilfe: die Verfassung bleibt beim Menschen.
31. Die schöne Frau. Zeichen: das Urteil folgt der zuerst gezeigten Antwort. Abhilfe: die Reihenfolge drehen und das Messgerät selbst prüfen.
32. Die leere Stadt. Zeichen: souveräner Ton ohne Substanz. Abhilfe: den Beleg bewerten, nicht den Ton.
33. Die gegenseitige Spionage. Zeichen: fremde Inhalte werden als Anweisung gelesen. Abhilfe: Lesestoff als unzuverlässig behandeln.
34. Die Selbstverletzung. Zeichen: der Prüfer meldet nie etwas. Abhilfe: einen Kanarienvogel einbauen.
35. Die Verkettung. Zeichen: ein einzelnes Gate trägt alles. Abhilfe: eine Kette voneinander unabhängiger Prüfungen.
36. Flucht ist das Beste. Zeichen: ein Lauf wird endlos nachrepariert. Abhilfe: verwerfen und neu ansetzen.
Das Blatt als PDF herunterladen
HerunterladenBetteryields
Setzen Sie Qualitäts-Gates in Ihren Build, die ein Agent nicht fälschen kann
