Die Signal FilesInteraktiver FeldführerBegleiter zur Recherche

Das Harness, lesbar gemacht.

Ein fähiger Agent in einem leeren Raum scheitert trotzdem. Dies ist der Begleit-Feldführer zu unserem Signal File über Harness Engineering, die Disziplin, die aus einem kraftvollen Modell ein zuverlässiges macht. Hier wird sie mit der Interpretable Context Methodology (ICM) abgeglichen. Zwölf Lektionen und ein Paper, navigierbar gemacht.

12
Lektionen
6
Projekte
5
Subsysteme
9
Konsens
7
Divergenz
Herkunft

Wir haben das Training nicht gemacht. Wir haben es lesbar gemacht. Das Curriculum ist Learn Harness Engineering von walkinglabs (MIT-Lizenz); die Methode der interpretierbaren Kontextführung ist die Arbeit von Van Clief & McDermott (arXiv:2603.16021). Stop Trying To Be Invisible hat weder den Kurs noch das Paper geschrieben. Wir haben diese visuelle Struktur gebaut, um dichtes Quellenmaterial in etwas zu verwandeln, das Sie an einem Nachmittag navigieren und nutzen können. Das Denken gehört ihnen; die Lesbarkeit ist unsere. Zur vollständigen Recherche →

01 · DAS MENTALE MODELL

Ein Harness ist kein Prompt. Es ist eine arbeitende Schleife.

Die Kernaussage des Kurses: Ein Harness macht das Modell nicht klüger. Es baut ein geschlossenes System um das Modell, damit dessen Kapazität tatsächlich realisiert wird. Wählen Sie eine Phase, um zu sehen, was sie tut und welche Datei sie trägt.

Learn Harness Engineering, Harness-Schleife der Kurs-Startseite (AGENTS.md → init.sh → Ausführen → Feedback → Prüfen → Übergabe)
02 · DAS CURRICULUM

Zwölf Fehler, zwölf Lösungen.

Jede Lektion diagnostiziert eine Art, wie fähige Agenten scheitern, und führt dann das Harness-Primitiv ein, das sie verhindert. Wählen Sie eine Karte für These, Fehler, Lösung und das Artefakt, das Sie in ein Repo legen würden.

03 · DIE PRAXIS

Sechs Projekte, eine App, ein immer stärkeres Harness.

Die Lektionen sind Theorie; die Projekte bauen sie. Eine Wissensdatenbank-App wird durch sechs Stufen geführt. Jede fügt eine Harness-Schicht hinzu und läuft zweimal, schwach gegen stark, damit Sie den Unterschied spüren statt ihn zu lesen.

04 · DIE KORRELATION

Harness Engineering × ICM

Zwei Methoden, eine geistige Abstammung: Unix, Trennung der Belange, Klartext, das Repository als Wahrheit. Aber sie optimieren Verschiedenes. Hier ist genau, wo sie übereinstimmen, wo sie sich trennen und wie ihre Begriffe zueinander passen.

HARNESS ENGINEERING

Zuverlässigkeit für autonome Coding-Agenten

Codex / Claude Code zuverlässig Software bauen lassen, über fünf Subsysteme (Anweisungen, Werkzeuge, Umgebung, Zustand, Feedback), wobei ausführbare Verifikation das „Gefühl" des Agenten ersetzt. Optimiert die Zuverlässigkeitsfläche des Agenten.

ICM · VAN CLIEF & McDERMOTT, 2026

Interpretierbarkeit für menschlich geprüfte Pipelines

Framework-Orchestrierung durch Ordnerstruktur ersetzen: nummerierte Stufen, Markdown-Kontext, ein menschliches Review-Gate an jeder Grenze. Optimiert die Kontroll- und Interpretierbarkeitsfläche des Menschen.

ICM-Kontextschicht / SchrittHarness-Engineering-Äquivalent
Die Synthese in einem Satz

ICM ist das Makro-Skelett: wo Dateien liegen, welcher Kontext wann lädt und wo ein Mensch prüft. Harness Engineering ist die Mikro-Maschinerie in einer Stufe: wie man beweist, dass die Ausgabe echt ist, wie der Zustand einen Neustart übersteht, wie der Lauf beobachtbar bleibt. Sie sind keine Rivalen. Sie können eine harness-engineerte Coding-Stufe innerhalb einer ICM-Pipeline laufen lassen: ICM übergibt dem Agenten einen sauberen, eingegrenzten Kontext; das Harness stellt sicher, dass das Zurückkommende wahr ist.

05 · DER SPICKZETTEL

Fehler → Lösung → die eine Datei, die ihn behebt.

Das Betriebsprinzip: Fügen Sie das kleinste Artefakt hinzu, das den tatsächlich beobachteten Fehler adressiert. Lösen Sie nicht jedes Zuverlässigkeitsproblem, indem Sie mehr Text in eine globale Anweisungsdatei kippen. Orange markiert das Kaputte.

FehlermodusWie es aussiehtPrimäre LösungArtefakt
Learn Harness Engineering, resources/reference/method-map
Harness-Stärke · dasselbe Modell, ein anderes Ergebnis
UnsichtbarAufkommendSichtbarDominant
P1 Nur Prompt: Der Agent rät, driftet, meldet zu früh Erfolg
P3 +Zustand & Kontinuität: übersteht Neustarts, ein Feature nach dem anderen
P5 +Rollentrennung: Generator / Evaluator / Planner
P6 Vollständiges Harness: beobachtbar, verifiziert, saubere Übergabe

Die Variable, die Ergebnisse bewegt, ist nicht das Modell. Es ist das Harness.

Allein Rollentrennung hebt einen Evaluator-Score von 1,6 / 5 (ein Agent benotet sich selbst) auf 4,9 / 5 mit Planner, Generator und unabhängigem Evaluator. Diese Lücke ist die ganze Disziplin in einer Zahl.

Learn Harness Engineering, Projekt 05, Evaluator-Rubrik-Scores (single-role → plan-gen-eval)
06 · HEUTE STARTEN

Das minimale Harness, das Sie heute Nachmittag ausliefern können.

Sie brauchen nicht alle zwölf Lektionen, um zu beginnen. Legen Sie vier Dateien in ein beliebiges Repo, und Sie haben die Grenze vom Prompting zum Harness überschritten.

DATEI A

AGENTS.md

Ein 50–200-Zeilen-Router: Überblick, Startbefehle, ≤15 harte Vorgaben, Links nach außen. Kein Lexikon.

DATEI B

init.sh

Ein Skript, das eine frische Session in Minuten vom Klon zu einem bestandenen Beispieltest bringt.

DATEI C

feature_list.json

Jedes Feature als Tripel: Verhalten · Verifikationsbefehl · Zustand. Die maschinenlesbare Quelle von „fertig".

DATEI D

claude-progress.md

Ausstempel-Datei: was fertig ist, was kaputt ist, was als Nächstes kommt. Die nächste Session liest sie zuerst.

07 · QUELLEN

Woher das stammt.

  1. Das Signal File, unsere Recherche (hier starten)
  2. Learn Harness Engineering, Kurs (MIT-Lizenz; zwölf Vorlesungen, sechs Projekte)
  3. Interpretable Context Methodology, Van Clief & McDermott, arXiv 2026 (CC BY 4.0)
  4. OpenAI: Harness engineering, Lopopolo, 2026
  5. Anthropic: Effective harnesses for long-running agents, Young, 2025
  6. Anthropic: Harness design for long-running application development, Rajasekaran, 2026