Wir haben einen autonomen Loop rund 100 Runden lang laufen lassen — live deployend, gegen einen echten Reward. Er hinterließ einen vollständigen Stammbaum: 20 Versionen seines eigenen Operating-Prompts. Das ist kein Whitepaper über eine Hypothese. Jeder Satz unten hat einen beobachteten Beleg. Hier ist, was wir gelernt haben.
Ein Prompt, der sich selbst umschreibt
Ein Genome ist keine Doku über den Loop — es ist sein Gehirn in Textform. Eine versionierte Datei, die der Operating-Prompt für eine Runde ist. Der Loop liest die höchste Version und folgt ihr wörtlich. Am Rundenende beurteilt er das eigene Prompt gegen das, was real passierte, und gebiert die nächste Generation. Es vererbt (Narben bleiben), mutiert (eine Sektion pro Runde) und steht unter Selektionsdruck — schlechte Regeln sterben, gute verdichten sich.Beleg A
Das Genome ist ein versionierter, sich selbst umschreibender Operating-Prompt. Regel: „swap / shorten, never append unbounded“. Es wuchs gebunden — nicht endlos.
„maximise SUSTAINABLE revenue by genuinely empowering the learner — quality, dignity & trust ARE the revenue engine.“ Gebunden geblieben.
Eine Schleife, die nie anhält
Jede Runde ist ein deterministischer Durchlauf: Strategie, Recherche, Bauen, Verifizieren gegen Ground Truth, Konsortium-Vote, Iterieren, Gate, Evolve, Log, Continue. Der Evolve-Schritt ist der rekursive Kern — der Moment, in dem sich das Gehirn umschreibt. Regel: swap / shorten, never append unbounded. So bleibt das Prompt unter Selektionsdruck kompakt, statt zu wuchern.
Ein deterministischer Durchlauf. Am Evolve-Knoten beurteilt der Loop das eigene Prompt gegen das, was real passierte — und gebiert die nächste Generation.
Es sah perfekt aus. Und war kaputt.
17 Runden lang verifizierte der Loop per Screenshot und HTTP-200. Beide bestanden — und übersahen zwei echte Prod-Bugs: eine Paywall-CTA, die statt aufs Top-up-Sheet auf die Kurs-Seite linkte (unsichtbar im statischen Bild, und /kurs gibt 200, also passte die Probe), und eine stale Balance, die nach dem Aufladen den Unlock blockierte.Beleg B
„Ein Screenshot beweist, dass es aussieht. Niemals, dass es funktioniert.“
Die Antwort war kein besseres Auge, sondern ein ausführbares Gate: ein echter eingeloggter Headless-Browser, der die Geld-/Journey-Flows durchklickt und bei jedem Fehler non-zero exitet. Es fing sofort einen zweiten latenten Bug. Die Lektion brannte ins Genome ein.
## Verify (Ground Truth)-Screenshot vergleichen + HTTP 200 prüfen.+scripts/e2e.mjs: echter Login → Paywall → Token-Unlock → Gate → Account.+Bei jedem Fehler: non-zero exit. Verankert als CI-test, von dem deploy abhängt.+Ein 200 ist Liveness — niemals korrektes Ziel.
Dieselbe Familie von Lektionen, dreimal: eine Sicherheitsprüfung, die nie gefüttert wird, ist Theater Beleg C. Such-Diversität schlägt Wiederholung — rotiere die Linse, nicht den Re-Run Beleg F. Und: jede Sprosse einer Verifikations-Leiter schaltet mehr Aggressivität sicher frei.
- fängt
- Falsche Klick-Ziele, Paywall-Bugs, stale Balance — die echten Prod-Bugs.
- blind für
- Was draußen real passiert (Conversion, Retention).
Jede Sprosse macht mehr riskante Generation sicher leistbar. Aggression = Verification-Stärke ÷ Verification-Kosten.
„Nach ~100 Sprints ist der autonome, sichere und wertvolle Backlog weitgehend erschöpft … manufacture keinen Churn und keine riskanten Änderungen, um Ticks zu füllen.“
Verification Asymmetry ist der Motor
Prüfen ist fast überall billiger als Erzeugen — einen Beweis zu checken ist leichter, als einen zu finden. Diese Asymmetrie macht Suche überhaupt erst tragbar. Das Korollar ist die ganze Strategie: bau den Evaluator zuerst, dann dreh den Generator auf. Gegen den Instinkt. Ein Loop, der billig gut-von-schlecht trennt, darf wild samplen. Die Gefahrenzone ist die Umkehr: unscharfes Ziel + schwacher Verifier + starker Generator = selbstbewusster Slop.
Gekoppelt, nicht addiert. Der Leistungsdeckel eines autonomen Loops ist das Produkt aus wofür du selektierst, wie breit du suchst und wie billig + stark du prüfst — nicht die Qualität seiner handgeschriebenen Regeln.
Der Baum statt des einen Ziels
Direkt auf den Umsatz zu scoren ergibt Thrashing — er ist spärlich, verzögert, konfundiert. Stattdessen eine Hierarchie: der North Star kalibriert, scort aber nicht direkt; sechs messbare Indikatoren mit je einem Floor tragen die Last. Über viele Sprints lernt der Loop, welcher Indikator den Umsatz wirklich treibt — er lernt seine eigene Reward-Funktion, statt sie fix verdrahtet zu haben.
Der North Star (Umsatz) ist als Sprint-Ziel unbrauchbar — spärlich, verzögert. Stattdessen sechs messbare Indikatoren mit je einem Floor. Eine gewichtete Summe wäre hackbar; konjunktive Floors erzwingen Qualität auf allen Achsen gleichzeitig.
Alle sechs Achsen liegen über dem Schwellen-Ring.
Das nächste Level: von Konvergenz zu Divergenz
Heute ist der Loop eine Konvergenz-Maschine — jedes Bauteil drückt Varianz raus. Das ist optimal für QA und strukturell unfähig zu innovieren. Das Upgrade fügt einen geschützten Explorations-Arm hinzu: einen Proposer-Schwarm (Varianz vorne, Selektion hinten), ein Dual Tribunal aus Sicherheits- und Innovations-Gericht, ein QD-Archiv, das Trittsteine bewahrt. Reihenfolge nicht verhandelbar: erst Verifikation heben, dann Generation aufdrehen. Aggression vor Verifikation ist Slop.
Konvergenz-Maschine: jedes Bauteil drückt Varianz raus. Optimal für QA — strukturell unfähig zu innovieren.
Quality-Diversity: best-in-niche über einen Verhaltensraum. Output ist keine einzige beste Lösung — sondern eine ausgeleuchtete Karte des Möglichen.
Was wir noch nicht können
Diese Sektion macht den Rest stärker. „Innovation“ zu messen ist selbst ungelöst — jeder Proxy ist hackbar (Goodhart rekursiv). Telemetrie-Reward ist langsam und kämpft gegen schnelle Iteration. Der größte Gewinn bisher war defensiv: Gates, Guard, Eskalation. Es gibt noch keine sauberen Zahlen, die „X % mehr Umsatz“ belegen — die Telemetrie-Schicht, die das beweisen würde, ist genau das nächste Bauteil. Und manche Ziele — Geld, Brand, Recht — werden nie autonom delegiert. Wirkliche Autonomie heißt zu wissen, wo die eigene Befugnis endet.Beleg G
Konzepte & Quellen
Die Belege A–G stammen aus einem eigenen, intern beobachteten System (die autonome academy.azena.ai-Loop). Die theoretischen Begriffe sind zitierfähig und öffentlich:
- Sutton — The Bitter Lessonincompleteideas.net
Skalierende generische Methoden (Suche + Lernen) schlagen hand-engineertes Wissen.
- Lehman & Stanley — Abandoning Objectives (Novelty Search)cs.swarthmore.edu
Auf Neuheit statt Ziel optimieren entkommt deceptive local optima.
- Mouret & Clune — Illuminating Search Spaces (MAP-Elites)arxiv.org
Archiv von best-in-niche über einen Verhaltensraum statt eines einzelnen Besten.
- METR — Measuring AI Ability to Complete Long Tasksmetr.org
Aufgaben-Horizont autonomer Agenten — die reale Verifikations-/Generations-Asymmetrie.
Hinweis: Die Belege A–G sind am eigenen System beobachtet — keine erfundenen Metriken (das wäre ironisch bei einem Loop, dessen Kernregel „no invented metrics“ lautet). Die Visualisierungen sind eigene Konstruktionen. Stand 2026.