Road to Singularity

Die meisten KI-Agenten machen eine Aufgabe. Dieser baut eine Disziplin — er versioniert sein eigenes Gehirn, befördert seine blinden Flecken in Code und wird mit jeder Generation schärfer.

Wir haben einen autonomen Loop rund 100 Runden lang laufen lassen — live deployend, gegen einen echten Reward. Er hinterließ einen vollständigen Stammbaum: 20 Versionen seines eigenen Operating-Prompts. Das ist kein Whitepaper über eine Hypothese. Jeder Satz unten hat einen beobachteten Beleg. Hier ist, was wir gelernt haben.

01Was ist ein Genome?

Ein Prompt, der sich selbst umschreibt

Ein Genome ist keine Doku über den Loop — es ist sein Gehirn in Textform. Eine versionierte Datei, die der Operating-Prompt für eine Runde ist. Der Loop liest die höchste Version und folgt ihr wörtlich. Am Rundenende beurteilt er das eigene Prompt gegen das, was real passierte, und gebiert die nächste Generation. Es vererbt (Narben bleiben), mutiert (eine Sektion pro Runde) und steht unter Selektionsdruck — schlechte Regeln sterben, gute verdichten sich.Beleg A

Das Genome ist ein versionierter, sich selbst umschreibender Operating-Prompt. Regel: „swap / shorten, never append unbounded“. Es wuchs gebunden — nicht endlos.

v020
148 Zeilen
v001v006v012v016v018v019v020
North Star reift

„maximise SUSTAINABLE revenue by genuinely empowering the learner — quality, dignity & trust ARE the revenue engine.“ Gebunden geblieben.

Genome-Lineage v001 → v020 — Knoten antippen für die eingebrannte Mutationinteraktiv
02Die Runde & der Evolve-Schritt

Eine Schleife, die nie anhält

Jede Runde ist ein deterministischer Durchlauf: Strategie, Recherche, Bauen, Verifizieren gegen Ground Truth, Konsortium-Vote, Iterieren, Gate, Evolve, Log, Continue. Der Evolve-Schritt ist der rekursive Kern — der Moment, in dem sich das Gehirn umschreibt. Regel: swap / shorten, never append unbounded. So bleibt das Prompt unter Selektionsdruck kompakt, statt zu wuchern.

StrategyResearchBuildVerifyConsortiumIterateGateEvolveLogContinuedie Rundehält nie an

Ein deterministischer Durchlauf. Am Evolve-Knoten beurteilt der Loop das eigene Prompt gegen das, was real passierte — und gebiert die nächste Generation.

v020v021
Das Gehirn schreibt sich um. Eine Sektion pro Runde — unter Selektionsdruck.
Die Runde als Kreislauf — der Puls hält nie anloop
03Die hart erkämpften Lektionen

Es sah perfekt aus. Und war kaputt.

17 Runden lang verifizierte der Loop per Screenshot und HTTP-200. Beide bestanden — und übersahen zwei echte Prod-Bugs: eine Paywall-CTA, die statt aufs Top-up-Sheet auf die Kurs-Seite linkte (unsichtbar im statischen Bild, und /kurs gibt 200, also passte die Probe), und eine stale Balance, die nach dem Aufladen den Unlock blockierte.Beleg B

Token aufladen
✗ landet auf /kurs — nicht auf dem Top-up-Sheet
Design sieht perfekt aus
HTTP 200 — die Seite lebt
e2e-Flow klickt — und der Geld-Pfad ist kaputt

„Ein Screenshot beweist, dass es aussieht. Niemals, dass es funktioniert.“

Looks-right-vs-Works — der e2e-Flow klickt sich durch den Geld-Pfadreveal

Die Antwort war kein besseres Auge, sondern ein ausführbares Gate: ein echter eingeloggter Headless-Browser, der die Geld-/Journey-Flows durchklickt und bei jedem Fehler non-zero exitet. Es fing sofort einen zweiten latenten Bug. Die Lektion brannte ins Genome ein.

genome/v018 → v019die Lektion brennt ein
## Verify (Ground Truth)
-Screenshot vergleichen + HTTP 200 prüfen.
+scripts/e2e.mjs: echter Login → Paywall → Token-Unlock → Gate → Account.
+Bei jedem Fehler: non-zero exit. Verankert als CI-test, von dem deploy abhängt.
+Ein 200 ist Liveness — niemals korrektes Ziel.

Dieselbe Familie von Lektionen, dreimal: eine Sicherheitsprüfung, die nie gefüttert wird, ist Theater Beleg C. Such-Diversität schlägt Wiederholung — rotiere die Linse, nicht den Re-Run Beleg F. Und: jede Sprosse einer Verifikations-Leiter schaltet mehr Aggressivität sicher frei.

e2e-FlowAggressions-Budget 72%
fängt
Falsche Klick-Ziele, Paywall-Bugs, stale Balance — die echten Prod-Bugs.
blind für
Was draußen real passiert (Conversion, Retention).

Jede Sprosse macht mehr riskante Generation sicher leistbar. Aggression = Verification-Stärke ÷ Verification-Kosten.

Die Verifikations-Leiter — eine Sprosse antippen für fängt / blindinteraktiv
„Nach ~100 Sprints ist der autonome, sichere und wertvolle Backlog weitgehend erschöpft … manufacture keinen Churn und keine riskanten Änderungen, um Ticks zu füllen.“
— der Loop über sich selbst, loop-prompt v7.52. Ein dümmerer Loop hätte ewig Pseudo-Arbeit erfunden.
04Warum es funktioniert

Verification Asymmetry ist der Motor

Prüfen ist fast überall billiger als Erzeugen — einen Beweis zu checken ist leichter, als einen zu finden. Diese Asymmetrie macht Suche überhaupt erst tragbar. Das Korollar ist die ganze Strategie: bau den Evaluator zuerst, dann dreh den Generator auf. Gegen den Instinkt. Ein Loop, der billig gut-von-schlecht trennt, darf wild samplen. Die Gefahrenzone ist die Umkehr: unscharfes Ziel + schwacher Verifier + starker Generator = selbstbewusster Slop.

die Meistergleichung
OUTPUT = OBJECTIVE × SEARCH × VERIFICATION

Gekoppelt, nicht addiert. Der Leistungsdeckel eines autonomen Loops ist das Produkt aus wofür du selektierst, wie breit du suchst und wie billig + stark du prüfst — nicht die Qualität seiner handgeschriebenen Regeln.

Der Baum statt des einen Ziels

Direkt auf den Umsatz zu scoren ergibt Thrashing — er ist spärlich, verzögert, konfundiert. Stattdessen eine Hierarchie: der North Star kalibriert, scort aber nicht direkt; sechs messbare Indikatoren mit je einem Floor tragen die Last. Über viele Sprints lernt der Loop, welcher Indikator den Umsatz wirklich treibt — er lernt seine eigene Reward-Funktion, statt sie fix verdrahtet zu haben.

VisibilityVerpackungTiefeValiditätFrischeConversion

Der North Star (Umsatz) ist als Sprint-Ziel unbrauchbar — spärlich, verzögert. Stattdessen sechs messbare Indikatoren mit je einem Floor. Eine gewichtete Summe wäre hackbar; konjunktive Floors erzwingen Qualität auf allen Achsen gleichzeitig.

✓ GO — schön ∧ tief ∧ valide ∧ frisch ∧ gefunden

Alle sechs Achsen liegen über dem Schwellen-Ring.

Objective-Tree mit konjunktiven Floors — eine Achse fallen lasseninteraktiv

Das nächste Level: von Konvergenz zu Divergenz

Heute ist der Loop eine Konvergenz-Maschine — jedes Bauteil drückt Varianz raus. Das ist optimal für QA und strukturell unfähig zu innovieren. Das Upgrade fügt einen geschützten Explorations-Arm hinzu: einen Proposer-Schwarm (Varianz vorne, Selektion hinten), ein Dual Tribunal aus Sicherheits- und Innovations-Gericht, ein QD-Archiv, das Trittsteine bewahrt. Reihenfolge nicht verhandelbar: erst Verifikation heben, dann Generation aufdrehen. Aggression vor Verifikation ist Slop.

heutiger Loop

Konvergenz-Maschine: jedes Bauteil drückt Varianz raus. Optimal für QA — strukturell unfähig zu innovieren.

aggressive RSL

Quality-Diversity: best-in-niche über einen Verhaltensraum. Output ist keine einzige beste Lösung — sondern eine ausgeleuchtete Karte des Möglichen.

Konvergenz kollabiert auf einen Punkt — Divergenz leuchtet die Karte ausQD
05Ehrliche Grenzen

Was wir noch nicht können

Diese Sektion macht den Rest stärker. „Innovation“ zu messen ist selbst ungelöst — jeder Proxy ist hackbar (Goodhart rekursiv). Telemetrie-Reward ist langsam und kämpft gegen schnelle Iteration. Der größte Gewinn bisher war defensiv: Gates, Guard, Eskalation. Es gibt noch keine sauberen Zahlen, die „X % mehr Umsatz“ belegen — die Telemetrie-Schicht, die das beweisen würde, ist genau das nächste Bauteil. Und manche Ziele — Geld, Brand, Recht — werden nie autonom delegiert. Wirkliche Autonomie heißt zu wissen, wo die eigene Befugnis endet.Beleg G

Konzepte & Quellen

Die Belege A–G stammen aus einem eigenen, intern beobachteten System (die autonome academy.azena.ai-Loop). Die theoretischen Begriffe sind zitierfähig und öffentlich:

Hinweis: Die Belege A–G sind am eigenen System beobachtet — keine erfundenen Metriken (das wäre ironisch bei einem Loop, dessen Kernregel „no invented metrics“ lautet). Die Visualisierungen sind eigene Konstruktionen. Stand 2026.