Darwin Agents
KI-Agents die sich selbst verbessern, jetzt mit GEPA-Style Reflective Optimizer
Selbst-evolvierende Prompts über A/B-Tests, Multi-Model-Critics, Safety-Gates. v0.5.0-alpha.2 ergänzt GEPA-Style Reflective Optimizer (GepaOptimizer, Reflector, Pareto-Helpers, DARWIN_DEFAULT_OBJECTIVES) auf der Basis vollständiger Execution-Trace-Capture (toolCalls, tokenUsage, errors, capturedAt) für OTEL-Mapping. 307 Tests, R1+R2-Review-Loops, TypeScript, MIT.
Welches Problem es löst
Du schreibst einen Prompt, er funktioniert leidlich, und dann bleibt er für immer genau so. Im üblichen Aufbau lernt nichts aus den zweihundert Läufen, die danach kamen. Darwin führt Buch über jeden Lauf, bewertet ihn, schlägt eine Variante des Prompts vor, testet die Variante gegen das Original und übernimmt sie nur, wenn sie wirklich besser war.
Wie es arbeitet
Acht Agenten sind von Haus aus dabei, darunter writer, researcher, critic, analyst und blog-writer. Jeder Lauf landet in einer lokalen SQLite-Datei und wird von einem Satz Kritiker bewertet, mit mehreren Rastern statt einer einzelnen Zahl, und wenn mehr als ein Anbieter-Schlüssel da ist, verteilen sich die Kritiker über Modellfamilien, damit ein Modell die eigene Familie nicht zu freundlich benotet. Ungefähr ab zehn Läufen zeigt sich Verbesserung: die ersten fünf setzen die Grundlinie, dann entsteht eine Variante und wird über die nächsten fünf getestet. Ein Sicherheitstor kümmert sich um die Kehrseite, und fällt eine Variante um mehr als zwanzig Prozent ab, geht es sofort zurück auf die letzte Fassung, die nachweislich gut war.
Wann du es nimmst
Es verdient seinen Platz dort, wo derselbe Agent immer wieder ähnliche Arbeit macht, denn nur dann sammelt sich Beleg an. Es läuft über die Claude-Kommandozeile, die Anthropic-API, eine OpenAI-kompatible API oder ein lokales Ollama, gespeichert wird standardmäßig in SQLite oder in Postgres, wenn du es darauf zeigen lässt, und alles bleibt auf deiner Platte, ohne Telemetrie.
Wann du es nicht nimmst
Zwei Grenzen solltest du kennen, bevor du eine Beförderung als Beweis liest. Die Kritiker sind selbst Sprachmodelle, die Sprachmodelle benoten, die Schieflage des Richters verschwindet also nicht, sie wird nur durch verteilte Raster und Modellfamilien abgestumpft. Und der voreingestellte A/B-Test vergleicht Mittelwerte gegen eine Fünf-Prozent-Schwelle, das ist eine Durchsatz-Faustregel und kein Signifikanztest. Formale sequenzielle Tests gibt es, sie sind einen Konfigurationsblock entfernt, aber du musst sie einschalten. Wenn du einen Agenten erst ein paar Mal laufen hattest, ist hier für dich noch nichts drin.
Stars
★ 10
installs
↓ 5,323
Clones (14d)
⊟ 84
Sprache
TypeScript
Aktualisiert
2026-08-28
Installation
npx -y darwin-agents