mm.tech
agents beta TypeScript

Darwin Agents

Agentes IA que se mejoran a sí mismos, ahora con optimizador reflexivo estilo GEPA

Prompts auto-evolutivos vía A/B testing, críticos multi-modelo, safety gates. v0.5.0-alpha.2 añade optimizador reflexivo estilo GEPA (GepaOptimizer, Reflector, helpers de Pareto, DARWIN_DEFAULT_OBJECTIVES) encima de captura completa de execution-trace (toolCalls, tokenUsage, errors, capturedAt) para mapeo OTEL. 307 tests, loops de review R1+R2, TypeScript, MIT.

Qué problema resuelve

Escribes un prompt, funciona más o menos, y luego se queda exactamente igual para siempre. En el montaje habitual nada aprende de las doscientas ejecuciones que vinieron después. Darwin lleva registro de cada ejecución, la puntúa, propone una variante del prompt, hace un test A/B de la variante contra el original y solo la adopta si de verdad fue mejor.

Cómo funciona

Vienen ocho agentes de serie, entre ellos writer, researcher, critic, analyst y blog-writer. Cada ejecución se guarda en un archivo SQLite local y la puntúa un conjunto de críticos con varias rúbricas en vez de un solo número, y cuando hay más de una clave de proveedor los críticos se reparten entre familias de modelos para que un modelo no califique a su propia familia con demasiada indulgencia. La mejora empieza a notarse alrededor de las diez ejecuciones: las cinco primeras fijan la línea base, luego se genera una variante y se prueba en las cinco siguientes. Una puerta de seguridad se ocupa del lado malo, y si una variante puntúa más de un veinte por ciento peor se vuelve de inmediato a la última versión que se sabía buena.

Cuándo usarlo

Se gana su sitio donde el mismo agente hace una y otra vez trabajo parecido, porque solo entonces se acumula evidencia. Funciona con el CLI de Claude, la API de Anthropic, una API compatible con OpenAI o un Ollama local, guarda por defecto en SQLite o en Postgres si se lo indicas, y todo se queda en tu disco, sin telemetría.

Cuándo no usarlo

Conviene conocer dos límites antes de leer una promoción como si fuera prueba. Los críticos son a su vez modelos de lenguaje calificando modelos de lenguaje, así que el sesgo del juez no desaparece, solo se atenúa repartiendo rúbricas y familias de modelos. Y el test A/B por defecto compara medias contra un umbral del cinco por ciento, que es una regla práctica de rendimiento y no un test de significación. Existen tests secuenciales formales, a un bloque de configuración de distancia, pero hay que activarlos. Si solo has ejecutado un agente un puñado de veces, aquí todavía no hay nada para ti.

Stars

★ 10

installs

↓ 5,320

Clones (14d)

⊟ 84

Lenguaje

TypeScript

Actualizado

2026-08-28

Instalación

npx -y darwin-agents

Repos relacionados