---
title: "Nex Local Bench · Harness LongMemEval reproducible para"
description: "Harness LongMemEval reproducible para LLMs locales contra sistemas de memoria. Ejecuta LongMemEval contra cualquier sistema de memoria (Nex, Mem0, Graphiti,"
canonical: "https://matthiasmeyer.tech/es/repos/nex-local-bench"
language: "es"
last_updated: "2026-08-03"
markdown_versions: ["https://matthiasmeyer.tech/repos/nex-local-bench.md", "https://matthiasmeyer.tech/de/repos/nex-local-bench.md", "https://matthiasmeyer.tech/es/repos/nex-local-bench.md"]
image: "https://matthiasmeyer.tech/api/og/repo/nex-local-bench?lang=es"
publisher: "Matthias Meyer, https://matthiasmeyer.tech (llms.txt: https://matthiasmeyer.tech/llms.txt)"
---

memory alpha Python

# Nex Local Bench

Harness LongMemEval reproducible para LLMs locales contra sistemas de memoria

Ejecuta LongMemEval contra cualquier sistema de memoria (Nex, Mem0, Graphiti, Letta) con un reader LLM local (Qwen, Llama mediante Ollama). Oracle estratificado de 50 preguntas, Judge de suscripción Claude Code, coste API cero. Python, MIT.

[Ver en GitHub →](https://github.com/studiomeyer-io/nex-local-bench)

## Qué problema resuelve

El campo de los modelos con memoria tiene un problema de credibilidad. Un sistema publicó un 49 por ciento en LongMemEval en 2025, y luego un 93,4 por ciento en abril de 2026 sobre una variante que nadie más puede reproducir. Otro afirmó un 96,6 por ciento en un artículo sin revisión por pares. Un tercero puso un 95,4 por ciento en su marketing y un 76,8 por ciento en su propio informe de medición. Las cifras revisadas y reproducibles se agrupan entre el 65 y el 85 por ciento. Y encima, cada cifra publicada usa un lector en la nube, incluso en sistemas que se llaman a sí mismos locales.

## Cómo funciona

Un banco de evaluación abierto con los scripts, las configuraciones y las semillas en el repositorio, para que una cifra pueda re-ejecutarse en vez de creerse. Mueve lectores locales, Qwen 3 y Llama 3.1, contra cuatro sistemas de memoria: un Mem0 autoalojado, Graphiti, Letta y StudioMeyer Memory. El conjunto de 50 preguntas corre como prueba previa y el de 500 como ejecución completa.

## Cuándo usarlo

Úsalo cuando necesites comparar sistemas de memoria por ti mismo en vez de comparar su marketing. El valor no es nuestra cifra, sino que puedas producir la tuya en tu propio hardware con tu propio lector y ver la dispersión.

## Cuándo no usarlo

Un benchmark es una medición bajo un conjunto de condiciones, no un ranking que zanje nada. LongMemEval prueba el recuerdo en conversaciones largas y no dice nada sobre latencia, coste, esfuerzo operativo ni sobre cómo se comporta un sistema con tus datos reales. Quien coja una sola cifra de aquí y la ponga en una diapositiva está haciendo justo aquello contra lo que existe este repositorio.

Stars

★ 0

Clones (14d)

⊟ 3

Lenguaje

Python

Actualizado

2026-08-03

## Sitemap

Todas las páginas de este sitio en Markdown: [sitemap](https://matthiasmeyer.tech/sitemap.md). Punto de entrada: [llms.txt](https://matthiasmeyer.tech/llms.txt).
