Kernaussagen
- Fazit vorweg: Kein Einheitsgewinner — Mem0 für den schnellsten Bolt-on, Zep für Temporal/Compliance, Letta für Memory+Runtime-Einheit, TencentDB Agent Memory für Team-Vier-Ebenen-Assets+MCP, LangMem für LangGraph-Natives, OpenMemory für lokales MCP app-übergreifend.
- Gleiches Support-Bot-Skript (50 Turns + 20 relationale Sonden): Mem0 schnellstes Onboarding (~45 Min.), Zep beste relationale Recall, Letta beste Langzeit-Persona, TencentDB führt bei Code/Wiki-Cold-Start.
- Modellqualität ist nicht der Trenner — Gedächtnistyp (Nutzerfakten vs. Zeitgraph vs. selbstverwalteter Kontext vs. Team-Assets) ist es.
- Memory kolokiert mit MCP-Servern, Repos und Secrets auf einem Always-on-Knoten deployen (siehe MCP-Deployment-Leitfaden).
- Enthält Szenario-Matrix, empfohlene Stacks, 7-Schritte-Rollout und FAQ. Keywords: Best Agent Memory Framework · Mem0 · Zep · Letta · TencentDB · LangMem · OpenMemory.
Fazit: 2026 Best Agent Memory Framework Ranking (Hands-on)
Framework-Wahl hängt davon ab, was gemerkt werden muss, wer es bearbeiten darf und ob Fakten verfallen — nicht von GitHub Stars. Mit demselben Modell schlägt die richtige Memory-Schicht Modellwechsel bei Token-Kosten und Halluzinationen.
Im August 2026 haben wir sechs Stacks in dasselbe Node.js-Support-Bot-Gerüst integriert: Signup → Planwechsel → Beschwerde → 30-Tage-Follow-up. Gewichtung von Time-to-First-Memory, P95-Suchlatenz, Recall@5 bei relationalen Sonden, monatlichen API-Kosten und Mandantenisolation:
- Mem0 — ~30 Zeilen für
add/search; managed oder self-hosted; bester Default für bestehende Agents. - Zep + Graphiti — best bei verfallenden Fakten („Allergie im Juni geheilt“); Finance/Health/Ticketing-Audits.
- Letta (ex-MemGPT) — Agents bearbeiten Memory Blocks; wochenlange Assistenten; Letta-Runtime erforderlich.
- TencentDB Agent Memory — Tencent MIT OSS; Chat/Skill/Wiki/CodeGraph-Ebenen + fünf MCP-Tools; OpenClaw/Claude-Code-Pfade.
- LangMem — LangChain-Primitives auf
BaseStore; null Reibung bei bestehendem LangGraph. - OpenMemory — Mem0-basiertes lokales MCP; Memory über Cursor und Claude Desktop teilen; kein Multi-Tenant-SaaS.
Asymmetrisches Fazit: Es gibt kein universelles „Beste“ — es gibt das Passende für Nutzer-, Temporal-, Selbstverwaltungs- oder Team-Asset-Memory.
1. Warum Agents eine dedizierte Memory-Schicht brauchen
Mainstream-Agents 2025–2026 (Claude Code, Cursor, OpenClaw) pushen Kontext auf 200K+, aber Produktion scheitert weiterhin an drei Klassen:
- Session-Übergreifende Brüche: Nutzer sagte letzte Woche „nur Dark Mode“, Agent fragt heute erneut — größere Fenster retten beendete Threads nicht.
- Zeit und Beziehungen: „Budget, das mein Manager gestern freigab“ braucht Graph oder bitemporale Fakten, nicht flache Vektoren.
- Team-Cold-Start: neue Agents sollen Firmenrichtlinien nicht aus leerem Chat lernen; Wiki, CodeGraph, genehmigte Skills mounten.
Memory-Schichten trennen Chat-Flow von abrufbaren Assets mit Schreibpolicy, Routing und ACL — gleiches Muster wie Dual-Agent-Cloud-Mac-Isolation: Ausführung und Memory sollten 7×24 online bleiben, nicht auf einem schlafenden Laptop.
2. Vier Framework-Typen
2.1 Bolt-on-Schicht (Mem0, OpenMemory)
Mem0 extrahiert Fakten per SDK; OpenMemory verpackt ähnliche Fähigkeit als lokales MCP für Cursor/Claude.
2.2 Temporaler Graph (Zep / Graphiti)
Graphiti bitemporale Kanten; Zep Cloud hostet APIs.
2.3 Selbstverwaltete Runtime (Letta)
Letta — Core/Recall/Archival-Ebenen; Agent-Tools bearbeiten Memory.
2.4 Orchestrierungs-nativ + Team-Hub (LangMem, TencentDB)
LangMem auf LangGraph-Store; TencentDB Agent Memory vereint Docs/Code/Chat zu ACL-gebundenen Assets via MCP.
3. Benchmark-Methodik
Umgebung: AWS t3.large Kontrollhost + kvmboot Cloud Mac M4 16GB (Claude-Code-Agent + MCP-Sonden). Daten: anonymisierter Support-Korpus, 50 Turns × 3 Nutzer-Personas. Metriken:
- TTFM (Time To First Memory): Ingenieur-Stunden von Clone bis erster erfolgreicher Recall;
- P95-Suchlatenz: Millisekunden pro
search-Aufruf; - Recall@5: 20 relationale/Zeit-Fallen-Sonden;
- Monatliche Kostenschätzung: Memory Write + Search API (ohne Haupt-LLM-Chat);
- Isolation: Nutzer A darf Memory von Nutzer B nicht abrufen (muss fehlschlagen).
Zahlen sind kvmboot-interne Referenzen — 48h auf eigenen Daten nachfahren, bevor Vendor fixiert werden.
4. Sechs-Framework-Vergleich
| Framework | Entry | Memory model | Deploy / cost | Permission boundary | Best for |
|---|---|---|---|---|---|
| Mem0 🥇 | Python/JS SDK, REST | Extracted facts + vector/graph (Pro) | Managed free tier + self-host | Per user_id / agent_id | Bolt memory onto an existing agent fast |
| Zep 🥈 | Python/TS/Go SDK | Temporal knowledge graph (Graphiti) | Cloud-first; Graphiti OSS | Session + entity ACL | Compliance, audits, evolving facts |
| Letta 🥉 | Letta Agent SDK / ADE | Core / Recall / Archival tiers | Self-host Postgres+pgvector or cloud | Agent-managed memory blocks | Greenfield long-running stateful agents |
| TencentDB Agent Memory | MCP / OpenClaw plugin / SDK | 4-tier assets: Chat·Skill·Wiki·CodeGraph | Local SQLite default; optional TCVDB | Team/User/Agent ACL binding | Multi-agent teams, cold-start knowledge import |
| LangMem | LangGraph BaseStore |
Semantic/episodic/procedural primitives | OSS library; storage-agnostic | LangGraph thread/store scope | Teams already on LangGraph |
| OpenMemory | Local MCP server | Mem0-powered cross-app memory | Local-first, no cloud required | User-owned disk | Share memory across Cursor/Claude tools |
5. Notizen pro Framework
5.1 Mem0 — schnellste Integration, größtes Ökosystem
Erster Recall in ~45 Minuten: pip install mem0ai, Qdrant oder managed Endpoint, client.add(messages, user_id=...). Recall@5 ~88% bei flachen Fakten, ~62% bei relationalen/Zeit-Fallen. Graph Memory erfordert Pro (~249 $/Mo.) — wenn Graphen Kern sind, Zep bevorzugen. Docs: docs.mem0.ai. Best für bestehende FastAPI/LangChain-Agents, die nur Nutzer-Memory brauchen.
5.2 Zep (Graphiti) — Temporal und Compliance
Onboarding ~2–3 Stunden (Session- + User-Modellierung). Relationaler Recall@5 ~91% (Gruppenbeste); P95 ~180–220 ms managed. Zep CE eingestellt; Produktion oft Cloud oder self-hosted Graphiti auf Neo4j. Best für Ticketing, CRM, Healthcare, wo Fakten verfallen und Audits zählen.
5.3 Letta — Langzeit-Persona und selbstverwaltetes Memory
Höchste Integrationskosten: Agent zu Letta SDK/ADE migrieren, TTFM ~1 Tag. Persona-Konsistenz bei 50 Turns ~+15% vs. Mem0 — Agents kuratieren Core Blocks aktiv. Self-Host: Postgres + pgvector. Best für Persönliche Assistenten, Research-Agents, NPCs, nicht „API an Microservice hängen“.
5.4 TencentDB Agent Memory — Team-Vier-Ebenen-Assets + MCP
Tencents 2026 MIT OSS TencentDB-Agent-Memory ist ein Memory Hub, keine einzelne Vektor-DB: Chat Memory, Skill, Wiki, CodeGraph als ACL-Assets. Default SQLite + sqlite-vec lokal; optional Tencent Cloud Vector DB (TCVDB). Nach Import eines mittelgroßen Monorepos schlug tdai_memory_search reines Mem0-Vektor bei „Wer ruft diese API auf?“ um +23% relevante Dateien. MCP-Tools: tdai_recall, tdai_capture, tdai_session_end usw. OpenClaw-npm-Plugin + Claude-Code-Adapter. Best für Multi-Agent-Teams mit Cold-Start aus Docs und Code.
5.5 LangMem — LangGraph-native Primitives
Wenn Produktion bereits auf LangGraph läuft, ist langmem nahezu reibungslos: create_memory_store_manager auf AsyncPostgresStore. Standalone-Adoption ist schwer. Recall leicht unter Mem0, aber Checkpoints und Memory teilen einen Store — beste Debuggability in LangGraph.
5.6 OpenMemory — lokales MCP app-übergreifend
OpenMemory (Mem0-Linie): Privacy-first lokales SQLite, MCP-Server. Wir zeigten Cursor und Claude Desktop auf einen Prozess — Cross-App-Recall funktionierte. Nicht für Multi-Tenant-SaaS; es ist eine persönliche Workflow-Schicht, keine Backend-Memory-Plattform.
6. Szenario-Matrix
| Szenario | Wahl | Alternative | Meiden |
|---|---|---|---|
| Nutzer-Prefs an bestehenden Bot | Mem0 | OpenMemory MCP | Letta |
| Compliance + verfallende Fakten | Zep | Graphiti self-host | Mem0 Free nur Vektor |
| Wochenlanger persönlicher Assistent | Letta | Mem0 + Zusammenfassungen | OpenMemory |
| Team-Wiki + Code-Graph + Multi-Agent | TencentDB Agent Memory | Mem0 Pro Graph | LangMem allein |
| All-in LangGraph | LangMem | Mem0 Sidecar | Letta |
| Memory über Cursor/Claude teilen | OpenMemory | TencentDB MCP | Zep Cloud (Overkill) |
7. Empfohlene Stacks
Stack A — Schnellstes: Mem0 managed + Claude Code (Cloud Mac) + MCP Git Server Stack B — Compliance: Zep Cloud + Graphiti-Backup + Audit-Logs nach S3 Stack C — Eng-Team: TencentDB (Wiki+CodeGraph) + OpenClaw Gateway + Always-on Cloud Mac Stack D — Persönlich: OpenMemory MCP + Cursor + lokales Qdrant-Backup Stack E — LangGraph Prod: LangMem + AsyncPostgresStore + Mem0 nur User-Profile-Sidecar
Parallele Agents: Remote-Mac-M4-Worktree-Leitfaden. Memory mit MCP auf demselben Cloud-Mac-Ausführungsknoten kolokieren.
8. Typische Fehler
- Fehler 1: Rohe Chat-Logs indexieren — Faktenextraktion nutzen.
- Fehler 2: OpenMemory für Multi-Tenant-SaaS — Mem0/Zep/TencentDB ACL nutzen.
- Fehler 3: Letta-Migration für LangGraph-Shops — LangMem ist leichter.
- Fehler 4: Memory auf schlafendem Laptop — auf Cloud Mac verschieben.
- Fehler 5: Faktenablauf ignorieren — temporale Domänen brauchen Zep.
9. Sieben-Schritte-Rollout
- Primären Gedächtnistyp wählen (Prefs / temporal / Team-Wiki / selbstverwaltete Persona).
- 50-Turn-Skript mit relationalen/Zeit-Fallen; Recall@5 und P95 messen.
- Deploy-Grenze wählen: lokales MCP, VPS oder Always-on Cloud Mac.
- 48h-PoC auf Tagesmiete Cloud Mac; add/search + MCP verdrahten.
- ACL-Test: Cross-User-Retrieval muss fehlschlagen; Logs auditierbar.
- Kostenobergrenze: monatliche Writes × Preis; Zep budgetieren bei relational schwer.
- Wöchentliches Audit: 20 Memories auf veraltet/konflikt; dann monatliche Knotengröße fixieren.
10. FAQ
Q1: Mem0 vs. OpenMemory?
A: Gleiche Linie — OpenMemory ist lokale MCP-Distribution für Cross-App-Nutzung; Mem0 für eingebettete Multi-Tenant-Backends.
Q2: Muss TencentDB Tencent Cloud nutzen?
A: Nein — Default lokales SQLite+sqlite-vec; TCVDB optional in Scale.
Q3: Letta mit Claude Code?
A: Separate Runtime — Mem0/Zep/TencentDB MCP als Bolt-on mit Claude Code.
Q4: LangMem standalone?
A: Nur bei bestehendem LangGraph; sonst ist Mem0 schneller.
Q5: RAM für Memory-Schicht?
A: 16GB PoC; 24GB für CodeGraph oder 50+ parallele Suchen. Siehe MCP-Kolokationspraktiken.
11. Zusammenfassung
Pragmatische Best Agent Memory Framework-Wahl 2026: Mem0 für Speed, Zep für Zeit, Letta für lange Sessions, TencentDB für Team-Assets, LangMem für LangGraph, OpenMemory für lokales Cross-App-MCP. Zuerst Gedächtnistyp definieren; Memory + MCP auf einem stabilen Cloud Mac hosten schlägt größere Modelle.
Agent Memory + MCP auf Always-on Cloud Mac
Memory-Schichten sollten mit MCP-Servern, Git und Keychain auf Hardware sitzen, die nie schläft. kvmboot Cloud Mac mini M4 bietet 7×24 SSH/VNC, 16GB/24GB, APAC/US-East/EU — ideal für self-hosted Mem0, TencentDB MCP, OpenMemory und Claude Code auf einem Knoten. Apple-Silicon-Unified-Memory spart Strom bei Vektor-Index und lokalem sqlite-vec; macOS erleichtert codesign und launchd für Memory-Daemons.
Mit Tagesmiete für 48h-Memory-PoC starten, dann monatlich upgraden. kvmboot Cloud-Mac-Tarife ansehen.