README.md

December 29, 2025 · View on GitHub

Memory Compass

Memory Compass Logo

Rethinking Memory in AI: Taxonomy, Operations, Topics, and Future Directions

📝 Paper | 📄 List | 📚 Notions

License

commit PR GitHub Repo stars

This repository introduce a comprehensive paper list, datasets, methods and tools for memory research.

Contents

📢 News

  • 🚀 Memory-T1 Released! We propose a new RL method designed for temporal reasoning and long-term memory in large language models. Memory-T1 focuses on multi-session interactions and realistic temporal dependencies, enabling systematic evaluation of memory-aware agents.
  • Version 3 is availabel!
  • Paper List, benchmarks and tools has been udpated.
  • Version 2 of our work is now available.

Memory Taxonomy

Memory Taxonomy

📜 Papers

1. Survey Papers

2025

2024

2. Memory Topics

2.1 Long Term Memory

2025
2024
2023
2022 & before

2.2 Long Context Memory

2025
2024
2023
2022

2.3 Parametric Memory

2025
2024
2023
2022 & Before

2.4 Multi-source Memory

2025
2024
2023
2022 & before

📊 Datasets

Evaluation for Long Term Memroy.

Table-1: Datasets for Evaluating Long-Term Memory *(Continuously Updated)

DatasetMoOperationsDS TypePerTRMetricsPurposeYear
PersonaMem-v2textUpdating, RetrievalMSAccuracy, Persona ScoreBenchmark implicit user persona learning and agentic memory updates over long contexts.2025
MemoryBenchtextUpdating, Retrieval, ForgettingQAAccuracy, Retention RateComprehensive benchmark for memory correctness, persistence, and continual learning.2025
HaluMemtextRetrievalQAAccuracy, Hallucination Rate, Omission RateEvaluate hallucinations in memory extraction, updating and retrieval.2025
BFCL V4text (API/Code)Updating, Retrieval, ReasoningQA (API)AST Accuracy, Execution SuccessBenchmarking function-calling capabilities, specifically featuring a "Memory" category for CRUD tool usage.2025
LongMemEvaltextIndexing, Retrieval, CompressionMSRecall@K, NDCG@K, AccuracyBenchmark chat assistants on long-term memory abilities, including temporal reasoning.2025
LoCoMotext + imageIndexing, Retrieval, CompressionMSAccuracy, ROUGE, Precision, Recall, F1Evaluate long-term memory in LLMs across QA, event summarization, and multimodal dialogue tasks.2024
MemoryBanktextUpdating, RetrievalMSAccuracy, Human EvalEnhance LLMs with long-term memory capabilities, adapting to user personalities and contexts.2024
PerLTQAtextRetrievalMSMAP, Recall, Precision, F1, Accuracy, GPT4 scoreTo explore personal long-term memory question answering ability.2024
MALPtextRetrieval, CompressionQAROUGE, Accuracy, Win RatePreference-conditioned dialogue generation. Parameter-efficient fine-tuning (PEFT) for customization.2024
DialSimtextRetrievalMSAccuracyTo evaluate dialogue systems under realistic, real-time, and long-context multi-party conversation conditions.2024
MovieChat-1Ktext + videoquestion-answering + captionQAAccuracyFor long-term video understanding for Large Multimodal Models across video question-answering and video captioning tasks.2023
CCtextRetrievalMSBLEU, ROUGEFor long-term dialogue modeling with time and relationship context.2023
LAMPtextConsolidation, Retrieval, CompressionMSAccuracy, F1, ROUGEMultiple entries per user. Supports both user-based splits and time-based splits.2023
MSCtextConsolidation, Retrieval, CompressionMSPPLEvaluate and improve long-term dialogue models via multi-session chats with evolving knowledge.2022
DuLeMontextConsolidation, Updating, Retrieval, CompressionMSAccuracy, F1, Recall, Precision, PPL, BLEU, DISTINCTFor dynamic persona tracking and consistent long-term interaction.2022
2WikiMultiHopQAtable + knowledge base + textConsolidation, Indexing, Retrieval, CompressionQAEM, F1Multi-hop QA combining structured and unstructured data with reasoning paths.2020
NQtextRetrieval, CompressionQAEM, F1Open-domain QA based on real Google search queries.2019
HotpotQAtextRetrieval, CompressionQAEM, F1Multi-hop QA with explainable reasoning and sentence-level supporting facts.2018

Note:

  • Mo: Modality of the dataset (e.g., text, image, table).
  • Ops (Operations): Memory-related operations supported or evaluated (e.g., Indexing, Retrieval, Compression, Updating, Consolidation).
  • DS Type: Dataset type —
    • QA = Question Answering
    • MS = Multi-Session Dialogue
  • Per: Persona present (✓ = Yes, ✗ = No).
  • TR: Temporal reasoning required or present (✓ = Yes, ✗ = No).

Evaluation for Long Context Memory

Table-2: Datasets for Long-Context Memory Evaluation *(Continuously Updated)*

DatasetModalityOperationsMetricsPurposeYear
MMLongBenchtext + imagecompression, retrievalSubEM, Accuracy, Rouge-L, Model-Based5 categories and 16 datasets for vision-language long-context evaluation2025
WikiText-103textcompressionPPL100M-token Wikipedia corpus for long-context language modeling2016
PG-19textcompressionPPLProject Gutenberg books corpus for long-context language modeling2019
LRAtext + imagecompression, retrievalAccBenchmark with 6 tasks for evaluating efficient long-context language models2020
NarrativeQAtextretrievalBleu-1, Bleu-4, Meteor, Rouge-L, MRRQA dataset for evaluating long-context QA ability2017
TriviaQAtextretrievalEM, F1QA dataset for evaluating long-context QA ability2017
NaturalQuestionstextretrievalEM, F1QA dataset for evaluating long-context QA ability2019
MusiQuetextretrievalF1Multi-hop QA dataset for evaluating long-context reasoning and QA2021
CNN/DailyMailtextcompressionRouge-1, Rouge-2, Rouge-LNews articles dataset for long document summarization2016
GovReporttextcompressionRouge-1, Rouge-2, Rouge-L, Bert ScoreGovernment agency reports for long document summarization2021
L-Evaltextcompression, retrievalRouge-L, F1, GPT420-subtask benchmark for diverse long-context language model evaluation2023
LongBenchtextcompression, retrievalF1, Rouge-L, Accuracy, EM, Edit Sim14 English, 5 Chinese, 2 code tasks for long-context evaluation2023
LongBench v2text + table + KGcompression, retrievalAccLonger, more challenging tasks with consistent multi-choice format2024
SWE-benchtextcompression, retrievalResolution rate (%Resolved)2,294 task instances from 12 popular python repositories from GitHub2023
SWE-bench Multimodaltext + imagecompression, retrievalResolution rate (%Resolved), Inference cost (Avg. $ Cost)Extending the original benchmark with image modal with 517 task instances2024
\inftyBenchtextcompression, retrievalF1, Acc, ROUGE-L-Sum12 sub-tasks specially designed for evaluating extreme long context language models2024
LooGLEtextcompression, retrievalBleu-1, Bleu-4, Rouge-1, Rouge-4, Rouge-L, Meteor score, Bert score, GPT4 score7 major tasks specially designed for evaluating extreme long context language models2023

Parametric Memory Modification

Table-3: Datasets for Parametric Memory Evaluation *(Continuously Updated)*

DatasetModalityOperationsMetricsPurposeYear
KnowEdittextupdatingEdit Success, Portability, Locality, Fluency6 datasets covering insertion, modification, and erasure2024
MQUAKE-CFtextupdatingEdit-wise Success Rate, Instance-wise Accuracy, Multi-hop AccuracyCounterfactual knowledge editing through multi-hop reasoning (up to 4 hops)2023
MQUAKE-TtextupdatingEdit-wise Success Rate, Instance-wise Accuracy, Multi-hop AccuracyTemporal knowledge editing with one edit per reasoning chain2023
CounterfacttextupdatingEfficacy Score, Magnitude, Paraphrase & Neighborhood ScoresTests substantial factual changes beyond superficial edits2022
zsREtextupdatingSuccess Rate, Retain Accuracy, Equivalence Accuracy, Perf. DeteriorationOne of the earliest datasets for knowledge editing2021
MUSEtextforgettingVerbMem, KnowMem, PrivLeakUnlearning benchmark with 6 desirable properties2024
KnowUnDotextforgettingUnlearn Success, Retention Success, Perplexity, ROUGE-LTest unlearning in copyrighted and privacy-sensitive domains2024
RWKUtextforgettingROUGE-LReal-world unlearning under corpus-free, adversarial settings2024
WMDPtextforgettingQA accuracyProxy for hazardous knowledge in bio/cyber/chemical domains2024
TOFUtextforgettingProbability, ROUGE, Truth RatioUnlearning dataset of facts about 200 fictitious authors2024
ABSAtextconsolidationF1Aspect-based sentiment analysis for continual learning2024
SGDtextconsolidationJGA, FWT, BWTMulti-turn task-oriented dialogue with evolving intents2020
INSPIREDtextconsolidationJGA, FWT, BWTTask-oriented dialogue supporting user goal evolution2020
Natural QuestiontextconsolidationIndexing Accuracy, Hits@1Supports continual learning over evolving document corpora2019

Note:

  • This table covers datasets for evaluating parametric memory in LLMs.
  • Operations:
    • updating – assessing model behavior after direct memory modification
    • forgetting – evaluating unlearning/removal of specific knowledge
    • consolidation – integrating new knowledge without harming prior capabilities
  • Metrics include fluency, factuality, locality, transfer, edit effectiveness, and forgetting accuracy.

Evaluation for Multi-Source Memory

Table-4: Datasets for Multi-Source Memory Evaluation *(Continuously Updated)*

DatasetMoOpsSrc#Mod#TaskMetricsPurposeYear
MultiChattext + imageRetrieval22RetrievalPrecision, mAP, GPT-4Image-grounded sticker retrieval with cross-session image-text dialogue context.2025
Context-conflictingtextCompression21ConflictDiffGR, EM, SimilarityEvaluates model handling of conflicting evidence across sources.2024
EgoSchemavideo + textRetrieval, Compression32FusionAccuracyEpisodic video + social schema + conversation for long-term memory QA.2023
Ego4D NLQvideo + textRetrieval, Compression22FusionRecall@KNatural language queries over egocentric video with temporal memory.2022
2WikiMultihopQAtextIndexing, Retrieval, Compression21ReasoningEM, F1Multi-hop QA across Wikipedia passages with sentence-level support.2020
HybridQAtextRetrieval, Compression21ReasoningEM, F1Reasoning across structured tables and unstructured text.2020
CommonsenseVQAtext + imageRetrieval, Compression22FusionAccuracyCommonsense QA over visual scenes requiring visual-textual fusion.2019
NaturalQuestionstextRetrieval, Compression>1*1ConflictEM, F1QA over Google snippets; used for contradiction analysis.2019
ComplexWebQuestionstextRetrieval, Compression>1*1ReasoningEM, F1Compositional QA requiring multi-step reasoning over web snippets.2018
HotpotQAtextRetrieval, Compression21ConflictEM, F1, Supporting Fact AccuracyMulti-hop QA with paragraph- and sentence-level support.2018
TriviaQAtextRetrieval, Compression≥61ConflictEM, F1QA with noisy web sources; useful for source disagreement analysis.2017
WebQuestionsSPtextIndexing, Retrieval, Compression>1*1ReasoningF1, AccuracyStructured QA dataset with enhanced reasoning chains.2016
Flickr30Ktext + imageRetrieval, Compression22RetrievalSimilarityImage-caption pairs for cross-modal retrieval and alignment.2014

Note:

  • Mo: Modality (e.g., text, image, video).
  • Ops: Operations (e.g., Retrieval, Compression, Indexing).
  • Src#: Number of sources per instance.
  • Mod#: Number of modalities involved.
  • Task:
    • Retrieval: retrieving relevant knowledge
    • Fusion: integrating multiple modalities
    • Reasoning: multi-hop or logic-based inference
    • Conflict: handling conflicting sources

🧠 Methods

  • Overview and comparison of methods used in AI memory research.

⚙️ Tools

Components Level

Table-1: Component-Level Tools for Memory Management and Utilization. *(Continuously Updated)*

Memory ToolFunctionInput/OutputExample Use
FAISSLibrary for fast storage, indexing, and retrieval of high-dimensional vectorsVector / Index, relevance scoreIndexing large sets of text embeddings and retrieving relevant documents in RAG systems
Neo4jNative graph database supporting ACID transactions and Cypher query languageNodes and relationships with properties / Query results via CypherModeling and retrieving complex relational data for use cases like fraud detection and recommendation engines
ChromaAI-native embedding database for building LLM applicationsText / EmbeddingsManaging knowledge, facts, and skills for LLMs
MilvusVector database for embedding similarity search and AI applicationsEmbeddings / Similar itemsUnstructured data search and similarity matching
QdrantVector similarity search engine and databaseEmbeddings / Similar itemsProduction-ready service with user-friendly API for vector search
WeaviateOpen-source vector database with built-in ML modelsData objects and vector embeddings / Search resultsScalable storage and retrieval for AI applications
BM25Probabilistic ranking function for estimating document relevanceText queries / Ranked list of documentsEnhancing search engine results and document retrieval systems
ContrieverUnsupervised dense retriever trained with contrastive learningQuery text / List of similar documentsHigh-recall retrieval tasks in multilingual question-answering systems
Embedding Models (e.g., OpenAI)Convert text, images, or audio into dense vector representations capturing semantic meaningRaw data / Vector embeddingsText similarity computation, recommendation systems, and clustering tasks

Framework Level

Table-2: Framework-Level Tools for Memory Management and Utilization *(Continuously Updated)*

Memory ToolFunctionInput/OutputExample UseSource Type
GraphitiFramework for building and querying temporally-aware knowledge graphs tailored for AI agents in dynamic environmentsMulti-source data / Queryable knowledge graphConstructing real-time knowledge graphs to enhance AI agent memoryOpen
LlamaIndexA flexible framework for building knowledge assistants using LLMs connected to enterprise dataText / Context-augmented responsesDeveloping knowledge assistants that process complex data formatsOpen
LangChainProvides a framework for building context-aware, reasoning applications by connecting LLMs with external data sourcesInput prompts / Multi-step reasoning outputsCreating complex LLM applications like question-answering systems and chatbotsOpen
LangGraphConstructs controllable agent architectures supporting long-term memory and human-in-the-loop multi-agent systemsGraph state / State updatesBuilding complex task workflows with multiple AI agentsOpen
EasyEditAn easy-to-use knowledge editing framework for LLMs, enabling efficient behavior modification within specific domainsEdit instructions / Updated model behaviorModifying LLM knowledge in specific domains, such as updating factual informationOpen
CrewAIA platform for building and deploying multi-agent systems, supporting automated workflows using any LLM and cloud platformMulti-agent tasks / Collaborative resultsAutomating workflows across agents like project management and content generationOpen
LettaConstructs stateful agents with long-term memory, advanced reasoning, and custom tools within a visual environmentUser interactions / Improved responseDeveloping AI agents that learn and improve over timeOpen
OpenHandsAn open platform for autonomous software agents that maintains persistent context across file editing, command execution, and web browsingNatural language tasks / Code patches, Terminal actionsAutomating complex software engineering tasks like debugging and feature implementation with full project contextOpen

Application-Layer Level

Table-3: Application Layer-Level Tools for Memory Management and Utilization (Continuously Updated)

Memory ToolFunctionInput/OutputExample UseSource Type
Mem0Provides a smart memory layer for LLMs, enabling direct addition, updating, and searching of memories in modelsUser interactions / Personalized responsesEnhancing AI systems with persistent context for customer support and personalized recommendationsOpen
ZepIntegrates chat messages into a knowledge graph, offering accurate and relevant user informationChat logs, business data / Knowledge graph query resultsAugmenting AI agents with knowledge through continuous learning from user interactionsOpen
MemaryAn open memory layer that emulates human memory to help AI agents manage and utilize information effectivelyAgent tasks / Memory management and utilizationBuilding AI agents with human-like memory characteristicsOpen
MemobaseA user profile-based long-term memory system designed to provide personalized experiences in generative AI applicationsUser interactions / Personalized responsesImplementing virtual assistants, educational tools, and personalized AI companionsOpen
O-MemAn omni-memory system enabling agents to self-evolve and maintain long-horizon consistency through recursive memory consolidationLong-term interaction logs / Evolved memory stateCreating self-evolving personal AI assistants that adapt to user growth over timeOpen
MemOSAn operating system-like architecture that manages memory hierarchy (working/short/long-term) to optimize Memory-Augmented GenerationAgent queries, Complex contexts / Hierarchical memory blocksManaging complex memory resources for agents handling multi-step reasoning tasksOpen

Product Level

Table-4: Product-Level Tools for Memory Utilization (Continuously Updated)

Memory ToolFunctionInput/OutputExample UseSource Type
Me.botAI-powered personal assistant that organizes notes, tasks, and memories, providing emotional support and productivity toolsUser inputs (text, voice) / Organized notes, reminders, summariesPersonal productivity enhancement, emotional support, idea organizationClosed
ima.copilotIntelligent workstation powered by Tencent's Mix Huang model, building a personal knowledge base for learning and work scenariosUser queries / Customized responses, knowledge retrievalEnhancing learning efficiency, work productivity, knowledge managementClosed
CozeEnables multi-agent collaboration across various platformsUser-defined workflows / ResponseDeployed chatbots, AI agentsClosed
GrokAI assistant developed by xAI, designed to provide truthful, useful, and curious responses, with real-time data access and image generationQuery / Informative answers, generated imagesAnswering questions, generating images, providing insightsClosed
ChatGPTConversational AI developed by OpenAI, capable of understanding and generating human-like text based on promptsUser prompts / Generated text responsesAnswering questions, generating images, providing insightsClosed
Claude          AI assistant featuring "Projects" to ground answers in user-provided knowledge bases and massive context windows                Prompts, Files, Code / Text, Code, Artifacts                  Analyzing large codebases, maintaining consistent style across documents via Projects  Closed          
Doubao          A high-efficiency multimodal AI assistant capable of handling long-context interactions and diverse tasks                      Text, Voice, Image / Answers, creative content                  Daily conversation, writing assistance, coding, and role-playing                        Closed          
Siri        Intelligent voice assistant utilizing on-device personal semantic memory for cross-app actions and context understanding      Voice commands / Action execution, personal info retrieval      Device control, retrieving personal context ("When is Mom's flight?"), cross-app tasks  Closed          
Xiaoyi  Huawei's smart assistant integrated into HarmonyOS, leveraging ecosystem memory for proactive services and document processingVoice, Text, Documents / Summaries, suggestions, IoT control    Document summarization, smart home control, personalized travel planning                Closed          
Zhixiaobao      Ant Group's financial AI agent that utilizes user financial history and market knowledge for personalized wealth management    Financial queries / Market analysis, investment advice          Financial planning, insurance analysis, market trend explanation                        Closed

🆚 Human vs. AI in Memory

Table-5: Key differences between human and agent memory across operational dimensions

AspectHuman MemoryAgent Memory
StorageDistributed, interconnected neural systems across brain regionsParametric, modular, and context-dependent (structured or unstructured)
ConsolidationSlow, biologically driven, passiveFast, explicit, policy-driven and selective
IndexingImplicit, associative, sparse codes via hippocampal circuitsExplicit, embedding-based, symbolic or key–value lookup
UpdatingIndirect, reconsolidation-based, error-pronePrecise, programmable, supports rollback/unlearning
ForgettingPassive decay or interferenceTransparent, trackable, policy-controlled
RetrievalCue/context/emotion dependent, emotionally biasedContent-based, reproducible, similarity or query driven
CompressionImplicit, salience- and frequency-biasedExplicit, customizable (e.g., quantization, summarization)
OwnershipIndividual and privateShareable, replicable, and broadcastable
VolumeBiologically limitedScalable, bounded only by storage and compute limits

🌞 Future Directions

Acknowledgements

Please contact me if I miss your names in the list, I will add you back ASAP!

🤝🤝 Thanks for all the great contributors on GitHub!

If you find our repository and survey useful for your research, please consider citing the following paper:

@article{du2025rethinking,
  title={Rethinking Memory in AI: Taxonomy, Operations, Topics, and Future Directions},
  author={Du, Yiming and Huang, Wenyu and Zheng, Danna and Wang, Zhaowei and Montella, Sebastien and Lapata, Mirella and Wong, Kam-Fai and Pan, Jeff Z.},
  journal={arXiv preprint arXiv:2505.00675},
  year={2025},
  url={https://arxiv.org/abs/2505.00675}
}

Contributors

Contributors

Star History

Star History Chart