尽管大模型的上下文窗口已经扩展到了百万级别,但在面对真实场景下离散、复杂且跨度极长的开放域对话时,它们依然常常“断片儿”。现有的“总结压缩”或“碎片化检索”范式,往往会割裂历史对话中的深层语义关联。
受人类大脑“先巩固,再生长”的认知机制启发,哈尔滨工业大学(深圳)、鹏城国家实验室与香港中文大学的研究团队在SIGIR 2026 上发表了最新研究成果。他们创新性地提出了动态记忆森林框架,让大模型像人脑一样,在复杂的话题跳转中实现记忆的联想与跳跃,大幅提升了长期对话的连贯性与类人感!
本文第一作者柯采,哈尔滨工业大学(深圳)- 鹏城国家实验室联培博士生,研究方向为大模型智能体长期对话记忆,指导老师为徐睿峰教授。
01被割裂的长期记忆
大模型在对话能力上已经取得了令人瞩目的进展,但这并不意味着“超长上下文 = 完美的长期记忆”。
真实的长期交互绝非信息的孤岛。在不同会话之间,往往隐藏着能够同时跨越和关联多个主题的语义枢纽(称之为“桥梁节点”)。例如,用户上周说“买了一台新相机”,今天说“想去新西兰旅游”,这里的“相机”和“旅游风景”就是潜在的关联。
然而,当前主流的长期记忆范式存在显著瓶颈:普遍依赖于将历史会话压缩为摘要(Summarization),或者进行碎片化的相似度检索(Structured RAG / Agentic Memory)。这种做法不可避免地割裂了关键的桥梁信息,丢失了细粒度的对话轨迹与深层关联。当面临跨主题的复杂查询时,大模型难以将散落在不同历史会话中的孤立记忆精准串联起来。
为了打破这一僵局,本研究将目光投向了认知科学。人类大脑处理记忆的过程,其实是一个“先巩固(Consolidation),再生长(Growth)”的过程。对话历史会被聚类为主题块,然后通过突触可塑性建立跨主题的联想网络。基于此,研究团队提出了动态记忆森林(DMF)。
图1 DMF 的记忆巩固、生长及信息流动过程。针对“新西兰南岛摄影推荐”的问题,DMF 能够利用高熵“桥梁节点”在电影、摄影、旅行等主题间跳跃,构建出严密的对话逻辑路径。
02 赋予记忆 “神经可塑性”,让僵化的历史也能像树木般自然生长
DMF 旨在将无序、离散的长期对话历史动态转化为一个由多棵“记忆树”组成的结构化“记忆森林”。整个流程分为四个核心阶段:
图2 基于自进化的动态记忆森林长期对话记忆框架(DMF)
阶段一:记忆巩固 (Memory Consolidation)
本阶段的目标是将杂乱的对话流转化为具有主题内聚性的结构化记忆单元。
阶段二:记忆生长 (Memory Growth)
将巩固好的独立单元组织成“记忆树”,并动态演化为“记忆森林”。
构建记忆树:按照时间戳将记忆单元排序为对话链,并利用 LLM 生成核心摘要作为“根节点”,形成保留时序逻辑的树结构。
群体相对投票优化(GRVO)嫁接机制:当产生新树时,它是该独立生长,还是应该“嫁接”到已有的记忆树上?DMF 引入了 GRVO 机制模拟大脑突触可塑性。新树中的每个语句会向候选节点“投票”(基于余弦相似度),只有当优势分数超过阈值时才发生嫁接。这种“群体决策”有效避免了单凭相似度造成的错误连接,保证了记忆森林的逻辑高质量。
阶段三:熵驱动记忆漫步 (Entropy-Driven Memory Walk, EDMW)
传统的检索是一次性的,而人类的回忆是联想式的。当用户提问时,DMF 启动 EDMW 算法,在记忆森林中寻找最优的记忆路径。在漫步过程中,导航策略综合了“全局相关性”、“局部连贯性”,并加入了一个“熵放大器”。这使得漫步路径在遇到高熵的“桥梁节点”时,能够实现跨树的联想跳跃,串联起多个历史会话。
阶段四:响应生成 (Response Generation)
EDMW 提取出访问过的节点,按全局时间戳排序。为了给 LLM 提供更丰富的上下文,还会自动在特定位置注入树的根节点摘要(分层记忆)。最终,这段包含结构化逻辑的记忆路径输入给大模型,生成高质量回复。
03 实验结果与分析
实验在三个人工参与的真实长期开放领域对话数据集上开展生成质量评估,包括 Conversation Chronicles (CC)、Multi-Session Chat (MSC) 和 GapChat (GC) 。基座模型选用了支持长上下文的 GPT-4o (128K) 和 Gemini2.5 (1M) 。
对比的 Baselines 涵盖了当下四大主流路线:全量历史 (Full History)、结构化 RAG (MemTree等)、智能体内存 (MemoryOS等)、记忆增强生成 (THEANINE等)。
自动指标:生成质量全面领先
表1 自动指标评估
结果表明,即便给予大模型 128K 甚至 1M 的全量历史,其表现也远不如 DMF。DMF 在所有指标上基本均取得了最佳成绩。特别是衡量文本与人类风格相似度的 Mauve 指标提升巨大,这有力地证明了:给大模型提供结构化的对话轨迹,比单纯塞给它超长文本更有效!
人类的思维往往是跳跃的,一句漫不经心的闲聊,或许就能解锁隐藏在数周前的关键线索。模型也理应具备这种“灵光一现”的联想能力。
图3 关联“烘焙”与“健身”的游走路径
这个案例极其直观地展现了 DMF 的强大: 用户提问关于“新烤箱”的建议。模型首先定位到“烘焙树”的节点 A1(买新烤箱),随后顺藤摸瓜找到高熵桥梁节点 C2(想吃健康食物)。借由 C2 的语义桥梁,路径成功跨界跳跃到了“健身树”的 B2 节点(教练说不吃糖),最终上溯至核心主题 B1(需要减肥)。 最终大模型给出了完美兼顾历史的回答:“既然你有新烤箱又要减肥,推荐你做无糖饼干”。
记忆系统的性能不应以高昂的计算成本为代价
图4 效率分析:成本更低,速度更快
相比于频繁重建树结构(如 MemTree),DMF 采用会话结束时的批量处理策略,使得 Token 总消耗量在所有动态维护方法中最低。同时在构建耗时和检索延迟上也具备显著优势,完全能够支撑实时、长程的对话交互。
04 让大模型不仅能读万卷书,更能拥有连贯的“人生回忆录”。
让 AI 拥有类人的长期记忆是一个极具挑战性的命题。本研究提出的 DMF 框架,成功地将认知科学原理应用于大模型记忆架构中。通过“聚类巩固、嫁接生长、联想漫步”的机制,有效解决了长期记忆中的碎片化问题。该工作揭示了:面对长程对话,记忆的“组织结构与关联轨迹”比单纯扩展上下文窗口更加关键。