研究

文明记忆架构:可审计的多系统 AI 记忆

从事件绑定到语义巩固、程序技能与多尺度图:一套可审计、可回放、受审批治理的 AI 记忆架构。

阅读文章45 分钟阅读
文明记忆架构研究封面

摘要

《文明记忆架构:从事件绑定到程序技能与多尺度图的可审计多系统记忆》记录了 v0.00.01 Sun 至 v0.00.06 Rosette 的完整版本化实现线。它讨论的不是把更多文本塞进上下文窗口,而是如何让一个会保留和复用经验的智能体能够回答:这条信息属于哪一种记忆、它来自什么证据、何时被允许变成抽象知识、发生冲突时保留了什么、以及这次读取是否真正进入了模型路径。

架构由冻结模型运行时、四种类型化记忆、确定性检索、类海马式的事件绑定与回放、经批准的情景到语义巩固、执行 trace 到程序技能的形成、原子化且冲突感知的上下文装配,以及多尺度图视图构成。记忆 cell 在冲突中不会被静默覆盖;竞争事实与控制决策保持可分别寻址,并由 link 相连。写入、策略读取和恢复都会产生 trace,已验证快照以规范序列化和完整性哈希保存,并在不一致时失败关闭。

论文的证据范围刻意受限。新鲜 WSL/CUDA 复现中,Orion、Trifid 与 Lagoon-Eagle-Rosette 分别通过 40、20 和 29 项测试;一条冻结 Qwen3-0.6B 诊断在完整记忆路径上给出非零干预,在 no-memory 对照下归零。它们支持的是实现契约、来源追踪、干预边界和恢复行为,而不是开放域准确率提升、自主终身学习、生产可靠性或人类级记忆。

研究问题:记忆为什么不能只是文本库

持续上下文会使智能体从无状态预测器变成一个会被早先观察影响的系统。平坦检索库可以召回文本,却无法说明某项内容究竟是短时工作状态、被观察到的具体事件、经批准的概念抽象、可执行策略,还是只用于控制访问的决策。没有这种区分,就难以判断某个结论由哪些来源支持、谁批准了它、反证是否仍可见,以及模型是否实际使用了被检索的记录。

论文把问题拆成两条需要同时成立的链路。第一条是记忆结构链:观察必须能够被写入、链接、衰减、回放、提议、审批、冲突处理和恢复。第二条是模型干预链:被选中的事实应能以可追踪的方式进入冻结模型的 Adapter 路径,并允许研究者通过 no-memory 对照确认影响不是由提示词表面特征、读出器泄漏或临时状态碰巧造成。架构不是用软件记忆替换语言模型,而是给模型系统增加一条有类型、有边界、可检查的外部记忆平面。

相关研究提供了几个互补方向。检索增强生成和大规模外部检索强调非参数证据;Memory Network、Neural Turing Machine 等强调可访问的记忆机制;情景控制和互补学习系统提示快速事件学习与缓慢知识整合应当分离;图网络提供关系结构的表达方式;Adapter、LoRA 和 prefix tuning 则是冻结模型的常见适配手段。本文不宣称替代其中任一方向,而是把重点放在类型、生命周期、来源、冲突和可审计交接上。

对象模型、检索与不变量

系统的记忆集合由工作记忆 W、情景记忆 E、语义记忆 S 和程序性记忆 P 组成。一个 cell 同时保存标识、所属系统、内容与摘要、来源 provenance、置信度和重要性、创建/更新时间、事件索引、衰减与巩固状态,以及类型化元数据。link 的类型包括时间、相似、因果、任务、程序、回放和冲突。存储本身是 cell 与 link 构成的图,加上一条对写入、读取、链接、更新、过期、巩固和冲突事件追加记录的 audit 序列。

Orion 的基础检索是确定性的、可解释的分数:查询词与 cell 词集合的重叠提供主项,明确指定系统时才有系统匹配增益,置信度、重要性和相邻 link 权重提供小幅加成,并以稳定标识符打破并列。它不是学习式相关性模型,也不声称能在同义改写、多语言或大规模库中达到最佳效果;它的价值在于让“为什么选中这一项”成为可复现的问题。

整条实现线由五个不变量约束。其一,冲突操作新增证据和关系,不能删除任一事实。其二,来自历史材料的语义或程序性写入必须携带来源标识和明确审批标识。其三,已经失活的工作记忆默认不得参与读取。其四,控制决定不能被序列化为事实。其五,快照封装、规范哈希、拓扑或被引用 cell 不一致时必须失败关闭。这些约束把“能记住”改写为“能在何种条件下、以何种权威等级记住”。

版本转换与权威边界

六个版本不是相互独立的功能列表。每个版本状态同时包含 cell、link、audit 事件、显式转换/准入策略和可序列化运行封装。一个新版本只能增加有限职责,同时保持已有事实 cell 与 link 的权威状态不变。新的 link、衰减标注或派生 cell 可以出现;静默替换旧事实、擦除来源或把控制决定改写成事实则不允许。

论文将公开对象分为五类权威状态。观察证据是工作或情景 cell 及其来源;绑定证据是事件锚点、顺序来源、时间与回放 link;提案包括巩固簇、schema 候选和技能候选;经批准派生状态是语义 schema 与程序技能;控制与视图对象则包括冲突决定、上下文包、图投影、遍历结果和恢复报告。后者能治理或描述事实,却不能因与事实同处一地就成为事实。

每次可变转换还需通过类型、来源、完整性、策略和确定性身份五类守卫。来源不存在、回放不完整、审批缺失或指纹不稳定时,正确行为是拒绝并留下失败结果,而不是产出一个看似可用的半成品。这个界限将检索、选择和巩固明确分开:检索观察已有状态;选择提出有界子集;巩固只有在守卫通过后才创建新的类型化对象。

Sun v0.00.01:冻结运行时与服务基线

Sun 提供后续版本必须继承的兼容性基础:冻结 Qwen 模型、Adapter 所在的残差干预表面、服务生命周期、异步工作与工件交付。选择冻结基座的目的不是声称冻结永远最优,而是让记忆路径的作用可以与基模型权重更新区分开来。若权重、检索器和记忆语义同时变化,就很难判断一个结果究竟来自哪个因素。

该版本也记录了失败的恢复路线与部署边界。任务恢复、包交付和并发服务的处理被纳入 stage,而不是作为论文之后的工程细节。论文公开模块职责、sanitized manifest、聚合测试和负向控制,但不公开主机地址、凭证、私有模型位置、训练参数或部署配置。公开边界使技术主张能够被审阅,同时不把论文变成生产环境复现手册。

Orion v0.00.02:四系统内核与受治理读取

Orion 将工作、情景、语义和程序性记忆放进共同的 cell/link/trace 表达中,但不把四者混同。工作记忆具有强制 TTL 和活跃读取边界;情景记忆保留有序事件来源;语义记忆用于经批准、具备 provenance 的持久事实;程序性记忆保存与执行结果相连的策略。局部会话隔离与显式全局读取让跨会话证据不会被默认为可见。

这一层还定义了 persistence、retention 与 recovery 的最小要求。读取会留下可追踪事件,过期不会伪装成删除历史,快照与 manifest 不只是缓存文件而是运行封装的一部分。它为之后的情景绑定提供稳定对象和策略边界,也为模型 Adapter 桥接提供了“被选择的事实”而不是未经分类文本的输入。

Trifid v0.00.03:事件绑定、回放和候选形成

Trifid 将场景、按序来源 cell、实体、目标、动作、结果、线索与时间区间绑定为 episode frame。绑定增加组织,不替换原始观察。每个 frame 都可沿来源关系回到支撑它的 cell;回放 link 表示某个来源步骤被验证纳入该 episode 的过程,而不是仅用一段摘要声称“曾经发生”。

从情景到概念的路径被故意放慢。系统以 scene、entities、goal、action 和 outcome 构成巩固签名;只有所有来源步骤都有回放 link、且满足配置数量的 frame 共享签名时,才可以产生候选。候选仍不是语义记忆。审批把证据搜集与状态变更分开,确定性指纹则避免同一批准被重复写成多个对象。配对 checkpoint 和服务交接记录使这一链路在进程边界后仍可检查。

Lagoon 与 Eagle:从证据到已批准知识和技能

Lagoon v0.00.04 处理情景到语义的巩固。它聚合候选而不宣称自动解决真伪:相反结果会增加 conflict relation,双方事实仍能被检索和审阅;决策记录说明某次处理策略,却不会被转成事实内容。完成的 replay、明确 approval 和稳定 identity 缺一不可。由同一指纹触发的批准写入返回原有对象,保留第一次产生时的来源。

Eagle v0.00.05 把同样的保守原则用于程序性记忆。程序候选来自执行 trace,而不是从一次自然语言输出中直接提炼“技能”。成功与失败都需要留在谱系中:成功给出可复用条件,失败给出限制和反例。只有满足政策要求的 trace 才能生成经批准的程序 cell,因此程序对象是可追踪策略,而不是未经证据支持的自动化承诺。

Rosette v0.00.06:原子上下文包与蜂窝图投影

Rosette 不把底层记忆库替换为图数据库。它在已验证的 cell、link、审批和决策之上构造查询专属的 context packet 与多尺度 honeycomb graph。图包含 episode、schema 和 control 三个尺度;遍历可按邻接类型、尺度和预算过滤。视图可以重新生成、被拒绝或因预算不足而截断,但这些变化不会改写权威 store。

原子上下文包解决了一个容易被忽略的问题:预算不足时,系统不能只保留冲突对的一半,从而向模型呈现误导性的“单一事实”。事实组要么整体进入上下文,要么整体被排除并留下可解释原因。图恢复同样遵循失败关闭原则:缺少被引用 cell、拓扑不一致或快照载荷被篡改时,系统应拒绝使用该视图,回到最近有效代际,而不是猜测性重建。

端到端证据链

论文用一条从观察到图视图的端到端路径串联六个版本。观察首先作为工作或情景 evidence 进入 Orion;Trifid 将有序来源绑定并回放;满足签名与完整性要求的 frame 形成 Lagoon 候选;审批产生可追溯的语义 schema;Eagle 可从结果 trace 形成程序候选;Rosette 再将受策略约束的召回组织成原子 packet 和图遍历。任何一步被拒绝,都应保留此前证据和拒绝理由。

这种设计的实际意义是把“模型记得什么”拆解为可验证的问题:哪一条 cell 被选中?为什么它满足读取策略?它的来源是什么?它是否与冲突证据并存?它何时成为经过批准的抽象?在模型侧,它是否造成了可干预的路径变化?审计的对象不是最终回答的文案,而是产生回答所经过的对象、策略和状态转换。

失败驱动的实现与安全边界

Stage 序列的粒度服务于失败隔离,而非把每个 stage 都包装成独立科学发现。某些 stage 新增数据结构,另一些关闭生命周期缺口、暴露负向对照、拒绝不完整恢复或冻结发布契约。报告明确记录了工作记忆 TTL 过期、回放证据不足、审批 ID 缺失、重复指纹、相反结果、紧张上下文预算、被篡改快照以及缺失图 cell 等注入条件。

每种注入条件都有预期反应。TTL 到期的工作 cell 要退出活跃查询但保留 expire trace;回放不完整时拒绝候选;缺少审批时拒绝派生写入;相反结果建立冲突关系;预算紧张时丢弃整组事实;快照载荷被改动或引用 cell 缺失时失败关闭。安全价值来自拒绝路径和恢复路径与默认路径一样可检查,而不是假设所有输入都正常。

评估协议与结果

新鲜复现包含三组回归:Orion 40 项测试耗时 13.67 秒,Trifid 20 项耗时 8.71 秒,Lagoon-Eagle-Rosette 29 项耗时 9.56 秒。Stage150 生成树含 153 个文件,七个顶层门均为真,包括 Lagoon、Eagle、Rosette context、蜂窝图、stage 集完整性、工件存在性和路线图契约覆盖。Lagoon、Eagle、Rosette context 与 Rosette graph 的嵌套工件分别贡献 59、30、32 和 32 项断言,合计 153 项功能断言通过。

受控图夹具包含两个 support node、一个 semantic node、一个矛盾 episode 和一个 decision node。完整遍历访问五个节点,邻接过滤能分别隔离 semantic-support 与 semantic-conflict 邻域。这证明类型化结构与遍历契约在夹具中执行,不构成图推理性能基准。

冻结模型侧,Stage75 CUDA 诊断将一个语义 cell 编码为有限的 [1, 1, 1024] tensor 和 [1, 1] true mask。完整控制在两个被追踪 Adapter 位置产生 7.7929 与 4.9193 的 memory-delta norm;相同请求在 no-memory-path 干预下为 0.0 与 0.0。审计还报告 Qwen 没有可训练参数、没有梯度且权重未变化。这个实验说明“记忆路径可被单独置零并观察到差异”,不能被解释为真实任务正确率。

论文还保留了 Sun 阶段的继承证据:局部五候选固定质心门在三个 seed 上通过,报告的全条件平均准确率由 0.2049 ± 0.0028 到 1.0000,错误上下文平均下降为 0.8000 ± 0.0000,隐状态范数比为 1.1270。与参数匹配的 MLP Adapter、LoRA、prefix tuning 在同一局部基准上也达到天花板,因此作者明确拒绝用它宣称优于这些方法的预测能力。

局限、威胁与不作出的主张

外部有效性是最重要的限制。v0.00.02 至 v0.00.06 的主要证据来自为暴露契约违规而设计的小型确定夹具,没有衡量长周期用户工作、开放域检索、并发写入、尾延迟、跨模型泛化或大规模 cell 数量下的行为。词法重叠评分与手工系数在同义改写、多语言和大规模存储中都可能较弱;没有 vector database 或学习式检索器的比较。

巩固策略同样是符号化且受人工/可信策略批准约束的。通过门不等于生成的 schema 在认识论上正确;approval ID 也不等于完整的组织治理流程。在真正部署中,它需要关联经认证的主体、策略版本、理由和可持久审计的授权记录。快照哈希可发现意外或低成本篡改,但不是数字签名;论文不覆盖生产认证、加密、多租户隔离和密钥管理。

因此,这是一套模型-系统架构的工程与实验基础,而不是关于“记忆使模型更聪明”的广义结论。未来工作需要独立保留的任务、匹配 RAG 基线、校准与负向控制、负载测试、多实例报告,以及对学习式检索、巩固策略和图权重的评估。

论文正文

完整论文、参考文献和正式版本可在 [Haokir Research 论文正文](https://research.haokir.com/ocen-2026/en/article/view/civilization-memory-architecture-auditable-multi-system-memory) 阅读。

结论

文明记忆架构把长期 AI 记忆定义为一个受治理的转换系统:快速绑定保留来源,回放先于候选形成,审批门控制语义和程序写入,冲突保留双方,控制状态不混入事实,上下文包保持原子性,图仅是有界投影,快照异常时失败关闭。现有版本已经把这些原则落实为 cell、link、trace、快照、回归门和受控模型干预;更广泛的性能、规模和自治能力则仍需后续实证研究。