研究摘要
这是一份围绕 Civilization Architecture 的研究说明,不是对原始论文的逐段改写。我们的研究对象是一个很具体的问题:当系统同时拥有长期记忆、即时状态和规则约束时,怎样确认某次决策确实使用了其中的一条结构化信息,而不是仅仅碰巧利用了提示词模板、选项表面特征或读出器的泄漏?为回答它,我们把 Transformer 类神经核心、Memory、State、Rule 三条路径、读出和审计面看作同一个模型系统。研究路径分为可控 PyTorch 后端与冻结 Qwen3-0.6B 实例;前者用于精确干预,后者用于测试这套接口能否进入一个真实语言模型的隐状态流。
项目的主要结果是一个受限的、但可以审计的结果。在三种子 Stage 42 局部五候选基准中,最终全隐状态的固定质心恢复为 1.0000,错误上下文条件的平均下降为 .8000,隐状态范数比为 1.1270;整个过程中 Qwen3 基座权重保持冻结。与此同时,参数匹配的 MLP adapter、LoRA 与 prefix tuning 在同一局部基准上也达到准确率天花板,直接 token 化结构化内容也接近天花板。因此,本文不主张预测能力胜过这些方法。我们能支持的主张是更窄的:Memory 和 Rule 可以在模型内作为分别寻址、分别禁用、分别导出轨迹的残差路径;该接口允许把“模型是否使用了某条路径”写成会失败的实验命题。
关键词: 隐状态审计;结构化记忆;规则路径;状态门控;路径消融;冻结语言模型;失败驱动验证。
一、研究为什么从“多给模型一点上下文”开始,又为什么没有停在那里
一开始,我们并没有试图发明一个替代检索、工具调用或 agent 编排的系统。现实中的语言模型已经能够从检索片段、工具返回结果、工作区状态和系统指令中吸收大量外部信息。问题是,当这些信息全部被排成同一种 token 序列时,研究者很难再区分它们的因果角色。一个输出可能遵守了规则,也可能只是复述了规则句子的高频表面模式;它可能引用了长期事实,也可能只是受到候选顺序、任务模板或最近上下文的影响。只看最终答案,对这些解释没有鉴别力。
我们把这个缺口称作“路径可审计性”问题。它不是要为每个隐藏单元赋予人类可读的语义,而是要在模型计算边界上提供可干预接口。若某个 Memory 记录真的参与某类决策,那么关闭 Memory 路径、替换为错误 Memory、或把其残差尺度设为零,应当在对应任务组留下可测的改变;相反,关闭与该任务无关的路径不应造成同样的坍塌。这个要求让研究从“加入更多信息是否提高分数”转向“哪一种信息以何种方式对隐藏状态作出可检查的贡献”。
在内部讨论中,我们刻意把“文明”从宏大叙事收回到工程含义:一个可长期运行、可能拥有历史、状态和规则的模型系统,至少应能够表示这些来源之间的差异。本文没有证明自治社会模拟、长期学习、规则修订或治理闭环已经完成;它只验证了支撑那些设想的一个底层接口。我们用严格的失败门限制叙事,是因为一套没有失败条件的架构图往往比一个明确失败的实验更容易误导人。
二、我们如何定义模型边界:神经核心不是全部,外部编排也不是全部
令输入序列为 x,结构化上下文为 C=(M,S,R)。M 表示记忆记录或其向量化表示,S 表示状态控制向量,R 表示规则记录。我们关心的不是把它们列在配置文件里,而是让模型通过 y=F(x,C) 计算时,C 的不同部分在隐状态更新点各自拥有入口。Memory 可承接事实、事件、关系或图派生线索;State 可承接推理模式、规则优先级、冲突压力或权限状态;Rule 可承接约束、偏好与冲突解决结构。它们的来源可以是文本,但进入模型时不再只是一段未区分的附加 prompt。
受控后端使用 CivilizationBlock 替换普通 Transformer block 的单一更新结构。常规自注意力与 MLP 产生基础更新;Memory attention、State gate/projection、Rule projection 各自产生可单独开关的贡献,再在残差汇合点形成下一层隐状态。实现细节可以变化,研究契约不变:每条路径必须有独立控制面和可导出的影响轨迹。我们记录自注意力、记忆注意力、状态尺度、规则影响范数等字段;可实验地关闭 Memory、State、Rule、链状态目标、优先级目标或硬负例训练。
这个设计解决的不是“规则最后能否拦截输出”。后处理过滤可以拒绝一条回复,但不能说明规则参与了内部冲突消解;提示词可以改变行为,但不能证明它形成了独立路径。我们的做法也不声称结构化路径天然更正确。它的价值在于使路径成为实验对象:当规则改变、目标路径关闭、无关路径关闭和错误上下文替换时,系统能否呈现符合预注册预期的差异。若不能,就应当把该次运行记为失败,而不是将一个漂亮的总体准确率包装为机制证据。
三、冻结 Qwen3:我们为什么选择把基座模型固定住
在真实语言模型阶段,最重要的约束是 Qwen3-0.6B 基座保持冻结。我们把基座参数从优化器中排除,记录其梯度为零,并拒绝带有基座权重变化的检查点。这不是关于“冻结优于微调”的普遍判断,而是一种研究上的收缩:若实验发生变化,我们至少不必同时解释基座权重被更新、任务分布被吸收和路径残差写入这三件事。训练对象限定为路径特异 adapter 与读出模块,使模型状态的变化更容易追溯。
适配器被拆为 Base、Memory、State、Rule 四类残差。Base 提供不带结构化来源的修正;其余三类残差分别由结构化输入生成并有独立尺度。早期版本曾使用更单一的 hook:它能写入隐藏层、工程完整性也通过,但后续中等规模运行仍处于五候选随机水平 .20。这次失败逼迫我们承认“可训练 hook 已经存在”不等于“路径机制已经成立”。随后,我们改成多层放置、路径拆分、delta 导出和独立读出,让失败能够指向 Memory、Rule、融合还是读出,而不是被一个总分掩盖。
冻结路线还避免了另一种常见混淆。若模型在完整条件下表现好,却在关闭 adapter 后仍表现一样,我们无法知道信号是否来自冻结基座、读出器或数据模板。因此 adapter-disabled 不是一个可有可无的消融:它保留同一模型结构和输入协议,只阻止残差写入。zero-scale 控制进一步把残差尺度置零。两者共同检查“接口存在但没有写入”时,效应是否消失。只有这些负控制与目标路径、无关路径、错误上下文控制一起成立,路径归因才有讨论价值。
四、两种读出、同一批固定质心:我们如何避免让测量本身替模型完成任务
对每个任务组 g 和路径 p,我们记录完整条件准确率 a_g(full) 与禁用路径后的 a_g(¬p),并以 D_g,p=a_g(full)-a_g(¬p) 定义路径下降。一个大下降仍不足够:它可能来自无关路径、标签泄漏或在消融条件下重新训练的读出器。因此通过门还要求完整条件达到阈值、目标路径下降足够大、无关路径下降保持受控,并在适用任务上通过错误上下文替换。错误上下文保留表面模板和候选格式,只替换结构化记忆或规则内容;若答案不随之变化,模型很可能没有使用我们声称的结构化信号。
我们保留投影 delta 读出与全隐状态固定质心读出两条并行证据。前者从某条导出的残差 delta 中池化、投影到候选方向,回答“这条路径残差是否携带了目标选项信息”;后者只用训练划分、完整条件的最终隐状态建立候选质心,再把相同质心用于完整、错误上下文、无 adapter、零尺度和路径消融条件,回答“该信号是否在融合后的原始隐藏状态中仍存活”。最关键的约束是不能为每个消融条件重建质心,否则读出器会重新适应被干预的表示,实验会把自己的答案泄漏回测量。
这个双读出设计源于真实失败。早期投影读出已经显示 Memory 或 Rule delta 指向正确选项,但原始全隐状态固定质心恢复仍接近随机。若只保留前者,我们会过早宣布隐路径已经被整合;若只保留后者,又会不知道失败发生在路径写入、融合还是读出。把两个门分开后,项目才得到可诊断的阶段顺序:先证明路径 delta 本身工作,再证明它在真实隐藏流中存活。
五、阶段门不是项目管理装饰:失败如何决定下一次实验能做什么
我们的验证流程是 fail-fast。每个阶段从此前最强的已接受工件开始,只打开该阶段允许训练的参数集合,同时检查工程门和研究门。工程门检查运行、工件、冻结状态、轨迹导出与数值稳定性;研究门检查路径是否必要、错误上下文是否有效、读出是否泄漏。软件“跑通”不代表论文主张成立。这个区别看似保守,却直接改变了实验路线:很多一次性看起来成功的运行,因为不通过模板控制、目标路径消融或固定质心约束而不被用作证据。
01–03 阶段建立最小可执行架构;04–07 阶段发现 codebook 存在模板泄漏,跨模板对齐和掩蔽关键词才使隐状态观测变得可接受;08–17 阶段把注入、三路径融合、硬逻辑、链状态和压力测试引入受控后端。进入冻结 Qwen3 后,18–26 阶段证明 adapter 可以在冻结约束下训练,却没有获得可直接扩张的真实任务结果。27–38 阶段因而从“继续训练”转为“修复机制”:拆分路径、校正 context/readout 对齐、构建投影读出和固定质心门。
Stage 39 是全链路中最具教育意义的一次失败。Memory 上下文本身已经可区分,但其 residual 没有把选择信息带到目标读出:delta-to-option 只有 .20,组成功率为 .00,no-memory 和 wrong-context 的下降也为 .00。按协议,runner 在 Rule、Conflict、Combined 和 full-hidden 阶段之前停止并保存工件。Stage 40 并不是重跑同一个训练,而是将监督直接连接到可微 memory-delta 张量,并冻结非 Memory 子路径。直到 Memory 组成功、no-memory drop、wrong-context drop 都达到 .80,Stage 41 才被允许恢复 Rule 与 Conflict。这个链条说明,最终成功不是抹去失败,而是用失败缩小下一步可接受的解释空间。
六、受控后端结果:先确认路径在可诊断环境中是否有选择地起作用
受控 PyTorch 后端不是为了模拟开放世界,而是为了让干预、轨迹和失败源能够被精确定位。泄漏修复后,canonical、同义、扰动和掩蔽关键词四种变体都达到 1.00 的最近质心准确率,masked-keyword drop 为 .00;这让我们不再把关键词表面线索误当成隐状态语义。alpha=0 的隐藏注入与基线严格等价,目标命中为 1.00,错误标签漂移为 .045。三路径融合中,完整融合目标命中和 hard-rule block 均为 1.00,错误标签漂移 .0075。这些数字的含义仅限于受控任务:它们证明接口和负控制符合预期,并不等同于自然语言理解或公共任务迁移。
链状态实验将条件变得更难:10 个种子、3 个序列长度、2 个模型尺寸和 12 个场景。最终最差场景为 two-hop logic .9991,链步骤与最终目标均通过;没有出现 NaN、轨迹缺失、掩蔽关键词或反事实划分异常。更直接的是路径依赖压力测试:完整模型平均准确率 .9854;关闭 Memory、State、Rule 后分别为 .7047、.8379、.8553;只保留结构则降至 .20。不同路径的下降不能被理解成同一任务上的统一效应,因为它们服务于不同情景族;它们共同支持的是在精心控制的任务中,目标路径的关闭产生选择性损伤。
1.0
.75
.50
.25
0.0
七、冻结模型结果:从“能写进去”到“写进去后仍能在原始全隐状态中找回来”
冻结 Qwen3 路线先导出全部 29 个隐藏状态组,选取 layer 16 作为稳定 adapter 目标。单层 adapter 的失败随后提醒我们:hook 和工程 sanity 检查都通过,主层准确率仍可能只有 .20。多层 16/24 adapter 一度在受控依赖门达到 1.00,但真实任务迁移依然没有通过,这使项目拒绝把“适配器可训练”当成架构验证。路径特异 adapter 让问题更清楚:早期 Memory-only 和 Rule-only 读出分别约 .4625、.425,而 Conflict 为 1.00;结构已经存在,读出与路径必要性却还没有成立。
投影读出修复了 Memory-only 与 Rule-only 二元诊断至 1.00,但 Combined 仍为 .475,raw delta 也弱。固定质心对齐后来把平均全隐状态恢复从 .7375 提升到 .9406,而没有损害投影门。这就是 Stage 40–42 不可省略的原因:Stage 40 修复 Memory delta,Stage 41 恢复 Rule/Conflict/Combined,Stage 42 才测试已验证信号是否留在完整隐藏流。seed 202 中 fixed-centroid 从 .2074 到 1.00;三种子复核的 before 为 .2049±.0028,after 为 1.0000±.0000,错误上下文下降 .8000±.0000,范数比 1.1270±.0091。
1.0
.75
.50
.25
0.0
这里仍需谨慎:三种子使用同一局部样本契约,并不代表任意任务分布、任意上下文长度或任意模型家族的鲁棒性。范数比门通过说明在已记录的尺度下没有发生不可控漂移,不说明该尺度是通用默认值。我们把它视为一个成功关闭的局部门,而非对所有 Transformer 的普遍性质。
八、完整论文图表与数值记录
以下交互表格逐项保留论文中的实验时间线、受控后端摘要、冻结 Qwen3 摘要、Stage 40–42 门、三种子稳健性与匹配基线。表 3 的受控路径依赖数值已在图 6 呈现;图 1–8 均以 React/JSX 重新实现并保留原图的信息结构、路径、阶段和数值,不以静态截图或简化占位图替代。
表 1. 实验时间线与阶段验证图
| 阶段 | 后端 | 目标 | 结果与研究门 |
|---|---|---|---|
| 01–03 | NumPy / PyTorch | 最小架构可行性 | 通过:结构化路径进入计算并形成训练闭环。 |
| 04–07 | PyTorch | 观测、codebook 与泄漏修复 | 发现表面泄漏;跨模板对齐后才允许注入。 |
| 08–17 | PyTorch | 注入、MSR 融合、链状态 | 硬逻辑失败后修复,恢复路径依赖门。 |
| 18–26 | Frozen Qwen3 | 适配器与初始迁移 | 混合:工程门可过,真实任务迁移不成立。 |
| 27–38 | Frozen Qwen3 | 路径拆分与读出对齐 | 多类别 Memory / full-hidden 反复失败。 |
| 39–42-M | Frozen Qwen3 | 严格门与多种子复核 | 由失败到修复;局部五候选门通过。 |
| BM-1 / BM-2 | Frozen Qwen3 | 匹配基线 | 无预测优势;保留原生路径审计差异。 |
表 7 的阅读方式尤为重要。Civilization、参数匹配 MLP、LoRA 与 prefix tuning 都达到 1.0000±0 的准确率与 .8000±0 的错误上下文下降,context-token-only 为 .9611±0,task-text-only 为 .2000±0。因此当前基准存在明显天花板,不能支持准确率优势说法。Memory/Rule drop 也不能跨机制直接对齐:Civilization 关闭的是模型内原生残差路径,其他方法删除的是序列化 token 信息通道。我们报告它们,是为了说明审计接口的不同,而不是把不同干预的效应大小包装成公平的性能排名。
九、我们遇到的四类问题,以及它们如何改变了研究设计
第一类问题是模板泄漏。一个 hidden-state codebook 能聚类,并不等于它编码了任务所说的含义;若题面模板、答案位置或关键词已经足够强,读出可以在不理解结构化信息的情况下成功。我们通过跨模板划分、同义改写、扰动和 masked-keyword 控制把这个风险前置。它改变了项目的判断习惯:每次看到一个高分,先问“有没有一个更简单的表面解释”,而不是先问“怎样把这个分数写进摘要”。
第二类问题是 hook 充分性错觉。早期冻结模型的 adapter 能够挂上、模型完整性也没有破坏,但这只是说明代码路径可执行。单层 .20 的结果告诉我们,隐藏状态写入本身不是机制证据。于是我们拆分 Base/Memory/Rule/State,导出每条 delta,并在不通过目标路径门时停止后续组。工程系统常常会把“没有崩溃”误报为“已经理解”;这里的阶段门负责把两者分开。
第三类问题是读出空间错位。路径 delta 可以在投影空间呈现正确方向,融合后的完整隐藏流却未必保留这个方向。Stage 42 之前 raw full-hidden 接近随机,正是这种错位的证据。我们因此拒绝让投影门替代全隐状态门,也拒绝在消融条件重建质心。此处的修复不是把读出调得更灵活,而是限制读出不许从测试条件重新学习答案。
第四类问题是失败的社会成本。研究者天然倾向于继续运行、继续调参、希望最后一个实验把早期失败覆盖掉;但在本项目中,Stage 39 的停止反而节省了时间。它阻止我们在 Memory 还没有被证明必要时就去堆叠 Rule、Conflict 和 Combined 的结果。我们从失败工件中确定下一步只能改监督通路,而不是随意增加容量。对可审计系统而言,失败不是附录;它决定哪些后续结论有资格出现。
十、能说什么,不能说什么
本文的内部有效性来自冻结权重、零尺度、adapter-disabled、目标与无关路径消融、错误上下文、训练集固定质心和保留失败工件,但这些控制无法保证局部基准没有其他隐含规律。构念有效性也有限:选项读出和固定质心适合检验路径归因,不替代开放式生成质量、检索质量或真实用户任务成功率。外部有效性目前只覆盖受控 PyTorch 任务和冻结 Qwen3-0.6B 的一个实例;不同模型家族、不同 tokenizer、长上下文、混合专家和多模态结构都可能要求新的路径几何与读出协议。
对比范围同样有限。论文没有把 retriever-backed RAG 作为已完成的正面对比,因为 token-context 实验使用固定给定证据,没有从语料库中检索选择信息;也没有覆盖全参数微调、较大模型、跨语言模型或广泛生成指标。公共 RTE、CB、BoolQ 的迁移记录没有通过研究门,正是我们不把结果描述为通用推理提升的原因。长期记忆维护、图更新、状态演化、规则修订、审计隔离、人类审批和部署治理仍属于架构路线图,不应从本文的局部路径证据自动推出。
十一、发布结论与下一步
我们发布 Civilization Architecture,不是为了宣布一个已经完成的“文明智能体”,而是为了公开一套更严格的模型系统问题:Memory、State 和 Rule 是否进入隐状态计算,是否可分别被关闭、替换和审计,是否能在控制条件下表现出选择性必要性。受控后端证明这些接口可以被训练和压力测试;冻结 Qwen3 实例证明在不修改基座权重时,结构化 Memory/Rule 信号能够形成可导出的残差,并在局部五候选基准中通过投影、错误上下文、路径消融和全隐状态固定质心的连续门。
同样公开的是边界:没有预测优势、没有公共任务迁移、没有已完成的长期学习或治理。下一阶段应在更难且预注册的保留协议上测试更长上下文、改写规则、噪声记忆、跨模型家族和 retriever-backed 对照;同时把记忆更新、规则版本、人类审批与审计隔离转化为同样可失败的工程接口。只有当这些门逐一被关闭,文明架构才有资格从“可审计隐路径的研究原型”走向更长期的系统主张。
