Locate · 定位
使用已知 source ID、时间范围或 curated Session link,把目标缩小到一个或极少量 raw records。
一套以 provenance 为核心的分层方法:原始证据长期保存,派生索引随时可重建,日常只召回最小充分上下文;只有 curated memory 不够时,才按需恢复原始来源。
日常 recall 只使用经过整理和复核的材料;raw source storage 留在普通索引之外。
Raw catalog 像仓库索引卡:它告诉系统箱子在哪里、封条是否完整,但不会把箱内对话摊进普通 recall。
使用已知 source ID、时间范围或 curated Session link,把目标缩小到一个或极少量 raw records。
检查路径边界、文件权限、byte size、cryptographic hash、record count、source identity 与 timestamps。
区分 visible dialogue、system context、reasoning 与 tool records,只恢复当前问题真正需要的内容。
每一层只做一件窄而明确的事;方便的派生层永远不能比它的 source 更权威。
当前安全、检索、隐私和协作规则。历史内容不能把自己提升成这一层的新指令。
Canonical Sessions、复核事实、有日期的 state、decision history 与 source links,用于日常 evidence-backed recall。
原始来源副本与 metadata-only locator。私密、默认关闭,只在 targeted recovery 时读取。
Chunks、aliases、state projections、scores、traces 与 context packets;可观察、可替换、可重建。
不同事实的变化速度不同;预期复查点已过,不等于系统有证据证明状态已经反转。
记录观察发生的时间;它回答“我们什么时候看到这个状态”,不是自动失效计时器。
只保存真正已知的适用区间。终点未知时保持为空,不用猜测性的 TTL 补齐。
记录同一状态最近一次明确确认;collection 的 reviewed_at 不能代替事实确认。
表示预计复查或获得结果的日期。超过它只添加可见提示,不静默改写状态。
可测试规则:注入 as_of;基础排名保持不变,只在 checkpoint 已过且没有后续确认时附加解释性时间标签。
问题需要走多远,就只升级到多远。
| 信号 | 第一步 | 何时升级 | 边界 |
|---|---|---|---|
| 当前上下文足够 | 不检索,直接回答 | 无需升级 | 不要养成顺手翻私人历史的习惯。 |
| 明确依赖过去内容 | 运行 curated retrieval | Packet 缺少精确证据或 provenance。 | 使用简洁 intent,不照抄整段用户消息。 |
| 需要原话、顺序或理由 | 搜索 private curated archive | 最佳 surviving curated source 仍然不完整。 | 摘要不能当作逐字对话。 |
| 必须恢复一个已知来源 | 先查 raw catalog,再做验证 | 仅在目标已经缩小以后。 | 不默认扫描或整库加载 raw storage。 |
| 问题缺少可用锚点 | 问一个最小澄清问题 | 用户补充 source、event、entity 或时间锚点。 | 不要猜用户指的是哪段私人历史。 |
测试失败的含义必须清楚;异构 ranker 的 raw score 也不能被假装成统一概率。
| Lane | 用途 | 运行语义 | 晋升规则 |
|---|---|---|---|
| Regression | 保护已经承诺的行为 | 正常运行必须全绿 | 只接收已经修复并稳定的 case |
| Challenge / probe | 保存真实 miss 与人工 contrast | 允许显式报告已知失败 | 修复后再进入 regression |
候选具有 canonical source link 或明确 provenance;这是证据形状标签,不是置信概率。
Topic、entity、state 或 decision 字段提供支持,适合解释为什么被召回。
只有措辞重合,没有更强结构信号;应测量是否造成 forbidden hit 或 packet 污染。
先归上层语义 triage;从少量人工 contrast 和真实漏检开始,不自动生成海量无语境查询。
这是一套可移植的方法,不是任何真实个人 memory workspace 的复制品。
优先使用最强的 surviving evidence,同时诚实标注被转换和整理过的材料。
一句话模型:Archive 记住发生过什么;Retrieval 决定现在该想起什么;Raw Catalog 知道证据箱在哪里;Policy 决定助手当前可以做什么。
从已核对实现提取两个具体机制,用虚构考察队说明。
以 config key 校验现有 state 与 decision 记录,也包括非活跃历史。未知标签在索引写入前阻止 build,并指出文件、记录、字段和标签。
未知 hint 触发 warning,查询继续。Runtime recognition set 不能验证存储数据:typo 重复出现也不能使自己合法。
优先采用有依据、语义具体的 alias。常见短名可能把无关内容归到同一个 entity;canonical ID 不必配上凭空发明的别名。
考察队现在使用离线平板。之前选择纸质日志的理由仍有价值,应作为历史附在已选中的直接后继后面,不能独立竞争成为当前建议。
| 合成输入 | 边界 | 预期观察 |
|---|---|---|
| 存储 topic: feild_test | Config 定义 field_test | Build 失败,旧索引保留 |
| 用户 hint: feild_test | 查询输入 | 警告,查询继续 |
| 平板 → 纸质日志理由 | 最终 context packet | 直接后继在前,前任标注为历史 |
决策附带发生在 packing 前;最终 packet 仍需验证后继相邻关系,尤其是小预算场景。标签集合校验不是完整 schema 或文件存在性校验;当前会跳过缺失的 projection 文件。
参考架构应明确区分已有机制与实验设想。
Build 标签检查、hint 只警告、旧决策附带直接后继、完整 fidelity 标签匹配、writer 设置权限、按规则排除 control-plane、连续短语排序,以及会过期且自带理由的 trace,均有对应实现。Pinecone 本身发布文档,不包含检索引擎。
Owner-only mode 需要 writer 落实,并在检出或恢复后检查。冻结输入的 advisory 保持可见,但不使检查失败,也不授权自动修复。目录软链接隔离仍有已知限制。
只存在一份的目录会逐个文件与外部副本比对,并且做过一次恢复演练。刷新仍是手动的,所以诚实的说法是「截至上次检查为止已验证」——而这正是检查会报告的内容。
独立 challenge runner 与校准后的证据标签仍是后续工作。Retrieval intent 解析已对照一个尚未达标的上限做测量,把这件事说出来本身就是重点。时间 checkpoint 逻辑有合成覆盖,不代表已有真实检查点。