内部资料独立审计 v2 · 2026-09-30 快照 · 仅限协作参考 · 阅读站未设置登录限制 · 与客户门户 / 演示站分开
内部资料 · 独立审计 · 北京时间 · 2026-09-30

工作流 v3 与上下文分层:
独立审计及第二阶段建议

这份审计回答一个问题:首期上下文治理到底有没有让项目推进更准确、更省钱? 结论是——已经建立了可回源的主题入口、当前/历史分离和有界检查,也能在后续任务里保留失败与未证边界,但还不能证明它已经让整体更准确或更省成本。第二阶段应沿真实事件补齐一个最小闭环,而不是先建 Cron 或写齐 15 份主题页。

v2:纳入执行方复盘 结论:局部改善有证、整体收益未证 静态快照

版本:2026-09-30 v2(纳入用户提供的执行方复盘)。主对话定位范围:9 月 1–30 日;运行抽样:9 月 27–30 日。这是本次建议,不是新增规则或授权。

五项优先问题可开始性、测试环境与重复复测、规则漏读、证据可发现性、效果未证。前三项已在旧复盘中部分识别。
第二阶段闭环实际变化 → 当前正文与义务同步 → 下一次任务验证 → 独立复审。
Cron 结论先事件维护 + 周度/里程碑独立审计,暂不新建持续任务。
独立性边界来源选择、反证、可核结论才构成独立性;换会话或换模型不自动保证。
01 · 结论

结论与第二阶段方向

先说结论,再看证据。这里保留原始建议和未证边界,不把它压缩成一句好听话。

首期已经建立可回源的主题入口、当前/历史分离、有界投影和限定范围检查,也能在后续任务中保留失败、未知和局部验收边界。但还不能证明它已经让项目推进整体更准确或更省成本。

最近三天的直接反例集中在四类地方:测试环境与数据前置、从局部通过到可实际走查的交接、既有授权的读取与传播、以及证据跨工作区的可发现性。

第二阶段优先补齐“实际变化 → 当前正文与义务同步 → 下一次任务验证 → 独立复审”的闭环。新增材料使“来源效力与冲突识别”“用例先于实现”“低风险资料合批验收”更具体;整体方向不变。

怎么做

先沿真实事件运行

先沿真实事件运行,再判断“周期唤醒”的增量。样本不足就继续记案例,不给统计改善结论。

不要当完成标准

不以建门为完成

不以建立 Cron、写齐 15 份主题页或增加检查门作为完成标准。这是本次建议,不是新增规则或授权。

新增素材及采纳理由见 §8 v2 增量;修改前的报告保留为 v1(原件在本地归档)。

02 · 主会话

找到的主对话与原始意图

这里只回用户原话、消息锚点与文档路径,用来确认第二阶段的原意,而不是用后来的自评代替用户意图。

主线对话 / 日期(北京时间)可确认的作用
最后一轮
上下文优化
Codex《梳理文档中的核心问题》,9 月 27–28 日用户直接提出旧口径、硬要求被忽略、资料混排、按主题与深度读取;引入 Claude 交接及 R19 研究,随后确认 15 主题和首期实施。
前一轮
Codex 工作流优化
《继续推进 TMS 项目》,9 月 19 日起用户追问实际分工、模型、技能、阻塞与优化;不是子代理任务书。
更早的
工作流审计
Claude Code,9 月 18–19 日原始工作流健康审计主会话,形成后续 v3 讨论、D42 等记录。
注意力分层
前身
Claude Code,9 月 23–26 日attention-layering-r1 的产生与接收链;部分原话仅存于压缩转述,不能与普通真人消息混同。
后续
实际推进
Codex,9 月 28–30 日用来观察分层后的实际行为,不用其自评代替审计结论。

主会话 9 月 28 日的两条直接用户消息

关于渐进节奏(8:10 开始的轮次)

“这些问题优先级可以略低一些,可以逐步加入,不需要一开始就自动化……可以由一些 cronjob 触发 AI 做一些简单的早期扫描……不希望跑上来搞得太复杂,可以循序渐进。”

关于两条工作线分开(9:02 开始的轮次)

“经常把 TMS 项目本身的任务,和工作流的任务混在一起让 AI 来做。这样也导致了上下文的混乱。是不是需要有一个技能或定时任务,定期让 AI 对工作流进行一遍‘体检’?”

这些原话要求渐进、自我修正、两条工作线分开;没有要求每日全仓自动改写。用户贴来的 K3 评审明确是“仅供参考”,其中推测和外部研究概括不自动成为用户决定。9 月 23 日旧实验卡的数值与后续门,也不自动成为 9 月 28 日新方案的准入条件。

展开:消息定位与来源边界(原件在本地归档)
  • 渐进节奏原话:message_id=01a0e55d-c1ef-7f02-96be-2642869dd310,所在轮次该轮 8:10 开始。
  • 两条工作线分开原话:message_id=01a0e589-5c9f-7213-ab62-14473349c8d0,9:02 开始的轮次。
  • 完整定位、真实消息锚点与来源边界见:Codex 检索记录、Claude 检索记录、Claude 消息锚点(原件在本地归档)。
  • R19 作为当时的方案输入定位;本次没有重新联网核验其全部外部主张,也不借用其中的数字推算本项目收益。

说明:会话原文与原始记录含敏感内容和内部推理,不随本站发布;此处只保留可公开转述的原话与定位编号。

03 · 实际运转

哪些改善已有证据

四类改善有样本内证据,同时都带边界。它们属于“局部有效”,不能相加成整体收益。

有产物

来源和效力区分已经产生具体产物

9 月 28 日主题入口、05 正文、07 导航、主线视图、状态与历史分离已落盘;保留原状态及 15 组未决义务。机器回执记录 18 项工具测试,以及限定 14 份文件的检查。它们证明对应工具/文档交付,不证明业务闭环或长期上下文效果。

首期无同条件整理前冷启动对照,不能把 81.72% 的字节减少解释为成功率提升。

有纠偏

测试独立性和结果边界后续得到纠偏

G1 早期执行与用户的独立测试要求不一致,回执承认偏差,后续独立运行有 3/3、rc=0 原始日志;G3A 最终机器报告 11/11。前面的路由偏差不能因后续成功而消失。G1 两次 0 执行以及 G3A 旧兼容红灯部分只见验收记录转述,审计没有把它们标为底层日志已核。

失败保留

失败没有被简单覆盖成全绿

G4 原始日志可见 5/5 后,同持久库复跑变为 4/5,费用断言匹配条目增加;定位/POD 子集后续 4/4。这既证明有纠错,也证明测试数据复用存在可避免副作用。候选批次 430 条已找到隔离工作区的独立验收回执,保留此前失败及候选范围;其底层临时命令日志未逐一打开,430 不外推为真实同单主线通过。

抓到结构门漏项

语义审查发现了结构门抓不住的问题

9 月 30 日资料把后台接口守卫误写成本版可见变化,后续取证删除;走查步骤结构合格,但“现在立即走完三段”的总判仍 FAIL,因为匹配运价、同单司机任务和现场账号核验未齐。说明局部结构检查有价值,也说明它不能替代可实际开始的交接。

证据边界:这些属于样本内改善与反例。缺少可比串行基线、完整费用与统一运行账,无法计算并行净收益、节省比例或整体返工率。详见“8 个运行样本及原始证据等级”(原件在本地归档)。
04 · 五项问题

五项优先问题与取舍

每项都给出证据、本次判断(已核实 / 未证)和去向。判断用标签区分,不把未证写成熟知。

显示 5 / 5 项
问题 1 · 可开始性已核实

包级 PASS、应用上线与“可以立即走查”之间缺前置承接

证据:资料盲读总判 FAIL;尚无同单真实完整主线回执。

判断:已备好的“可开始路径”未被证明;不能推成系统处理所有订单都失败。

建议去向:在现有发布/交接回执列声明可开始的场景、数据、角色、任务、实际试走证据和承接人。内部样例由项目侧准备;客户裁定真实业务规则。验证看首次实际开始时缺什么。

问题 2 · 测试环境已核实 部分未证

环境 0 执行、夹具不足、持久库重复复测

证据:G4 直接日志显示重复费用匹配;G1 环境失败由回执记录。

判断:已核实存在可避免返工;未证不能把全部多轮测试判为低收益——G3A 兼容缺陷、认证构建等变化有复测理由。

建议去向:派测时明确缓存/监听、候选和数据恢复方式;0 执行先修环境,写入测试使用可重建数据。只统计“无输入变化、无新失败假设”的重复运行,不压掉必要回归。

问题 3 · 规则读取已核实 适用性未证

既有规则被漏读或误解释

证据:guide 同步曾新设授权停点;新增复盘显示 POD 主线“两照要求”与专项设计的“已关闭 Q3”存在适用口径分叉。

判断:已核实 guide 现行流程已纠正,但实际发布尚未由此次审计证明;POD 两份文本及主题 05 呈现确有差异。未证哪项规定适用当前阶段——不能仅按日期或整稿 draft 状态裁定。

建议去向:guide 用旧误判复查现有入口;POD 先查 Q3 已关闭记录、适用范围与后续替代依据,再决定是否需要人裁定新增要求。主题 05 链接存在不代表分叉已正确传达;不重复向客户询问已有明确答复。

问题 4 · 可发现性已核实

证据分布在主仓、隔离工作区和临时目录

证据:根仓扫描曾遗漏 430 候选回执。

判断:已核实扫描边界影响结论;“未找到”与“没有执行”是不同状态。新复盘包已保存原路径、摘要与安全快照。

建议去向:不再重复安排本批快照;下一次交接验证能否从当前入口找到它,并识别历史候选范围。其他批次按需保留来源定位与必要快照。检索失败先查已登记的工作区,不立即重跑。

问题 5 · 效果未证未证

首期工具已有数据,后续真实任务效果未形成同条件序列

证据:15 主题映射不等于全量整合;尚无真实任务的同条件前后序列。

判断:尚不能证明整体准确率、成本或遗漏率改善;也未证明需要每日 Cron。

建议去向:沿真实变更抽样,修错后用“同反例的新会话”复查。只整合反复参与实际任务的主题;机械提示不升级成全仓阻断。

前三项已在旧 Agent 复盘中不同程度被识别。本次独立定位原话、核对现行规则并补查运行证据,认可其成立部分,保留缺证和已纠偏边界;不把旧自评重复算成一份新的独立运行证明。

05 · 最小闭环

第二阶段:以真实进展驱动的最小闭环

建议试行两个自然周,或先积累 6 个真实变更/交接样本;这是观察安排,不是硬门。样本不足就继续记案例,不给统计改善结论。

图 1 · 第二阶段最小闭环:按事件触发,不按日历自动改写
实际变化同步正文与义务下一次任务验证独立复审 客户裁定 / 实现验收发布 / 义务关闭在既有回执补一行,不另建状态账 影响哪份当前正文来源及版本 / 已否同步资料没变化就不重写 更早找到正确来源场景能否开始义务是否保留 另一会话做有界审计最多 5 个合并根因成功与未通过样本都看 修错后用“同反例的新会话”复查 试行两个自然周,或先积累 6 个真实变更/交接样本;这是观察安排,不是硬门。
闭环由事件触发:有变化才走一遍,不基于日历自动改写业务事实、状态或客户口径。虚线代表“复查修正是否改变行为”的反馈。

每次实际变化:维护仍在产品工作里完成

客户裁定、实现验收、发布或义务关闭涉及主题时,在本批既有回执补一行:什么变化 → 影响哪份当前正文/场景 → 来源及版本 → 已同步或待同步 → 未完承接 → 下次怎么验证。资料没有变化时不重写。执行者按白名单维护,主代理核语义和义务;不另建一套平行状态账。

对低风险资料修订,试行“内容稳定后一次综合验收”;再有变化或发现缺陷,只复查受影响范围。这里不设统一次数上限,也不取消独立语义检查。Luna 负责链接、版本和材料差量,主代理或 Sol 判断业务表述;DeepSeek 仅执行确有需要的代码、脚本或界面测试,不承担方案审核或业务语义裁定。测试用例形成时点另行记录,独立执行不能补偿“按实现结果倒写预期”。

样本优先取 5 类已出现的反例:独立测试实际路由与用例时序;已授权 guide 同步;POD 来源效力与分叉;可开始走查的前置;隔离候选证据查找。主题 2/4/5/6 按实际影响取用,不一次重写全部 15 主题。

每周或里程碑:另一个会话做有界审计

审计先取原问题、实际变更、开放义务、失败/纠偏样本及当时适用规则,再读现行解释。包括成功样本和未通过样本,不能只选最终绿灯。每次最多给 5 个合并根因的问题,分别标“已核实 / 推断 / 未知 / 已修待复查”;原始证据留在原处。

独立性来自来源选择、反证和可核结论,不由“换个会话”或“换个模型”自动保证。发现问题先判断是缺来源、适用效力误判、正文不同步、路由漏读还是工具故障;只修对应位置。遇到已确认授权先引用其范围,不把审计建议变成新的审批点。

下一次相似任务:复查修正有没有改变行为

不仅检查新规则存在,还看代理是否更早找到正确来源、义务是否保留、场景是否能开始、是否再次要求同一授权。若仍错,先定位原规则在当时指令链中的可达性与输入版本;不连续加泛化规则。解决过的问题不能凭旧快照重新判为当前冲突。

只收集四组可得指标

指标分母、口径与用途
关键条件召回与效力判断对固定反例预先列必须找到的条件/来源;报告正确、错误、未知的项数与样本数。包括独立作者与用例时序、已关闭 Q3 与暂定 PRD 的适用关系,以及“已修/未证/不适用”;不只考关键词。按同反例复查,不与 9 月 23 日不同实验的 0/4 拼接。
交接前置缺口对本次声明可开始的场景,统计首次实际开始时因缺数据/角色/任务而阻断的场景数 ÷ 实际尝试数;未实际尝试单列未知,不能作为通过。
0 执行与可避免重复分列 0 执行次数 ÷ 测试启动次数;同候选、命令、输入与夹具无变化且无新假设的重复次数。原始失败保留,必要修复后的回归另计;先有可靠运行索引再给总体率。
同根因复发与无效告警修正后同类机会中复发次数 ÷ 可比较机会;审计告警经核不成立数 ÷ 全部告警。无相似机会不算“0 复发成功”;发现少也可能源于抽样遗漏。

记录从现有任务/回执抽取,不向人索取投入分钟,不维护新复杂台账。初轮作为前瞻基线;重大漏项或越权立即纠正对应行为,普通低收益建议到试行复审再决定保留/简化/撤回。减少复审频率不等于停止变更后的日常同步。

06 · Cron 边界

Cron 的推荐边界

这一节回答“要不要上定时任务”。结论是先不上持续任务,先沿事件维护 + 有界复审。

当前推荐:先采用“事件维护 + 周度/里程碑独立审计”,暂不新建持续任务。

现有证据证明需要及时维护和有界复审,尚未证明“不按时唤醒”是主要失效原因。即使定时执行,缺源材料、语义误述、业务前置未准备,也不会因此自动解决。

什么时候才考虑把它定时化

若两轮里发现约定审计确实被漏掉,或确定性检查发现的问题长时间无人看到,再把已经跑稳的同一入口定时化。先明确本机/其他宿主、读取范围、频率、执行预算、失败处置及通知边界。

Cron 的权限边界

只做

唤醒与只读

Cron 只负责唤醒,只做只读扫描或提交候选建议。有进展时才读新增/变化来源与选定高风险样本;无变化或不可行动时保持安静。

不做

不自动改事实

不自动修改业务事实、状态和客户口径,不触发部署或发送。周期扫描本身也可能漏掉未登记来源,不能宣称“全仓无问题”。

连续两轮无有效发现,可按现行约定降为双周,但同时检查是否因为样本太窄。首期原方案已经有这条渐进路径,第二阶段应验证并接上实际运行。

07 · 编排

本次编排与独立性边界

这次审计用了哪些角色、各自只做什么,以及为什么“独立”不是自动保证。角色分工与独立性边界分开写。

  1. 两个扫描代理分别定位 Codex 和 Claude 主对话只回用户原话、消息锚点与文档路径;Codex 扫描 1116 个 9 月会话文件,限定本项目 437 个,按文本标记排除 308 条任务书/执行包记录。它不是对全部 308 条内容的逐条审查,分类可能有漏判。Claude 限定项目顶层主会话,不读子代理全文。
  2. 一个梳理代理梳理 8 个有界运行样本核原始结果与回执等级,不负责方案取舍;主代理复核原意、现行规则和关键证据之间的关系。
  3. 本版补读用户提供的执行方复盘对照活动索引、候选快照与验收状态,主代理读取项目发现和改进建议,并回查 POD 相关正文。执行方独立审阅与复盘材料属于待核输入,不自动增加一份独立运行证明。
  4. 主代理负责根因、收益、优先级和第二阶段建议由一个独立模型(Sol)核对支持、反证和未知,不读取本报告草稿及旧主代理复盘结论。
  5. DeepSeek 只用于代码测试本次无代码修改或新的测试执行;此前主代理误派的一次方案短分析已排除,不纳入审计依据。注意:这是本次审计的历史分工记录,不是现在对 DeepSeek 的业务审核路由推荐。
独立性怎么看:独立性来自来源选择、反证和可核结论,不由“换个会话”或“换个模型”自动保证。执行方复盘与独立审计是两份材料,不能把互相引用视为两次独立运行。
08 · 证据边界

本次没有做什么

把“没做”和“没做到”写清楚,避免读者把审计读成在线核验或绩效结论。

没有执行

不重跑、不访问线上

本次没有重跑产品测试、访问线上、创建自动化、修改项目规则/状态、部署或对外发送。没有做全仓语义审计、全部 15 主题验收,或全月每个包的绩效统计。

快照边界

按记录版本判断

读取窗口内共享树有其他会话改动;判断以记录版本与读取快照为边界,不用文件修改时间或界面更新时间推定发生顺序。

不可外推

数字不能当成功率

81.72% 的字节减少不是成功率提升(无同条件冷启动对照);430 条候选不外推为真实同单主线通过(底层临时命令日志未逐一打开)。

外部主张

不借外部数字推算收益

R19 只作为当时的方案输入定位,未重新联网核验其全部外部主张;用户贴来的 K3 评审是“仅供参考”,其推测不自动成为用户决定。

09 · 复查入口

想复核时从这里进入

能访问的原件给出站内链接;不能访问的按性质标注“原件在本地归档”,不静默删除出处。

原件在本地归档本次运行证据清单

8 个样本、原始证据是否打开、具体路径和缺证。性质:审计支撑材料。

原件在本地归档独立证据核查

由另一模型核对的 4 项关键主张的支持、反证和未知。性质:证据推理核查,不替代方案取舍,也未为全部第二阶段建议背书。

原件在本地归档上下文首期验收

实施范围、失败/通过与冷启动对照限制。性质:项目验收记录。

原件在本地归档现行上下文维护入口

任务分流、同步、退出和体检范围。性质:项目方法论文档。

原件在本地归档D42 原裁定

停止重复低收益工作、保留事实与机器可得指标。性质:项目决定记录。

原件在本地归档本版资料与 guide 记录

局部通过、真实走查前置及线上旧说明页的区别。性质:运行/资料回执。

本站已收9 月 30 日现行流程纠偏回执

既有同版授权的解释已修,尚未等同于发布执行。性质:执行方复盘修正回执。
打开修正回执

10 · v2 增量

新复盘对本报告的实际增量

方向与 v1 一致;下面只写“具体更新”,不把同一发现重复算成新发现。

用户提供的执行方复盘把工作流问题与项目发现分开,方向与本审计一致。“局部通过不等于可实际开始”“同单路径缺口”“430 候选与线上验收边界”“guide 授权纠偏”在 v1 已不同程度引用;本版不把它们重新计算成新发现。以下是具体更新。

材料增量对建议的影响与证据边界
用户纠偏时间线 补全“先定用例、再由独立执行者执行”和禁止事后倒写预期的顺序。测试独立性拆成“作者、形成时点、执行者”三个可核项。采纳“用例先于实现”的要求;不因执行者独立就判测试设计独立,也不把用户后续纠偏视为返工根因。
活动索引(原件在本地归档)记录最后资料/guide 轮有 15 次命令行启动;改进计划 提出资料合批验收。纳入低风险资料合批的试行建议。启动数包含失败、修订与重试,尚无逐次输入对比,不能断言 15 次都浪费或计算节省额。按用户纠正的模型边界分工,不继承“DeepSeek 承担业务语义审核”的安排。
项目发现 使 POD 分叉可具体回查:主线 PRD 和主题 05 写“两照暂定必备”;专项设计 Q3 记录“签字回单照必传”的已关闭答复(项目原件在本地归档)。这是第二阶段“来源效力与适用范围”检查的具体样本。文本差异已核,业务适用关系未裁定。先回源确认 Q3 范围与后续替代;专项稿整体草案状态不能自动抹去其已关闭条目,较新暂定正文也不自动成为新裁定。本审计没有据此改业务规则。
430 候选安全快照已带原路径与指纹保存(原件在本地归档)。将“补存本批证据”改为已完成,下一步只验证后续会话能找到并正确解释。快照保存改善可复核性,不构成重跑,也不扩大候选验收范围。
纠偏对照 与 驱动方验收 确认三份现行流程窄修已接受。guide 授权误读归入“已修待行为复查”;不重复新增审批门。复盘中历史段落仍写“正在核对”时,以有版本与验收依据的后续状态解释。现行流程修正与 guide 实际发布分别记。
材料验收报告 给出 A01–A13 通过。这是复盘交付物验收,不是项目主线或第二阶段效果数据。仍缺后续真实任务中的召回、前置缺口、复发与告警观测;Cron 必要性和整体收益判断不变。

项目问题在本报告只用作工作流失效与修复的样本。金额/POD 裁定、样例数据准备、同单实操和版本交付仍由产品工作线承接;治理审计不据此自动派单、修实现或维护状态。第二阶段的价值在于让这些问题更早被正确找到、解释和交接,而不是让治理会话包办项目任务。