⚠ 本文件仅作历史档案,禁止据此实现。
现行有效文档:PLAN.md (v3.1)、OKR.md (v1,第一序 O1 + Gate + 第二序 S1/S3/S2/S4/S5)。
归档原则:记录"当时怎么写的 / 为什么错 / 被什么取代",供复盘追溯。
日期
版本
事件
2026-08-23
PLAN v1(未落盘,仅存于对话)
初稿:文本 grounding 当主线、整帧 PSNR、无坐标契约
2026-08-23
PLAN v2 落盘
首轮自评后修正(三模式排序、坐标契约、双路径、mask 加权指标)
2026-08-23
OKR v1(S1 单特性)
"S1 是唯一优先特性"
2026-08-24
OKR v2(全场景)
S1–S5 program 级 OKR
2026-08-24
PLAN v3
二轮 review:SAM3 API 事实更正 + Phase 重构 + 非目标清单
2026-08-24
OKR 第一序(OKR_first_order.md)
反事实分析:grounding 是唯一不可替代能力;模式 C 校准升格为 week-1 fail-fast
2026-08-24
PLAN v3.1
模式 C 校准从 Phase 3 提前到 Phase 1
2026-08-25
PLAN.md + OKR.md 合并
三份 OKR(first_order / all_scenarios / S1)合并为单一 OKR.md;PLAN_rdc-sam-perception-layer.md 更名 PLAN.md;分立文件删除
A. PLAN v1 的 7 处缺陷(2026-08-23 首轮自评推翻)
#
v1 的错误
为什么是问题
取代方案(v2 起生效)
C1
把"文本 grounding"当主线卖点
SAM3 不是异常检测器;训练分布偏自然图像,合成 CG 上文本命中无保证
三种驱动模式按可靠性排序(diff → interactive → text)
C2
坐标对齐没设为先决条件
全链路正确性建立在"导出图坐标 == RT 坐标"上,错位会让 pick-pixel 打偏、指标全错
§4.3 坐标契约 + Phase 1 合成色块 spike 先行
C3
L2 指标写成整帧 PSNR
整帧被不变像素主导,对局部 artifact 无灵敏度
mask 加权指标 + outside 回归守卫
C4
想一口气做 perception-agent harness
范围膨胀,违背最小垂直切片
只做 perception 层 + 接线;S1 单链路先打通
C5
未区分视觉/数值两条路径
PNG 是 LDR(HDR clamp),丢掉只在 HDR 下可见的 artifact
PNG 定位 / float 判定分离
C6
对延迟、mask 体积、双 GPU 无应对
落地时会"突然卡住"
backbone 缓存 + 常驻 daemon + GPU1 + mask 默认不外传
C7
想引入 SAM3 自带 agent 模式(MLLM 中继)
已有编排 LLM,中继纯属多余依赖
明确不引入
B. PLAN v2 的事实错误(2026-08-24 二轮 review 推翻,已对源码核实)
#
v2 的错误
源码事实
v3 修正
F1
§5.1 segment_point 声称 Sam3Processor 支持 point prompt
Sam3Processor 只有 set_text_prompt + add_geometric_prompt(box only);point 在 SAM3InteractiveImagePredictor.predict(point_coords=[(x,y)]px, point_labels, box=XYXY px, mask_input)
模式 B 改用 interactive predictor
F2
§5.1 segment_box(box_xyxy) 暗示像素 xyxy
add_geometric_prompt 接受 [cx,cy,w,h] 归一化 [0,1](docstring 第 132 行)
引擎对外统一 xyxy 像素,内部转换
F3
未注意 text prompt 状态语义
set_text_prompt 会覆盖上一个 text query(源码注释 "will erase the previous text prompt");geometric prompt 是 append 累积
不同 text query 间需 reset_all_prompts()
F4
Phase 3 直接是 S2 闭环,S1 全链路接线无阶段归属(只在 §5.4 伪代码)
OKR 有 I4 而 PLAN 无对应阶段,两文档不一致
Phase 3 重构为"S1 全链路 + 模式C校准",S2 移 Phase 4,顺延至 Phase 6
F5
sam_diff/sam_verify 只写 PNG 输入
与 §4.2"指标走数值路径"矛盾
CLI 接受 PNG 或 .npy float 数组
F6
Phase 编号与 perception-agent-design.md 的 Phase 1–5 撞号
读者混淆
§7 开头加对照说明
F7
无显式非目标清单
边界散落各处
新增 §1.4 非目标
#
原决策(已推翻)
推翻理由
现行
O1
"S1 是唯一优先特性"(OKR v1)
只回答了"先交付什么",没回答"什么不存在"
S1 仍是第二序交付集的 P0,但受第一序 OKR 门控
O2
"模式 C 文本 grounding 是加分项,集成最后做"(PLAN v2/v3)
反事实分析:没有 grounding,SAM 增量≈0(S3/S4 用 numpy/PIL 即可,S2 可用粗框降级)——模式 C 的校准 是存在性前提,不是加分项
校准提前到 Phase 1(week 1,半天,fail-fast);集成 仍最后做(OKR.md §1)
O3
"模式 C 校准是 Phase 3 门槛"
存在性假设应最先验证(最便宜 + 最 existential)
同 O2
O4
OKR v1 的 KR 无基线对照
"≥80%""<60s" 没有现有流程的对照值无从比较
OKR_S1 补 I0"样本与基线采集"(M1 内完成)
O5
OKR v1 无样本获取举措、无复盘节奏
验收材料来源缺失;只在出事时才反思
I0 覆盖样本制作;每周五 checkpoint 常态机制
以下出自历史版本,至今仍是设计约束,现行文档已吸收:
SAM 是 grounding 层,不是 reasoning 层 (PLAN v2 §0,现行保留)
坐标契约是全链路正确性基石 (PLAN v2 §4.3,现行保留)
S3/S4 不依赖 SAM (OKR.md §0 退化表)——避免把 numpy/PIL 能做的事包装成 SAM 特性
纹理级 artifact(banding/aliasing/shimmer)可能超出对象分割模型家族的能力边界 (OKR.md §5 复盘项)——对象分割 ≠ 像素统计模式,week 1 校准时会暴露