Skip to content

Latest commit

 

History

History
72 lines (55 loc) · 5.69 KB

File metadata and controls

72 lines (55 loc) · 5.69 KB

OUTDATED — 已归档的历史版本与推翻记录

本文件仅作历史档案,禁止据此实现。 现行有效文档:PLAN.md(v3.1)、OKR.md(v1,第一序 O1 + Gate + 第二序 S1/S3/S2/S4/S5)。

归档原则:记录"当时怎么写的 / 为什么错 / 被什么取代",供复盘追溯。


归档时间线

日期 版本 事件
2026-08-23 PLAN v1(未落盘,仅存于对话) 初稿:文本 grounding 当主线、整帧 PSNR、无坐标契约
2026-08-23 PLAN v2 落盘 首轮自评后修正(三模式排序、坐标契约、双路径、mask 加权指标)
2026-08-23 OKR v1(S1 单特性) "S1 是唯一优先特性"
2026-08-24 OKR v2(全场景) S1–S5 program 级 OKR
2026-08-24 PLAN v3 二轮 review:SAM3 API 事实更正 + Phase 重构 + 非目标清单
2026-08-24 OKR 第一序(OKR_first_order.md) 反事实分析:grounding 是唯一不可替代能力;模式 C 校准升格为 week-1 fail-fast
2026-08-24 PLAN v3.1 模式 C 校准从 Phase 3 提前到 Phase 1
2026-08-25 PLAN.md + OKR.md 合并 三份 OKR(first_order / all_scenarios / S1)合并为单一 OKR.mdPLAN_rdc-sam-perception-layer.md 更名 PLAN.md;分立文件删除

A. PLAN v1 的 7 处缺陷(2026-08-23 首轮自评推翻)

# v1 的错误 为什么是问题 取代方案(v2 起生效)
C1 把"文本 grounding"当主线卖点 SAM3 不是异常检测器;训练分布偏自然图像,合成 CG 上文本命中无保证 三种驱动模式按可靠性排序(diff → interactive → text)
C2 坐标对齐没设为先决条件 全链路正确性建立在"导出图坐标 == RT 坐标"上,错位会让 pick-pixel 打偏、指标全错 §4.3 坐标契约 + Phase 1 合成色块 spike 先行
C3 L2 指标写成整帧 PSNR 整帧被不变像素主导,对局部 artifact 无灵敏度 mask 加权指标 + outside 回归守卫
C4 想一口气做 perception-agent harness 范围膨胀,违背最小垂直切片 只做 perception 层 + 接线;S1 单链路先打通
C5 未区分视觉/数值两条路径 PNG 是 LDR(HDR clamp),丢掉只在 HDR 下可见的 artifact PNG 定位 / float 判定分离
C6 对延迟、mask 体积、双 GPU 无应对 落地时会"突然卡住" backbone 缓存 + 常驻 daemon + GPU1 + mask 默认不外传
C7 想引入 SAM3 自带 agent 模式(MLLM 中继) 已有编排 LLM,中继纯属多余依赖 明确不引入

B. PLAN v2 的事实错误(2026-08-24 二轮 review 推翻,已对源码核实)

# v2 的错误 源码事实 v3 修正
F1 §5.1 segment_point 声称 Sam3Processor 支持 point prompt Sam3Processor 只有 set_text_prompt + add_geometric_prompt(box only);point 在 SAM3InteractiveImagePredictor.predict(point_coords=[(x,y)]px, point_labels, box=XYXY px, mask_input) 模式 B 改用 interactive predictor
F2 §5.1 segment_box(box_xyxy) 暗示像素 xyxy add_geometric_prompt 接受 [cx,cy,w,h] 归一化 [0,1](docstring 第 132 行) 引擎对外统一 xyxy 像素,内部转换
F3 未注意 text prompt 状态语义 set_text_prompt 会覆盖上一个 text query(源码注释 "will erase the previous text prompt");geometric prompt 是 append 累积 不同 text query 间需 reset_all_prompts()
F4 Phase 3 直接是 S2 闭环,S1 全链路接线无阶段归属(只在 §5.4 伪代码) OKR 有 I4 而 PLAN 无对应阶段,两文档不一致 Phase 3 重构为"S1 全链路 + 模式C校准",S2 移 Phase 4,顺延至 Phase 6
F5 sam_diff/sam_verify 只写 PNG 输入 与 §4.2"指标走数值路径"矛盾 CLI 接受 PNG 或 .npy float 数组
F6 Phase 编号与 perception-agent-design.md 的 Phase 1–5 撞号 读者混淆 §7 开头加对照说明
F7 无显式非目标清单 边界散落各处 新增 §1.4 非目标

C. OKR 演进中被推翻的排序决策

# 原决策(已推翻) 推翻理由 现行
O1 "S1 是唯一优先特性"(OKR v1) 只回答了"先交付什么",没回答"什么不存在" S1 仍是第二序交付集的 P0,但受第一序 OKR 门控
O2 "模式 C 文本 grounding 是加分项,集成最后做"(PLAN v2/v3) 反事实分析:没有 grounding,SAM 增量≈0(S3/S4 用 numpy/PIL 即可,S2 可用粗框降级)——模式 C 的校准是存在性前提,不是加分项 校准提前到 Phase 1(week 1,半天,fail-fast);集成仍最后做(OKR.md §1)
O3 "模式 C 校准是 Phase 3 门槛" 存在性假设应最先验证(最便宜 + 最 existential) 同 O2
O4 OKR v1 的 KR 无基线对照 "≥80%""<60s" 没有现有流程的对照值无从比较 OKR_S1 补 I0"样本与基线采集"(M1 内完成)
O5 OKR v1 无样本获取举措、无复盘节奏 验收材料来源缺失;只在出事时才反思 I0 覆盖样本制作;每周五 checkpoint 常态机制

D. 仍然有效的历史结论(归档但不作废)

以下出自历史版本,至今仍是设计约束,现行文档已吸收:

  • SAM 是 grounding 层,不是 reasoning 层(PLAN v2 §0,现行保留)
  • 坐标契约是全链路正确性基石(PLAN v2 §4.3,现行保留)
  • S3/S4 不依赖 SAMOKR.md §0 退化表)——避免把 numpy/PIL 能做的事包装成 SAM 特性
  • 纹理级 artifact(banding/aliasing/shimmer)可能超出对象分割模型家族的能力边界OKR.md §5 复盘项)——对象分割 ≠ 像素统计模式,week 1 校准时会暴露