实验定位 负结果 / 方向收窄
A74 接在 A73 后面,回答一个很具体的问题:如果只看 per-region λ 的结构、平均移动量、p95 移动量和拓扑这些 no-GT 特征,能否从 A73 Pareto 候选里选出接近 oracle 的候选?实验把 3 个 active case 做 leave-one-case-out:在 2 个 case 上用 GT joint 训练/挑选线性排序器权重,在 held-out case 上只用 no-GT 特征选择。
结果不乐观但很关键:最佳 no-GT ranker 是 moderate_scalar_prior,10-case joint=-0.0001506,仍明显落后 A73 oracle=-0.0003089 和 A53 reference joint=-0.0003849。LOO linear ranker 的 joint=-0.0000504,只比 A73 weak proxy=-0.0000296 好一点,却不如 hard λ=1。
A74 is a retrospective ranker audit on only three active cases. It tests whether lambda/motion priors are sufficient; it does not prove generalization to unseen object categories.
实验设计(Image-2 风格)
模块设计(Image-2 风格)
Feature Set
- 只使用 no-GT 特征:四类 region λ、λ 方差、conflict-visible order、mean/p95 move、candidate 类型。
- 不使用 Chamfer、F@5、GT mesh 或测试视角指标作为 held-out 选择输入。
- GT joint 只用于训练 split 上的 retrospective 权重搜索和最终审计。
Ranker Audit
- 比较 A73 weak proxy、lambda-order prior、moderate scalar prior、LOO linear ranker、hard λ=1、carrier 和 GT oracle。
- 评价 10-case projected ΔChamfer、ΔF@5、joint、oracle gap、Pareto 命中数。
- 目标不是追求小样本 SOTA,而是证伪 lambda-only frontier selection 是否足够。
实验结果(表格)
10-case projected ranker comparison
| ranker | mean ΔChamfer | mean ΔF@5 | joint | nonzero | Pareto hits | gap to oracle |
|---|---|---|---|---|---|---|
| A73 GT oracle upper bound | -0.0002107 | 0.001227 | -0.0003089 | 3 | 3 | 0.0000000 |
| moderate scalar prior | -0.0000892 | 0.000768 | -0.0001506 | 3 | 0 | 0.0001582 |
| hard λ=1 | -0.0000892 | 0.000768 | -0.0001506 | 3 | 0 | 0.0001582 |
| LOO linear joint ranker | -0.0000083 | 0.000526 | -0.0000504 | 3 | 1 | 0.0002584 |
| A73 weak proxy | -0.0000089 | 0.000259 | -0.0000296 | 3 | 0 | 0.0002793 |
| lambda-order prior | -0.0000062 | 0.000288 | -0.0000292 | 3 | 0 | 0.0002797 |
| carrier zero | 0.0000000 | 0.000000 | 0.0000000 | 0 | 0 | 0.0003089 |
case-level selection
| case | candidates | Pareto | oracle | oracle joint | weak proxy | lambda-order | LOO selected | LOO joint | LOO on Pareto |
|---|---|---|---|---|---|---|---|---|---|
| gso_000_input4 | 25 | 6 | scalar_1.250 | -0.0001417 | template_v0.350_c1.000_n0.700_u0.500 | probe_v0.000_c0.750_r0.000 | template_v0.000_c0.250_n0.000_u0.000 | -0.0000382 | 是 |
| gso_002_input4 | 26 | 1 | scalar_1.250 | -0.0025723 | probe_v0.250_c0.750_r0.500 | template_v0.000_c0.250_n0.000_u0.000 | template_v0.000_c0.250_n0.000_u0.000 | -0.0005410 | 否 |
| gso_008_input4 | 26 | 2 | probe_v0.000_c0.750_r0.000 | -0.0003747 | probe_v0.250_c0.750_r0.500 | template_v0.125_c0.750_n0.250_u0.125 | scalar_1.250 | 0.0000748 | 否 |
LOO details
| held-out | selected | ΔChamfer | ΔF@5 | joint | on Pareto | top weights |
|---|---|---|---|---|---|---|
| gso_000_input4 | template_v0.000_c0.250_n0.000_u0.000 | -0.0000165 | 0.000271 | -0.0000382 | 是 | is_conflict_only:-0.99, lambda_std:0.95, conflict_minus_visible:0.92, unobserved:-0.89 |
| gso_002_input4 | template_v0.000_c0.250_n0.000_u0.000 | -0.0001829 | 0.004476 | -0.0005410 | 否 | is_conflict_only:-0.96, neutral_unobserved_sum:0.90, visible:-0.86, unobserved_over_conflict:0.81 |
| gso_008_input4 | scalar_1.250 | 0.0001160 | 0.000515 | 0.0000748 | 否 | conflict:-0.70, visible:0.20, neutral:-0.20, is_scalar:-0.20 |
可视化结果
实验结论
- A74 证伪了一个看似自然的方案:只用 λ 结构先验和移动量来做 Pareto frontier ranking 不够,LOO linear ranker 没有稳定接近 A73 oracle。
- 最佳 no-GT 选择退回 moderate scalar/hard λ=1,本质上说明当前候选空间里“哪个 case 该 scalar overstep、哪个 case 该 conflict-only”无法由候选自身形状参数判断。
- 这不是坏消息:它把创新点从“调一个更聪明的 λ 先验”推进到“observation-conditioned predictor”。也就是必须引入 VGGT/MV residual、per-view signed consistency 或 sampler-time regional budget。
- A73 oracle 仍比 A74 no-GT 强很多,但 A53 reference 仍更强,说明 post-hoc mesh interpolation 的论文价值有限,下一步要把 regional budget 放到 denoising/generation 过程中。
下一步想法
- A75:给 A73/A74 的 ranker 加入 observation-conditioned 特征:A58 MV depth error、A64 per-view residual、A65 per-region signed damage flag、candidate-vs-carrier render consistency。
- 如果 A75 仍不能缩小 oracle gap,就停止后验 ranker 主线,把区域 λ 变成 sampler-time regional guidance loss。
- 把 A74 的负结果写成论文动机:candidate-intrinsic prior cannot infer view-conditioned edit validity。
- 扩展 active case 数量,否则 LOO ranker 只能作为证伪实验,不能作为最终泛化证据。