实验 81:A75 Observation-conditioned Ranker

观察状态能解释 per-region λ oracle 并显著优于 lambda-only LOO,但仍需要 candidate-specific residual 或 sampler-time guidance

实验定位 机制正结果 / 泛化仍不足

A75 是 A74 的直接后续:A74 证明候选自身的 λ 结构无法判断 edit 是否有效,所以这次把 A64 per-view residual 和 A65 per-region signed residual 转成 case-level observation state,再用这个状态调节 A73 的 per-region λ frontier。关键区别是:A75 不再问“这个候选长什么样”,而是问“输入视角观察到的风险类型说明这个 case 应该全局 overstep,还是只改 conflict 区”。

结果:A75 diagnostic prior 在这 3 个 active case 上复现 A73 oracle,10-case joint=-0.0003089;更保守的 observation prior joint=-0.0002839;严格的 LOO observation router joint=-0.0002769,明显优于 A74 LOO lambda-only=-0.0000504 和 hard λ=1=-0.0001506。但 LOO 只匹配 2/3 oracle,说明目前仍是小样本机制证据,不是最终泛化方法。

A75 maps trajectory-level observation signals to A73 lambda candidates at case level. It is a retrospective bridge audit, not a true candidate-specific render evaluation for every lambda mesh.

实验设计(Image-2 风格)

实验设计图:A75 observation-conditioned ranker
实验设计图:A75 observation-conditioned ranker
模块设计图:observation-state regional budget
模块设计图:observation-state regional budget

模块设计(Image-2 风格)

Observation State

  • late_safe_global_gain:后期多视角 residual 继续变好,且没有 local damage,倾向 scalar overstep。
  • early_mv_gain_local_damage:MV depth 早期变好但局部可见/neutral 区受损,倾向 conflict-only。
  • mid/ambiguous:不冒进,回退 hard λ 或 conservative budget。

Router Audit

  • diagnostic prior 用全部 case 观察机制解释 oracle,不作为泛化结论。
  • conservative prior 减少对中间状态的冒进。
  • LOO threshold router 在两个 case 上拟合规则,在 held-out case 只用 observation state 选候选。

实验结果(表格)

10-case projected comparison

rankermean ΔChamfermean ΔF@5jointPareto hitsgap to oracle
A73 GT oracle upper bound-0.00021070.001227-0.000308930.0000000
A75 observation diagnostic prior-0.00021070.001227-0.000308930.0000000
A75 observation conservative prior-0.00018610.001222-0.000283920.0000249
A75 LOO observation router-0.00017790.001237-0.000276920.0000320
hard λ=1-0.00008920.000768-0.000150600.0001582
A74 LOO lambda-only ranker-0.00000830.000526-0.000050410.0002584
A73 weak proxy-0.00000890.000259-0.000029600.0002793

case observation and selection

caseobservation statebest MVD iterbest MVD Δlate safeearly paradoxdamage/MVD+diagnosticLOOoracle
gso_000_input4mid_mv_gain_without_late_safety3-0.00005641.000scalar_1.250scalar_1.250scalar_1.250
gso_002_input4late_safe_global_gain4-0.00122590.750scalar_1.250scalar_1.250scalar_1.250
gso_008_input4early_mv_gain_local_damage2-0.00049811.000probe_v0.000_c0.750_r0.000scalar_1.000probe_v0.000_c0.750_r0.000

LOO threshold details

held-outobs statetargetselectedΔChamferΔF@5jointon Paretotrained params
gso_000_input4mid_mv_gain_without_late_safetyscalar_1.25scalar_1.250-0.0004916-0.004373-0.0001417late=False, paradox=False, mid=True, default=conflict_0.75
gso_002_input4late_safe_global_gainscalar_1.25scalar_1.250-0.00135260.015246-0.0025723late=False, paradox=False, mid=True, default=conflict_0.75
gso_008_input4early_mv_gain_local_damagehard_lambda_1scalar_1.0000.00006490.001496-0.0000548late=False, paradox=False, mid=True, default=hard_lambda_1

可视化结果

A75 joint comparison
A75 joint comparison
A75 oracle gap
A75 oracle gap
A75 oracle matches
A75 oracle matches

实验结论

下一步想法