现有方法主要缺陷
- 非正交输入通常没有相机位姿,模型只能在语义 token 上融合,无法做严格几何对齐。
- 生成式正交视图会发生 identity drift:小物件丢失、背面画错、多个方向过于相似。
- 所有输入视图默认同权,错误视图会污染多图融合;stochastic 模式还会受到 step 数和输入顺序影响。
改进假设
用 multidiffusion 替代 stochastic 可以减少 step 级别的视图采样偏置;用质量门控的 hybrid 输入保留原图细节,同时只加入可信 GPT 正交视图提供方向约束。
新增实验总览:direct / GPT-only / direct-md / GPT-md / hybrid-gated
新增实验多角度抽帧:每个 variant 抽取 3 个旋转角度,避免只看第一帧误判。
改进实验结论
最有价值的不是固定采用某一个输入路线,而是先评估正交视图质量,再在 direct、GPT-only、hybrid 之间路由。错误 GPT 视图会污染融合;高质量 GPT 视图则能提供更稳定的方向约束。
| Case | 当前最佳路线 | 观察 |
| chair | direct 或 hybrid-gated | GPT-only 路线让椅子更正,但容易弱化座面小物件;hybrid 能部分保留细节,但没有稳定超过 direct。 |
| monkey | gpt-only / gpt-md | GPT 正交视图本身质量高,stochastic 与 multidiffusion 差异小;hybrid 不再显著提升。 |
| robot | direct / direct-md | GPT back 方向错误是主要瓶颈;排除 back 后 hybrid 避免进一步污染,但仍难超过 direct。 |
| toolcar | hybrid-gated | 原图细节和可信 GPT 正交约束互补,hybrid 比 GPT-md 更稳定,也比 direct-md 更正。 |
| flower | direct-md / hybrid-gated | GPT 四视图方向差异不足;门控策略正确回退到原图 multidiffusion,避免 GPT-only 的信息压缩。 |
chair
Hybrid gated inputs: original 3 images + GPT views ['front', 'left', 'right', 'back'].
Direct baseline
435,104 vertices / 870,136 faces · OBJGPT-only baseline
366,344 vertices / 732,720 faces · OBJDirect multidiffusion
354,468 vertices / 708,866 faces · OBJGPT multidiffusion
288,840 vertices / 577,724 faces · OBJHybrid gated multidiffusion
357,190 vertices / 714,436 faces · OBJ monkey
Hybrid gated inputs: original 4 images + GPT views ['front', 'left', 'right', 'back'].
Direct baseline
303,618 vertices / 607,312 faces · OBJGPT-only baseline
356,890 vertices / 713,796 faces · OBJDirect multidiffusion
291,760 vertices / 583,576 faces · OBJGPT multidiffusion
351,084 vertices / 702,208 faces · OBJHybrid gated multidiffusion
315,306 vertices / 630,692 faces · OBJ robot
Hybrid gated inputs: original 2 images + GPT views ['front', 'left', 'right'].
Direct baseline
233,694 vertices / 467,362 faces · OBJGPT-only baseline
202,274 vertices / 404,494 faces · OBJDirect multidiffusion
232,840 vertices / 465,664 faces · OBJGPT multidiffusion
182,830 vertices / 365,542 faces · OBJHybrid gated multidiffusion
182,916 vertices / 365,768 faces · OBJ toolcar
Hybrid gated inputs: original 3 images + GPT views ['front', 'left', 'right', 'back'].
Direct baseline
366,840 vertices / 733,796 faces · OBJGPT-only baseline
454,232 vertices / 908,464 faces · OBJDirect multidiffusion
351,034 vertices / 702,268 faces · OBJGPT multidiffusion
338,700 vertices / 677,416 faces · OBJHybrid gated multidiffusion
393,308 vertices / 786,820 faces · OBJ flower
Hybrid gated inputs: original 8 images + GPT views [].
Direct baseline
405,576 vertices / 811,608 faces · OBJGPT-only baseline
288,208 vertices / 576,888 faces · OBJDirect multidiffusion
422,160 vertices / 844,724 faces · OBJGPT multidiffusion
301,634 vertices / 603,700 faces · OBJHybrid gated multidiffusion
422,170 vertices / 844,740 faces · OBJ