多视角非正交 TRELLIS 改进实验

新增实验:multidiffusion 融合、GPT-only multidiffusion、质量门控 hybrid multidiffusion。

现有方法主要缺陷

改进假设

用 multidiffusion 替代 stochastic 可以减少 step 级别的视图采样偏置;用质量门控的 hybrid 输入保留原图细节,同时只加入可信 GPT 正交视图提供方向约束。

新增实验总览:direct / GPT-only / direct-md / GPT-md / hybrid-gated
新增实验多角度抽帧:每个 variant 抽取 3 个旋转角度,避免只看第一帧误判。

改进实验结论

最有价值的不是固定采用某一个输入路线,而是先评估正交视图质量,再在 direct、GPT-only、hybrid 之间路由。错误 GPT 视图会污染融合;高质量 GPT 视图则能提供更稳定的方向约束。

Case当前最佳路线观察
chairdirect 或 hybrid-gatedGPT-only 路线让椅子更正,但容易弱化座面小物件;hybrid 能部分保留细节,但没有稳定超过 direct。
monkeygpt-only / gpt-mdGPT 正交视图本身质量高,stochastic 与 multidiffusion 差异小;hybrid 不再显著提升。
robotdirect / direct-mdGPT back 方向错误是主要瓶颈;排除 back 后 hybrid 避免进一步污染,但仍难超过 direct。
toolcarhybrid-gated原图细节和可信 GPT 正交约束互补,hybrid 比 GPT-md 更稳定,也比 direct-md 更正。
flowerdirect-md / hybrid-gatedGPT 四视图方向差异不足;门控策略正确回退到原图 multidiffusion,避免 GPT-only 的信息压缩。

chair

Hybrid gated inputs: original 3 images + GPT views ['front', 'left', 'right', 'back'].

Direct baseline
435,104 vertices / 870,136 faces · OBJ
GPT-only baseline
366,344 vertices / 732,720 faces · OBJ
Direct multidiffusion
354,468 vertices / 708,866 faces · OBJ
GPT multidiffusion
288,840 vertices / 577,724 faces · OBJ
Hybrid gated multidiffusion
357,190 vertices / 714,436 faces · OBJ

monkey

Hybrid gated inputs: original 4 images + GPT views ['front', 'left', 'right', 'back'].

Direct baseline
303,618 vertices / 607,312 faces · OBJ
GPT-only baseline
356,890 vertices / 713,796 faces · OBJ
Direct multidiffusion
291,760 vertices / 583,576 faces · OBJ
GPT multidiffusion
351,084 vertices / 702,208 faces · OBJ
Hybrid gated multidiffusion
315,306 vertices / 630,692 faces · OBJ

robot

Hybrid gated inputs: original 2 images + GPT views ['front', 'left', 'right'].

Direct baseline
233,694 vertices / 467,362 faces · OBJ
GPT-only baseline
202,274 vertices / 404,494 faces · OBJ
Direct multidiffusion
232,840 vertices / 465,664 faces · OBJ
GPT multidiffusion
182,830 vertices / 365,542 faces · OBJ
Hybrid gated multidiffusion
182,916 vertices / 365,768 faces · OBJ

toolcar

Hybrid gated inputs: original 3 images + GPT views ['front', 'left', 'right', 'back'].

Direct baseline
366,840 vertices / 733,796 faces · OBJ
GPT-only baseline
454,232 vertices / 908,464 faces · OBJ
Direct multidiffusion
351,034 vertices / 702,268 faces · OBJ
GPT multidiffusion
338,700 vertices / 677,416 faces · OBJ
Hybrid gated multidiffusion
393,308 vertices / 786,820 faces · OBJ

flower

Hybrid gated inputs: original 8 images + GPT views [].

Direct baseline
405,576 vertices / 811,608 faces · OBJ
GPT-only baseline
288,208 vertices / 576,888 faces · OBJ
Direct multidiffusion
422,160 vertices / 844,724 faces · OBJ
GPT multidiffusion
301,634 vertices / 603,700 faces · OBJ
Hybrid gated multidiffusion
422,170 vertices / 844,740 faces · OBJ