实验定位 论文主线 / 待验证
这一页不是一个已经宣称成功的结果,而是基于前五轮实验形成的论文级研究假设:VGGT 的价值不在于给 TRELLIS.2 增加一个强条件,而在于提供局部几何可信域;生成模型只能在这个可信域内做受限轨迹修正。
实验设计(Image-2 风格)
模块设计(Image-2 风格)
本页的模块设计图已在“实验设计”区域并排展示;它描述输入视角、VGGT/TRELLIS.2 信号、门控/路由、mesh 输出和评测反馈之间的数据流。这里单独标出模块设计章节,方便按统一汇报格式阅读。
实验结果(表格)
| 已有尝试 | 设计 | 证据 | 状态 |
|---|---|---|---|
| VGGT 静态标量权重 | 全局 confidence / geometry weight | geometry Chamfer Δ=0.003525,相对改善=-0.0432 | 证伪 |
| 直接 spatial adapter | VGGT residual 直接进 sparse 条件 | tokens 26→3134;Chamfer 恶化 19.39% | 证伪 |
| baseline-preserving v2 | gate=0 精确复现 multidiffusion | parity=True; step25 Chamfer=0.07727 | 必要条件 |
| alpha=0.25 单例 | residual 缩放 + support gate | Chamfer 0.06435 vs baseline 0.06764;support Jaccard 0.923 | 局部有效 |
| alpha=0.25 十例 | 同一策略放大到 10 case | 失败 1/10;Chamfer 0.08325 vs 0.08316 | 放大失败 |
| hybrid repair | 后处理解决拓扑 | watertight=100.0%; Chamfer 0.08193 vs 0.08161 | 拓扑有效 |
可视化结果
和现有方法的关系
| 相关方法 | 核心能力 | 本课题缺口 / 可借鉴点 | 来源 |
|---|---|---|---|
| TRELLIS.2 | 结构化 3D latent / O-Voxel 思路强化生成质量 | 缺口:多非正交图像条件下仍缺少显式相机/几何一致性约束;本实验看到非水密与面片过多 | project |
| VGGT | 从多图预测相机、深度、点图与跟踪,提供 feed-forward 几何观测 | 缺口:VGGT 给几何观测,不直接告诉生成模型如何在 diffusion trajectory 中安全使用 | project |
| SyncDreamer | 通过同步多视角 diffusion 的中间状态来提升一致性 | 启发:约束扩散过程本身;差异:我们的约束对象是 TRELLIS.2 sparse support,而不是只同步 RGB 视图 | project |
| MVDream | 用多视角扩散作为 3D 生成先验,强调跨视角一致图像生成 | 启发:多视角一致性需要模型结构显式支持;差异:本课题输入是不定数量真实非正交图 | arXiv |
| Wonder3D++ | 多视角法线/颜色联合生成,解决单图到 3D 的一致性问题 | 启发:法线和几何信号有用;差异:我们已有 VGGT 几何点图,核心是如何不破坏 sparse latent | arXiv |
实验结论
- 静态视角权重和直接 feature injection 已经被本地实验排除,不应再作为论文主线。
- 真正可研究的对象是 diffusion trajectory 中 sparse support 的可控性:token 数、support 位置、centroid、decoded occupancy 都要纳入约束。
- VGGT 应从“条件增强器”降级为“几何可信域估计器”,只允许它在跨视角一致的局部区域提出小修正。
- 后处理 repair 可以解决可用性,但不构成核心创新;核心创新要前置到生成过程。
下一步想法
| 消融编号 | 设计 | 要回答的问题 | 通过门槛 |
|---|---|---|---|
| A0 baseline | TRELLIS.2 multidiffusion | 当前可靠基线 | Chamfer / F-score / watertight / faces / support set |
| A1 local confidence mask | 只在 VGGT 高置信 patch 允许 correction | 验证局部 mask 是否优于标量权重 | support drift 不超过阈值 |
| A2 support-set loss | 训练时加入 Jaccard、centroid、token ratio 惩罚 | 解决 alpha=0.25 安全区间太窄的问题 | 10-case no-extra-failure |
| A3 decoder-aware band | 用 decoded occupancy band 约束 topology | 把 v5 中没改善的 occupancy gate 变成训练目标 | occupancy IoU improved cases > 0 |
| A4 100-case matrix | 2/4/6/8 输入视角 + 20 test views | 验证是否泛化到真实多视角设置 | 平均指标 + 失败率 + 拓扑指标 |
下一轮优先跑 A1/A2 的小规模 10-case ablation。只有 no-extra-failure、support drift 受控,并且 Chamfer 或 F@5 至少一项有配对改善时,才扩到 100-case / 2-4-6-8 输入矩阵。