实验定位 无效
这个实验把 VGGT 从静态权重升级为空间 residual:让模型知道哪里有跨视角一致的 3D 几何。但第一版暴露了 TRELLIS.2 sparse flow 对条件扰动极度敏感。
实验设计(Image-2 风格)
模块设计(Image-2 风格)
本页的模块设计图已在“实验设计”区域并排展示;它描述输入视角、VGGT/TRELLIS.2 信号、门控/路由、mesh 输出和评测反馈之间的数据流。这里单独标出模块设计章节,方便按统一汇报格式阅读。
实验结果(表格)
| 方法 | Chamfer ↓ | F@5% ↑ | F@10% ↑ | 面片数 | boundary / nonmanifold | 判断 |
|---|---|---|---|---|---|---|
| uniform multidiffusion | 0.06764 | 0.4772 | 0.7224 | 13496 | 260 / 345 | 基线 |
| VGGT spatial adapter step100 | 0.08076 | 0.3803 | 0.6757 | 1597958 | 6606 / 8808 | 强负面 |
可视化结果
uniform sparse tokens=26,adapter tokens=3134,occupancy fraction 从 0.000793 到 0.095642。
实验结论
- 直接 feature injection 不是正确路线:它会把 sparse support 从小区域扩散到大范围空间。
- mean-DINO 单调用不是 multidiffusion 的严格 fallback,因为 flow 对 condition 非线性。
- 这一步的正价值是明确了安全条件:任何 adapter 必须在 gate=0 时逐视图、逐 step 精确复现 baseline。
下一步想法
构建 baseline-preserving adapter:保留每张图独立 condition,VGGT 只生成逐视图 residual;所有 residual 都要经过 token ratio、support Jaccard、centroid drift 门控。