TRELLIS / 修改版 TRELLIS.2 多视角融合研究

5 个 GSO GT 对象 · 每组 4 张输入 · 3 种顺序 · stochastic / multidiffusion · 12 steps · seed 1

结论摘要

论文与代码机制

TRELLIS stochastic

view(t) = t mod V

每个 step 只调用一张图。12 steps / 4 views 时每张调用 3 次;输入重排会改变图像与 diffusion timestep 的绑定。

TRELLIS multidiffusion

prediction(t) = (1 / V) × Σ model(x_t, t, cond_i)

所有视图从同一个 x_t 独立预测,再做算术平均。显式权重为 1 / V,理论上对列表顺序不变。

“调用次数相同”不等于“有效影响相同”。stochastic 的图像位于不同噪声时间步;multidiffusion 虽显式等权,但内容质量、遮挡和特征冲突仍会改变实际结果。

每张图片的权重

实现融合阶段本实验每图使用量显式权重顺序影响
TRELLIS stochasticsparse、SLat3 / 12 calls按调用次数名义上 25%,有效权重未知会改变视图与 timestep 的绑定
TRELLIS multidiffusionsparse、SLat每个 step 都调用每 step 精确 1 / V理论不变;浮点求和误差可被扩散过程放大
TRELLIS.2 stochasticsparse、shape、texture各阶段均为 3 / 12 calls按调用次数名义上 25%,有效权重未知三个阶段都可能受 timestep 绑定影响
TRELLIS.2 multidiffusionsparse、shape、texture各阶段每个 step 都调用每 step 精确 1 / V理论不变;实验中接近但不完全相同

一般情况下 stochastic 中每张图至少获得 floor(steps / V) 次调用;当 steps % V != 0 时,输入列表前面的若干视图会多一次调用。因此只有像本实验 12/4 这样整除时,调用次数才完全相同。

论文口径:不要混淆两类“多视角”

VAE 多视角编码:TRELLIS 论文在构建 3D latent 时,会把带已知投影关系的 dense multiview DINOv2 特征投影到体素并平均;这是训练表示的 3D 编码流程。生成推理条件:论文中的生成模型通过 cross-attention 接收 DINOv2 图像特征,TRELLIS.2 则使用 DINOv3-L 图像条件。本文测试的多图输入是对该生成采样器的推理期改造,没有论文 VAE 编码阶段的相机投影与几何对齐。

全部生成组

Chamfer 越低越好;F-score 越高越好;失败率单独报告,不从成功样本均值中隐藏。

方法成功ChamferF@5%F@10%面片数失败率
TRELLIS stochastic · identity5/50.08580.40400.60664772170.0000
TRELLIS stochastic · reverse5/50.07760.42050.65244351300.0000
TRELLIS stochastic · rotate5/50.08140.41470.64044419400.0000
TRELLIS multidiffusion · identity5/50.08090.44770.63364954360.0000
TRELLIS multidiffusion · reverse5/50.08170.44250.62905041030.0000
TRELLIS multidiffusion · rotate5/50.08170.43990.63025067230.0000
TRELLIS multidiffusion · 正交5/50.08160.39080.64505252560.0000
TRELLIS.2 stochastic · identity5/50.06750.50360.741915174970.0000
TRELLIS.2 stochastic · reverse5/50.07820.43300.668815374840.0000
TRELLIS.2 stochastic · rotate5/50.07710.42690.685711637940.0000
TRELLIS.2 multidiffusion · identity5/50.07210.46560.714211667260.0000
TRELLIS.2 multidiffusion · reverse5/50.06720.49190.750912322400.0000
TRELLIS.2 multidiffusion · rotate4/50.07270.46440.712415038450.2000
TRELLIS.2 multidiffusion · 正交5/50.08380.39760.63048258120.0000

输入顺序实验

identity=[0,1,2,3],reverse=[3,2,1,0],rotate=[1,2,3,0]。GT 指标 range 衡量同一 case 的评价波动;预测间 Chamfer 直接衡量三个输出 mesh 是否相同。

融合方式完整 caseGT Chamfer mean rangeF@5% range预测间 Chamfer
TRELLIS stochastic50.00960.04620.0212
TRELLIS multidiffusion50.00080.00860.0062
TRELLIS.2 stochastic50.01470.10480.0336
TRELLIS.2 multidiffusion40.00090.00640.0081

正交与非正交输入

Δ 定义为 canonical 正交输入减去随机非正交输入。Chamfer Δ<0、F-score Δ>0 表示正交输入更好。本协议的正交组固定 elevation=0°,因此俯仰覆盖弱于带高低视角的随机非正交组,结果只说明“水平四向正交”没有占优。

模型配对 caseChamfer ΔF@5% ΔF@10% Δ面片数 Δ
TRELLIS50.0006-0.05680.011429820
TRELLIS.250.0117-0.0680-0.0838-340914

2026-07-19 · VGGT 几何加权实验

假设:冻结 TRELLIS.2,仅用 VGGT 的跨视角置信度和共同三维点一致性设置 multidiffusion 的静态视角权重,可能优于每视角 1 / V 平均。

score = confidence + 0.5 × support + 0.25 × coverage
prediction(t) = Σ weight_i × model(x_t, t, cond_i)

过程与异常发现

方法Chamfer ↓F@5% ↑水密率 ↑生成时间/case生成峰值显存门槛
uniform multidiffusion0.08160.43360.000016.20 s2.84 GiB基线
VGGT confidence0.08150.43720.000016.14 s2.88 GiB不通过
VGGT geometry0.08510.43930.000016.62 s2.96 GiB不通过

结论:不通过。VGGT geometry 的 Chamfer 相对改善为 -0.0432,F@5% 平均增量为 0.0057,水密率仍为 0。静态全局权重无法稳定融合空间上互补的视角,并会显著改变 sparse-structure token 数与面数。下一阶段应训练空间可变的 VGGT token adapter,并单独解决 watertight extraction。

2026-07-19 · VGGT 空间稀疏适配器与监督数据准备

选择:冻结 VGGT、DINOv3 与 TRELLIS.2 sparse flow,将高置信世界点和 VGGT patch 特征聚合到 16³ voxel grid,保留 top-512 几何 token,再对 mean-DINO 条件做 cross-attention residual。

DINO = [B,V,1029,1024]
VGGT = [B,V,1374,2048]
fused_cond = mean_dino + tanh(gate) × geometry_residual

gate 零初始化,因此训练开始时输出严格等于多视图 DINO 均值;适配器只先学习 sparse occupancy / coarse topology,shape adapter 与 watertight extraction 留到后续阶段。

Toys4K 数据

范围1024 dual-gridshape latentSS latentrender_cond显存峰值
单对象36.94 s28.23 s6.58 s208.27 sshape 9.28 GiB; render 3.82 GiB
smoke16110.59 s / 4 CPU workers8-GPU 分片8-GPU 分片最慢 rank 387.32 sshape 10.04 GiB; render 6.49 GiB

完整性:16 / 16 对象成功由 ImageConditionedSparseStructureLatent 加载,得到有限的 x_0 [8,16,16,16]cond [3,518,518];共 256 张条件图,逻辑磁盘占用约 940 MiB。

DINO / VGGT 特征缓存

对每个对象的 16 个 render_cond 视角按 transforms.json 原始顺序缓存:DINO BF16 [16,1029,1024]、VGGT 最后一层 patch BF16 [16,1369,2048]、confidence-weighted world points FP32 [16,37,37,3]、confidence、4×4 transforms 与水平 FOV。

对象模型提取均值总作业墙钟峰值显存缓存体积重载验证
16 × 16 views 1.24 s/object 64.81 s 15.92 GiB 1.84 GiB 4.50 s · camera-aligned

Adapter flow-matching smoke

冻结 1.3B sparse-flow 与全部 encoder,仅训练 VGGTSpatialAdapter;官方 target 为 v=(1-σ_min)noise-x_0。在 smoke16 上执行 100 optimizer steps、accumulation 4,共 400 samples,视角数随机覆盖 2 / 4 / 6 / 8。

梯度有效loss step 1 → 100last-10 meangate训练时长峰值显存checkpoint
100 / 100 0.2983 → 0.1022 0.1207 -0.002942 129.52 s train; 150.19 s wall 13.10 GiB step 1 / 25 / 50 / 100

loss 使用每步重新采样的对象、视角、timestep 与 noise,因而不是单调曲线;step 1=0.2983、step 100=0.1022 仅证明训练链路和早期优化可运行。是否改善几何必须由固定验证集和 benchmark mesh 评价决定。

vggt_adapter inference · 单例正式评价

step-100 adapter 在 sparse-structure 阶段生成一个融合条件;shape 与 texture 阶段继续使用 multidiffusion。输入严格遵循 manifest 的四视图顺序及相机矩阵对齐。

caseAdapter 提取采样进程墙钟Chamfer ↓F@5% ↑F@10% ↑拓扑
gso_000_input4 2.07 s · 7.83 GiB 16.33 s · 7.84 GiB 117.98 s 0.08076 0.38030 0.67572 watertight = 0.0000; winding = 0.0000; valid = 0.0000

负面结果:20,000 surface samples、seed 11 的正式评价显示该单例高度非水密且几何明显失真:6,606 boundary edges、8,808 nonmanifold edges,bbox 对角线 / 表面积 / 绝对体积比为 4.45795 / 13.99996 / 47.50581。这不是改进证据,说明 16-object / 100-step smoke 不足,并且在扩大训练前必须先排查坐标、体素化、gate residual 尺度与训练/benchmark 视角分布。

同 case uniform 对照与 sparse occupancy

同一 gso_000_input4、seed 1、12 steps、512 pipeline 的 uniform multidiffusion 在同一 20k/seed-11 评价中得到 Chamfer 0.06764、F@5 0.47725、F@10 0.72235。adapter 相对 uniform 的 Chamfer 恶化 19.39%,F@5 下降 0.09695,面数增加到 118.4×。

路径32³ sparse tokensoccupancy坐标范围boundary / nonmanifold
uniformuniform 260.079%3 × 5 × 5260 / 345
step-100 adapteradapter 3,1349.564%32 × 32 × 286,606 / 8,808

诊断结论:adapter sparse token 数是 uniform 的 120.5×,范围从 3×5×5 扩张到 32×32×28。当前首要问题不是 watertight 后处理,而是 sparse occupancy 爆炸;在解释并修正该问题前暂停 25/50/100 × 10-case 矩阵,避免放大无效计算。

Checkpoint sparse-only 扫描

在同一 benchmark 条件上,仅运行 sparse stage:官方 uniform multidiffusion 为 26 tokens;把四个 DINO 条件先求均值再单调用 sparse flow,即使不加任何 geometry residual,也得到 mean-DINO 单调用 3,421 tokens。step-1 3,409、step-25 3,153、step-50 3,234、step-100 3,090;step-1 的有效 condition 扰动仅 0.0062%,仍未恢复 occupancy。

架构级根因:条件均值不保持 multidiffusion 基线。sparse flow 对 condition 是非线性的,model(mean(cond_i)) ≠ mean(model(cond_i));因此当前所谓“zero-gate exact fallback”只精确回退到 mean-DINO condition,并不回退到已验证的 multidiffusion sampler。后续设计必须在 gate=0 时逐步、逐视图精确复现 multidiffusion 的 velocity 平均。

baseline-preserving v2:逐视图 residual 与精确 sparse parity

cond_i' = cond_i + tanh(gate) × residual_i
velocity = mean_i sparse_flow(x_t, t, cond_i')

gate=0 时保留全部逐视图 DINO condition,并继续使用 multidiffusion 的逐视图 velocity 平均。正式 parity gate 的 condition / token count / ordered coordinates 均精确一致:26 / 26 tokens,精确 sparse parity = true。adapter extraction 0.924 s,uniform / adapter sparse 5.509 / 4.703 s,峰值 7.54 GiB。

v2 在线重算精确 2/4/6/8-view 子集的 DINO 与 VGGT,100 optimizer steps / 400 micro-samples;loss 0.19453 → 0.08757,最小 0.03293,非零梯度 100 / 100。训练 780.35 s,平均 optimizer step 7.79 s,峰值 reserved 25.46 GiB,外部峰值 35.45 GiB。

checkpoint sparse-only 扫描高度非单调:uniform 26;step-1 285,step-25 30,step-50 4,672,step-100 320。只有 step-25 的 1.154× 通过 ≤2.0× sparse gate。

step-25 单例正式 20k/seed-11 几何评价:Chamfer 0.07727、F@5 0.41023、F@10 0.72308、watertight = 0.0000,boundary / nonmanifold = 169 / 269;bbox 0.44706、面积 0.14764、绝对体积 0.49898。相对 uniform,Chamfer 恶化 14.23%,F@5 下降 0.06701。

单例质量门控:不通过。生成成功,bbox/表面积比例与同 case uniform 处于同一量级,boundary / nonmanifold 计数也下降;但 Chamfer 与 F@5 均未改善,因此按预注册决策不运行十例矩阵。下一步诊断微小 residual 如何改变 sparse 坐标位置与尺度,再决定训练目标或正则化修改。

逐步 sparse 轨迹诊断

相同初始噪声下,latent 在 step 1 首次分叉,首步 velocity delta RMS 为 0.00614;decoded occupancy 在 step 6 首次分叉,此时 velocity delta RMS 已增至 0.09643。最后一步的 latent delta / uniform RMS 达 1.3116×,latent cosine 降至 0.00945。

最终 uniform / adapter tokens 为 26 / 24,坐标集合 Jaccard 0.0000,质心相距 25.05 voxels。相同进程内重复 step-25 得到 24 / 24,Jaccard 1.0000,说明完整支持集搬移是稳定行为;先前 23/24/30 token 波动来自阈值附近数值敏感性,而不是运行内随机噪声。

根因结论:token count 相近不能约束 sparse support 的位置。极小 condition residual 经 CFG、非线性 flow 与后期大 Euler step 累积放大,最后跨过 decoder 的零阈值并把支持集整体搬到另一空间区域。诊断首次尝试还因 The first trajectory run sampled uniform successfully but failed while decoding intermediate latents because low_vram had moved the sparse decoder back to CPU. A regression test now moves the decoder to the pipeline device and restores it to CPU, while reusing the production 64^3-to-32^3 max-pool path. 失败;已通过遵循 low-VRAM decoder 设备迁移并复用生产 64³→32³ max-pool 路径修复。

Residual α sweep 与安全支持集

固定 step-25 checkpoint,仅缩放 residual:cond_i(α)=cond_i+α(cond_i'-cond_i)。结果高度非单调:α=0.03125 / 0.0625 分别得到 297 / 144 tokens,α=0.125 / 0.5 为空,而 α=0.75 / 1.0 虽只有 23 / 22 tokens,却已搬到错误空间区域。

Residual α sweep 选择 α=0.25。α=0.25 得到 24 tokens,Jaccard 0.9231,质心漂移 0.079 voxel,满足 token / overlap / centroid 三重门槛。

α=0.25 端到端 mesh:5,361 vertices / 10,950 faces;Chamfer 0.06435,相对改善 4.86%;F@5 0.46006,F@5 下降 0.01719;F@10 0.76072,增加 0.03837。watertight = 0.0000,boundary / nonmanifold = 281 / 471。

同 case 门控:通过。按预注册规则,生成无失败、尺度未灾难性偏移,且 Chamfer 或 F@5 至少一项改善;因此允许进入固定 protocol-4 十例矩阵。但该结论不代表拓扑或水密性改善,F@5 与 edge topology 仍退化。

固定十例矩阵

α=0.25 在 protocol-4 固定前十例仅成功 9 / 10,失败率 10.0%;失败 case 为 gso_000_input4,同一 case 在独立单例进程曾成功,进一步证明阈值附近跨进程不稳定。

只在共同成功的 9 个 case 上,Chamfer 0.08316 → 0.08325,Chamfer 恶化 0.11%;F@5 0.42880 → 0.42957,F@5 增加 0.00077;F@10 增加 0.00111。这些微小 paired 变化不能抵消新增失败。

成功样本仍全部非水密,最大面数 2,662,864,最大 bbox / 表面积 / 绝对体积比为 14.22 / 192.42 / 345.02。

十例门控:不通过。违反 no-extra-failure,且多数输出出现 occupancy/尺度爆炸。停止扩大该 checkpoint/α 组合,不运行 100-case 或 protocol2/6/8;下一设计必须在训练时约束 velocity/support,而不是依赖单 case 推理缩放。

velocity trust-region v3:局部速度上界的负面结果

v_base = mean_i flow(x_t,t,cond_i)
v_corr = mean_i flow(x_t,t,cond_i')
v_safe = v_base + min(1, cap × RMS(v_base) / RMS(v_corr-v_base)) × (v_corr-v_base)

cap-zero 精确 parity:uniform / adapter 为 26 / 26 tokens;final latent 精确一致 = true,ordered coordinates 精确一致 = true。完整进程 108.23 s,外部 GPU 峰值 8.22 GiB。

首轮 cap=0.01/0.025/0.05/0.1 全部没有真正裁剪:step-25 residual 的最大原始 velocity delta / baseline RMS 仅 0.00306。缩小到 10⁻⁶–3×10⁻³ 后,每一步实测比值均满足 cap,但最终轨迹仍高度非单调,证明局部 relative-RMS 上界不等价于累计状态或 sparse support 上界。

三例门代表 casecaptoken ratiosupport Jaccard质心漂移final latent delta / baseline
gso_000_input40.00000112.7308×0.000013.4728 voxels2.8427×

固定三例共同门耗时 237.18 s,外部 GPU 峰值 8.26 GiB。例如 gso_000_input4 在 cap=10⁻⁶ 时达到 12.7308× tokens、Jaccard 0.0000、质心漂移 13.4728 voxels,final latent delta / baseline 达 2.8427×;其他 case 可接近 baseline,显示同一 cap 的对象间敏感性差异极大。

三例门控:不通过。没有非零 constant cap 同时通过三例;selected training cap = none,因此不启动 v3 训练、不生成 mesh,也不扩大到十例或 100-case。下一版必须约束累计 state / predicted x0 或直接约束 decoder occupancy,而不是仅限制单步 velocity 的相对 RMS。watertight extraction 与 protocol-2/4/6/8 100-case 仍未完成。

cumulative state anchor v4:双轨累计状态投影

x_base_next = Euler(x_base, v_base)
x_raw_next = Euler(x_safe, v_corr)
x_safe_next = x_base_next + project(x_raw_next - x_base_next)
RMS(x_safe_next-x_base_next) ≤ rel_cap × RMS(x_base_next)

v4 不再把 baseline velocity 评估在已经分叉的 adapter state,而是同步维护一条独立 uniform shadow trajectory。cap=0 时,初始噪声、shadow、候选与独立 uniform 的全部 12 个 latent state 精确一致;最终 sparse tokens 为 26 / 26,ordered coordinates 精确一致 = true。完整进程 106.24 s,外部 GPU 峰值 8.22 GiB。

单例从 `1e-5` 扫到 `0.1` 均满足累计 state 上界。rel_cap=0.100 首次对 gso_000_input4 产生受控 support 变化:25 tokens,Jaccard 0.9615,质心漂移 0.1038 voxels;没有出现 v3 的空 support、整体搬移或跨吸引子发散。

固定三例 @ rel_cap=0.1token ratioJaccard质心漂移final latent delta / uniform
gso_000_input40.9615×0.96150.1038 voxels0.1000×
gso_001_input40.9941×0.99410.0241 voxels0.0377×
gso_002_input40.9770×0.96800.3724 voxels0.1000×

三例 gate 中,gso_000_input4 的 Jaccard 为 0.9615;最大质心漂移来自 gso_002_input4,为 0.3724 voxels。所有 shadow states 与独立 uniform 精确一致,所有候选 final latent delta 均不超过配置 cap。

三例 state gate:通过。选择 rel_cap=0.100,三例运行 245.53 s,外部 GPU 峰值 8.26 GiB。该结果允许进入短 unroll 训练设计,但尚未证明 mesh 几何或水密性改善;在训练、同 case 正式几何门和固定十例拓扑门通过前,不运行 protocol-2/4/6/8 100-case。

v4 truncated-unroll one-step GPU smoke

固定 seed-1 选中 [4] views、timestep window [0]。loss 0.160263,flow / state loss = 0.160028 / 0.000235,gradient norm 1.586127,final state ratio 0.000333。冻结模型无梯度 = true,checkpoint 重载 = true。

成功尝试命令墙钟 38.65 s,CPU RSS 峰值 10.52 GiB,CUDA allocated / reserved 峰值 18.33 GiB / 18.77 GiB,外部 GPU 峰值 19.52 GiB。

one-step 训练门控:通过。只有在后续 100-step checkpoints 25/50/100 均通过固定三例 state gate 后,才允许进入 mesh 几何与拓扑验证。

100-step truncated-unroll systems smoke

完成 100 / 100 个非零梯度 optimizer steps;loss first / mean / last = 0.160398 / 0.125254 / 0.379477,mean state loss 0.005118,max final state ratio 0.026894。adapter gate -0.000030 → 0.001443。

训练内计时 297.93 s,完整命令 331.19 s,平均 optimizer step 2.968 s;CPU RSS 峰值 10.51 GiB,CUDA reserved 23.81 GiB,外部 GPU 峰值 24.55 GiB。

post-training fixed three-case state gates

step 25 / 50 / 100 依次在固定三例、12 sampler steps、seed 1、rel_cap=0.1 下复测;三个 checkpoints 全部通过。

checkpointgate最小 Jaccard最大质心漂移外部 GPU 峰值
step 25通过0.96150.3800 voxels8.26 GiB
step 50通过0.92310.1684 voxels8.26 GiB
step 100通过0.92310.1443 voxels8.26 GiB

选择 step 50。它在三个安全 checkpoints 中提供最均衡的 support overlap 与质心漂移,允许进入同 case 正式 mesh 几何/拓扑门;仍不代表 watertightness 或 100-case 性能已经改善。

same-case formal geometry/topology gate

checkpoint step 50 在 gso_000_input4 上生成 mesh,并按 20,000 surface samples、seed 11 正式评价:Chamfer 0.07542,F@5 0.43027,F@10 0.69020;bbox / surface / volume ratio = 0.47144 / 0.09987 / 0.76995。

相对完全相同的 uniform baseline,Chamfer 恶化 11.49%,F@5 下降 0.04698,F@10 下降 0.03215;boundary / nonmanifold = 360 / 355,分别增加 100 / 10。watertight = 0.0000。

完整生成命令 118.63 s,CPU RSS 峰值 24.26 GiB,外部 GPU 峰值 8.20 GiB。

同 case geometry gate:不通过。虽然输出无生成失败且尺度未灾难性偏移,但预注册 Gate D 要求 Chamfer 或 F@5 至少一项改善;两项均退化,edge topology 也未改善。因此不进入固定十例,不运行该 v4 checkpoint 的 100-case 协议,也不声称水密性提升。

decoder-aware watertight v5:几何监督与确定性水密重建

批准设计:v4 state safety did not improve same-case Chamfer, F@5, or edge topology。下一步采用 decoder-aware occupancy training plus deterministic o-voxel watertight remeshing,保留 v4 的 state anchor,同时把训练目标扩展到冻结 sparse-structure decoder 的 occupancy logits。

L = L_flow + L_state + BCE(occ) + Dice(occ) + surface-band + VGGT-point
raw mesh = TRELLIS.2 decode
watertight mesh = o-voxel narrow-band dual-contouring remesh

100-case 基线显示 TRELLIS.2 watertight/topology-valid = 0.00 / 0.00 / 0.00 / 0.00,而 TRELLIS target = 0.87 / 0.90 / 0.91 / 0.88、ReconViaGen target = 0.85 / 0.86 / 0.86 / 0.88。v5 的最终协议门槛不是单例变好,而是在 protocol 2/4/6/8 上同时超过 TRELLIS 与 ReconViaGen。

初始权重:state = 1.00,occ BCE / Dice / band / VGGT point weights = 0.25 / 0.50 / 0.25 / 0.05。GT occupancy 由相同冻结 decoder 从 GT sparse latent 解码,预测 occupancy 由二步 unroll 的 x0_hat 解码。

v5 one-step decoder-aware GPU smoke

完成 1 optimizer step;loss 13.903753,flow 0.162397,state 0.000234,decoder occ 13.741121。occ BCE / Dice / surface-band = 48.562469 / 0.512329 / 5.377357。

gradient norm 54.801418,final state ratio 0.001044,occupancy fraction 0.061253,CUDA reserved 18.91 GiB。checkpoint: experiments/nonorthogonal_gpt_orthoview/outputs/data_survey/vggt_spatial_adapter/decoder_aware_watertight_v5/training_smoke1/adapter_step_0001.pt

v5 one-step gate:通过。该结果只证明 decoder-aware 训练链路、冻结模块梯度隔离和 checkpoint 元数据可运行;仍需 100-step pilot 与 fixed three-case occupancy gate。

v5 100-step decoder-aware pilot

完成 100 / 100 个非零梯度 optimizer steps;loss 13.928650 → 4.190114,decoder occ 13.765808 → 3.801179,max final state ratio 0.071633。

occupancy fraction min / max = 0.000000 / 0.111225;CUDA reserved 23.89 GiB,外部 GPU 峰值 24.64 GiB。

v5 100-step pilot:不通过。Do not generate mesh until fixed three-case occupancy gate confirms no empty/full decoded occupancy; pilot had empty decoded occupancy at step 96 and near-empty at steps 57/96.

v5 fixed three-case occupancy gates

复测 checkpoints 25 / 50 / 100;state gate all passed = true,any occupancy gate passed = false,selected checkpoint = none。

checkpointgatestateoccupancy improved casescollapse casesmin Jaccard Δmin occupancy IoU Δ
step 25不通过通过occupancy improved cases 000.0000000.000000
step 50不通过通过occupancy improved cases 000.0000000.000000
step 100不通过通过occupancy improved cases 000.0000000.000000

v5 checkpoint gate:不通过。No v5 checkpoint passed the fixed three-case occupancy improvement gate; do not generate raw or watertight meshes.

门控顺序:objective TDD → one-step GPU smoke → 100-step pilot → fixed three-case state+occupancy gate → same-case raw/watertight geometry gate → fixed protocol-4 ten-case matrix → protocol-2/4/6/8 all100 evaluation。其中 same-case raw/watertight Gate E 必须同时评价 mesh_raw.objmesh_watertight.obj,要求水密输出 topology-valid 且 Chamfer/F@5 不发生不可接受退化。

v5 决策:v5 100-step pilot completed with finite gradients and state cap, but empty/near-empty decoded occupancy appeared during training. Do not generate meshes; run or strengthen fixed three-case occupancy gate before Gate E. 因此在 Gate E 通过前不运行十例或 100-case。

mesh repair v6:v2 α=0.25 hybrid mesh repair

v5 decoder-aware 训练没有产生 occupancy improvement 后,改为在已通过几何单例门的 v2 α=0.25 raw mesh 上执行确定性后处理。默认使用 PyMeshFix;对极端碎片化 mesh 使用 MeshLab screened Poisson + boundary fan-fill;对超大单连通 mesh 提高 PyMeshFix 预简化 target_faces。

protocol-4 ten-case mesh gate:通过。watertight/topology-valid 10 / 10;mean Chamfer 0.081932 vs baseline 0.081609;mean F@5 0.438803 vs baseline 0.433643。

casegateChamfer ↓F@5 ↑F@10 ↑topologyfacespreprocess
gso_000_input4通过0.066041 vs 0.0676420.497449 vs 0.4772480.768974watertight=1.0000; valid=1.0000; boundary/nonmanifold=0/02,734backend=pymeshfix; keep=None; target_faces=None; poisson_depth=None
gso_001_input4通过0.089577 vs 0.0906220.328850 vs 0.3206570.587303watertight=1.0000; valid=1.0000; boundary/nonmanifold=0/0449,604backend=pymeshfix; keep=None; target_faces=None; poisson_depth=None
gso_002_input4通过0.049776 vs 0.0535450.650318 vs 0.6001280.858309watertight=1.0000; valid=1.0000; boundary/nonmanifold=0/0234,960backend=pymeshfix; keep=1; target_faces=100000; poisson_depth=None
gso_003_input4通过0.040599 vs 0.0406520.706689 vs 0.7107780.997048watertight=1.0000; valid=1.0000; boundary/nonmanifold=0/0295,076backend=pymeshfix; keep=1; target_faces=300000; poisson_depth=None
gso_004_input4通过0.107434 vs 0.1078430.222504 vs 0.2193370.441418watertight=1.0000; valid=1.0000; boundary/nonmanifold=0/0100,120backend=pymeshfix; keep=1; target_faces=100000; poisson_depth=None
gso_005_input4通过0.069330 vs 0.0681380.341970 vs 0.3499060.680455watertight=1.0000; valid=1.0000; boundary/nonmanifold=0/0328,064backend=pymeshfix; keep=None; target_faces=None; poisson_depth=None
gso_006_input4通过0.073083 vs 0.0716450.487258 vs 0.4669010.685385watertight=1.0000; valid=1.0000; boundary/nonmanifold=0/01,832,108backend=pymeshlab_poisson_fill; keep=None; target_faces=None; poisson_depth=9
gso_007_input4通过0.156216 vs 0.1534090.166991 vs 0.1858040.358187watertight=1.0000; valid=1.0000; boundary/nonmanifold=0/0278,432backend=pymeshfix; keep=None; target_faces=None; poisson_depth=None
gso_008_input4通过0.135412 vs 0.1306770.191150 vs 0.2079060.376619watertight=1.0000; valid=1.0000; boundary/nonmanifold=0/0827,994backend=pymeshfix; keep=None; target_faces=None; poisson_depth=None
gso_009_input4通过0.031856 vs 0.0319180.794851 vs 0.7977681.000000watertight=1.0000; valid=1.0000; boundary/nonmanifold=0/083,166backend=pymeshfix; keep=1; target_faces=100000; poisson_depth=None

v6 结论:这已经生成了固定 protocol-4 十例上 topology-valid 且几何不退化的 watertight mesh;下一步才有资格扩大到 protocol-2/4/6/8 的 100-case 统计。

失败与修复记录

当前结论:Task 6 adapter inference 已完成端到端单例验证、uniform 对照和 checkpoint sparse-only 扫描。失败根因已缩小为 condition-level mean 破坏 multidiffusion baseline;16→4 VGGT context mismatch 是次要分布风险,但不是本次 occupancy 爆炸主因。下一步重新设计为 baseline-preserving 的逐视图 residual 融合;在 zero-gate token count 精确等于 uniform 前不恢复训练或 10-case 矩阵。尚未开始 512-object 正式训练、watertight extraction 或完整四协议评估。

5 个 case 可视化

gso_000_input4

4 张随机非正交输入
gso_000_input4 nonorthogonal view 0gso_000_input4 nonorthogonal view 1gso_000_input4 nonorthogonal view 2gso_000_input4 nonorthogonal view 3
4 张 canonical 正交输入
gso_000_input4 orthogonal view 0gso_000_input4 orthogonal view 1gso_000_input4 orthogonal view 2gso_000_input4 orthogonal view 3

TRELLIS stochastic · identity

mesh

TRELLIS stochastic · reverse

mesh

TRELLIS multidiffusion · 非正交

mesh

TRELLIS multidiffusion · 正交

mesh

TRELLIS.2 stochastic · identity

mesh

TRELLIS.2 stochastic · reverse

mesh

TRELLIS.2 multidiffusion · 非正交

mesh

TRELLIS.2 multidiffusion · 正交

mesh

gso_001_input4

4 张随机非正交输入
gso_001_input4 nonorthogonal view 0gso_001_input4 nonorthogonal view 1gso_001_input4 nonorthogonal view 2gso_001_input4 nonorthogonal view 3
4 张 canonical 正交输入
gso_001_input4 orthogonal view 0gso_001_input4 orthogonal view 1gso_001_input4 orthogonal view 2gso_001_input4 orthogonal view 3

TRELLIS stochastic · identity

mesh

TRELLIS stochastic · reverse

mesh

TRELLIS multidiffusion · 非正交

mesh

TRELLIS multidiffusion · 正交

mesh

TRELLIS.2 stochastic · identity

mesh

TRELLIS.2 stochastic · reverse

mesh

TRELLIS.2 multidiffusion · 非正交

mesh

TRELLIS.2 multidiffusion · 正交

mesh

gso_002_input4

4 张随机非正交输入
gso_002_input4 nonorthogonal view 0gso_002_input4 nonorthogonal view 1gso_002_input4 nonorthogonal view 2gso_002_input4 nonorthogonal view 3
4 张 canonical 正交输入
gso_002_input4 orthogonal view 0gso_002_input4 orthogonal view 1gso_002_input4 orthogonal view 2gso_002_input4 orthogonal view 3

TRELLIS stochastic · identity

mesh

TRELLIS stochastic · reverse

mesh

TRELLIS multidiffusion · 非正交

mesh

TRELLIS multidiffusion · 正交

mesh

TRELLIS.2 stochastic · identity

mesh

TRELLIS.2 stochastic · reverse

mesh

TRELLIS.2 multidiffusion · 非正交

mesh

TRELLIS.2 multidiffusion · 正交

mesh

gso_003_input4

4 张随机非正交输入
gso_003_input4 nonorthogonal view 0gso_003_input4 nonorthogonal view 1gso_003_input4 nonorthogonal view 2gso_003_input4 nonorthogonal view 3
4 张 canonical 正交输入
gso_003_input4 orthogonal view 0gso_003_input4 orthogonal view 1gso_003_input4 orthogonal view 2gso_003_input4 orthogonal view 3

TRELLIS stochastic · identity

mesh

TRELLIS stochastic · reverse

mesh

TRELLIS multidiffusion · 非正交

mesh

TRELLIS multidiffusion · 正交

mesh

TRELLIS.2 stochastic · identity

mesh

TRELLIS.2 stochastic · reverse

mesh

TRELLIS.2 multidiffusion · 非正交

mesh

TRELLIS.2 multidiffusion · 正交

mesh

gso_004_input4

4 张随机非正交输入
gso_004_input4 nonorthogonal view 0gso_004_input4 nonorthogonal view 1gso_004_input4 nonorthogonal view 2gso_004_input4 nonorthogonal view 3
4 张 canonical 正交输入
gso_004_input4 orthogonal view 0gso_004_input4 orthogonal view 1gso_004_input4 orthogonal view 2gso_004_input4 orthogonal view 3

TRELLIS stochastic · identity

mesh

TRELLIS stochastic · reverse

mesh

TRELLIS multidiffusion · 非正交

mesh

TRELLIS multidiffusion · 正交

mesh

TRELLIS.2 stochastic · identity

mesh

TRELLIS.2 stochastic · reverse

mesh

TRELLIS.2 multidiffusion · 非正交

mesh

TRELLIS.2 multidiffusion · 正交

mesh

限制