8
重点调研方法
100
已构建 benchmark 对象数
2/4/6/8
输入视角数量协议
20
每物体 held-out 评估视角
核心结论
现有论文的公开评测协议并不统一。单图到 3D 方法多用 GSO/OmniObject3D,强调单张输入和 orbit/benchmark 渲染;更贴近本课题的多非正交输入方法开始转向 GSO、Toys4K、Dora-bench、OmniObject3D,并报告 2/4/6/8 输入视角消融。可复现性最大的缺口是:很多论文公开了数据集和代码,但没有公开 exact object ids、camera json、渲染脚本和对齐细节。因此当前最稳的路线是用已下载的 GSO + Toys4K 自建固定 seed 的非正交视角评测集。
指标说明
| 指标 | 衡量内容 | 为什么对本课题有价值 |
|---|---|---|
| PSNR / SSIM / LPIPS | 预测 mesh 从测试视角渲染后,与 GT render 的像素、结构、感知相似度。 | 验证生成 mesh 是否能解释未见视角,避免只看输入视角过拟合。 |
| CLIP / DreamSim | 渲染图与 GT 图的语义或感知距离。 | 对纹理重绘、颜色偏差更宽容,可补充 PSNR 的局限。 |
| Chamfer Distance | 预测 mesh 和 GT mesh 表面采样点之间的双向距离。 | 直接衡量几何精度,是 mesh 重建的主指标之一。 |
| F-score | 给定距离阈值下 precision/recall 的调和平均。 | 比 CD 更能反映结构完整性,尤其适合比较缺面/多余面。 |
| Normal Consistency / Normal-map PSNR | 表面法线方向或法线渲染图的一致性。 | 能发现表面粗糙、局部凹凸错误和过度平滑。 |
| Face count / failure rate | mesh 面片数、是否生成失败或不可加载。 | 评估工程可用性。TRELLIS.2 这类方法 raw mesh 面片数较高,必须报告简化前后结果。 |
| ATE / RPE / AbsRel / RMSE | 相机位姿和深度预测误差。 | 对无位姿多视角方法有价值,可解释 mesh 好坏来自 pose 估计还是生成先验。 |
论文评测协议对比
| 方法 | 输入设置 | 输出 | 训练数据/流程 | 测试集与规模 | 评估视角 | 指标 | 代码/数据/视角开放性 | 对本课题启发 |
|---|---|---|---|---|---|---|---|---|
| UniRecGen (2026) | 任意数量 unposed sparse views;论文图示和消融重点是 4 views,并报告 2/4/6/8。 | mesh;VGGT 几何锚点 + Hunyuan3D-Omni 生成先验。 | 先训练/适配重建模块获得 canonical geometry anchor,再训练受控 3D generator。论文明确用 VGGT、Hunyuan3D-Omni 作为模块。 | GSO + Toys4K;表中报告几何、pose、depth 指标。具体 object id 和 camera 文件未在论文正文中完整列出。 | 多视角输入;附录示例为 4 输入视角;评估视角协议未完全公开。 | CD、Precision、Recall、F-score、Normal、IoU;ATE/RPE;AbsRel/RMSE。 | 代码仓库公开数据集公开exact views 待核实 | 最接近我们的任务:非正交、无位姿、多输入、mesh 输出。它也把 TRELLIS-S/TRELLIS-M 作为 baseline。 |
| ReconViaGen (2025) | 任意数量多视角输入;重点是 arbitrary camera poses。 | mesh;将 VGGT 重建先验与 TRELLIS 生成先验结合。 | 本地代码含 `train_ss.py`、`train_slat.py`;数据目录为 ProObjaverse-300K,训练 SS Flow 与 SLat Flow。 | Dora-bench + OmniObject3D;表中比较 VGGT、TRELLIS-S/M、Hunyuan3D-2.0-mv、LGM、InstantMesh、LucidFusion。 | 论文在 Dora-bench 上报告 2/4/6/8 输入消融;评估视角依赖 benchmark 渲染。 | PSNR、SSIM、LPIPS、CD、F-score;pose 评估用 RRE/TE。 | 本地代码已有Dora-bench 已下载OmniObject3D 未完整 | 给出了我们应采用的主指标组合,并证明输入视角数增加通常提升质量但收益递减。 |
| InstantMesh (2024) | 单图输入,先生成 sparse views,再用 LRM 重建。 | mesh 或 NeRF variant。 | 官方仓库公开 inference/training code,但不提供完整训练数据;使用 Zero123++ 生成多视图、LRM/Instant3D 架构训练 sparse-view reconstruction。 | GSO 300 objects;OmniObject3D 28 common categories 共约 130 objects。 | 每物体 orbit 21 views;Omni3D 额外随机选 16 benchmark views。 | PSNR、SSIM、LPIPS、CD、F-score。 | 代码公开数据集公开object split/渲染细节需复现 | 提供单图 baseline 的严谨评测模板:GSO + OmniObject3D、orbit views、image + geometry 双指标。 |
| Unique3D (2024) | 单图输入,生成 4 个正交 RGB/normal views。 | 直接 mesh;ISOMER mesh reconstruction。 | Objaverse 子集训练 multi-view diffusion 和 normal diffusion;四正交视图 + 法线 + coarse-to-fine mesh 优化。 | GSO 随机 30 objects。 | 输入 frontal view;评估为多 elevation、360-degree azimuth renders。 | PSNR、SSIM、LPIPS、CLIP-Sim、CD、Volume IoU、F-score;另有用户研究。 | 代码公开GSO 公开30 objects/views 未完全标准化公开 | 正交视图转换路线的代表。对我们的 GPT 正交化分支有参考,但它本身不是任意非正交输入重建。 |
| CRM (2024) | 单图输入,扩展为 6 个正交/环绕视图。 | textured mesh。 | 多视图 diffusion + convolutional reconstruction model;依赖六视图空间对齐。 | GSO 随机 30 shapes,GSO 不在训练集内。 | 输入单图;纹理评估渲染 24 images,3 个 elevation、每个 elevation 8 azimuth。 | CD、Volume IoU、F-score;PSNR、SSIM、LPIPS、CLIP-Sim。 | 代码公开GSO 公开评测 split 需复现 | 说明正交视图 pipeline 很依赖视图对齐;非正交输入如果直接塞进去会出现空间假设不匹配。 |
| TripoSR (2024) | 单图输入。 | mesh from implicit representation。 | 大规模 3D 数据训练 feed-forward reconstruction;论文更强调速度和几何指标。 | GSO + OmniObject3D,各约 300 manually filtered objects。 | 主要报告 3D shape metrics;视角协议和 object ids 不完全公开。 | CD、F-score@0.1/0.2/0.5;10K surface samples。 | 代码/权重公开数据集公开exact split 待复现 | 适合作为快速单图几何 baseline,不适合作为多非正交输入主方法。 |
| SF3D (2024/2025) | 单图输入;显式输出 UV-unwrapped textured mesh、材质参数和 normal map。 | 低面数 textured mesh / GLB。 | 基于 TripoSR,先做 NeRF 预训练,再切到 differentiable mesh rendering;训练损失包含 MSE、LPIPS、mask、mesh regularization 和 shading regularization。 | GSO 278 个随机 scenes;OmniObject3D 308 个 scenes。 | 每物体渲染 16 views,选择 frontal view 作为 conditioning view;预测 mesh 与 GT 统一 normalize、旋转 brute-force alignment、ICP 后评估。 | CD、F-score@0.1/0.2/0.5、runtime;supplement 中有 indicative rendering metrics。 | 代码公开模型 gated HFexact random scenes/cameras 未在论文表中完整公开 | 提供了一个很实用的评价范式:mesh 先对齐再算 CD/F-score,同时报告面片数和耗时。对我们报告 raw/simplified mesh 很有参考价值。 |
| SPAR3D (2025) | 单图输入;先生成 sparse point cloud,再由 image + point cloud 输出 mesh。 | 带 PBR material 的 mesh;支持编辑 point cloud 改 unseen surface。 | point diffusion stage + meshing stage;meshing 使用 rendering loss,并估计 geometry、albedo、lighting、normal、metallic/roughness。 | GSO + OmniObject3D;跟随 TripoSR 过滤掉简单盒状/柱状物体,每个 eval set 约 250 objects。 | 渲染多样 azimuth/elevation,随机 HDRI,变化焦距;论文未给 exact object ids 和 camera JSON。 | CD、F-score@0.1/0.2/0.5、PSNR、SSIM、LPIPS、runtime;同样做 normalize、rotation search、ICP。 | 代码公开模型 gated HFexact views 未公开 | 对本课题的启发是“回归模型守输入可见面,生成/点云先验补不可见面”。多非正交输入可以类比为用真实多视图约束替代 hallucinated point prior。 |
| Hi3DGen (2025) | 单图输入;用 normal map 作为 image-to-3D 的中间 bridge。 | 高细节 geometry mesh。 | NiRNE image-to-normal + NoRLD normal-to-geometry;训练数据包括 170K cleaned Objaverse 和 700K synthesized DetailVerse,每个 asset 渲染 40 images。 | normal estimator 在 LUCES-MV 上评估;3D 生成主要用 Hyper3D/Hunyuan/Dora project page 图像做视觉比较和 user study。 | normal-to-geometry 用 22 个 viewpoints 渲染 normal map 计算 NE/SNE;用户研究采样 3006 generations 中的结果。 | NE、SNE;user study;与 Hunyuan3D-2.0、Trellis、CraftsMan、Dora、Clay、Tripo-2.5 对比。 | 代码公开DetailVerse 承诺/部分状态需持续跟踪exact eval views 不适合作为严格 GT benchmark | 训练数据路线非常重要:高细节合成 mesh + normal supervision 能补 Objaverse 的细节稀缺。后续若训练 TRELLIS.2-like 模型,可以优先考虑 normal/depth auxiliary supervision。 |
| TRELLIS (2024/2025) | text/image 到 3D;单图为主,也可通过多图条件改造。 | Structured latent,解码为 mesh/3DGS/RF 等。 | 约 500K 高质量 3D assets:ObjaverseXL Sketchfab/GitHub、ABO、3D-FUTURE、HSSD;150 renders/asset,GPT-4o captions,美学过滤。 | Toys4K 为重要 evaluation set;过滤后 3229 assets,重建实验随机 500,生成实验 Toys4K 1250。 | 重建评估单随机 camera;geometry 通过 100 depth views unproject 点云;生成评估 4 yaw views。 | PSNR、LPIPS、CD、F-score、normal-map PSNR/LPIPS、FD/KD/CLIP。 | 代码公开训练数据配方公开但完整过滤清单未必公开 | 我们当前实验基础。Toys4K 是它自己用于泛化评估的重要集合,适合纳入本课题 benchmark。 |
| Hunyuan3D-2.0 / Hunyuan3D-MV | 单图/多视角生成,部分版本支持多视图控制。 | 高分辨率 mesh。 | 大规模 3D 资产和多模态条件训练,公开模型侧重推理。 | 在 ReconViaGen、UniRecGen 中作为 baseline 出现在 Dora/GSO/Toys4K/OmniObject3D 评估。 | 跟随各论文 benchmark。 | PSNR/SSIM/LPIPS、CD/F-score、Normal/IoU。 | 模型/代码部分公开训练数据与 exact eval views 不完整 | 可作为强生成先验 baseline,但公平评估需要固定输入视角和同一渲染器。 |
评测可复现性矩阵
| 方法/协议 | 测试数据是否开源 | 代码/模型是否开源 | 评测代码 | exact object ids / camera views | 本课题处理方式 |
|---|---|---|---|---|---|
| SF3D | GSO、OmniObject3D 公开 | GitHub 公开;模型 gated HuggingFace | 官方 repo 主要是 inference/demo,未看到完整 paper eval split | 论文给 278/308 数量和 16 views,但未给 exact ids/cameras | 借鉴 16-view + alignment + CD/F-score 协议;暂不直接作为主评测。 |
| SPAR3D | GSO、OmniObject3D 公开 | GitHub 公开;模型 gated HuggingFace | 官方 repo 主要是 inference/demo,论文称所有 baseline 用官方实现 | 约 250 objects/set,多样视角策略公开,exact ids/cameras 未公开 | 借鉴多样 azimuth/elevation/HDRI/focal 的测试视角设计。 |
| ReconViaGen | Dora-bench、OmniObject3D 公开/可下载;本地 Dora 已下载 | 本地已有代码和训练脚本 | 论文指标明确,本地已复用其 runner 思路 | Dora JSON 可解析;Omni 当前下载不完整 | 已在自建 GSO/Toys4K benchmark 上跑 ReconViaGen 5-case 几何评估。 |
| UniRecGen | GSO、Toys4K 公开,本地均已下载 | 仓库公开 | 论文指标充分,但 exact split/camera 文件仍需继续追 repo | 报告 2/4/6/8 输入消融,但 exact views 未在论文正文完整列出 | 本课题已经按 2/4/6/8 非正交输入 + 20 held-out eval 自建协议。 |
| 本地 benchmark v0 | GSO + Toys4K 均本地可访问 | 渲染、manifest、eval 脚本在本项目目录 | 完整可运行 | 100 objects、全部 camera views 写入 manifest | 作为当前主评测集;已完成 4000/4000 GT renders。 |
本机数据集状态
本节的可追溯统计已写入 local_dataset_stats.json,包括本地路径、大小、对象数量、类别数量、benchmark 采样分布和渲染完成状态。
| 数据集 | 路径 | 规模/状态 | 类型 | GT Mesh | 相机/视角 | 当前用途 |
|---|---|---|---|---|---|---|
| GSO / Google Scanned Objects | /data/jiachen/GSO/google_scanned_objects.zip | 24G zip;zip 内 1030 个 model.obj。 | 真实扫描日用品、玩具、鞋、电子产品等。 | 有 OBJ + texture。 | 官方 train/test split 有;本课题需自渲染相机 | 立即用于 50-object GT geometry + held-out render benchmark。 |
| Toys4K | /data/jiachen/Toys4K | 20G;mesh mirror 中 106 类、3855 个对象目录、3854 个 mesh 文件;官方 tar 3.6G。 | 玩具/小物体,类别均衡,适合泛化测试。 | 有 PLY mesh。 | 无统一官方相机;需要自渲染 | 立即用于 50-object GT benchmark;也可复现 TRELLIS/UniRecGen 风格评估。 |
| Dora-bench-256 | /home/jiachen/datasets/Dora-bench-256 | 63G;Level_all.json 共 3202 条,Level1/2/3/4 各约 800 条。 | 面向 sharp/complex 3D assets 的 benchmark。 | 需按 JSON 路径核验 mesh 可访问性 | benchmark JSON 可用;渲染协议需进一步解析 | 用于对齐 ReconViaGen 论文评测,但先不作为第一批 100-object 主集。 |
| ProObjaverse-300K / ReconViaGen | /home/jiachen/ReconViaGen/data/ProObjaverse-300K | 84G;141181 本地文件;日志接近 19306/19307。 | Objaverse 派生训练数据,含 renders_random_env、lh-slats、envs。 | 主要是训练渲染/latent;不等同完整 GT mesh benchmark | 已有随机环境渲染数据 | 用于训练/微调 ReconViaGen/TRELLIS-style 模块,不作为几何 GT 主评测集。 |
| OmniObject3D-New | /data/jiachen/OmniObject3D-New | 364G;下载中断在 OpenXLab/Aliyun 405,约 345/1496 文件。 | 大规模真实感对象,多类别。 | 理论有 | 理论含 benchmark/random views | 暂时放一边;完整后可补充 100-300 object benchmark。 |
数据集多维度对比
| 数据集 | 本地大小 | 数量维度 | 物体类型 | 训练价值 | 评测价值 | 当前风险 |
|---|---|---|---|---|---|---|
| GSO | 24G | 1030 OBJ meshes;benchmark v0 选 50 个 | 真实扫描日用品/商品,纹理丰富,形状中等复杂 | 不建议训练主模型,适合保留 held-out | GT mesh 明确,适合 CD/F-score 和 novel-view render 指标 | 官方 exact camera split 与很多论文不完全一致,需要自建固定 camera manifest |
| Toys4K | 20G | 106 类,约 3855 对象目录;benchmark v0 选 50 个 | 玩具/小物体,类别覆盖广,许多细长结构 | 不建议用于训练当前 benchmark 主模型 | TRELLIS/UniRecGen/SPAR3D 等论文相关,泛化评估价值高 | 少数 PLY 对 Blender importer 不友好,已加 trimesh 转 OBJ 兜底 |
| Dora-bench-256 | 63G | Level_all 约 3202 条,Level1-4 各约 800 | 复杂/困难 3D assets,适合 stress test | 不作为训练集,避免污染 benchmark | ReconViaGen 相关,适合第二阶段困难样本评估 | 需要继续解析 Level JSON 的 mesh/render/camera 关系,才能严格复现论文协议 |
| ProObjaverse-300K | 84G | 本地约 14.1 万文件,含 renders_random_env、lh-slats、envs | Objaverse 派生训练渲染与 latent 数据 | 当前最适合作为多视角非正交模型训练/微调来源 | 不适合作为几何 GT 主评测,因为当前更像训练数据包 | 需要整理 object-level index、相机参数、latent 对齐关系后才能大规模训练 |
| OmniObject3D-New | 364G partial | 当前部分下载;完整规模待恢复下载后确认 | 真实感多类别对象,很多论文使用或引用 | 完整后可作为训练/评测补充 | 可对齐 InstantMesh/TripoSR/SF3D/SPAR3D 等论文 | 下载被 OpenXLab/Aliyun 405 中断;按你的要求当前先放一边 |
当前已准备的评测集
输入视角协议
每个对象生成 2、4、6、8 四档输入视角。相机是非正交的 turntable-like 随机视角:azimuth 均匀覆盖但有扰动,elevation 在 -18 到 28 度之间随机,FOV 45。
评估视角协议
每个对象 20 个 held-out 非正交视角,独立随机生成。生成 mesh 后统一从这些视角渲染 RGB、normal、mask/depth,再和 GT render 比较。
渲染入口已准备:/home/jiachen/TRELLIS/experiments/nonorthogonal_gpt_orthoview/render_benchmark_views.py。
已用 Blender 4.0.2 smoke test 通过 GSO 与 Toys4K 各 1 个对象的 2-view RGB 渲染,输出在
../data_survey/rendered_benchmark_v0/。为兼容 Blender 4,已给 TRELLIS 官方 renderer 补了 OBJ/PLY importer 的新旧 API 兼容。
512 分辨率全量渲染已在后台启动,PID 记录在
../data_survey/logs/render_benchmark_v0_512.pid,日志在
../data_survey/logs/render_benchmark_v0_512.log,当前进度 JSON 为
render_status.json。截至本页最后更新,100/100 个对象完整,4000/4000 帧完成;GSO 50/50 已完整,Toys4K 50/50 已完整。
Toys4K 中少数 PLY 在 Blender 4 importer 下会报 face size 异常,已在渲染脚本里加入 trimesh 读取并缓存为 OBJ 的兜底转换;补跑时脚本自动跳过 99 个已完成对象,只重渲染异常对象 toys4k_015 / chicken_012。
1. GT meshGSO OBJ + Toys4K PLY,统一归一化到单位包围球。
2. Render views按 manifest 渲染 2/4/6/8 输入视角和 20 测试视角。
3. Run methodsTRELLIS、TRELLIS.2、ReconViaGen、GPT orthoview + TRELLIS 分支。
4. EvaluateRGB/normal/depth render metrics + mesh geometry metrics。
5. Report按 dataset、view count、method、mesh simplification 分组展示。
训练数据建议
| 用途 | 推荐数据 | 理由 | 暂不推荐 |
|---|---|---|---|
| 快速方法验证 / baseline 对比 | GSO + Toys4K 100-object manifest | 有 GT mesh,已落盘,能马上做几何与 novel-view 指标。 | 直接用 ProObjaverse 评估几何,因为它当前更像训练渲染/latent 数据。 |
| 微调多视角非正交输入模型 | ProObjaverse-300K 的 renders_random_env + lh-slats | 与 ReconViaGen/TRELLIS latent 结构接近,训练脚本已在本地。 | 用 GSO/Toys4K 训练主模型,因为它们更适合保留为 held-out benchmark。 |
| 后续扩展评估 | OmniObject3D-New 完整下载后加入 | InstantMesh/TripoSR/ReconViaGen 都用它或类似协议,利于和论文对齐。 | 现在依赖它出结论,因为当前下载不完整且有 405 阻断。 |
| 困难样本评估 | Dora-bench-256 | ReconViaGen 使用 Dora-bench 证明 sparse-view 重建性能;可作为第二阶段 benchmark。 | 未解析 JSON 前直接混入主评测,会降低协议清晰度。 |
我给本课题准备的数据划分
| 用途 | 数据来源 | 规模 | 视角设置 | 文件入口 | 为什么这样安排 |
|---|---|---|---|---|---|
| 主评测集 v0 | GSO 50 + Toys4K 50 | 100 objects;4000 GT renders | 输入为 2/4/6/8 张随机非正交视角;测试为每物体 20 张 held-out 非正交视角 | benchmark_manifest_v0.json · render_status.json | 有 GT mesh、可公开复现、和近期论文常用数据集重叠,避免依赖未公开 exact views。 |
| 训练/微调候选集 | ProObjaverse-300K / ReconViaGen 数据 | 84G 本地数据,含多视角渲染和 latent | 使用现有 renders_random_env 作为非正交输入来源,lh-slats/envs 作为 TRELLIS-style supervision | /home/jiachen/ReconViaGen/data/ProObjaverse-300K | 和 TRELLIS/ReconViaGen latent 体系最近,训练成本最低;GSO/Toys4K 保留做测试,避免数据泄漏。 |
| 第二阶段困难评测 | Dora-bench-256 | Level_all 约 3202 条 | 待解析官方 JSON 后按 2/4/6/8 输入和 20 测试视角适配 | /home/jiachen/datasets/Dora-bench-256 | 贴近 ReconViaGen 论文设置,适合检查方法在复杂形状上的上限和失败模式。 |
下一步可执行实验
- 继续扩展方法评测:当前已完成 GSO 上 TRELLIS/TRELLIS.2/ReconViaGen 小规模对比,以及 Toys4K 上 TRELLIS 2-view/4-view 对比。
- 对新增方法结果继续保存 raw mesh、1/3 simplified mesh、20-view render、指标 JSON,保证每个数字都能追溯到文件。
- 全量 100-object 渲染完成后,把 10-object smoke 扩到 100-object 主表,并按 dataset、view count、method、simplified/raw 分组报告。
- 优先补 TRELLIS.2 和 ReconViaGen 在 Toys4K 上的 protocol-2/4 结果,检查多视角收益是否跨方法一致。
已遇到的问题与解决
| 问题 | 影响 | 解决方法 | 验证结果 |
|---|---|---|---|
| Toys4K 少数 PLY 在 Blender 4 importer 中失败 | toys4k_015 / chicken_012 五组视角初次只写出日志,没有 PNG。 | 在 render_benchmark_views.py 里增加 trimesh 兜底:先读取 PLY,再导出为缓存 OBJ,交给 Blender 渲染。 | 用 conda run -n trellis 补跑后,该对象 2/4/6/8/eval 全部成功;最终 render_status.json 为 100/100、4000/4000。 |
| Blender 4 导入 API 与旧 TRELLIS renderer 不兼容 | 官方脚本里旧的 OBJ/PLY import operator 在新版 Blender 下不可用。 | 给 dataset_toolkits/blender_script/render.py 增加新旧 API fallback:优先使用 bpy.ops.wm.obj_import/ply_import,失败再回退旧 API。 | GSO 50 个和 Toys4K 50 个对象全部 512 分辨率渲染完成。 |
现有方法接入状态
| 环节 | 当前状态 | 文件 |
|---|---|---|
| benchmark -> method manifest | 已支持把 rendered benchmark 转成原 ProObjaverse runner 兼容的 prepared_cases.json 格式,可按 2/4/6/8 输入视角分别导出。 | build_benchmark_method_manifest.py ../data_survey/method_manifests/prepared_cases_protocol2_limit1.json |
| TRELLIS smoke | 已在 GSO 第 1 个对象、2 个非正交输入视角上跑通,成功导出 raw OBJ mesh。 | ../data_survey/method_smoke/trellis_protocol2_limit1/gso_000_input2/mesh_raw.obj |
| geometry eval smoke | 已对 TRELLIS smoke mesh 与 GT mesh 计算 20k 表面采样 Chamfer/F-score。该 case 的 Chamfer mean 为 0.1478,F-score@10% bbox 为 0.2526。这个数只用于验证链路,不代表最终平均性能。 | geometry_eval.json |
| GSO protocol-2 小规模实测 | 已完成 TRELLIS 10 cases、TRELLIS.2 5 cases、ReconViaGen 5 cases。三方法同前 5 个 GSO case 对比:TRELLIS Chamfer 0.0760 / F@10 0.6811 / 69.8 万 faces;TRELLIS.2 Chamfer 0.0629 / F@10 0.7754 / 210.1 万 faces;ReconViaGen Chamfer 0.0623 / F@10 0.7999 / 92.9 万 faces。 | three-method comparison |
| TRELLIS 2-view vs 4-view | 同 10 个 GSO case 上,4 个非正交输入视角明显优于 2 个输入视角:Chamfer 从 0.0842 降到 0.0662,F@10 从 0.6685 升到 0.7350,平均面片数从 50.95 万降到 38.32 万。 | 2v4 comparison |
| 1/3 simplified mesh | 已对 TRELLIS.2 和 ReconViaGen 的 raw mesh 做 1/3 faces 简化并重算几何指标。TRELLIS.2 简化后平均 faces 从 210.1 万降到 70.0 万,F@10 基本不变 0.7754;ReconViaGen 简化后从 92.9 万降到 31.0 万,F@10 基本不变 0.7993。 | TRELLIS.2 simplified · ReconViaGen simplified |
| Toys4K protocol-2 小规模实测 | 已完成 TRELLIS 10 cases。平均 Chamfer 0.0442、F@10 0.8554、平均 faces 26.4 万;中位 Chamfer 0.0209、F@10 0.9971,说明大多数 case 很好,均值主要被少数困难对象拉低。 | Toys4K protocol-2 aggregate |
| Toys4K 2-view vs 4-view | 同 10 个 Toys4K case 上,4 个非正交输入视角显著优于 2 个输入视角:Chamfer 从 0.0442 降到 0.0208,F@10 从 0.8554 升到 0.9631,平均面片数只从 26.4 万小幅升到 27.2 万。 | Toys4K 2v4 comparison |
| 方法 | 对象/输入 | Chamfer mean↓ | F-score@5%↑ | F-score@10%↑ | 平均面片数 | 结果文件 |
|---|---|---|---|---|---|---|
| TRELLIS | GSO 前 5,2 非正交视角 | 0.0760 | 0.5194 | 0.6811 | 698,317 | comparison |
| TRELLIS.2 | 同前 5,2 非正交视角 | 0.0629 | 0.5495 | 0.7754 | 2,101,288 | comparison |
| ReconViaGen | 同前 5,2 非正交视角 | 0.0623 | 0.5156 | 0.7999 | 928,658 | comparison |
| TRELLIS | GSO 前 10,4 非正交视角 | 0.0662 | 0.5308 | 0.7350 | 383,213 | aggregate |
| TRELLIS | Toys4K 前 10,2 非正交视角 | 0.0442 | 0.7590 | 0.8554 | 264,050 | aggregate |
| TRELLIS | Toys4K 前 10,4 非正交视角 | 0.0208 | 0.9052 | 0.9631 | 271,909 | aggregate |
| TRELLIS.2 simplified 1/3 | GSO 前 5,2 非正交视角 | 0.0628 | 0.5489 | 0.7755 | 700,428 | aggregate |
| ReconViaGen simplified 1/3 | GSO 前 5,2 非正交视角 | 0.0622 | 0.5163 | 0.7993 | 309,552 | aggregate |
主要参考源
- UniRecGen: Unifying Multi-View 3D Reconstruction and Generation
- ReconViaGen: Towards Accurate Multi-view 3D Object Reconstruction via Generation
- InstantMesh: Efficient 3D Mesh Generation from a Single Image
- Unique3D: High-Quality and Efficient 3D Mesh Generation from a Single Image
- CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction Model
- TripoSR: Fast 3D Object Reconstruction from a Single Image
- Stable Fast 3D: Rapid 3D Asset Generation from Single Images、SF3D official repo
- SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single Images
- Hi3DGen: High-fidelity 3D Geometry Generation from Images via Normal Bridging
- TRELLIS: Structured 3D Latents for Scalable and Versatile 3D Generation
- InstantMesh official repo、TRELLIS official repo、UniRecGen repo