ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

单图生成可编辑3D场景!马里兰大学等提出LEGO-Anything

单图生成可编辑3D场景!马里兰大学等提出LEGO-Anything LEGO-Anything: Coding Agents for 3D Scene Reconstruction作者Xirui Li, Peng Shi, Mingwen Dong, Sheng Zhang, Zhuoyan Xu, Dongkyu Lee, Shuaichen Chang, Yi Xiang, Lin Pan, Jiarong Jiang核心发表机构University of Maryland, College Park、AWS论文链接arXiv:2609.36380v1发布于arXiv 预印本cs.CV|————————|GPT-6-astra Codex | 100.0±0.0 | 52.4±1.1 | 54.4±0.7 |53.4±0.8| 98.0±1.0 | 34.0±1.5 | 45.5±0.5 |39.6±0.8||GPT-6-sol Codex | 99.4±1.1 | 22.2±2.4 | 42.5±0.3 | 32.3±1.0 | 99.7±0.6 | 19.8±1.0 | 28.7±0.5 | 24.2±0.4 ||GPT-6-luna Codex | 99.7±0.5 | 15.8±1.2 | 30.5±0.3 | 23.2±0.7 | 99.7±0.6 | 13.2±0.6 | 21.4±0.5 | 17.3±0.5 ||GPT-5.6-sol Codex | 97.8±2.3 | 9.8±2.1 | 19.8±0.6 | 14.8±1.0 | 98.7±0.6 | 12.8±1.8 | 17.7±0.4 | 15.3±0.8 ||GPT-5.6-terra Codex | 99.7±0.5 | 9.5±1.0 | 21.3±0.5 | 15.4±0.6 | 98.0±1.7 | 8.1±0.7 | 15.0±0.9 | 11.5±0.4 ||GPT-5.6-luna Codex | 99.1±0.0 | 10.2±2.1 | 18.0±0.7 | 14.1±1.3 | 97.0±1.0 | 7.8±1.5 | 16.6±0.8 | 12.1±1.0 |基线结果如下其中 “–” 表示论文设置下未报告该 split。基线Indoor VIndoor RIndoor AIndoor SOutdoor VOutdoor ROutdoor AOutdoor SVIGA100.0±0.010.8±1.520.3±0.715.6±1.1100.0±0.08.0±0.417.1±0.012.6±0.2SceneConductor12.3±2.35.0±2.10.0±0.00.3±0.2––––3D-RE-GEN100.0±0.01.2±0.111.3±0.26.3±0.1––––Gen3DSR92.0±1.165.4±0.70.0±0.030.1±0.480.0±1.035.0±0.50.0±0.014.0±0.1REST3D77.5±13.07.2±0.70.0±0.02.8±0.4––––SceneGen71.6±3.09.7±1.80.0±0.03.4±0.538.7±1.52.6±1.10.0±0.00.5±0.2主要发现是所有六个 GPT 配置的 Validity 接近饱和但保真度差异很大总体分数从GPT-6-astra的 53.4%/39.6% 到最强GPT-5.6配置的 15.4%/15.3%。GPT-6-astra取得最佳总体分数超过 task-specific 与 single-image scene-construction 基线。Gen3DSR 的 Reconstruction 高于GPT-6-astra室内 65.4% vs. 52.4%但其 Appearance 无法评估0.0%。VIGA 和 3D-RE-GEN 能交付有效 artifact但保真度低。六个基线中有三个不支持 outdoor 场景而所有编码智能体都能在 indoor/outdoor 两个 split 上运行Validity 稳定尽管所有模型在 outdoor 上保真度下降。核心结论是编码智能体能够稳定交付有效 artifact但 artifact delivery 与忠实场景重建之间仍存在明显差距。成本–性能方面论文用标准化 token 成本代理作为横轴benchmark 全域、经 artifact 有效性门控的 Final 分数作为纵轴虚线连接非支配前沿。GPT-5.6-luna是绝对最便宜的点但质量–成本前沿的大部分由 GPT-6 家族定义GPT-6-luna相对最低成本区间显著提升GPT-6-sol以中等成本再添一档质量GPT-6-astra以显著更高花费达到最高分。GPT-5.6-sol与GPT-5.6-terra位于前沿之外。Bird’s-Eye 重建压力测试单独报告在非配对的 NYC Bird’s-Eye split 上每次完整运行含 10 个俯视视图 case该表报告三个 GPT-6 agent 的 artifact validity、Reconstruction F2%、Appearance 与有效性门控 Final 分数。Model HarnessV ↑R ↑A ↑S ↑GPT-5.6-solCodex93.3 ± 5.811.2 ± 7.924.3 ± 3.316.4 ± 3.6GPT-5.6-terraCodex86.7 ± 5.80.9 ± 1.323.0 ± 4.210.7 ± 2.8GPT-5.6-lunaCodex80.0 ± 10.07.6 ± 6.021.1 ± 2.911.4 ± 2.8GPT-6-astraCodex100.0 ± 0.024.0 ± 5.046.6 ± 0.335.3 ± 2.5GPT-6-solCodex100.0 ± 0.017.8 ± 2.640.0 ± 0.828.9 ± 1.0GPT-6-lunaCodex100.0 ± 0.06.7 ± 4.734.4 ± 0.720.0 ± 2.7结论是GPT-6-astra在 Bird’s-Eye 压力测试中最强GPT-6 家族显著优于 GPT-5.6 家族但所有模型在 artifact 交付与远更弱的严格几何重建F2%之间仍存在明显差距。LEGO-World 测试重建场景能否表示自然图像。实验用未启用 LEGO-Plugin 的GPT-6-astra在三条固定 100 图像轨迹上评测COCO val2017 检测、LVIS v1 验证集实例分割、ETH3D 相对深度。agent 先构建场景然后从冻结 artifact 读取任务预测。由于场景导出没有校准置信度box 和 mask AP 遵循 equal-confidence protocol即把每个预测实例的置信度统一设为 1.0并使用确定性并列顺序缺失的场景预测导出为“无检测”而不是丢弃该图像。结果如下方法Box APMask APAbsRelScene readoutsGPT-6-astra 重建30.114.80.155专用模型DINO: 59.9SAM 3: 54.0Depth Anything 3: 0.078场景 readouts 在三个任务上均达到非平凡性能检测达到专用模型 box AP 的约一半但远低于专用视觉模型。当前编码智能体通过程序构建的场景是自然图像的有前景但尚不够精确的表示。覆盖率方面COCO boxes 与 LVIS masks 各尝试 100 张图像有计分的场景输出为 94 张匹配诊断配对为 93 对ETH3D depth 尝试 100 张有计分场景输出 99 张匹配诊断配对 99 对。在相同的 99 张有效图像上归档直接法与场景式的 AbsRel 均值分别为 0.07845 与 0.15540。4.3 消融实验 / Ablation Study场景复杂度的影响。论文在 Easy/Medium/Hard 三档下报告 R 与 A对所有GPT-6与GPT-5.6配置平均。Indoor 的 R 从 23.3±0.1 降到 19.7±1.2 再到 18.8±0.4A 从 30.4±0.6 降到 27.9±0.6 再到 27.4±0.5Outdoor 的 R 从 18.4±0.9 降到 14.2±1.0 再到 12.7±1.0A 从 25.3±0.4 降到 22.8±0.9 再到 22.4±0.3。场景复杂度增加主要降低保真度而非可执行性Validity 在各 tier 稳定在 99.5%。总体分数从 Easy 的 24.6% 降到 Medium 的 21.3%再到 Hard 的 20.5%。下降最陡的是 outdoor Reconstruction18.4% → 12.7%。Outdoor 场景在每个复杂度层级都比 indoor 更难。更多推理是否改善场景重建。论文在固定的 42-case Office 子集上做 test-time scaling变化 harness-native reasoning effortLow、Medium、High、XHigh同时保持输入、prompts、执行预算和评分固定。三个GPT-6模型的 overall score 随 effort 上升astra从 32.3% 到 61.8%sol从 21.3% 到 39.7%luna从 14.4% 到 21.2%。增益随模型强度增大而增大astra在接近 XHigh 时饱和而sol继续改善。相比之下GPT-5.6模型显示出微弱或非单调变化。该 campaign 覆盖 6 模型 × 4 档 effort × 42 任务共 1,008 个结果全部用同一个冻结评估器与同一容器镜像重新打分图中区间是 42 个任务输入上均值的 pointwise 95% percentile bootstrap 区间10,000 次重采样它们不度量重复运行间的波动。新增的GPT-6-sol与GPT-6-luna扫描贡献 336 个结果其 High 结果专为该扫描生成提示禁用了主表 campaign 中使用的额外相机引导13 个 Luna 试验保留原生非零退出标志但 artifact 被成功重新打分这些结果保留在固定分母中。LEGO-Plugin 的消融与定性结果。插件在 42-case Office 子集上评估比较每个模型有/无插件保持相同输入、prompts、执行预算、reasoning effort 和 evaluator插件只看到参考图像和当前 Blender 场景从不看私有 ground truth 或 LEGO-Bench 分数。LEGO-Plugin 改善全部六个模型增益与基础性能负相关三个GPT-5.6模型相对改善 55%–63%约 7–8 个点GPT-6-luna相对改善 27.5%GPT-6-sol相对改善 12.1%GPT-6-astra仅 2.1%。摘要给出的最高相对增益为 62.7%。这一模式表明插件主要补偿较弱智能体表现出的初始化、回归和自评估失败最强智能体已经避免了其中大部分问题。定性例子方面Reception 场景中相对于三个GPT-5.6-solbase runs 的最佳结果LEGO-Plugin 更好匹配参考总体分数从 0.147 提升到 0.325。下面依次给出该例的参考图、base 结果与插件结果。Copy room 场景中总体分数从 0.109 提升到 0.278。下面依次给出该例的参考图、base 结果与插件结果。结论是LEGO-Plugin 无需训练即可改善每个模型对较弱智能体增益最大缩小了但与最强模型的差距仍未闭合。轨迹诊断。论文分析GPT-6-astra、GPT-5.6-sol、GPT-5.6-terra、GPT-5.6-luna的首次归档原生高推理努力运行每个 cohort 目标为 198 个 Indoor/Outdoor 任务排除 10 个 Bird’s-Eye 任务。合格 checkpoint 需有合法 Blender 场景、几何导出以及 Reconstruction 与 Appearance 两个分数checkpoint 质量Q ( R A ) / 2 Q(RA)/2Q(RA)/2离线计算且从不暴露给 actor。下图汇总共同任务交集上的首场景时间、轨迹回归与最终 regret。GPT-6-astra在绝对墙钟时间上更晚到达首个可评测场景但相对自身运行时长更早且具有最低的回归率与最好的 best-to-final regret。四个模型的构建过程都是非单调的因此最终提交应被解读为轨迹端点而非有保证的最优状态。此前分析还显示GPT-5.6-sol常停滞或下降29.6% 的编辑降低分数最终提交比最佳中间场景低 3.2 分这些回归来自后续编辑破坏几何、相机设置或之前更强的场景。编码智能体能否判断自己的场景。论文用 VLM judge 测试方法给定同一 case 的两张渲染图judge model 选择更好的一张测量其与确定性 LEGO-Bench 指标方向的一致性chance 50%。在六个模型的全部 36 个 builder–judge 对中self-judgments 在 Reconstruction 上一致率为 45.8%Appearance 上为 62.2%cross-model judgments 在 Reconstruction 上为 45.4%Appearance 上为 63.9%。在几何上judge 接近或低于 chanceself-judging 优于其他五个 judge 的均值仅出现在 3/6 buildersReconstruction和 2/6 buildersAppearance。VLM judge 设置中比较共含 360 个 checkpoint 对来自完整6 × 6 6\times66×6矩阵的 2,160 条主判定终局失败为 0额外有 36 对被每个 judge 以反序评估得到 216 条审计判定顺序交换一致性 Reconstruction 为 69.4%–100.0%Appearance 为 61.1%–83.3%。核心结论是编码智能体不能可靠判断场景质量尤其是几何self-judging 相比 cross-model judging 没有一致优势。因此 refinement 应基于 deterministic evidence而非自我评估。敏感性检查与铰接试点。小规模敏感性检查固定六个任务子集由 GPT-6-astra 与 GPT-5.6-sol 共享。改变重建阈值F2%、F5%、F10%、外观容差20、30、40和点预算25k、50k、100k会按预期改变绝对值但不会改变该子集上的模型排序GPT-6-astra 始终领先 GPT-5.6-sol。铰接试点方面论文使用 canonical articulation registry443 个规范资产中36883.1%确认为静态7516.9%具有验证的关节关节要求 327 个其中连续 75、旋转 55、棱柱 197GT 不可用为 0。在重评一个冻结的 Office 提交时此前部分 GT 适配器下只有 2 个铰接目标可计分、12 个不可用完整 canonical manifest 使全部 14 个铰接目标可计分并保留 12 个人工确认的静态目标作为误运动对照把不可用计数降到零。该提交仍然得到S A r t p i l o t 0 S_{\mathrm{Art}}^{\mathrm{pilot}}0SArtpilot​0故这个零反映的是预测本身而非铰接真值缺失。可行的场景级铰接评估仍需要更具体的场景设定有待进一步探索。五、相关工作 / Related Work编码智能体。编码智能体可被理解为 LLM 加代码编辑、执行与迭代验证的工具组合其 harness 组织工具访问、执行上下文与环境反馈使代码既是输出也是规划与交互的接口。论文点名的相关工作包括 VIGA通过 code–render–inspect 循环重建并编辑视觉程序、SEIG通过 staged executable inverse graphics 把图像重建为可编辑 Blender 程序、ArtiCraft面向铰接式 3D 资产的 agentic coding 接口、Code-CoT把可执行 3D 程序作为空间推理的中间表示等。LEGO-Anything 的差异在于它把通用编码智能体本身作为“单图可执行场景构建”的 testbed重点关注场景保真度、迭代失败模式以及冻结重建场景的感知充分性。附录还提到 LL3M它用多个语言模型 agent 编写、调试、精修 Blender Python 脚本用于 3D 建模LEGO-Anything 的区别在于任务与评测目标但源码笔记中该句在“it evaluates end-to-end image-conditioned scene”处截断后续内容未提供因此不对其完整对比作额外推断。3D 场景构建。程序化系统从结构化规格与可复用资产生成自然、室内或城市环境例如 ProcTHOR、Infinigen、Infinigen Indoors、CityCraft。图像条件方法从视觉观测恢复几何与外观例如 collaborative multimodal coding、SAM3D 系。其他方向包括从 RGB-D 扫描得到可编辑室内场景以及 simulation-ready 铰接资产例如 Ditto、PARIS、URDF-Anything、SimArt、Articulate-Anything、PhysX-Anything 等。这些工作提供越来越强的组件但没有直接回答“单张自然图像能否被重建为忠实的可执行场景”。物体级 image-to-3D 代表如 TriMM、SAM 3D、LiteReality 提供日益强大的几何与外观先验可作为更大场景构建流水线的组件但重建孤立物体本身并不决定多个物体应如何被选择、定位、铰接与整合进连贯的可执行场景。铰接与仿真兼容资产方向与本文互补它们强化物体级几何、外观与功能而 LEGO-Anything 评测的是完整可执行场景的图像条件装配。场景重建与可编辑 3D 中间表示。Panoptic 3D scene reconstruction from a single RGB image 在固定场景表示中联合推理几何、语义与实例RecGen 通过生成式框架从稀疏 RGB-D 观测重建多物体场景直接处理不完整视图下的歧义、遮挡与不确定性。与 LEGO-Anything 的差别在输出接口本文问的是通用编码 agent 能否从单张 RGB 图像产出可执行 Blender 场景程序而不是预测固定的 panoptic 或生成式场景表示。可编辑 3D 中间表示也用于重建之外BlenderFusion 用 3D-grounded Blender 场景做视觉编辑与生成式合成表明显式场景状态、相机控制与物体操控可支持图像条件视觉任务这与 LEGO-World 的动机相邻——可执行场景不仅是重建产物也是可被查询、编辑、复用的可检视表示。基准对比。下表比较相关 3D 基准✓ 表示支持✗ 表示不支持。BenchmarkImage InputScene-level Eval.Executable / InteractiveIndoor/Outdoor CoverageNatural-Image StyleControlled Difficulty3DCodeBench✓✗✗✗✗✗WorldCoder-Bench✗✓✓✗✗✗P3D-Bench✓✗✗✗✗✗SEIG✓✗✓✗✗✗SceneActBench✓✓✓✗✗✗LEGO-Bench(Ours)✓✓✓✓✓✓LEGO-Bench 独特地针对端到端评估可执行场景重建跨多样、现实场景具有受控难度。评估基础设施与可复现性。论文基于 Harbor 完成任务扩展、重复、日志、产物收集、verifier 执行与聚合自研lego_bench_harbor包新增数据集转换器、隔离的 Blender 运行时、agent 适配器、verifier 与运行 manifest。公开输入挂载给 actor而私有几何、掩码、深度、对应关系保持 verifier-only。正式运行使用隔离的 Docker/Compose 环境含 Blender 5.0.1、Xvfb每个 trial 一个 Blender MCP listener。每个 harness 收到相同的图像、提示、分类体系、工具接口、限制与产物契约。Codex 方面ContainerCodex继承 Harbor 的 Codex 适配器在隔离的CODEX_HOME中注册 MCP 工具并附加输入图像最终 campaign 设置model_provideramazon-bedrock因此 GPT 家族标识本身并不指定服务路径。Hermes 方面包装层使用 Harbor 的通用适配器与上游 Nous Research Hermes Agent固定于修订aa6f77596b只有具备冻结运行 manifest 的配置才被报告。论文明确声明支持某适配器并不意味着该模型配置出现在论文中。六、局限性与展望 / Limitations Future Work论文反复强调的核心局限是有效性不等于保真度。当前编码智能体能以接近饱和的 Validity 交付合法 scene artifact但几何与外观的忠实恢复仍远未解决。GPT-6-astra取得最强总体结果室内 53.4%、室外 39.6%但仍存在显著差距Gen3DSR 在 Reconstruction 上更高却无法评估 Appearance说明单一指标可能掩盖不同维度的失败。Outdoor 场景比 indoor 更难且场景复杂度增加会降低 Reconstruction 与 Appearance但不影响 Validity。下降最陡的是 outdoor Reconstruction。这意味着可执行性相对稳定而几何保真度对场景复杂度更敏感。构建过程本身存在系统性失败。轨迹分析显示重建质量沿构建轨迹非单调较弱智能体需要更长时间产生可评估场景且后续编辑可能降低场景保真度。GPT-5.6-sol有 29.6% 的编辑降低分数最终提交比最佳中间场景低 3.2 分。编码智能体不能可靠判断场景质量尤其是几何self-judging 相比 cross-model judging 没有一致优势。因此LEGO-Plugin 的设计原则是用参考接地的确定性证据替代自由形式自我纠正但这并没有完全弥合与最强模型的差距它改善所有六个模型对较弱智能体增益最大对GPT-6-astra仅 2.1% 相对改善。LEGO-World 的读出在检测、分割与深度上均达到非平凡性能但远低于专用视觉模型检测 30.14 对 DINO 59.88分割 14.75 对 SAM 3 的 53.96深度 AbsRel 0.1554 对 Depth Anything 3 的 0.0783。论文据此判断程序构建场景是自然图像的有前景但尚不够精确的表示。此外equal-confidence AP 不是校准置信度只能读作固定排序下的兼容性诊断相对深度使用 scale-and-shift 对齐不检验绝对度量尺度缺失输出不能按零误差处理。Bird’s-Eye split 不是配对的 benchmark split被排除在配对复杂度分析之外仅作为更严格的大尺度重建压力测试。场景级铰接试点虽然通过完整 canonical manifest 把不可用计数降到零并使 0 分归因于预测本身但可行的场景级铰接评估仍需更具体的场景设定。Reasoning-effort 的区间只反映 42 个任务输入上的均值不确定性不度量重复运行波动该 campaign 的耗时也不能作为推理成本的可控度量。成本–性能前沿使用标准化 token 成本代理它只是成本近似而非完整经济成本。未来工作可能包括提升单图几何与外观保真度尤其是 outdoor 与复杂场景改进 harness 与插件使弱智能体也能获得稳定初始化与可靠 refinement研究更强的场景级铰接表示与评测协议扩展资产库与场景规格使 LEGO-Bench 随资产增长而扩展以及进一步提升程序构建场景作为统一视觉表示的精度使其在检测、分割、深度等任务上更接近专用模型。七、总结 / ConclusionLEGO-Anything 的核心贡献不在于训练一个更强的 3D 重建模型而在于重新定义任务接口把单图场景重建变成通用编码智能体在 Blender 中迭代编写、执行、检查、修订显式场景程序的过程。场景程序可检查、可编辑、可查询因而比渲染图或固定 3D 输出更适合作为“可操作、可诊断、可复用”的重建结果。为了衡量这一设定论文提出 LEGO-Bench208 张图像、104 个场景、8 个环境、17 个主题、443 个资产模拟器基底允许分离评分 artifact validity、visible-surface geometry 与 rendered appearance并支持受控复杂度与精确自动评估。实验表明当前编码智能体能可靠交付有效 artifact但几何与外观保真度仍有限GPT-6-astra在室内外分别达到 53.4% 与 39.6%是最强配置但仍与忠实重建存在显著差距。轨迹诊断把差距归因于弱初始化、回归编辑与不可靠自评估进而催生免训练 harness 插件 LEGO-Plugin它以 Enhanced Initialization、Grounded Refinement 与 Version Control 三个模块改善全部六个模型最高相对增益 62.7%对较弱智能体增益更大。LEGO-World 进一步表明冻结的重建场景已经能以确定性查询支持检测、分割与深度读出性能非平凡但远低于专用视觉模型。总体而言LEGO-Anything 把可执行场景程序确立为通用编码智能体的一个可测量、可诊断、有前景的研究目标LEGO-Bench 的可扩展设计有望支持未来走向更忠实的图像条件场景重建。原文摘要:A 3D scene reconstructed from a single image is most useful when represented not as a rendering or a fixed 3D output, but as an explicit scene program whose execution yields a scene that can be inspected, edited, and queried. We present LEGO-Anything, an Image-to-Code framework in which a coding agent iteratively writes and executes Blender code, inspects scenes and renderings, and revises the program. To evaluate end-to-end scene recovery, we introduce LEGO-Bench, a simulator-grounded benchmark with 208 images from 104 diverse indoor and outdoor scenes. LEGO-Bench separately scores artifact validity, visible-surface geometry, and rendered appearance. Its simulator-grounded design enables extensibility and precise automatic evaluation. Among evaluated agents, GPT-6-astra achieves the strongest overall results, with 53.4% indoor and 39.6% outdoor scores, yet substantial gaps remain between delivering valid scene artifacts and faithfully recovering scene geometry and appearance. Analysis of agent construction trajectories reveals three recurring issues: weak scene initialization, regressive edits during iteration, and unreliable self-evaluation. These findings motivate LEGO-Plugin, a training-free harness plugin for more controlled iterative scene construction, which improves all six evaluated models, with relative gains of up to 62.7% in overall score. Finally, we test whether reconstructed scenes can represent natural images and support vision tasks. In LEGO-World, we derive object detections, instance masks, and relative depth as deterministic queries on scenes reconstructed by GPT-6-astra. These readouts show non-trivial performance across all three tasks but fall well short of specialized vision models, suggesting that program-constructed scenes from current coding agents are a promising but not yet sufficiently precise representation of natural images.PDF链接:https://arxiv.org/pdf/2609.36380v1部分平台可能图片显示异常请以我的博客内容为准
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表