Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing
腾讯混元团队推出Buffalo 1.0,把3D理解、生成和编辑统一到一个模型里
Hunyuan3D-Buffalo 1.0用一个模型同时完成理解3D物体、根据文本生成3D物体、按指令编辑3D物体、以及按文本要求生成局部部件这四件事。为此团队自建了一套自动化数据流程,构造出总量8700万条的3D多模态训练语料,并用名为Nano3D-v2的自动化流程专门解决3D编辑数据稀缺的问题。实验显示该模型在文本生成3D和3D编辑基准上超越了此前方法,并发现生成能力变强会连带提升编辑能力。
METAL LAB 解读图
Hunyuan3D-Buffalo 1.0 的结构流程
证据状态已报告实测结果
- 数据引擎全自动流程构建2500万理解样本、5000万文本到3D配对、1200万编辑配对,总计8700万条
- Nano3D-v2五阶段:视角选择、编辑区域预测、体素编辑、几何纹理精修、VLM校验,自动生成编辑训练配对
- Hunyuan3D-VLM读取3D点云,理解物体的语义、结构与部件位置,为生成提供条件信息
- Hunyuan3D DiT接收VLM提供的条件与源物体表征,以扩散方式生成或编辑3D形状
- 基准验证在Edit3D-Bench上相比Steer3D,CD降低86.7%,F1提升2.39倍
他们做了什么
- 团队用全自动流程构建了总计8700万条的3D多模态训练语料,包含2500万条理解样本、5000万条文本到3D配对、1200万条编辑配对。
- 3D视觉语言模型Hunyuan3D-VLM负责理解物体的语义、结构和空间位置信息,并把这些信息转成条件提供给扩散模型Hunyuan3D DiT,由后者真正生成3D形状。
- 为解决编辑数据稀缺问题,团队设计了基于智能体的Nano3D-v2流程,分五个阶段:选取最佳编辑视角、用学习到的模型在体素级别定位编辑区域、进行体素编辑、精细几何与纹理修补、以及基于视觉语言模型的质量校验。
- 在Edit3D-Bench基准上,相比此前最强基线Steer3D,该模型把形状误差指标Chamfer Distance从0.0684降到0.0091(相对降低86.7%),平均F1指标从0.2729提升到0.6515(提升2.39倍)。
- 仅给文本到3D训练数据额外加入1000条鸡头相关样本、完全不添加任何编辑数据,模型就自动获得了替换该部位的编辑能力,说明扩大生成数据也能带动编辑能力提升。

| Capability | Subset | #Samples |
|---|---|---|
| 3D understanding | Text / image / 3D instruction data | ∼25M |
| Text-to-3D | Text–asset pairs | ∼50M |
| 3D editing | Human edits | ∼7M |
| Object edits | ∼3M | |
| Part generation | ∼2M | |
| Subtotal | ∼12M |

| Tier | Length | Emphasis |
|---|---|---|
| Detailed | 4–6 sentences (≤120 w) | subject, parts, pose, features |
| Main | 24–30 tokens | structure + key parts |
| Simplified | 15–20 tokens | main parts and fit |
| Paraphrase | 15–20 tokens | reworded Simplified |
| Short | 6–10 tokens | subject + ≤1 attribute |
| Tags | ≤8 keywords | disentangled keywords |

| Model | Part Understanding Q&A | Overall 3D Object Captioning | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| SBERT | SimCSE | BLEU-1 | ROUGE-L | METEOR | SBERT | SimCSE | BLEU-1 | ROUGE-L | METEOR | |
| GPT4Point [63] | 48.32 | 45.17 | 15.16 | 22.55 | 16.19 | 25.60 | 27.00 | 11.50 | 12.00 | 12.70 |
| PointLLM-7B [93] | 61.30 | 58.48 | 21.78 | 29.26 | 22.45 | 42.79 | 42.44 | 11.58 | 14.39 | 16.90 |
| PointLLM-13B [93] | 56.36 | 51.47 | 21.40 | 29.16 | 21.80 | 43.51 | 43.12 | 13.54 | 15.74 | 17.45 |
| ShapeLLM-13B [62] | 61.19 | 57.26 | 23.32 | 32.56 | 24.45 | 25.15 | 27.14 | 11.77 | 12.14 | 12.84 |
| ShapeLLM-Omni-7B [103] | 57.35 | 51.16 | 22.77 | 29.57 | 23.24 | 31.18 | 31.93 | 17.79 | 19.04 | 14.30 |
| Part-X-MLLM [78] | 78.98 | 84.25 | 40.54 | 42.26 | 34.24 | 53.82 | 51.97 | 36.04 | 38.11 | 30.71 |
| UniVerse3D [101] | 83.11 | 87.16 | 46.79 | 43.94 | 42.05 | 65.18 | 66.25 | 42.75 | 44.17 | 41.11 |
| Hunyuan3D-VLM (Ours) | 85.47 | 89.06 | 49.95 | 45.01 | 45.79 | 72.94 | 73.60 | 50.93 | 52.84 | 50.47 |

| Task | Name | IoU | SBERT | SimCSE | BLEU-1 | ROUGE-L | METEOR |
|---|---|---|---|---|---|---|---|
| 0 | Pure box listing | 0.864 | - | - | - | - | - |
| 1 | Multi-Part Grounding (Q1) | 0.880 | 68.00 | 68.55 | 52.06 | 52.09 | 26.35 |
| 2 | Multi-Part Grounding (Q2) | 0.844 | 70.92 | 69.47 | 40.04 | 41.86 | 38.19 |
| 3 | Single-Part Grounding (Q1) | 0.626 | 78.95 | 77.92 | 45.74 | 47.47 | 44.07 |
| 4 | Single-Part Grounding (Q2) | 0.525 | - | - | - | - | - |
| 5 | Box-to-Text (Q1) | - | 67.64 | 68.27 | 49.89 | 50.00 | 25.45 |
| 6 | Box-to-Text (Q2) | - | 74.13 | 72.99 | 42.01 | 44.28 | 40.96 |
| 7 | Part QA | 0.633 | 85.47 | 89.06 | 49.95 | 45.01 | 45.79 |

| Model | Text alignment | Geometry quality | Overall preference |
|---|---|---|---|
| Universe3D [101] | 8.2 | 7.4 | 8.3 |
| TRELLIS [92] | 14.9 | 12.4 | 14.4 |
| Omni123 [100] | 17.5 | 21.0 | 18.4 |
| Hunyuan3D-Buffalo 1.0 (Ours) | 55.2 | 57.1 | 56.6 |

| Num. of samples | Text alignment | Geometry quality | Overall preference |
|---|---|---|---|
| 300w | 9.9 | 8.8 | 8.4 |
| 1500w | 28.8 | 29.0 | 28.6 |
| 5000w | 54.5 | 57.4 | 57.5 |

| Method | Add | Remove | Avg | |||
|---|---|---|---|---|---|---|
| CD ↓ | F1 ↑ | CD ↓ | F1 ↑ | CD ↓ | F1 ↑ | |
| ShapeLLM-Omni [103] | 0.2546 | 0.0877 | 0.2237 | 0.1166 | 0.2392 | 0.1022 |
| 3DEditFormer [90] | 0.1676 | 0.1955 | 0.1342 | 0.1836 | 0.1509 | 0.1896 |
| Tailor3D [64] | 0.1661 | 0.1217 | 0.1755 | 0.1352 | 0.1708 | 0.1285 |
| Steer3D [85] | 0.1404 | 0.2414 | 0.0976 | 0.3044 | 0.1190 | 0.2729 |
| Omni123 [100] | 0.0736 | 0.1743 | 0.0632 | 0.2259 | 0.0684 | 0.2001 |
| Hunyuan3D-Buffalo 1.0 w/ CLIP (Ours) | 0.0154 | 0.5657 | 0.0162 | 0.7015 | 0.0158 | 0.6336 |
| Hunyuan3D-Buffalo 1.0 w/ 3D-VLM (Ours) | 0.0127 | 0.5610 | 0.0054 | 0.7420 | 0.0091 | 0.6515 |

研究结果
- 在Edit3D-Bench上,采用3D-VLM条件的Hunyuan3D-Buffalo 1.0相比最强基线Steer3D,把平均Chamfer Distance从0.0684降至0.0091(相对降低86.7%),平均F1从0.2729提升至0.6515(提升2.39倍)。
- 在添加与删除两类编辑任务中,该模型分别取得CD/F1为0.0127/0.5610和0.0054/0.7420,说明它既能精准局部编辑,又能较好保留其余几何结构。
- 把条件输入从CLIP嵌入换成3D-VLM后,平均CD从0.0158降到0.0091,平均F1从0.6336提升到0.6515,证明更强的3D理解能力能提升编辑效果。
- 仅给文本到3D数据额外加入1000条鸡头相关样本,完全不加任何编辑数据,模型就获得了编辑该部位的新能力。
- 在定性比较中,Hunyuan3D-Buffalo 1.0在遵循编辑指令与保留原始形状之间的平衡表现优于对比模型Omni123和Steer3D。

可应用场景
- 游戏与动画资产制作中,通过文本指令对3D角色或道具进行局部修改(如添加眼镜、去除翅膀)的工具
- 将3D物体按部件拆解再重新组合、构建可复用3D资产库的流程
- 针对3D资产提供问答或部件定位(grounding)功能的3D检索与标注工具

局限与待验证事项
- 目前模型主要聚焦几何编辑,尚未涉及纹理编辑,包含颜色、材质变化的完整编辑仍是未来工作。
- 编辑数据构建流程难以保证编辑框内部非编辑区域的一致性,这种不一致会作为噪声混入训练过程。
- 文本到3D数据的描述仍依赖Gemini等多模态语言模型生成,这些描述存在一定模糊性,给训练数据带来噪声。
- 基于TRELLIS式的多阶段扩散架构在追求高质量几何时需要多阶段编辑,这从根本上限制了可扩展性。
- 作者自己指出目前数据的规模和质量都还未达到理想水平,后续仍需要进一步扩大数据规模。

为什么重要
过去3D的理解、生成、编辑模型大多各自独立开发,这项工作用实测结果证明把三者放进同一个模型能让能力互相促进。对于做游戏资产、动画或产品设计工具的人来说,这提供了一条不必分别维护多套流程、就能同时具备理解、生成与编辑能力的路径。

本文术语
- Nano3D-v2 · 一套基于智能体的自动化流程,输入源3D物体和编辑指令后自动生成编辑后的3D物体,用于构建训练数据
- Hunyuan3D-VLM · 一个专门处理3D点云数据的视觉语言模型,能理解物体的含义、结构和各部件所在位置
- DiT(扩散Transformer) · 一种从随机噪声出发、逐步生成目标结果(这里是3D形状)的扩散式生成模型
- Chamfer Distance · 衡量两个3D形状表面平均距离的指标,数值越小说明编辑结果在几何上越接近原本目标
- 体素(voxel) · 把3D空间划分成的网格最小单元,相当于3D版本的像素
论文原文摘要(英文)
Recent advances in image generation have demonstrated the potential of unified multimodal models that integrate understanding, generation, and editing. However, unified 3D modeling remains constrained by scarce multimodal data, particularly the lack of large-scale and geometrically consistent editing data. To address this limitation, we propose Hunyuan3D-Buffalo 1.0, a unified framework supporting 3D understanding, text-to-3D generation, instruction-guided 3D editing, and text-grounded part gene
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM AgentsAI助手在该向你提问的时候,却更愿意自己去核实事实
- SynFlow: A Multidimensional Diachronic Semantic Analysis Toolkit一款把单词意义变化拆解到语法细节的开源分析工具
- Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)用AI总结股市新闻发现:简单的摘要方法反而比时髦的检索增强技术更靠谱
METAL LAB 最新报道
图片来源: Junliang Ye et al., arXiv:2608.02711, arxiv-nonexclusive