每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

腾讯发布文本生成3D开放世界工具"Hy3D WorldClaw"

不是视频、也不是高斯溅射,而是用可编辑的游戏用3D素材来搭建世界的方式

이미지: METAL LAB 생성

摘要

  • 腾讯混元发布了名为"Hy3D WorldClaw"的智能体工作流,可通过文本提示生成大规模3D开放世界
  • 该团队表示,生成的场景可自由探索,且由可编辑的游戏用3D素材构成
  • 团队特别强调这与视频生成或高斯溅射有所区别,凸显与既有世界生成方式的差异
原文视频
이름
Hy3D WorldClaw
공개 주체·시점
Tencent Hunyuan, 2026년 8월 11일 X 게시
입력
텍스트 프롬프트
구조
단일 모델이 아닌 '에이전틱 워크플로'로 소개
산출물
편집 가능한 게임용(game-ready) 3D 에셋으로 구성된 대규모 오픈월드
탐색
생성된 모든 장면을 자유롭게 이동·탐색 가능
명시한 차별점
영상 생성 아님, 가우시안 스플래팅 아님

用一句提示词走进搭建出的世界

腾讯混元(Tencent Hunyuan)在8月11日发布于X的内容,是一段短视频加两句话。输入文本提示,就能得到大规模3D开放世界;由此生成的场景还可以自由行走探索。这个项目名为Hy3D WorldClaw。

值得注意的是,团队并未将其称为"模型"。他们用的说法是智能体工作流(agentic workflow)。这意味着并非由单一神经网络一次性输出结果,而是通过多个步骤自主推进、逐步拼装场景的流程。可以理解为一个将地形搭建、建筑与树木布置、材质贴附等工作分步处理的流水线。

腾讯混元发布的Hy3D WorldClaw演示视频缩略图
Hy3D WorldClaw发布帖中的演示视频 · 来源:Tencent Hunyuan

"不是视频,也不是溅射"

腾讯在自我介绍前先写了一句否定句:"不是视频,也不是高斯溅射"(腾讯混元X发帖)。这一句正是本次发布的核心。

过去一两年里,被贴上"世界生成"标签的成果大致分为两类。一类是视频生成型:用户移动时,系统实时绘制下一帧画面,画面看起来逼真,但其中并不留存真实的三维形状数据——回头一看,刚经过的建筑可能已经变了样。另一类是高斯溅射:从多张照片中将空间还原为数百万个模糊的点云,真实感出色,但结果并非网格(mesh,即三维表面数据),因此很难将其导入游戏引擎中开门或移动墙体。

WorldClaw主张的是第三条路。其宣称结果从一开始就是以可编辑的3D素材单位输出。如果属实,这意味着用户不止能欣赏生成出的世界,开发者还能挑选并移动、修改其中的物体。

方法输出结果可编辑/复用性弱点
视频生成型世界模型帧序列几乎不可能不保留形状信息,难以维持一致性
高斯溅射3D点集合有限非网格结构,引擎整合、物理应用较困难
Hy3D WorldClaw(宣称)游戏用3D素材据称可行公开形式与质量验证尚待确认

数日间接连出现的"世界"发布

放在这个位置来看,就能读出一条趋势线。8月初短短十天内,多家主要研究机构接连谈起了"世界"。

时间主体内容
8月4日NVIDIA提出基于视频世界模型的机器人策略概念World Action Model
8月8日报道NVIDIA以OpenMDW 1.1形式公开开放物理AI基础模型Cosmos 3
8月9日报道Qwen发布用于智能体训练的世界模型Qwen-AgentWorld-35B-A3B(Apache-2.0协议)
8月11日Tencent Hunyuan发布文本转3D开放世界工作流Hy3D WorldClaw

尽管用词相同,但方向各异。NVIDIA与Qwen的世界模型,重点在于打造用于训练机器人和智能体的环境。而WorldClaw正面瞄准的是供人类使用的内容领域,即游戏与3D制作流程。

腾讯的3D路线

腾讯混元近来发布节奏很快。8月9日,团队发布了采用MoE结构的文本生成模型Hy3,同日还在Hugging Face上传了将1.8B翻译模型量化至1.25比特的GGUF版本。语言模型走轻量化路线,3D则以工作流单位推进——两条方向同时在推进。名称前缀"Hy3D"也表明这是该团队一贯延续的3D生成系列的延伸。

不过本次发布更接近演示与宣告。权重或代码的公开形式、支持的引擎、生成规模上限等细节均未在帖子中提及。

究竟改变了什么

迄今为止,用AI制作的"世界"大多只是观赏对象。视频虽美观,却无法进入其中触摸;溅射还原了空间,但一旦转入游戏制作工具,人还是得重新开始建模。如果WorldClaw的说法能被实测证实,那么就打开了一条从文本直接进入编辑阶段的路径。对于花上数天搭建一块背景的小型游戏团队来说,这相当于多了一个能快速产出初稿的工具;对机器人领域而言,则意味着可以批量生产能够接入物理引擎的训练环境。

归根结底,关键只有一点:脱离演示视频、换成他人给出的提示词,能否依然保持同等品质。这个答案,只有等到真实文件能被打开查看之后才能揭晓。