想象一下这样一个3D建模过程。
你给 GPT-6Astra 一张挖掘机的参考图,它先理解这台机器由哪些部分组成:驾驶舱、履带、底盘、动臂、斗杆、铲斗……
随后,这些主要部件被分别送进一个专业3D 生成模型,几十秒后以独立资产的形式返回。
接下来,GPT-6Astra 开始接手。
它判断每个部件的尺度和空间关系,把履带放到底盘两侧,把动臂接到车身,再把斗杆和铲斗依次装上;主体结构完成后,它继续通过 Three.js 补上液压管、螺丝、转轴,以及驾驶舱里的操作摇杆。
最后,一台完整、结构化,还可以继续修改的挖掘机出现在三维场景中。
这不是单纯的图生3D,也不是单纯的代码生成。
而是两种 AI 能力开始以一种更自然的方式配合起来:
GPT-6Astra 负责理解、规划和构建,专业3D Foundation Model 负责复杂几何。
这也是极顶数创旗下 V2Fun 最近正在尝试的一种新工作流。
而它背后的一个更大变化是:
3D Agent 正在从“自己生成所有东西”,走向“知道什么时候该调用什么模型”。

01.GPT-6Astra 已经会做3D,下一步是什么?
GPT-6Astra 带来的一个重要变化,是大语言模型正在真正进入三维世界。
过去,我们更习惯让 AI 生成一张图片、一段视频或者一段文字。现在,依靠越来越强的多模态理解、空间推理和代码能力,GPT-6Astra 已经可以理解一个三维对象的结构,再通过 Three.js 等程序化方式把它真正搭建出来。
比如一条工业流水线。
GPT-6Astra 可以识别其中的传送带、滚轮、支撑框架、电机和不同工作模块,再逐步生成对应的几何结构。
这类对象尤其适合程序化建模,因为它们通常拥有明确的数学关系和重复结构。一根支撑柱可以由基础几何体表达,一个滚轮可以复制几十次,一段传送带的长度和位置也可以直接通过参数控制。
更重要的是,这样生成出来的并不是一个完全黑盒的 Mesh。
流水线中的各个部件仍然是独立对象,可以继续移动、复制、删除和修改。
从这个角度看,GPT-6Astra 已经不只是“生成3D”,而开始具备一种更接近3D 工程师的能力:
理解一个对象由什么组成,并把它构建出来。
但当对象越来越复杂,一个新的问题也随之出现。
如果面对的不是流水线,而是人物面部、生物、服装、雕塑,甚至只是一台拥有复杂工业曲面的挖掘机——是不是仍然应该让 GPT-6Astra 把所有几何都通过代码写出来?
答案可能不是非此即彼。
而这恰恰是 V2Fun 能够进入这个工作流的地方。
02.为什么是 V2Fun?
V2Fun 并不是为了这次 Demo 临时接入的一个3D API。
它是极顶数创(Vertex Lab)长期研发 AI3D Foundation Model 的产品化入口。极顶数创成立于2025年,核心方向一直围绕3D 生成、空间智能以及更长期的世界模型基础设施展开。
此前,V2Fun 已经作为鸿蒙系统首个3D 大模型 AI 原生应用亮相 HDC2026,并通过移动端和 Web 工作台覆盖从大众创作到专业3D 内容生产的完整链路。
它做的事情,本质上一直是:
如何把一个复杂的三维对象,以更低的门槛、更短的时间,变成真正可继续使用的3D 资产。即将上线的 V2Fun2.0,会进一步升级这套能力。

新版本将搭载最新一代3D Foundation Model,并支持最高8K 级贴图生成,重点提升复杂几何、人物、生物、服装、雕塑以及其他非规则曲面的生成质量。
这也是为什么,V2Fun 和 GPT-6Astra 的结合并不是一个偶然的产品联动。
两边擅长解决的问题,本身就是互补的。
GPT-6Astra 强在理解、规划、空间关系、代码和 Agent 调度。
V2Fun 强在直接生成复杂三维几何和高质量表面。
一个更擅长回答:“这个东西应该怎么构建?”另一个更擅长回答:“这个复杂部件本身应该长什么样?”当这两种能力结合起来之后,3D 生成就不再只剩下一条路径。
03.有些东西适合写代码,有些东西更适合直接生成
还是回到那台挖掘机。
从结构上看,它非常规则。
GPT-6Astra 很容易理解一台挖掘机由底盘、左右履带、车身、驾驶舱、动臂、斗杆和铲斗组成,也能够理解这些部件之间应该如何连接。
但继续往下看,问题就变得不同。
驾驶舱不是一个简单立方体,车身外壳也不是几个 Primitive 拼在一起就能准确表达。铲斗拥有连续曲面,机械臂有复杂轮廓,履带与底盘本身也包含大量工业设计细节。
GPT-6Astra 当然可以继续通过程序化代码逼近这些结构。
但几何越复杂,需要生成和修改的代码就越多,迭代轮次也会增加。
对于 Agent 来说,这意味着越来越多 Token 被消耗在底层几何描述上。
于是我们换了一种方式。
GPT-6Astra 先负责“看懂”挖掘机。
然后把驾驶舱、履带、机械臂、铲斗等复杂主体分别交给 V2Fun2.0生成。
生成完成之后,再由 GPT-6Astra 重新接管,完成尺度调整、旋转、位置匹配和整体装配。
这里,V2Fun 发挥的正是它一直在积累的能力:从视觉输入中直接恢复复杂三维结构,而不是让语言模型通过大量代码间接描述曲面。
这一步看似只是少写了一些 Three.js,实际上改变的是整个计算路径。

更有意思的是,V2Fun 并没有取代 Three.js。
组装完成以后,GPT-6Astra 仍然会继续自己生成很多东西。
例如液压管。
它本质上就是沿几个关键点连接起来的一条管状结构,非常适合程序化表达。
再比如螺丝、连接轴和摇杆。
这些对象尺寸规则、结构简单、数量又很多。如果每一个都单独调用一次3D Foundation Model,反而会增加整个流程的成本和复杂度。
所以最终看到的挖掘机其实是一个真正的 Hybrid Asset。
复杂主体由 V2Fun 生成。
规则细节由 GPT-6Astra + Three.js 完成。
最后再由 GPT-6Astra 把两者组织成同一个结构化3D 对象。
这也是这套方案真正有意思的地方:不是“代码生成”和“3D 大模型”二选一,而是让 Agent 自己决定,哪一部分最适合哪一种能力。
04.如果对象变成一个人,V2Fun 的价值会更明显
挖掘机仍然是一个偏硬表面的对象。
真正把纯程序化路线推向极限的,是人物和复杂有机曲面。
为此,我们又做了一个更激进的 Demo:
让 GPT-6Astra 构建一名全副武装的国王。
这个角色不仅有人体本身,还拥有复杂铠甲、头部、剑和盾牌。
相比机械设备,人类角色更加难以用规则表达。
一个脸“像不像”,不是因为眼睛、鼻子和嘴的大致位置正确就够了。
脸型、颧骨、眼窝、鼻梁、嘴唇以及这些结构之间连续而微妙的曲率变化,共同决定了最终形象。
铠甲也是如此。
它虽然属于硬表面,却不是简单的工程件。大量浮雕、装饰、连续曲面和风格化造型共同构成角色视觉特征。
这恰恰是 V2Fun2.0新一代3D Foundation Model 更适合处理的对象。
在这个 Demo 里,GPT-6Astra 首先理解整个角色,并将其拆解成头模、身体与铠甲、剑和盾几个主要部分。
随后,这些复杂部件分别通过 V2Fun 生成。
GPT-6Astra 再负责后面的事情:
头部尺度是否正确,如何与身体连接;剑和盾牌应该放在什么位置;各个部件之间比例是否协调;哪些模型需要减面;最终怎样整理成一个可继续编辑和使用的3D Asset。
换句话说:
V2Fun 解决的是“复杂几何如何快速、高质量地出现”。
GPT-6Astra 解决的是“这些几何如何成为一个完整对象”。

V2Fun 为什么能承担这一层复杂几何?
原因并不只是“它也是一个图生3D 模型”。
极顶数创过去一段时间的核心研发,一直围绕两个最基础的问题展开:
几何如何表达得更准确,以及高分辨率纹理如何在三维表面上保持一致。
在几何侧,团队持续迭代3D 表达和生成架构,希望减少无效几何表达,把模型能力集中到高曲率、薄结构和复杂区域。
在纹理侧,则重点解决多视角、高分辨率生成时常见的纹理错位、撕裂和细节损失问题。
这也是 V2Fun2.0能进一步做到8K 级高质量贴图的基础。
对于一个 Agent 来说,这类能力非常重要。
因为它调用的不是一个“看起来像3D”的视觉生成工具,而是一个真正输出三维资产的专业模型。
生成出来的资产还要继续被 GPT-6Astra 组合、减面、修改,甚至进入后续动画、游戏、打印或其他3D 工作流。
这正是 V2Fun 过去一直在解决的产品问题:让 AI 生成的不只是一个结果,而是一个真正可以继续工作的3D Asset。
05.更高质量,只是一部分,另一个变化是 Token
这套工作流还有一个很直接的收益:
Token 效率。
当 GPT-6Astra 用 Three.js 描述一个简单结构时,Token 使用效率非常高。
一个圆柱、一条液压管、几个螺丝,只需要很少的代码。
但如果让同样的方法去逼近人物面部、衣物褶皱或者高复杂度工业曲面,需要输出和修改的几何代码会快速增加。
于是大量 Token 被花在:
“这个曲面应该怎样再接近一点。”
“这个轮廓需要怎样继续调整。”
“这一部分应该增加多少几何细节。”
而当复杂部分直接交给 V2Fun 后,这些底层过程被压缩成一次专业模型调用。
GPT-6Astra 可以把更多推理资源放在真正需要 reasoning 的地方:
如何拆分对象;
哪些部分应该分别生成;
不同部件是什么空间关系;
最终如何组装;
哪里需要继续修改。
这也是为什么 V2Fun2.0带来的不只是“模型更好看”。
它还有机会同时降低 GPT-6Astra 在复杂3D 任务里的Token 消耗和整体建模时间。
原本可能是:理解 → 写几何 → 修改 → 再写几何 → 再修改
现在变成:理解 → 拆分 → 并行生成 → 组装 → 局部补充
当多个复杂部件能够同时生成时,这种效率差异还会进一步放大。
06.从“生成一个模型”,到“成为 Agent 的3D 基础能力”
过去几年,AI3D 的核心问题一直是:怎么生成一个更好的模型?
但随着 GPT-6Astra 这样的模型拥有越来越强的多模态理解、代码和 Agent 能力,这个问题正在发生变化。
未来,AI 不一定需要用一种技术完成所有3D 工作。
简单结构,可以直接写代码。
复杂曲面,可以调用 V2Fun。
已有资产,可以直接复用。
需要减面、组合、调整结构,再交给 Agent 继续执行。
这和3D 生成行业正在从“单次生成工具”走向“Agent 化生产力”的变化是一致的。参考文章也把这个趋势概括为:3D 生成正在从类似早期 Chatbot 的阶段,转向 Agent 模式的生产力阶段。
对于极顶数创而言,这个方向其实和它长期的技术判断是一致的。
公司从一开始就没有把 V2Fun 只定义成一个“图生3D 网站”。
从移动端降低3D 创作门槛,到 Web 端进入专业资产生产,再到3D 模型、动画、动作以及更长期的空间智能和世界模型方向,极顶数创真正想做的,一直是三维内容生成和空间智能的基础设施。
而 Agent 的兴起,可能让这件事情有了一个新的入口。
未来用户未必需要知道自己到底应该调用哪个模型、写哪段代码、选择什么建模方式。
他只需要说一句:
“把这个做成3D。”
GPT-6Astra 负责理解这个需求,并决定怎么完成。
而 V2Fun2.0希望成为它在复杂三维世界里的那一项专业基础能力。
GPT-6Astra 负责理解、规划和构建。
V2Fun 负责把复杂的三维想象真正变成资产。
GPT-6Astra × V2Fun:从代码生成,走向模型协同。