v1.2.0 已发布 · 人形角色生成器上线

将参考图重建为
Three.js 模型

以纯代码、程序化的方式重建参考图中的物体。经过质量门控、可直接用于动画, 并刻意做到省 token —— 通过代码重建,而非摄影测量、网格提取或下载素材包。

img2threejs 演示 — 参考战利品宝箱图像被重建为程序化 Three.js 模型
一张参考图像,通过代码重建为 —— 比例正确、配色、倒角、金色镶边,以及发光徽记 —— 在浏览器中实时运行
功能简介

不只是生成模型,更是可动画的资产

你给它一张物体的参考图,它生成一个 TypeScript 编写的 THREE.Group 工厂函数, 附带运行时层级结构——枢轴、插槽、碰撞体、销毁组。

物体与角色

每个主题会被分类为 object(物体)、character(角色)或 hybrid(混合)。物体走硬表面流水线;角色则进入一个具备解剖学意识的轨道——头身比例、面部关键点、姿态。

了解角色重建

细节优先分析

在生成代码之前,流水线会枚举出一份 detailInventory(身份定义性小细节清单),包含光泽、倒角、螺丝、线条、磨损。每一个细节都必须对应到一个真实的部件或材质条目。

查看分类法

最大相似度

针对特定人物的可选投影优先路径:参数化模板拟合到关键点,照片去光、相机匹配,并投影到网格上。

相似度最大化

质量门控

适用性、严格质量、截图反馈、可交互就绪、连接正确性、材质与光照真实感——六道门在代码前后拦截不合格输出。

纯代码,零依赖

结果是可 diff 的 TypeScript 代码加 JSON 规格。每个脚本都是纯 Python 3.10+ 标准库,没有 pip,没有 PIL,没有 numpy,无需安装。

Agent 无关

可运行于 Claude Code、Codex 或 OpenCode 之上。凡是提到 agent 视觉或浏览器工具的地方,都会使用宿主所提供的任意能力——原生图像读取、浏览器 MCP、项目预览或用户截图。

工作原理

分阶段雕刻流水线

脚本负责管控每个阶段;只有 agent 的视觉判断才能批准一个阶段通过。 模型按固定顺序雕刻,一个阶段只有在前一个被评审并接受后才会解锁。

草图
结构阶段
形态精修
材质阶段
表面阶段
光照阶段
交互阶段
优化阶段
参考图像
探测与适用性门控
规格预评估:类别、复杂度、质量契约
编写 ObjectSculptSpec:部件、材质、插槽
校验与严格质量门
锁定的构建阶段
生成 Three.js 工厂 + 浏览器渲染截图
打包对比图 → Agent 视觉评审
可直接动画的 Three.js 模型
01

适用性门控

这张图到底是不是一个可行的 3D 目标,在最早期就做出判断。

02

规格预评估与严格质量

在规格足够深入、匹配物体复杂度之前阻止代码生成。复合物体不允许只有一个根的规格。

03

截图反馈

continue 需要一次渲染、一张对比图,外加一个通过的视觉评分。

04

可交互就绪

模型通过 root.userData.sculptRuntime 暴露运行时层级:枢轴、插槽、碰撞体、销毁组。

05

连接正确性

子部件(把手、四肢、管道)需声明它们如何连接到父级,从而没有任何东西悬空漂浮。

06

材质与光照真实感

独立的 PBR 通道与真实灯光,绝不让 albedo 被混入 roughness。

在线演示

浏览器中实时运行的生成模型

完全由基础几何体、程序化着色器和生成的几何结构构建。没有网格文件,无需下载 —— 打开任意一个即可环绕查看并阅读生成的源码。

Sony WF-1000XM3 耳机 + 充电盒硬表面物体

Sony WF-1000XM3 耳机 + 充电盒

消费电子产品的精确重建

ISSACA 12 号口径霰弹枪硬表面物体

ISSACA 12 号口径霰弹枪

复杂机械结构的程序化重建

Gerber 伞绳刀硬表面物体

Gerber 伞绳刀

工具类物体的细节还原

哆啦 A 梦之家硬表面物体

哆啦 A 梦之家

等距微缩场景的程序化构建

战列运输车 "SECTOR 07"硬表面物体

战列运输车 "SECTOR 07"

科幻载具的多部件组装

加冕宝箱硬表面物体

加冕宝箱

游戏道具的完整 PBR 重建

为什么它能省 token

昂贵的上下文只留给视觉判断

大多数图像转 3D 的 agent 循环都在浪费 token:让模型做机械性工作——重读整个模型、给像素打分、手工校验 JSON。 img2threejs 把这一切都推进确定性的脚本里,只在真正需要判断力的地方消耗模型 token。

脚本负责执行,模型负责判断

Python 脚本处理校验、门控、规格编写、PBR 提取、对比图打包及流水线状态。它们从不给视觉打分。模型 token 只花在看一张对比图并决定通过与否上。

零依赖,零安装折腾

每个脚本都是纯 Python 3.10+ 标准库。没有 pip,没有 PIL,没有 numpy,没有 Playwright。PNG 的读写用 struct 和 zlib 完成。无需安装,意味着上下文中没有需要调试的东西。

阶段门控生成

代码生成器只输出当前已解锁的构建阶段。模型不会在每次迭代中重新生成或重读整个模型——每一步都很小且范围明确。

快速失败,在代码生成之前

一道严格质量门会在生成任何一行 Three.js 代码之前,挡住过于浅显的规格,因此你永远不会把 token 浪费在渲染一个从一开始就规格不足的模型上。

每次评审只看一张图

每个阶段的评审都基于恰好一张打包好的对比图(参考图与渲染图并排),而不是一堆零散的截图。

文本输出,而非二进制

结果是一份可 diff 的 TypeScript 代码,外加一份 JSON 规格——体积小、可审阅、可纳入版本控制,而不是几兆字节的网格文件。

单次物体重建的 Token 分布

工程估算,非实测基准。实际成本随模型层级、图像分辨率、物体复杂度及评审轮次变化。

确定性脚本(探测、评估、规格、校验、生成、同步)~2k-5k
读取参考图像<1k
撰写评估 + 细节清单 + 规格 JSON~15k-25k
编写和编辑 Three.js 工厂~20k-45k
渲染-评审循环(5-8 轮)~30k-70k
单次完整重建总计~80k-180k

单轮渲染-评审循环

~5k-12k / 轮

截图(~0)+ 打包对比图(~0)+ 视觉检查(~2k-3k)+ 撰写评审(~1k-2k)

角色重建成本

角色成本更高(更多评审轮次 + 关键点与投影检查):使用 v1.2 角色生成器, 完整的风格化或最大相似度重建约 ~150k-350k tokens。

快速开始

三步即可运行

这样就够了:skill 会自行分类主题、运行细节清单,并对每个阶段进行门控。

01

安装

把这个文件夹放到你的 skills 目录下:

git clone https://github.com/img2threejs/img2threejs.git ~/.claude/skills/img2threejs
02

调用

在 Claude Code 中,附上或指向一张物体图像,然后运行:

/img2threejs Rebuild this object as a Three.js model,
keep the proportions, angles, and colours.
03

跟随流水线

skill 会校验图像、撰写评估与规格、逐阶段生成工厂函数,并在每一步都向你展示一张并排对比图,直到渲染与参考图一致。

更进一步使用

上面那句简短指令把判断权交给了 skill。当你已经清楚自己主题中「正确」的定义时,就明确说出来—— 下面每一行都对应流水线中一道真实的门控或产物:

/img2threejs 将这张图像中的主题重建为一个程序化的 Three.js 模型。

保真度   保持与参考图一致的比例与轮廓。先枚举出身份定义性的
        细节 —— 倒角与圆角、面板接缝、紧固件、雕刻或喷涂的
        线条、光泽与哑光区域、磨损 —— 并丢弃任何无法落实到
        真实部件上的细节,而不是去伪造它。
材质     从参考图像素中推导表面类别与渐变节点,而不是凭记忆。
        标记任何无法在色调映射中保留的颜色。
运行时   为所有应当活动的部分暴露枢轴与插槽,并附带一个用于
        循环待机动画的 userData.tick。
门控     运行 --strict-quality,并且在并排评审通过之前不推进
        任何阶段。对图像无法呈现的区域报告分区置信度。

脚本从 skill 根目录运行,仅需 Python 3.10+

python3 forge/stage1_intake/probe_image.py <image>
python3 forge/stage2_spec/new_pre_spec_assessment.py "Name" --image <image> --out assessment.json
python3 forge/stage2_spec/new_sculpt_spec.py "Name" --image <image> --assessment assessment.json --out spec.json
python3 forge/stage2_spec/validate_sculpt_spec.py spec.json --strict-quality
python3 forge/stage3_build/generate_threejs_factory.py spec.json --out src/createObjectModel.ts
脚本工具

确定性脚本一览

每个脚本都是纯 Python 3.10+ 标准库,负责校验、门控、规格编写、PBR 提取与流水线状态。

脚本职责
stage1_intake/probe_image.py图像元数据与明显的技术问题(非视觉检查)。
stage2_spec/new_pre_spec_assessment.py对物体分类、评估复杂度,并产出质量契约。
stage2_spec/new_sculpt_spec.py基于评估编写 ObjectSculptSpec。
stage2_spec/validate_sculpt_spec.py校验规格;--strict-quality 会在代码生成前挡住浅显的规格。
stage1_intake/extract_pbr_evidence.py针对每个裁剪区域,从参考图推导 PBR 证据(推断,而非逆向渲染)。
stage3_build/orchestrate_passes.py锁定的阶段状态:状态、检查、同步。
stage3_build/generate_threejs_factory.py为当前已解锁阶段生成 Three.js Group 工厂。
stage4_review/make_comparison_sheet.py打包一张参考图 vs 渲染图对比图供评审。
stage4_review/append_review.py记录每次阶段的评审:评分、决策、证据。
_shared/feature_acceptance_policy.py内部辅助脚本,强制执行每个特征的评分阈值。
stage1_intake/build_detail_inventory.py将参考图切分为若干区域,并搭建细节清单。
stage1_intake/extract_landmarks.py叠加关键点网格,并为角色搭建解剖学区块。
stage1_intake/solve_camera_pose.py产出参考相机区块,使渲染能进行相机匹配。
stage1_intake/delight_albedo.py在纹理投影前,从照片中近似出中性反照率。
stage3_build/bake_projected_texture.py为照片纹理投影产出投影/UV 烘焙描述符。

grimoire 文件夹保存着每道门控所依据的详细评分准则——校验、规格预评估、程序化模式、 材质与光照真实感、连接正确性、可交互就绪模型、自我修正。

你会得到什么

三份可审阅的交付物

规格文件

ObjectSculptSpec JSON

完整的部件树、材质、重复系统、插槽,以及每个阶段被记录的评审历史。

可运行代码

TypeScript 工厂函数

createObjectNameModel(spec, options) 返回 THREE.Group,并通过 root.userData.sculptRuntime 暴露节点、插槽、碰撞体与销毁组。

视觉证据

渲染图与对比图

一份渲染图,外加记录每个阶段保真度的并排对比图——参考图 vs 渲染图。

路线图

每次发布一个主题

发展脉络:资产(v1.4–v1.5)→ 世界(v1.6–v1.7)→ 生产(v1.8–v1.9)→ 一个能从参考图生成可玩世界的 AI 游戏资产平台(v2.0)。

v1.0已发布

物体流水线

分阶段雕刻、渲染对比参考图的评审循环、可交互就绪的层级结构。

v1.1已发布

细节优先分析

强制性的细节清单、严格质量门。每道门控所依据的详细评分准则。

v1.2已发布

人形角色生成器

解剖学轨道、比例锁定与特征放置阶段。世界空间人形组件树模板。

v1.3已发布

质量与效率 + 生物生成器

Divine Eye 确定性评审框架、输入完整性与几何真实性门控、CIEDE2000 色彩数学。4 种身体结构方案(四足 / 鸟类 / 翼龙 / 蛇形)。

v1.4即将发布

武器更新

面向 CS2 级别硬表面资产的 1:1 照片级、非风格化流水线——严格的 PBR 标准与纹理投影、针对装配的机械推理,以及真实的金属 / 聚合物 / 木材响应。

v1.5规划中

角色更新

角色重建、面部特征、可绑定拓扑、blendshape 预备、毛发与衣物。包含实测 Token 基准。

v1.6规划中

环境更新

建筑、房间、街道、植被、地形感知与多物体重建。

v1.7规划中

游戏流水线更新

Unity 与 Unreal 导出器、Blender 桥接、LOD 与碰撞网格生成。

v1.8规划中

动画更新

自动绑定、自动蒙皮权重、Mixamo 兼容、面部绑定。

v1.9规划中

AI 工作室更新

Web UI、批量处理、可视化提示词构建器、云端渲染。

v2.0规划中

程序化世界更新

多视角重建、程序化城市生成、语义化世界理解、插件生态与 API。

关于局限性的坦诚说明

单张图像无法揭示被遮挡的侧面,也无法保证精确的几何。当输出是近似的、风格化的或低多边形的时候, skill 会直白说明,并通过镜像可见面来推断不可见的面,而不是伪造置信度。 它在硬表面物体上表现出色;角色则是风格化的重建,而非照片级的相似。

「从这张图像无法达到所要求的保真度」是一个有效且可预期的结果。