AI 3D 生成模型:究竟係咩喺生成 3D 房間

「AI 3D 生成」呢個講法,俾人用嚟指代至少四種本質上完全唔同嘅技術, 而佢哋產出嘅嘢並唔係同一種。如果你而家評估緊任何一款聲稱可以生成 3D 內容嘅工具, 真正決定輸出結果喺下游能唔能夠實際被使用嘅,係佢背後嘅技術,而唔係市場推廣文案。
文字轉 3D 同圖像轉 3D 嘅網格生成模型
呢類模型接收一段文字提示或者一張參考圖片,一次生成過程直接輸出一個 3D 網格—— 頂點、面片,通常仲有一張貼圖。由佢被優化嗰個角度睇,結果可以幾令人驚艷。 局限性會喺你需要修改任何嘢嗰一刻出現:呢個網格係一整嚿不透明嘅幾何體, 底層冇「腳」「座面」「坐墊」呢類描述可供操作。要編輯,淨係可以人手重做表面, 或者重新生成一次,然後寄望新結果更接近你想要嘅樣。佢亦冇可靠嘅辦法 等你問「呢件嘢有幾闊」而得到一個可信嘅數字——幾何結構就係模型啱啱好生成出嚟嘅樣, 並非嚟自真實世界嘅尺寸,而如果呢件物件需要實際擺入某處,或者要按規格生產, 呢一點就非常關鍵。
輻射場重建
呢個係高斯濺射同類方法背後嘅技術:由多張相片捕捉一個真實場景, 充分重建空間入面每一點嘅光照行為,從而可以渲染出原始相片入面冇嘅新視角。 輸出由任何鄰近角度睇都真正做到像真——因為佢重建嘅係真實存在過嘅嘢, 而唔係憑空發明幾何結構。但由任何傳統意義嚟講,佢都唔係可編輯嘅幾何結構; 冇網格,冇物料清單,冇任何可以查詢「呢個有幾闊」嘅嘢,因為一個濺射場 係一種俾捕捉落嚟嘅外觀,而唔係一個結構化對象。
基於擴散模型嘅紋理合成
呢個係四種技術入面範圍較窄但確實有用嘅一種:俾定已有嘅幾何結構, 擴散模型為佢生成一個合理嘅紋理或物料貼圖——木紋、布料紋理、表面磨損—— 而唔會觸碰底層網格。呢個係一個貼圖步驟,而唔係生成步驟;佢假定幾何結構已經存在, 全部精力放喺表面睇落點樣。
VLM 驅動嘅參數化構建
四種入面最新嘅一種,亦係喺「AI 3D 生成」嘅梳理入面最常被忽略嘅一種: 視覺語言模型並唔直接輸出幾何結構。相反,佢寫出一份結構化嘅構建配方——尺寸、 比例、物料選擇、形態——再由確定性引擎執行,構建出實際嘅網格。模型嘅工作 係描述,而唔係構造。

呢個正正就係 Flur 嘅 /catalog/create 背後嘅方式:一個 VLM 寫出一份
AssetRecipe(資產配方),
再由一套確定性嘅 Three.js 流程構建出嚟——呢個流程入面冇第三方網格生成廠商參與。
輸出由頭到尾都保持做一個結構化對象,而唔係一個渲染出嚟嘅估估吓。
實際帶嚟嘅結果係,構建出呢件資產嘅同一份配方,事後都可以用嚟描述佢。 問一件家具屬於邊個類別、佔地面積有幾大、應該向邊面牆,都有實實在在嘅欄位可以讀取答案—— 因為呢啲資訊本來就係構建指令嘅一部分,而唔係事後由一個成品網格反推出嚟嘅。
真正重要嘅取捨
以上每一種技術,都喺同一個維度上做取捨:可編輯性。生成嘅網格同重建嘅 輻射場都可以俾你一個睇得嘅嘢,但都俾唔到你一個可以查詢嘅嘢——你冇辦法問一個 濺射場「呢間房有幾闊」,都冇辦法問一個生成嘅網格「換一種物料」而得到一個乾淨嘅答案, 因為佢哋都冇好似配方咁,由構建之初就保留呢類資訊。
基於配方嘅資產,單件產出速度比一次性網格生成慢,因為佢要先俾人寫出嚟, 再俾人構建,而唔係一次生成過程就完成。佢換返嚟嘅係:每件資產喺事後都保持 可檢查、可編輯——你可以修改一個尺寸、替換一種物料、查詢一件物品嘅類別, 因為呢啲資訊由一開始就冇俾人掉咗。
應該揀邊一種
冇邊種技術係普遍更好嘅——佢哋解決嘅係唔同嘅問題。如果你需要一個已存在嘅 房間或物件嘅像真視圖,重建技術係正確嘅工具,任何網格生成模型都做唔到呢一點。 如果你需要新嘅、比例準確、可編輯嘅家具,並且要求佢可以正確放入真實房間、 之後仲可以繼續調整,基於配方嘅方式正正就係為呢份工作而生嘅。而如果你已經擁有 正確嘅幾何結構,淨係需要一個更好睇嘅表面,基於擴散模型嘅紋理合成就可以單獨解決 呢個更窄嘅問題——佢唔係前三者嘅競爭者,更似係一個假定前面某個環節已經完成嘅 收尾步驟。
立即開始
想了解基於配方嘅構建方式喺一次完整房間搭建入面處於咩位置,可以參考 3D 模型搭建流程完整解析。如果你而家 權衡緊輻射場重建同可編輯幾何結構,用於室內漫遊場景,可以參考 高斯濺射 vs 網格 vs 全景。 想更深入了解 Flur 基於配方嘅目錄工具具體係點運作嘅,可以參考 用 AI 搭建 3D 家具目錄。 想了解同樣一種由 VLM 驅動嘅方式點樣應用喺編輯已有場景、而唔係生成新資產,可以參考 用對話編輯一間 3D 房間。