文章上線

Higgsfield 開源發布 95 分鐘 AI 電影:完整提示、素材、工作流程與 50 萬美元預算拆解

Higgsfield 開源發布 95 分鐘 AI 電影:完整提示、素材、工作流程與 50 萬美元預算拆解

目錄

你可能想知道的事

1. Higgsfield 如何讓一部長片級 AI 電影的每條提示、每個素材與每次迭代都可重現?

2. 團隊在花費約 50 萬美元過程中,對提示撰寫與迭代學到了哪些實務經驗?

主要議題

Higgsfield 近期釋出他們 95 分鐘 AI 生成電影《Hell Grind》的完整開源套件。發布內容包含每一行提示、所有素材,以及整個製作流程中的每次迭代,還有一段 19 分鐘的幕後拆解與一個可協助打包與重複使用提示的 Claude Skill。公開整個專案讓其他創作者可以研究產生長片的精確輸入與輸出——若擁有相應預算與運算資源,也能嘗試重現或在此基礎上延伸創作。

該專案由一支 15 人團隊在哈薩克阿拉木圖於 14 天內完成,據稱花費約 50 萬美元。當中約 80%——大約 $400,000——花在 GPU 雲端運算,其餘用於人員與其他製作成本。團隊描述生成過程具有某種隨機性:他們從 16,181 幀的生成池中篩選出最終可用的 253 個鏡頭,選取比大約為 64:1。如此高的淘汰率顯示長片 AI 製作在運算與大量迭代上相當昂貴且資源密集。

Higgsfield 也將開源發布置於更廣泛的行銷與社群策略之中。此發布支援 Higgsfield Global Film Festival(獎金池 100 萬美元、最高獎 50 萬美元)的活動,公開專案有助於教育創作者,同時宣傳平台與影展。

開源套件包含:使用的每一條文字提示;所有角色與場景素材;關鍵鏡頭的迭代歷史;以及一個可現成使用的 Claude Skill。該 Claude Skill 使用四部分結構來標準化提示,以促進決定性、可重現的輸入:(1)資產的錨定標記(例如:@Roco、@Monster)搭配簡潔的外觀描述與參考圖像,讓模型能一致辨識實體;(2)以公尺表示的空間座標;(3)以秒為單位指定的動作時間點;以及(4)嘗試防止模型發明新元素或與先前指示矛盾的嚴格規則區塊。此範本強制精確並減少長序列中的歧義。

在生成最終場景前,團隊會「定裝」或固定反覆出現的角色與環境。這表示鎖定反覆出現角色的屬性,例如髮型、面部特徵與服裝;對於怪物,設定精確的物理參數(例如:4 公尺高、骷髏臉、紅色水晶刀、無右手、骨頭直接形成刀刃)。基礎描述越詳細,AI 模型在多幀間更能可靠地再現相同角色。

一套重要的實務規則在如何撰寫提示以維持連貫性與電影品質上浮現。Higgsfield 團隊發現抽象形容詞與主觀指示(例如「更戲劇化」、「不要那麼卡通化」)通常無效。相反地,他們使用具體數值與可比較的量化指標:不是說「攝影機快一點」,而是指定「為典型電影推軌速度的 3×」。對於環繞型攝影機移動,他們給出起止距離(「從 8 公尺到 4 公尺」)與高度(「從 3 公尺到 2 公尺」)。像怪物變形這類轉換,持續時間也以精確數值固定(「0.4 秒」)。

處理群眾規模時採取類似方法:不是列出精確的巨大人數,而是把群眾深度分層為三個層次——銳利的前景主體、密集的中景群眾,以及較朦朧的遠景輪廓——讓觀者感知尺度,同時模型只需清楚渲染視覺上重要的主體。霧與能見度受限被有意用作遮掩背景失誤的實用手法。即便高品質 4K 渲染提升了背景細節,當畫面元素變得密集時,這種遮掩技巧仍然有用。

動作與戰鬥序列被分解為緊密定時的微步驟。像戰士起身這類單一動作被拆為離散段落(例如:0.5s 的手部動作、1.5s 的頭盔動作、3s 站直)。鎖定這些時間點可防止模型跳幀或發明過渡狀態。另一項製作紀律要求每條提示至少執行四次獨立生成,以判定失敗是源於隨機性還是提示缺陷;這有助於分辨運氣不佳與指令錯誤,從長遠看能節省計算資源。

最昂貴的教訓之一是如何處理否定。告訴模型「不要做」往往不可靠:明確說「沒有手持武器」或「沒有握把」有時會讓模型仍然幻覺出被禁止的元素。團隊發現更有效的方法是以正向方式重新框定限制——直接指示應顯示什麼——並在必要時示範缺失,透過指令讓模型呈現空白空間(例如:「抬起手臂以清楚顯示空的手腕與前臂」)。

另一個持續出現的失敗情形是模型在提示中出現「game」或類似「不是遊戲」的否定詞時,會把電影級打鬥視為電玩過場動畫。模型往往會鎖定強烈詞彙標記,並強調相關的風格模式。為了修正,團隊以肯定的方式描述期望的電影特性(用精確的光線與材質描述取代「不要廉價 CGI」),並採用多鏡頭剪輯。他們讓模型產生四個不同鏡頭切法──50mm 環繞、24mm 低角、85mm 特寫、35mm 廣角──然後規定跨鏡頭連續性規則:鏡頭 A 的結束姿勢必須等於鏡頭 B 的開始姿勢。若不明確匹配結束與開始姿勢,AI 會把每個切面當作獨立場景並在鏡頭間重置姿勢。

為了呈現衝擊與物理互動,團隊撰寫了數值化的空間約束(例如以厘米計的每秒碰撞距離與明確的撞擊角度),並加入關於材質行為的硬性規則(例如:「水晶總是能擊碎鋼鐵」)。這些指令產生了可預測的物理結果——鋼刀破裂與火花飛濺——而非模糊的電影隱喻如「慢動作」。

Higgsfield 的最終觀察是,真正的技術不是某一句天才提示,而是能夠識別精確的失敗模式並只修補那部分流程。許多最終幀是合成影像,從同一生成批次中挑選並編輯而成。工作流程——清楚的範本、數值精確、迭代紀律與外科式修正——使團隊能比臨時拼湊的提示更可靠地從隨機輸出建立長片專案。

與這些流程同時公開的還有詳細說明哪些生成設定用於各鏡頭(例如:固定模型為 CS 2.0、單次通過時長 15s、每次執行產生四個輸出、沒有隱藏調整),讓研究者與創作者更能理解電影輸出背後的實驗條件。

關鍵見解表

面向描述
預算分配~$500,000 總計;約 80% 用於 GPU 雲端運算,約 20% 用於人員。
提示結構四部分 Claude Skill 範本:錨定標記、度量的空間座標、精確時間、嚴格規則區塊。
角色一致性鎖定反覆出現角色的細節(外觀、尺寸、道具)以維持鏡頭間的連貫性。
數字化使用以明確數值比較與測量取代主觀形容詞,來指示鏡頭與動作方向。
否定陷阱避免告訴模型「不要做什麼」;改以肯定的正向指示,並在需要時示範缺失。
迭代策略對每條提示執行多次生成以區分隨機性與提示缺陷;從同一批次選出最佳片段以供剪輯。

後續...

Higgsfield 的開源發布提供了一個罕見且極具實務意義的長片 AI 內容創作個案研究。透過公開完整提示歷史、素材與迭代紀錄,團隊提供了透明的學習資源:開發者可以研究具體的提示範本、藝術家可以學習如何鎖定角色連貫性、研究者可以衡量運算到輸出的效率。該專案強調可預測的電影輸出依賴於數值精確、模組化編輯策略與細緻除錯——更多是工程而非神奇的提示技巧。

展望未來,此發布可能加速藝術實驗與批判性討論。有足夠資源的創作者可複製工作流程的部分做法,而工具開發者則能將四部分提示結構與連續性規則內建到更友善的介面中。與此同時,高額的運算成本凸顯出雖然長片 AI 製作可行,但仍相當耗費資源;提升模型效率、更好的多鏡頭連續性模型與更聰明的素材重用,將是讓此類製作對更廣泛創作者更可及的重要下一步。

最終,Higgsfield 證明長片 AI 製作的技藝在於受控流程、迭代紀律與剪輯時的組合能力,而非單一提示。公開的材料使這些流程變得明顯,有助於整個領域從實驗新奇走向可重複的實務。

最後編輯時間:2026/8/11

Claude AI

AI 智能編輯