本頁內容

難度
中階
所需時間
3–6 小時,不包括生成排隊、內部審批與多輪重試
你需要準備
Claude 或所在地正式可用的文字模型 · Nano Banana Pro 或合適圖像模型 · Google Docs 或試算表 · Higgsfield、Veo 3.1、Kling 3.0 或 Seedance 2.0 · ElevenLabs · CapCut
開始之前
- 先準備產品真實資料、包裝原檔、價格、銷售條款、品牌語氣及不可使用的聲稱
- 確認人物、聲音、產品圖、字體、音樂、音效、場景和平台素材的商業使用權
- 知道目標平台、影片比例、長度、語言、CTA、安全區和最終交付規格
- 為每次生成記錄模型、日期、提示、參考素材、版本、花費和批准人
- 只使用自己所在地及帳戶正式可用的服務,不繞過地區、身份或付款限制
這套流程示範的不是「輸入一句話便得到完整廣告」,而是把一條短廣告拆成六個可獨立檢查的工序:先用 Claude 整理概念,再建立角色與場景參考、設計逐鏡關鍵幀、把靜態畫面轉成短片、挑選旁白,最後在 CapCut 對齊畫面、聲音和節奏。來源教學以一段罐裝飲品情境廣告作示範;本文只分析製作方法,不把畫面中的品牌、人物或文案當成本站推薦或真實成效證據。
媒體披露:文章封面是 ImageGen 製作的編輯圖片;內文使用獲授權的真實來源教學截圖與影片片段,所有畫面均裁走來源身份、帳戶、個人資料及社交平台推廣區。三段預覽片均為靜音,只用來展示動作、剪接與畫面連續性。全部內文媒體已於 2026-07-26 逐張、逐段人工檢查。
40 分鐘來源教學時間軸
先按來源影片的實際章節理解工作次序。不要在角色未定稿時大量生成影片,也不要在旁白尚未切句時便微調每一個剪接點。
| 來源時間 | 示範階段 | 本階段應留下的交付物 |
|---|---|---|
| 00:00–01:50 | 成片方向與流程預覽 | 廣告目的、片長、比例、參考節奏 |
| 01:50–04:09 | Claude 廣告概念 | 故事大綱、角色任務、鏡頭清單 |
| 04:09–09:29 | 角色與場景生成 | 角色描述、獲選人物/場景參考 |
| 09:29–19:40 | Storyboard 與產品關鍵幀 | 每一鏡的構圖、起點、終點與連戲條件 |
| 19:40–26:14 | Higgsfield/Kling/Veo 影片生成 | 逐鏡短片、版本與接受/拒絕紀錄 |
| 26:14–28:02 | ElevenLabs 旁白選擇 | 已批准聲線、分句音檔與讀音核對 |
| 28:02–38:40 | CapCut 剪輯、同步、音效與音樂 | 畫面主軌、旁白、音效、音樂及完成版 |
步驟一:先把概念寫成可拍、可生成的鏡頭
來源教學由 Claude 協助建立廣告概念,但真正有用的輸出不是一段華麗文案,而是「誰在甚麼場景做甚麼、鏡頭由哪裏開始、何時切到產品、最後如何收束」。實作時先提供片長、平台比例、受眾、產品事實、禁用聲稱和參考節奏,再要求模型輸出逐鏡表。每一鏡最好只有一個主要動作,例如鬧鐘響、人物起身、拿起產品、開罐、飲用或結尾反應。
逐鏡表至少要有:鏡頭編號、秒數、景別、人物、動作、產品位置、相機運動、起始幀、結束幀、旁白、音效和失敗條件。若模型寫出產品功效、價格、銷量或見證,必須回到品牌資料核實;流暢文字不是證據。香港廣告專案亦應留意香港海關不良營商手法資料,避免把生成內容當成可直接使用的商品說明。
步驟二:把角色描述寫到可以重複生成
角色一致性先由文字 brief 開始。來源畫面把年齡感、身形、髮型、鬍鬚、衣着、神情、坐姿、房間光線與背景窗戶逐項寫出。這種描述比「一個疲倦男人」更可重複,因為後續每一張圖都可逐項比對。商業專案不要要求模仿真人或名人;應把參考拆成可描述的造型特徵,並使用有權使用的虛構角色。

完成文字描述後,再從生成結果挑一個真正適合故事的雙人場景。選擇時不要只看單張是否漂亮,要看角色能否在下一鏡保持髮型、衣着、床鋪位置、視線方向與人物關係。把獲選圖另存為主參考,未獲選版本不要混入後續生成。

步驟三:把靜態圖整理成 Storyboard,而不是直接長片生成
來源教學明確把 image-to-video 拆成多張關鍵畫面:飲用、反應、產品近鏡等畫面先各自成立,再交給影片模型補上動作。這樣做的優點是角色或罐身出錯時,只重做一個鏡頭,不用推翻整條廣告。

Storyboard 的畫面不能只標「兩個人在房間」。要記錄前景人物、後景人物、誰清晰、誰故意失焦、鏡頭高度和留白。來源的雙人床上構圖把女角色放在前景,男角色在後方坐起,冷色窗光保持不變;這個構圖既交代關係,也為下一個產品近鏡保留剪接方向。

產品鏡頭要再獨立定義。手指數量、握法、罐身比例、標誌方向、床單質感與光線,都要在影片生成前看清楚。正式品牌專案尤其不應把生成罐身細字當作批准包裝;可先用乾淨參考完成動作,再於剪輯階段疊加品牌提供的正確包裝資產。

步驟四:在影片工具內逐鏡設定模型、起止幀與長度
來源在 Higgsfield 的 Create Video 流程中示範選擇 Kling 3.0、加入 start frame/end frame、設定片長、比例和解像度,再輸入單一鏡頭的動作。不同入口提供的模型、credits、秒數及控制項可能不同;正式生成前應以Higgsfield 的 Veo 3.1 說明、當日價格頁及實際帳戶畫面為準。

實際檢查一:提示是否真的轉成所需動作
第一段真實預覽把鬧鐘畫面變成手指按掣的短動作。觀看時不要只看最後一幀:要看手是否由合理位置進入、按掣時有沒有穿模、數字和鬧鐘外形有沒有跳變,以及鏡頭是否在可剪接位置停下。
實際檢查二:產品與手部能否跨幀保持
產品動作比純鏡頭移動更容易失敗。第二段預覽保留開罐動作,讀者應集中檢查拉環、拇指、罐口、標誌和手腕是否在整段連續。若只有一兩幀錯誤,不要用快速轉場遮住;回到該鏡頭重做,並把 prompt 簡化成單一動作。
步驟五:在 ElevenLabs 先篩聲線,再逐句生成
來源先在聲音庫以語言、口音、用途、性別和年齡等條件縮小選擇,再把旁白分句輸出。選聲時應比較語氣是否符合畫面,而不是只挑最有戲劇性的聲音。香港項目還要由香港粵語使用者逐字聽品牌名、金額、語速和停頓;供應商標示支援中文,不代表每個香港用語都自然。

旁白最好按鏡頭分成短檔,檔名包含鏡頭編號與版本。這樣某一句讀音或停頓不合格時,只重做該句。使用 TTS、Voice Changer 或聲音克隆前,要確認錄音來源、同意範圍、商業用途與保存期;可參考 ElevenLabs 的Text to Speech 文件、Voice Changer 文件及聲音克隆規則。
步驟六:在 CapCut 先排畫面,再同步旁白
來源在 CapCut 先把所有獲選影片匯入,按故事次序放到同一條主畫面軌。第一輪只處理鏡頭長短與切點:鬧鐘、雙人場景、產品近鏡、飲用和反應畫面是否順序清楚,總長度是否符合廣告要求。此時不要急着加大量轉場或濾鏡。

旁白同步:以語意切點對齊,不要把畫面任意拉長
畫面骨架成立後,再把分句旁白放到音訊軌,將每一句的關鍵字對齊相關動作。若旁白比鏡頭長,先刪減句子或重錄語速,不應把三秒動作硬拉成六秒。保留少量句尾空間,讓切點不會緊貼最後一個字。

音效:讓聲音落在可見動作上
來源為鬧鐘開場加入三個短促 alarm/beep 音效區塊。音效應對齊畫面事件,而不是鋪滿整段:按掣、開罐或物件落桌等瞬間,可放在波形尖峰或動作接觸幀附近,再以耳機及手機喇叭各聽一次。

背景音樂:先鋪節奏,再讓旁白保持可懂
最後才加入背景音樂。來源畫面可見一條完整音樂波形位於產品預覽下方;實作時先把音樂當節奏底,然後在旁白出現時降低音量,檢查開頭及結尾有沒有突兀切斷。素材能在剪輯器搜尋到,不代表自動擁有所有商業投放權;保存素材頁、授權標示及下載日期。

步驟七:觀看完成版時,逐鏡核對連戲與節奏
完成版不是只看「像不像廣告」。至少播放三次:第一次正常速度看故事是否清楚;第二次靜音看沒有旁白時能否理解;第三次逐幀看手部、面孔、產品、光線與剪接。下面是真實來源完成段落的靜音摘錄,可看到鬧鐘、床上情境、產品、飲用反應與全身產品鏡頭如何串成一條短廣告。
每一鏡都要通過的十項 QA
- 任務:鏡頭是否完成分鏡指定的唯一工作?
- 角色:臉形、髮型、衣着、年齡感和人物位置是否延續?
- 手部:手指、關節、握法與物件接觸是否合理?
- 產品:罐身比例、罐口、方向、數量和包裝有沒有跳變?
- 物理:開罐、飲用、影子、布料與反射是否連續?
- 鏡頭:運鏡速度、焦點和結束姿勢能否接下一鏡?
- 文字:生成細字是否錯誤;正式標誌是否使用批准原檔?
- 聲音:旁白、音效與畫面事件是否同步,音樂有沒有蓋過人聲?
- 權利:人物、聲線、字體、音樂、音效、產品圖及生成平台是否有可保存的使用依據?
- 輸出:比例、解像度、幀率、字幕、安全區和檔名是否符合交付規格?
成本與權利:失敗版本也要入帳
真實成本應包括所有圖像及影片嘗試、失敗重做、月費或 credits、旁白、音樂、剪輯與人工 QA,而不是只計最後三段成功片。Higgsfield、直接模型供應商與不同方案的 credits 不能互換;以生成當刻的帳戶畫面和平台條款記錄為準。CapCut 的 Pro 價格、AI 用量與素材權限亦會按地區和方案改變,可查閱官方價格說明及素材當日標示。
團隊應為每一鏡保存:模型、日期、提示版本、參考圖版本、秒數、解像度、花費、輸出檔、接受/拒絕、拒絕原因及批准人。若涉及客戶、員工或未公開素材,也要按公司政策處理;香港個人資料私隱專員公署的僱員使用生成式 AI 清單提供治理、輸入資料、準確性與標示方面的檢查方向。
交付前清單
- 概念、角色、Storyboard、逐鏡影片、旁白與剪輯檔各有清楚版本。
- 所有鏡頭均以原尺寸看過,沒有 loading、半完成畫面或移動模糊。
- 沒有用快速轉場遮掩手部、產品或面孔錯誤。
- 旁白由目標語言使用者核對,字幕逐字校正。
- 音效落在可見動作;背景音樂不遮蓋人聲。
- 產品聲稱、價格與 CTA 回到已批准資料。
- 人物、聲音、字體、音樂、音效及生成輸出權利有紀錄。
- 完成版在手機、耳機、手機喇叭和靜音狀態各播放一次。
- 發布 master、poster、字幕、來源、成本表與批准紀錄已備份。
延伸閱讀
總結
這條來源教學最值得保留的不是某一個模型名稱,而是製作順序:先把概念拆成鏡頭,再鎖定角色和關鍵幀;影片逐鏡生成、逐鏡驗收;旁白分句;CapCut 先排畫面、再同步人聲、再加音效和音樂;最後用完成版反查每一個錯誤與權利。只要每一鏡都有清楚輸入、輸出、版本和停止條件,失敗時便能回到最小步驟重做,而不是重新生成整條廣告。
資料來源與引用
我們附上第一手及官方來源,方便你逐一核實。
- 1.Plans & Pricing — Claude by Anthropic
- 2.Where can I access Claude? — Claude Help Center
- 3.Image generation with Gemini — Google AI for Developers
- 4.Gemini Developer API pricing — Google AI for Developers
- 5.Available regions for Google AI Studio and Gemini API — Google AI for Developers
- 6.Where you can use the Gemini web app — Google Gemini Apps Help
- 7.Veo 3.1 — AI Video Generation on Higgsfield — Higgsfield
- 8.Higgsfield Pricing — Higgsfield
- 9.Higgsfield vs Runway 2026 — Higgsfield
- 10.Terms of Use Agreement — Higgsfield
- 11.Video generation in the Gemini API — Google AI for Developers
- 12.Kling AI Launches 3.0 Model — Kuaishou Technology
- 13.Kling AI Video 3.0 Model User Guide — Kling AI
- 14.Seedance 1.5 pro — ByteDance Seed
- 15.Seedance 2.0 Official Launch — ByteDance Seed
- 16.ElevenLabs Pricing — ElevenLabs
- 17.Text to Speech — ElevenLabs Documentation
- 18.Voice Changer — ElevenLabs Documentation
- 19.Pronunciation dictionaries — ElevenLabs Documentation
- 20.Can I create a Professional Voice Clone of someone else's voice? — ElevenLabs Help Center
- 21.How Much Does CapCut Pro Cost? — CapCut
- 22.CapCut Standard vs Pro — CapCut
- 23.How do I recognise subtitles? — CapCut
- 24.Unfair Trade Practices — Hong Kong Customs and Excise Department
- 25.Checklist on Guidelines for the Use of Generative AI by Employees — Office of the Privacy Commissioner for Personal Data, Hong Kong
常見問題
這套 AI 廣告流程可以完全免費嗎?
可以用免費層級做概念測試,但不應假設完整商業廣告必定零成本。圖像和影片生成通常按 credits、秒數、解像度或模型收費;配音、音樂、商用素材、無浮水印匯出和團隊審批亦可能產生成本。先做低解像度測試,再只為已批准鏡頭使用較高成本模型。
一條 20 秒 AI 廣告真的可以低於 US$30 嗎?
有可能,但不是保證。成本視乎現有月費、模型、片長、解像度、失敗重試、加購 credits、配音和人工而定。按 Higgsfield 自家一份有日期的示例估價,三個 Kling 加三個 Veo 鏡頭若全部一次成功約 US$11.70;若每鏡平均三次,單是影片已約 US$35.10,尚未包括其他費用。
Claude 官方未列香港,香港讀者應怎樣做?
不要用 VPN、虛假地址、借用身份或他人帳戶繞過限制。截至本文核對日,Claude 官方支援地區清單沒有列香港。可把本文的結構化 Prompt 複製到你所在地和帳戶正式可用、而且符合公司資料政策的文字模型;付款前亦可先看本站的 Claude 香港訂閱指南。
Nano Banana Pro 和 Nano Banana 2 應該怎樣選?
Google 現時把 Nano Banana 2 定位為一般全能圖像模型,而 Nano Banana Pro 適合較複雜、專業資產、較高解像度、較多參考和文字處理。角色聖經可先用較快模型探索,鎖定方向後才以 Pro 製作關鍵參考。模型名稱、價格和地區支援要以實際入口為準。
Veo 3.1 和 Kling 3.0 哪一個較適合廣告?
沒有一個模型適合所有鏡頭。Veo 3.1 適合指定 4、6、8 秒的短鏡及參考控制;Kling 3.0 可處理較長、多鏡、原生音訊和元素一致性。先按鏡頭任務測試,而不是把品牌偏好當成品質結論;經 Higgsfield 使用時,功能和價格亦不一定等同直接供應商。
Seedance 1.5 是否仍是現行版本?
Seedance 1.5 pro 是較早版本;ByteDance 已在 2026 年 2 月正式發布 Seedance 2.0。舊教學出現 1.5 並不代表名稱錯誤,但新文章和新專案應把 2.0 當成現行比較選項,再以實際平台可用版本為準。正確拼法是 Seedance,不是 Sea Dance。
影片模型已有原生音訊,仍需要 ElevenLabs 嗎?
不一定。環境聲、簡短對白或概念測試可先用影片模型音訊;需要統一旁白聲線、精準時間、修正品牌讀音和多版本輸出時,獨立 TTS 或 Voice Changer 較容易控制。不要同時保留兩套不一致的人聲,並要分別確認每套輸出的授權。
可以複製員工、客戶或 KOL 的聲音嗎?
不可因為網上有錄音便直接複製。ElevenLabs 官方說 Professional Voice Clone 只可建立自己的聲音;即使對方同意,也應由聲音擁有人自行建立、驗證及在適用情況下分享。其他複製方式亦要有清楚、具體、可保存的同意和商業使用範圍。
購買 CapCut Pro 後,所有素材都可任意商用嗎?
不能一概而論。CapCut 的價格、Standard/Pro 功能、AI 用量和素材可用性會按地區、裝置、方案和活動改變;商業使用亦要看個別音樂、字體、模板、貼紙和素材標示及條款。保存素材頁、授權狀態和下載日期,不要只保存完成影片。
AI 廣告一定要標示由 AI 生成嗎?
要看內容、平台和觀眾是否可能受誤導。若合成人物、事件、聲音、見證或產品效果可能被當成真實,應採取清晰披露;平台亦可能另有 altered 或 synthetic content 規則。即使只是示意,廣告聲稱仍須真實、有證據,不可用標示來補救誤導內容。
本文遵循我們的 編輯準則.

關於作者
HK Learn AI 編輯部
HK Learn AI 編輯部負責研究、查證同編寫每一篇內容,並引用官方及第一手來源。
此主題相關文章

Google AI 生態 30 個工作流選擇指南:Gemini、AI Studio、Gemini Notebook 與 Opal 怎樣分工
不要再把所有任務塞進同一個聊天框。本文把 30 個實用工作流按一般協作、模型與 App 原型、來源型研究、視覺自動化四類重整,逐步解釋 Gemini、Google AI Studio、Gemini Notebook(原 NotebookLM)和 Opal 的選擇、交接、成本、權限、驗證與發布關卡。

ChatGPT 協作 Excel:寫公式、生成 VBA、自動製圖與匯出 PDF 報表
用一份虛構銷售明細完整示範:先讓 ChatGPT 理解欄位與驗收規格,再建立列級銷售額、業務彙總與佔比公式,審查 VBA、重建直條圖,資料適合時再建立圓餅圖,最後輸出具時間戳的 PDF。

Google 表單複選資料整理:用 ChatGPT 寫 Excel VBA 拆分報名名單
Google 表單的核取方塊答案全擠在同一格?本文用匿名範例把分隔符號內的選項拆成逐列名單,完整示範需求規格、ChatGPT 提示詞、VBA、Module、測試、驗算與 Power Query 替代方案。