跳至主要內容
HK Learn AI
生成式 AI 教學

2026 AI 廣告製作全流程:腳本、角色、分鏡、生成、配音到剪輯

以虛構產品 Harbour Spark 示範一條 20 秒直式 DTC 廣告:由產品事實表、Claude 腳本、Nano Banana Pro 角色圖、Google Docs 分鏡、Higgsfield 的 Veo 3.1/Kling 3.0 逐鏡生成、ElevenLabs 粵語配音,到 CapCut 剪輯、成本、授權與逐鏡 QA。重點不是一鍵成片,而是每一鏡都可驗證、可重做、可交付。

HK Learn AI 編輯部標誌

HK Learn AI 編輯部

編輯部

發佈於 2026年7月25日

最後審閱:2026年7月26日

分享這篇文章
本頁內容
AI 廣告製作由產品事實、腳本、角色、分鏡、影片生成、配音走到 CapCut 成片的六階段流程

難度

中階

所需時間

3–6 小時,不包括生成排隊、內部審批與多輪重試

你需要準備

Claude 或所在地正式可用的文字模型 · Nano Banana Pro 或合適圖像模型 · Google Docs 或試算表 · Higgsfield、Veo 3.1、Kling 3.0 或 Seedance 2.0 · ElevenLabs · CapCut

開始之前

  • 先準備產品真實資料、包裝原檔、價格、銷售條款、品牌語氣及不可使用的聲稱
  • 確認人物、聲音、產品圖、字體、音樂、音效、場景和平台素材的商業使用權
  • 知道目標平台、影片比例、長度、語言、CTA、安全區和最終交付規格
  • 為每次生成記錄模型、日期、提示、參考素材、版本、花費和批准人
  • 只使用自己所在地及帳戶正式可用的服務,不繞過地區、身份或付款限制

這套流程示範的不是「輸入一句話便得到完整廣告」,而是把一條短廣告拆成六個可獨立檢查的工序:先用 Claude 整理概念,再建立角色與場景參考、設計逐鏡關鍵幀、把靜態畫面轉成短片、挑選旁白,最後在 CapCut 對齊畫面、聲音和節奏。來源教學以一段罐裝飲品情境廣告作示範;本文只分析製作方法,不把畫面中的品牌、人物或文案當成本站推薦或真實成效證據。

媒體披露:文章封面是 ImageGen 製作的編輯圖片;內文使用獲授權的真實來源教學截圖與影片片段,所有畫面均裁走來源身份、帳戶、個人資料及社交平台推廣區。三段預覽片均為靜音,只用來展示動作、剪接與畫面連續性。全部內文媒體已於 2026-07-26 逐張、逐段人工檢查。

40 分鐘來源教學時間軸

先按來源影片的實際章節理解工作次序。不要在角色未定稿時大量生成影片,也不要在旁白尚未切句時便微調每一個剪接點。

來源時間示範階段本階段應留下的交付物
00:00–01:50成片方向與流程預覽廣告目的、片長、比例、參考節奏
01:50–04:09Claude 廣告概念故事大綱、角色任務、鏡頭清單
04:09–09:29角色與場景生成角色描述、獲選人物/場景參考
09:29–19:40Storyboard 與產品關鍵幀每一鏡的構圖、起點、終點與連戲條件
19:40–26:14Higgsfield/Kling/Veo 影片生成逐鏡短片、版本與接受/拒絕紀錄
26:14–28:02ElevenLabs 旁白選擇已批准聲線、分句音檔與讀音核對
28:02–38:40CapCut 剪輯、同步、音效與音樂畫面主軌、旁白、音效、音樂及完成版

步驟一:先把概念寫成可拍、可生成的鏡頭

來源教學由 Claude 協助建立廣告概念,但真正有用的輸出不是一段華麗文案,而是「誰在甚麼場景做甚麼、鏡頭由哪裏開始、何時切到產品、最後如何收束」。實作時先提供片長、平台比例、受眾、產品事實、禁用聲稱和參考節奏,再要求模型輸出逐鏡表。每一鏡最好只有一個主要動作,例如鬧鐘響、人物起身、拿起產品、開罐、飲用或結尾反應。

逐鏡表至少要有:鏡頭編號、秒數、景別、人物、動作、產品位置、相機運動、起始幀、結束幀、旁白、音效和失敗條件。若模型寫出產品功效、價格、銷量或見證,必須回到品牌資料核實;流暢文字不是證據。香港廣告專案亦應留意香港海關不良營商手法資料,避免把生成內容當成可直接使用的商品說明。

步驟二:把角色描述寫到可以重複生成

角色一致性先由文字 brief 開始。來源畫面把年齡感、身形、髮型、鬍鬚、衣着、神情、坐姿、房間光線與背景窗戶逐項寫出。這種描述比「一個疲倦男人」更可重複,因為後續每一張圖都可逐項比對。商業專案不要要求模仿真人或名人;應把參考拆成可描述的造型特徵,並使用有權使用的虛構角色。

AI 廣告男性角色的年齡、身形、頭髮、衣着、神情、坐姿與臥室光線文字 brief
來源步驟 06:50:角色 brief 不只寫外貌,也鎖定衣着、神情、姿勢、冷藍灰晨光和百葉窗背景,方便後續逐鏡檢查一致性。

完成文字描述後,再從生成結果挑一個真正適合故事的雙人場景。選擇時不要只看單張是否漂亮,要看角色能否在下一鏡保持髮型、衣着、床鋪位置、視線方向與人物關係。把獲選圖另存為主參考,未獲選版本不要混入後續生成。

獲選的雙人臥室角色場景,人物位置、衣着、床鋪與視線關係清楚
來源步驟 08:30:由多個結果選出主場景;這張圖建立兩名角色、床鋪位置、鏡頭高度與表情關係,後續分鏡都要沿用同一視覺規則。

步驟三:把靜態圖整理成 Storyboard,而不是直接長片生成

來源教學明確把 image-to-video 拆成多張關鍵畫面:飲用、反應、產品近鏡等畫面先各自成立,再交給影片模型補上動作。這樣做的優點是角色或罐身出錯時,只重做一個鏡頭,不用推翻整條廣告。

四個連續廣告關鍵畫面說明由靜態 image 逐鏡轉成 video
來源步驟 09:50:四張完成狀態先定義飲用與反應節奏,之後才逐鏡生成動作;每一張都是下一段短片的視覺錨點。

Storyboard 的畫面不能只標「兩個人在房間」。要記錄前景人物、後景人物、誰清晰、誰故意失焦、鏡頭高度和留白。來源的雙人床上構圖把女角色放在前景,男角色在後方坐起,冷色窗光保持不變;這個構圖既交代關係,也為下一個產品近鏡保留剪接方向。

雙人臥室廣告分鏡,前景角色躺在床上,後景角色坐起並保留冷色窗光
來源步驟 12:50:Storyboard 先鎖定前後景、視線和景深。後方人物較柔是構圖選擇,不是擷取到移動畫面的模糊幀。

產品鏡頭要再獨立定義。手指數量、握法、罐身比例、標誌方向、床單質感與光線,都要在影片生成前看清楚。正式品牌專案尤其不應把生成罐身細字當作批准包裝;可先用乾淨參考完成動作,再於剪輯階段疊加品牌提供的正確包裝資產。

手拿罐裝產品的近鏡關鍵幀,顯示手部、罐身比例、方向與冷色床鋪背景
來源步驟 15:10:產品 keyframe 是動作起點,也是 QA 基準;生成後要逐幀檢查手部、罐口、標誌方向和產品比例有沒有漂移。

步驟四:在影片工具內逐鏡設定模型、起止幀與長度

來源在 Higgsfield 的 Create Video 流程中示範選擇 Kling 3.0、加入 start frame/end frame、設定片長、比例和解像度,再輸入單一鏡頭的動作。不同入口提供的模型、credits、秒數及控制項可能不同;正式生成前應以Higgsfield 的 Veo 3.1 說明當日價格頁及實際帳戶畫面為準。

Higgsfield Create Video 畫面顯示 Kling 3.0、起始幀、結束幀、Multi-shot、五秒、16比9與720p設定
來源步驟 19:50:先選模型和控制方式,再上載關鍵幀;一次只處理一個明確動作,方便重試及計算真實 credits。

實際檢查一:提示是否真的轉成所需動作

第一段真實預覽把鬧鐘畫面變成手指按掣的短動作。觀看時不要只看最後一幀:要看手是否由合理位置進入、按掣時有沒有穿模、數字和鬧鐘外形有沒有跳變,以及鏡頭是否在可剪接位置停下。

真實來源預覽 01(21:49.0–21:52.7,靜音):用動作結果核對提示的時間與方向;poster 只作本影片縮圖,沒有在文章另行重複展示。

實際檢查二:產品與手部能否跨幀保持

產品動作比純鏡頭移動更容易失敗。第二段預覽保留開罐動作,讀者應集中檢查拉環、拇指、罐口、標誌和手腕是否在整段連續。若只有一兩幀錯誤,不要用快速轉場遮住;回到該鏡頭重做,並把 prompt 簡化成單一動作。

真實來源預覽 02(23:44.8–23:49.3,靜音):集中檢查開罐動作、手指、拉環和罐身在時間上的連續性。

步驟五:在 ElevenLabs 先篩聲線,再逐句生成

來源先在聲音庫以語言、口音、用途、性別和年齡等條件縮小選擇,再把旁白分句輸出。選聲時應比較語氣是否符合畫面,而不是只挑最有戲劇性的聲音。香港項目還要由香港粵語使用者逐字聽品牌名、金額、語速和停頓;供應商標示支援中文,不代表每個香港用語都自然。

ElevenLabs 聲音庫的語言、口音、用途、性別與年齡篩選介面
來源步驟 26:50:以條件篩選旁白候選,逐一試聽後才批准;畫面中的聲音庫項目只是介面例子,不構成特定聲線推薦。

旁白最好按鏡頭分成短檔,檔名包含鏡頭編號與版本。這樣某一句讀音或停頓不合格時,只重做該句。使用 TTS、Voice Changer 或聲音克隆前,要確認錄音來源、同意範圍、商業用途與保存期;可參考 ElevenLabs 的Text to Speech 文件Voice Changer 文件及聲音克隆規則。

步驟六:在 CapCut 先排畫面,再同步旁白

來源在 CapCut 先把所有獲選影片匯入,按故事次序放到同一條主畫面軌。第一輪只處理鏡頭長短與切點:鬧鐘、雙人場景、產品近鏡、飲用和反應畫面是否順序清楚,總長度是否符合廣告要求。此時不要急着加大量轉場或濾鏡。

CapCut 媒體庫、產品預覽與第一條完整廣告畫面時間線
來源步驟 28:50:先把獲選鏡頭放到 V1 主軌,確認每段開頭、結尾和整體故事順序;媒體庫與時間線都已可見。

旁白同步:以語意切點對齊,不要把畫面任意拉長

畫面骨架成立後,再把分句旁白放到音訊軌,將每一句的關鍵字對齊相關動作。若旁白比鏡頭長,先刪減句子或重錄語速,不應把三秒動作硬拉成六秒。保留少量句尾空間,讓切點不會緊貼最後一個字。

CapCut 媒體庫內的分句旁白波形與下方完整畫面序列
來源步驟 32:30:旁白以多個短音檔管理,再逐句對齊主畫面;這個狀態與初次排片不同,重點是語音節奏。

音效:讓聲音落在可見動作上

來源為鬧鐘開場加入三個短促 alarm/beep 音效區塊。音效應對齊畫面事件,而不是鋪滿整段:按掣、開罐或物件落桌等瞬間,可放在波形尖峰或動作接觸幀附近,再以耳機及手機喇叭各聽一次。

CapCut 鬧鐘預覽與時間線上三個已插入的 Alarm 音效區塊
來源步驟 35:10:上方保留穩定鬧鐘畫面,下方只顯示已放入時間線的三個短音效;搜尋結果與任何上載者身份均已裁走。

背景音樂:先鋪節奏,再讓旁白保持可懂

最後才加入背景音樂。來源畫面可見一條完整音樂波形位於產品預覽下方;實作時先把音樂當節奏底,然後在旁白出現時降低音量,檢查開頭及結尾有沒有突兀切斷。素材能在剪輯器搜尋到,不代表自動擁有所有商業投放權;保存素材頁、授權標示及下載日期。

CapCut 產品預覽與已插入時間線的背景音樂波形
來源步驟 37:30:完成後期音樂放置的穩定狀態;只保留播放器與實際音樂軌,搜尋結果中的創作者資料及旁白檔名均不在畫面內。

步驟七:觀看完成版時,逐鏡核對連戲與節奏

完成版不是只看「像不像廣告」。至少播放三次:第一次正常速度看故事是否清楚;第二次靜音看沒有旁白時能否理解;第三次逐幀看手部、面孔、產品、光線與剪接。下面是真實來源完成段落的靜音摘錄,可看到鬧鐘、床上情境、產品、飲用反應與全身產品鏡頭如何串成一條短廣告。

真實來源預覽 03(38:18.3–38:35.5,靜音):17.16 秒內包含多個不同鏡頭,適合檢查節奏、產品連續性和角色反應;poster 選自後段完整手持產品畫面,沒有與開罐 poster 重複。

每一鏡都要通過的十項 QA

  1. 任務:鏡頭是否完成分鏡指定的唯一工作?
  2. 角色:臉形、髮型、衣着、年齡感和人物位置是否延續?
  3. 手部:手指、關節、握法與物件接觸是否合理?
  4. 產品:罐身比例、罐口、方向、數量和包裝有沒有跳變?
  5. 物理:開罐、飲用、影子、布料與反射是否連續?
  6. 鏡頭:運鏡速度、焦點和結束姿勢能否接下一鏡?
  7. 文字:生成細字是否錯誤;正式標誌是否使用批准原檔?
  8. 聲音:旁白、音效與畫面事件是否同步,音樂有沒有蓋過人聲?
  9. 權利:人物、聲線、字體、音樂、音效、產品圖及生成平台是否有可保存的使用依據?
  10. 輸出:比例、解像度、幀率、字幕、安全區和檔名是否符合交付規格?

成本與權利:失敗版本也要入帳

真實成本應包括所有圖像及影片嘗試、失敗重做、月費或 credits、旁白、音樂、剪輯與人工 QA,而不是只計最後三段成功片。Higgsfield、直接模型供應商與不同方案的 credits 不能互換;以生成當刻的帳戶畫面和平台條款記錄為準。CapCut 的 Pro 價格、AI 用量與素材權限亦會按地區和方案改變,可查閱官方價格說明及素材當日標示。

團隊應為每一鏡保存:模型、日期、提示版本、參考圖版本、秒數、解像度、花費、輸出檔、接受/拒絕、拒絕原因及批准人。若涉及客戶、員工或未公開素材,也要按公司政策處理;香港個人資料私隱專員公署的僱員使用生成式 AI 清單提供治理、輸入資料、準確性與標示方面的檢查方向。

交付前清單

  • 概念、角色、Storyboard、逐鏡影片、旁白與剪輯檔各有清楚版本。
  • 所有鏡頭均以原尺寸看過,沒有 loading、半完成畫面或移動模糊。
  • 沒有用快速轉場遮掩手部、產品或面孔錯誤。
  • 旁白由目標語言使用者核對,字幕逐字校正。
  • 音效落在可見動作;背景音樂不遮蓋人聲。
  • 產品聲稱、價格與 CTA 回到已批准資料。
  • 人物、聲音、字體、音樂、音效及生成輸出權利有紀錄。
  • 完成版在手機、耳機、手機喇叭和靜音狀態各播放一次。
  • 發布 master、poster、字幕、來源、成本表與批准紀錄已備份。

延伸閱讀

總結

這條來源教學最值得保留的不是某一個模型名稱,而是製作順序:先把概念拆成鏡頭,再鎖定角色和關鍵幀;影片逐鏡生成、逐鏡驗收;旁白分句;CapCut 先排畫面、再同步人聲、再加音效和音樂;最後用完成版反查每一個錯誤與權利。只要每一鏡都有清楚輸入、輸出、版本和停止條件,失敗時便能回到最小步驟重做,而不是重新生成整條廣告。

資料來源與引用

我們附上第一手及官方來源,方便你逐一核實。

  1. 1.Plans & PricingClaude by Anthropic
  2. 2.Where can I access Claude?Claude Help Center
  3. 3.Image generation with GeminiGoogle AI for Developers
  4. 4.Gemini Developer API pricingGoogle AI for Developers
  5. 5.Available regions for Google AI Studio and Gemini APIGoogle AI for Developers
  6. 6.Where you can use the Gemini web appGoogle Gemini Apps Help
  7. 7.Veo 3.1 — AI Video Generation on HiggsfieldHiggsfield
  8. 8.Higgsfield PricingHiggsfield
  9. 9.Higgsfield vs Runway 2026Higgsfield
  10. 10.Terms of Use AgreementHiggsfield
  11. 11.Video generation in the Gemini APIGoogle AI for Developers
  12. 12.Kling AI Launches 3.0 ModelKuaishou Technology
  13. 13.Kling AI Video 3.0 Model User GuideKling AI
  14. 14.Seedance 1.5 proByteDance Seed
  15. 15.Seedance 2.0 Official LaunchByteDance Seed
  16. 16.ElevenLabs PricingElevenLabs
  17. 17.Text to SpeechElevenLabs Documentation
  18. 18.Voice ChangerElevenLabs Documentation
  19. 19.Pronunciation dictionariesElevenLabs Documentation
  20. 20.Can I create a Professional Voice Clone of someone else's voice?ElevenLabs Help Center
  21. 21.How Much Does CapCut Pro Cost?CapCut
  22. 22.CapCut Standard vs ProCapCut
  23. 23.How do I recognise subtitles?CapCut
  24. 24.Unfair Trade PracticesHong Kong Customs and Excise Department
  25. 25.Checklist on Guidelines for the Use of Generative AI by EmployeesOffice of the Privacy Commissioner for Personal Data, Hong Kong

常見問題

這套 AI 廣告流程可以完全免費嗎?

可以用免費層級做概念測試,但不應假設完整商業廣告必定零成本。圖像和影片生成通常按 credits、秒數、解像度或模型收費;配音、音樂、商用素材、無浮水印匯出和團隊審批亦可能產生成本。先做低解像度測試,再只為已批准鏡頭使用較高成本模型。

一條 20 秒 AI 廣告真的可以低於 US$30 嗎?

有可能,但不是保證。成本視乎現有月費、模型、片長、解像度、失敗重試、加購 credits、配音和人工而定。按 Higgsfield 自家一份有日期的示例估價,三個 Kling 加三個 Veo 鏡頭若全部一次成功約 US$11.70;若每鏡平均三次,單是影片已約 US$35.10,尚未包括其他費用。

Claude 官方未列香港,香港讀者應怎樣做?

不要用 VPN、虛假地址、借用身份或他人帳戶繞過限制。截至本文核對日,Claude 官方支援地區清單沒有列香港。可把本文的結構化 Prompt 複製到你所在地和帳戶正式可用、而且符合公司資料政策的文字模型;付款前亦可先看本站的 Claude 香港訂閱指南。

Nano Banana Pro 和 Nano Banana 2 應該怎樣選?

Google 現時把 Nano Banana 2 定位為一般全能圖像模型,而 Nano Banana Pro 適合較複雜、專業資產、較高解像度、較多參考和文字處理。角色聖經可先用較快模型探索,鎖定方向後才以 Pro 製作關鍵參考。模型名稱、價格和地區支援要以實際入口為準。

Veo 3.1 和 Kling 3.0 哪一個較適合廣告?

沒有一個模型適合所有鏡頭。Veo 3.1 適合指定 4、6、8 秒的短鏡及參考控制;Kling 3.0 可處理較長、多鏡、原生音訊和元素一致性。先按鏡頭任務測試,而不是把品牌偏好當成品質結論;經 Higgsfield 使用時,功能和價格亦不一定等同直接供應商。

Seedance 1.5 是否仍是現行版本?

Seedance 1.5 pro 是較早版本;ByteDance 已在 2026 年 2 月正式發布 Seedance 2.0。舊教學出現 1.5 並不代表名稱錯誤,但新文章和新專案應把 2.0 當成現行比較選項,再以實際平台可用版本為準。正確拼法是 Seedance,不是 Sea Dance。

影片模型已有原生音訊,仍需要 ElevenLabs 嗎?

不一定。環境聲、簡短對白或概念測試可先用影片模型音訊;需要統一旁白聲線、精準時間、修正品牌讀音和多版本輸出時,獨立 TTS 或 Voice Changer 較容易控制。不要同時保留兩套不一致的人聲,並要分別確認每套輸出的授權。

可以複製員工、客戶或 KOL 的聲音嗎?

不可因為網上有錄音便直接複製。ElevenLabs 官方說 Professional Voice Clone 只可建立自己的聲音;即使對方同意,也應由聲音擁有人自行建立、驗證及在適用情況下分享。其他複製方式亦要有清楚、具體、可保存的同意和商業使用範圍。

購買 CapCut Pro 後,所有素材都可任意商用嗎?

不能一概而論。CapCut 的價格、Standard/Pro 功能、AI 用量和素材可用性會按地區、裝置、方案和活動改變;商業使用亦要看個別音樂、字體、模板、貼紙和素材標示及條款。保存素材頁、授權狀態和下載日期,不要只保存完成影片。

AI 廣告一定要標示由 AI 生成嗎?

要看內容、平台和觀眾是否可能受誤導。若合成人物、事件、聲音、見證或產品效果可能被當成真實,應採取清晰披露;平台亦可能另有 altered 或 synthetic content 規則。即使只是示意,廣告聲稱仍須真實、有證據,不可用標示來補救誤導內容。

本文遵循我們的 編輯準則.

HK Learn AI 編輯部標誌

關於作者

HK Learn AI 編輯部

HK Learn AI 編輯部負責研究、查證同編寫每一篇內容,並引用官方及第一手來源。