跳至主要內容
HK Learn AI
生成式 AI 教學

2026 AI 廣告製作全流程:腳本、角色、分鏡、生成、配音到剪輯

以虛構產品 Harbour Spark 示範一條 20 秒直式 DTC 廣告:由產品事實表、Claude 腳本、Nano Banana Pro 角色圖、Google Docs 分鏡、Higgsfield 的 Veo 3.1/Kling 3.0 逐鏡生成、ElevenLabs 粵語配音,到 CapCut 剪輯、成本、授權與逐鏡 QA。重點不是一鍵成片,而是每一鏡都可驗證、可重做、可交付。

HK Learn AI 編輯部標誌

HK Learn AI 編輯部

編輯部

發佈於 2026年7月25日

最後審閱:2026年7月25日

分享這篇文章
本頁內容
AI 廣告製作由產品事實、腳本、角色、分鏡、影片生成、配音走到 CapCut 成片的六階段流程

難度

中階

所需時間

3–6 小時,不包括生成排隊、內部審批與多輪重試

你需要準備

Claude 或所在地正式可用的文字模型 · Nano Banana Pro 或合適圖像模型 · Google Docs 或試算表 · Higgsfield、Veo 3.1、Kling 3.0 或 Seedance 2.0 · ElevenLabs · CapCut

開始之前

  • 先準備產品真實資料、包裝原檔、價格、銷售條款、品牌語氣及不可使用的聲稱
  • 確認人物、聲音、產品圖、字體、音樂、音效、場景和平台素材的商業使用權
  • 知道目標平台、影片比例、長度、語言、CTA、安全區和最終交付規格
  • 為每次生成記錄模型、日期、提示、參考素材、版本、花費和批准人
  • 只使用自己所在地及帳戶正式可用的服務,不繞過地區、身份或付款限制

一條 20 秒廣告,看似只是六個短鏡頭;真正困難的是六個鏡頭要同時做到產品正確、角色一致、節奏清楚、旁白自然、權利完整,而且每次按「Generate」都在消耗時間或 credits。若只輸入「幫我生成一條飲品廣告」,模型通常會自行改產品包裝、加上不能證明的功效、製造不存在的客戶見證,最後得到一段漂亮但不能投放的片。

本教學把工作拆成可以驗收的交付物:產品事實表 → 三個廣告概念 → 角色聖經 → 六鏡分鏡 → 逐鏡影片 → 配音 → CapCut 成片 → 權利、成本與發佈閘門。示範產品「Harbour Spark 柚子烏龍無糖氣泡茶」完全虛構,目的不是替任何飲品背書,而是讓你看清楚每一步應保存甚麼、由誰批准,以及失敗時要重做哪一小段。

如果你需要先比較整個市場的 AI 影片工具、平台規格與香港營銷風險,可先閱讀AI 影片製作香港營銷指南;本文是更窄的執行篇,專注一條 DTC 直式廣告如何逐鏡落地。本文屬製作及風險管理教育,不是法律意見;高價投放、受監管產品或具爭議聲稱應交由合資格法律及合規人員審核。

重構媒體披露:本文封面、6 張步驟圖、2 張影片海報及 2 段預覽影片,全部是為本教學重新設計的虛構操作示意。它們不是來源影片截圖或剪輯,不包含來源帳戶、頻道、講者、作者、社交平台身份或第三方推廣資料,也不重現任何真實品牌、人物或廣告。介面經過簡化,不代表供應商當日畫面;示範產品、價格、角色、數據、評分和生成結果均屬虛構。工具功能、配額、價格、地區和條款會更新,本文資料核對至 2026 年 7 月 26 日,正式使用前請重查第一方頁面及實際結帳畫面。

先看全圖:八個交付物、八個批准閘門

AI 廣告最容易失控,是因為腳本、圖片、影片和剪輯各自在不同工具內,沒有共同版本。以下流程不要求每家公司使用相同軟件,但要求每一階段都有輸入、輸出、驗收人和停止條件。只有上一階段通過,才花錢生成下一階段。

階段主要輸入必須交付批准閘門
0. 事實包裝、價錢、條款、證據產品事實表及禁用聲稱品牌/法務確認
1. 概念事實表、受眾、平台三個概念及 20 秒腳本一個方向獲批
2. 視覺品牌資產、角色設定角色聖經及產品比例一致性鎖定
3. 分鏡腳本、視覺參考六鏡表及驗收條件逐鏡可拍/可生成
4. 生成每鏡提示、起止參考獨立乾淨鏡頭逐鏡 QA
5. 聲音已批旁白、讀音表分句 WAV 及權利紀錄語言及同意通過
6. 剪輯批准鏡頭、音訊、品牌原檔9:16 主版及替代版畫面、聲音、字幕通過
7. 發佈完成片、聲稱證據、授權審批包、平台披露、版本指定負責人簽核

步驟零:先鎖定產品事實,否則漂亮腳本也不能用

AI 不知道哪一句是已證實的產品資料,哪一句只是常見廣告寫法。開始前建立一頁「Product Truth Sheet」,把每項聲稱連到內部證據、包裝、價目表或批准文件。示範表內的 Harbour Spark 是虛構資料,真實專案不可照抄。

欄位Harbour Spark 虛構示範製作規則
產品柚子烏龍無糖氣泡茶,330mL罐身尺寸與口味名稱不可由模型改寫
可用事實無添加糖;建議零售價 HK$18真實專案要連到包裝及批准價目
CTA加入新品通知名單不可寫成已開售或限時優惠
禁用聲稱減肥、排毒、零卡、提神、最健康沒有證據便不可出現在旁白、字幕或畫面
禁用證據形式虛構評價、醫生推薦、前後對比AI 生成亦不可冒充真實見證
批准人品牌、產品、法務各一名姓名、日期及版本寫入審批紀錄

香港海關的不良營商手法資料列出虛假商品說明、誤導性遺漏、餌誘式廣告等問題。AI 只是製作工具,不會令原本沒有證據的聲稱變得真實。每一句字幕、旁白和 CTA 都應回到事實表;若資料未定,腳本必須標「待品牌確認」,而不是讓模型猜。

步驟一:用 Claude 產生三個可比較概念,不直接叫它寫成片

文字模型最有價值的工作,是把同一批產品事實變成多個結構化選項,再暴露缺失資料。提示內要包括受眾、平台、長度、語氣、已核對事實、禁用聲稱和固定輸出格式。這樣創作團隊比較的是同一份 brief,而不是三段沒有共同標準的文案。

你是一位香港短片廣告創意策劃與製作統籌。請只使用以下已核對的產品事實,不要自行補充功效、成分、用戶評價或市場數據。

產品:Harbour Spark 柚子烏龍無糖氣泡茶(虛構示範產品)
已核對事實:330mL 鋁罐;無添加糖;柚子烏龍風味;建議零售價 HK$18;今次 CTA 是加入新品通知名單
不可聲稱:減肥、排毒、改善健康、零卡路里、提神效果、銷量第一、醫生推薦、真實客戶見證
受眾:香港 25–40 歲上班族
平台:9:16 直式短片
長度:20 秒
語言:繁體中文畫面字;自然香港粵語旁白
品牌語氣:清爽、克制、城市感;不要浮誇

請提出 3 個創意方向。每個方向必須輸出:
1. 一句核心概念;
2. 0–3 秒 Hook;
3. 逐鏡內容、每鏡秒數、旁白、畫面字、音效和 CTA;
4. 每鏡需要的角色、產品及場景參考;
5. 哪些字句是產品事實,哪些只是創意表達;
6. 生成難度與最可能失敗的位置;
7. 按 Hook 清晰度、證據安全、可生成程度、品牌一致性各以 5 分評分;
8. 列出需要人類再次確認的資料。

規則:不可虛構優惠、評論、人物身份或實拍證據;產品罐身文字留給後期疊加;如資料不足,請寫「待品牌確認」。
Harbour Spark 虛構產品事實表旁邊顯示三個 AI 廣告概念及 Hook、證據、可生成程度和 CTA 評分
重構示意圖一:先鎖定虛構產品事實,再比較三個概念;畫面不含來源帳戶、作者、真實品牌或平台身份。

不要只揀最高分:逐句做「事實、創意、待查」標記

模型輸出後,把每句分為三色:綠色是可由事實表支持,例如容量和已批准價錢;藍色是明顯創意表達,例如「把午後轉成清爽一刻」;紅色是待查或不可用,例如「全港最受歡迎」。創意表達亦不能暗示不存在的功效。最終概念應另存為 concept_v03_approved,並寫明哪一位人員在甚麼日期批准。

香港地區注意:截至本文核對日,Claude 官方支援地區清單沒有列香港。本文不建議以 VPN、虛假地址、外地電話、借用身份或他人帳戶繞過限制。你可以把同一結構化 Prompt 放到所在地和帳戶正式可用、符合公司資料政策的文字模型。付款前可閱讀Claude 香港訂閱、地區與帳戶風險指南。Claude 官方價格頁在核對日列出 Free、Pro 每月 US$20 或年付折算每月 US$17,以及 Max 由每月 US$100 起,但價格不代表香港已獲支援。

步驟二:用 Nano Banana Pro 建角色聖經,不把第一張靚圖直接當分鏡

角色一致性不是純粹「同一張臉」。髮型、服裝、年齡感、身形、飾物、光線、產品尺寸、持罐手勢和色彩都會漂移。先做一張角色聖經,把正面、側面、三分之四角度、全身、手持產品比例和不可改變項目放在同一畫面,再逐張批准。人物必須虛構,不模仿任何真人、網紅、員工或客戶。

建立一套虛構廣告角色及產品場景參考圖,不要模仿任何真人、名人、網紅、員工或現有品牌。

角色:虛構香港城市上班族,約 30 歲,短黑髮,米白色恤衫配深藍外套,平靜而自然的神情
角色固定錨點:臉形、髮型、服裝、耳環、膚色及身形在所有角度一致
產品:虛構 Harbour Spark 330mL 霧銀色鋁罐;青綠與柚子黃色色塊;罐身文字只保留乾淨留白,不生成細小品牌字
場景:沒有可識別店舖、路牌、帳戶、社交平台介面或第三方商標的城市茶飲空間

輸出一張 16:9 角色聖經:正面、三分之四角度、側面、全身、手持產品比例、色板、服裝細節、產品尺寸及「不可改變」清單。畫面要清晰銳利,不要景深模糊、動態殘影、額外手指、變形罐身、浮水印或介面身份。
Harbour Spark 虛構廣告角色的正面、側面、全身、服裝色板、產品比例與固定身份錨點
重構示意圖二:角色聖經只使用虛構人物與虛構包裝;清楚列出臉形、髮型、服裝和產品比例等不可改變項目。

Google 的圖像生成文件把 Nano Banana Pro 對應到 gemini-3-pro-image,定位於複雜、專業資產,支援較高解像度、參考圖和圖中文字;官方同時把 Nano Banana 2 列為較一般的全能選擇,所以不要把 Pro 寫成永遠最新或所有工作都必須使用的預設。可先用較快模型探索姿勢,再把獲批方向交給 Pro 做關鍵參考。

同一個「Gemini」名稱也有不同入口。Google 的 Gemini 網頁版可用地區頁在核對日列有香港,但Google AI Studio 和 Gemini API 可用地區頁沒有列香港。透過 Higgsfield 或其他平台使用某個 Google 模型,服務地區、功能、條款和收費由該平台決定,不能推論為 Google API 已在香港直接開放。

產品包裝不要交給生成模型定稿

生成圖的細字、條碼、營養資料、標誌比例和法定標籤容易錯。角色圖可保留乾淨罐身與色塊作構圖參考;真正品牌名稱、標誌、口味、容量和法定字樣在 CapCut 或設計軟件以已批准向量檔疊加。每張參考圖命名為 character_front_v02product_scale_v03,不要用「final-final-new」這類不可追蹤名稱。

步驟三:在 Google Docs 做六鏡分鏡,每一鏡只有一個工作

20 秒廣告不應一次生成。先用 Google Docs 或試算表建立六列,每列固定:鏡頭 ID、時間、目標、畫面、動作、鏡頭、旁白、畫面字、音效、起始參考、結束姿勢、連戲錨點、不可出現內容和驗收準則。這張表是所有工具之間的單一事實來源。

Google Docs 形式的 Harbour Spark 六鏡廣告分鏡表顯示秒數、鏡頭、動作、旁白、音效、連戲和批准狀態
重構示意圖三:六個不重複鏡頭各有單一任務、時間及驗收條件;所有縮圖與文字均為虛構示範。
鏡頭時間/工作畫面與動作旁白/畫面字關鍵 QA
S010–3 秒/Hook清晰罐身在桌面,凝結水珠;慢速推近「午後,想飲杯有氣口感?」首幀即見產品;文字稍後疊加
S023–6 秒/觸感同一角色單手拿起罐;鏡頭固定短開罐聲,沒有旁白五指正確;罐口、衣袖和尺寸一致
S036–9 秒/產品氣泡茶倒入透明杯;柚子皮只作視覺「柚子烏龍,無添加糖。」液體方向、杯緣、罐身不變形
S049–13 秒/情境角色在無商標城市茶飲空間小口品嚐「清爽一口,留返俾自己。」不可變成真實見證或誇張反應
S0513–16 秒/Packshot單罐置於品牌色背景,輕微轉台畫面字:330mL/無添加糖只用已核對事實;後期放真實標誌
S0616–20 秒/CTA產品與乾淨按鈕區,鏡頭完全穩定「加入新品通知名單」沒有假倒數、假優惠或不存在網址

先用靜態分鏡做 animatic

把六張靜態圖放到時間線,以旁白草稿和臨時音效播放一次。若 S01 到 S03 已經用了 11 秒,或者 CTA 只剩半秒,此時改分鏡幾乎沒有生成成本。Animatic 通過後才把每列標成「Ready for generation」,並凍結旁白版本。

重構預覽 A:虛構產品事實先鎖定,再由三個概念收斂成六鏡分鏡;預覽不使用來源片段、帳戶或人物身份,所有畫面保持清晰和穩定。

步驟四:在 Higgsfield 按鏡頭路由 Veo、Kling 或 Seedance

Higgsfield 是集合多個模型的入口;你在 Higgsfield 看見的模式、長度、credits 和功能,不一定等同直接使用 Google、Kling 或 ByteDance 的版本。開始前把每鏡需要的長度、原生音訊、起止畫面、參考數量和一致性列出,再按任務選模型。

選項較適合官方能力線索使用前要查
Veo 3.14/6/8 秒受控短鏡、參考圖、直式或橫式Google 文件列出原生音訊及多種解像度;Higgsfield 頁面列出其平台實際模式Standard/Fast 的參考及起止幀功能不同;不要假設 Higgsfield 提供 API 全部解像度
Kling 3.0較長鏡頭、多鏡敘事、元素一致性、原生音訊Kuaishou 官方發布資料列出最長 15 秒、多鏡與多模態輸入直接 Kling credits 不等同 Higgsfield credits;聲音和解像度會影響成本
Seedance 2.0需要比較多模態控制或替代動作演繹ByteDance 已於 2026 年 2 月發布 2.0舊教學的 Seedance 1.5 是較早版本;正確名稱不是 Sea Dance
Veo 3.1、Kling 3.0 和 Seedance 2.0 按鏡頭長度、參考控制、音訊和一致性分流並顯示兩個清晰結果幀
重構示意圖四:模型按鏡頭任務分流,右側只展示完成並通過 QA 的清晰結果;沒有 loading、進度條、動態模糊或重複畫面。

每次只生成一鏡,Prompt 要有起點和終點

鏡頭 ID:[S01]
用途:[Hook/產品展示/使用情境/CTA]
長度:[3 秒]
比例:9:16
主體:[只描述本鏡頭需要的人物和 Harbour Spark 虛構產品]
動作:[單一、可觀察、可在指定秒數完成的動作]
場景:[時間、位置、背景層次;不可出現第三方商標或可識別帳戶]
攝影機:[景別、焦段感、運鏡方向、速度、起點和終點]
光線與色彩:[柔和日光、青綠與暖黃品牌色]
起始參考:[檔名及版本]
結束要求:[要停在哪一個可剪接姿勢]
音訊:[無/環境聲/一句短對白;旁白稍後製作]
必須保持:[角色臉、服裝、罐身尺寸、罐口方向、品牌色]
排除:文字亂碼、變形手指、額外人物、罐身融化、標誌漂移、快速模糊、跳切、鏡頭外產品

只完成這一個鏡頭,不要把六個鏡頭合併生成。

「電影感、超高質、廣告級」不會自動解決連戲。真正有用的是可觀察條件:相機由哪裏移到哪裏、人物哪一隻手拿罐、動作在第幾秒完成、罐口朝向、最後停在哪個姿勢,以及哪些錯誤不能接受。若 S02 手指錯,只重做 S02;不要重新生成整條 20 秒廣告。

逐鏡十項 QA:先看 100%,再逐幀看

  1. 用途:本鏡是否完成分鏡指定工作,還是只得漂亮氣氛?
  2. 角色:臉形、髮型、服裝、膚色、飾物和年齡感是否一致?
  3. 手部:手指數量、關節、握罐位置和左右手是否合理?
  4. 產品:罐身比例、罐口、色塊、液體顏色和產品數量有沒有漂移?
  5. 文字:生成亂碼是否已完全移除,正式字樣是否留給後期?
  6. 物理:倒水、氣泡、影子、反射、布料和物件接觸是否可信?
  7. 鏡頭:運鏡方向、速度、焦點和終點是否符合下一鏡剪接?
  8. 聲音:若有原生音訊,對白、環境聲、口形和時間是否準確?
  9. 身份與權利:背景有沒有意外生成商標、路牌、真人或可識別帳戶?
  10. 技術:首尾幀、比例、解像度、幀率、壓縮和可用秒數是否符合交付?

每次輸出保存為 S03_v01_reject-handS03_v04_approved,並記錄失敗原因。不要只保存成功片,否則無法計算真實成本或發現模型反覆失敗的位置。Higgsfield 的條款在核對日說明訂閱會自動續期、訂閱 credits 不會結轉,加購 credits 亦有期限,且價格、模型權限和限制可調整;採購前要重新核對實際帳戶。

步驟五:用 ElevenLabs 製作分句旁白,先解決聲音權利

旁白有兩條路。Text to Speech 適合由已批准文字直接生成;Voice Changer 則可以先由人類錄出演繹、速度和停頓,再轉成獲授權的目標聲線。ElevenLabs 的Voice Changer 文件在核對日列出每段最長 5 分鐘及每分鐘 1,000 credits;短廣告仍應逐句處理,方便重錄一行而不用重做全部。

語言:香港粵語
角色:城市生活品牌旁白,不扮演真人或名人
情緒:清爽、自然、像向朋友介紹新品
速度:每分鐘約 150–165 個中文字,保留自然停頓
讀音:
- Harbour Spark:先試「Harbour Spark」英文讀法,再由品牌人員批准
- 柚子烏龍:讀作「柚子/烏龍」,不要變成普通話腔
- HK$18:讀作「十八蚊」

逐句輸出,句尾預留 4–6 幀剪接空間。不要自行加入功效、折扣或限時字眼。
Harbour Spark 廣告旁白波形按六個鏡頭對齊並顯示香港粵語讀音、同意、商業使用和人工核對清單
重構示意圖五:旁白拆成可重做的短句,讀音、時間、聲音同意和商業權利分開驗收;波形及資料均屬虛構。

香港粵語要逐字聽,不可只看「支援中文」

供應商寫支援 Chinese,不等於每個香港粵語詞、英文品牌名、金額和語氣自然。以手機喇叭、耳機和靜音字幕三種方式檢查;把品牌名、地名、產品名和數字放入讀音表。Pronunciation Dictionary 可以協助固定讀音,但不同模型的支援方式不同,若字典不生效,應使用拼音或別名測試並由香港粵語使用者批准。

聲音同意不可省略:ElevenLabs 官方說 Professional Voice Clone 只可建立自己的聲音;即使你已得到某人的同意,也不代表你可代他建立專業複製。聲音擁有人要按平台流程自行建立、驗證及在適用情況下分享。Instant Clone、Voice Changer 或其他平台同樣要確認錄音來源、同意範圍、使用期限、媒體渠道、地區、撤回安排和商業用途。最安全的示範是使用平台授權聲音、Voice Design,或團隊成員自己的已同意聲音。

步驟六:在 CapCut 組合,而不是用剪輯掩飾錯誤

先建立固定軌道:V1 批准影片、V2 真實產品包裝和標誌、V3 畫面字及字幕、A1 旁白、A2 音效、A3 音樂。所有影片先按 S01S06 排好,再調整 J-cut、L-cut 和節奏。不要把一個有六指、變形包裝或錯誤功效的鏡頭以快速轉場遮掩;應回到對應生成步驟重做。

CapCut 形式的六鏡廣告時間線顯示影片、真實品牌疊加、繁體字幕、旁白、音效、音樂、手機預覽和發布 QA
重構示意圖六:六個獨立鏡頭、字幕、旁白和品牌原檔在時間線組合,右側手機預覽及 QA 全部使用虛構資料,沒有來源帳戶或身份。

CapCut 剪輯次序

  1. 建立 1080 × 1920、9:16 專案,確認幀率和平台安全區。
  2. 只匯入標記為 approved 的鏡頭;代理檔和原檔放在分開資料夾。
  3. 先完成畫面節奏,再放最終旁白,避免為不必要句子拉長鏡頭。
  4. 以已批准向量或透明 PNG 疊加真實標誌、產品名稱、容量、價格和 CTA。
  5. 用 Auto Captions 產生字幕草稿,再逐字校對繁體中文、香港用語、分行和時間。
  6. 音樂先降低至不遮蓋人聲,音效只用來支持開罐、倒茶和轉場,不用聲浪掩飾剪接。
  7. 統一不同模型的白平衡、對比、顆粒和銳度;避免過度降噪令產品邊緣變軟。
  8. 輸出前在真實手機上播放一次,也以靜音播放檢查只看字幕是否仍能理解。

CapCut 官方說 Auto Captions 可在網頁、桌面和流動版本使用,但具體功能會按平台和地區不同;Pro 價格亦沒有單一全球定價。免費下載或 Pro 訂閱不等於所有 AI 功能、音樂、字體、模板、素材和匯出永久免費或全部可商用。使用任何 diamond/Pro/commercial asset 前,保存素材標示、條款和下載日期。

重構預覽 B:只使用通過逐鏡 QA 的清晰虛構素材,依次對齊旁白、字幕及 CTA;沒有 loading、模糊移動畫面、重複鏡頭或來源身份。

成本怎樣計:不要只數成功的六個鏡頭

正確公式是:成片成本 = 月費攤分 + 所有圖像及影片嘗試 + 配音及音樂 + 加購 credits、稅和匯率成本 + 人工剪輯、審批及 QA。即使某次輸出因手指錯誤而被棄用,它仍然是成本。團隊應在每次 Generate 前記錄畫面顯示的 credits 或金額,而不是月底憑記憶估算。

項目應記錄常見漏算
文字概念方案月費攤分、用量限制香港地區不可用時的替代工具及遷移時間
角色圖每張輸入、輸出、解像度及重試棄用角度、去背、產品原檔重疊
影片模型、秒數、解像度、每次 credits失敗片、排隊重做、放大和補幀
配音生成字數/分鐘、重錄、聲音方案讀音修正、錄音人同意及版本
剪輯Pro、素材、音樂、人工小時多比例輸出、字幕、法務修改
投放平台版本、A/B 變體、批准人錯版重發、素材到期、下架及重製

「低於 US$30」只能做情境示例

Higgsfield 自家一篇 2026 比較文章曾用約 US$1 作 10 秒 Kling 3.0、約 US$2.90 作 8 秒 Veo 3.1 的平台估算。若六鏡各用三個 Kling 和三個 Veo,而且全部一次成功,示例影片成本約 US$11.70;若每鏡平均試三次,同一算法已約 US$35.10。這仍未包括圖像、配音、月費、加購、稅、匯率、剪輯及人工,所以不能把「US$30 以下」寫成固定承諾。平台價格、credits 和可用模型會變,正式預算只可使用你當日帳戶顯示的數字。

Google API 價格頁在核對日把 Nano Banana Pro 圖像輸出列為約每張 US$0.134(1K/2K)及 US$0.24(4K),另計文字、圖像輸入和思考 tokens。若角色參考需要 12 個接受輸出、平均每張試三次,單是 36 張 2K 輸出已約 US$4.82,尚未計輸入。這正好說明「每個生成按鈕都要入帳」。

權利與香港合規:五類素材要各自留證明

完成片不是一個單一權利。產品原圖可能由攝影師擁有,字體有獨立 licence,音樂只容許社交貼文但不容許付費廣告,配音有地域或期限,AI 平台又可能對輸入和輸出有不同條款。建議每條廣告附一份 rights manifest。

素材要保存不可假設
人物/肖像同意書、用途、渠道、地區、期限、撤回上載相片便等於同意生成所有場景
聲音錄音來源、克隆方式、聲音擁有人批准公開影片聲音可以直接模仿
品牌/產品商標、包裝、價目、聲稱證據、批准版本AI 畫得像便代表資料正確
音樂/字體/模板素材頁、商用標示、下載日期、投放範圍付費方案內所有資產都可無限商用
AI 輸出工具條款、方案、模型、提示、日期、SynthID/水印資訊平台允許下載便等於沒有第三方權利風險

香港個人資料私隱專員公署的僱員使用生成式 AI 清單建議機構建立治理架構、可接受使用範圍、輸入資料規則、準確與偏差檢查,以及何時使用標籤或水印。不要把未公開客戶名單、員工資料、合約、個人錄音或拍攝素材隨意上載到未獲公司批准的服務。

甚麼時候要明確標示 AI?

如果虛構人物看似真實代言人、合成聲音像某個真人、生成場景似乎是實際活動、或產品效果可能被誤認為實拍證據,觀眾更容易受誤導,應作清晰、就近和容易理解的披露;平台亦可能要求 altered 或 synthetic content 標示。披露不是免責符:虛假價錢、假見證或沒有證據的功效,即使標示 AI 仍可能有問題。

媒體人工驗收:每張圖、每段預覽都過四關

教學媒體本身也要有品質閘。不要把自動抽幀後的所有畫面直接發佈;逐張以原尺寸查看,並保存一份接受/拒絕記錄。本文媒體規格刻意把六張圖分成六個不同交付物,避免同一個人物畫面重複出現。

  1. 有意義:讀者不看 caption 也能辨認這張圖是在說概念、角色、分鏡、模型路由、配音或剪輯;純裝飾畫面不算。
  2. 沒有身份:不可見來源平台帳戶、頻道、作者名、頭像、社交平台水印或第三方推廣身份;需要時重構,不以粗糙遮罩破壞資訊。
  3. 不重複:比較感知雜湊和人工構圖;同一畫面只換標題、放大或裁切仍屬重複。
  4. 清晰穩定:拒絕 loading、進度畫面、移動中模糊幀、對焦未完成、壓縮破圖、半個 UI、字幕被切和手指變形;影片 poster 要從穩定完成狀態選取。

預覽影片應使用 H.264 MP4、1280 × 720、24fps,以 7–9 秒展示四個穩定狀態;轉場以短淡入或位置插值完成,不用快速運鏡製造模糊。每段配獨立 poster 和 .zh-Hant.vtt 字幕。教學頁內不要把同一張步驟圖再次當兩段 poster。

發佈前最後 24 項清單

  1. 產品名稱、容量、口味、價錢和 CTA 與批准版本一致。
  2. 每項功效、比較、數據和優惠均有證據及有效日期。
  3. 沒有虛構客戶評價、醫生推薦、前後效果或銷量排名。
  4. 人物為虛構或已取得具體肖像同意。
  5. 聲音屬自己、獲授權聲音或平台可商用聲音。
  6. 沒有模仿名人、KOL、員工或客戶而未獲准。
  7. 產品包裝和標誌使用批准原檔,不依賴生成細字。
  8. 六鏡人物、服裝、產品比例、光線和方向一致。
  9. 手指、關節、倒水、反射、陰影和口形逐幀通過。
  10. 背景沒有意外商標、路牌、帳戶或可識別個人資料。
  11. 字幕是繁體中文,香港用語、分行和安全區已校對。
  12. 旁白品牌讀音、金額、語速和停頓由香港粵語使用者批准。
  13. 音樂、音效、字體、模板和貼紙有相應商業權利。
  14. AI 工具方案、條款、模型、提示、日期及輸出版本已保存。
  15. 所有失敗生成亦記入 credits 和成本。
  16. 影片沒有 loading、動態模糊、重複鏡頭或壓縮破圖。
  17. 首 3 秒在無聲播放時仍清楚。
  18. CTA 顯示至少有足夠時間閱讀及點擊。
  19. 9:16 主版在真實手機、小屏幕和弱網絡情境測試。
  20. 另存 16:9、1:1 或無字幕 master 時沒有拉伸畫面。
  21. 按平台規則完成 synthetic/altered content 披露。
  22. 品牌、產品、法務及投放負責人完成指定批准。
  23. 發布 master、字幕、海報、來源和 rights manifest 已備份。
  24. 設定素材到期、價格更新和下架覆核日期。

A/B 測試:只改一個變項,產品事實永遠不變

完成主版後可建立變體,但不要同時更改 Hook、角色、價錢、字幕和 CTA,否則無法知道甚麼造成差異。建議先測 Hook A「午後想飲杯有氣口感?」與 Hook B「茶香,都可以有氣。」;其餘五鏡、受眾、投放、CTA 和產品事實保持一致。

每個版本用清楚命名,例如 HS_9x16_HookA_v01_20260726。觀察 3 秒觀看率、完整觀看率、點擊率和最終轉換;不要只因觀看率高便聲稱廣告成功。如果 Hook 吸引錯誤受眾,可能增加播放但降低轉換。測試結束保存日期、受眾、預算、曝光和決定,下一輪只改一個變項。

常見失敗與最小修正

失敗不要這樣補救回到哪一步
產品名稱或價錢錯在錯誤罐身上再加一層細字事實表及產品原檔
角色每鏡不同叫模型「更一致」但不給參考角色聖經和固定錨點
20 秒故事塞太多用超快剪接和小字字幕六鏡分鏡,刪除次要訊息
倒茶變形以閃白、震動或音效遮住只重做 S03,簡化動作
粵語不自然加速或降噪掩飾讀音表、分句配音和人工重錄
字幕出現簡體或錯字接受自動字幕直接匯出CapCut 人工校對和品牌字庫
成本突然超標只報告六個成功鏡頭生成日誌、停止條件和低成本測試
不確定可否商用因為已付款便假設可以rights manifest 和第一方條款

交付資料夾:讓下一位同事可以重建成片

一條可交付 AI 廣告至少要有:00-brief 產品事實與批准、01-concepts 提示及概念版本、02-character 角色與產品參考、03-storyboard 六鏡表、04-generated-shots 接受及拒絕片、05-audio 旁白音效及同意、06-edit 專案與字幕、07-exports 平台版本,以及 08-rights-cost-approvals 授權、成本與簽核。不要只交一個 MP4。

生成日誌每列包括:鏡頭 ID、日期、平台、模型、模式、秒數、解像度、提示版本、參考版本、credits/金額、輸出檔、接受/拒絕、拒絕原因及批准人。工具日後改版時,團隊仍可以知道哪一鏡曾用甚麼方法,而不是重新猜一次。

延伸閱讀

總結:把 AI 當成鏡頭製作系統,不是成片按鈕

可用的 AI 廣告不是由最昂貴模型決定,而是由一連串小而清楚的決定累積:產品事實先鎖定、概念可比較、角色有固定錨點、分鏡每列只有一個工作、模型按鏡頭路由、每次失敗都有記錄、旁白有權利和香港語言核對、CapCut 只組合已批准資產,最後再由人類完成聲稱、授權、私隱和平台審批。

若團隊能從完成片反向找到每一句聲稱、每一張參考、每一次生成、每一項成本及每一個批准人,這條片才真正可重做、可擴展和可投放。若只剩一個漂亮 MP4,沒有事實表、權利和版本紀錄,它仍然只是一段風險不明的示範。

資料來源與引用

我們附上第一手及官方來源,方便你逐一核實。

  1. 1.Plans & PricingClaude by Anthropic
  2. 2.Where can I access Claude?Claude Help Center
  3. 3.Image generation with GeminiGoogle AI for Developers
  4. 4.Gemini Developer API pricingGoogle AI for Developers
  5. 5.Available regions for Google AI Studio and Gemini APIGoogle AI for Developers
  6. 6.Where you can use the Gemini web appGoogle Gemini Apps Help
  7. 7.Veo 3.1 — AI Video Generation on HiggsfieldHiggsfield
  8. 8.Higgsfield PricingHiggsfield
  9. 9.Higgsfield vs Runway 2026Higgsfield
  10. 10.Terms of Use AgreementHiggsfield
  11. 11.Video generation in the Gemini APIGoogle AI for Developers
  12. 12.Kling AI Launches 3.0 ModelKuaishou Technology
  13. 13.Kling AI Video 3.0 Model User GuideKling AI
  14. 14.Seedance 1.5 proByteDance Seed
  15. 15.Seedance 2.0 Official LaunchByteDance Seed
  16. 16.ElevenLabs PricingElevenLabs
  17. 17.Text to SpeechElevenLabs Documentation
  18. 18.Voice ChangerElevenLabs Documentation
  19. 19.Pronunciation dictionariesElevenLabs Documentation
  20. 20.Can I create a Professional Voice Clone of someone else's voice?ElevenLabs Help Center
  21. 21.How Much Does CapCut Pro Cost?CapCut
  22. 22.CapCut Standard vs ProCapCut
  23. 23.How do I recognise subtitles?CapCut
  24. 24.Unfair Trade PracticesHong Kong Customs and Excise Department
  25. 25.Checklist on Guidelines for the Use of Generative AI by EmployeesOffice of the Privacy Commissioner for Personal Data, Hong Kong

常見問題

這套 AI 廣告流程可以完全免費嗎?

可以用免費層級做概念測試,但不應假設完整商業廣告必定零成本。圖像和影片生成通常按 credits、秒數、解像度或模型收費;配音、音樂、商用素材、無浮水印匯出和團隊審批亦可能產生成本。先做低解像度測試,再只為已批准鏡頭使用較高成本模型。

一條 20 秒 AI 廣告真的可以低於 US$30 嗎?

有可能,但不是保證。成本視乎現有月費、模型、片長、解像度、失敗重試、加購 credits、配音和人工而定。按 Higgsfield 自家一份有日期的示例估價,三個 Kling 加三個 Veo 鏡頭若全部一次成功約 US$11.70;若每鏡平均三次,單是影片已約 US$35.10,尚未包括其他費用。

Claude 官方未列香港,香港讀者應怎樣做?

不要用 VPN、虛假地址、借用身份或他人帳戶繞過限制。截至本文核對日,Claude 官方支援地區清單沒有列香港。可把本文的結構化 Prompt 複製到你所在地和帳戶正式可用、而且符合公司資料政策的文字模型;付款前亦可先看本站的 Claude 香港訂閱指南。

Nano Banana Pro 和 Nano Banana 2 應該怎樣選?

Google 現時把 Nano Banana 2 定位為一般全能圖像模型,而 Nano Banana Pro 適合較複雜、專業資產、較高解像度、較多參考和文字處理。角色聖經可先用較快模型探索,鎖定方向後才以 Pro 製作關鍵參考。模型名稱、價格和地區支援要以實際入口為準。

Veo 3.1 和 Kling 3.0 哪一個較適合廣告?

沒有一個模型適合所有鏡頭。Veo 3.1 適合指定 4、6、8 秒的短鏡及參考控制;Kling 3.0 可處理較長、多鏡、原生音訊和元素一致性。先按鏡頭任務測試,而不是把品牌偏好當成品質結論;經 Higgsfield 使用時,功能和價格亦不一定等同直接供應商。

Seedance 1.5 是否仍是現行版本?

Seedance 1.5 pro 是較早版本;ByteDance 已在 2026 年 2 月正式發布 Seedance 2.0。舊教學出現 1.5 並不代表名稱錯誤,但新文章和新專案應把 2.0 當成現行比較選項,再以實際平台可用版本為準。正確拼法是 Seedance,不是 Sea Dance。

影片模型已有原生音訊,仍需要 ElevenLabs 嗎?

不一定。環境聲、簡短對白或概念測試可先用影片模型音訊;需要統一旁白聲線、精準時間、修正品牌讀音和多版本輸出時,獨立 TTS 或 Voice Changer 較容易控制。不要同時保留兩套不一致的人聲,並要分別確認每套輸出的授權。

可以複製員工、客戶或 KOL 的聲音嗎?

不可因為網上有錄音便直接複製。ElevenLabs 官方說 Professional Voice Clone 只可建立自己的聲音;即使對方同意,也應由聲音擁有人自行建立、驗證及在適用情況下分享。其他複製方式亦要有清楚、具體、可保存的同意和商業使用範圍。

購買 CapCut Pro 後,所有素材都可任意商用嗎?

不能一概而論。CapCut 的價格、Standard/Pro 功能、AI 用量和素材可用性會按地區、裝置、方案和活動改變;商業使用亦要看個別音樂、字體、模板、貼紙和素材標示及條款。保存素材頁、授權狀態和下載日期,不要只保存完成影片。

AI 廣告一定要標示由 AI 生成嗎?

要看內容、平台和觀眾是否可能受誤導。若合成人物、事件、聲音、見證或產品效果可能被當成真實,應採取清晰披露;平台亦可能另有 altered 或 synthetic content 規則。即使只是示意,廣告聲稱仍須真實、有證據,不可用標示來補救誤導內容。

本文遵循我們的 編輯準則.

HK Learn AI 編輯部標誌

關於作者

HK Learn AI 編輯部

HK Learn AI 編輯部負責研究、查證同編寫每一篇內容,並引用官方及第一手來源。