跳至主要內容
HK Learn AI
content-creation

HeyGen 廣東話 AI Avatar 教學:虛擬分身、配音、字幕與輸出

由本人同意、Stock/Photo/Digital Twin 選型、Avatar V/IV、AI Studio 分場景、繁體廣東話配音、自動字幕修正到影片、音訊與 SRT 輸出,建立一套不冒充、不偷聲、可逐句驗收的 HeyGen 製作流程。

HK Learn AI 編輯部標誌

HK Learn AI 編輯部

編輯部

發佈於 2026年7月25日

最後審閱:2026年7月25日

分享這篇文章
本頁內容
HeyGen 廣東話 AI Avatar 由本人同意、虛擬分身、配音字幕走到人工驗收與輸出

難度

中階

所需時間

45–120 分鐘;Digital Twin 審核及重新生成時間另計

你需要準備

HeyGen 帳戶及 AI Studio · 本人或已取得明確授權的人物素材 · 已批准的廣東話腳本 · 耳機、手機及桌面瀏覽器 · 權利清單、版本表及字幕校對表

開始之前

  • 只為本人建立 Digital Twin,或已取得畫面中本人對指定用途的明確同意
  • 不複製同事、客戶、藝人、KOL、配音員或其他第三者聲線
  • 腳本事實、人物、相片、商標、字型、音樂和背景畫面均有合法使用權
  • 知道免費配額、片長、解像度、Premium Credits 和下載功能會隨地區及方案更新
  • 願意逐句聆聽、逐幀觀看及實際開啟輸出檔,而不是看到生成完成便發布

HeyGen 把文字、Avatar、聲音、字幕和場景編輯放進同一個製作環境,最吸引人的地方是不用每次搭景、拍攝和重錄,也能快速更新培訓、介紹或支援影片。但「快速生成」不等於「可以使用任何人的樣貌和聲線」,也不等於廣東話、嘴形、字幕與事實會自動正確。真正可重用的流程要由同意與權利開始,以短場景生成,最後由真人逐句、逐幀和逐檔驗收。

本文把常見示範更新成 2026 年工作流:先分清 Stock Avatar、Photo Avatar、Digital Twin 與 Avatar V/IV/III,再在 AI Studio 建場景、選 Chinese (Cantonese — Traditional)、修正字幕和下載影片。若你要先理解不同 AI 影片工具的角色,可配合香港 AI 影片營銷完整指南;本文集中 HeyGen 的身份、聲音、場景和交付細節,不重複一般影片策略。

媒體披露:本文封面、6 張步驟圖、2 張影片海報及 2 段預覽影片全部是重構操作示意,使用虛構內部培訓專案與虛構資料。它們不是來源影片、HeyGen 帳戶或任何創作者畫面的截圖或片段,也沒有來源社交平台、頻道、作者、帳戶、真實人物或推廣身份。每張圖和每格影片均使用穩定完成狀態,沒有載入畫面、移動模糊或重複圖像。產品介面、方案與功能會更新,請以 2026 年 7 月 26 日後你的帳戶和第一方文件為準。

先理解四層:Avatar、聲音、字幕與成品是不同權利

第一層是人物影像:你是否有權把某人的面孔、身體動作和身份放進 AI 系統及成品。第二層是聲音:即使人物同意拍片,也不必然同意建立可反覆生成的 voice clone。第三層是腳本和素材:公司簡報、客戶 logo、相片、圖示、字型與音樂都有獨立權利。第四層是發布:內部十人觀看的授權,不一定覆蓋公開廣告、跨地區投放或永久保存。

所以不要用一句「對方話可以」代替權利清單。記錄同意人、批准人、用途、平台、地區、期間、可否修改、可否建立分身、可否合成聲音、撤回方法及檔案保存位置。任何一格待確認,就不要上載該資產。

HeyGen AI Avatar 專案開始前的影像、聲音、腳本及素材權利清單
重構示意圖一:人物影像、本人聲音、批准腳本與素材 licence 分開核對;右下角待確認的音樂令專案暫停,畫面全屬虛構。
專案:[影片名稱/版本]
用途:[內部培訓/公開推廣/客戶支援]
觀眾:[誰會看到、在哪個地區、保留多久]

人物影像:
- 畫面中的人是否本人?
- 是否有涵蓋本用途、平台、期間及地區的書面同意?
- Digital Twin 的 consent video 是否由本人親自錄製?

聲音:
- 使用 stock voice、本人錄音,還是本人授權的 voice clone?
- 是否禁止模仿同事、客戶、藝人、KOL 或其他第三者?

其他素材:
- 腳本事實是否已批准?
- 相片、簡報、圖示、字型、音樂及商標是否有使用權?
- 是否包含客戶資料、未公開數據、身份證明或背景敏感資訊?

停止條件:
任何權利、身份、事實或用途未能確認,停止上載及生成。

步驟一:先決定是否真的需要個人 Digital Twin

很多內部說明或概念驗證,用 Stock Avatar 已足夠;它避免收集同事的生物特徵式素材,也較容易替換。Photo Avatar 適合完全虛構角色或你有權使用的相片,能快速測試腳本與畫面風格。Personal Digital Twin 才是把真人外觀轉成可重複生成的分身,應只在「必須由這個身份講述」而且同意、管理和撤回機制清楚時使用。

HeyGen Photo Avatar 指南說明可由相片建立、編輯外觀和產生說話影片;這不會自動授予相片權利。若相片由攝影師、圖庫或客戶提供,要核對 licence 是否容許生成式修改和商業影片。若角色看似某個真人,即使名稱是虛構,也要評估冒充或混淆風險。

選型時問四題:觀眾是否需要辨認講者;內容更新頻率是否足以支持建立分身;是否有人負責處理離職、撤回與刪除;若 Avatar 失效或配額改變,能否用真人旁白、stock presenter 或純字幕版替代。沒有 fallback 的個人分身,容易成為單一供應商和單一身份依賴。

HeyGen Stock Photo Avatar 與 Personal Digital Twin 的用途、素材及權利比較
重構示意圖二:低設定成本的 Stock/Photo 路線與需要本人同意的 Personal Twin 分開;不是 HeyGen 真實帳戶介面。

Avatar V、Avatar IV、Avatar III:不要只按「最新」

HeyGen 在 2026 年 6 月的 Avatar V 說明把 V 描述為以約 15 秒真人參考影片驅動的影片 Avatar,並指出它適合 video-based real humans;Avatar IV 則更適合虛擬或相片角色。官方頁亦列出不同模型的 Premium Credits 用量,但 credits、方案和開放範圍會更新,本文不把某個數字寫成永久成本。

Avatar III 可作較基礎或大量的標準 Avatar 動畫。最實際的做法不是全片直接選最高階,而是用同一句 8–12 秒腳本建立測試矩陣:身份相似度、嘴形、眨眼、頭肩動作、手勢、粵語節奏、處理時間與 credits。只為真正需要表現力的場景使用 premium 模型,其餘場景保留較穩定和成本較可控的路線。

選項適合先準備主要風險第一個測試
Stock Avatar概念、一般講解批准腳本品牌辨識度較低一幕開場
Photo Avatar虛構角色、風格化人物有權相片相似真人或相片 licence正面短句
Digital Twin本人持續講解本人素材+consent身份、撤回、長期管理一句身份驗收
Avatar V高表現真人片段清晰參考短片premium credits、輸入質素同句與 IV 比較

HeyGen 官方 consent video 指南要求每個 video-based Digital Twin 有有效同意片。這一步不是形式:同意片應由建立分身的本人親自錄製,身份和聲音清楚,按介面要求說出指定文字,不應由另一個 Avatar、剪接蒙太奇或第三者代錄。

把 consent video 與用來建立 Avatar 的 reference footage 分成兩個檔案和兩個驗收。前者證明本人同意;後者決定成品質素。參考片使用固定鏡頭、眼睛接近鏡頭高度、均勻前光、安靜房間、簡單背景和自然說話。避免窗外逆光、強烈自動曝光、耳環或頭髮遮嘴、手持搖動、濾鏡、美顏、快速轉身和背景電腦上的敏感資料。

錄製前先清場:相片中的第三者、白板上的客戶名稱、桌上的證件、螢幕通知、校服或公司內部標記都可能無意進入模型與成品。錄完由另一人觀看原檔,確認只有應出現的人和素材,再上載。保留檔名、日期、用途、批准和刪除政策,不要把原始 consent 片散落在個人訊息群組。

HeyGen consent video、真人參考影片、素材 QA 與一句 Avatar 測試的流程
重構示意圖三:同意片與參考片分開,通過第三者及背景資料檢查後,才建立一句測試片;所有人物描述均為示意。
重構預覽 A:四個穩定畫面展示權利、consent、Avatar 和身份驗收閘;不是來源影片或 HeyGen 介面錄影。

步驟三:在 AI Studio 先拆場景,不要貼整篇長稿

一段三分鐘內容,建議先拆成 8–15 個短場景;每幕只有一個目的,例如提出問題、解釋步驟、展示例子、提醒限制或給 CTA。場景表至少有:編號、目的、旁白、畫面文字、Avatar、背景素材、預計秒數、讀音註記、權利狀態和驗收。

Quick Avatar Video 官方流程把操作概括為選 Avatar、貼腳本、選聲音與 motion engine,再生成;其頁面亦交代字元和輸出選項。這是快速入口,不代表長腳本是最好製作單位。場景越長,錯一個人名或字幕時需要重生的範圍越大,版本亦越難比較。

先建立 10–15 秒 vertical slice:一個 Avatar、一個背景、一段粵語、一個畫面標題和兩行字幕。通過身份、嘴形、讀音、對比和安全區後,才複製場景樣式。這比全片生成後才發現字體太小、Avatar 選錯或背景沒有授權便宜得多。

HeyGen AI Studio 以四幕結構管理廣東話腳本、畫面及 Avatar motion engine
重構示意圖四:四幕虛構培訓短片先分清目的、讀音與事實,再選動作引擎逐幕生成;不是帳戶截圖。
場景:[01/02/03/04]
畫面目的:[這一幕只完成一件事]
預計長度:[秒]

廣東話口語稿:
[使用自然短句;一段只表達一個重點]

讀音註記:
- 品牌/人名:[粵拼或拆音]
- 英文字母:[逐字讀/作單字讀]
- 數字、日期、貨幣:[寫出實際讀法]

畫面文字:
- 主標題:[不超過一行]
- 字幕:[與實際旁白逐字核對]

不得新增:
[未核實功效、價格、資格、保證、客戶名稱]

驗收:
身份相符|嘴形自然|讀音正確|字幕一致|素材合法|手機可讀

步驟四:把書面中文改成可說的香港廣東話

普通書面中文直接交給廣東話聲音,往往語法正確但不自然。先把句子縮短,一句一個動作;把「使用者可以透過點擊」改成「撳呢個掣,就可以……」之類自然口語,但仍按品牌語氣決定正式程度。不要為追求口語而自行改動法律、醫療、金融或產品聲稱。

建立讀音詞庫:公司和產品名、英文縮寫、人名、地名、金額、百分比、日期、電話和網址。每個詞寫實際想聽到的讀法,而不是只寫原文。例如英文縮寫要決定逐個字母讀還是當單字;「2026」在年份和序號的讀法也可能不同。試聽時用耳機,先只聽音訊,再同畫面聽,避免嘴形吸引注意而漏掉讀音。

HeyGen 官方聲音語言清單列出 Chinese (Cantonese — Traditional)。這只證明有相應語言選項,不是所有聲音都同樣自然,也不是每個帳戶看到相同 voice library。選三個候選聲音,用同一段含粵語助詞、英文名和數字的句子比較,再記錄 voice 名稱、版本日期和選擇原因。

聲音複製的紅線

「我有一段錄音」不等於「我有權建立可生成聲音」。不要用會議錄音、直播、訪問、客戶電話或網上影片抽取他人聲線。本人建立 voice clone 也要清楚知道用途、誰能操作、可生成甚麼內容、如何撤回和離職後如何處理。高風險內容可改用 stock voice,並由真人在開頭和結尾確認身份。

HeyGen 繁體廣東話 voice QA 與 stylized captions 校對
重構示意圖五:聲音權利、品牌讀音、速度停頓與繁中字幕分開驗收,錯一句只重做該場景。

步驟五:字幕要分清燒錄樣式、可開關軌與 SRT

HeyGen captions 指南說明 AI Studio 可加入及自訂 stylized captions,包括字型、位置和樣式;同一文件亦提醒 Closed Captions 與 Avatar Videos 的支援限制,翻譯分享頁則可有不同 CC 選項。不要把「畫面見到字幕」等同「播放器有可關閉字幕軌」。

發布前做兩次校對。第一次戴耳機逐字對照:粵語同音字、助詞、英文大小寫、標點、數字、品牌名及專有名詞。第二次靜音只看畫面:每行是否太長、換行有沒有拆散詞組、字幕有沒有遮嘴或 CTA、白字在淺背景是否看不見、9:16 手機安全區是否足夠。

若工作流程需要翻譯、無障礙或後期修改,另存 SRT;若需要品牌化社交短片,可同時保留燒錄 stylized captions。兩者用同一文字來源和版本號。任何字幕修改都要判斷是否需要同步修聲音,不可讓畫面文字和實際旁白講不同條件。

字幕形式觀眾控制適合主要 QA
Stylized captions通常燒在場景視覺品牌短片、社交影片字型、位置、對比、安全區
Closed Captions播放器可開關可存取分享/特定頁面平台是否真正支援
SRT由播放器或剪輯工具載入交付、翻譯、後期時間碼、編碼、版本一致

步驟六:逐幕生成的成本與版本控制

HeyGen 在 2026 年更新把部分名稱由 Generative Credits 改為 Premium Credits,並調整付費方案內不同功能的用量。官方 Premium Features 更新指出 Avatar IV、Video Translation lip sync、進階 Video Agent 或 B-roll 等屬 premium 類,而核心 Avatar III 等在部分付費方案有不同處理。文章不把任何一項寫成永久無限,因為方案與地區會改。

建立簡單成本表:訂閱期內實際分攤、premium credits、重生成、翻譯或 dubbing、stock 素材、人工寫稿、粵語校對、字幕和審批。不要只計「成功輸出」的一次 credits;三次錯讀和兩次嘴形重做都是真實成本。每幕記錄 input script hash、Avatar、voice、engine、日期、輸出檔與批准狀態,才知道哪個版本可回復。

動態與非動態限制亦可按平台容量和帳戶狀態改變。HeyGen 的 limits 說明是較可靠的當日入口。趕 deadline 時不要假設昨晚的生成速度或同時工作數會保持;預留人工或較低風險 fallback。

版本|場景|時間碼|問題類型|實際問題|修正方法|重生成範圍|核對者|狀態
v0.1|01|00:03|讀音|品牌英文被逐字母讀錯|加入讀音註記|只重做場景 01|[姓名]|待核
v0.2|02|00:11|字幕|「登入」誤作「登陸」|編輯字幕文字|不用重生 Avatar|[姓名]|通過
v0.3|03|00:24|權利|背景簡報含客戶名稱|更換虛構畫面|只重做場景 03|[姓名]|通過

步驟七:完整播放、下載和實際開檔

先在預覽由頭到尾播放,不要只跳看縮圖。第一輪看人物:身份是否一致、嘴形是否怪、眼睛和牙齒是否閃動、手或衣服有沒有突變。第二輪只聽聲音:音量、雜音、停頓、讀音、句尾和場景接位。第三輪看字幕與畫面:文字、圖像、logo、背景資料、裁切和安全區。第四輪對腳本事實及權利清單。

HeyGen export 指南列出影片、音訊與 SRT 等下載方式,亦指出 4K 等輸出受方案限制。看到「可下載」不代表任何帳戶、任何 Avatar 或任何解像度都相同。實際下載後,用手機和桌面各開一次,確認檔案可播、聲畫同步、字幕檔編碼正常、解像度及比例正確。

HeyGen AI Avatar 影片發布前的身份、嘴形、粵語、字幕、權利及輸出驗收矩陣
重構示意圖六:所有項目由人逐句、逐幀和逐檔核對後才標記 PASS;內容及結果均屬虛構。
重構預覽 B:四個穩定畫面展示場景、繁中廣東話、字幕和輸出驗收;沒有 loading、移動模糊或來源帳戶身份。

發布前 24 項清單

  1. 影片用途、觀眾、地區、平台和保存期已寫明。
  2. 畫面人物為本人或有可驗證同意。
  3. Digital Twin consent video 由本人錄製。
  4. 同意涵蓋生成、修改和指定發布用途。
  5. 聲音是 stock、本人或有明確授權的 clone。
  6. 沒有模仿藝人、KOL、同事或客戶。
  7. 相片、logo、簡報、圖示、字型和音樂有 licence。
  8. 背景沒有第三者、證件、通知或客戶資料。
  9. 腳本每個事實和聲稱有批准版本。
  10. 沒有把 AI 自行補寫內容當成公司政策。
  11. 每幕只完成一個目的。
  12. Avatar 和 motion engine 有版本記錄。
  13. 身份、眼睛、牙齒、嘴形和衣服逐幀檢查。
  14. 廣東話由真人完整聆聽。
  15. 人名、地名、品牌、英文和數字讀音正確。
  16. 字幕與實際音訊逐字一致。
  17. 字幕換行、停留、對比和安全區合格。
  18. Closed Captions 或 SRT 的實際支援已測試。
  19. 場景之間音量和語氣一致。
  20. 所有重生成及 premium credits 已記錄。
  21. 下載的影片、音訊和 SRT 實際開啟。
  22. 手機和桌面都沒有裁切或同步問題。
  23. AI 身份或製作披露不會誤導觀眾。
  24. 指定負責人簽署,並有撤回和回復方案。

三個實際使用情境

內部系統培訓

用 Stock Avatar 或獲批准的內部講者,背景只放虛構系統資料。每個功能一幕,字幕保留選單名稱,系統更新時只換相關場景。觀眾仍要有文字版 SOP,避免 Avatar 影片成為唯一操作來源。

產品功能介紹

先鎖定公開規格和禁用聲稱。人物只負責引導,真正產品畫面由授權錄屏提供。若產品介面或售價經常更新,不要把數字燒進 Avatar 口型;改用可編輯畫面文字,並在發布前重新核對。

多語言客戶支援

先完成一個已批准的廣東話 master,再進翻譯。每種語言由相應使用者核對術語、禮貌程度、字幕和文化語境。翻譯後嘴形看似自然,不代表技術內容正確;保留原稿、譯稿、核對者和版本。

常見失敗與修正

失敗表面結果真正風險修正
直接用網上相片很快有 Avatar沒有肖像或改作權Stock、本人或明確授權素材
整篇稿一次生成很快有長片錯一句要重做大片段短場景+逐幕批准
只看嘴形不聽聲畫面自然粵語、人名或數字錯耳機全段試聽
自動字幕不校對畫面有文字同音字和條件錯逐字、靜音、手機三重 QA
把 Web 方案當 API預算看似足夠用量和帳單分開分開查方案與 API pricing
生成完便分享連結可以播放未實開下載、權利未簽完整播放、下載、簽署、回復

總結:好的 AI Avatar,不應令人懷疑「這是誰在說話」

HeyGen 可以把更新影片由重拍變成換稿和重生場景,但身份與責任不能一同自動化。最可靠的流程是:先證明誰同意甚麼用途,按最低身份風險選 Avatar,短場景測試廣東話和嘴形,分開校對 stylized captions、CC 與 SRT,最後把每個輸出和 licence 實際打開。

若一段片看起來很像真人,卻沒有清楚同意、聲線權利、腳本批准和人工核對,它只是一個高風險 demo;若每一幕都可回到 consent、資產、版本和驗收紀錄,即使介面、credits 或模型更新,你仍能安全地替換工具並重建成品。這才是可維護的 AI Avatar 工作流。

延伸閱讀:需要把 Avatar 納入完整 campaign,可看AI 影片營銷指南;需要處理其他生成圖像素材,可看AI 圖像生成與香港營銷指南;若後期要在剪輯軟件整理字幕、比例和時間線,可參考剪映 AI 功能教學

資料來源與引用

我們附上第一手及官方來源,方便你逐一核實。

  1. 1.Recording your Consent VideoHeyGen
  2. 2.Avatar V is now available on HeyGenHeyGen
  3. 3.How to get started with Photo AvatarsHeyGen
  4. 4.Quick Avatar VideoHeyGen
  5. 5.Voice languages we supportHeyGen
  6. 6.How to use captionsHeyGen
  7. 7.How to download or export a videoHeyGen
  8. 8.HeyGen credit-based pricing plans explainedHeyGen
  9. 9.How Dynamic & Non-Dynamic Limits Work at HeyGenHeyGen
  10. 10.HeyGen Premium Features UpdateHeyGen
  11. 11.HeyGen API Pricing ExplainedHeyGen

常見問題

HeyGen 免費帳戶可做多少段影片?

HeyGen 的現行說明把免費影片數寫成按地區可有差異,片長、解像度、下載、Avatar 和 Premium Credits 亦會變。不要把某一帳戶今日看到的數字寫成永久配額;建立專案前直接在登入後方案頁核對。

可以用同事的相片建立 AI Avatar 嗎?

不可因為手上有相片就假設可用。必須先有涵蓋人物、用途、平台、期間和地區的明確同意;video-based Digital Twin 還要求由本人錄製 consent video。沒有可驗證同意就用 stock 或完全虛構角色。

Avatar V、Avatar IV 和 Avatar III 怎樣選?

官方把 Avatar V 定位於以真人短片作參考的高表現影片 Avatar;Avatar IV 適合相片或虛擬角色的表達;Avatar III 可處理較基礎的 Avatar 影片。供應、credits 和效果會更新,先用一句低風險試片比較。

HeyGen 是否支援廣東話?

官方語言清單列出 Chinese (Cantonese — Traditional)。支援語言不等於每個粵語詞、英文品牌、人名和數字都準確;要加入讀音提示、分句試聽,再由廣東話使用者全段核對。

可以複製名人或 KOL 的聲線嗎?

不要。即使技術上能上載錄音,也不代表有身份、聲音、表演或商業使用權。只使用 stock voice、本人聲音,或有清楚授權且符合平台規則的聲音;公開影片亦應避免造成真人背書或發言的誤解。

自動字幕是否可以直接發布?

不可以。廣東話同音字、語氣助詞、英文夾雜、數字和專有名詞很容易錯。逐字對照音軌,檢查分行、停留時間、對比度和手機安全區,並保留 SRT 作獨立版本。

Stylized Captions、Closed Captions 和 SRT 有甚麼分別?

Stylized Captions 是燒在場景視覺中的可編輯字幕樣式;Closed Captions 是播放器可開關的字幕軌;SRT 是可下載或交付的字幕檔。HeyGen 對 Avatar Video、翻譯分享頁和不同輸出的支援並不相同,要按現行文件測試。

為甚麼不一次貼完整三分鐘腳本?

分場景能把身份、讀音、嘴形、字幕和畫面問題定位到一幕。完整長片只錯一句時,重新生成可能浪費 credits 並改變其他已合格段落;短場景亦較容易比較版本與回復。

HeyGen 網頁方案是否包括 API?

不要假設包括。HeyGen 官方另有 API pricing 說明,網頁方案的影片、credits 或 Avatar 權益不一定等同 API 使用量。自動化或大量產製前要分開核對兩套帳戶、費用及限制。

AI Avatar 影片一定要標示由 AI 製作嗎?

平台規則、廣告要求、合約和使用情境不同。即使未有統一格式,也應避免觀眾誤以為是真人即時發言或第三者背書;保存同意、生成版本、腳本批准和素材 licence,並在高風險或公開用途採用清楚披露。

本文遵循我們的 編輯準則.

HK Learn AI 編輯部標誌

關於作者

HK Learn AI 編輯部

HK Learn AI 編輯部負責研究、查證同編寫每一篇內容,並引用官方及第一手來源。