本頁內容
難度
中階
所需時間
45–120 分鐘;Digital Twin 審核及重新生成時間另計
你需要準備
HeyGen 帳戶及 AI Studio · 本人或已取得明確授權的人物素材 · 已批准的廣東話腳本 · 耳機、手機及桌面瀏覽器 · 權利清單、版本表及字幕校對表
開始之前
- 只為本人建立 Digital Twin,或已取得畫面中本人對指定用途的明確同意
- 不複製同事、客戶、藝人、KOL、配音員或其他第三者聲線
- 腳本事實、人物、相片、商標、字型、音樂和背景畫面均有合法使用權
- 知道免費配額、片長、解像度、Premium Credits 和下載功能會隨地區及方案更新
- 願意逐句聆聽、逐幀觀看及實際開啟輸出檔,而不是看到生成完成便發布
HeyGen 把文字、Avatar、聲音、字幕和場景編輯放進同一個製作環境,最吸引人的地方是不用每次搭景、拍攝和重錄,也能快速更新培訓、介紹或支援影片。但「快速生成」不等於「可以使用任何人的樣貌和聲線」,也不等於廣東話、嘴形、字幕與事實會自動正確。真正可重用的流程要由同意與權利開始,以短場景生成,最後由真人逐句、逐幀和逐檔驗收。
本文把常見示範更新成 2026 年工作流:先分清 Stock Avatar、Photo Avatar、Digital Twin 與 Avatar V/IV/III,再在 AI Studio 建場景、選 Chinese (Cantonese — Traditional)、修正字幕和下載影片。若你要先理解不同 AI 影片工具的角色,可配合香港 AI 影片營銷完整指南;本文集中 HeyGen 的身份、聲音、場景和交付細節,不重複一般影片策略。
媒體披露:本文封面、6 張步驟圖、2 張影片海報及 2 段預覽影片全部是重構操作示意,使用虛構內部培訓專案與虛構資料。它們不是來源影片、HeyGen 帳戶或任何創作者畫面的截圖或片段,也沒有來源社交平台、頻道、作者、帳戶、真實人物或推廣身份。每張圖和每格影片均使用穩定完成狀態,沒有載入畫面、移動模糊或重複圖像。產品介面、方案與功能會更新,請以 2026 年 7 月 26 日後你的帳戶和第一方文件為準。
先理解四層:Avatar、聲音、字幕與成品是不同權利
第一層是人物影像:你是否有權把某人的面孔、身體動作和身份放進 AI 系統及成品。第二層是聲音:即使人物同意拍片,也不必然同意建立可反覆生成的 voice clone。第三層是腳本和素材:公司簡報、客戶 logo、相片、圖示、字型與音樂都有獨立權利。第四層是發布:內部十人觀看的授權,不一定覆蓋公開廣告、跨地區投放或永久保存。
所以不要用一句「對方話可以」代替權利清單。記錄同意人、批准人、用途、平台、地區、期間、可否修改、可否建立分身、可否合成聲音、撤回方法及檔案保存位置。任何一格待確認,就不要上載該資產。

專案:[影片名稱/版本]
用途:[內部培訓/公開推廣/客戶支援]
觀眾:[誰會看到、在哪個地區、保留多久]
人物影像:
- 畫面中的人是否本人?
- 是否有涵蓋本用途、平台、期間及地區的書面同意?
- Digital Twin 的 consent video 是否由本人親自錄製?
聲音:
- 使用 stock voice、本人錄音,還是本人授權的 voice clone?
- 是否禁止模仿同事、客戶、藝人、KOL 或其他第三者?
其他素材:
- 腳本事實是否已批准?
- 相片、簡報、圖示、字型、音樂及商標是否有使用權?
- 是否包含客戶資料、未公開數據、身份證明或背景敏感資訊?
停止條件:
任何權利、身份、事實或用途未能確認,停止上載及生成。步驟一:先決定是否真的需要個人 Digital Twin
很多內部說明或概念驗證,用 Stock Avatar 已足夠;它避免收集同事的生物特徵式素材,也較容易替換。Photo Avatar 適合完全虛構角色或你有權使用的相片,能快速測試腳本與畫面風格。Personal Digital Twin 才是把真人外觀轉成可重複生成的分身,應只在「必須由這個身份講述」而且同意、管理和撤回機制清楚時使用。
HeyGen Photo Avatar 指南說明可由相片建立、編輯外觀和產生說話影片;這不會自動授予相片權利。若相片由攝影師、圖庫或客戶提供,要核對 licence 是否容許生成式修改和商業影片。若角色看似某個真人,即使名稱是虛構,也要評估冒充或混淆風險。
選型時問四題:觀眾是否需要辨認講者;內容更新頻率是否足以支持建立分身;是否有人負責處理離職、撤回與刪除;若 Avatar 失效或配額改變,能否用真人旁白、stock presenter 或純字幕版替代。沒有 fallback 的個人分身,容易成為單一供應商和單一身份依賴。

Avatar V、Avatar IV、Avatar III:不要只按「最新」
HeyGen 在 2026 年 6 月的 Avatar V 說明把 V 描述為以約 15 秒真人參考影片驅動的影片 Avatar,並指出它適合 video-based real humans;Avatar IV 則更適合虛擬或相片角色。官方頁亦列出不同模型的 Premium Credits 用量,但 credits、方案和開放範圍會更新,本文不把某個數字寫成永久成本。
Avatar III 可作較基礎或大量的標準 Avatar 動畫。最實際的做法不是全片直接選最高階,而是用同一句 8–12 秒腳本建立測試矩陣:身份相似度、嘴形、眨眼、頭肩動作、手勢、粵語節奏、處理時間與 credits。只為真正需要表現力的場景使用 premium 模型,其餘場景保留較穩定和成本較可控的路線。
| 選項 | 適合 | 先準備 | 主要風險 | 第一個測試 |
|---|---|---|---|---|
| Stock Avatar | 概念、一般講解 | 批准腳本 | 品牌辨識度較低 | 一幕開場 |
| Photo Avatar | 虛構角色、風格化人物 | 有權相片 | 相似真人或相片 licence | 正面短句 |
| Digital Twin | 本人持續講解 | 本人素材+consent | 身份、撤回、長期管理 | 一句身份驗收 |
| Avatar V | 高表現真人片段 | 清晰參考短片 | premium credits、輸入質素 | 同句與 IV 比較 |
步驟二:正確錄製 Consent Video 與參考素材
HeyGen 官方 consent video 指南要求每個 video-based Digital Twin 有有效同意片。這一步不是形式:同意片應由建立分身的本人親自錄製,身份和聲音清楚,按介面要求說出指定文字,不應由另一個 Avatar、剪接蒙太奇或第三者代錄。
把 consent video 與用來建立 Avatar 的 reference footage 分成兩個檔案和兩個驗收。前者證明本人同意;後者決定成品質素。參考片使用固定鏡頭、眼睛接近鏡頭高度、均勻前光、安靜房間、簡單背景和自然說話。避免窗外逆光、強烈自動曝光、耳環或頭髮遮嘴、手持搖動、濾鏡、美顏、快速轉身和背景電腦上的敏感資料。
錄製前先清場:相片中的第三者、白板上的客戶名稱、桌上的證件、螢幕通知、校服或公司內部標記都可能無意進入模型與成品。錄完由另一人觀看原檔,確認只有應出現的人和素材,再上載。保留檔名、日期、用途、批准和刪除政策,不要把原始 consent 片散落在個人訊息群組。

步驟三:在 AI Studio 先拆場景,不要貼整篇長稿
一段三分鐘內容,建議先拆成 8–15 個短場景;每幕只有一個目的,例如提出問題、解釋步驟、展示例子、提醒限制或給 CTA。場景表至少有:編號、目的、旁白、畫面文字、Avatar、背景素材、預計秒數、讀音註記、權利狀態和驗收。
Quick Avatar Video 官方流程把操作概括為選 Avatar、貼腳本、選聲音與 motion engine,再生成;其頁面亦交代字元和輸出選項。這是快速入口,不代表長腳本是最好製作單位。場景越長,錯一個人名或字幕時需要重生的範圍越大,版本亦越難比較。
先建立 10–15 秒 vertical slice:一個 Avatar、一個背景、一段粵語、一個畫面標題和兩行字幕。通過身份、嘴形、讀音、對比和安全區後,才複製場景樣式。這比全片生成後才發現字體太小、Avatar 選錯或背景沒有授權便宜得多。

場景:[01/02/03/04]
畫面目的:[這一幕只完成一件事]
預計長度:[秒]
廣東話口語稿:
[使用自然短句;一段只表達一個重點]
讀音註記:
- 品牌/人名:[粵拼或拆音]
- 英文字母:[逐字讀/作單字讀]
- 數字、日期、貨幣:[寫出實際讀法]
畫面文字:
- 主標題:[不超過一行]
- 字幕:[與實際旁白逐字核對]
不得新增:
[未核實功效、價格、資格、保證、客戶名稱]
驗收:
身份相符|嘴形自然|讀音正確|字幕一致|素材合法|手機可讀步驟四:把書面中文改成可說的香港廣東話
普通書面中文直接交給廣東話聲音,往往語法正確但不自然。先把句子縮短,一句一個動作;把「使用者可以透過點擊」改成「撳呢個掣,就可以……」之類自然口語,但仍按品牌語氣決定正式程度。不要為追求口語而自行改動法律、醫療、金融或產品聲稱。
建立讀音詞庫:公司和產品名、英文縮寫、人名、地名、金額、百分比、日期、電話和網址。每個詞寫實際想聽到的讀法,而不是只寫原文。例如英文縮寫要決定逐個字母讀還是當單字;「2026」在年份和序號的讀法也可能不同。試聽時用耳機,先只聽音訊,再同畫面聽,避免嘴形吸引注意而漏掉讀音。
HeyGen 官方聲音語言清單列出 Chinese (Cantonese — Traditional)。這只證明有相應語言選項,不是所有聲音都同樣自然,也不是每個帳戶看到相同 voice library。選三個候選聲音,用同一段含粵語助詞、英文名和數字的句子比較,再記錄 voice 名稱、版本日期和選擇原因。
聲音複製的紅線
「我有一段錄音」不等於「我有權建立可生成聲音」。不要用會議錄音、直播、訪問、客戶電話或網上影片抽取他人聲線。本人建立 voice clone 也要清楚知道用途、誰能操作、可生成甚麼內容、如何撤回和離職後如何處理。高風險內容可改用 stock voice,並由真人在開頭和結尾確認身份。

步驟五:字幕要分清燒錄樣式、可開關軌與 SRT
HeyGen captions 指南說明 AI Studio 可加入及自訂 stylized captions,包括字型、位置和樣式;同一文件亦提醒 Closed Captions 與 Avatar Videos 的支援限制,翻譯分享頁則可有不同 CC 選項。不要把「畫面見到字幕」等同「播放器有可關閉字幕軌」。
發布前做兩次校對。第一次戴耳機逐字對照:粵語同音字、助詞、英文大小寫、標點、數字、品牌名及專有名詞。第二次靜音只看畫面:每行是否太長、換行有沒有拆散詞組、字幕有沒有遮嘴或 CTA、白字在淺背景是否看不見、9:16 手機安全區是否足夠。
若工作流程需要翻譯、無障礙或後期修改,另存 SRT;若需要品牌化社交短片,可同時保留燒錄 stylized captions。兩者用同一文字來源和版本號。任何字幕修改都要判斷是否需要同步修聲音,不可讓畫面文字和實際旁白講不同條件。
| 字幕形式 | 觀眾控制 | 適合 | 主要 QA |
|---|---|---|---|
| Stylized captions | 通常燒在場景視覺 | 品牌短片、社交影片 | 字型、位置、對比、安全區 |
| Closed Captions | 播放器可開關 | 可存取分享/特定頁面 | 平台是否真正支援 |
| SRT | 由播放器或剪輯工具載入 | 交付、翻譯、後期 | 時間碼、編碼、版本一致 |
步驟六:逐幕生成的成本與版本控制
HeyGen 在 2026 年更新把部分名稱由 Generative Credits 改為 Premium Credits,並調整付費方案內不同功能的用量。官方 Premium Features 更新指出 Avatar IV、Video Translation lip sync、進階 Video Agent 或 B-roll 等屬 premium 類,而核心 Avatar III 等在部分付費方案有不同處理。文章不把任何一項寫成永久無限,因為方案與地區會改。
建立簡單成本表:訂閱期內實際分攤、premium credits、重生成、翻譯或 dubbing、stock 素材、人工寫稿、粵語校對、字幕和審批。不要只計「成功輸出」的一次 credits;三次錯讀和兩次嘴形重做都是真實成本。每幕記錄 input script hash、Avatar、voice、engine、日期、輸出檔與批准狀態,才知道哪個版本可回復。
動態與非動態限制亦可按平台容量和帳戶狀態改變。HeyGen 的 limits 說明是較可靠的當日入口。趕 deadline 時不要假設昨晚的生成速度或同時工作數會保持;預留人工或較低風險 fallback。
版本|場景|時間碼|問題類型|實際問題|修正方法|重生成範圍|核對者|狀態
v0.1|01|00:03|讀音|品牌英文被逐字母讀錯|加入讀音註記|只重做場景 01|[姓名]|待核
v0.2|02|00:11|字幕|「登入」誤作「登陸」|編輯字幕文字|不用重生 Avatar|[姓名]|通過
v0.3|03|00:24|權利|背景簡報含客戶名稱|更換虛構畫面|只重做場景 03|[姓名]|通過步驟七:完整播放、下載和實際開檔
先在預覽由頭到尾播放,不要只跳看縮圖。第一輪看人物:身份是否一致、嘴形是否怪、眼睛和牙齒是否閃動、手或衣服有沒有突變。第二輪只聽聲音:音量、雜音、停頓、讀音、句尾和場景接位。第三輪看字幕與畫面:文字、圖像、logo、背景資料、裁切和安全區。第四輪對腳本事實及權利清單。
HeyGen export 指南列出影片、音訊與 SRT 等下載方式,亦指出 4K 等輸出受方案限制。看到「可下載」不代表任何帳戶、任何 Avatar 或任何解像度都相同。實際下載後,用手機和桌面各開一次,確認檔案可播、聲畫同步、字幕檔編碼正常、解像度及比例正確。

發布前 24 項清單
- 影片用途、觀眾、地區、平台和保存期已寫明。
- 畫面人物為本人或有可驗證同意。
- Digital Twin consent video 由本人錄製。
- 同意涵蓋生成、修改和指定發布用途。
- 聲音是 stock、本人或有明確授權的 clone。
- 沒有模仿藝人、KOL、同事或客戶。
- 相片、logo、簡報、圖示、字型和音樂有 licence。
- 背景沒有第三者、證件、通知或客戶資料。
- 腳本每個事實和聲稱有批准版本。
- 沒有把 AI 自行補寫內容當成公司政策。
- 每幕只完成一個目的。
- Avatar 和 motion engine 有版本記錄。
- 身份、眼睛、牙齒、嘴形和衣服逐幀檢查。
- 廣東話由真人完整聆聽。
- 人名、地名、品牌、英文和數字讀音正確。
- 字幕與實際音訊逐字一致。
- 字幕換行、停留、對比和安全區合格。
- Closed Captions 或 SRT 的實際支援已測試。
- 場景之間音量和語氣一致。
- 所有重生成及 premium credits 已記錄。
- 下載的影片、音訊和 SRT 實際開啟。
- 手機和桌面都沒有裁切或同步問題。
- AI 身份或製作披露不會誤導觀眾。
- 指定負責人簽署,並有撤回和回復方案。
三個實際使用情境
內部系統培訓
用 Stock Avatar 或獲批准的內部講者,背景只放虛構系統資料。每個功能一幕,字幕保留選單名稱,系統更新時只換相關場景。觀眾仍要有文字版 SOP,避免 Avatar 影片成為唯一操作來源。
產品功能介紹
先鎖定公開規格和禁用聲稱。人物只負責引導,真正產品畫面由授權錄屏提供。若產品介面或售價經常更新,不要把數字燒進 Avatar 口型;改用可編輯畫面文字,並在發布前重新核對。
多語言客戶支援
先完成一個已批准的廣東話 master,再進翻譯。每種語言由相應使用者核對術語、禮貌程度、字幕和文化語境。翻譯後嘴形看似自然,不代表技術內容正確;保留原稿、譯稿、核對者和版本。
常見失敗與修正
| 失敗 | 表面結果 | 真正風險 | 修正 |
|---|---|---|---|
| 直接用網上相片 | 很快有 Avatar | 沒有肖像或改作權 | Stock、本人或明確授權素材 |
| 整篇稿一次生成 | 很快有長片 | 錯一句要重做大片段 | 短場景+逐幕批准 |
| 只看嘴形不聽聲 | 畫面自然 | 粵語、人名或數字錯 | 耳機全段試聽 |
| 自動字幕不校對 | 畫面有文字 | 同音字和條件錯 | 逐字、靜音、手機三重 QA |
| 把 Web 方案當 API | 預算看似足夠 | 用量和帳單分開 | 分開查方案與 API pricing |
| 生成完便分享 | 連結可以播放 | 未實開下載、權利未簽 | 完整播放、下載、簽署、回復 |
總結:好的 AI Avatar,不應令人懷疑「這是誰在說話」
HeyGen 可以把更新影片由重拍變成換稿和重生場景,但身份與責任不能一同自動化。最可靠的流程是:先證明誰同意甚麼用途,按最低身份風險選 Avatar,短場景測試廣東話和嘴形,分開校對 stylized captions、CC 與 SRT,最後把每個輸出和 licence 實際打開。
若一段片看起來很像真人,卻沒有清楚同意、聲線權利、腳本批准和人工核對,它只是一個高風險 demo;若每一幕都可回到 consent、資產、版本和驗收紀錄,即使介面、credits 或模型更新,你仍能安全地替換工具並重建成品。這才是可維護的 AI Avatar 工作流。
延伸閱讀:需要把 Avatar 納入完整 campaign,可看AI 影片營銷指南;需要處理其他生成圖像素材,可看AI 圖像生成與香港營銷指南;若後期要在剪輯軟件整理字幕、比例和時間線,可參考剪映 AI 功能教學。
資料來源與引用
我們附上第一手及官方來源,方便你逐一核實。
- 1.Recording your Consent Video — HeyGen
- 2.Avatar V is now available on HeyGen — HeyGen
- 3.How to get started with Photo Avatars — HeyGen
- 4.Quick Avatar Video — HeyGen
- 5.Voice languages we support — HeyGen
- 6.How to use captions — HeyGen
- 7.How to download or export a video — HeyGen
- 8.HeyGen credit-based pricing plans explained — HeyGen
- 9.How Dynamic & Non-Dynamic Limits Work at HeyGen — HeyGen
- 10.HeyGen Premium Features Update — HeyGen
- 11.HeyGen API Pricing Explained — HeyGen
常見問題
HeyGen 免費帳戶可做多少段影片?
HeyGen 的現行說明把免費影片數寫成按地區可有差異,片長、解像度、下載、Avatar 和 Premium Credits 亦會變。不要把某一帳戶今日看到的數字寫成永久配額;建立專案前直接在登入後方案頁核對。
可以用同事的相片建立 AI Avatar 嗎?
不可因為手上有相片就假設可用。必須先有涵蓋人物、用途、平台、期間和地區的明確同意;video-based Digital Twin 還要求由本人錄製 consent video。沒有可驗證同意就用 stock 或完全虛構角色。
Avatar V、Avatar IV 和 Avatar III 怎樣選?
官方把 Avatar V 定位於以真人短片作參考的高表現影片 Avatar;Avatar IV 適合相片或虛擬角色的表達;Avatar III 可處理較基礎的 Avatar 影片。供應、credits 和效果會更新,先用一句低風險試片比較。
HeyGen 是否支援廣東話?
官方語言清單列出 Chinese (Cantonese — Traditional)。支援語言不等於每個粵語詞、英文品牌、人名和數字都準確;要加入讀音提示、分句試聽,再由廣東話使用者全段核對。
可以複製名人或 KOL 的聲線嗎?
不要。即使技術上能上載錄音,也不代表有身份、聲音、表演或商業使用權。只使用 stock voice、本人聲音,或有清楚授權且符合平台規則的聲音;公開影片亦應避免造成真人背書或發言的誤解。
自動字幕是否可以直接發布?
不可以。廣東話同音字、語氣助詞、英文夾雜、數字和專有名詞很容易錯。逐字對照音軌,檢查分行、停留時間、對比度和手機安全區,並保留 SRT 作獨立版本。
Stylized Captions、Closed Captions 和 SRT 有甚麼分別?
Stylized Captions 是燒在場景視覺中的可編輯字幕樣式;Closed Captions 是播放器可開關的字幕軌;SRT 是可下載或交付的字幕檔。HeyGen 對 Avatar Video、翻譯分享頁和不同輸出的支援並不相同,要按現行文件測試。
為甚麼不一次貼完整三分鐘腳本?
分場景能把身份、讀音、嘴形、字幕和畫面問題定位到一幕。完整長片只錯一句時,重新生成可能浪費 credits 並改變其他已合格段落;短場景亦較容易比較版本與回復。
HeyGen 網頁方案是否包括 API?
不要假設包括。HeyGen 官方另有 API pricing 說明,網頁方案的影片、credits 或 Avatar 權益不一定等同 API 使用量。自動化或大量產製前要分開核對兩套帳戶、費用及限制。
AI Avatar 影片一定要標示由 AI 製作嗎?
平台規則、廣告要求、合約和使用情境不同。即使未有統一格式,也應避免觀眾誤以為是真人即時發言或第三者背書;保存同意、生成版本、腳本批准和素材 licence,並在高風險或公開用途採用清楚披露。
本文遵循我們的 編輯準則.

關於作者
HK Learn AI 編輯部
HK Learn AI 編輯部負責研究、查證同編寫每一篇內容,並引用官方及第一手來源。