
難度
初階
所需時間
約 45–60 分鐘(不計排隊與重新生成)
你需要準備
小雲雀 AI 網頁版 · 即夢 AI/Dreamina 網頁版 · 可剪片及加字幕的影片編輯器 · 自有或已獲授權的寵物圖片、參考片段與聲音 · 耳機(逐句檢查聲畫同步)
開始之前
- 準備一至兩張清晰寵物正面或四分之三側面圖片;眼睛、鼻口和耳朵不要被物件遮住
- 只使用自己擁有、已獲授權或可合法使用的圖片、影片、聲音、音樂和參考素材
- 先決定 9:16、1:1 或 16:9;本文示範以 16:9 雙主持 Podcast 構圖說明
- 把對白分成一人一句的短句,並準備每隻寵物的角色、語氣、動作和說話次序
- 接受模型、積分、片長、水印和地區供應會變;生成前以帳戶當日畫面為準
兩隻寵物戴着耳機坐在咪高峰前,一隻一本正經地吐槽,另一隻停半秒再反擊——這類「寵物 Podcast」短片看似只靠一個提示詞,真正決定成敗的卻是角色分工、逐句對口型、沉默角色控制和剪輯節奏。若把所有對白一次交給模型,最常見結果是兩張嘴一起動、牙齒變形、咪高峰漂移,或者角色說錯句子。
本文把整個流程拆成兩條路線:小雲雀適合快速用參考與完整提示試做;即夢/Dreamina則先生成一張穩定的 Podcast 主視覺,再逐位角色生成對口型。示範素材已移除原創作者、頻道、帳戶、人物與社交平台識別;文章只保留完成操作所需的畫面。
版本提醒:舊教學畫面曾使用 Seedance 1.5 Pro 和即夢圖片 4.5。本文在 2026 年 7 月 20 日重新檢查公開介面:小雲雀已可見 Seedance 2.0 系列,即夢圖片頁顯示圖片 5.0 Pro。名稱、積分、片長和功能會分階段調整,請用「功能目的」對照你的帳戶,而不要死跟舊按鈕位置。
先看目標成品:甚麼才算成功
頁首成品圖先做到角色清楚、咪高峰不遮嘴、光線一致和構圖可剪;原有字幕、帳戶和平台識別已裁走。正文不再重貼同一張圖。
合格的第一版不必追求電影級動作,但至少要同時通過五項檢查:
- 角色:毛色、品種、眼鏡、帽子和耳機在每個鏡頭一致。
- 說話者:只有該句的角色張嘴,另一位保持自然聆聽。
- 嘴形:下顎幅度合理,牙齒、舌頭和鼻口沒有突然融合或消失。
- 道具:咪高峰、耳機和桌面不漂移、不穿過臉或前腳。
- 節奏:每句短而清楚,保留反應停頓;字幕不遮住嘴和重點動作。
兩條工作流怎樣選
| 比較 | 小雲雀快速路線 | 即夢逐步控制路線 |
|---|---|---|
| 起點 | 參考圖片/影片或完整文字描述 | 先做角色主視覺,再做數字人對口型 |
| 優點 | 步驟少,適合快速測概念、構圖和節奏 | 可先修正圖片,再逐位角色設定聲音和動作 |
| 主要風險 | 一次生成太多要求,角色與口型較難局部修 | 片段較多,要管理版本、角色一致和剪輯 |
| 雙主持策略 | 仍建議拆成一句一片,再交替剪接 | 每次選一位角色/裁成單人鏡頭,逐句生成 |
| 適合 | 先做 5–15 秒 proof of concept | 要準確控制形象、聲音、句子和反應節奏 |
如果是第一次做,先完成一個 8–12 秒、四句對白的版本。不要由 45 秒長片開始;片長越長,角色漂移、錯嘴、無意義停頓和重做成本越高。
步驟一:準備可合法使用的素材
1. 只保留真正需要的參考
準備一張或兩張寵物圖,最好同一光線和焦距。正面或四分之三側面最容易辨認嘴部;不要讓玩具、手、食物或長毛完全遮住下顎。若照片含有人臉、寵物名牌、電話、住址、窗外地標或定位資訊,先裁走,而不是用模糊遮蓋後仍保留輪廓。
2. 把「參考」拆成可重新創作的元素
可以學習一段短片的結構:開場鉤子、雙主持景別、咪高峰位置、一問一答、停頓和最後笑點;不要搬走它的創作者身份、完整腳本、燒錄字幕、背景音樂、品牌畫面或平台標誌。公開可見不代表有權下載或重新發布。
3. 決定畫幅和安全區
- 9:16:適合短片平台;兩隻寵物要坐得更近,字幕放在下方安全區。
- 16:9:適合網站、YouTube 或橫向教學;較易保留桌面、咪高峰和兩邊反應。
- 1:1:可在多個 feed 重用,但要預留上下裁切空間。
步驟二:先寫可對口型的雙角色腳本
短片不是把一段長文切成兩把聲。最穩定結構是「鉤子 → 回應 → 升級 → 笑點」,每句約 6–16 個中文字,讓角色有時間開始、說完和閉嘴。先把台詞與動作分開:
角色 A(貓,冷靜):今日邊個負責準時開錄?
動作:望向右邊的狗,嘴部只在說話時移動。
角色 B(狗,活潑):我負責氣氛,你負責準時。
動作:先望鏡頭,再轉向貓;貓保持閉嘴聆聽。
角色 A:咁剪片又邊個做?
角色 B:當然係冇出鏡嗰位。
如果系統的文字轉語音讀不準廣東話、人名或品牌名,使用自己錄製或已獲授權的乾淨音訊。每句獨立一個檔案,前後各保留約 0.2–0.4 秒安靜,避免上一句尾音混入下一個角色。
方法 A:用小雲雀快速生成
步驟三:選擇最接近的短片模式


進入小雲雀後,不必執著舊錄影的按鈕名稱。你要找的是能加入參考素材、提示詞、畫幅和片長的短片流程。本文檢查時可見「沉浸式短片」等選項;其他帳戶也可能顯示 Agent、短劇或復刻類入口。
步驟四:選模型前先看消耗與能力

Seedance 2.0 官方資料說明它可以同時參考圖片、影片與音訊,並生成最長 15 秒的多鏡頭有聲影片;但小雲雀內不同等級或體驗模型未必全部開放相同能力。先用低成本短片測角色,再升級解像度或片長。
步驟五:加入參考並寫完整生成提示
按加入素材的位置,上載你有權使用的寵物圖或參考片段。不要直接貼一個未知授權的熱門影片連結便當作可重用素材。若功能支援多參考,為每個檔案寫清用途,例如「只參考貓的毛色」「只參考鏡頭構圖」「只參考說話節奏」。

寫實、專業的雙主持寵物 Podcast 錄音室,16:9,中景,固定鏡頭。
左邊是一隻戴黑色圓框眼鏡和耳機的胖三花貓,表情冷靜;
右邊是一隻戴藍色帽和耳機的白色薩摩耶,表情開朗。
兩者面前各有一支獨立咪高峰,嘴部完整可見,桌面乾淨。
角色外觀、體型、毛色、比例、構圖和暖色燈光全片一致。
說話次序:貓先說第一句,狗閉嘴聆聽;狗再說第二句,貓閉嘴。
自然呼吸和輕微眼神反應,不要卡通化,不要誇張張嘴。
不要文字、標誌、水印、額外肢體、漂移咪高峰、變形牙齒或第三個角色。
「完全匹配」和「避免恐怖谷」只可當目標,不是模型保證。比起形容詞堆疊,更重要的是指定唯一說話者、誰保持閉嘴、鏡頭是否固定、道具是否可動和不能出現甚麼。
步驟六:設定畫幅、片長,再做低成本測試


- 畫幅跟最終發布位置一致,不要生成後才大幅裁切。
- 第一輪只做一至兩句,片長以帳戶可選的最短實用設定為主。
- 確認提交按鈕旁的積分、模型、秒數、解像度和排隊提示。
- 生成完成後先完整播放,不要在結果仍載入或畫面切換時截圖。
- 若錯嘴,只重做該句;不要把四句全部一起重生。
方法 B:用即夢先做圖,再逐句對口型
步驟七:在圖片生成建立「可說話」主視覺


選圖片生成,加入寵物參考,再選跟發布一致的比例。主視覺要為動畫預留條件:嘴部清楚、兩張臉不要重疊、咪高峰不要遮下顎、眼鏡不要壓住眼睛、前腳與桌邊分開。
Photorealistic professional podcast studio, two pet hosts at one desk, medium two-shot, 16:9.
Left: a chubby calico cat wearing black round glasses and studio headphones, calm serious expression.
Right: a white Samoyed wearing a blue cap and studio headphones, cheerful expression.
One separate microphone per character, both mouths fully visible, realistic fur, warm soft key light,
symmetrical but natural composition, clean background, no people, no text, no logo, no watermark.
Negative: cartoon, extra animal, extra limb, fused paws, distorted teeth, open mouth at rest,
microphone crossing face, duplicated headphones, unreadable objects, platform interface.
一次生成多個候選可以,但不要把所有圖都塞進文章或剪輯。逐張放大到原尺寸,先淘汰嘴部、牙齒、眼睛、咪高峰和前腳有問題的版本,再只保留一個主視覺。這一步選錯,後面每句對口型都會把缺陷放大。
步驟八:進入數字人/對口型


- 上載剛才選定的主視覺,或由圖片結果進入數字人/對口型。
- 指定本句角色;若介面無法可靠點選其中一隻,就先裁成單人中近鏡。
- 選合適聲音,或上載已獲授權、乾淨而短的音訊。
- 在「說話內容」只放台詞,不要把鏡頭指令混進朗讀文字。
- 在「動作描述」寫眼神、轉頭、情緒和沉默角色行為。
- 查看品質模式、字數/音訊長度、積分和可用解像度後再生成。
唯一說話者:右邊的白色薩摩耶。
動作:先望向鏡頭,自然眨眼;說到句子中段時輕微轉頭望向左邊的貓。
嘴形:只在聲音出現時自然開合,句尾立即閉嘴,不露出誇張牙齒。
沉默角色:左邊的貓全程閉嘴,只做輕微眼神和呼吸反應。
固定鏡頭;咪高峰、耳機、帽子、眼鏡、桌面和背景保持不動。
步驟九:同一主圖,分別生成角色 A 與 B
複製同一主視覺和設定,將第二句改成另一位角色。命名不要只用「版本 1/版本 2」,改用可追查格式:
01-cat-hook-v1.mp4
02-dog-reply-v2.mp4
03-cat-question-v1.mp4
04-dog-punchline-v3.mp4
如果雙人畫面仍令另一張嘴移動,可做兩個單人裁切版本。生成後在剪輯器以同一背景和相近景別交替,觀眾仍會理解兩者在同一錄音室。這通常比反覆要求模型在一個長鏡頭準確處理四輪說話更穩定。
現行工具的影片控制可怎樣幫到你

對口型負責「誰說甚麼」,一般影片生成則適合做開場、建立錄音室、角色入鏡或無台詞反應。兩種任務不要混成一個過長提示。若使用鏡頭運動、首尾幀或多參考控制,先鎖定靜態角色和道具,再逐項增加動作;每加一項都重新抽幀檢查,不要把不相關的產品展示片當作本文成品。
步驟十:在剪輯器組成真正的雙主持對話

- 把四句片段按 A → B → A → B 放到時間線,不要一開始便加特效。
- 每句開頭剪走模型準備張嘴的僵硬畫面,句尾保留約 0.15–0.35 秒自然閉嘴。
- 若用單人裁切,在角色轉換位置加直切或極短音訊 J-cut;避免花巧轉場令畫面糊掉。
- 統一音量;背景音樂要低於人聲,並確認有商業使用權。
- 人工校對繁體中文字幕。每行盡量短,不遮嘴、咪高峰或寵物表情。
- 先輸出一個低碼率審稿版,完整觀看後才輸出最終版。
讓笑點更自然的時間參考
| 位置 | 建議長度 | 作用 |
|---|---|---|
| 開場建立鏡頭 | 0.5–1.0 秒 | 讓觀眾看清兩個角色和 Podcast 場景 |
| 每句前 | 0.1–0.25 秒 | 避免一切鏡便立即張嘴 |
| 普通回應 | 0.15–0.35 秒 | 保持節奏,不像把音訊硬拼起來 |
| 最後笑點前 | 0.4–0.8 秒 | 讓表情和沉默角色反應建立預期 |
| 結尾 | 0.5–1.0 秒 | 確認兩張嘴閉合,再接片尾或 CTA |
常見失敗與修正
| 問題 | 最可能原因 | 優先修正 |
|---|---|---|
| 兩隻一起張嘴 | 同框角色太近,提示沒有唯一說話者 | 一句一片;裁成單人鏡;明寫另一位全程閉嘴 |
| 說錯角色 | 只寫左右,模型重新構圖後失去指向 | 用毛色、配件和位置三重描述;先生成靜態主圖 |
| 牙齒或下顎變形 | 原圖嘴部不清、句子太長、張嘴幅度過大 | 換清晰主圖;縮短句子;要求自然小幅開合 |
| 角色外觀跳變 | 每句由不同提示重新生成 | 重用同一主圖、種子或參考;固定配件和燈光 |
| 咪高峰漂移 | 模型把道具當成可動主體 | 寫明固定;讓咪高峰與嘴保持空隙;必要時改用單人近鏡 |
| 廣東話不自然 | TTS 讀音或中英夾雜不穩 | 用已授權自錄音訊;逐句生成;字幕人工校對 |
| 影片看似模糊 | 截到載入、轉場或快速運動幀 | 等生成完成;以固定間隔抽幀;選靜止而資訊完整的海報 |
| 畫面有帳戶或平台宣傳 | 直接截整個社交或社群頁面 | 從原素材重新裁切;移除身份區;不能安全裁走就棄用 |
費用、地區與「免費」要怎樣理解
錄影中出現的每日積分和每段消耗,只能代表當時帳戶、活動、模型與地區,不能當成 2026 年 7 月固定價格。小雲雀的現行模型選單會在部分選項旁顯示每秒積分提示;即夢/Dreamina 的免費 tokens、方案、水印和片長也會按入口、地區和活動改變。

每次提交前記錄六項:模型、畫幅、解像度、秒數、預計積分、匯出水印。先用最短片測角色,再決定是否花積分提高品質。香港帳戶亦可能因分階段推出而看不到某個中國版或全球版功能,文章不保證所有帳戶同日可用。
版權、聲音與 AI 標識
- 參考素材:只用自有或已獲授權內容;保留來源、許可和付款紀錄。
- 寵物與人物:寵物照也可能包含主人的臉、住所、電話或地點線索,發布前要移除。
- 聲音:只使用自己聲音、合約許可聲音或平台授權聲庫;不要模仿可識別人士作未授權代言。
- 音樂與字型:分別確認商業發布、地區和平台許可,不能因影片是 AI 生成便忽略。
- AI 標識:小雲雀協議要求遵守相關 AI 標識規則,亦不應自行隱藏或刪除必要標識。裁走第三方帳戶身份與刪除法規或平台要求的 AI 標識是兩回事。
- 披露:若畫面或聲音可能令人誤以為真實寵物真的說過某句話,加入清楚的 AI 生成/合成內容說明。
如要把短片用於品牌推廣,可配合香港 AI 影片營銷指南建立審批、素材權利與發布流程;靜態主視覺可參考AI 圖像生成實務,字幕與剪輯則可看剪映 AI 功能教學。
發布前逐格 QA 清單
- 完整播放:由第一格看到最後一格,不只看模型挑選的封面。
- 固定抽幀:每 0.5–1 秒查看一格,特別檢查開口、閉口、轉頭和切鏡位置。
- 角色:毛色、眼睛、耳朵、配件和體型沒有跳變。
- 嘴形:唯一說話者正確;沉默角色沒有跟讀;牙齒、舌頭和下顎自然。
- 道具:咪高峰、耳機、帽子、眼鏡、桌邊與前腳沒有融合或漂移。
- 聲音:發音、音量、停頓、授權和角色配對正確,沒有不必要的原片聲音。
- 字幕:繁體字、標點和專有名詞正確;沒有原作者、頻道、帳戶或社交平台識別。
- 圖片:每張以原尺寸開啟;沒有載入、spinner、糊幀、半截 UI、重複或資訊不足。
- 預覽:影片海報與正文圖片不是同一格;不同預覽展示不同操作或結果。
- 權利與披露:素材、聲音、音樂、輸出條款、AI 標識和合成內容說明均已確認。
本文媒體的實際處理標準
本文只保留能解釋一個明確步驟的畫面。原影片縮圖因含人物與頻道式宣傳而棄用;相近構圖、載入畫面、模糊移動幀和帶身份區的社群內容亦不發布。所有最終圖像、海報和影片會在上載前再次以原尺寸或固定間隔抽幀檢查。
最短可行版本:30 分鐘完成第一次測試
- 用 5 分鐘選一張已授權、嘴部清楚的寵物圖,決定 16:9 或 9:16。
- 用 5 分鐘寫四句、每句不超過 16 字的 A/B 對白。
- 用 10 分鐘在小雲雀做兩句低成本測試,或在即夢生成一張穩定主圖。
- 用 5–10 分鐘只為一位角色生成一句對口型,確認流程可行。
- 剩餘時間做抽幀 QA,記下錯嘴、道具、讀音和積分,再決定是否擴成完整版本。
第一輪的目標不是立即發布,而是證明三件事:角色能保持一致、指定角色能準確說一句、你知道每次生成的實際成本。三項都過關,才值得擴寫腳本、增加鏡頭和輸出高解像版本。
資料來源與引用
我們附上第一手及官方來源,方便你逐一核實。
常見問題
AI 寵物 Podcast 是真正的 Podcast 嗎?
本文指的是以錄音室、咪高峰、耳機和主持對話為視覺語言的短片。它可以發布到短片或社交平台,但不會自動建立 RSS feed、節目頁或音訊平台分發。
小雲雀和即夢應該選哪一個?
想快速由參考和完整提示試做,可先用小雲雀;想先把角色圖做準、逐隻設定聲音和動作,再逐句修正對口型,通常用即夢較容易控制。實際可用功能、模型和地區供應會因帳戶而異。
即夢和 Dreamina 是否同一個工具?
兩者屬同一產品體系的中國版與全球版入口,但名稱、模型、方案、介面、地區供應和條款未必完全相同。跟著本文時應按自己帳戶可見的圖片生成、數字人/AI Avatar、對口型和音訊上載功能對照。
為甚麼兩隻動物會同時張嘴?
單張圖同時包含兩張臉時,模型未必能穩定理解說話者。最可靠的方法是每次只生成一句、明確指定唯一說話者和沉默角色,必要時分別裁成兩個單人鏡頭,再在剪輯器交替排列。
可以用自己的寵物樣貌嗎?
可以,但最好使用清晰、光線一致、沒有名牌電話或住址線索的照片。參考圖只應包含你有權使用的內容;發布前要檢查生成結果有沒有改變品種、毛色、眼睛、項圈或其他身份特徵。
可以下載任何網上熱門影片作參考嗎?
不可以把可觀看等同可重用。使用自有、獲授權、公共領域或許可明確的素材,並保留來源和許可紀錄。不要複製另一帳戶的完整對白、字幕、音樂、人物、頻道識別、平台標誌或 AI 標識。
兩個工具是否免費?
免費通常只代表試用、每日或活動積分、有限模型、有限片長、排隊或帶水印匯出,不等於無限免費。積分和方案經常變,應在按下生成前查看模型、秒數、解像度和實際消耗。
廣東話對口型不準怎樣改善?
把句子縮短、移除難讀的中英夾雜和連續數字,先錄一段清晰、已獲授權的真人聲音,再逐句生成。完成後以耳機重播,檢查口型起點、停頓、專有名詞和字幕,而不是只看第一格和最後一格。
本文遵循我們的 編輯準則.

關於作者
HK Learn AI 編輯部
HK Learn AI 編輯部負責研究、查證同編寫每一篇內容,並引用官方及第一手來源。
此主題相關文章

ChatGPT 協作 Excel:寫公式、生成 VBA、自動製圖與匯出 PDF 報表
用一份虛構銷售明細完整示範:先讓 ChatGPT 理解欄位與驗收規格,再建立列級銷售額、業務彙總與佔比公式,審查 VBA、重建直條圖,資料適合時再建立圓餅圖,最後輸出具時間戳的 PDF。

Google 表單複選資料整理:用 ChatGPT 寫 Excel VBA 拆分報名名單
Google 表單的核取方塊答案全擠在同一格?本文用匿名範例把分隔符號內的選項拆成逐列名單,完整示範需求規格、ChatGPT 提示詞、VBA、Module、測試、驗算與 Power Query 替代方案。

ChatGPT 寫 Excel VBA 入門:貼上、儲存與執行 AI 巨集完整教學
拿到 ChatGPT 產生的 VBA 卻不知道放哪裏?由開啟 VBE、插入標準 Module、檢查程式、另存 .xlsm 到執行巨集與安全除錯,逐步把 AI 程式碼變成可測試、可回復的 Excel 自動化。