跳至主要內容
HK Learn AI
生成式 AI 教學

AI 寵物 Podcast 完整教學:用小雲雀、即夢製作貓狗吐槽對話影片

由一張貓狗 Podcast 畫面開始,逐步示範拆解參考、寫雙角色對白、用小雲雀快速生成,以及在即夢建立寵物主持圖、製作逐句對口型和剪成多人對話。本文按 2026 年 7 月現行介面修正舊版模型名稱,附可直接改寫的提示詞、成品預覽、費用判斷與逐格品質檢查。

HK Learn AI 編輯部標誌

HK Learn AI 編輯部

編輯部

發佈於 2026年7月20日

最後審閱:2026年7月20日

分享這篇文章
兩隻寵物戴上耳機坐在咪高峰前錄製 AI Podcast 的去識別成品畫面

難度

初階

所需時間

約 45–60 分鐘(不計排隊與重新生成)

你需要準備

小雲雀 AI 網頁版 · 即夢 AI/Dreamina 網頁版 · 可剪片及加字幕的影片編輯器 · 自有或已獲授權的寵物圖片、參考片段與聲音 · 耳機(逐句檢查聲畫同步)

開始之前

  • 準備一至兩張清晰寵物正面或四分之三側面圖片;眼睛、鼻口和耳朵不要被物件遮住
  • 只使用自己擁有、已獲授權或可合法使用的圖片、影片、聲音、音樂和參考素材
  • 先決定 9:16、1:1 或 16:9;本文示範以 16:9 雙主持 Podcast 構圖說明
  • 把對白分成一人一句的短句,並準備每隻寵物的角色、語氣、動作和說話次序
  • 接受模型、積分、片長、水印和地區供應會變;生成前以帳戶當日畫面為準

兩隻寵物戴着耳機坐在咪高峰前,一隻一本正經地吐槽,另一隻停半秒再反擊——這類「寵物 Podcast」短片看似只靠一個提示詞,真正決定成敗的卻是角色分工、逐句對口型、沉默角色控制和剪輯節奏。若把所有對白一次交給模型,最常見結果是兩張嘴一起動、牙齒變形、咪高峰漂移,或者角色說錯句子。

本文把整個流程拆成兩條路線:小雲雀適合快速用參考與完整提示試做;即夢/Dreamina則先生成一張穩定的 Podcast 主視覺,再逐位角色生成對口型。示範素材已移除原創作者、頻道、帳戶、人物與社交平台識別;文章只保留完成操作所需的畫面。

版本提醒:舊教學畫面曾使用 Seedance 1.5 Pro 和即夢圖片 4.5。本文在 2026 年 7 月 20 日重新檢查公開介面:小雲雀已可見 Seedance 2.0 系列,即夢圖片頁顯示圖片 5.0 Pro。名稱、積分、片長和功能會分階段調整,請用「功能目的」對照你的帳戶,而不要死跟舊按鈕位置。

先看目標成品:甚麼才算成功

頁首成品圖先做到角色清楚、咪高峰不遮嘴、光線一致和構圖可剪;原有字幕、帳戶和平台識別已裁走。正文不再重貼同一張圖。

合格的第一版不必追求電影級動作,但至少要同時通過五項檢查:

  1. 角色:毛色、品種、眼鏡、帽子和耳機在每個鏡頭一致。
  2. 說話者:只有該句的角色張嘴,另一位保持自然聆聽。
  3. 嘴形:下顎幅度合理,牙齒、舌頭和鼻口沒有突然融合或消失。
  4. 道具:咪高峰、耳機和桌面不漂移、不穿過臉或前腳。
  5. 節奏:每句短而清楚,保留反應停頓;字幕不遮住嘴和重點動作。

兩條工作流怎樣選

比較小雲雀快速路線即夢逐步控制路線
起點參考圖片/影片或完整文字描述先做角色主視覺,再做數字人對口型
優點步驟少,適合快速測概念、構圖和節奏可先修正圖片,再逐位角色設定聲音和動作
主要風險一次生成太多要求,角色與口型較難局部修片段較多,要管理版本、角色一致和剪輯
雙主持策略仍建議拆成一句一片,再交替剪接每次選一位角色/裁成單人鏡頭,逐句生成
適合先做 5–15 秒 proof of concept要準確控制形象、聲音、句子和反應節奏

如果是第一次做,先完成一個 8–12 秒、四句對白的版本。不要由 45 秒長片開始;片長越長,角色漂移、錯嘴、無意義停頓和重做成本越高。

步驟一:準備可合法使用的素材

1. 只保留真正需要的參考

準備一張或兩張寵物圖,最好同一光線和焦距。正面或四分之三側面最容易辨認嘴部;不要讓玩具、手、食物或長毛完全遮住下顎。若照片含有人臉、寵物名牌、電話、住址、窗外地標或定位資訊,先裁走,而不是用模糊遮蓋後仍保留輪廓。

2. 把「參考」拆成可重新創作的元素

可以學習一段短片的結構:開場鉤子、雙主持景別、咪高峰位置、一問一答、停頓和最後笑點;不要搬走它的創作者身份、完整腳本、燒錄字幕、背景音樂、品牌畫面或平台標誌。公開可見不代表有權下載或重新發布。

3. 決定畫幅和安全區

  • 9:16:適合短片平台;兩隻寵物要坐得更近,字幕放在下方安全區。
  • 16:9:適合網站、YouTube 或橫向教學;較易保留桌面、咪高峰和兩邊反應。
  • 1:1:可在多個 feed 重用,但要預留上下裁切空間。

步驟二:先寫可對口型的雙角色腳本

短片不是把一段長文切成兩把聲。最穩定結構是「鉤子 → 回應 → 升級 → 笑點」,每句約 6–16 個中文字,讓角色有時間開始、說完和閉嘴。先把台詞與動作分開:

角色 A(貓,冷靜):今日邊個負責準時開錄?
動作:望向右邊的狗,嘴部只在說話時移動。

角色 B(狗,活潑):我負責氣氛,你負責準時。
動作:先望鏡頭,再轉向貓;貓保持閉嘴聆聽。

角色 A:咁剪片又邊個做?
角色 B:當然係冇出鏡嗰位。

如果系統的文字轉語音讀不準廣東話、人名或品牌名,使用自己錄製或已獲授權的乾淨音訊。每句獨立一個檔案,前後各保留約 0.2–0.4 秒安靜,避免上一句尾音混入下一個角色。

方法 A:用小雲雀快速生成

步驟三:選擇最接近的短片模式

錄影版小雲雀模式選單顯示沉浸式短片與 Seedance 1.5 Pro
錄影當時由「模式」選擇沉浸式短片,並顯示 Seedance 1.5 Pro。這張畫面只用來對照舊介面;目前模型與入口請以下一張現行截圖為準。
小雲雀創作類型選單顯示沉浸式短片等現行選項
2026 年 7 月公開介面可見多種創作類型;選名稱最接近短片、有聲影片或參考復刻的入口,實際選項會因帳戶更新。

進入小雲雀後,不必執著舊錄影的按鈕名稱。你要找的是能加入參考素材、提示詞、畫幅和片長的短片流程。本文檢查時可見「沉浸式短片」等選項;其他帳戶也可能顯示 Agent、短劇或復刻類入口。

步驟四:選模型前先看消耗與能力

小雲雀模型選單顯示 Seedance 2.0 系列與每秒積分提示
舊教學的 Seedance 1.5 Pro 已不是唯一選擇。先查看目前模型、每秒積分、可參考素材和可生成片長,再決定是否提交。

Seedance 2.0 官方資料說明它可以同時參考圖片、影片與音訊,並生成最長 15 秒的多鏡頭有聲影片;但小雲雀內不同等級或體驗模型未必全部開放相同能力。先用低成本短片測角色,再升級解像度或片長。

步驟五:加入參考並寫完整生成提示

按加入素材的位置,上載你有權使用的寵物圖或參考片段。不要直接貼一個未知授權的熱門影片連結便當作可重用素材。若功能支援多參考,為每個檔案寫清用途,例如「只參考貓的毛色」「只參考鏡頭構圖」「只參考說話節奏」。

錄影版小雲雀提示詞輸入框顯示角色外觀、構圖、語氣和寫實要求
錄影把角色外觀、比例、色調、構圖、語氣與寫實風格放在同一提示中。本文保留這個寫法結構,但不要直接複製未授權影片,也不要把口音要求當作輸出保證。
寫實、專業的雙主持寵物 Podcast 錄音室,16:9,中景,固定鏡頭。
左邊是一隻戴黑色圓框眼鏡和耳機的胖三花貓,表情冷靜;
右邊是一隻戴藍色帽和耳機的白色薩摩耶,表情開朗。
兩者面前各有一支獨立咪高峰,嘴部完整可見,桌面乾淨。
角色外觀、體型、毛色、比例、構圖和暖色燈光全片一致。
說話次序:貓先說第一句,狗閉嘴聆聽;狗再說第二句,貓閉嘴。
自然呼吸和輕微眼神反應,不要卡通化,不要誇張張嘴。
不要文字、標誌、水印、額外肢體、漂移咪高峰、變形牙齒或第三個角色。

「完全匹配」和「避免恐怖谷」只可當目標,不是模型保證。比起形容詞堆疊,更重要的是指定唯一說話者、誰保持閉嘴、鏡頭是否固定、道具是否可動和不能出現甚麼。

步驟六:設定畫幅、片長,再做低成本測試

錄影版小雲雀畫幅選單顯示自動、16 比 9 和 9 比 16
先按發布位置選橫屏或豎屏;「自動」方便試做,但正式 campaign 最好明確鎖定畫幅和安全區。
錄影版小雲雀片長選單顯示自動、5 秒和 10 秒
錄影帳戶當時提供自動、5 秒與 10 秒。現行 Seedance 2.0 能力與小雲雀實際可選長度未必相同,應以生成按鈕旁的當日設定為準。
  1. 畫幅跟最終發布位置一致,不要生成後才大幅裁切。
  2. 第一輪只做一至兩句,片長以帳戶可選的最短實用設定為主。
  3. 確認提交按鈕旁的積分、模型、秒數、解像度和排隊提示。
  4. 生成完成後先完整播放,不要在結果仍載入或畫面切換時截圖。
  5. 若錯嘴,只重做該句;不要把四句全部一起重生。
錄影示例:霓虹錄音室中的貓與狗交替轉頭和說話。片段與頁首暖色成品是不同場景,已裁走來源字幕、平台及帳戶身份,並移除原聲。

方法 B:用即夢先做圖,再逐句對口型

步驟七:在圖片生成建立「可說話」主視覺

錄影版即夢圖片 4.5 頁面輸入雙主持寵物 Podcast 場景提示
錄影當時使用圖片 4.5,提示中指定三花貓、白色薩摩耶、眼鏡、帽子、咪高峰、寫實燈光與 16:9。下一張是目前圖片 5.0 Pro 的公開介面。
即夢圖片生成頁顯示圖片 5.0 Pro、參考上載和比例設定
即夢目前圖片頁可見圖片 5.0 Pro。先把靜態構圖、角色和咪高峰做準,之後才進入對口型。下方社群內容與帳戶區已裁走。

選圖片生成,加入寵物參考,再選跟發布一致的比例。主視覺要為動畫預留條件:嘴部清楚、兩張臉不要重疊、咪高峰不要遮下顎、眼鏡不要壓住眼睛、前腳與桌邊分開。

Photorealistic professional podcast studio, two pet hosts at one desk, medium two-shot, 16:9.
Left: a chubby calico cat wearing black round glasses and studio headphones, calm serious expression.
Right: a white Samoyed wearing a blue cap and studio headphones, cheerful expression.
One separate microphone per character, both mouths fully visible, realistic fur, warm soft key light,
symmetrical but natural composition, clean background, no people, no text, no logo, no watermark.
Negative: cartoon, extra animal, extra limb, fused paws, distorted teeth, open mouth at rest,
microphone crossing face, duplicated headphones, unreadable objects, platform interface.

一次生成多個候選可以,但不要把所有圖都塞進文章或剪輯。逐張放大到原尺寸,先淘汰嘴部、牙齒、眼睛、咪高峰和前腳有問題的版本,再只保留一個主視覺。這一步選錯,後面每句對口型都會把缺陷放大。

步驟八:進入數字人/對口型

錄影版即夢圖片結果頁開啟細節修復與對口型功能
錄影從選定圖片的細節修復選單進入「對口型」。介面入口會更新;真正要找的是選定角色、台詞或音訊,以及動作描述。
即夢數字人頁顯示角色、聲音、說話內容和動作描述欄
數字人流程把角色、聲音、說話內容和動作分開。每次只處理一位說話者,較容易找出錯誤。社群帳戶內容已裁走。
  1. 上載剛才選定的主視覺,或由圖片結果進入數字人/對口型。
  2. 指定本句角色;若介面無法可靠點選其中一隻,就先裁成單人中近鏡。
  3. 選合適聲音,或上載已獲授權、乾淨而短的音訊。
  4. 在「說話內容」只放台詞,不要把鏡頭指令混進朗讀文字。
  5. 在「動作描述」寫眼神、轉頭、情緒和沉默角色行為。
  6. 查看品質模式、字數/音訊長度、積分和可用解像度後再生成。
唯一說話者:右邊的白色薩摩耶。
動作:先望向鏡頭,自然眨眼;說到句子中段時輕微轉頭望向左邊的貓。
嘴形:只在聲音出現時自然開合,句尾立即閉嘴,不露出誇張牙齒。
沉默角色:左邊的貓全程閉嘴,只做輕微眼神和呼吸反應。
固定鏡頭;咪高峰、耳機、帽子、眼鏡、桌面和背景保持不動。

步驟九:同一主圖,分別生成角色 A 與 B

複製同一主視覺和設定,將第二句改成另一位角色。命名不要只用「版本 1/版本 2」,改用可追查格式:

01-cat-hook-v1.mp4
02-dog-reply-v2.mp4
03-cat-question-v1.mp4
04-dog-punchline-v3.mp4

如果雙人畫面仍令另一張嘴移動,可做兩個單人裁切版本。生成後在剪輯器以同一背景和相近景別交替,觀眾仍會理解兩者在同一錄音室。這通常比反覆要求模型在一個長鏡頭準確處理四輪說話更穩定。

即夢流程成品:狗說話時貓保持閉嘴並自然望向同伴。已把結尾動態糊幀剪走,完整抽幀確認角色、咪高峰與配件穩定;片段沒有原聲或身份資訊。

現行工具的影片控制可怎樣幫到你

即夢影片功能展示鏡頭與生成控制
當你需要在對話以外加一個建立場景或反應鏡頭,可用影片生成控制;不要把不相關的展示片當作寵物 Podcast 成品。

對口型負責「誰說甚麼」,一般影片生成則適合做開場、建立錄音室、角色入鏡或無台詞反應。兩種任務不要混成一個過長提示。若使用鏡頭運動、首尾幀或多參考控制,先鎖定靜態角色和道具,再逐項增加動作;每加一項都重新抽幀檢查,不要把不相關的產品展示片當作本文成品。

步驟十:在剪輯器組成真正的雙主持對話

剪輯時間線把多段貓狗 Podcast 對口型片段交替排列
錄影把分別生成的貓、狗說話片段匯入時間線再組合。畫面只保留操作區,沒有作者、帳戶或社交平台身份。
  1. 把四句片段按 A → B → A → B 放到時間線,不要一開始便加特效。
  2. 每句開頭剪走模型準備張嘴的僵硬畫面,句尾保留約 0.15–0.35 秒自然閉嘴。
  3. 若用單人裁切,在角色轉換位置加直切或極短音訊 J-cut;避免花巧轉場令畫面糊掉。
  4. 統一音量;背景音樂要低於人聲,並確認有商業使用權。
  5. 人工校對繁體中文字幕。每行盡量短,不遮嘴、咪高峰或寵物表情。
  6. 先輸出一個低碼率審稿版,完整觀看後才輸出最終版。

讓笑點更自然的時間參考

位置建議長度作用
開場建立鏡頭0.5–1.0 秒讓觀眾看清兩個角色和 Podcast 場景
每句前0.1–0.25 秒避免一切鏡便立即張嘴
普通回應0.15–0.35 秒保持節奏,不像把音訊硬拼起來
最後笑點前0.4–0.8 秒讓表情和沉默角色反應建立預期
結尾0.5–1.0 秒確認兩張嘴閉合,再接片尾或 CTA

常見失敗與修正

問題最可能原因優先修正
兩隻一起張嘴同框角色太近,提示沒有唯一說話者一句一片;裁成單人鏡;明寫另一位全程閉嘴
說錯角色只寫左右,模型重新構圖後失去指向用毛色、配件和位置三重描述;先生成靜態主圖
牙齒或下顎變形原圖嘴部不清、句子太長、張嘴幅度過大換清晰主圖;縮短句子;要求自然小幅開合
角色外觀跳變每句由不同提示重新生成重用同一主圖、種子或參考;固定配件和燈光
咪高峰漂移模型把道具當成可動主體寫明固定;讓咪高峰與嘴保持空隙;必要時改用單人近鏡
廣東話不自然TTS 讀音或中英夾雜不穩用已授權自錄音訊;逐句生成;字幕人工校對
影片看似模糊截到載入、轉場或快速運動幀等生成完成;以固定間隔抽幀;選靜止而資訊完整的海報
畫面有帳戶或平台宣傳直接截整個社交或社群頁面從原素材重新裁切;移除身份區;不能安全裁走就棄用

費用、地區與「免費」要怎樣理解

錄影中出現的每日積分和每段消耗,只能代表當時帳戶、活動、模型與地區,不能當成 2026 年 7 月固定價格。小雲雀的現行模型選單會在部分選項旁顯示每秒積分提示;即夢/Dreamina 的免費 tokens、方案、水印和片長也會按入口、地區和活動改變。

錄影帳戶的歷史積分紀錄顯示到期清零與影片生成扣減
這是錄影當時單一帳戶的歷史紀錄,只示範應在哪裡核對可用積分、到期與實際扣減;圖中的 60、70 並不是現行固定價格。

每次提交前記錄六項:模型、畫幅、解像度、秒數、預計積分、匯出水印。先用最短片測角色,再決定是否花積分提高品質。香港帳戶亦可能因分階段推出而看不到某個中國版或全球版功能,文章不保證所有帳戶同日可用。

版權、聲音與 AI 標識

  • 參考素材:只用自有或已獲授權內容;保留來源、許可和付款紀錄。
  • 寵物與人物:寵物照也可能包含主人的臉、住所、電話或地點線索,發布前要移除。
  • 聲音:只使用自己聲音、合約許可聲音或平台授權聲庫;不要模仿可識別人士作未授權代言。
  • 音樂與字型:分別確認商業發布、地區和平台許可,不能因影片是 AI 生成便忽略。
  • AI 標識:小雲雀協議要求遵守相關 AI 標識規則,亦不應自行隱藏或刪除必要標識。裁走第三方帳戶身份與刪除法規或平台要求的 AI 標識是兩回事。
  • 披露:若畫面或聲音可能令人誤以為真實寵物真的說過某句話,加入清楚的 AI 生成/合成內容說明。

如要把短片用於品牌推廣,可配合香港 AI 影片營銷指南建立審批、素材權利與發布流程;靜態主視覺可參考AI 圖像生成實務,字幕與剪輯則可看剪映 AI 功能教學

發布前逐格 QA 清單

  1. 完整播放:由第一格看到最後一格,不只看模型挑選的封面。
  2. 固定抽幀:每 0.5–1 秒查看一格,特別檢查開口、閉口、轉頭和切鏡位置。
  3. 角色:毛色、眼睛、耳朵、配件和體型沒有跳變。
  4. 嘴形:唯一說話者正確;沉默角色沒有跟讀;牙齒、舌頭和下顎自然。
  5. 道具:咪高峰、耳機、帽子、眼鏡、桌邊與前腳沒有融合或漂移。
  6. 聲音:發音、音量、停頓、授權和角色配對正確,沒有不必要的原片聲音。
  7. 字幕:繁體字、標點和專有名詞正確;沒有原作者、頻道、帳戶或社交平台識別。
  8. 圖片:每張以原尺寸開啟;沒有載入、spinner、糊幀、半截 UI、重複或資訊不足。
  9. 預覽:影片海報與正文圖片不是同一格;不同預覽展示不同操作或結果。
  10. 權利與披露:素材、聲音、音樂、輸出條款、AI 標識和合成內容說明均已確認。

本文媒體的實際處理標準

本文只保留能解釋一個明確步驟的畫面。原影片縮圖因含人物與頻道式宣傳而棄用;相近構圖、載入畫面、模糊移動幀和帶身份區的社群內容亦不發布。所有最終圖像、海報和影片會在上載前再次以原尺寸或固定間隔抽幀檢查。

最短可行版本:30 分鐘完成第一次測試

  1. 用 5 分鐘選一張已授權、嘴部清楚的寵物圖,決定 16:9 或 9:16。
  2. 用 5 分鐘寫四句、每句不超過 16 字的 A/B 對白。
  3. 用 10 分鐘在小雲雀做兩句低成本測試,或在即夢生成一張穩定主圖。
  4. 用 5–10 分鐘只為一位角色生成一句對口型,確認流程可行。
  5. 剩餘時間做抽幀 QA,記下錯嘴、道具、讀音和積分,再決定是否擴成完整版本。

第一輪的目標不是立即發布,而是證明三件事:角色能保持一致、指定角色能準確說一句、你知道每次生成的實際成本。三項都過關,才值得擴寫腳本、增加鏡頭和輸出高解像版本。

資料來源與引用

我們附上第一手及官方來源,方便你逐一核實。

  1. 1.小雲雀 AI剪映
  2. 2.Seedance 2.0 正式發布ByteDance Seed
  3. 3.Seedance 2.0 產品頁ByteDance Seed
  4. 4.Dreamina AI Lip Sync 使用指南CapCut
  5. 5.Dreamina Animated Image MakerCapCut
  6. 6.Dreamina 與 Runway AI 功能及方案比較CapCut
  7. 7.小雲雀用戶協議剪映
  8. 8.Dreamina Terms of ServiceCapCut

常見問題

AI 寵物 Podcast 是真正的 Podcast 嗎?

本文指的是以錄音室、咪高峰、耳機和主持對話為視覺語言的短片。它可以發布到短片或社交平台,但不會自動建立 RSS feed、節目頁或音訊平台分發。

小雲雀和即夢應該選哪一個?

想快速由參考和完整提示試做,可先用小雲雀;想先把角色圖做準、逐隻設定聲音和動作,再逐句修正對口型,通常用即夢較容易控制。實際可用功能、模型和地區供應會因帳戶而異。

即夢和 Dreamina 是否同一個工具?

兩者屬同一產品體系的中國版與全球版入口,但名稱、模型、方案、介面、地區供應和條款未必完全相同。跟著本文時應按自己帳戶可見的圖片生成、數字人/AI Avatar、對口型和音訊上載功能對照。

為甚麼兩隻動物會同時張嘴?

單張圖同時包含兩張臉時,模型未必能穩定理解說話者。最可靠的方法是每次只生成一句、明確指定唯一說話者和沉默角色,必要時分別裁成兩個單人鏡頭,再在剪輯器交替排列。

可以用自己的寵物樣貌嗎?

可以,但最好使用清晰、光線一致、沒有名牌電話或住址線索的照片。參考圖只應包含你有權使用的內容;發布前要檢查生成結果有沒有改變品種、毛色、眼睛、項圈或其他身份特徵。

可以下載任何網上熱門影片作參考嗎?

不可以把可觀看等同可重用。使用自有、獲授權、公共領域或許可明確的素材,並保留來源和許可紀錄。不要複製另一帳戶的完整對白、字幕、音樂、人物、頻道識別、平台標誌或 AI 標識。

兩個工具是否免費?

免費通常只代表試用、每日或活動積分、有限模型、有限片長、排隊或帶水印匯出,不等於無限免費。積分和方案經常變,應在按下生成前查看模型、秒數、解像度和實際消耗。

廣東話對口型不準怎樣改善?

把句子縮短、移除難讀的中英夾雜和連續數字,先錄一段清晰、已獲授權的真人聲音,再逐句生成。完成後以耳機重播,檢查口型起點、停頓、專有名詞和字幕,而不是只看第一格和最後一格。

本文遵循我們的 編輯準則.

HK Learn AI 編輯部標誌

關於作者

HK Learn AI 編輯部

HK Learn AI 編輯部負責研究、查證同編寫每一篇內容,並引用官方及第一手來源。