# Act 3: 為你的播客注入生命 🎤 ![lab3](../../../../translated_images/zh-HK/lab3.b009c55c4442250b.webp) ## 壓軸大戲 你已經研究了主題,寫好了劇本。現在是最精彩的時刻:將你的文字轉換成帶有逼真聲音的播客音頻! 介紹 **VibeVoice** — 微軟研究院開源的 TTS(文字轉語音)魔法,可以創造: - 🎭 自然的對話聲音 - 👥 多重說話者(最多4位!) - ⏱️ 長篇音頻(最多90分鐘!) - 🎵 富有表情的語音(不是機械人聲!) 這就是合成播客背後的技術。讓我們來製作屬於你的播客! ## VibeVoice 是什麼?(炫酷亮點) VibeVoice 是微軟研究院獻給世界的禮物。它專為播客風格的對話音頻而設計。 ### 為何它這麼棒 🔥 * **⏱️ 馬拉松長時間**:生成長達90分鐘的連續語音(就是一整集播客!) * **👥 多說話者魔法**:最多4種不同聲音,且保持人設一致 * **⚡ 超高效能**:使用超低 7.5 Hz 幀率,節省計算資源 * **🧠 智能音訊**:結合大型語言模型(理解上下文)與擴散模型(製造真實音訊) * **🎭 自然流暢**:自動處理輪流說話、停頓和對話節奏 **換句話說**:VibeVoice 不只是朗讀你的劇本——它像真人對話一樣*演繹*。 --- ## 開始之前 🚀 **你需要:** * 🐍 **Python 3.10+**(你已經在 Acts 1 和 2 安裝好了) * 🚀 **uv**(一個快速的 Python 套件管理工具—我們會安裝它) * 📝 **你的劇本**:從 Act 2 取得的 `podcast.txt`(在 `../03.Application/`) **專家提示**:這一步需要良好網絡連接下載預訓練模型。喝杯咖啡吧!☕ --- ## 開始吧!簡單路線 🎬 我們把整個流程簡化到極致。一個 shell 腳本搞定一切。 ### 流程 1. **授權執行權限**: ```bash chmod +x run_vibe_voice.sh ``` 2. **執行腳本**: ```bash ./run_vibe_voice.sh ``` 3. **等待魔法完成**(首次運行可能要幾分鐘) ### 背後發生什麼 🎭 這個腳本就是你的自動音效工程師: 1. **📥 下載 VibeVoice**:從 GitHub 克隆官方倉庫 2. **📦 安裝依賴**:利用 `uv pip` 超迅速安裝套件 3. **🎬 生成音頻**:執行推論腳本並帶入: * `--model_path`:預訓練的 VibeVoice-7B 模型 * `--txt_path`:你的 `podcast.txt` 劇本 * `--speaker_names`:指派聲音(預設為 Xinran 和 Anchen) **結果**:你的劇本變成真正的播客集!🎉 --- ## 你的任務 🎯 讓我們來點挑戰: ### 任務 1:創作內容 編輯 `../03.Application/podcast.txt` ,寫一段兩人對話。主題不限,可以是科技、興趣,只要自然對話就好。 **格式範例**: ``` Speaker 1: Hey! Did you hear about the new AI model? Speaker 2: No way! Tell me more! Speaker 1: It's called... ``` ### 任務 2:生成音頻 執行腳本,見證魔法發生。首次使用因為還要下載模型會比較慢。 ### 任務 3:聆聽與分析 - 聲音自然嗎? - 演講者的聲音區分明顯嗎? - 輪流說話流暢嗎? - 有沒有機械人音調? ### 任務 4:嘗試 (敢挑戰的你) 編輯 `run_vibe_voice.sh`,改變 `--speaker_names` 來試不同聲音組合。VibeVoice 有多個預訓練聲音可用! **額外挑戰**:試試三人對話!🎆 --- ## 深入了解 📚 * **🏠 專案首頁**: [VibeVoice 官方網站](https://microsoft.github.io/VibeVoice/) * **🤗 預訓練模型**: [Hugging Face - VibeVoice-7B](https://huggingface.co/vibevoice/VibeVoice-7B) * **📖 研究論文**:深入瞭解背後技術(如果你感興趣) > **⚠️ 負責任的 AI 提醒**:VibeVoice 功能強大,請負責任地使用!不要製作深偽或誤導內容。創造有益的精彩作品。🙏 --- ## 🏆 恭喜!你做到了! 你剛剛完成了整個流程: 1. ✅ **Act 1**:建立具定制工具的 AI 代理 2. ✅ **Act 2**:編排多代理工作流程 3. ✅ **Act 3**:生成真實播客音頻 **現在你擁有**: - 可用的 AI 研究助理 - 完整的播客製作流程 - 可分享的真實音頻文件 ### 下一步?🚀 **上線你的播客!** - 上傳到播客平台 - 分享到社交媒體 - 持續迭代提升 **繼續建構!** - 嘗試不同主題 - 玩更多說話者組合 - 加進背景音樂 - 建立網頁界面 - 自動化整個流程 **分享你的成果!** 標記我們!向世界展示你的創作。AI 播客革命由你開始。🎙️ --- **有問題?想法?成功故事?** 在工作坊聊天裡告訴我們! **歡迎來到內容創作的未來。** 🌟 --- **免責聲明**: 本文件乃使用 AI 翻譯服務 [Co-op Translator](https://github.com/Azure/co-op-translator) 所翻譯。雖然我們致力於準確性,但請注意自動翻譯可能包含錯誤或不準確之處。原文文件應視為權威來源。對於關鍵資訊,建議採用專業人工翻譯。我們不對因使用本翻譯而產生之任何誤解或誤釋負責。