# Act 3: Buhayin ang Iyong Podcast 🎤 ![lab3](../../../../translated_images/tl/lab3.b009c55c4442250b.webp) ## Ang Pinakabagong Kabanata Nagsaliksik ka na ng mga paksa. Nakasulat ka na ng mga script. Ngayon, ang panghuli: gawing totoong podcast audio na may makatotohanang mga boses ang iyong teksto! Ipinapakilala si **VibeVoice** — ang open-source TTS (text-to-speech) na himala ng Microsoft Research na lumilikha ng: - 🎭 Natural na tunog ng mga pag-uusap - 👥 Maramihang tagapagsalita (hanggang 4!) - ⏱️ Mahahabang audio (hanggang 90 minuto!) - 🎵 Mapanlikhang pag-deliver (hindi boses ng robot!) Ito ang teknolohiya sa likod ng gawa-gawang mga podcast. Gawin natin ang sa iyo! ## Ano ang VibeVoice? (Ang Astig na Bagay) Ang VibeVoice ay regalo ng Microsoft Research sa mundo. Talagang dinisenyo ito para sa podcast-style na mga pag-uusap na audio. ### Bakit Ito Kamangha-mangha 🔥 * **⏱️ Marathon Sessions**: Nakakagawa ng hanggang 90 minutong tuloy-tuloy na pagsasalita (ito ay buong episode ng podcast!) * **👥 Multi-Speaker Magic**: Hanggang 4 na iba't ibang boses na may pare-parehong personalidad * **⚡ Sobrang Epektibo**: Gumagamit ng ultra-mababang 7.5 Hz frame rate para makatipid ng compute power * **🧠 Matalinong Audio**: Pinag-iisa ang LLM (nakakaintindi ng konteksto) at diffusion model (lumilikha ng makatotohanang audio) * **🎭 Natural na Daloy**: Namamahala ng turn-taking, mga paghinto, at ritmo ng pag-uusap nang awtomatiko **Salin**: Hindi lang basta binabasa ng VibeVoice ang iyong script — *gina-ganap* nito ito na parang totoong tao ang nagsasalita. --- ## Bago Ka Magsimula 🚀 **Kailangan Mo**: * 🐍 **Python 3.10+** (nasa iyo na ito mula sa Acts 1 & 2) * 🚀 **uv** (isang mabilis na Python package manager — iko-install natin ito) * 📝 **Ang Iyong Script**: Ang `podcast.txt` na file mula sa Act 2 (nasa `../03.Application/`) **Pro Tip**: Kailangan nito ng magandang koneksyon sa internet para i-download ang pre-trained model. Kumuha ng kape! ☕ --- ## Tara Na! Ang Madaling Paraan 🎬 Pinadali namin ito sobrang simple. Isang shell script lang ang gagawa ng lahat. ### Ang Proseso 1. **Gawing executable**: ```bash chmod +x run_vibe_voice.sh ``` 2. **Patakbuhin ito**: ```bash ./run_vibe_voice.sh ``` 3. **Maghintay sa mahika** (maaari itong tumagal ng ilang minuto sa unang takbo) ### Ano ang Nangyayari Sa Likod ng Eksena 🎭 Ang script ay parang awtomatikong sound engineer mo: 1. **📥 Idi-download ang VibeVoice**: Kinokopya ang official repo mula sa GitHub 2. **📦 Ini-install ang Dependencies**: Ginagamit ang `uv pip` para sa napakabilis na pag-install ng package 3. **🎬 Gumagawa ng Audio**: Pinapatakbo ang inference script gamit ang: * `--model_path`: Ang pre-trained na VibeVoice-7B model * `--txt_path`: Ang iyong `podcast.txt` script * `--speaker_names`: Itinakda ang mga boses (Xinran & Anchen bilang default) **Resulta**: Nagiging totoong episode ng podcast ang iyong script! 🎉 --- ## Ang Iyong Misyon 🎯 Gawing mas kawili-wili ito: ### Gawain 1: Gumawa ng Nilalaman I-edit ang `../03.Application/podcast.txt` na may pag-uusap ng dalawang tao. Gawin itong tungkol sa tech, hobbies, kahit ano! Siguraduhing conversational ito. **Halimbawa ng Format**: ``` Speaker 1: Hey! Did you hear about the new AI model? Speaker 2: No way! Tell me more! Speaker 1: It's called... ``` ### Gawain 2: Gumawa ng Audio Patakbuhin ang script at panoorin ang mahika. Mas tatagal sa unang beses (pag-download ng modelo). ### Gawain 3: Pakinggan at Suriin - Natural ba ang tunog? - May magkakaibang boses ba ang mga tagapagsalita? - Makinis ba ang palitan ng salita? - May mga robotic moments ba? ### Gawain 4: Mag-eksperimento (Para sa Matapang) I-edit ang `run_vibe_voice.sh` at palitan ang `--speaker_names` para subukan ang iba't ibang kombinasyon ng boses. Marami ang pre-trained na boses ng VibeVoice! **Bonus Challenge**: Subukan ang pag-uusap ng 3 tagapagsalita! 🎆 --- ## Matuto Pa 📚 * **🏠 Homepage ng Proyekto**: [VibeVoice Official Site](https://microsoft.github.io/VibeVoice/) * **🤗 Pre-trained Model**: [Hugging Face - VibeVoice-7B](https://huggingface.co/vibevoice/VibeVoice-7B) * **📖 Research Paper**: Siyasatin ang teknolohiya (kung interesado ka) > **⚠️ Paalala sa Responsableng AI**: Makapangyarihan ang VibeVoice. Gamitin ito nang may etika! Huwag gumawa ng deepfakes o mapanlinlang na nilalaman. Gumawa ng mga magagandang bagay na nakakatulong sa tao. 🙏 --- ## 🏆 Congratulations! Nagawa Mo Na! Katatapos mo lang ng buong pipeline: 1. ✅ **Act 1**: Naka-buo ng AI agents gamit ang custom tools 2. ✅ **Act 2**: Nakapamahala ng multi-agent workflow 3. ✅ **Act 3**: Nakagawa ng totoong podcast audio **Ngayon ay mayroon ka ng**: - Isang gumaganang AI research assistant - Isang buong podcast production workflow - Isang totoong audio file na maaari mong ibahagi ### Ano Ang Susunod? 🚀 **I-launch ang iyong podcast!** - I-upload sa mga podcast platforms - Ibahagi sa social media - I-iterate at pagandahin **Patuloy na magtayo!** - Subukan ang iba't ibang mga paksa - Mag-eksperimento sa mas maraming tagapagsalita - Magdagdag ng background music - Gumawa ng web interface - I-automate ang buong proseso **Ibahagi ang iyong gawa!** I-tag kami! Ipakita sa mundo ang iyong nagawa. Nagsisimula sa iyo ang AI podcast revolution. 🎙️ --- **May tanong? Mga ideya? Kwento ng tagumpay?** I-drop ito sa workshop chat! **Maligayang pagdating sa hinaharap ng content creation.** 🌟 --- **Paunawa**: Ang dokumentong ito ay isinalin gamit ang serbisyo ng AI translation na [Co-op Translator](https://github.com/Azure/co-op-translator). Bagaman nagsusumikap kami para sa katumpakan, pakatandaan na ang mga awtomatikong pagsasalin ay maaaring maglaman ng mga pagkakamali o di-tumpak na impormasyon. Ang orihinal na dokumento sa orihinal nitong wika ang dapat ituring na pinagkakatiwalaang sanggunian. Para sa mahahalagang impormasyon, inirerekomenda ang propesyonal na pagsasaling-tao. Hindi kami mananagot sa anumang hindi pagkakaintindihan o maling interpretasyon na nagmula sa paggamit ng pagsasaling ito.