# Aktas 3: Įkvėpkite savo podcastą 🎤 ![lab3](../../../../translated_images/lt/lab3.b009c55c4442250b.webp) ## Didysis finalas Jūs tyrinėjote temas. Jūs rašėte scenarijus. Dabar – vyšnia ant torto: paversti savo tekstą tikru podcast garso įrašu su natūraliomis balsų variacijomis! Pristatome **VibeVoice** — Microsoft Research atvirojo kodo TTS (tekstas į kalbą) magiją, kuri kuria: - 🎭 Natūraliai skambančius pokalbius - 👥 Keletą kalbėtojų (iki 4!) - ⏱️ Ilgalaikį garsą (iki 90 minučių!) - 🎵 Išraiškingą pateikimą (ne robotų balsai!) Tai technologija už sintetinių podcastų. Padarykime tavo! ## Kas yra VibeVoice? (Įdomybės) VibeVoice – tai Microsoft Research dovana pasauliui. Jis specialiai sukurtas podcast stiliaus pokalbiams perteikti. ### Kodėl tai nuostabu 🔥 * **⏱️ Maratono sesijos**: Sugeneruoja iki 90 minučių nuoseklaus kalbėjimo (tai pilnas podcast epizodas!) * **👥 Daugiakalbių magija**: Iki 4 skirtingų balsų su nuosekliomis asmenybėmis * **⚡ Be proto efektyvus**: Naudoja itin mažą 7,5 Hz kadrų dažnį, kad taupytų skaičiavimo resursus * **🧠 Protingas garsas**: Derina LLM (supranta kontekstą) su difuzijos modeliu (kuria realistišką garsą) * **🎭 Natūralus srautas**: Automatiškai valdo kalbų kaitą, pauzes bei pokalbio ritmą **Vertimas**: VibeVoice ne tik skaito tavo scenarijų — jis *atlieka* jį kaip tikri žmonės. --- ## Prieš pradedant 🚀 **Ko reikia**: * 🐍 **Python 3.10+** (tai jau turite iš 1 ir 2 aktų) * 🚀 **uv** (greitas Python paketų tvarkyklė – įdiegsime ją) * 📝 **Tavo scenarijus**: `podcast.txt` failas iš 2 akto (kataloge `../03.Application/`) **Pro patarimas**: Šiam žingsniui reikės gero interneto ryšio, kad būtų galima atsisiųsti iš anksto išmokytą modelį. Pasigamink kavos! ☕ --- ## Pradedam! Paprastas būdas 🎬 Padarėme tai labai paprasta. Vienas shell skriptas atlieka viską. ### Procesas 1. **Padaryti vykdomu**: ```bash chmod +x run_vibe_voice.sh ``` 2. **Paleisti jį**: ```bash ./run_vibe_voice.sh ``` 3. **Laukti stebuklo** (pirmą kartą gali užtrukti kelias minutes) ### Kas vyksta už užkulisių 🎭 Skriptas iš esmės yra tavo automatizuotas garso inžinierius: 1. **📥 Atsisiunčia VibeVoice**: Nukopijuoja oficialų repo iš GitHub 2. **📦 Įdiegia priklausomybes**: Naudoja `uv pip` labai greitam paketų diegimui 3. **🎬 Generuoja garsą**: Atlieka inferenciją su: * `--model_path`: Iš anksto apmokytas VibeVoice-7B modelis * `--txt_path`: Tavo `podcast.txt` scenarijus * `--speaker_names`: Priskiria balsus (pagal nutylėjimą Xinran & Anchen) **Rezultatas**: Tavo scenarijus virsta tikru podcast epizodu! 🎉 --- ## Tavo užduotis 🎯 Padarykime tai įdomiau: ### Užduotis 1: Sukurk turinį Redaguok `../03.Application/podcast.txt` su dviejų žmonių pokalbiu. Kalbėkite apie technologijas, pomėgius ar ką nors! Svarbiausia, kad būtų pokalbis. **Formatavimo pavyzdys**: ``` Speaker 1: Hey! Did you hear about the new AI model? Speaker 2: No way! Tell me more! Speaker 1: It's called... ``` ### Užduotis 2: Sukurk garsą Paleisk skriptą ir stebėk kaip vyksta magija. Pirmą kartą užtruks ilgiau (modelio atsisiuntimas). ### Užduotis 3: Klausyk ir analizuok - Ar skamba natūraliai? - Ar kalbėtojai turi skirtingus balsus? - Ar sklandžiai vyksta kalbų kaita? - Ar nėra roboto balsų momentų? ### Užduotis 4: Eksperimentuok (Drąsiausiems) Redaguok `run_vibe_voice.sh` ir pakeisk `--speaker_names`, kad išbandytum skirtingas balso kombinacijas. VibeVoice turi daug iš anksto apmokytų balsų! **Papildomas iššūkis**: Išbandyk pokalbį su 3 kalbėtojais! 🎆 --- ## Sužinok daugiau 📚 * **🏠 Projekto svetainė**: [VibeVoice oficiali svetainė](https://microsoft.github.io/VibeVoice/) * **🤗 Iš anksto apmokytas modelis**: [Hugging Face - VibeVoice-7B](https://huggingface.co/vibevoice/VibeVoice-7B) * **📖 Mokslinis straipsnis**: Gilinkis į technologiją (jei tai tau įdomu) > **⚠️ Atsakingo dirbtinio intelekto priminimas**: VibeVoice yra galingas. Naudok jį etiškai! Nesukurk deepfake ar klaidinančio turinio. Kurk naudinga ir įdomu. 🙏 --- ## 🏆 Sveikiname! Tu tai padarei! Tu ką tik užbaigei visą procesą: 1. ✅ **Aktas 1**: Sukūrė AI agentus su individualiais įrankiais 2. ✅ **Aktas 2**: Organizavo daugiaagentinį darbo srautą 3. ✅ **Aktas 3**: Sugeneravo tikrą podcast garso įrašą **Dabar turi**: - Veikiantį AI tyrimų asistentą - Pilną podcast produkcijos darbo srautą - Tikrą garso failą, kurį gali dalintis ### Kas toliau? 🚀 **Paleisk savo podcastą!** - Įkelk jį į podcast platformas - Dalinkis socialiniuose tinkluose - Tobulink ir tobulėk **Tęsk kūrimą!** - Išbandyk skirtingas temas - Ekspermentuok su daugiau kalbėtojų - Pridėk foninę muziką - Sukurk internetinę sąsają - Automatizuok visą procesą **Dalinkis savo kūryba!** Pažymėk mus! Parodyk pasauliui ką sukūrei. AI podcast revoliucija prasideda nuo tavęs. 🎙️ --- **Klausimų? Idėjų? Sėkmės istorijų?** Rašyk darbo kambario pokalbyje! **Sveiki atvykę į turinio kūrimo ateitį.** 🌟 --- **Atsakomybės apribojimas**: Šis dokumentas buvo išverstas naudojant dirbtinio intelekto vertimo paslaugą [Co-op Translator](https://github.com/Azure/co-op-translator). Nors stengiamės užtikrinti tikslumą, atkreipkite dėmesį, kad automatiniai vertimai gali turėti klaidų ar netikslumų. Originalus dokumentas gimtąja kalba turėtų būti laikomas autoritetingu šaltiniu. Svarbiai informacijai rekomenduojamas profesionalus žmogaus atliktas vertimas. Mes neatsakome už bet kokius nesusipratimus ar klaidingą interpretavimą, atsiradusius dėl šio vertimo naudojimo.