# Hành động 3: Mang Podcast của Bạn Đến Cuộc Sống 🎤 ![lab3](../../../../translated_images/vi/lab3.b009c55c4442250b.webp) ## Phần Kết Thúc Hoành Tráng Bạn đã nghiên cứu các chủ đề. Bạn đã viết kịch bản. Giờ đến phần quan trọng nhất: biến văn bản của bạn thành âm thanh podcast thực sự với giọng nói tự nhiên! Hãy gặp **VibeVoice** — phép thuật TTS (text-to-speech) mã nguồn mở của Microsoft Research tạo ra: - 🎭 Hội thoại nghe tự nhiên - 👥 Nhiều người nói (tối đa 4 người!) - ⏱️ Âm thanh dài (tối đa 90 phút!) - 🎵 Cách thể hiện biểu cảm (không phải giọng robot!) Đây chính là công nghệ phía sau các podcast tổng hợp. Hãy tạo podcast của bạn nào! ## VibeVoice Là Gì? (Điều Thú Vị) VibeVoice là món quà của Microsoft Research dành cho thế giới. Nó được thiết kế đặc biệt cho âm thanh hội thoại kiểu podcast. ### Tại Sao Nó Tuyệt Vời 🔥 * **⏱️ Phiên Liên Tục Dài**: Tạo ra giọng nói liên tục lên đến 90 phút (đây là một tập podcast đầy đủ!) * **👥 Phép Thuật Đa Người Nói**: Tối đa 4 giọng khác nhau với tính cách nhất quán * **⚡ Siêu Hiệu Quả**: Sử dụng tần số khung hình cực thấp 7.5 Hz để tiết kiệm công suất tính toán * **🧠 Âm Thanh Thông Minh**: Kết hợp LLM (hiểu ngữ cảnh) với mô hình khuếch tán (tạo âm thanh thực tế) * **🎭 Dòng Chảy Tự Nhiên**: Tự động xử lý lượt nói, ngắt quãng và nhịp điệu hội thoại **Dịch**: VibeVoice không chỉ đọc kịch bản của bạn — nó *diễn xuất* như người thật đang nói chuyện. --- ## Trước Khi Bắt Đầu 🚀 **Bạn Cần**: * 🐍 **Python 3.10+** (bạn đã có từ Hành động 1 & 2) * 🚀 **uv** (trình quản lý gói Python nhanh — chúng ta sẽ cài đặt) * 📝 **Kịch Bản Của Bạn**: Tệp `podcast.txt` từ Hành động 2 (trong `../03.Application/`) **Mẹo Chuyên Nghiệp**: Bước này cần kết nối internet tốt để tải mô hình đã huấn luyện sẵn. Hãy lấy một tách cà phê! ☕ --- ## Bắt Đầu Nào! Cách Đơn Giản 🎬 Chúng tôi đã làm cho nó cực kỳ dễ dàng. Một script shell làm tất cả. ### Quy Trình 1. **Cho phép chạy**: ```bash chmod +x run_vibe_voice.sh ``` 2. **Chạy script**: ```bash ./run_vibe_voice.sh ``` 3. **Chờ phép màu diễn ra** (lần đầu có thể mất vài phút) ### Chuyện Gì Xảy Ra Phía Sau 🎭 Script chính là kỹ sư âm thanh tự động của bạn: 1. **📥 Tải VibeVoice**: Clone repo chính thức từ GitHub 2. **📦 Cài Đặt Phụ Thuộc**: Dùng `uv pip` để cài đặt gói nhanh như chớp 3. **🎬 Tạo Âm Thanh**: Chạy script suy luận với: * `--model_path`: Mô hình VibeVoice-7B đã huấn luyện sẵn * `--txt_path`: Kịch bản `podcast.txt` của bạn * `--speaker_names`: Gán giọng nói (mặc định Xinran & Anchen) **Kết Quả**: Kịch bản của bạn trở thành một tập podcast thực thụ! 🎉 --- ## Nhiệm Vụ Của Bạn 🎯 Hãy làm cho nó thú vị: ### Nhiệm Vụ 1: Tạo Nội Dung Chỉnh sửa `../03.Application/podcast.txt` với một cuộc hội thoại giữa hai người. Hãy nói về công nghệ, sở thích, bất cứ điều gì! Chủ yếu là phải tự nhiên. **Ví dụ Định Dạng**: ``` Speaker 1: Hey! Did you hear about the new AI model? Speaker 2: No way! Tell me more! Speaker 1: It's called... ``` ### Nhiệm Vụ 2: Tạo Âm Thanh Chạy script và chứng kiến phép màu xảy ra. Lần đầu sẽ mất nhiều thời gian hơn (tải mô hình). ### Nhiệm Vụ 3: Nghe & Phân Tích - Nó có nghe tự nhiên không? - Giọng các người nói có khác biệt rõ ràng không? - Quá trình lượt nói có trôi chảy không? - Có đoạn nào nghe như robot không? ### Nhiệm Vụ 4: Thử Nghiệm (Dành Cho Người Mạo Hiểm) Chỉnh sửa `run_vibe_voice.sh` và thay đổi `--speaker_names` để thử các kết hợp giọng khác nhau. VibeVoice có nhiều giọng đã huấn luyện! **Thử Thách Thưởng**: Thử một cuộc hội thoại 3 người! 🎆 --- ## Tìm Hiểu Thêm 📚 * **🏠 Trang Chủ Dự Án**: [VibeVoice Official Site](https://microsoft.github.io/VibeVoice/) * **🤗 Mô Hình Đã Huấn Luyện**: [Hugging Face - VibeVoice-7B](https://huggingface.co/vibevoice/VibeVoice-7B) * **📖 Bài Báo Nghiên Cứu**: Tìm hiểu sâu về công nghệ (nếu bạn thích) > **⚠️ Lời Nhắc AI Có Trách Nhiệm**: VibeVoice rất mạnh. Hãy sử dụng có đạo đức! Đừng tạo deepfake hay nội dung đánh lừa. Hãy tạo ra thứ thú vị giúp ích cho mọi người. 🙏 --- ## 🏆 Chúc Mừng! Bạn Đã Hoàn Thành! Bạn vừa hoàn tất toàn bộ quy trình: 1. ✅ **Hành động 1**: Xây dựng agent AI với công cụ tùy chỉnh 2. ✅ **Hành động 2**: Điều phối quy trình làm việc đa agent 3. ✅ **Hành động 3**: Tạo âm thanh podcast thực sự **Bạn đã có**: - Một trợ lý nghiên cứu AI hoạt động - Một quy trình sản xuất podcast hoàn chỉnh - Một tệp âm thanh thực tế để chia sẻ ### Tiếp Theo Là Gì? 🚀 **Phát hành podcast của bạn!** - Tải lên các nền tảng podcast - Chia sẻ trên mạng xã hội - Lặp lại và cải thiện **Tiếp tục xây dựng!** - Thử nhiều chủ đề khác - Thử thêm nhiều người nói - Thêm nhạc nền - Xây dựng giao diện web - Tự động hóa toàn bộ **Chia sẻ tác phẩm của bạn!** Gắn thẻ chúng tôi! Cho thế giới biết bạn đã xây dựng gì. Cuộc cách mạng podcast AI bắt đầu từ bạn. 🎙️ --- **Có câu hỏi? Ý tưởng? Câu chuyện thành công?** Hãy chia sẻ trong phòng chat workshop! **Chào mừng đến với tương lai của sáng tạo nội dung.** 🌟 --- **Tuyên bố từ chối trách nhiệm**: Tài liệu này đã được dịch bằng dịch vụ dịch thuật AI [Co-op Translator](https://github.com/Azure/co-op-translator). Mặc dù chúng tôi cố gắng đảm bảo độ chính xác, xin lưu ý rằng các bản dịch tự động có thể chứa lỗi hoặc không chính xác. Tài liệu gốc bằng ngôn ngữ gốc nên được xem là nguồn chính xác và đáng tin cậy. Đối với những thông tin quan trọng, nên sử dụng dịch vụ dịch thuật chuyên nghiệp do con người thực hiện. Chúng tôi không chịu trách nhiệm đối với bất kỳ sự hiểu nhầm hay giải thích sai lệch nào phát sinh từ việc sử dụng bản dịch này.