# บทที่ 04 : การแปลงรูปแบบโมเดลและการลดความละเอียด - ภาพรวมของบท การเกิดขึ้นของ EdgeAI ทำให้การแปลงรูปแบบโมเดลและการลดความละเอียดกลายเป็นเทคโนโลยีสำคัญสำหรับการนำความสามารถของการเรียนรู้ของเครื่องที่ซับซ้อนมาใช้บนอุปกรณ์ที่มีทรัพยากรจำกัด บทนี้เป็นคู่มือที่ครอบคลุมเพื่อทำความเข้าใจ การนำไปใช้ และการปรับปรุงโมเดลสำหรับสถานการณ์การใช้งานบน Edge ## 📚 โครงสร้างบทและเส้นทางการเรียนรู้ บทนี้ถูกจัดแบ่งออกเป็นเจ็ดส่วนที่มีความต่อเนื่องกัน โดยแต่ละส่วนจะสร้างความเข้าใจที่ครอบคลุมเกี่ยวกับการปรับปรุงโมเดลสำหรับการประมวลผลบน Edge: --- ## [ส่วนที่ 1: พื้นฐานการแปลงรูปแบบโมเดลและการลดความละเอียด](./01.Introduce.md) ### 🎯 ภาพรวม ส่วนพื้นฐานนี้สร้างกรอบทฤษฎีสำหรับการปรับปรุงโมเดลในสภาพแวดล้อมการประมวลผลบน Edge โดยครอบคลุมขอบเขตการลดความละเอียดตั้งแต่ 1-bit ถึง 8-bit และกลยุทธ์การแปลงรูปแบบที่สำคัญ **หัวข้อสำคัญ:** - กรอบการจำแนกความละเอียด (ต่ำมาก ต่ำ ปานกลาง) - ข้อดีและกรณีการใช้งานของรูปแบบ GGUF และ ONNX - ประโยชน์ของการลดความละเอียดสำหรับประสิทธิภาพการทำงานและความยืดหยุ่นในการใช้งาน - การเปรียบเทียบประสิทธิภาพและการใช้หน่วยความจำ **ผลลัพธ์การเรียนรู้:** - เข้าใจขอบเขตและการจำแนกการลดความละเอียด - ระบุเทคนิคการแปลงรูปแบบที่เหมาะสม - เรียนรู้กลยุทธ์การปรับปรุงขั้นสูงสำหรับการใช้งานบน Edge --- ## [ส่วนที่ 2: คู่มือการใช้งาน Llama.cpp](./02.Llamacpp.md) ### 🎯 ภาพรวม คู่มือที่ครอบคลุมสำหรับการใช้งาน Llama.cpp ซึ่งเป็นเฟรมเวิร์ก C++ ที่ทรงพลังสำหรับการอนุมานโมเดลภาษาขนาดใหญ่ที่มีการตั้งค่าขั้นต่ำบนฮาร์ดแวร์ที่หลากหลาย **หัวข้อสำคัญ:** - การติดตั้งบนแพลตฟอร์ม Windows, macOS และ Linux - การแปลงรูปแบบ GGUF และระดับการลดความละเอียดต่าง ๆ (Q2_K ถึง Q8_0) - การเร่งฮาร์ดแวร์ด้วย CUDA, Metal, OpenCL และ Vulkan - การผสาน Python และกลยุทธ์การใช้งานในระดับผลิต **ผลลัพธ์การเรียนรู้:** - เชี่ยวชาญการติดตั้งข้ามแพลตฟอร์มและการสร้างจากซอร์ส - ใช้เทคนิคการลดความละเอียดและการปรับปรุงโมเดล - ใช้งานโมเดลในโหมดเซิร์ฟเวอร์พร้อมการผสาน REST API --- ## [ส่วนที่ 3: Microsoft Olive Optimization Suite](./03.MicrosoftOlive.md) ### 🎯 ภาพรวม การสำรวจ Microsoft Olive ซึ่งเป็นเครื่องมือปรับปรุงโมเดลที่คำนึงถึงฮาร์ดแวร์ มีส่วนประกอบการปรับปรุงในตัวมากกว่า 40 ชิ้น ออกแบบมาสำหรับการใช้งานโมเดลระดับองค์กรบนแพลตฟอร์มฮาร์ดแวร์ที่หลากหลาย **หัวข้อสำคัญ:** - คุณสมบัติการปรับปรุงอัตโนมัติด้วยการลดความละเอียดแบบไดนามิกและแบบคงที่ - ความฉลาดที่คำนึงถึงฮาร์ดแวร์สำหรับการใช้งานบน CPU, GPU และ NPU - การสนับสนุนโมเดลยอดนิยม (Llama, Phi, Qwen, Gemma) พร้อมใช้งาน - การผสานองค์กรกับ Azure ML และเวิร์กโฟลว์การผลิต **ผลลัพธ์การเรียนรู้:** - ใช้การปรับปรุงอัตโนมัติสำหรับสถาปัตยกรรมโมเดลต่าง ๆ - ใช้กลยุทธ์การใช้งานข้ามแพลตฟอร์ม - สร้างท่อการปรับปรุงที่พร้อมสำหรับองค์กร --- ## [ส่วนที่ 4: OpenVINO Toolkit Optimization Suite](./04.openvino.md) ### 🎯 ภาพรวม การสำรวจ OpenVINO Toolkit ของ Intel ซึ่งเป็นแพลตฟอร์มโอเพ่นซอร์สสำหรับการใช้งานโซลูชัน AI ที่มีประสิทธิภาพในระบบคลาวด์ ระบบในองค์กร และสภาพแวดล้อม Edge พร้อมความสามารถขั้นสูงของ Neural Network Compression Framework (NNCF) **หัวข้อสำคัญ:** - การใช้งานข้ามแพลตฟอร์มพร้อมการเร่งฮาร์ดแวร์ (CPU, GPU, VPU, AI accelerators) - Neural Network Compression Framework (NNCF) สำหรับการลดความละเอียดและการตัดแต่งขั้นสูง - OpenVINO GenAI สำหรับการปรับปรุงและการใช้งานโมเดลภาษาขนาดใหญ่ - ความสามารถของเซิร์ฟเวอร์โมเดลระดับองค์กรและกลยุทธ์การใช้งานที่ปรับขนาดได้ **ผลลัพธ์การเรียนรู้:** - เชี่ยวชาญการแปลงและการปรับปรุงโมเดลด้วย OpenVINO - ใช้เทคนิคการลดความละเอียดขั้นสูงด้วย NNCF - ใช้งานโมเดลที่ปรับปรุงแล้วบนแพลตฟอร์มฮาร์ดแวร์ที่หลากหลายด้วย Model Server --- ## [ส่วนที่ 5: การเจาะลึก Apple MLX Framework](./05.AppleMLX.md) ### 🎯 ภาพรวม การครอบคลุม Apple MLX อย่างละเอียด ซึ่งเป็นเฟรมเวิร์กที่ปฏิวัติวงการออกแบบมาเพื่อการเรียนรู้ของเครื่องที่มีประสิทธิภาพบน Apple Silicon โดยเน้นความสามารถของโมเดลภาษาขนาดใหญ่และการใช้งานในพื้นที่ **หัวข้อสำคัญ:** - ข้อดีของสถาปัตยกรรมหน่วยความจำแบบรวมและ Metal Performance Shaders - การสนับสนุนโมเดล LLaMA, Mistral, Phi-3, Qwen และ Code Llama - LoRA fine-tuning สำหรับการปรับแต่งโมเดลอย่างมีประสิทธิภาพ - การผสาน Hugging Face และการสนับสนุนการลดความละเอียด (4-bit และ 8-bit) **ผลลัพธ์การเรียนรู้:** - เชี่ยวชาญการปรับปรุง Apple Silicon สำหรับการใช้งาน LLM - ใช้เทคนิคการปรับแต่งและการปรับแต่งโมเดล - สร้างแอปพลิเคชัน AI ระดับองค์กรพร้อมคุณสมบัติความเป็นส่วนตัวที่เพิ่มขึ้น --- ## [ส่วนที่ 6: การสังเคราะห์เวิร์กโฟลว์การพัฒนา Edge AI](./06.workflow-synthesis.md) ### 🎯 ภาพรวม การสังเคราะห์กรอบการปรับปรุงทั้งหมดเป็นเวิร์กโฟลว์ที่รวมกัน การตัดสินใจ และแนวปฏิบัติที่ดีที่สุดสำหรับการใช้งาน Edge AI ที่พร้อมสำหรับการผลิตบนแพลตฟอร์มและกรณีการใช้งานที่หลากหลาย รวมถึงมือถือ เดสก์ท็อป และระบบคลาวด์ **หัวข้อสำคัญ:** - สถาปัตยกรรมเวิร์กโฟลว์ที่รวมกรอบการปรับปรุงหลายตัว - ต้นไม้การตัดสินใจเลือกกรอบการทำงานและการวิเคราะห์การแลกเปลี่ยนประสิทธิภาพ - การตรวจสอบความพร้อมสำหรับการผลิตและกลยุทธ์การใช้งานที่ครอบคลุม - กลยุทธ์การเตรียมพร้อมสำหรับฮาร์ดแวร์และสถาปัตยกรรมโมเดลที่เกิดขึ้นใหม่ **ผลลัพธ์การเรียนรู้:** - เชี่ยวชาญการเลือกกรอบการทำงานอย่างเป็นระบบตามข้อกำหนดและข้อจำกัด - ใช้ท่อ Edge AI ที่พร้อมสำหรับการผลิตพร้อมการตรวจสอบที่ครอบคลุม - ออกแบบเวิร์กโฟลว์ที่ปรับตัวได้ซึ่งพัฒนาไปพร้อมกับเทคโนโลยีและข้อกำหนดที่เกิดขึ้นใหม่ --- ## [ส่วนที่ 7: Qualcomm QNN Optimization Suite](./07.QualcommQNN.md) ### 🎯 ภาพรวม การสำรวจ Qualcomm QNN (Qualcomm Neural Network) อย่างละเอียด ซึ่งเป็นกรอบการอนุมาน AI ที่รวมกันออกแบบมาเพื่อใช้ประโยชน์จากสถาปัตยกรรมการประมวลผลแบบเฮเทอโรจีนีของ Qualcomm รวมถึง Hexagon NPU, Adreno GPU และ Kryo CPU เพื่อประสิทธิภาพสูงสุดและประหยัดพลังงานบนอุปกรณ์มือถือและ Edge **หัวข้อสำคัญ:** - การประมวลผลแบบเฮเทอโรจีนีด้วยการเข้าถึง NPU, GPU และ CPU แบบรวม - การปรับปรุงที่คำนึงถึงฮาร์ดแวร์สำหรับแพลตฟอร์ม Snapdragon พร้อมการกระจายงานที่ชาญฉลาด - เทคนิคการลดความละเอียดขั้นสูง (INT8, INT16, mixed-precision) สำหรับการใช้งานบนมือถือ - การอนุมานที่ประหยัดพลังงานที่ปรับปรุงสำหรับอุปกรณ์ที่ใช้แบตเตอรี่และแอปพลิเคชันแบบเรียลไทม์ **ผลลัพธ์การเรียนรู้:** - เชี่ยวชาญการเร่งฮาร์ดแวร์ของ Qualcomm สำหรับการใช้งาน AI บนมือถือ - ใช้กลยุทธ์การปรับปรุงที่ประหยัดพลังงานสำหรับการประมวลผลบน Edge - ใช้งานโมเดลที่พร้อมสำหรับการผลิตในระบบนิเวศของ Qualcomm ด้วยประสิทธิภาพที่เหมาะสมที่สุด --- ## 🎯 ผลลัพธ์การเรียนรู้ของบท เมื่อจบบทนี้ ผู้อ่านจะได้รับ: ### **ความเชี่ยวชาญทางเทคนิค** - ความเข้าใจลึกซึ้งเกี่ยวกับขอบเขตการลดความละเอียดและการใช้งานจริง - ประสบการณ์การใช้งานจริงกับกรอบการปรับปรุงหลายตัว - ทักษะการใช้งานในสภาพแวดล้อมการประมวลผลบน Edge ### **ความเข้าใจเชิงกลยุทธ์** - ความสามารถในการเลือกการปรับปรุงที่คำนึงถึงฮาร์ดแวร์ - การตัดสินใจที่มีข้อมูลเกี่ยวกับการแลกเปลี่ยนประสิทธิภาพ - กลยุทธ์การใช้งานและการตรวจสอบที่พร้อมสำหรับองค์กร ### **การเปรียบเทียบประสิทธิภาพ** | Framework | Quantization | Memory Usage | Speed Improvement | Use Case | |-----------|-------------|--------------|-------------------|----------| | Llama.cpp | Q4_K_M | ~4GB | 2-3x | การใช้งานข้ามแพลตฟอร์ม | | Olive | INT4 | ลดลง 60-75% | 2-6x | เวิร์กโฟลว์ระดับองค์กร | | OpenVINO | INT8/INT4 | ลดลง 50-75% | 2-5x | การปรับปรุงฮาร์ดแวร์ Intel | | QNN | INT8/INT4 | ลดลง 50-80% | 5-15x | การใช้งานมือถือ/Edge ของ Qualcomm | | MLX | 4-bit | ~4GB | 2-4x | การปรับปรุง Apple Silicon | ## 🚀 ขั้นตอนถัดไปและการใช้งานขั้นสูง บทนี้ให้พื้นฐานที่สมบูรณ์สำหรับ: - การพัฒนาโมเดลที่ปรับแต่งสำหรับโดเมนเฉพาะ - การวิจัยในด้านการปรับปรุง Edge AI - การพัฒนาแอปพลิเคชัน AI เชิงพาณิชย์ - การใช้งาน Edge AI ระดับองค์กรขนาดใหญ่ ความรู้จากทั้งเจ็ดส่วนนี้มอบเครื่องมือที่ครอบคลุมสำหรับการนำทางในภูมิทัศน์ที่เปลี่ยนแปลงอย่างรวดเร็วของการปรับปรุงและการใช้งานโมเดล AI บน Edge --- **ข้อจำกัดความรับผิดชอบ**: เอกสารนี้ได้รับการแปลโดยใช้บริการแปลภาษา AI [Co-op Translator](https://github.com/Azure/co-op-translator) แม้ว่าเราจะพยายามให้การแปลมีความถูกต้อง แต่โปรดทราบว่าการแปลอัตโนมัติอาจมีข้อผิดพลาดหรือความไม่ถูกต้อง เอกสารต้นฉบับในภาษาดั้งเดิมควรถือเป็นแหล่งข้อมูลที่เชื่อถือได้ สำหรับข้อมูลที่สำคัญ ขอแนะนำให้ใช้บริการแปลภาษามืออาชีพ เราไม่รับผิดชอบต่อความเข้าใจผิดหรือการตีความผิดที่เกิดจากการใช้การแปลนี้