# Chapter 04 : Model Format Conversion and Quantization - ជំពូកសង្ខេប ការរីកចម្រើននៃ EdgeAI បានធ្វើឲ្យការបំលែងទ្រង់ទ្រាយម៉ូដែល និង ការបន្ថយតម្លៃ (quantization) ជាបច្ចេកវិទ្យាសំខាន់សម្រាប់ការដាក់បញ្ចូលសមត្ថភាព machine learning ចំរូងលើរបៀបឧបករណ៍ដែលមានធនធានកំណត់។ ជំពូកនេះផ្តល់ណែនាំពេញលេញសម្រាប់ការយល់ដឹង ការអនុវត្ត និងការបង្កើនប្រសិទ្ធិភាពម៉ូដែលសម្រាប់ស្ថានភាពដាក់បញ្ចូលនៅឆ្វេងឧបករណ៍។ ## 📚 រចនាសម្ព័ន្ធជំពូក និង ផ្លូវការសិក្សា ជំពូកនេះត្រូវបានរៀបចំជា៧ផ្នែកដោយលំដាប់ សែលមួយៗសាងសង់លើមូលដ្ឋាននៃមុន ដើម្បីបង្កើតការយល់ដឹងពេញលេញអំពីការអុបទីម៉ាសិនម៉ូដែលសម្រាប់ edge computing: --- ## [Section 1: មូលដ្ឋានក្នុងការបំលែងទ្រង់ទ្រាយម៉ូដែល និង Quantization](./01.Introduce.md) ### 🎯 សេចក្តីសង្ខេប ផ្នែកមូលដ្ឋាននេះបង្កើតស៊ុមទ្រឹស្តីសម្រាប់អុបទីម៉ាសិនម៉ូដែលនៅក្នុងបរិបទ edge computing ដោយគ្របដណ្តប់ពីព្រំដែន quantization ចាប់ពី 1-bit ដល់ 8-bit និងយុទ្ធសាស្ត្របំលែងទ្រង់ទ្រាយសំខាន់ៗ។ **ប្រធានសំខាន់ៗ:** - ស៊ុមចាត់ថ្នាក់កម្រិតព្រីស៊ីស្យុង (ultra-low, low, medium precision) - អត្ថប្រយោជន៍ និងករណីប្រើប្រាស់របស់ទ្រង់ទ្រាយ GGUF និង ONNX - អត្ថប្រយោជន៍នៃ quantization សម្រាប់ប្រសិទ្ធភាពប្រតិបត្តការ និងភាពបត់បែនក្នុងការដាក់បញ្ចូល - ការប្រមាណសមត្ថភាព និងការប្រៀបធៀបទំហំចងចាំ **លទ្ធផលសិក្សា:** - យល់ពីព្រំដែននិងចាត់ថ្នាក់របស់ quantization - កំណត់យុទ្ធសាស្រ្តការបំលែងទ្រង់ទ្រាយដែលសាកសម - រៀនយុទ្ធសាស្រ្តអុបទីម៉ាសិនជាន់ខ្ពស់សម្រាប់ការដាក់បញ្ចូលនៅឆ្វេងឧបករណ៍ --- ## [ផ្នែក 2: មគ្គុទេសក៍អនុវត្ត Llama.cpp](./02.Llamacpp.md) ### 🎯 សេចក្តីសង្ខេប មេរៀនពេញលេញសម្រាប់ការអនុវត្ត Llama.cpp វិទ្យាសាស្ត្រ C++ ខ្លះ ដែលអនុញ្ញាតឲ្យ inference នៃ Large Language Model បានយ៉ាងមានប្រសិទ្ធិភាពដោយការតំឡើងតិច និងគាំទ្រកាន់តែកាន់តែច្រើនលើរបៀបហាដ្វែរ។ **ប្រធានសំខាន់ៗ:** - ការដំឡើងលើវេទិកា Windows, macOS, និង Linux - ការបំលែងទ្រង់ទ្រាយ GGUF និង កម្រិត quantization ផ្សេងៗ (Q2_K ដល់ Q8_0) - ការត្រីក្សាហេដ្វែរ​ដោយ CUDA, Metal, OpenCL, និង Vulkan - ការរួមបញ្ចូល Python និងយុទ្ធសាស្ត្រដាក់ជាផលិតកម្ម **លទ្ធផលសិក្សា:** - ជំនាញក្នុងការដំឡើងឆ្លាតវៃឆ្លើយបានលើគោលដៅ cross-platform និង កសាងពី source - អនុវត្ត quantization និងយុទ្ធសាស្ត្រអុបទីម៉ាសិន - ដាក់បញ្ចូលម៉ូដែលនៅម៉ូដសេវាកម្មជាមួយការរួមបញ្ចូល REST API --- ## [ផ្នែក 3: កញ្ចប់អុបទីម៉ាសិន Microsoft Olive](./03.MicrosoftOlive.md) ### 🎯 សេចក្តីសង្ខេប ការស្វែងយល់អំពី Microsoft Olive ដែលជាកញ្ចប់ឧបករណ៍អុបទីម៉ាសិនម៉ូដែលដែលផ្ដោតលើហេដ្វែរ មានជំពូកបង្កប់អុបទីម៉ាសិនជាង 40+ រួមទាំងសមត្ថភាពដ៏ខ្លាំងសម្រាប់ការដាក់ប្រើប្រាស់ថ្នាក់សហគ្រាសលើហេដ្វែរផ្សេងៗ។ **ប្រធានសំខាន់ៗ:** - មុខងារ auto-optimization ជាមួយ quantization ទីញិងស្ថិតិ (dynamic និង static) - បញ្ញាអានឡឺចចំពោះហេដ្វែរ សម្រាប់ CPU, GPU និង NPU - គាំទ្រម៉ូដែលពេញនិយម (Llama, Phi, Qwen, Gemma) ពីប្រអប់ - ការរួមបញ្ចូលសម្រាប់សហគ្រាសជាមួយ Azure ML និង workflow ផលិត **លទ្ធផលសិក្សា:** - ប្រើប្រាស់អុបទីម៉ាសិនស្វ័យប្រវត្តិសម្រាប់សំណាញ់ម៉ូដែលផ្សេងៗ - អនុវត្តយុទ្ធសាស្ត្រដាក់ប្រើប្រាស់ឆ្លងវេទិកា - បង្កើតបំពង់អុបទីម៉ាសិនដែលសមសម្រាប់សហគ្រាស --- ## [ផ្នែក 4: កញ្ចប់ OpenVINO Toolkit Optimization](./04.openvino.md) ### 🎯 សេចក្តីសង្ខេប ការស្វែងយល់យ៉ាងទូលំទូលាយពី OpenVINO toolkit របស់ Intel ជាវេទិកាឯកសារលើការដាក់បញ្ចូល AI មានសមត្ថភាពលឿនលើ cloud, on-premises និង edge ជាមួយសមត្ថភាព Neural Network Compression Framework (NNCF) ជាន់ខ្ពស់។ **ប្រធានសំខាន់ៗ:** - ដាក់ឲ្យប្រើបានលើវេទិកាចម្រុះជាមួយការលាតត្រដាប់ហេដ្វែរ (CPU, GPU, VPU, AI accelerators) - Neural Network Compression Framework (NNCF) សម្រាប់ quantization និង pruning ជាន់ខ្ពស់ - OpenVINO GenAI សម្រាប់អុបទីម៉ាសិន និងដាក់ប្រើ LLMs - សមត្ថភាពម៉ូដែលសេវាកម្មថ្នាក់សហគ្រាស និងយុទ្ធសាស្ត្រដាក់បញ្ចូលដែលអាចវិសាល **លទ្ធផលសិក្សា:** - ជំនាញការបំលែងម៉ូដែល និង វិធីសាស្ត្រអុបទីម៉ាសិនក្នុង OpenVINO - អនុវត្តបច្ចេកទេស quantization ជាន់ខ្ពស់ជាមួយ NNCF - ដាក់បញ្ចូលម៉ូដែលដែលបានអុបទីម៉ាសជាលើហេដ្វែរផ្សេងៗជាមួយ Model Server --- ## [ផ្នែក 5: ការវិភាគលម្អិត Apple MLX Framework](./05.AppleMLX.md) ### 🎯 សេចក្តីសង្ខេប ការគ្របដណ្តប់ពេញលេញអំពី Apple MLX ដែលជាផ្នែកឧបករណ៍ប្លែកសម្រាប់ machine learning លើ Apple Silicon ដោយផ្តោតលើសមត្ថភាព LLM និងការដាក់ប្រើក្នុងកន្លែងក្នុងទឹកដី។ **ប្រធានសំខាន់ៗ:** - អត្ថប្រយោជន៍រចនាសម្ព័ន្ធមេម៉ូរីរួម និង Metal Performance Shaders - គាំទ្រ LLaMA, Mistral, Phi-3, Qwen, និង Code Llama - LoRA fine-tuning សម្រាប់ប្ដូរម៉ូដែលដោយមានប្រសិទ្ធិភាព - ការរួមបញ្ចូលជាមួយ Hugging Face និងគាំទ្រ quantization (4-bit និង 8-bit) **លទ្ធផលសិក្សា:** - ជំនាញអុបទីម៉ាសិន Apple Silicon សម្រាប់ដាក់ប្រើ LLM - អនុវត្ត fine-tuning និងបCustomizer ម៉ូដែល - បង្កើតកម្មវិធី AI សម្រាប់សហគ្រាសដែលមានលក្ខណៈភាពឯកជនកាន់តែធ្វើបានល្អ --- ## [ផ្នែក 6: ការសម្រួលលំហូរអភិវឌ្ឍ Edge AI](./06.workflow-synthesis.md) ### 🎯 សេចក្តីសង្ខេប ការសម្រួលទាំងមូលនៃគ្រប់គ្រងការអុបទីម៉ាសិនជាមួយផ្លូវកូដសហគ្រិន វិធីសាស្ត្រសម្រេចចិត្ត និងអនុវត្តន៍ល្អបំផុតសម្រាប់ការដាក់ប្រើ Edge AI រួមទាំងលើទូរស័ព្ទ, ដេសក៍ ហើយ cloud។ **ប្រធានសំខាន់ៗ:** - អាគារលំហូររួមបញ្ចូល framework ផ្សេងៗគ្នា - ដើមឈើសម្រេចចិត្តក្នុងការជ្រើស framework និងវិភាគការប្តូរលក្ខណៈសមត្ថភាព - ការផ្ទៀងផ្ទាត់ស្រេចចិត្តសម្រាប់ការដាក់ប្រើប្រាស់ផ្លូវផលិត និងយុទ្ធសាស្ត្រដាក់បញ្ចូលទូលំទូលាយ - យុទ្ធសាស្ត្រកែលម្អដើម្បីរួចចេញនៃហេដ្វែរនិងសំណុំម៉ូដែលថ្មីៗ **លទ្ធផលសិក្សា:** - ជំនាញក្នុងការជ្រើស framework របៀបប្រព័ន្ធមើលពីតម្រូវការនិងកំណត់កម្រិត - អនុវត្តបំពង់ Edge AI ដល់ផលិតផលជាមួយមេធានីការត្រួតពិនិត្យទាំងស្រុង - ផ្គុំនូវលំហូរដែលអាចដើរតាមការផ្លាស់ប្តូរនៃបច្ចេកវិទ្យានាពេលអនាគត --- ## [ផ្នែក 7: កញ្ចប់អុបទីម៉ាសិន Qualcomm QNN](./07.QualcommQNN.md) ### 🎯 សេចក្តីសង្ខេប ការស្វែងយល់ពេញលេញអំពី Qualcomm QNN (Qualcomm Neural Network) ដែលជាវេទិកា inference AI ផ្តោតលើការ​ប្រើប្រាស់សម្ព័ន្ធគណនា heterogeneous របស់ Qualcomm រួមទាំង Hexagon NPU, Adreno GPU និង Kryo CPU ដើម្បីទទួលបានសមត្ថភាព និងថាមពលប្រើប្រាស់ល្អបំផុតលើឧបករណ៍ចល័តនិង Edge។ **ប្រធានសំខាន់ៗ:** - ការគណនាបួនខ្នាត heterogeneous ជាមួយការចូលដំណើរការរួមទៅ NPU, GPU និង CPU - អុបទីម៉ាសិនឆ្លាតវៃសម្រាប់វេទិកា Snapdragon ជាមួយការបែងចែកកាតព្វកិច្ចយ៉ាងឆ្លាត - បច្ចេកទេស quantization ជាន់ខ្ពស់ (INT8, INT16, mixed-precision) សម្រាប់ដាក់ប្រើលើទូរស័ព្ទ - inference ប្រើថាមពលតិចដែលអូបទីម៉ាស់សម្រាប់ឧបករណ៍ដឹកថ្ម និងកម្មវិធីពេលពិត **លទ្ធផលសិក្សា:** - ជំនាញក្នុងការបង្កើនល្បឿនដំណើរការ​ប្រើហេដ្វែរផ្សេងៗរបស់ Qualcomm សម្រាប់ AI លើទូរស័ព្ទ - អនុវត្តយុទ្ធសាស្ត្រកែលម្អប្រើថាមពលសម្រាប់ edge computing - ដាក់បញ្ចូលម៉ូដែលចេញផលិតកម្មលើអ生态 Qualcomm ជាមួយសមត្ថភាពខ្ពស់ --- ## 🎯 លទ្ធផលសិក្សានៃជំពូក បន្ទាប់ពីបានបញ្ចប់ជំពូកពេញលេញនេះ អ្នកអាននឹងទទួលបាន៖ ### **ជំនាញបច្ចេកទេស** - យល់ដឹងជ្រាលជ្រៅអំពីព្រំដែននៃ quantization និងអនុវត្តប្រែប្រួល - បទពិសោធន៍ជាក់ស្តែងជាមួយ framework អុបទីម៉ាសិនច្រើន - ជំនាញដាក់បញ្ចូលក្នុងបរិបទ edge computing ### **ការយល់ដឹងយុទ្ធសាស្ត្រ** - សមត្ថភាពជ្រើសអុបទីម៉ាសិនដោយយកហេដ្វែរunner ទៅកាន់ចិត្ត - ការធ្វើសម្រេចចិត្តដោយមានព័ត៌មានលម្អិតអំពីកង្វះ-លទ្ធផល - យុទ្ធសាស្ត្រដាក់ប្រើ និងត្រួតពិនិត្យសម្រាប់សហគ្រាស ### **ការប្រមាណសមត្ថភាព** | Framework | Quantization | ការប្រើប្រាស់អង្គចងចាំ | ការកែលម្អល្បឿន | ករណីប្រើប្រាស់ | |-----------|-------------|--------------------------|------------------|-----------------| | Llama.cpp | Q4_K_M | ~4GB | 2-3x | ការដាក់ប្រើលើវេទិកាចម្រុះ | | Olive | INT4 | 60-75% reduction | 2-6x | Workflow សម្រាប់សហគ្រាស | | OpenVINO | INT8/INT4 | 50-75% reduction | 2-5x | អុបទីម៉ាសិនសម្រាប់ហេដ្វែរ Intel | | QNN | INT8/INT4 | 50-80% reduction | 5-15x | Qualcomm សម្រាប់ទូរស័ព្ទ/edge | | MLX | 4-bit | ~4GB | 2-4x | អុបទីម៉ាសិន Apple Silicon | ## 🚀 ជំហ៊ានបន្ទាប់ និង ករណីប្រើកម្រិតខ្ពស់ ជំពូកនេះផ្តល់មូលដ្ឋានពេញលេញសម្រាប់៖ - ការអភិវឌ្ឍម៉ូដែលផ្ទាល់ខ្លួនសម្រាប់ដែនកម្រិតពិសេស - ការស្រាវជ្រាវនៅក្នុង field នៃ edge AI optimization - ការអភិវឌ្ឍកម្មវិធី AI ពាណិជ្ជកម្ម - ការដាក់ប្រើ Edge AI នៅវិស័យសហគ្រាសក្នុងវិសាលភាពធំ ចំណេះដឹងពីប្រាំពីរផ្នែកទាំងនេះផ្ដល់ឧបករណ៍ពេញលេញសម្រាប់រុករកលំហឆាប់ប្រកបដោយការកែលម្អនៃការអុបទីម៉ាសិនម៉ូដែល និងការដាក់ប្រើនៅលើ Edge AI។ --- **ការមិនទទួលខុសត្រូវ**: ឯកសារ​នេះ​ត្រូវបាន​បកប្រែ​ដោយ​ប្រើ​សេវាកម្ម​បកប្រែ AI [Co-op Translator](https://github.com/Azure/co-op-translator)។ ខណៈពេលយើងខិតខំឲ្យមានភាពត្រឹមត្រូវ សូមចំណាំថា ការបកប្រែដោយស្វ័យប្រវត្តិអាចមានកំហុស ឬមិនត្រឹមត្រូវ។ ឯកសារដើម​ក្នុង​ភាសាដើម​គួរត្រូវបាន​ពិចារណាថាជា​ប្រភព​ពិតប្រាកដ។ សម្រាប់ព័ត៌មានសំខាន់ៗ យើងសូមផ្តល់អនុសាសន៍ឲ្យប្រើ​ការ​បកប្រែ​ដោយ​អ្នក​បកប្រែ​មនុស្ស​វិជ្ជាជីវៈ។ យើងមិនទទួលខុសត្រូវចំពោះការយល់ច្រឡំ ឬការបកស្រាយខុសណាមួយដែលកើតឡើងពីការប្រើប្រាស់ការបកប្រែនេះ។