# ជំពូក 03: ការបង្ហោះម៉ូឌែលភាសាតូច (SLMs) ជំពូកទូលំទូលាយនេះពិភាក្សាអំពីជីវចរណ៍ពេញលេញនៃការបង្ហោះម៉ូឌែលភាសាតូច (SLMs) ដែលគ្របដណ្តប់លើគ្រឹះទស្សនវិទ្យា វិធីសាស្ត្រអនុវត្តជាក់ស្តែង និងដំណោះស្រាយកុងតឺន័រដែលរួចសម្រាប់ផលិតកម្ម។ ជំពូកនេះត្រូវបានរៀបចំជាផ្នែកបីដែលឈានពីកម្រិតមូលដ្ឋានទៅកាន់សេណារីយោការបង្ហោះកម្រិតខ្ពស់។ ## រចនាសម្ព័ន្ធជំពូក និងដំណើរការរៀន ### **[ផ្នែក 1: ការរៀន SLM ជាន់ខ្ពស់ - មូលដ្ឋាន និងការបង្កើនប្រសិទ្ធភាព](./01.SLMAdvancedLearning.md)** ផ្នែកដើមបង្កើតមូលដ្ឋានទស្សនវិទ្យាសម្រាប់ការយល់ដឹងអំពីម៉ូឌែលភាសាតូច និងសារៈសំខាន់យុទ្ធសាស្ត្ររបស់ពួកវាក្នុងការប្រើប្រាស់ edge AI។ ផ្នែកនេះគ្របដណ្តប់៖ - **ចំណាត់ថ្នាក់ប៉ារ៉ាម៉ែត្រ**: ការពិភាក្សាពីប្រភេទ SLM ពី Micro SLMs (100M-1.4B parameters) ទៅ Medium SLMs (14B-30B parameters) ជាមួយការផ្តោតពិសេសលើម៉ូឌែលដូចជា Phi-4-mini-3.8B, Qwen3 series, និង Google Gemma3 រួមទាំងតម្រូវការឧបករណ៍ និងការវិភាគទំហំដាក់ចងចាំសម្រាប់កម្រិតម៉ូឌែលនីមួយៗ - **វិធីសាស្ត្រកែលម្អជាន់ខ្ពស់**: ការក្រងគ្រប់គ្រងលម្អិតអំពីវិធីសាស្ត្រប៉ាន់កម្រិត (quantization) ដោយប្រើ Llama.cpp, Microsoft Olive, និង Apple MLX frameworks, រួមទាំង BitNET 1-bit quantization ថ្មីៗ ជាមួយឧទាហរណ៍កូដជាក់ស្តែងបង្ហាញសៀគ្វីប៉ាន់កម្រិត និងលទ្ធផលវាយតម្លៃប្រសិទ្ធភាព - **យុទ្ធសាស្ត្រទទួលបានម៉ូឌែល**: ការវិភាគជម្រៅអំពី​ប្រព័ន្ធហ្គេក Hugging Face និង Azure AI Foundry Model Catalog សម្រាប់ការបង្ហោះ SLM កម្រិតសហគ្រាស ជាមួយឧទាហរណ៍កូដសម្រាប់ទាញយកម៉ូឌែលដោយកម្មវិធី វាយតម្លៃ និងបំលែងទ្រង់ទ្រាយ - **API សម្រាប់អ្នកអភិវឌ្ឍន៍**: ឧទាហរណ៍កូដជា Python, C++, និង C# បង្ហាញពីវិធីផ្ទុកម៉ូឌែល ចាត់ចែង inference និងរួមបញ្ចូលជាមួយ frameworks ទូរាងដូចជា PyTorch, TensorFlow, និង ONNX Runtime ផ្នែកមូលដ្ឋាននេះលើកសក្តិសមភាពរវាងប្រសិទ្ធភាពប្រតិបត្តិការ ភាពបត់បែននៃការបង្ហោះ និងការសន្សំគិតថ្លៃ ដែលធ្វើឱ្យ SLM សមរម្យសម្រាប់សេណារីយោ edge computing ជាមួយឧទាហរណ៍កូដជាក់ស្តែងដែលអ្នកអភិវឌ្ឍន៍អាចអនុវត្តបានទាន់ភ្លាម។ ### **[ផ្នែក 2: ការបង្ហោះនៅបរិយាកាសក្នុងស្រុក - ដំណោះស្រាយផ្តល់អាទិភាពឯកជនភាព](./02.DeployingSLMinLocalEnv.md)** ផ្នែកទីពីរនេះផ្លាស់ពីទ្រឹស្តីទៅការអនុវត្តជាក់ស្តែង ដោយផ្ដោតលើយុទ្ធសាស្ត្របង្ហោះក្នុងស្រុកដែលផ្តល់អាទិភាពដល់សេរីភាពទិន្នន័យ និងឯករាជ្យប្រតិបត្តិការ។ តំបន់សម្គាល់សំខាន់ៗរួមមាន៖ - **Ollama Universal Platform**: ការស្រាវជ្រាវទូលំទូលាយអំពីការបង្ហោះចម្រុះវេទិកា ជាមួយការផ្ដោតលើដំណើរការងាយសម្រាប់អ្នកអភិវឌ្ឍន៍ ការគ្រប់គ្រងជីវចរណ៍ម៉ូឌែល និងការប្តូរតាម Modelfiles រួមទាំងឧទាហរណ៍សមាសភាគ REST API ពេញលេញ និងស្គ្រីបអូតូម៉ាទ CLI - **Microsoft Foundry Local**: ដំណោះស្រាយបង្ហោះសម្រាប់សហគ្រាសជាមួយការបង្កើនប្រសិទ្ធភាពលើផ្នែក ONNX, ការភ្ជាប់ Windows ML និងលក្ខណៈសុវត្ថិភាពទូលំទូលាយ ជាមួយឧទាហរណ៍កូដ C# និង Python សម្រាប់ការរួមបញ្ចូលកម្មវិធីក្នុងដើម - **ការវិភាគប្រៀបធៀប**: ប្រៀបធៀបទ្វេដងលម្អិតអំពីស៊ុមបច្ចេកទេស លក្ខណៈប្រតិបត្តិការ និងគន្លងដល់ការបង្កើនប្រសិទ្ធភាពសម្រាប់ករណីប្រើប្រាស់ ជាមួយកូដប្រៀបធៀបសម្រាប់វាយតម្លៃល្បឿន inference និងការប្រើប្រាស់ចងចាំលើឧបករណ៍ខុសៗគ្នា - **API Integration**: កម្មវិធីតំណាងបង្ហាញពីវិធីសម្រាប់សាងសង់សេវាវេប កម្មវិធី chat និងបំពង់ដើម្បីដំណើរការ​ទិន្នន័យដោយប្រើការបង្ហោះ SLM ក្នុងស្រុក ជាមួយឧទាហរណ៍កូដជា Node.js, Python Flask/FastAPI, និង ASP.NET Core - **Testing Frameworks**: វិធីសាស្ត្រប៉ោងសម្រាប់សាកល្បងស្វ័យប្រវត្តិសម្រាប់ធានាគុណភាពម៉ូឌែល រួមទាំងឧទាហរណ៍សាកល្បងទូទៅ និងសាកល្បងរួមសម្រាប់ការអនុវត្ត SLM ផ្នែកនេះផ្តល់ដំបូន្មានអនុវត្តន៍សម្រាប់អង្គការដែលចង់អនុវត្តដំណោះស្រាយ AI រក្សាសម្រុងភាពឯកជន ខណៈដែលរក្សាការត្រួតត្រាផ្ទាល់លើបរិយាកាសបង្ហោះរបស់ពួកគេ ជាមួយឧទាហរណ៍កូដដាក់ប្រើបានភ្លាមដែលអ្នកអភិវឌ្ឍន៍អាចប្ដូរឲ្យសមបម្រើតាមតម្រូវការ។ ### **[ផ្នែក 3: ការបង្ហោះកុងតឺន័រនៅពពក - ដំណោះស្រាយសម្រាប់កម្រិតផលិតកម្ម](./03.DeployingSLMinCloud.md)** ផ្នែកចុងក្រោយបញ្ចប់ដោយការលាយលំអបចុងក្រោយនៃយុទ្ធសាស្ត្របង្ហោះកុងតឺន័រលំដាប់ខ្ពស់ ដោយយក Phi-4-mini-instruct របស់ Microsoft ជាគំរូករណីសម្បូរបែប។ ផ្នែកនេះគ្របដណ្តប់៖ - **vLLM Deployment**: ការបង្កើនប្រសិទ្ធភាព inference កម្រិតខ្ពស់ជាមួយ OpenAI-compatible APIs ការខ្សែសង្វាក់ GPU ខ្ពស់ និងករណីសមាហរណភាពសម្រាប់ផលិតកម្ម រួមទាំង Dockerfiles ពេញលេញ, Kubernetes manifests និងប៉ារ៉ាម៉ែត្រ​​សំរាប់កែតម្រូវប្រសិទ្ធភាព - **Ollama Container Orchestration**: ដំណើរការបង្ហោះដែលសាមញ្ញជាមួយ Docker Compose វ៉ារីយង់នៃការកែលម្អម៉ូឌែល និងការរួមបញ្ចូល UI បណ្តាញ ជាមួយឧទាហរណ៍ CI/CD សម្រាប់ការបង្ហោះ និងសាកល្បងដោយស្វ័យ - **ONNX Runtime Implementation**: ការបង្ហោះឌីហ្សាញសម្រាប់ edge ជាមួយការបំលែងម៉ូឌែល យុទ្ធសាស្ត្រប៉ាន់កម្រិត និងភាពឆបគ្នាចម្រុះវេទិកា រួមទាំងឧទាហរណ៍កូដលម្អិតសម្រាប់ការកែលម្អ និងបង្ហោះម៉ូឌែល - **Monitoring & Observability**: ការអនុវត្តផ្ទាំងតាមដាន Prometheus/Grafana ជាមួយម៉េត្រកែច្នៃសម្រាប់តាមដានប្រសិទ្ធភាព SLM រួមទាំងការកំណត់ឆ្លើយស្នង និងការបញ្ចូលប័ណ្ណកំណត់ហេតុ - **Load Balancing & Scaling**: ឧទាហរណ៍ជាក់ស្តែងនៃយុទ្ធសាស្ត្រកំណត់ផ្ទុកទ្រូងជាត្រឹម(horizontal) និងកំណត់កម្ពស់(vertical) ជាមួយការកំណត់ autoscaling តាមការប្រើប្រាស់ CPU/GPU និងលំនាំសំណើ - **Security Hardening**: ប្រព័ន្ធអនុវត្តអនុវត្តន៍សុវត្ថិភាពសម្រាប់កុងតឺន័រ រួមទាំងការកាត់បន្ថយសិទ្ធិ ការគ្រប់នីតនិយមបណ្តាញ និងការគ្រប់គ្រងសម្ងាត់សម្រាប់គន្លង API និងសញ្ញាប័ត្រចូលប្រើម៉ូឌែល របៀបបង្ហោះមួយៗត្រូវបានបង្ហាញជាមួយឧទាហរណ៍ក конф្ហិចពេញលេញ នីតិវិធីសាកល្បង បញ្ជីត្រួតពិនិត្យសមត្ថភាពផលិតកម្ម និងស្រាបញ្ញាស្ថាបត្យកម្មជា​កូដ ដែលអ្នកអភិវឌ្ឍន៍អាចអនុវត្តត្រូវតាមដំណើរការបង្ហោះរបស់ពួកគេ។ ## លទ្ធផលសិក្សាចម្បង ដោយបញ្ចប់ជំពូកនេះ អ្នកអាននឹងមានជំនាញក្នុង៖ 1. **ការជ្រើសរើសម៉ូឌែលយុទ្ធសាស្ត្រ**: យល់ដឹងពីដែនកំណត់ប៉ារ៉ាម៉ែត្រ និងជ្រើសរើស SLM ដែលសមស្របទៅតាមភាពឈប់សេសន៍ធនធាន និងតម្រូវការប្រសិទ្ធភាព 2. **ជំនាញក្នុងការបង្កើនប្រសិទ្ធភាព**: អនុវត្តវិធីសាស្ត្រប៉ាន់កម្រិតជាន់ខ្ពស់នៅលើ frameworks ខុសៗគ្នា ដើម្បីទទួលបានតុល្យភាពអតិបរមានៃប្រសិទ្ធភាព និងការសន្សំធនធាន 3. **ភាពបត់បែនក្នុងការបង្ហោះ**: ជ្រើសរើសរវាងដំណោះស្រាយក្នុងស្រុកផ្តល់អាទិភាពឯកជនភាព និងការបង្ហោះកុងតឺន័រលំនឹងបានដោយសម្រួលទៅតាមតម្រូវការអង្គការ 4. **ភាពរួមគ្រាប់សម្រាប់ផលិតកម្ម**: កំណត់ការតាមដាន សុវត្ថិភាព និងប្រព័ន្ធកំណែកម្មសម្រាប់ការបង្ហោះ SLM ដើម្បីឲ្យសម្របសម្រួលជាមួយតម្រូវការកម្រិតសហគ្រាស ## ការផ្តោតអនុវត្តន៍ និងកម្មវិធីពិភពពិត ជំពូកនេះរក្សាទិសដៅអនុវត្តន៍ខ្លាំងៗទាំងមូល ដោយមាន៖ - **ឧទាហរណ៍ប្រើប្រាស់អនុវត្ត**: ឯកសារ​កំណត់រចនាសម្ព័ន្ធពេញលេញ នីតិវិធីសាកល្បង API និងស្គ្រីបបង្ហោះ - **ការវាយតម្លៃប្រសិទ្ធភាព**: ការប្រៀបធៀបទាំងលម្អិតនៃល្បឿន inference ការប្រើប្រាស់ចងចាំ និងតម្រូវការធនធាន - **កិច្ចចងក្រងសុវត្ថិភាព**: ការអនុវត្តសុវត្ថិភាពកម្រិតសហគ្រាស ក្រោងនីតិ និងយុទ្ធសាស្ត្រការការពារទិន្នន័យ - **ការអនុវត្តល្អបំផុត**: គន្លឹះដែលបានពិសោធន៍សម្រាប់ការតាមដាន ការ​កំណត់ទំហំ និងការថែទាំក្នុងផលិតកម្ម ## ទស្សនវិជ្ជាសម្រាប់អនាគត ជំពូកនេះបញ្ចប់ដោយចំណាប់អារម្មណ៍មើលទៅមុខពីអំពើនានាដែលកំពុងកើតឡើង រួមមាន៖ - រចនាសម្ព័ន្ធម៉ូឌែលកម្រិតខ្ពស់ដែលមានអត្រាភាពទន់ល្អប្រសើរ - ការរួមបញ្ចូលឧបករណ៍ជ្រៅជាមួយកម្មឧបករណ៍ជំនួយ AI ជាក់លាក់ - ការវាស់វែងនិងអភិវឌ្ឍន៍របស់អេកូស៊ីស្តែមទៅកាន់ស្តង់ដារ និងភាពសហប្រតិបត្តិ - លំនាំការទទួលយកដោយសហគ្រាសដែលជំរុញដោយភាពឯកជនភាព និងតម្រូវការអនុវត្តតាមច្បាប់ វិធីសាស្ត្រទូលំទូលាយនេះធានាថាអ្នកអានមានឧបករណ៍គ្រប់គ្រងក្នុងការដឹកនាំទាំងបញ្ហាបច្ចុប្បន្ននៃការបង្ហោះ SLM និងការវិវឌ្ឍន៍បច្ចេកវិទ្យាអនាគត ដើម្បីធ្វើការសម្រេចចិត្តយ៉ាងមានព័ត៌មានបានត្រឹមត្រូវបំប៉នទៅនឹងតម្រូវការអង្គការរបស់ពួកគេ។ ជំពូកនេះមានសារសំខាន់ទាំងជា គ្រប់គ្រងអនុវត្តជាក់ស្តែងសម្រាប់ការអនុវត្តភ្លាមៗ និងជាធនធានយុទ្ធសាស្ត្រសម្រាប់ការធ្វើផែនការបង្ហោះ AI រយៈពេលវែង ដោយលើកសំខាន់នៃតុល្យភាពរវាងសមត្ថភាព ប្រសិទ្ធភាព និងភាពល្អឯកប្រតិបត្តិ ដែលកំណត់ភាពជោគជ័យនៃការបង្ហោះ SLM។ --- **Disclaimer**: ឯកសារនេះត្រូវបានបកប្រែដោយប្រើសេវាកម្មបកប្រែ AI [Co-op Translator](https://github.com/Azure/co-op-translator). ទោះយើងខិតខំរកភាពត្រឹមត្រូវក៏ដោយ សូមយល់ព្រមថាការបកប្រែដោយស្វ័យប្រវត្តិអាចមានកំហុស ឬ ភាពមិនត្រឹមត្រូវ។ ឯកសារដើមក្នុងភាសាមាតុភាសាគួរត្រូវបានចាត់ទុកថាជាប្រភពផ្លូវការសំខាន់។ សម្រាប់ព័ត៌មានដាច់ខាត យើងណែនាំឱ្យប្រើការបកប្រែដោយអ្នកជំនាញមនុស្ស។ យើងមិនទទួលខុសត្រូវចំពោះការយល់ច្រឡំ ឬ ការបកស្រាយខុសណាមួយដែលកើតឡើងពីការប្រើប្រាស់ការបកប្រែនេះទេ។