# القسم 1: أساسيات تحويل تنسيق النماذج والتكميم يمثل تحويل تنسيق النماذج والتكميم تقدمًا مهمًا في الذكاء الاصطناعي على الحافة (EdgeAI)، مما يتيح قدرات تعلم آلي متقدمة على الأجهزة ذات الموارد المحدودة. فهم كيفية تحويل النماذج وتحسينها ونشرها بشكل فعال أمر ضروري لبناء حلول عملية تعتمد على الذكاء الاصطناعي على الحافة. ## المقدمة في هذا الدليل، سنستكشف تقنيات تحويل تنسيق النماذج والتكميم واستراتيجيات تنفيذها المتقدمة. سنغطي المفاهيم الأساسية لضغط النماذج، حدود تصنيفات تنسيق التحويل، تقنيات التحسين، واستراتيجيات النشر العملية لبيئات الحوسبة على الحافة. ## أهداف التعلم بنهاية هذا الدليل، ستكون قادرًا على: - 🔢 فهم حدود التكميم وتصنيفات مستويات الدقة المختلفة. - 🛠️ تحديد تقنيات تحويل التنسيق الرئيسية لنشر النماذج على الأجهزة الحافة. - 🚀 تعلم استراتيجيات التكميم والضغط المتقدمة لتحسين الاستدلال. ## فهم حدود وتصنيفات تكميم النماذج التكميم هو تقنية تهدف إلى تقليل دقة معلمات الشبكات العصبية باستخدام عدد أقل بكثير من البتات مقارنة بنظيراتها ذات الدقة الكاملة. بينما تستخدم النماذج ذات الدقة الكاملة تمثيلات النقطة العائمة 32-بت، فإن النماذج المكممة مصممة خصيصًا لتحقيق الكفاءة والنشر على الحافة. يساعد إطار تصنيف الدقة في فهم الفئات المختلفة لمستويات التكميم واستخداماتها المناسبة. هذا التصنيف ضروري لاختيار مستوى الدقة المناسب لسيناريوهات الحوسبة على الحافة. ### إطار تصنيف الدقة فهم حدود الدقة يساعد في اختيار مستويات التكميم المناسبة لسيناريوهات الحوسبة على الحافة المختلفة: - **🔬 دقة منخفضة جدًا**: تكميم 1-بت إلى 2-بت (ضغط شديد للأجهزة المتخصصة) - **📱 دقة منخفضة**: تكميم 3-بت إلى 4-بت (توازن بين الأداء والكفاءة) - **⚖️ دقة متوسطة**: تكميم 5-بت إلى 8-بت (تقارب قدرات الدقة الكاملة مع الحفاظ على الكفاءة) تظل الحدود الدقيقة مرنة في المجتمع البحثي، لكن معظم الممارسين يعتبرون 8-بت وما دونها "مكممة"، مع تحديد بعض المصادر عتبات متخصصة لأهداف الأجهزة المختلفة. ### المزايا الرئيسية لتكميم النماذج يوفر التكميم العديد من المزايا الأساسية التي تجعله مثاليًا لتطبيقات الحوسبة على الحافة: **الكفاءة التشغيلية**: توفر النماذج المكممة أوقات استدلال أسرع بسبب تقليل التعقيد الحسابي، مما يجعلها مثالية للتطبيقات في الوقت الفعلي. تتطلب موارد حسابية أقل، مما يتيح النشر على الأجهزة ذات الموارد المحدودة مع استهلاك أقل للطاقة وتقليل البصمة الكربونية. **مرونة النشر**: تتيح هذه النماذج قدرات الذكاء الاصطناعي على الأجهزة دون الحاجة إلى الاتصال بالإنترنت، وتعزز الخصوصية والأمان من خلال المعالجة المحلية، ويمكن تخصيصها للتطبيقات الخاصة بالمجال، وهي مناسبة لبيئات الحوسبة على الحافة المختلفة. **فعالية التكلفة**: توفر النماذج المكممة تدريبًا ونشرًا بتكلفة أقل مقارنة بالنماذج ذات الدقة الكاملة، مع تقليل تكاليف التشغيل ومتطلبات عرض النطاق الترددي لتطبيقات الحافة. ## استراتيجيات متقدمة للحصول على تنسيقات النماذج ### GGUF (تنسيق GGML العالمي العام) يعد GGUF التنسيق الأساسي لنشر النماذج المكممة على وحدات المعالجة المركزية وأجهزة الحافة. يوفر التنسيق موارد شاملة لتحويل النماذج ونشرها: **ميزات اكتشاف التنسيق**: يقدم التنسيق دعمًا متقدمًا لمستويات التكميم المختلفة، توافق الترخيص، وتحسين الأداء. يمكن للمستخدمين الوصول إلى توافق عبر الأنظمة الأساسية، معايير الأداء في الوقت الفعلي، ودعم WebGPU للنشر عبر المتصفح. **مجموعات مستويات التكميم**: تشمل التنسيقات الشائعة للتكميم Q4_K_M لضغط متوازن، سلسلة Q5_K_S للتطبيقات التي تركز على الجودة، Q8_0 لدقة قريبة من الأصل، وتنسيقات تجريبية مثل Q2_K للنشر بدقة منخفضة جدًا. يتميز التنسيق أيضًا بتنوعات مدفوعة بالمجتمع مع تكوينات متخصصة لمجالات محددة ومتغيرات عامة ومضبوطة للتعليمات محسنة لحالات الاستخدام المختلفة. ### ONNX (تبادل الشبكات العصبية المفتوح) يوفر تنسيق ONNX توافقًا عبر الأطر للنماذج المكممة مع قدرات تكامل محسنة: **تكامل المؤسسات**: يتضمن التنسيق نماذج بدعم على مستوى المؤسسات وقدرات تحسين، مع تكميم ديناميكي لاختيار الدقة التكيفية وتكميم ثابت للنشر الإنتاجي. كما يدعم النماذج من أطر مختلفة مع نهج تكميم موحد. **فوائد المؤسسات**: أدوات مدمجة للتحسين، النشر عبر الأنظمة الأساسية، وتسريع الأجهزة مدمجة عبر محركات الاستدلال المختلفة. دعم مباشر للأطر مع واجهات برمجة تطبيقات موحدة، ميزات تحسين مدمجة، وسير عمل نشر شامل يعزز تجربة المؤسسات. ## تقنيات التكميم والتحسين المتقدمة ### إطار تحسين Llama.cpp يوفر Llama.cpp تقنيات تكميم متطورة لتحقيق أقصى كفاءة في النشر على الحافة: **طرق التكميم**: يدعم الإطار مستويات تكميم مختلفة بما في ذلك Q4_0 (تكميم 4-بت مع تقليل كبير للحجم - مثالي للنشر على الأجهزة المحمولة)، Q5_1 (تكميم 5-بت يوازن بين الجودة والضغط - مناسب للاستدلال على الحافة)، و Q8_0 (تكميم 8-بت لجودة قريبة من الأصل - موصى به للاستخدام الإنتاجي). تمثل التنسيقات المتقدمة مثل Q2_K ضغطًا متطورًا للسيناريوهات القصوى. **فوائد التنفيذ**: يوفر الاستدلال المحسن لوحدة المعالجة المركزية مع تسريع SIMD تحميل وتنفيذ النماذج بكفاءة في الذاكرة. يتيح التوافق عبر الأنظمة الأساسية عبر معماريات x86، ARM، وApple Silicon قدرات نشر غير معتمدة على الأجهزة. **مقارنة بصمة الذاكرة**: تقدم مستويات التكميم المختلفة توازنات متفاوتة بين حجم النموذج والجودة. يوفر Q4_0 تقليلًا للحجم بنسبة 75% تقريبًا، بينما يقدم Q5_1 تقليلًا بنسبة 70% مع احتفاظ أفضل بالجودة، ويحقق Q8_0 تقليلًا بنسبة 50% مع الحفاظ على أداء قريب من الأصل. ### مجموعة تحسين Microsoft Olive تقدم Microsoft Olive سير عمل شامل لتحسين النماذج مصمم لبيئات الإنتاج: **تقنيات التحسين**: تتضمن المجموعة تكميم ديناميكي لاختيار الدقة التلقائي، تحسين الرسوم البيانية ودمج المشغل لتحسين الكفاءة، تحسينات خاصة بالأجهزة للنشر على وحدات المعالجة المركزية، وحدات معالجة الرسومات، ووحدات المعالجة العصبية، وسير عمل تحسين متعدد المراحل. تدعم سير عمل التكميم المتخصص مستويات دقة مختلفة من 8-بت وصولاً إلى تكوينات تجريبية 1-بت. **أتمتة سير العمل**: يضمن القياس التلقائي عبر متغيرات التحسين الحفاظ على مقاييس الجودة أثناء التحسين. يوفر التكامل مع أطر التعلم الآلي الشهيرة مثل PyTorch وONNX قدرات تحسين للنشر السحابي وعلى الحافة. ### إطار Apple MLX يوفر Apple MLX تحسينًا أصليًا مصممًا خصيصًا لأجهزة Apple Silicon: **تحسين Apple Silicon**: يستخدم الإطار بنية ذاكرة موحدة مع تكامل Metal Performance Shaders، استدلال دقة مختلطة تلقائي، واستغلال عرض النطاق الترددي للذاكرة المحسن. تظهر النماذج أداءً استثنائيًا على رقائق سلسلة M مع توازن مثالي لنشر الأجهزة المختلفة من Apple. **ميزات التطوير**: دعم واجهات برمجة التطبيقات Python وSwift مع عمليات صفيف متوافقة مع NumPy، قدرات التفاضل التلقائي، وتكامل سلس مع أدوات تطوير Apple يوفر بيئة تطوير شاملة. ## استراتيجيات النشر والإستدلال الإنتاجي ### Ollama: نشر محلي مبسط يُبسط Ollama نشر النماذج بميزات جاهزة للمؤسسات لبيئات الحافة والمحلية: **قدرات النشر**: تثبيت وتشغيل النماذج بأمر واحد مع سحب النماذج وتخزينها تلقائيًا. دعم تنسيقات التكميم المختلفة مع واجهة REST API لتكامل التطبيقات وإدارة النماذج المتعددة وقدرات التبديل. تتطلب مستويات التكميم المتقدمة تكوينًا محددًا للنشر الأمثل. **ميزات متقدمة**: دعم ضبط النماذج المخصص، إنشاء ملفات Docker للنشر في الحاويات، تسريع وحدة معالجة الرسومات مع الكشف التلقائي، وخيارات تكميم وتحسين النماذج توفر مرونة نشر شاملة. ### VLLM: استدلال عالي الأداء يوفر VLLM تحسين استدلال على مستوى الإنتاج لسيناريوهات الإنتاجية العالية: **تحسينات الأداء**: PagedAttention لحساب الانتباه بكفاءة في الذاكرة، التجميع الديناميكي لتحسين الإنتاجية، التوازي التنسوري لتوسيع النشر على وحدات معالجة الرسومات المتعددة، والتشفير التخميني لتقليل زمن الاستجابة. تتطلب تنسيقات التكميم المتقدمة نوى استدلال متخصصة لتحقيق الأداء الأمثل. **تكامل المؤسسات**: نقاط نهاية API متوافقة مع OpenAI، دعم نشر Kubernetes، تكامل المراقبة والملاحظة، وقدرات التوسع التلقائي توفر حلول نشر على مستوى المؤسسات. ### حلول الحافة من Microsoft توفر Microsoft قدرات نشر شاملة للحافة لبيئات المؤسسات: **ميزات الحوسبة على الحافة**: تصميم معماري يعتمد على العمل دون اتصال مع تحسين قيود الموارد، إدارة سجل النماذج المحلي، وقدرات المزامنة بين الحافة والسحابة تضمن نشرًا موثوقًا على الحافة. **الأمان والامتثال**: معالجة البيانات المحلية للحفاظ على الخصوصية، ضوابط أمان المؤسسات، تسجيل التدقيق وإعداد تقارير الامتثال، وإدارة الوصول بناءً على الأدوار توفر أمانًا شاملاً للنشر على الحافة. ## أفضل الممارسات لتنفيذ تكميم النماذج ### إرشادات اختيار مستوى التكميم عند اختيار مستويات التكميم للنشر على الحافة، ضع في اعتبارك العوامل التالية: **اعتبارات عدد الدقة**: اختر دقة منخفضة جدًا مثل Q2_K للتطبيقات المحمولة القصوى، دقة منخفضة مثل Q4_K_M لسيناريوهات الأداء المتوازن، ودقة متوسطة مثل Q8_0 عند الاقتراب من قدرات الدقة الكاملة مع الحفاظ على الكفاءة. توفر التنسيقات التجريبية ضغطًا متخصصًا لتطبيقات البحث المحددة. **توافق حالة الاستخدام**: قم بمطابقة قدرات التكميم مع متطلبات التطبيق المحددة، مع مراعاة عوامل مثل الحفاظ على الدقة، سرعة الاستدلال، قيود الذاكرة، ومتطلبات التشغيل دون اتصال. ### اختيار استراتيجية التحسين **نهج التكميم**: اختر مستويات التكميم المناسبة بناءً على متطلبات الجودة وقيود الأجهزة. ضع في اعتبارك Q4_0 لتحقيق أقصى ضغط، Q5_1 لتحقيق توازن بين الجودة والضغط، وQ8_0 للحفاظ على جودة قريبة من الأصل. تمثل التنسيقات التجريبية الحدود القصوى للضغط للتطبيقات المتخصصة. **اختيار الإطار**: اختر أطر التحسين بناءً على الأجهزة المستهدفة ومتطلبات النشر. استخدم Llama.cpp للنشر المحسن لوحدة المعالجة المركزية، Microsoft Olive لسير عمل التحسين الشامل، وApple MLX لأجهزة Apple Silicon. ## تحويل التنسيق العملي وحالات الاستخدام ### سيناريوهات النشر الواقعية **تطبيقات الهواتف المحمولة**: تنسيقات Q4_K ممتازة في تطبيقات الهواتف الذكية مع بصمة ذاكرة صغيرة، بينما يوفر Q8_0 أداءً متوازنًا لتطبيقات الأجهزة اللوحية. تقدم تنسيقات Q5_K جودة فائقة لتطبيقات الإنتاجية المحمولة. **الحوسبة المكتبية وعلى الحافة**: يوفر Q5_K أداءً مثاليًا لتطبيقات سطح المكتب، بينما يقدم Q8_0 استدلالًا عالي الجودة لبيئات محطات العمل، ويتيح Q4_K معالجة فعالة على أجهزة الحافة. **البحث والتجريب**: تتيح التنسيقات المتقدمة للتكميم استكشاف الاستدلال بدقة منخفضة جدًا لأغراض البحث الأكاديمي وتطبيقات إثبات المفهوم التي تتطلب قيودًا شديدة على الموارد. ### معايير الأداء والمقارنات **سرعة الاستدلال**: يحقق Q4_K أسرع أوقات الاستدلال على وحدات المعالجة المركزية المحمولة، بينما يوفر Q5_K نسبة سرعة-جودة متوازنة للتطبيقات العامة، ويقدم Q8_0 جودة فائقة للمهام المعقدة، وتوفر التنسيقات التجريبية أقصى إنتاجية نظرية مع الأجهزة المتخصصة. **متطلبات الذاكرة**: تتراوح مستويات التكميم من Q2_K (أقل من 500 ميجابايت للنماذج الصغيرة) إلى Q8_0 (حوالي 50% من الحجم الأصلي)، مع تحقيق التكوينات التجريبية نسب ضغط قصوى. ## التحديات والاعتبارات ### التوازن بين الأداء يتطلب نشر التكميم النظر بعناية في التوازن بين حجم النموذج، سرعة الاستدلال، وجودة المخرجات. بينما يوفر Q4_K سرعة وكفاءة استثنائية، يقدم Q8_0 جودة فائقة على حساب زيادة متطلبات الموارد. يمثل Q5_K توازنًا وسطًا مناسبًا لمعظم التطبيقات العامة. ### توافق الأجهزة تتمتع أجهزة الحافة المختلفة بقدرات وقيود متفاوتة. يعمل Q4_K بكفاءة على المعالجات الأساسية، بينما يتطلب Q5_K موارد حسابية معتدلة، ويستفيد Q8_0 من الأجهزة عالية الأداء. تتطلب التنسيقات التجريبية أجهزة أو برامج متخصصة لتحقيق العمليات المثلى. ### الأمان والخصوصية بينما تتيح النماذج المكممة المعالجة المحلية لتعزيز الخصوصية، يجب تنفيذ تدابير أمان مناسبة لحماية النماذج والبيانات في بيئات الحافة. هذا مهم بشكل خاص عند نشر تنسيقات عالية الدقة في بيئات المؤسسات أو تنسيقات مضغوطة في التطبيقات التي تتعامل مع بيانات حساسة. ## الاتجاهات المستقبلية في تكميم النماذج يستمر مشهد التكميم في التطور مع تقدم تقنيات الضغط، طرق التحسين، واستراتيجيات النشر. تشمل التطورات المستقبلية خوارزميات تكميم أكثر كفاءة، طرق ضغط محسنة، وتكامل أفضل مع مسرعات الأجهزة على الحافة. فهم هذه الاتجاهات والحفاظ على الوعي بالتقنيات الناشئة سيكون أمرًا حاسمًا للبقاء على اطلاع بأفضل الممارسات لتطوير ونشر التكميم. ## موارد إضافية - [وثائق Hugging Face GGUF](https://huggingface.co/docs/hub/en/gguf) - [تحسين نماذج ONNX](https://onnxruntime.ai/docs/performance/model-optimizations/) - [وثائق llama.cpp](https://github.com/ggml-org/llama.cpp) - [إطار Microsoft Olive](https://github.com/microsoft/Olive) - [وثائق Apple MLX](https://github.com/ml-explore/mlx) ## ➡️ ما التالي - [02: دليل تنفيذ Llama.cpp](./02.Llamacpp.md) --- **إخلاء المسؤولية**: تم ترجمة هذا المستند باستخدام خدمة الترجمة بالذكاء الاصطناعي [Co-op Translator](https://github.com/Azure/co-op-translator). بينما نسعى لتحقيق الدقة، يرجى العلم أن الترجمات الآلية قد تحتوي على أخطاء أو معلومات غير دقيقة. يجب اعتبار المستند الأصلي بلغته الأصلية المصدر الموثوق. للحصول على معلومات حاسمة، يُوصى بالاستعانة بترجمة بشرية احترافية. نحن غير مسؤولين عن أي سوء فهم أو تفسيرات خاطئة تنشأ عن استخدام هذه الترجمة.