# פרק 04: המרת פורמט מודל וכימות - סקירת הפרק הופעת EdgeAI הפכה את טכנולוגיות המרת פורמט מודל וכימות לחיוניות עבור פריסת יכולות למידת מכונה מתקדמות על מכשירים עם משאבים מוגבלים. פרק מקיף זה מספק מדריך שלם להבנה, יישום ואופטימיזציה של מודלים לתרחישי פריסה בקצה. ## 📚 מבנה הפרק ונתיב הלמידה הפרק מחולק לשבעה חלקים מתקדמים, שכל אחד מהם בונה על הקודם כדי ליצור הבנה מקיפה של אופטימיזציית מודלים עבור מחשוב בקצה: --- ## [חלק 1: יסודות המרת פורמט מודל וכימות](./01.Introduce.md) ### 🎯 סקירה כללית חלק יסודי זה מבסס את המסגרת התיאורטית לאופטימיזציית מודלים בסביבות מחשוב בקצה, ומכסה גבולות כימות מרמת דיוק של 1 ביט ועד 8 ביט ואסטרטגיות מרכזיות להמרת פורמטים. **נושאים מרכזיים:** - מסגרת סיווג דיוק (דיוק נמוך מאוד, נמוך, בינוני) - יתרונות ושימושים של פורמטים GGUF ו-ONNX - יתרונות הכימות ליעילות תפעולית וגמישות בפריסה - מדדי ביצועים והשוואות טביעת זיכרון **תוצאות למידה:** - הבנת גבולות וסיווגי כימות - זיהוי טכניקות מתאימות להמרת פורמטים - למידת אסטרטגיות אופטימיזציה מתקדמות לפריסה בקצה --- ## [חלק 2: מדריך יישום Llama.cpp](./02.Llamacpp.md) ### 🎯 סקירה כללית מדריך מקיף ליישום Llama.cpp, מסגרת C++ חזקה המאפשרת הסקת מודלים של שפה גדולה ביעילות עם התקנה מינימלית על מגוון תצורות חומרה. **נושאים מרכזיים:** - התקנה על פלטפורמות Windows, macOS ו-Linux - המרת פורמט GGUF ורמות כימות שונות (Q2_K עד Q8_0) - האצת חומרה עם CUDA, Metal, OpenCL ו-Vulkan - אינטגרציה עם Python ואסטרטגיות פריסה בייצור **תוצאות למידה:** - שליטה בהתקנה חוצת פלטפורמות ובנייה ממקור - יישום טכניקות כימות ואופטימיזציה של מודלים - פריסת מודלים במצב שרת עם אינטגרציית REST API --- ## [חלק 3: Microsoft Olive Optimization Suite](./03.MicrosoftOlive.md) ### 🎯 סקירה כללית חקירה של Microsoft Olive, ערכת כלים לאופטימיזציית מודלים מודעת לחומרה עם יותר מ-40 רכיבי אופטימיזציה מובנים, המיועדת לפריסת מודלים ברמה ארגונית על מגוון פלטפורמות חומרה. **נושאים מרכזיים:** - תכונות אוטומטיות לאופטימיזציה עם כימות דינמי וסטטי - אינטליגנציה מודעת לחומרה לפריסה על CPU, GPU ו-NPU - תמיכה מובנית במודלים פופולריים (Llama, Phi, Qwen, Gemma) - אינטגרציה ארגונית עם Azure ML וזרימות עבודה בייצור **תוצאות למידה:** - ניצול אופטימיזציה אוטומטית עבור ארכיטקטורות מודלים שונות - יישום אסטרטגיות פריסה חוצות פלטפורמות - הקמת צינורות אופטימיזציה מוכנים לארגון --- ## [חלק 4: OpenVINO Toolkit Optimization Suite](./04.openvino.md) ### 🎯 סקירה כללית חקירה מקיפה של ערכת הכלים OpenVINO של אינטל, פלטפורמת קוד פתוח לפריסת פתרונות AI ביצועיים בענן, באתר ובסביבות קצה עם יכולות מתקדמות של Neural Network Compression Framework (NNCF). **נושאים מרכזיים:** - פריסה חוצת פלטפורמות עם האצת חומרה (CPU, GPU, VPU, מאיצי AI) - Neural Network Compression Framework (NNCF) לכימות מתקדם וגיזום - OpenVINO GenAI לאופטימיזציה ופריסת מודלים של שפה גדולה - יכולות שרת מודלים ברמה ארגונית ואסטרטגיות פריסה בקנה מידה גדול **תוצאות למידה:** - שליטה בתהליכי המרת מודלים ואופטימיזציה עם OpenVINO - יישום טכניקות כימות מתקדמות עם NNCF - פריסת מודלים אופטימליים על מגוון פלטפורמות חומרה עם Model Server --- ## [חלק 5: Apple MLX Framework Deep Dive](./05.AppleMLX.md) ### 🎯 סקירה כללית סקירה מקיפה של Apple MLX, מסגרת מהפכנית שתוכננה במיוחד ללמידת מכונה יעילה על Apple Silicon, עם דגש על יכולות מודלים של שפה גדולה ופריסה מקומית. **נושאים מרכזיים:** - יתרונות ארכיטקטורת זיכרון מאוחדת ו-Metal Performance Shaders - תמיכה במודלים LLaMA, Mistral, Phi-3, Qwen ו-Code Llama - LoRA כוונון עדין להתאמה יעילה של מודלים - אינטגרציה עם Hugging Face ותמיכה בכימות (4 ביט ו-8 ביט) **תוצאות למידה:** - שליטה באופטימיזציית Apple Silicon לפריסת מודלים של שפה גדולה - יישום טכניקות כוונון עדין והתאמת מודלים - בניית יישומי AI ארגוניים עם תכונות פרטיות משופרות --- ## [חלק 6: סינתזת זרימת עבודה לפיתוח Edge AI](./06.workflow-synthesis.md) ### 🎯 סקירה כללית סינתזה מקיפה של כל מסגרות האופטימיזציה לזרימות עבודה מאוחדות, מטריצות החלטה ופרקטיקות מיטביות לפריסת Edge AI מוכנה לייצור על מגוון פלטפורמות ושימושים כולל מובייל, מחשבים שולחניים וסביבות ענן. **נושאים מרכזיים:** - ארכיטקטורת זרימת עבודה מאוחדת המשלבת מסגרות אופטימיזציה שונות - עצי החלטה לבחירת מסגרות וניתוח פשרות ביצועים - אימות מוכנות לייצור ואסטרטגיות פריסה מקיפות - אסטרטגיות עתידיות להתאמה לחומרה וארכיטקטורות מודלים מתפתחות **תוצאות למידה:** - שליטה בבחירת מסגרות שיטתית בהתבסס על דרישות ומגבלות - יישום צינורות Edge AI מוכנים לייצור עם ניטור מקיף - עיצוב זרימות עבודה גמישות שמתפתחות עם טכנולוגיות ודרישות מתפתחות --- ## [חלק 7: Qualcomm QNN Optimization Suite](./07.QualcommQNN.md) ### 🎯 סקירה כללית חקירה מקיפה של Qualcomm QNN (Qualcomm Neural Network), מסגרת הסקת AI מאוחדת שתוכננה לנצל את ארכיטקטורת המחשוב ההטרוגנית של Qualcomm כולל Hexagon NPU, Adreno GPU ו-Kryo CPU לביצועים מקסימליים ויעילות אנרגטית על מכשירים ניידים ובקצה. **נושאים מרכזיים:** - מחשוב הטרוגני עם גישה מאוחדת ל-NPU, GPU ו-CPU - אופטימיזציה מודעת לחומרה לפלטפורמות Snapdragon עם חלוקת עומסים חכמה - טכניקות כימות מתקדמות (INT8, INT16, דיוק מעורב) לפריסה ניידת - הסקה חסכונית באנרגיה המותאמת למכשירים מבוססי סוללה ויישומים בזמן אמת **תוצאות למידה:** - שליטה בהאצת חומרה של Qualcomm לפריסת AI ניידת - יישום אסטרטגיות אופטימיזציה חסכוניות באנרגיה למחשוב בקצה - פריסת מודלים מוכנים לייצור על פני מערכת Qualcomm עם ביצועים אופטימליים --- ## 🎯 תוצאות למידה מהפרק עם סיום פרק מקיף זה, הקוראים ישיגו: ### **שליטה טכנית** - הבנה מעמיקה של גבולות כימות ויישומים מעשיים - ניסיון מעשי עם מסגרות אופטימיזציה שונות - מיומנויות פריסה בייצור בסביבות מחשוב בקצה ### **הבנה אסטרטגית** - יכולות בחירה מודעת לחומרה באופטימיזציה - קבלת החלטות מושכלת על פשרות ביצועים - אסטרטגיות פריסה וניטור מוכנות לארגון ### **מדדי ביצועים** | מסגרת | כימות | שימוש בזיכרון | שיפור מהירות | שימוש | |-------|-------|--------------|--------------|-------| | Llama.cpp | Q4_K_M | ~4GB | פי 2-3 | פריסה חוצת פלטפורמות | | Olive | INT4 | הפחתה של 60-75% | פי 2-6 | זרימות עבודה ארגוניות | | OpenVINO | INT8/INT4 | הפחתה של 50-75% | פי 2-5 | אופטימיזציה לחומרה של אינטל | | QNN | INT8/INT4 | הפחתה של 50-80% | פי 5-15 | מובייל/קצה של Qualcomm | | MLX | 4 ביט | ~4GB | פי 2-4 | אופטימיזציה ל-Apple Silicon | ## 🚀 צעדים הבאים ויישומים מתקדמים פרק זה מספק בסיס שלם ל: - פיתוח מודלים מותאמים לתחומים ספציפיים - מחקר באופטימיזציית Edge AI - פיתוח יישומי AI מסחריים - פריסות Edge AI ארגוניות בקנה מידה גדול הידע מהשבעה חלקים הללו מציע ערכת כלים מקיפה לניווט בנוף המתפתח במהירות של אופטימיזציה ופריסת מודלים של Edge AI. --- **הצהרת אחריות**: מסמך זה תורגם באמצעות שירות תרגום מבוסס AI [Co-op Translator](https://github.com/Azure/co-op-translator). למרות שאנו שואפים לדיוק, יש לקחת בחשבון שתרגומים אוטומטיים עשויים להכיל שגיאות או אי דיוקים. המסמך המקורי בשפתו המקורית צריך להיחשב כמקור סמכותי. עבור מידע קריטי, מומלץ להשתמש בתרגום מקצועי אנושי. אנו לא נושאים באחריות לאי הבנות או פירושים שגויים הנובעים משימוש בתרגום זה.