# Розділ 04: Конверсія формату моделі та квантування - Огляд розділу Поява EdgeAI зробила конверсію формату моделі та квантування важливими технологіями для впровадження складних можливостей машинного навчання на пристроях із обмеженими ресурсами. Цей розгорнутий розділ надає повний посібник для розуміння, впровадження та оптимізації моделей для сценаріїв розгортання на краю. ## 📚 Структура розділу та навчальний шлях Розділ організований у сім прогресивних секцій, кожна з яких базується на попередній, щоб створити всебічне розуміння оптимізації моделей для обчислень на краю: --- ## [Секція 1: Основи конверсії формату моделі та квантування](./01.Introduce.md) ### 🎯 Огляд Ця базова секція встановлює теоретичну основу для оптимізації моделей у середовищах обчислень на краю, охоплюючи межі квантування від 1-бітної до 8-бітної точності та ключові стратегії конверсії формату. **Основні теми:** - Класифікаційна структура точності (ультра-низька, низька, середня точність) - Переваги та випадки використання форматів GGUF і ONNX - Переваги квантування для операційної ефективності та гнучкості розгортання - Порівняння продуктивності та використання пам’яті **Результати навчання:** - Розуміння меж квантування та класифікацій - Визначення відповідних технік конверсії формату - Вивчення передових стратегій оптимізації для розгортання на краю --- ## [Секція 2: Посібник із впровадження Llama.cpp](./02.Llamacpp.md) ### 🎯 Огляд Розгорнутий посібник із впровадження Llama.cpp, потужного C++ фреймворку, що дозволяє ефективно виконувати великі мовні моделі з мінімальними налаштуваннями на різноманітних апаратних конфігураціях. **Основні теми:** - Встановлення на платформах Windows, macOS та Linux - Конверсія формату GGUF та різні рівні квантування (Q2_K до Q8_0) - Апаратне прискорення за допомогою CUDA, Metal, OpenCL та Vulkan - Інтеграція з Python та стратегії розгортання у виробництві **Результати навчання:** - Оволодіння кросплатформним встановленням та побудовою з вихідного коду - Впровадження технік квантування та оптимізації моделі - Розгортання моделей у серверному режимі з інтеграцією REST API --- ## [Секція 3: Набір оптимізації Microsoft Olive](./03.MicrosoftOlive.md) ### 🎯 Огляд Дослідження Microsoft Olive, апаратно-орієнтованого інструментарію оптимізації моделей із понад 40 вбудованими компонентами оптимізації, розробленого для розгортання моделей корпоративного рівня на різноманітних апаратних платформах. **Основні теми:** - Автоматичні функції оптимізації з динамічним і статичним квантуванням - Апаратно-орієнтований інтелект для розгортання на CPU, GPU та NPU - Підтримка популярних моделей (Llama, Phi, Qwen, Gemma) "з коробки" - Інтеграція з Azure ML та виробничими робочими процесами **Результати навчання:** - Використання автоматизованої оптимізації для різних архітектур моделей - Впровадження стратегій кросплатформного розгортання - Створення готових до виробництва оптимізаційних конвеєрів --- ## [Секція 4: Набір оптимізації OpenVINO Toolkit](./04.openvino.md) ### 🎯 Огляд Розгорнуте дослідження інструментарію OpenVINO від Intel, відкритої платформи для розгортання продуктивних AI-рішень у хмарі, локально та на краю з розширеними можливостями Neural Network Compression Framework (NNCF). **Основні теми:** - Кросплатформне розгортання з апаратним прискоренням (CPU, GPU, VPU, AI-акселератори) - Neural Network Compression Framework (NNCF) для розширеного квантування та обрізання - OpenVINO GenAI для оптимізації та розгортання великих мовних моделей - Можливості серверів моделей корпоративного рівня та масштабовані стратегії розгортання **Результати навчання:** - Оволодіння робочими процесами конверсії та оптимізації моделей OpenVINO - Впровадження розширених технік квантування за допомогою NNCF - Розгортання оптимізованих моделей на різноманітних апаратних платформах із використанням Model Server --- ## [Секція 5: Глибоке дослідження фреймворку Apple MLX](./05.AppleMLX.md) ### 🎯 Огляд Розгорнуте висвітлення Apple MLX, революційного фреймворку, спеціально розробленого для ефективного машинного навчання на Apple Silicon, з акцентом на можливості великих мовних моделей та локальне розгортання. **Основні теми:** - Переваги архітектури уніфікованої пам’яті та Metal Performance Shaders - Підтримка моделей LLaMA, Mistral, Phi-3, Qwen та Code Llama - LoRA тонке налаштування для ефективної кастомізації моделей - Інтеграція з Hugging Face та підтримка квантування (4-біт та 8-біт) **Результати навчання:** - Оволодіння оптимізацією Apple Silicon для розгортання LLM - Впровадження технік тонкого налаштування та кастомізації моделей - Створення корпоративних AI-додатків із розширеними функціями конфіденційності --- ## [Секція 6: Синтез робочого процесу розробки Edge AI](./06.workflow-synthesis.md) ### 🎯 Огляд Розгорнутий синтез усіх фреймворків оптимізації в єдині робочі процеси, матриці рішень та найкращі практики для готового до виробництва розгортання Edge AI на різноманітних платформах і для різних випадків використання, включаючи мобільні, настільні та хмарні середовища. **Основні теми:** - Єдина архітектура робочого процесу, що інтегрує кілька фреймворків оптимізації - Дерева рішень для вибору фреймворків та аналіз компромісів продуктивності - Перевірка готовності до виробництва та розгорнуті стратегії розгортання - Стратегії захисту на майбутнє для нових апаратних засобів та архітектур моделей **Результати навчання:** - Оволодіння систематичним вибором фреймворків на основі вимог та обмежень - Впровадження готових до виробництва конвеєрів Edge AI із комплексним моніторингом - Розробка адаптивних робочих процесів, які еволюціонують із новими технологіями та вимогами --- ## [Секція 7: Набір оптимізації Qualcomm QNN](./07.QualcommQNN.md) ### 🎯 Огляд Розгорнуте дослідження Qualcomm QNN (Qualcomm Neural Network), єдиного фреймворку AI-інференсу, розробленого для використання гетерогенної обчислювальної архітектури Qualcomm, включаючи Hexagon NPU, Adreno GPU та Kryo CPU для максимальної продуктивності та енергоефективності на мобільних і крайових пристроях. **Основні теми:** - Гетерогенне обчислення з єдиним доступом до NPU, GPU та CPU - Апаратно-орієнтована оптимізація для платформ Snapdragon з інтелектуальним розподілом навантаження - Розширені техніки квантування (INT8, INT16, змішана точність) для мобільного розгортання - Енергоефективний інференс, оптимізований для пристроїв із живленням від батареї та реальних додатків **Результати навчання:** - Оволодіння апаратним прискоренням Qualcomm для мобільного AI-розгортання - Впровадження енергоефективних стратегій оптимізації для обчислень на краю - Розгортання готових до виробництва моделей у екосистемі Qualcomm із оптимальною продуктивністю --- ## 🎯 Результати навчання розділу Після завершення цього розгорнутого розділу читачі досягнуть: ### **Технічного оволодіння** - Глибоке розуміння меж квантування та практичних застосувань - Практичний досвід із кількома фреймворками оптимізації - Навички розгортання у виробничих середовищах обчислень на краю ### **Стратегічного розуміння** - Здатність вибору апаратно-орієнтованої оптимізації - Обґрунтоване прийняття рішень щодо компромісів продуктивності - Стратегії розгортання та моніторингу корпоративного рівня ### **Порівняння продуктивності** | Фреймворк | Квантування | Використання пам’яті | Покращення швидкості | Випадок використання | |-----------|-------------|----------------------|-----------------------|-----------------------| | Llama.cpp | Q4_K_M | ~4GB | 2-3x | Кросплатформне розгортання | | Olive | INT4 | Зменшення на 60-75% | 2-6x | Корпоративні робочі процеси | | OpenVINO | INT8/INT4 | Зменшення на 50-75% | 2-5x | Оптимізація для апаратного забезпечення Intel | | QNN | INT8/INT4 | Зменшення на 50-80% | 5-15x | Мобільне/крайове використання Qualcomm | | MLX | 4-біт | ~4GB | 2-4x | Оптимізація для Apple Silicon | ## 🚀 Наступні кроки та розширені застосування Цей розділ надає повну основу для: - Розробки кастомних моделей для конкретних доменів - Досліджень у сфері оптимізації Edge AI - Розробки комерційних AI-додатків - Масштабних корпоративних розгортань Edge AI Знання з цих семи секцій пропонують всебічний інструментарій для навігації у швидко змінюваному ландшафті оптимізації та розгортання моделей Edge AI. --- **Відмова від відповідальності**: Цей документ був перекладений за допомогою сервісу автоматичного перекладу [Co-op Translator](https://github.com/Azure/co-op-translator). Хоча ми прагнемо до точності, будь ласка, майте на увазі, що автоматичні переклади можуть містити помилки або неточності. Оригінальний документ на його рідній мові слід вважати авторитетним джерелом. Для критичної інформації рекомендується професійний людський переклад. Ми не несемо відповідальності за будь-які непорозуміння або неправильні тлумачення, що виникають внаслідок використання цього перекладу.