# Глава 03: Размештање малих језичких модела (SLM) Ова свеобухватна глава истражује комплетан животни циклус размештања малих језичких модела (SLM), покривајући теоријске основе, практичне стратегије имплементације и производно спремна решења у контејнерима. Глава је структурирана у три прогресивна дела који читаоце воде од основних концепата до напредних сценарија размештања. ## Структура главе и пут учења ### **[Део 1: Напредно учење SLM - Основе и оптимизација](./01.SLMAdvancedLearning.md)** Први део поставља теоријске основе за разумевање малих језичких модела и њиховог стратешког значаја у размештању AI на ивици. Овај део покрива: - **Оквир за класификацију параметара**: Детаљно истраживање категорија SLM-а од микро SLM-а (100M-1.4B параметара) до средњих SLM-а (14B-30B параметара), са посебним фокусом на моделе као што су Phi-4-mini-3.8B, Qwen3 серија и Google Gemma3, укључујући анализу хардверских захтева и меморијског отиска за сваки ниво модела - **Напредне технике оптимизације**: Свеобухватно покривање метода квантовања користећи Llama.cpp, Microsoft Olive и Apple MLX оквире, укључујући најсавременије BitNET 1-bit квантовање са практичним примерима кода који приказују цевоводе квантовања и резултате бенчмарка - **Стратегије набавке модела**: Дубинска анализа екосистема Hugging Face и Azure AI Foundry Model Catalog за SLM размештање на нивоу предузећа, са примерима кода за програмско преузимање модела, валидацију и конверзију формата - **API-ји за програмере**: Примери кода у Python-у, C++-у и C#-у који показују како учитати моделе, извршити инференцију и интегрисати се са популарним оквирима као што су PyTorch, TensorFlow и ONNX Runtime Овај основни део наглашава равнотежу између оперативне ефикасности, флексибилности размештања и исплативости која чини SLM-ове идеалним за сценарије рачунарства на ивици, са практичним примерима кода које програмери могу директно применити у својим пројектима. ### **[Део 2: Размештање у локалном окружењу - Решења која првенствено чувају приватност](./02.DeployingSLMinLocalEnv.md)** Други део прелази са теорије на практичну имплементацију, фокусирајући се на стратегије локалног размештања које приоритет дају суверенитету података и оперативној независности. Кључне области укључују: - **Ollama универзална платформа**: Свеобухватно истраживање размештања на више платформи са нагласком на радне токове прилагођене програмерима, управљање животним циклусом модела и прилагођавање кроз Modelfiles, укључујући комплетне примере интеграције REST API-ја и CLI аутоматизационе скрипте - **Microsoft Foundry Local**: Решења за размештање на нивоу предузећа са оптимизацијом заснованом на ONNX-у, интеграцијом Windows ML-а и свеобухватним безбедносним функцијама, са примерима кода у C#-у и Python-у за интеграцију у изворне апликације - **Компаративна анализа**: Детаљно поређење оквира које покрива техничку архитектуру, карактеристике перформанси и смернице за оптимизацију случајева употребе, са кодом за бенчмарк који процењује брзину инференције и употребу меморије на различитом хардверу - **Интеграција API-ја**: Пример апликација које показују како изградити веб услуге, апликације за ћаскање и цевоводе за обраду података користећи локална SLM размештања, са примерима кода у Node.js-у, Python Flask/FastAPI-ју и ASP.NET Core-у - **Оквири за тестирање**: Приступи аутоматизованом тестирању за осигурање квалитета модела, укључујући примере јединичних и интеграционих тестова за SLM имплементације Овај део пружа практичне смернице за организације које желе да имплементирају AI решења која чувају приватност, истовремено задржавајући потпуну контролу над својим окружењем за размештање, са готовим примерима кода које програмери могу прилагодити својим специфичним захтевима. ### **[Део 3: Размештање у облаку у контејнерима - Решења за производну скалу](./03.DeployingSLMinCloud.md)** Завршни део се фокусира на напредне стратегије размештања у контејнерима, са Microsoft-овим Phi-4-mini-instruct као главном студијом случаја. Овај део покрива: - **vLLM размештање**: Оптимизација инференције високих перформанси са OpenAI-компатибилним API-јима, напредним GPU убрзањем и конфигурацијом за производњу, укључујући комплетне Dockerfile-ове, Kubernetes манифесте и параметре за подешавање перформанси - **Ollama оркестрација контејнера**: Поједностављени радни токови размештања са Docker Compose-ом, варијантама оптимизације модела и интеграцијом веб корисничког интерфејса, са примерима CI/CD цевовода за аутоматизовано размештање и тестирање - **ONNX Runtime имплементација**: Размештање оптимизовано за ивицу са свеобухватном конверзијом модела, стратегијама квантовања и компатибилношћу на више платформи, укључујући детаљне примере кода за оптимизацију и размештање модела - **Праћење и посматрање**: Имплементација Prometheus/Grafana контролних табли са прилагођеним метрикама за праћење перформанси SLM-а, укључујући конфигурације за упозорења и агрегирање логова - **Баланс оптерећења и скалирање**: Практични примери стратегија хоризонталног и вертикалног скалирања са конфигурацијама за аутоматско скалирање заснованим на коришћењу CPU/GPU-а и обрасцима захтева - **Ојачавање безбедности**: Најбоље праксе за безбедност контејнера укључујући смањење привилегија, политике мреже и управљање тајнама за API кључеве и акредитиве за приступ моделу Сваки приступ размештању представљен је са комплетним примерима конфигурације, процедурама тестирања, контролним листама за спремност за производњу и шаблонима инфраструктуре као кода које програмери могу директно применити у својим радним токовима за размештање. ## Кључни исходи учења Завршетком ове главе, читаоци ће савладати: 1. **Стратешки избор модела**: Разумевање граница параметара и избор одговарајућих SLM-ова на основу ограничења ресурса и захтева за перформансама 2. **Мајсторство оптимизације**: Имплементацију напредних техника квантовања у различитим оквирима за постизање оптималне равнотеже између перформанси и ефикасности 3. **Флексибилност размештања**: Избор између локалних решења која чувају приватност и скалабилних размештања у контејнерима на основу потреба организације 4. **Спремност за производњу**: Конфигурисање система за праћење, безбедност и скалирање за SLM размештања на нивоу предузећа ## Практични фокус и примена у стварном свету Глава одржава снажан практични оријентир током целог текста, укључујући: - **Практичне примере**: Комплетне конфигурационе датотеке, процедуре тестирања API-ја и скрипте за размештање - **Бенчмаркинг перформанси**: Детаљна поређења брзине инференције, употребе меморије и захтева за ресурсима - **Безбедносне разматрања**: Практике безбедности на нивоу предузећа, оквири за усаглашеност и стратегије заштите података - **Најбоље праксе**: Смернице доказане у производњи за праћење, скалирање и одржавање ## Перспектива спремна за будућност Глава се завршава увидима у трендове који се појављују, укључујући: - Напредне архитектуре модела са побољшаним односима ефикасности - Дубљу интеграцију хардвера са специјализованим AI акцелераторима - Еволуцију екосистема ка стандардизацији и интероперабилности - Шаблоне усвајања на нивоу предузећа вођене приватношћу и захтевима за усаглашеност Ова свеобухватна перспектива осигурава да су читаоци добро опремљени за навигацију кроз тренутне изазове размештања SLM-а и будуће технолошке развоје, доносећи информисане одлуке које су у складу са специфичним захтевима и ограничењима њихове организације. Глава служи и као практични водич за непосредну имплементацију и као стратешки ресурс за дугорочно планирање размештања AI-а, наглашавајући критичну равнотежу између способности, ефикасности и оперативне изврсности која дефинише успешна размештања SLM-а. --- **Одрицање од одговорности**: Овај документ је преведен коришћењем услуге за превођење помоћу вештачке интелигенције [Co-op Translator](https://github.com/Azure/co-op-translator). Иако се трудимо да превод буде тачан, молимо вас да имате у виду да аутоматизовани преводи могу садржати грешке или нетачности. Оригинални документ на његовом изворном језику треба сматрати меродавним извором. За критичне информације препоручује се професионални превод од стране људи. Не преузимамо одговорност за било каква погрешна тумачења или неспоразуме који могу настати услед коришћења овог превода.