
# edge0
**Un framework open source d'inférence MoE en streaming — SSD expert offload + Recover-LoRA + prédiction de routage prerouter.**
**Python** · **macOS** · **iOS** · **Android** — une seule recette, tous les appareils.
[](https://huggingface.co/Edge0/Edge0-35B-A3B-preview)
[](https://huggingface.co/Edge0/Edge0-8B-A1B-preview)
[](https://www.modelscope.cn/models/Edge0/Edge0-35B-A3B-preview)
[](https://www.modelscope.cn/models/Edge0/Edge0-8B-A1B-preview)
[](https://arxiv.org/abs/2609.18063)
[](https://github.com/Edge0-AI/Edge0)
[](LICENSE)
[English](README.md) | [中文](README_zh.md) | [日本語](README_ja.md) | [Español](README_es.md) | Français
## Actualités
- **[2026-09-30]** Nous avons publié les **moteurs d'inférence edge0 pour quatre plateformes — iOS, macOS, Android et Windows** — afin d'offrir aux utilisateurs la meilleure expérience d'inférence à travers les architectures et les plateformes. Le code source est publié en open source dans ce dépôt ([`ios/`](ios/) · [`macos/`](macos/) · [`android/`](android/) · [`windows/`](windows/)) — consultez le README de chaque répertoire pour plus de détails. Le **framework d'inférence unifié** suivra au **T4 2026** ; voir la [Feuille de route](#feuille-de-route).
- **[2026-09-16]** Notre rapport technique est sur arXiv : [The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction](https://arxiv.org/abs/2609.18063).
- **[2026-09-08]** Première publication open source d'**edge0**, avec les deux gammes de modèles — [`Edge0-35B-A3B-preview`](https://huggingface.co/Edge0/Edge0-35B-A3B-preview) et [`Edge0-8B-A1B-preview`](https://huggingface.co/Edge0/Edge0-8B-A1B-preview) — sur Hugging Face et ModelScope.
## À propos
**edge0** est un framework open source d'inférence MoE en streaming. Il
généralise la recette éprouvée en production — **SSD expert offload +
Recover-LoRA + prédiction de routage prerouter** — en un framework
extensible qui exécute de grands modèles MoE creux (sparse-MoE) sur du
matériel grand public : la mémoire de pointe est limitée par l'ensemble
*actif* d'experts, et non par le nombre de paramètres.
### Mécanismes fondamentaux
- **SSD expert offload** : les poids des experts sont lus en streaming
depuis le stockage à la demande ; la mémoire de pointe est limitée par
l'ensemble actif, et non par le nombre de paramètres.
- **Prerouter** : une tête entraînée prédit le routage des experts un pas
à l'avance, de sorte que les chargements d'experts chevauchent la passe
avant au lieu de la bloquer — **jusqu'à +59 %** de débit de decode ; le
gain augmente avec la latence du stockage, la taille du modèle et la
largeur routée *K*.
- **Recover-LoRA** : la base int4 est gelée et les adaptateurs LoRA sont
entraînés par distillation depuis l'enseignant FP, récupérant
l'essentiel de la perte de quantification à 4 bits (voir
[Qualité](#qualité)). Les adaptateurs restent non fusionnés : une base
unique en lecture seule sert plusieurs jeux d'adaptateurs.
### Plateformes
Un dépôt, une recette, des runtimes par plateforme :
| Plateforme | Répertoire | Stack | Statut |
|---|---|---|---|
| **Python** (macOS · Apple Silicon) | [`python/`](python/README_fr.md) | Python + MLX | ✅ Disponible maintenant |
| Application et CLI **macOS** | [`macos/`](macos/README_fr.md) | Rust | ✅ Open source (2026-09-30) |
| Application **iOS** | [`ios/`](ios/README_fr.md) | Swift + MLX Swift | ✅ Open source (2026-09-30) |
| Application et moteur **Android** | [`android/`](android/README_fr.md) | Kotlin + moteur natif | ✅ Open source (2026-09-30) |
| Application et moteur **Windows** | [`windows/`](windows/README_fr.md) | C++ + Vulkan | ✅ Open source (2026-09-30) |
### Modèles
Deux gammes de modèles sont fournies avec le framework. Chaque gamme est
une publication complète : le checkpoint publié, les adaptateurs LoRA
entraînés et les têtes prerouter entraînées fonctionnent ensemble comme
une seule unité.
| Gamme | Checkpoint publié | Profil d'inférence |
|---|---|---|
| `edge0-35b` | [`Edge0/Edge0-35B-A3B-preview`](https://huggingface.co/Edge0/Edge0-35B-A3B-preview) · [ModelScope](https://www.modelscope.cn/models/Edge0/Edge0-35B-A3B-preview) | 4-bit, 40 couches, 256 experts, prerouter K=4 |
| `edge0-8b` | [`Edge0/Edge0-8B-A1B-preview`](https://huggingface.co/Edge0/Edge0-8B-A1B-preview) · [ModelScope](https://www.modelscope.cn/models/Edge0/Edge0-8B-A1B-preview) | 4-bit, 24 couches, 128 experts, prerouter K=8 |
Les deux checkpoints sont construits à partir de modèles de base MoE creux
open source (respectivement Qwen3.6-35B-A3B et l'hybride bailing Ling 3.0)
et sont fournis avec l'entraînement LoRA et prerouter réalisé pour ce
framework — les fichiers d'adaptateurs sont colocalisés avec chaque
checkpoint et se chargent automatiquement, de sorte que
`edge0 serve