
# edge0
**Un framework de inferencia MoE en streaming de código abierto — SSD expert offload + Recover-LoRA + predicción de enrutamiento del prerouter.**
**Python** · **macOS** · **iOS** · **Android** — una receta, todos los dispositivos.
[](https://huggingface.co/Edge0/Edge0-35B-A3B-preview)
[](https://huggingface.co/Edge0/Edge0-8B-A1B-preview)
[](https://www.modelscope.cn/models/Edge0/Edge0-35B-A3B-preview)
[](https://www.modelscope.cn/models/Edge0/Edge0-8B-A1B-preview)
[](https://arxiv.org/abs/2609.18063)
[](https://github.com/Edge0-AI/Edge0)
[](LICENSE)
[English](README.md) | [中文](README_zh.md) | [日本語](README_ja.md) | Español | [Français](README_fr.md)
## Novedades
- **[2026-09-30]** Lanzamos los **motores de inferencia de edge0 para cuatro plataformas — iOS, macOS, Android y Windows** — de modo que los usuarios obtienen la mejor experiencia de inferencia en todas las arquitecturas y plataformas. El código fuente se ha liberado en este repositorio ([`ios/`](ios/) · [`macos/`](macos/) · [`android/`](android/) · [`windows/`](windows/)) — consulta el README de cada directorio para más detalles. El **framework de inferencia unificado** llegará en **Q4 2026**; consulta la [Hoja de ruta](#hoja-de-ruta).
- **[2026-09-16]** Nuestro informe técnico está en arXiv: [The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction](https://arxiv.org/abs/2609.18063).
- **[2026-09-08]** Primera versión de código abierto de **edge0**, junto con los dos niveles de modelos — [`Edge0-35B-A3B-preview`](https://huggingface.co/Edge0/Edge0-35B-A3B-preview) y [`Edge0-8B-A1B-preview`](https://huggingface.co/Edge0/Edge0-8B-A1B-preview) — en Hugging Face y ModelScope.
## Acerca de
**edge0** es un framework de inferencia MoE en streaming de código abierto.
Generaliza la receta probada en producción — **SSD expert offload +
Recover-LoRA + predicción de enrutamiento del prerouter** — en un framework
extensible que ejecuta grandes modelos sparse-MoE en hardware de consumo: la
memoria pico está limitada por el conjunto de expertos *activos*, no por el
número de parámetros.
### Mecanismos principales
- **SSD expert offload**: los pesos de los expertos se transmiten desde el
almacenamiento bajo demanda; la memoria pico está limitada por el conjunto
activo, no por el número de parámetros.
- **Prerouter**: una cabeza entrenada predice el enrutamiento de expertos un
paso por delante, de modo que las cargas de expertos se solapan con el
forward pass en lugar de bloquearlo — **hasta +59%** de throughput de
decode; la ganancia crece con la latencia del almacenamiento, el tamaño del
modelo y el ancho de enrutamiento *K*.
- **Recover-LoRA**: la base int4 se mantiene congelada y los adaptadores LoRA
se entrenan por destilación desde el teacher FP, recuperando la mayor parte
de la pérdida de cuantización a 4 bits (consulta [Calidad](#calidad)). Los
adaptadores permanecen sin fusionar: una única base de solo lectura sirve a
varios conjuntos de adaptadores.
### Plataformas
Un repositorio, una receta, runtimes por plataforma:
| Plataforma | Directorio | Stack | Estado |
|---|---|---|---|
| **Python** (macOS · Apple Silicon) | [`python/`](python/README_es.md) | Python + MLX | ✅ Disponible ahora |
| Aplicación y CLI para **macOS** | [`macos/`](macos/README_es.md) | Rust | ✅ Código abierto (2026-09-30) |
| Aplicación para **iOS** | [`ios/`](ios/README_es.md) | Swift + MLX Swift | ✅ Código abierto (2026-09-30) |
| Aplicación y motor para **Android** | [`android/`](android/README_es.md) | Kotlin + motor nativo | ✅ Código abierto (2026-09-30) |
| Aplicación y motor para **Windows** | [`windows/`](windows/README_es.md) | C++ + Vulkan | ✅ Código abierto (2026-09-30) |
### Modelos
El framework incluye dos niveles de modelos. Cada nivel es una versión de
extremo a extremo: el checkpoint publicado, los adaptadores LoRA entrenados y
las cabezas prerouter entrenadas funcionan en conjunto como una sola unidad.
| Nivel | Checkpoint publicado | Perfil de inferencia |
|---|---|---|
| `edge0-35b` | [`Edge0/Edge0-35B-A3B-preview`](https://huggingface.co/Edge0/Edge0-35B-A3B-preview) · [ModelScope](https://www.modelscope.cn/models/Edge0/Edge0-35B-A3B-preview) | 4 bits, 40 capas, 256 expertos, prerouter K=4 |
| `edge0-8b` | [`Edge0/Edge0-8B-A1B-preview`](https://huggingface.co/Edge0/Edge0-8B-A1B-preview) · [ModelScope](https://www.modelscope.cn/models/Edge0/Edge0-8B-A1B-preview) | 4 bits, 24 capas, 128 expertos, prerouter K=8 |
Ambos checkpoints se construyen sobre modelos base sparse-MoE abiertos
(Qwen3.6-35B-A3B y el híbrido bailing Ling 3.0, respectivamente) e incluyen
el entrenamiento de LoRA y prerouter realizado para este framework — los
archivos de adaptadores están junto a cada checkpoint y se cargan
automáticamente, de modo que `edge0 serve