Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.
| Property | NeoHorse-1-4B | NeoHorse-1-9B |
|---|---|---|
| Model family | NeoHorse Agent-Native Causal Language Model | NeoHorse Agent-Native Causal Language Model |
| Parameters | Approximately 4B | Approximately 9B |
| Post-training | Routing-guided agentic post-training | Routing-guided agentic post-training |
| Interface | Text input and text output | Text input and text output |
| Context length | 262,144 natively; base capability extensible up to 1,010,000 tokens | 262,144 natively; base capability extensible up to 1,010,000 tokens |
| Weight format / precision | Safetensors / BF16 | Safetensors / BF16 |
| Benchmark | Qwen3.5-4B | Gemma-4-E4B-it | Nanbeige-4.2-3B | Agents-A1-4B | Spark-X2.5-4B | NeoHorse-1-4B | 螖 vs Qwen3.5-4B |
|---|---|---|---|---|---|---|---|
| 馃 Agentic | |||||||
| QwenClawBench | 38.47 | 22.98 | 40.66 | 43.16 | 43.52 | 44.68 | +6.21 |
| WorkBuddy Bench | 24.62 | 11.65 | 21.03 | 33.37 | 26.47 | 34.41 | +9.79 |
| PinchBench | 71.19 | 47.60 | 66.78 | 75.07 | 62.37 | 77.33 | +6.14 |
| VitaBench | 21.50 | 5.00 | 31.50 | 39.25 | 37.00 | 32.00 | +10.50 |
| BFCL v4 | 61.02 | 47.18 | 67.28 | 46.60 | 63.71 | 61.79 | +0.77 |
| tau2-Bench | 84.29 | 43.60 | 85.08 | 81.00 | 77.72 | 88.46 | +4.17 |
| 馃捇 Coding | |||||||
| HumanEval | 87.20 | 84.76 | 98.78 | 92.68 | 92.07 | 96.95 | +9.75 |
| LiveCodeBench v6 | 53.71 | 52.00 | 72.50* | 56.57 | 54.86 | 59.43 | +5.72 |
| 馃摎 Instruction Following | |||||||
| IFBench | 60.33 | 40.00 | 55.00 | 63.33 | 73.33 | 65.33 | +5.00 |
| IFEval | 87.06 | 74.68 | 84.47 | 83.55 | 91.13 | 88.35 | +1.29 |
| 馃搳 Overall | |||||||
| Ten-benchmark average | 58.94 | 42.95 | 62.31 | 61.46 | 62.22 | 64.87 | +5.93 |
| Benchmark | Granite-4.2-8B | Qwen3.5-9B | Ornith-1.5-9B | Gemma-4-12B-it | Muse-Glimmer-30B | NeoHorse-1-9B | 螖 vs Qwen3.5-9B |
|---|---|---|---|---|---|---|---|
| 馃 Agentic | |||||||
| QwenClawBench | 37.01 | 44.04 | 47.27 | 43.53 | 46.11 | 48.73 | +4.69 |
| WorkBuddy Bench | 35.07 | 39.60 | 29.29 | 29.65 | 45.85 | 40.15 | +0.55 |
| PinchBench | 56.93 | 74.55 | 68.22 | 58.89 | 71.35 | 82.25 | +7.70 |
| VitaBench | 23.00 | 31.25 | 26.75 | 36.50 | 48.50 | 42.25 | +11.00 |
| BFCL v4 | 52.06 | 64.88 | 65.03 | 62.06 | 53.74 | 67.43 | +2.55 |
| tau2-Bench | 62.28 | 88.04 | 83.68 | 59.37 | 76.64 | 90.82 | +2.78 |
| 馃捇 Coding | |||||||
| HumanEval | 96.34 | 92.68 | 93.90 | 100.00 | 98.17 | 98.17 | +5.49 |
| LiveCodeBench v6 | 72.00 | 65.14 | 47.43 | 73.14 | 65.71 | 65.14 | +0.00 |
| 馃摎 Instruction Following | |||||||
| IFBench | 78.00 | 66.33 | 40.00 | 77.67 | 78.67 | 66.33 | +0.00 |
| IFEval | 92.98 | 89.46 | 71.35 | 94.27 | 93.90 | 89.09 | -0.37 |
| 馃搳 Overall | |||||||
| Ten-benchmark average | 60.57 | 65.60 | 57.29 | 63.51 | 67.86 | 69.04 | +3.44 |