面向自我进化 Agent 的持续学习基础设施
[](https://github.com/Human-Agent-Society/reef/actions/workflows/ci.yml)
[](https://pypi.org/project/reef-infra/)
[](pyproject.toml)
[](LICENSE)
[English](README.md) | 中文
Reef 是首个面向持续自我进化 Agent 的开源基础设施。它连接 Agent 推理、反馈、学习与
版本化交付。你可以用它配合 Slime 和 SGLang 训练模型权重,也可以改进 Agent 的
harness,包括提示词、规则和技能。
**🚀 [快速上手](https://reefinfra.ai/docs/getting-started/quickstart/) |
🗺️ [路线图](https://github.com/Human-Agent-Society/reef/issues/25) |
📣 [发布文章](https://x.com/ao_qu18465/status/2094867930081337730) |
💬 [加入 Discord](https://discord.gg/5y8e5f937k) |
📱 [加入微信群](docs/community/wechat.md)**
## 🎯 何时使用 Reef
如果你希望 Agent 通过与你的日常交互不断学习、持续进化,就适合使用 Reef。
| 你的目标 | 学习路径 | 所需条件 |
|---|---|---|
| 持续获得更贴合自身需求的强大模型 | 模型权重训练 | 可训练模型、受支持的 GPU 栈,以及 recipe 可利用的反馈 |
| 让 harness 自我进化 | Harness 优化 | 模型端点、有代表性的任务和评估器;无需本地训练 GPU |
| 进行科学发现 | 测试时训练 | 执行环境、正确性检查器和可度量的目标 |
## 🧩 Reef 在技术栈中的位置
| 能力 | 推理引擎(vLLM、SGLang…) | RL 训练框架(Slime、veRL、AReaL…) | **Reef** |
|---|:---:|:---:|:---:|
| 承接线上流量 | ✅ | ❌ | ✅ |
| 训练权重 | ❌ | ✅ | ✅ |
| 版本管理 | ❌ | ❌ | ✅ |
| 更新期间持续服务 | ❌ | ❌ | ✅ |
| 可进化权重以外的部分(技能、harness) | ❌ | ❌ | ✅ |
## 🔄 工作原理