# Qwen Audio Agent
[中文](README_ZH.md) | [English](README.md)
[](https://github.com/QwenAudio/qwen-audio-agent/actions/workflows/ci.yml)
[](https://www.npmjs.com/package/qwen-audio-agent)
[](https://nodejs.org/)
[](LICENSE)
[](#交流与分享)
## Agent,始终在场
真正的交流,不该在说完一句话后,就陷入漫长的等待。也不该因为 Agent 正在查资料、调用工具或处理任务,整场对话就此暂停。
交流应该是连续的,Agent 也应该始终在场。
所以,我们做了 **qwen-audio-agent**——让 Agent 持续交流、持续工作、持续在场的实时语音运行时。无论是聊天、思考,还是处理任务,Agent 都始终在这场对话里。它会倾听,会回应,也会在任务完成时自然地告诉你:
“已经好了。”
## News
- **2026-08-20 · [v1.11.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.11.0)**
🧩 开放可嵌入 Gateway 与 Realtime Provider 扩展;🛠️ 支持安装与管理 Agent Skill;📎 TUI 支持多模态输入;🎨 皮肤动画联动运行状态。
- **2026-08-13 · [v1.10.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.10.0)**
🐋 新增实验性 DeepSeek Harness 后台接入,支持一键安装。
- **2026-08-13 · [v1.9.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.9.0)**
🧩 桌面任务卡实时展示 Agent 进度;🔎 后台 Agent 选择更清晰、支持搜索;🎙️ 支持 Qwen3.5-Omni Realtime 前台模型接入。
- **2026-08-09 · [v1.8.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.8.0)**
🆕 新增 Qwen Code 后台;🔧 修复已知问题。
- **2026-08-07 · [v1.7.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.7.0)**
🎨 悬浮球开放自定义外观,兼容 [Awesome Codex Pet](https://codexpet.top/) 社区画廊的宠物包;🪟 优化 Windows 后台 Agent 启动。
- **2026-08-06 · [v1.6.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.6.0)**
🪟 桌面版正式支持 Windows;🧠 新增无感记忆,会话结束后自动提取。
- **2026-08-05 · [v1.5.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.5.0)**
⏰ 新增定时提醒与进度查询;🗣️ 新增语音唤醒词“你好千问”;🐧 桌面版支持 Linux 打包;桌面版数据目录与 CLI 隔离。
- **2026-08-04 · [v1.4.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.4.0)**
🧠 新增个性化规则与清单管理;桌面版支持自动休眠与快捷键唤醒。
- **2026-08-03 · [v1.3.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.3.0)**
🎙️ 新增 [🤗 speech-to-speech](https://github.com/huggingface/speech-to-speech) 前台接入,支持本地部署 VAD、STT、LLM 与 TTS 全链路。
- **2026-08-01 · [v1.2.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.2.0)**
⚡ 桌面版新增自动更新,优化启动速度与后台 Agent 检测。
- **2026-07-31 · [v1.1.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.1.0)**
🤝 新增 Kimi Code CLI 后台,原生 ACP 接入。
- **2026-07-30 · [v1.0.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v1.0.0)**
🚀 正式版发布,推出内置 Gateway 的 macOS 桌面版。
- **2026-07-28 · [v0.9.0](https://github.com/QwenAudio/qwen-audio-agent/releases/tag/v0.9.0)**
🌍 项目正式开源,后台 Agent 统一接入 ACP 架构。
## 对话继续,任务也在继续
对话不会因为后台任务而停下;任务完成后,结果会自然回到当前对话:
https://github.com/user-attachments/assets/ab570531-8da9-4af4-93fa-244bb6614c05
### 核心特色
- 全双工实时语音交互、自然打断和持续多轮对话
- 从统一模型目录选择 DashScope Qwen Audio 与 Qwen3.5 Omni Realtime 模型
- 一键选择你喜欢的办事 Agent,复用已有的工具、MCP、Skill
- 前台对话与后台任务并驾齐驱,可随时追问任务进度或取消任务
- 支持创建多个独立任务,由后台 Agent 异步执行,并持续追踪任务状态
- 任务结果自动回到当前对话,支持继续追问和修改
- 支持 WebUI、终端 TUI 和桌面悬浮球(macOS / Windows / Linux)
- 桌面版自动休眠时断开云端 Realtime,但不停止已提交任务;可通过自定义快捷键或本地唤醒词恢复
- 支持当前用户的长期个性化覆盖与跨会话记忆
## 参考架构

能直接回答的问题会立即回答;需要工具或持续处理时,任务会交给后台 Agent。
整个过程中,用户面对的始终是同一个助理。
查看详细架构

更完整的产品边界见[架构文档](docs/architecture.zh.md),也可查看
[语音 Agent 架构演示文档](docs/voice-agent-architecture-presentation.zh.md)。
## Agent 支持
| 后台 Agent | 接入方式 | 接入准备 | 推荐指数 |
| --- | --- | --- | --- |
| 无 | N/A | 仅前台模式,无需配置 | ★★★★★ |
| OpenCode | 原生 ACP | 支持一键安装和百炼配置 | ★★★★★ |
| OpenClaw | 内置 ACP 桥接 | 支持一键安装和百炼配置 | ★★★★★ |
| Qoder | 原生 ACP | 支持一键安装,需用户配置 | ★★★★★ |
| Qwen Code | 原生 ACP | 支持一键安装,需用户配置 | ★★★★☆ |
| Kimi Code | 原生 ACP | 支持一键安装,需用户配置 | ★★★★★ |
| Hermes | 原生 ACP | 支持一键安装,需用户配置 | ★★★★☆ |
| CodeBuddy | 原生 ACP | 支持一键安装,需用户配置 | ★★★★☆ |
| Codex | 外部 ACP 适配 | 支持一键安装本体与适配器,需用户配置 | ★★★★☆ |
| Claude Code | 外部 ACP 适配 | 支持一键安装本体与适配器,需用户配置 | ★★★★☆ |
| DeepSeek | 原生 ACP | 支持一键安装,需 DeepSeek API Key | ★★★★☆ |
| Pi | 外部 ACP 适配 | 支持一键安装本体与适配器,需用户配置 | ★★★★☆ |
推荐指数综合反映当前集成完整度、兼容性和实际验证程度:五星表示已经过充分测试的
推荐集成,四星表示正在开发或尚未完成同等范围验证。
详细配置和能力边界见[配置说明](docs/configuration.zh.md)。
## 安装
需要 Node.js 22.22.2+ 或 24.15.0+、npm 10+。一键安装(推荐):
```bash
npm install -g qwen-audio-agent
```
从源码安装、从 GitHub 安装最新代码以及获取 DashScope API Key 的详细步骤见
[安装指南](docs/getting-started/install.zh.md)。
## 快速开始
1. 创建配置并填入 API Key:
```bash
qwenaudio config
```
```dotenv
DASHSCOPE_API_KEY=your-key
# 语音前台模型:Omni Flash/Plus 或 Audio Flash/Plus(默认 Audio Plus)
QWEN_AUDIO_REALTIME_MODEL=qwen-audio-3.0-realtime-plus
# 后台Agent:可选,不设置或设置为 none 时,启动仅前台模式
AGENT_PROTOCOL=openclaw
# 后台模型:可为空,留空则沿用 Agent 自身的用户配置
QWEN_AUDIO_AGENT_BACKEND_MODEL=qwen3.7-max
```
> 默认使用 DashScope 实时语音前台;也可切换为本地 [speech-to-speech 前台](docs/voice-frontends/speech-to-speech.zh.md),无需云端 API Key。
> `qwen3.5-omni-flash-realtime` 与 `qwen3.5-omni-plus-realtime`
> 在模型层支持文本、音频和图片输入。本版本客户端传输层仅启用文本和音频;
> 图片/画面帧与原生视频传输仍保持关闭,待对应客户端和 Gateway 链路实现。
桌面版或 `qwenaudio config set --realtime-model ` 配置 Gateway 统一使用的模型;
CLI 修改后需要重启 Gateway。WebUI 与 TUI 只显示当前生效模型,不单独覆盖模型。
2. 启动 Gateway,另开终端启动 TUI(也可用 `qwenaudio webui` 启动浏览器界面):
```bash
qwenaudio # 终端 1:Gateway
qwenaudio tui # 终端 2:TUI
```
完整配置项、speech-to-speech 前台接入和 TUI 平台注意事项见
[快速开始](docs/getting-started/quickstart.zh.md)、
[语音前台](docs/voice-frontends/speech-to-speech.zh.md)与
[TUI 注意](docs/getting-started/tui.zh.md)。
## 示例
仓库内提供智能座舱语音 Agent 示例,包含车控、导航、音乐、天气、联网查询、淘宝闪购和座舱 UI:
```bash
cp examples/car/.env.example examples/car/.env.local
npm install --prefix examples/car/server
npm install --prefix examples/car/react-app
npm run example:car:server # 终端 1:座舱 Agent 服务
npm run example:car:web # 终端 2:座舱 UI
```
详细说明见 [examples/car](https://github.com/QwenAudio/qwen-audio-agent/tree/main/examples/car)。
## 桌面版
桌面版提供常驻桌面的语音悬浮球,内置 Gateway,支持空闲自动休眠、自定义唤醒
快捷键和本地语音唤醒。休眠时会断开 Realtime 前台,但桌面进程、Gateway、后台
Agent 和已提交任务仍继续运行;它不等于退出或重启桌面版。任务完成后可以唤醒
桌面版,并把结果带回当前对话。从发布页下载对应平台安装包,或从源码构建:
```bash
npm run desktop:build:local # macOS
npm run desktop:build:win # Windows
npm run desktop:build:linux # Linux(AppImage + deb,无需签名)
```
外观效果、悬浮球行为和构建说明见[桌面版文档](docs/desktop/overview.zh.md)。
## 后台 Agent
`AGENT_PROTOCOL` 可选。留空即仅前台模式;选择后可复用已安装 Agent 的用户级
模型、工具、MCP、Skill 和认证。CLI 与桌面版共用同一套接入规范:检测到已有 Agent
时直接复用;用户选择一键安装时只补齐缺失组件;安装、配置和运行状态分别判断。
配置仍由后台 Agent 自己负责,桌面版打开其原生配置入口,不读取、复制或改写它的
凭据。
```bash
qwenaudio setup # 查看当前可用的后台 Agent
```
Agent 选择、后台常驻服务、通用 ACP 入口和权限模式见
[后台 Agent 文档](docs/backends/overview.zh.md)。
## 个性化与记忆
用户数据保存在 `~/.config/qwaudio/`(`ASSISTANT.md`、`USER.md`、`MEMORY.md`、
`tasks.json`、`logs/`),只存本机、不进仓库。详见
[助手画像、用户偏好与记忆](docs/reference/memory.zh.md)。
## 使用注意事项
- 不要在用户偏好或对话中保存密码、API Key、验证码和访问令牌。
- 麦克风音频与实时对话会发送到配置的 Realtime 前台服务(DashScope 或
speech-to-speech)。
- 后台任务可能调用所选 Agent 的模型、工具、MCP 和外部服务。
- `full` 权限允许后台执行命令和修改文件,只应在可信项目中使用。
- Gateway 默认仅供本机访问;不要直接暴露到局域网或公网。
- Linux / Windows 使用无回声消除全双工时,请佩戴耳机。
详细数据边界见[隐私说明](PRIVACY.md),网络与权限配置见
[配置说明](docs/configuration.zh.md)。
## 源码开发
```bash
npm install
npm run build
npm test
```
```bash
npm run dev # Gateway 与 WebUI 热更新
npm run desktop # 桌面悬浮球(macOS / Windows)
```
更多构建、测试和发布说明见 [CONTRIBUTING.md](CONTRIBUTING.md)。
## 交流与分享
你可以直接在 [GitHub Issues](https://github.com/QwenAudio/qwen-audio-agent/issues) 发起讨论。
对中国用户,也可以扫描左侧二维码加入微信交流群;如果群二维码已满或过期,
扫描右侧任一维护者的个人二维码,维护者会邀请你进群。
| 微信交流群 | 个人微信 | 个人微信 |
| :---: | :---: | :---: |
|
|
|
|
## 参与贡献与安全
- 开发与提交说明:[CONTRIBUTING.md](CONTRIBUTING.md)
- 安全问题报告:[SECURITY.md](SECURITY.md)
- 数据流向说明:[PRIVACY.md](PRIVACY.md)
- 第三方组件声明:[THIRD_PARTY_NOTICES.md](THIRD_PARTY_NOTICES.md)
## 许可证
[Apache License 2.0](LICENSE)