终极开源实时语音运行时qwen-audio-agent:让AI语音助手一直在聊、一直在干活的完整解析
【免费下载链接】qwen-audio-agentA realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents项目地址: https://gitcode.com/gh_mirrors/qw/qwen-audio-agent
qwen-audio-agent 是一个开源的实时语音运行时(Realtime Voice Runtime),专为 AI 语音助手打造:它让 Agent 与你全双工对话的同时,还能把工具调用、文件处理和长任务交给后台执行——对话不中断、结果自然回流,真正做到“一直在聊、一直在干活、一直在场”。
为什么需要这个实时语音运行时?
传统语音助手的痛点很直观:说一句、等一句。助手去查资料、调工具、跑任务时,整场对话就“卡住”了。
qwen-audio-agent 的设计哲学是Agent Presence(始终在场):
- 🗣️全双工实时语音——随时打断、自然多轮,像真人聊天一样连续
- ⚡对话与任务并行——后台干活时,前台继续聊,可随时追问进度或取消
- 🔄结果自动回流——任务完成后,结果自然回到当前对话,支持继续追问和修改
- 🧠长期记忆——当前用户跨会话的个性化记忆
官方一句话概括:能直接回答的问题立即回答;需要工具或持续处理时交给后台 Agent,而用户面对的始终是同一个助理。
三层架构:AI语音助手如何边聊边干活
理解这套实时语音运行时,只需记住三层职责:
| 层级 | 组件 | 职责 |
|---|---|---|
| 第 1 层 | 前台 Agent(实时语音) | 听、说、路由,负责自然语音答复与打断处理 |
| 第 2 层 | Gateway + 编排运行时 | 管理任务生命周期、权限、会话,让工作与对话并行 |
| 第 3 层 | 后台 Agent(可选持久执行) | 用自己的模型、工具、MCP 与 Skills 持续干活 |
关键机制是非阻塞循环:当请求需要后台执行时,前台发起任务委派(spawn_thinking),编排运行时立即返回受理回执,对话继续进行;任务完成后,结果在安全的插入窗口自然回流到同一场对话。
更底层的原理见下方架构图——用户与实时模型之间维持连续语音,而更深入的搜索、推理和智能体能力由 Agent Runtime 委派处理:
完整设计解读可阅读 docs/architecture/overview.zh.md 和 docs/architecture/deep-dive.zh.md。
最快安装步骤:三步开始第一次对话
安装非常轻量,只需 Node.js 22.22.2+(或 24.15.0+)和 npm 10+:
第 1 步 · 一键安装
npm install -g qwen-audio-agent第 2 步 · 创建配置并填入 API Key
qwenaudio config在生成的config.env中填入百炼(DashScope)API Key。新手建议先只用「仅前台模式」验证语音对话,不配置后台也不影响聊天:
DASHSCOPE_API_KEY=your-key QWEN_AUDIO_REALTIME_MODEL=qwen-audio-3.0-realtime-plus AGENT_PROTOCOL=none第 3 步 · 启动 Gateway,连接客户端
qwenaudio # 终端 1:启动 Gateway qwenaudio webui # 终端 2:打开浏览器界面(或 qwenaudio tui 使用终端客户端)打开麦克风说一句“你好”,能看到转写并听到回答,就说明运行成功了。详细步骤见 docs/getting-started/quickstart.zh.md 与 docs/getting-started/install.zh.md。
桌面悬浮球:让语音助手常驻桌面的完整体验
不想敲命令?下载桌面版(macOS / Windows / Linux)即可。它内置 Gateway,无需单独启动服务:
- 🌐语音悬浮球 + 对话面板——常驻桌面,可切换外观、导入桌宠皮肤
- 💤自动休眠——闲置后自动隐藏,但保持连接与上下文,说“可以退下了”也能唤醒退出
- 🗣️语音唤醒——启用唤醒词“你好千问”,本地检测、不上传音频
- 📱手机远程接入——手机或另一台电脑可通过连接码接入同一 Gateway
桌面版源码位于 desktop/,行为说明见 docs/desktop/overview.zh.md。
可自由组合的语音前台与后台 Agent
这套运行时把「说话的大脑」和「干活的手」解耦,按需组合:
语音前台(负责实时交流):Qwen Audio 3.0 Realtime、GPT-Live / OpenAI Realtime、Google Gemini Live、Qwen3.5-Omni Realtime、豆包 Seeduplex、StepAudio 3,以及本地部署的 Hugging Face Speech-to-Speech、MiniCPM-o 4.5 等。接入新服务只需实现 Realtime Provider 接口,无需改动核心逻辑。
后台 Agent(负责执行任务):一键接入 Qwen Code、OpenCode、OpenClaw、Qoder、Kimi Code、Codex、Claude Code、DeepSeek Harness 等十余个 Agent,并复用其模型配置、工具、MCP、Skills 和认证。
各方案对比与配置方法见 docs/backends/overview.zh.md 和 docs/voice-frontends/ 下的各前台指南。
场景扩展:从桌面办公到智能座舱
“前台对话 + 后台任务”的设计远不止桌面办公。项目内置了多个可直接参考的示例:
- 🚗智能座舱——车控、导航、音乐、天气与生活服务的语音 Agent,完整示例见 examples/smart-cockpit/
- 🎧语音客服——零售与航空场景的语音客服,见 examples/customer-service/
- 👁️X-Omni 视觉对话——画面观察与解说,见 examples/x-omni/
- 💳AI Passport——硬件卡片上的千问语音豆,见 examples/ai-passport/
- 🤖数字人——见 examples/digital-human/
智能座舱示例展示了同一套实时语音运行时如何驱动车控、导航、音乐等技能卡片:
文档与源码导航:按需深入
| 想做什么 | 去哪里看 |
|---|---|
| 快速上手 | docs/getting-started/quickstart.zh.md |
| 理解架构 | docs/architecture/overview.zh.md |
| 配置语音前台 | docs/configuration/frontend.zh.md |
| 接入后台 Agent | docs/backends/overview.zh.md |
| 桌面版玩法 | docs/desktop/overview.zh.md |
| 远程接入与运维 | docs/operations/remote-access.zh.md |
| 服务端核心实现 | server/src/(voice 语音会话、task 任务管理、backend 后台接入) |
项目采用 Apache License 2.0 开源,贡献指南见 CONTRIBUTING.md,安全与隐私说明见 SECURITY.md 和 PRIVACY.md。
一句话总结:如果你想要一个不冷场、不等待、边聊边办事的 AI 语音助手,qwen-audio-agent 就是目前开源世界里最完整的实时语音运行时答案。🚀
【免费下载链接】qwen-audio-agentA realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents项目地址: https://gitcode.com/gh_mirrors/qw/qwen-audio-agent
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考