拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

终极开源实时语音运行时qwen-audio-agent:让AI语音助手一直在聊、一直在干活的完整解析

终极开源实时语音运行时qwen-audio-agent:让AI语音助手一直在聊、一直在干活的完整解析

终极开源实时语音运行时qwen-audio-agent:让AI语音助手一直在聊、一直在干活的完整解析

【免费下载链接】qwen-audio-agentA realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents项目地址: https://gitcode.com/gh_mirrors/qw/qwen-audio-agent

qwen-audio-agent 是一个开源的实时语音运行时(Realtime Voice Runtime),专为 AI 语音助手打造:它让 Agent 与你全双工对话的同时,还能把工具调用、文件处理和长任务交给后台执行——对话不中断、结果自然回流,真正做到“一直在聊、一直在干活、一直在场”。

为什么需要这个实时语音运行时?

传统语音助手的痛点很直观:说一句、等一句。助手去查资料、调工具、跑任务时,整场对话就“卡住”了。

qwen-audio-agent 的设计哲学是Agent Presence(始终在场):

  • 🗣️全双工实时语音——随时打断、自然多轮,像真人聊天一样连续
  • ⚡对话与任务并行——后台干活时,前台继续聊,可随时追问进度或取消
  • 🔄结果自动回流——任务完成后,结果自然回到当前对话,支持继续追问和修改
  • 🧠长期记忆——当前用户跨会话的个性化记忆

官方一句话概括:能直接回答的问题立即回答;需要工具或持续处理时交给后台 Agent,而用户面对的始终是同一个助理。

三层架构:AI语音助手如何边聊边干活

理解这套实时语音运行时,只需记住三层职责:

层级组件职责
第 1 层前台 Agent(实时语音)听、说、路由,负责自然语音答复与打断处理
第 2 层Gateway + 编排运行时管理任务生命周期、权限、会话,让工作与对话并行
第 3 层后台 Agent(可选持久执行)用自己的模型、工具、MCP 与 Skills 持续干活

关键机制是非阻塞循环:当请求需要后台执行时,前台发起任务委派(spawn_thinking),编排运行时立即返回受理回执,对话继续进行;任务完成后,结果在安全的插入窗口自然回流到同一场对话。

更底层的原理见下方架构图——用户与实时模型之间维持连续语音,而更深入的搜索、推理和智能体能力由 Agent Runtime 委派处理:

完整设计解读可阅读 docs/architecture/overview.zh.md 和 docs/architecture/deep-dive.zh.md。

最快安装步骤:三步开始第一次对话

安装非常轻量,只需 Node.js 22.22.2+(或 24.15.0+)和 npm 10+:

第 1 步 · 一键安装

npm install -g qwen-audio-agent

第 2 步 · 创建配置并填入 API Key

qwenaudio config

在生成的config.env中填入百炼(DashScope)API Key。新手建议先只用「仅前台模式」验证语音对话,不配置后台也不影响聊天:

DASHSCOPE_API_KEY=your-key QWEN_AUDIO_REALTIME_MODEL=qwen-audio-3.0-realtime-plus AGENT_PROTOCOL=none

第 3 步 · 启动 Gateway,连接客户端

qwenaudio # 终端 1:启动 Gateway qwenaudio webui # 终端 2:打开浏览器界面(或 qwenaudio tui 使用终端客户端)

打开麦克风说一句“你好”,能看到转写并听到回答,就说明运行成功了。详细步骤见 docs/getting-started/quickstart.zh.md 与 docs/getting-started/install.zh.md。

桌面悬浮球:让语音助手常驻桌面的完整体验

不想敲命令?下载桌面版(macOS / Windows / Linux)即可。它内置 Gateway,无需单独启动服务:

  • 🌐语音悬浮球 + 对话面板——常驻桌面,可切换外观、导入桌宠皮肤
  • 💤自动休眠——闲置后自动隐藏,但保持连接与上下文,说“可以退下了”也能唤醒退出
  • 🗣️语音唤醒——启用唤醒词“你好千问”,本地检测、不上传音频
  • 📱手机远程接入——手机或另一台电脑可通过连接码接入同一 Gateway

桌面版源码位于 desktop/,行为说明见 docs/desktop/overview.zh.md。

可自由组合的语音前台与后台 Agent

这套运行时把「说话的大脑」和「干活的手」解耦,按需组合:

语音前台(负责实时交流):Qwen Audio 3.0 Realtime、GPT-Live / OpenAI Realtime、Google Gemini Live、Qwen3.5-Omni Realtime、豆包 Seeduplex、StepAudio 3,以及本地部署的 Hugging Face Speech-to-Speech、MiniCPM-o 4.5 等。接入新服务只需实现 Realtime Provider 接口,无需改动核心逻辑。

后台 Agent(负责执行任务):一键接入 Qwen Code、OpenCode、OpenClaw、Qoder、Kimi Code、Codex、Claude Code、DeepSeek Harness 等十余个 Agent,并复用其模型配置、工具、MCP、Skills 和认证。

各方案对比与配置方法见 docs/backends/overview.zh.md 和 docs/voice-frontends/ 下的各前台指南。

场景扩展:从桌面办公到智能座舱

“前台对话 + 后台任务”的设计远不止桌面办公。项目内置了多个可直接参考的示例:

  • 🚗智能座舱——车控、导航、音乐、天气与生活服务的语音 Agent,完整示例见 examples/smart-cockpit/
  • 🎧语音客服——零售与航空场景的语音客服,见 examples/customer-service/
  • 👁️X-Omni 视觉对话——画面观察与解说,见 examples/x-omni/
  • 💳AI Passport——硬件卡片上的千问语音豆,见 examples/ai-passport/
  • 🤖数字人——见 examples/digital-human/

智能座舱示例展示了同一套实时语音运行时如何驱动车控、导航、音乐等技能卡片:

文档与源码导航:按需深入

想做什么去哪里看
快速上手docs/getting-started/quickstart.zh.md
理解架构docs/architecture/overview.zh.md
配置语音前台docs/configuration/frontend.zh.md
接入后台 Agentdocs/backends/overview.zh.md
桌面版玩法docs/desktop/overview.zh.md
远程接入与运维docs/operations/remote-access.zh.md
服务端核心实现server/src/(voice 语音会话、task 任务管理、backend 后台接入)

项目采用 Apache License 2.0 开源,贡献指南见 CONTRIBUTING.md,安全与隐私说明见 SECURITY.md 和 PRIVACY.md。

一句话总结:如果你想要一个不冷场、不等待、边聊边办事的 AI 语音助手,qwen-audio-agent 就是目前开源世界里最完整的实时语音运行时答案。🚀

【免费下载链接】qwen-audio-agentA realtime voice runtime that keeps Agents talking, working, and present. Real-time Voice Runtime for AI Agents项目地址: https://gitcode.com/gh_mirrors/qw/qwen-audio-agent

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表