十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

在 AIRI 中配置小米 MiMo 语音识别(ASR/STT)转写指南

在 AIRI 中配置小米 MiMo 语音识别(ASR/STT)转写指南 在 AIRI 中配置小米 MiMo 语音识别ASR/STT转写指南【免费下载链接】airi Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-samas altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.项目地址: https://gitcode.com/GitHub_Trending/ai/airiAIRI 的「听觉」模块支持接入小米 MiMo 的原生音频理解模型完成语音转写ASR/STT。本文以 小米 MiMo 语音识别配置文档 为核心骨架结合仓库中 MiMo 转写 Provider 实现 与 设置页源码完整讲解从申请 API Key、在设置界面填写配置、通过 Ping 校验到在「听觉」中启用并实际验证转写效果的全过程并深入剖析底层调用链与可用模型帮助你快速落地可用的语音输入能力。为什么选择小米 MiMo 作为语音转写服务商AIRI 的语音转写Speech-to-Text属于可插拔的服务商体系你既可以使用本地模型也可以接入各家云端 ASR 服务。小米 MiMo 的独特之处在于——它不依赖独立的「语音识别模型」而是直接使用其原生音频理解多模态模型来完成语音转写音频作为input_audio消息直接送入 chat/completions 接口模型理解音频内容后返回文本。从仓库源码看MiMo 在 AIRI 中注册了两个独立的 Providermimo-audio-transcription负责语音转写ASR/STT注册于 mimo-audio/index.ts其能力声明为speech-to-text / automatic-speech-recognition / asr / sttmimo-audio-speech负责语音合成TTS覆盖预设音色、声音设计、声音克隆三种模式见 语音合成配置文档。因此如果你的账号已经使用 MiMo或希望利用其多模态模型直接处理音频内容选择该服务商即可让「听觉 → 转写」链路获得多模态模型的原生音频理解能力。第一步获取 API Key打开并登录小米 MiMo 平台确认账户已开通 API 使用权限MiMo 属于付费云端服务仓库中将mimo-audio-transcription标记为paidCloud类别见 attributes.ts。在平台控制台创建 API Key复制后妥善保存。仓库代码中 API Key 输入框的占位格式为mimo_...见 mimo-audio-transcription.vue可据此核对你的 Key 格式。安全提醒不要公开 API Key。使用云端转写会把待识别音频发送给服务商请先确认你的数据处理要求与隐私预期。第二步在 AIRI 中配置 MiMo 转写打开设置 → 服务商 → 语音识别 → Xiaomi MiMo填写 API Key。Base URL 保留默认值https://api.xiaomimimo.com/v1/除非服务商提供了其他地址。这两个字段在源码中都有明确约束理解它们有助于排查问题Base URL 归一化Provider 内部会通过normalizeBaseUrl去掉结尾多余的斜杠并统一补上/即使你填成https://api.xiaomimimo.com/v1也能正常工作见 mimo-audio/index.ts。配置校验器createMimoValidators会校验apiKey与baseUrl非空任一缺失都会导致校验失败mimo-audio/index.ts。只有 API Key 与 Base URL 都填写后才触发校验validationRequiredWhen。模型字段设置页的模型下拉框来自 Provider 的listModels动态加载mimo-audio-transcription.vue保存后也会持久化到配置中。第三步验证配置并启用Ping API点击此按钮测试网络是否连通以及 API Key 是否填写正确。校验通过后设置页会显示成功提示失败则会展示具体的校验错误信息并允许「仍然继续」强制保存mimo-audio-transcription.vue。选择模型测试成功后选择mimo-v2-omni或界面列出的可用模型随后到设置 → 听觉中启用该转写 Provider。实测转写允许麦克风访问并进行一段短语音输入确认文字可正常输出。设置页内置了TranscriptionPlayground转写试听组件可以直接上传音频文件验证效果mimo-audio-transcription.vue无需先走完整语音链路即可确认配置正确。可用模型一览MiMo 转写 Provider 当前注册了两个多模态模型mimo-audio/index.ts模型 ID说明上下文长度mimo-v2-omni原生音频理解 语音转写的 Omni 多模态模型默认256,000mimo-v2.5最新 Omni 多模态模型支持音频理解1,000,000默认模型由配置 schema 指定为mimo-v2-omnimimo-audio/index.ts设置页的默认值也与此一致mimo-audio-transcription.vue。底层原理MiMo 转写请求是如何构造的理解了设置界面再看底层实现会更容易排查问题。MiMo 转写 Provider 的请求构造逻辑位于 mimo-audio/index.ts其工作流程如下接收音频文件上层通过hearingStore.transcription将File对象传入Provider 要求请求体必须是FormData并从中取出file字段与模型名hearing.ts转码为 Data URIreadBlobAsDataUri将音频 Blob 读取为data:mime;base64,data形式audioFormatFromDataUri则根据 MIME 类型推断音频格式webm/mp4原样保留、mpeg/mp3归一为mp3其余回退为wav构造多模态请求以POST {baseUrl}/chat/completions发送请求请求头携带api-key消息体包含一条user消息其中同时携带textTranscribe the audio content.与input_audioBase64 音频数据 格式两类内容解析结果从响应的choices[0].message.content中取出转写文本并以 OpenAI 兼容的{ text: ... }JSON 结构返回给上层。也就是说MiMo 的转写并非传统的「专用 ASR 接口」而是把音频塞进多模态对话请求由模型直接理解并输出文本——这正是选择 MiMo 的核心价值。排查指南按文档给出的两个典型故障场景展开请求失败HTTP 错误检查 API Key 是否正确、模型是否可选、网络是否连通。底层实现会在非 2xx 响应时抛出包含状态码与响应体的错误信息MiMo transcription failed: status statusText — body可直接据此定位mimo-audio/index.ts。没有文字结果确认 AIRI 已获得系统麦克风权限。hearingStore在转写失败时会区分错误码若为permission_denied会额外上报麦克风权限被拒事件hearing.ts说明转写链路对权限问题有专门的追踪路径。未上传文件如果请求体中没有音频文件Provider 会直接抛出 No audio file provided for transcription.mimo-audio/index.ts请确认输入来源文件上传或麦克风录制已正确生成音频。延伸阅读小米 MiMo 语音合成TTS配置文档同一 Provider 的 TTS 能力含声音设计、声音克隆的完整说明MiMo Provider 源码TTS 与转写两套配置 schema、请求构造与模型清单的完整实现MiMo 转写设置页源码设置界面字段绑定、校验反馈与 Playground 的完整逻辑听觉模块 Store转写请求的编排、流式转写分支与错误码归一化逻辑Provider 定义测试验证 MiMo 相关 Provider 注册与能力声明的测试用例。【免费下载链接】airi Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to achieve Neuro-samas altitude. Capable of realtime voice chat, Minecraft, Factorio playing. Web / macOS / Windows supported.项目地址: https://gitcode.com/GitHub_Trending/ai/airi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表