9 月 21 日上架的 Qwen-Audio-3.1-TTS-Next,主打的是“一段剧本进、一整场戏出”:人声、音效、环境声在同一次生成里按时序排好。本文把半天实测的 8 笔调用整理成四步走:接口怎么调、时序怎么控、上限在哪、钱怎么算,命令与数字全部来自实际调用。
一、先说结果:四个工种收进一次调用
传统做一段有声内容是四个工种接力:配音录对白、音效翻素材库、混音调层次、剪辑拼场景。这个模型把这几道手合并了:模态是 Text+Audio 进、Audio 出,写一段剧本式提示词,成品直接是排好顺序的声景。
官方给了两种落位:语音与对话(旁白、多人对话、播客、有声书、广播剧),以及综合声音场景(给台词配雨声、海浪、游戏音效)。提示词按官方六要素写:创作任务、人物及音色、台词(加引号、注明说话人)、表达方式、背景与音效、声音变化。
先摸能力面:
bl model list--modelqwen-audio-3.1-tts-next返回里能看到 09-21 上架、按 token 计价,适用场景列了多语种语音合成、多人对话、播客、影视剧声景。要早知道的细节:它没有传统的“音色 ID”,角色音色直接写在提示词描述里。
8 笔实测的关键数字先放这儿:
- 298 字剧本出 32.08 秒三人广播剧;439 字出 69.96 秒双人播客。
- 参考音频可以自产自用:先用
bl生成音色样本,base64 回喂,用@voice1/@voice2分配台词。 - 提示词超 3000 字符立刻报错;成品超 120 秒静默截断,结尾消失但账单照收。
- 输出 token = 生成内容秒数 × 200,每秒约 0.24 分钱;4 分钟满格播客约 6 毛钱。
二、环境准备
npminstall-gbailian-cliCLI 负责外围:查目录、核账、回读。也可以走官方 skill 包让 Agent 代跑。合成要 API Key,去控制台签一个放进环境变量。
三、第一步:CLI 报 400,合成改走官方 HTTP 接口
用 CLI 自己的合成命令发请求:
bl speech synthesize--text"雨突然下大了。要伞吗?"\--modelqwen-audio-3.1-tts-next--voicelonganhuan_v3.6--formatwav--outsmoke.wav返回 HTTP 400,报错原文:text_prompt must not be empty.。原因是请求体对不上:bl speech synthesize按经典语音合成发(input.text加voice),新模型要的是input.text_prompt,也不认voice。换回老模型qwen-audio-3.0-tts-flash,同样的命令一次过。合成走官方 HTTP:
curl-sS-XPOST\"https://$WORKSPACE_ID.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/SpeechSynthesizer"\-H"Authorization: Bearer$DASHSCOPE_API_KEY"\-H"Content-Type: application/json"\-d'{ "model": "qwen-audio-3.1-tts-next", "input": { "text_prompt": "<你的剧本>", "format": "wav", "sample_rate": 48000, "channels": 2 } }'返回 JSON 里三个字段最有用:output.audio.url(成品地址,24 小时有效)、output.audio.duration(成品秒数)、usage(这一单记了多少 token)。冒烟那笔 6.6 秒成品,生成等了 41.5 秒。
四、第二步:跑三场戏,验证时序
面馆广播剧(298 字 → 32.08 秒)。三个角色(老板 55 岁、加班顾客 26 岁、骑手 23 岁)各标音色、情绪、语速,两组环境声(雨棚上的雨、后厨沸水),两个情绪转折。成品 32.08 秒,一个字约 0.11 秒;生成等了 121.6 秒。
验证靠回读:bl speech recognize直读生成的 wav,六句台词逐句对上。时间戳给出两个信息:人声第 2.7 秒进来(前面是雨声铺场),最后一句第 27.8 秒收,余下 4 秒雨声收尾。时序确实按剧本在走。
参考音频自举(37.36 秒)。做连续剧集要固定角色音色,机制是参考音频:最多三条,@voice1到@voice3引用,每条不超过 30 秒、10MB。没有现成素材,可以先用bl里的qwen-audio-3.0-tts-flash造两段音色样本,base64 塞进请求的references,提示词里分配台词。成品 37.36 秒,回读四句全对。注意:环境声写在最前面,它会先铺 18 秒环境声,人声 18.4 秒才进来,想让人声快点进来就把顺序写明。
播客(439 字 → 69.96 秒)。成品 69.96 秒(一个字约 0.16 秒),全文回读一句不缺;生成 101.6 秒,约是成品时长的 1.45 倍。长音频的生成效率更高:6.6 秒冒烟等了 41.5 秒(六倍多),70 秒这一笔压在 1.5 倍以内。
五、第三步:两个上限,第二个会静默切尾
提示词上限 3000 字符是软墙:3058 字符的脚本 0.2 秒返回text_prompt exceeds the maximum length of 3000 characters.,拦在门口。
时长上限是硬墙:469 字的独白(按 0.16 秒/字估约 75 秒)成品正好 120.0 秒顶格,最后一句没了,finish_reason却显示stop。超时长不报错、不提醒,直接切结尾,账单按 120 秒照收(约 3 毛钱)。做有声书的最容易踩。土办法:按“一个字约 0.16 秒”估时长(对话多按 0.12 到 0.15),接近 120 秒就拆段生成。
六、第四步:逐单成本核算
规律:每 1 秒生成内容记 200 个输出 token。6.6 秒记 1320、32.08 秒记 6416、69.96 秒记 13992、37.36 秒记 7472、120 秒记 24000,8 笔全部吻合。按目录价(输入 6 元、输出 12 元每百万 token)折算,每秒约 0.24 分钱:
| 成品 | 生成耗时 | 费用(约) |
|---|---|---|
| 6.6 秒(冒烟) | 41.5 秒 | 2 分钱 |
| 32 秒(面馆广播剧) | 121.6 秒 | 8 分钱 |
| 37 秒(复刻对话) | 90.2 秒 | 12 分钱 |
| 70 秒(播客) | 101.6 秒 | 17 分钱 |
| 120 秒(顶格独白) | 174.6 秒 | 30 分钱 |
一集 4 分钟满格播客约 6 毛钱;8 笔共 289 秒成品、总花费约 0.77 元。模型有单独的免费额度(90 天、每模型独立、仅北京地域),输出侧 100 万 token 约够 83 分钟成品。
核账两个经验。先记一个前提:核账这两条命令在bl帮助里标着[Console],要bl auth login --console浏览器登录,和合成、回读用的 API Key 是两拨凭证。bl usage free面板有入账延迟,逐单对账走bl log audit list --output json;语速参数不省钱,rate=1.6让成品从 9 秒缩到 5.3 秒,但计费量只从 1808 缩到 1688 个输出 token(-6.6%)。另外同一提示词两遍的 md5 不一样,满意版本马上存档。
bl log audit list--outputjson七、常见问题
Q1:bl speech synthesize报text_prompt must not be empty.?
请求体字段不匹配。CLI 按经典语音合成发input.text加voice,新模型要input.text_prompt且不认voice,改用官方 HTTP 接口(见第三步)。
Q2:怎么控制角色音色?
两条路:写进提示词描述(六要素之“人物及音色”),或用参考音频@voice1到@voice3(最多三条、每条不超过 30 秒、10MB、支持 WAV/MP3/OGG Opus)。参考音频可以先自己用bl造样本。
Q3:怎么确认台词没被吞?bl speech recognize读回成品逐句对稿;时间戳还能看人声进入时间和各句落点。
Q4:怎么提前发现 120 秒截断?
按 0.16 秒/字估成品时长(对话多按 0.12 到 0.15),接近 120 秒就拆段。截断发生在服务端,finish_reason仍显示stop,只能靠回读发现。
Q5:一次调用多少钱怎么算?
输出 token = 生成内容秒数 × 200;乘以 12 元每百万就是输出侧金额。每秒约 0.24 分钱。逐单金额用bl log audit list --output json核对。
Q6:调rate参数能省钱吗?
不能。同一段稿子rate=1.6再跑,成品从 9 秒缩到 5.3 秒,计费量只从 1808 缩到 1688 个输出 token(-6.6%)。省钱的开关是缩短内容。
Q7:同一个提示词两次结果一样吗?
不一样,md5 每次不同,固定随机种子也一样。满意的版本立即归档。
Q8:免费额度怎么算?
90 天有效、每模型独立、仅北京地域、过期不补发。输出侧 100 万 token 约够 83 分钟成品。
八、怎么选:什么时候值得上
播客和有声书的初稿最合适:一集 6 毛钱以内,哪句太长、哪个转场生硬,听一遍就暴露。游戏 NPC 台词、短剧声景的概念验证也比写需求文档直观。批量口播就是标准 HTTP 调用接进流水线。要等的部分:接话密度和情感演播与真人还有差距,精修得人耳过一遍;偶尔配一段音,控制台里的开箱即用产品可能更省事。
三场戏成品还开着:面馆广播剧、复刻对话、播客。想自己跑:官方 skill 包或npm install -g bailian-cli;合成要 Key,这里签。