使用说明
三步上手
- 粘贴或导入文本:中间编辑框直接粘贴要朗读的内容,或点“导入文件”读入 txt/md(自动识别 UTF-8 / GBK 编码)。
- 选择标记方式:
· 不懂标记语法?保持下方“自动添加朗读标记”勾选,点生成后会先由 AI 分析文本、自动加上角色与情绪标记(转换后的文本会回填到编辑框,你可以再手改);
· 已有带标记的稿件:直接粘贴,系统检测到标记会跳过自动标注;
· 取消勾选:完全不做标注,按原文本与默认音色朗读(最省 token、最快)。
- 点“生成语音”:下方进度区实时显示每段(分块)的合成状态与耗时;完成后可在线试听、下载 WAV。长文本会自动分句分块逐段合成再拼接成一个完整音频文件。
标记语法(想让 AI 以外的自己人写稿时用)
每条指令独占一行,“@”开头的是声明,方括号开头的是正文行的指令:
@voice 旁白=Enceladus
@voice 侦探=Charon
@style 雨夜悬疑氛围,节奏沉稳
[speaker=旁白|emotion=低沉压抑,语速缓慢]雨下了整整三天。
[speaker=侦探|emotion=不耐烦]别铺垫了,说重点。
[speaker=侦探|emotion=惊讶]什么?这不可能![gasps]
@voice 名字=音色:声明说话人,写 2 个以上即进入多角色模式;音色见左侧下拉框(Kore 坚定、Puck 欢快、Enceladus 气声、Charon 资讯感……)。
@style 描述(可选):全局风格,如“讲给小朋友听的语气”。
- 行首
[speaker=角色|emotion=情绪]:控制这一句由谁、用什么情绪读。emotion 用具体可演的中文描述(“低沉压抑,语速缓慢”),避免“正常”“复杂”这类抽象词。
- 单角色时只写
[emotion=情绪],也可整篇不写(用默认音色平稳朗读)。
- 夹在正文里的英文方括号标签是 Gemini 官方音频标签(
[laughs] [sighs] [whispers] [gasps]…),会被原样传给模型,建议整篇不超过 3 处。
设置区说明
- API Key:留空即使用服务器/本机配置的 Key 池(自动轮询、限频自动换、无效自动剔除,可在下方“Key 池”行点击展开管理);临时填写的 Key 只在内存用、不落盘。
- 模型:默认 Gemini 3.1 Flash TTS(预览);也可切 2.5 Flash TTS 或手动输入模型 ID。
- 代理:仅国内直连 Google 时需要(如 Clash 的
http://127.0.0.1:7897)。此设置会记住在本浏览器,服务器上留空即可。
- 默认音色:文本未指定角色时使用的音色。
- 语速:0.50×~2.00×。试听会立刻按该速度播放,点“下载 WAV”按同一速度做变速不变调(音高不变)导出,文件名带
-1.25x 后缀;想拿原始速度的文件点“下载原始(不变速)”。改语速不需要重新生成,也不消耗 API 额度。
进度与历史
- 合成中可点“刷新试听”听已完成的部分,不必等整篇跑完。
- 两个播放器都可拖动进度条跳转(服务端已支持分片请求,拖动会即时定位而不会回到开头)。
- 中途失败(限频/网络)不必从头再来:错误框里点“从断点继续”,已完成的分块会保留复用。
- 所有任务记录在“历史任务”里(默认收起),可试听中断任务已生成的部分、下载产物、或删除任务(连同其音频与缓存一并清除)。
常见问题
- 报 429 / 一直“换 Key 重试”:免费层每个 Key 的每分钟与每天调用数都很有限。多备几个 Key,或换时间再跑;长文本建议分几天生成。
- 多角色听起来音色不对:官方模型偶发不严格遵循指定音色,可换音色或调低文本与音色的反差(例如别用低沉男声读少女台词)。
- 长文本质量下降:已按每块 ≤180 字切分;若某段效果差,把该段单独拆出来重新生成即可。