语音
EvoX 当前确认的语音能力分为两类:输入框语音听写,以及由 speech-generation 插件提供的语音生成、声音克隆和音频转写。它不是实时双向语音通话。
使用语音听写
在消息输入框选择麦克风并开始说话。识别结果会先变成可编辑文本;发送前可以修改专有名词、数字、文件名和标点,再补充附件或任务边界。
听写需要操作系统麦克风权限。没有反应时,检查系统隐私设置、输入设备和 EvoX 当前选择的麦克风。
使用语音插件
内置 speech-generation 插件默认关闭。启用时先选择并配置支持的供应商;音频外发、声音克隆和可能产生费用的调用会保留明确确认。
| 工具 | 作用 |
|---|---|
list_voices | 查看供应商音色和本地已登记音色。 |
preview_voice | 生成短试听文件。 |
synthesize_speech | 把文字生成完整音频。 |
clone_voice | 使用参考录音和同意证据创建可复用音色。 |
forget_voice | 从本地注册表移除音色,并区分是否支持远端删除。 |
transcribe_audio | 将音频转成 SRT 或纯文本;默认可使用本地 whisper.cpp。 |
生成的音频保存在任务产物目录,转写稿保存在转写产物目录。插件不接受任意输出目录。
声音克隆和录音安全
只克隆用户本人声音或已获得明确授权的声音。供应商要求的同意录音必须由用户真实朗读,EvoX 不能替用户生成或勾选权利声明。
本地转写不外发录音;显式选择远程供应商时,确认卡应说明上传到哪家服务。插件不包含实时变声、实时语音对话或通话音频编辑。
EvoX 文档 · 功能 · 能力