MCP

让 MCP 客户端使用本机转录与播报。

已可用——edgespeak-cli 通过 stdio 提供 9 个 MCP 工具,桌面 App 未运行时也能使用;App 运行时,本地网关还通过 HTTP 提供同一组工具。

接入

任何支持 stdio 服务器的 MCP 客户端都能接。先安装并激活 edgespeak-cli,然后注册 EdgeSpeak——以 Claude Code 为例:

claude mcp add edgespeak -- edgespeak-cli mcp

通道

推荐 stdio:App 开着就经本地网关复用已加载的模型,没开就自行拉起随附的本地引擎,并按需下载缺失模型。HTTP /mcp 是 App 运行时的备选通道,使用与网关相同的 Bearer key。

edgespeak-cli mcp                   # stdio
POST http://127.0.0.1:1117/mcp      # HTTP(桌面 App 运行时)

工具

共 9 个工具:6 个只读;声音创建、删除与播报只修改受管理的本机文件。产品能力称“播报”,工具标识继续使用开发者契约中的 speech。

edgespeak_transcribe_file    必填: path(绝对路径)
                             可选: model, timestamps (none|word|segment),
                                   min_chars, max_chars, start_margin, end_margin

edgespeak_transcribe         必填: audio_base64(解码后 ≤ 50MB)
                             可选: 同 transcribe_file

edgespeak_align              必填: text + path | audio_base64 二选一
                             可选: protected_terms

edgespeak_segment_sentences  必填: text 或 segments[]
                             可选: threshold (默认 0.35), min_chars, max_chars,
                                   start_margin, end_margin

edgespeak_list_models        无参数 → {models: [{id, owned_by, locality}]}

edgespeak_list_voices        无参数 → {voices: [...]}

edgespeak_add_voice          必填: audio_path(绝对路径)、ref_text、name、
                                   consent=true
                             可选: language、speaker_description

edgespeak_delete_voice       必填: voice_id(user:<uuid>)
                             不允许删除内置声音

edgespeak_generate_speech    必填: model、input、voice
                             模型: omnivoice、voxcpm2、qwen3-tts-0.6b-base、
                                   qwen3-tts-1.7b-voice-design
                             可选: instructions、style_instruction、speed、language、seed、
                                   guidance_scale、inference_steps、retry_badcase
                             qwen3-tts-1.7b-voice-design 必须传 instructions,
                             并使用 voice=builtin:auto
                             输出: 受管理的本机 WAV artifact

结果

文本结果在 2000 字符内直接内联;超长输出落盘为本地 artifact 并保留内联预览。播报始终返回受管理的本机 WAV artifact 路径与生成诊断。

≤ 2000 字符  →  { "metadata": …, "result": …, "truncated": false }
> 2000 字符  →  { "metadata": …, "preview": { "head": …, "tail": … },
                  "artifact_path": …, "artifact_json_path": …, "truncated": true }
播报           →  { "artifact_path": …, "format": "wav", "sample_rate": …,
                  "duration": …, "seed_used": …, "warnings": […] }

隐私

与其它能力遵循同一条本地优先规则:源音频、克隆声音、生成的播报音频与转录稿都留在本机,绝不上传。