Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD

August 29, 2026 · View on GitHub

dsh-ears

dsh-ears

一款支持润色整理的 DeepSeek Harness 语音输入插件。

简体中文 · English

dsh 0.1.0-rc.6 - 0.1.1-rc.2 npm version npm downloads MIT

https://github.com/user-attachments/assets/1363768e-a393-44bd-a008-1ce2055cac41


dsh-ears 为 DeepSeek Harness 提供语音输入与 LLM 润色整理能力。支持浏览器 Web Speech、本地 Whisper 以及主流语音识别(ASR)API 服务。

安装

前置依赖:DeepSeek Harness0.1.0-rc.60.1.1-rc.2)和 Node.js ^22.19.0 || >=24.0.0

通过 npm 安装

dsh plugin --profile web add dsh-ears

从源码安装

git clone https://github.com/WizisCool/dsh-ears.git
cd dsh-ears
pnpm use:platform
pnpm install
pnpm build
dsh plugin --profile web add "$PWD"
# Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD

pnpm use:platformnode_modules 切换到当前平台的 native 依赖树(Windows / Linux 各自独立),首次克隆和跨平台切换后都需要运行。

安装完成后刷新 Web UI,输入框右侧会显示麦克风图标。

更新

dsh plugin --profile web add dsh-ears

add 会从 npm 拉取最新版本,任何已装版本都可以直接运行。更新后需要重启 dsh web 加载新的服务端代码,再刷新 Web UI;也可以在设置页的"关于"面板检查新版本。

卸载

dsh plugin --profile web remove dsh-ears

卸载后刷新 Web UI。

使用

  1. 点击麦克风图标,或按下 Ctrl+Shift+Space(可在设置页更改)
  2. 开始说话
  3. 再次按下快捷键或点击麦克风,停止录音并开始转写
  4. 开启润色后,原始转写会先写入草稿,润色完成后再更新,期间的手动编辑会被保留
  5. 检查内容后手动发送

转写结果始终写入可编辑草稿,不会自动发送。如果所选后端尚未就绪,麦克风图标会变灰,悬停即可查看原因。

识别后端

后端工作方式需要什么
Web Speech浏览器实时识别默认后端;Chromium 内核浏览器
本地 Whisper录音结束后本地转写在设置页下载 GGML 模型
GroqGroq Whisper APIAPI key
Deepgram预录音频实时音频流API key、模型名(如 nova-3
阿里云百炼DashScope 同步转写API key、模型名;单次最长 300 秒
腾讯云录音文件识别实时语音识别AppID、SecretID、SecretKey、engine_type
小米 MiMo语音识别 API,支持标准 API 或 Token PlanAPI key、模型名(如 mimo-v2.5-asr);Token Plan 需选择区域集群
硅基流动 (CN)语音转写 APIAPI key、模型名(如 FunAudioLLM/SenseVoiceSmall
火山引擎录音文件识别(大模型)单向流式语音识别API key(新版控制台 X-Api-Key)、资源 ID
自定义 OpenAI 兼容发送到指定 /audio/transcriptions 端点端点地址、API key、模型名

本地 Whisper:基于 @fugood/whisper.node 本地运行 whisper.cpp,无需 Python、FFmpeg 或外部依赖。支持在设置页下载管理 GGML 模型(tiny(默认)至 turbo),并可选 default(自动)、vulkancuda 加速。

火山引擎:仅支持新版控制台的 API Key(X-Api-Key)鉴权(不支持旧版 AppID + Access Token),可在控制台 API Key 管理页面获取。

润色

默认开启。提供方和模型都留空时使用 dsh 的默认 Agent 模型(包括默认推理设置);也可以从 dsh 已配置的模型中选择。LLM 凭据复用 dsh 现有配置。支持设置推理强度。

默认提示词会删除口头禅、修正 ASR 错字、处理自我纠正和口头列举。可在设置页自定义提示词或查看默认内容。润色失败或取消时保留原始转写。

设置

安装后在 Web UI 的设置页出现 dsh-ears 面板,分为四个标签页:

标签页可配置项
常规设置页显示名称、语音快捷键开关与组合键、提示音开关、最长录音时间(1–600 秒,默认 120 秒)
识别后端选择、语言、本地 Whisper 模型和加速方式、云服务提供方及各提供方凭据
润色开关、LLM 提供方和模型、推理强度、自定义提示词(最长 4000 字)
关于版本号、许可证、dsh 兼容范围、检查更新

已知限制

  • Web Speech 后端依赖浏览器实现,音频可能被发送到浏览器厂商的服务端处理,不是完全的本地/离线方案。
  • 百炼单次录音最长 300 秒。
  • Deepgram Flux 系列模型需要 Listen V2 协议,当前不支持。
  • 本地 Whisper 单次音频限制 24 MB,转写超时 120 秒。
  • 加速方式(default / vulkan / cuda)在首次 native 加载后锁定,切换需重启 dsh web

本地开发

pnpm use:platform
pnpm install
dsh plugin --profile web add "$PWD"
# Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD
pnpm check          # 类型检查
pnpm test           # 运行测试
pnpm build          # 构建
pnpm dev:config     # 构建并生成 HMR 配置
pnpm dev:web        # 启动 dsh web

开发时在另一个终端运行 pnpm dev:watch 实时重编译。

修改前端 UI 代码只需刷新浏览器;修改服务端、设置注册、Remote 或 schema 代码需重启 dsh web 再刷新。

文档

License

MIT

友链