Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD
August 29, 2026 · View on GitHub
dsh-ears
一款支持润色整理的 DeepSeek Harness 语音输入插件。
简体中文 · English
https://github.com/user-attachments/assets/1363768e-a393-44bd-a008-1ce2055cac41
dsh-ears 为 DeepSeek Harness 提供语音输入与 LLM 润色整理能力。支持浏览器 Web Speech、本地 Whisper 以及主流语音识别(ASR)API 服务。
安装
前置依赖:DeepSeek Harness(0.1.0-rc.6 至 0.1.1-rc.2)和 Node.js ^22.19.0 || >=24.0.0。
通过 npm 安装
dsh plugin --profile web add dsh-ears
从源码安装
git clone https://github.com/WizisCool/dsh-ears.git
cd dsh-ears
pnpm use:platform
pnpm install
pnpm build
dsh plugin --profile web add "$PWD"
# Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD
pnpm use:platform 将 node_modules 切换到当前平台的 native 依赖树(Windows / Linux 各自独立),首次克隆和跨平台切换后都需要运行。
安装完成后刷新 Web UI,输入框右侧会显示麦克风图标。
更新
dsh plugin --profile web add dsh-ears
add 会从 npm 拉取最新版本,任何已装版本都可以直接运行。更新后需要重启 dsh web 加载新的服务端代码,再刷新 Web UI;也可以在设置页的"关于"面板检查新版本。
卸载
dsh plugin --profile web remove dsh-ears
卸载后刷新 Web UI。
使用
- 点击麦克风图标,或按下
Ctrl+Shift+Space(可在设置页更改) - 开始说话
- 再次按下快捷键或点击麦克风,停止录音并开始转写
- 开启润色后,原始转写会先写入草稿,润色完成后再更新,期间的手动编辑会被保留
- 检查内容后手动发送
转写结果始终写入可编辑草稿,不会自动发送。如果所选后端尚未就绪,麦克风图标会变灰,悬停即可查看原因。
识别后端
| 后端 | 工作方式 | 需要什么 |
|---|---|---|
| Web Speech | 浏览器实时识别 | 默认后端;Chromium 内核浏览器 |
| 本地 Whisper | 录音结束后本地转写 | 在设置页下载 GGML 模型 |
| Groq | Groq Whisper API | API key |
| Deepgram | 预录音频或实时音频流 | API key、模型名(如 nova-3) |
| 阿里云百炼 | DashScope 同步转写 | API key、模型名;单次最长 300 秒 |
| 腾讯云 | 录音文件识别或实时语音识别 | AppID、SecretID、SecretKey、engine_type |
| 小米 MiMo | 语音识别 API,支持标准 API 或 Token Plan | API key、模型名(如 mimo-v2.5-asr);Token Plan 需选择区域集群 |
| 硅基流动 (CN) | 语音转写 API | API key、模型名(如 FunAudioLLM/SenseVoiceSmall) |
| 火山引擎 | 录音文件识别(大模型)或单向流式语音识别 | API key(新版控制台 X-Api-Key)、资源 ID |
| 自定义 OpenAI 兼容 | 发送到指定 /audio/transcriptions 端点 | 端点地址、API key、模型名 |
本地 Whisper:基于
@fugood/whisper.node本地运行 whisper.cpp,无需 Python、FFmpeg 或外部依赖。支持在设置页下载管理 GGML 模型(tiny(默认)至turbo),并可选default(自动)、vulkan或cuda加速。火山引擎:仅支持新版控制台的 API Key(
X-Api-Key)鉴权(不支持旧版 AppID + Access Token),可在控制台 API Key 管理页面获取。
润色
默认开启。提供方和模型都留空时使用 dsh 的默认 Agent 模型(包括默认推理设置);也可以从 dsh 已配置的模型中选择。LLM 凭据复用 dsh 现有配置。支持设置推理强度。
默认提示词会删除口头禅、修正 ASR 错字、处理自我纠正和口头列举。可在设置页自定义提示词或查看默认内容。润色失败或取消时保留原始转写。
设置
安装后在 Web UI 的设置页出现 dsh-ears 面板,分为四个标签页:
| 标签页 | 可配置项 |
|---|---|
| 常规 | 设置页显示名称、语音快捷键开关与组合键、提示音开关、最长录音时间(1–600 秒,默认 120 秒) |
| 识别 | 后端选择、语言、本地 Whisper 模型和加速方式、云服务提供方及各提供方凭据 |
| 润色 | 开关、LLM 提供方和模型、推理强度、自定义提示词(最长 4000 字) |
| 关于 | 版本号、许可证、dsh 兼容范围、检查更新 |
已知限制
- Web Speech 后端依赖浏览器实现,音频可能被发送到浏览器厂商的服务端处理,不是完全的本地/离线方案。
- 百炼单次录音最长 300 秒。
- Deepgram Flux 系列模型需要 Listen V2 协议,当前不支持。
- 本地 Whisper 单次音频限制 24 MB,转写超时 120 秒。
- 加速方式(
default/vulkan/cuda)在首次 native 加载后锁定,切换需重启dsh web。
本地开发
pnpm use:platform
pnpm install
dsh plugin --profile web add "$PWD"
# Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD
pnpm check # 类型检查
pnpm test # 运行测试
pnpm build # 构建
pnpm dev:config # 构建并生成 HMR 配置
pnpm dev:web # 启动 dsh web
开发时在另一个终端运行 pnpm dev:watch 实时重编译。
修改前端 UI 代码只需刷新浏览器;修改服务端、设置注册、Remote 或 schema 代码需重启 dsh web 再刷新。
文档
License
友链
- LINUX DO — 新的理想型社区