FunASR 社区集成

July 24, 2026 · View on GitHub

English | 简体中文

FunASR 社区集成

本页收录已经在上游项目中落地、仍在维护的 FunASR、Fun-ASR-Nano、SenseVoice 或其他官方 FunASR 模型集成。下面每一项都已对照项目默认分支核验;如有对应的已合并 PR,文中也提供了链接。

这些集成由社区项目维护,其发布节奏、硬件支持和 API 稳定性由上游项目决定,不属于 FunASR 维护者的兼容性承诺。

语音 Agent 与应用

项目已集成能力从这里开始
recording-inbox面向飞书/Lark 录音归档的自托管工作流,在 macOS 或 Windows 本地运行 SenseVoiceSmall,再把结构化会议纪要和带时间戳全文发布回飞书。可恢复流水线已用于多小时录音,并有真实纯 CPU 推理验证和跨平台 mocked CI。项目指南macOS 安装 和 FunASR showcase #3294
Pipecat面向语音和多模态 Agent pipeline 的本地 FunASRSTTService,底层使用 SenseVoice,并提供转写与语音 Agent 示例。FunASR 服务文档转写示例语音 Agent 示例 和已合并 #4844
xiaozhi-esp32-server默认本地 ASR provider 使用 FunASR + SenseVoiceSmall;识别语种可设为 autozhenjakoyue,同时也提供独立 FunASR runtime server provider。Provider 实现配置 和已合并 #3255
AutoSubs面向 DaVinci Resolve、Premiere 和 After Effects 字幕生成的端侧 int8 ONNX SenseVoice 引擎。SenseVoice 模型说明引擎源码 和已合并 #629
TMSpeechWindows 会议字幕与翻译工具,可通过外部命令识别器运行 Fun-ASR-Nano INT8。Silero VAD 先完成语音段切分再调用 Nano 解码,同时保留原有低成本 C# 流式识别器。Fun-ASR-Nano 配置识别器源码 和已合并 #110
妙幕 / SmartSub跨平台本地转写、字幕翻译、配音与视频导出桌面应用。其离线 FunASR 引擎通过内置 sherpa-onnx 运行 SenseVoice 和 Paraformer,并提供应用内模型下载与文件夹导入。项目 READMEFunASR 资源面板 和已合并的下载恢复引导 #392
clowder-ai本地 AI 服务启动器;whisper-stt 服务位现在包含 Qwen3-ASR 作为 backend model variant,让本地 ASR 安装入口保持可见,同时不再新增一个独立语音服务。服务 manifest推荐矩阵 和已合并 #1083
蛐蛐 / QuQu中文桌面语音转文字工作流,也是 Wispr Flow 的开源替代方案;内置本地 FunASR Paraformer pipeline、funasr_server.py、VAD、标点恢复,并可接入 LLM 文本优化。项目 READMEFunASR serverpackage metadata
OpenLessmacOS 与 Windows 开源语音输入应用;统一 Bailian ASR provider 暴露 Fun-ASR-Flash 录音文件转写,并与实时 ASR 选项一起服务于光标听写和 AI prompt 工作流。项目 READMEDashScope multimodal ASR providerprovider settings copy 和已合并 #793
OmniVoice Studio本地语音克隆、配音、听写和有声书应用;既可通过 OpenAI 兼容远程 ASR backend 连接自托管 FunASR/SenseVoice 服务,也提供原生 FunASR/SenseVoice + CAM++ 路径,让整段录音里的 speaker identity 保持一致。OpenAI 兼容 ASR 指南FunASR backend、已合并 #1003 和已合并 #1167
GPT-SoVITS使用 Fun-ASR-Nano、SenseVoice 和经典 FunASR 模型完成数据集预处理与 WebUI 转写。funasr_asr.py、runtime fallback #2801 和 backend 文档 #2803
AudioNotes将音视频内容提取为结构化 Markdown 笔记,并把 Fun-ASR-MLT-Nano 路由到 Fun-ASR Nano 推理配置,保留 cache、batch size 和列表式 hotwords。项目 READMEFunASR 服务 和已合并 #65
StetmacOS 本地听写应用,内置 in-process Fun-ASR Nano 引擎;其 universal static runtime 源自 FunASR llama.cpp 路径,并通过 Settings 管理 encoder、decoder、VAD 下载,支持 runtime 复用和个人词典 hotwords。FunASR package 说明Fun-ASR Nano spec 和已合并 release #44
NarratoAIAI 视频解说与剪辑应用,可通过 OpenAI 兼容转写 endpoint,把字幕生成连接到自托管 FunASR 服务。FunASR 字幕服务配置示例 和已合并 #259
wyoming-faster-whisperWyoming 协议 speech-to-text server,提供可选 FunASR backend,让本地语音助手和 Home Assistant 相关部署可以通过 Wyoming 使用 SenseVoice/FunASR。FunASR handler模型注册 和已合并 #95
Dify FunASR 插件面向自托管 FunASR endpoint 的 Dify 官方 speech-to-text 模型 provider。Marketplace 0.1.1 内置 SenseVoice、Fun-ASR-Nano、Paraformer 和 Paraformer English 配置,上传上限为 25 MB。官方插件源码provider 实现、初始集成 #3281 和 0.1.1 发布更新 #3498
RAGFlowRAG 与 Agent 平台,提供本地 FunASR / SenseVoice speech-to-text provider,适合自托管文档和媒体摄取工作流;同时可通过 Tongyi-Qianwen provider 使用托管 Fun-ASR-Flash speech-to-text。Provider 注册支持模型文档、已合并 #16473 和已合并 #16844
LiveTalking实时交互数字人服务,包含本地 FunASR/SenseVoice ASR server 路径;已合并修复会串行化共享模型访问,避免并发请求在懒加载模型或 generate() 时竞争。ASR server项目 README 和已合并 #611
Sokuji实时语音翻译应用,本地推理 sidecar 支持通过 FunASR 使用 GPU-native SenseVoice,并在内置模型目录中提供离线 CPU/GPU Fun-ASR-Nano 与 Fun-ASR-MLT-Nano ASR。Sidecar 模型目录native model catalog、已合并 #268、已合并 #270 和已合并 #329
SayIt本地语音输入助手,提供 FunASR 与 SenseVoice ASR 模式;已合并的热词说明明确哪些模式支持 FunASR hotwords,帮助用户在录音前选择正确 backend。项目 READMEASR package 和已合并 #23
VocaLinuxLinux 离线语音输入应用,可通过 remote ASR engine 连接自托管 FunASR 或 SenseVoice OpenAI 兼容 endpoint。Remote ASR 指南recognition manager 和已合并 #468
VocoType-linuxLinux 桌面听写工作流,其 IBus 集成可运行 FunASR 支持的 system Python ASR runtime;已合并的验证修复让桌面输入路径可复现,不再依赖交互式 shell 环境。项目 READMEIBus engine 和已合并 #32
TranscriptionSuite本地私有 speech-to-text 桌面/server 应用,提供 SenseVoice/FunASR backend、OpenAI 兼容音频路由和 CAM++ 说话人分离支持。SenseVoice backendOpenAI audio route、已合并 #198 和已合并 #201

模型服务与 Runtime

项目已集成能力从这里开始
Xinference通过 Xinference 统一推理 API 提供 SenseVoiceSmall、Fun-ASR-Nano-2512 和 Fun-ASR-MLT-Nano-2512 内置音频模型规格。音频模型规格 和已合并 #5140 中的 FunASR 1.3 兼容性更新。
Optimum Intel通过 Hugging Face Optimum Intel 支持 Fun-ASR 模型的 OpenVINO 导出与推理,包括 FunASR 专用 modeling 代码以及 ASR、export、quantization 覆盖。FunASR OpenVINO modeling支持模型文档 和已合并 #1801
OpenVINO NotebooksOpenVINO 官方 FunASR-Nano 教程资料,包含 helper 代码和 NPU device 修复,方便用户在 Intel 加速路径上运行 notebook。FunASR-Nano notebookOpenVINO FunASR helper、已合并 #3497 和 NPU 修复 #3517
SGLang Omni面向 omni models 的 multi-stage pipeline runtime,已内置 Fun-ASR 模型支持、OpenAI 兼容服务、cookbook 文档、benchmark 任务和格式化后的 stream-output 测试。Fun-ASR cookbookFun-ASR 模型 runtime、已合并 #1078 和 review-fix 已合并 #1079
Fun-ASR-vLLM面向 Fun-ASR-Nano 和 Fun-ASR-MLT-Nano 的社区 vLLM 推理实现,包含批量评测和 NVIDIA Triton 部署。安装与 Benchmark 和已合并 #20 中的确定性 ASR 解码修复。
vad-burn纯 Rust FSMN VAD 推理与 Python binding,支持离线、流式和纯 CPU 模式。项目 README 和 FunASR showcase #3106

发现入口

项目已集成能力从这里开始
awesome-pythonSenseVoice 已收录到大型 Python 资源目录的 Speech Recognition 部分,方便 Python 开发者发现本地多语种 ASR。项目 README 和已合并 #3246
speech-tridentSenseVoice 已收录到 speech/audio language models 目录,面向语音 LLM、representation learning 和 codec model 读者。项目 README 和已合并 #31
voiceai面向 Voice AI agent builder 的资源地图,在 Speech-to-text (STT / ASR) 部分同时收录 FunASR 和 SenseVoice,帮助开发者发现自托管本地 ASR 与多语种语音理解选项。英文 README中文 README 和已合并 #16
Large-Audio-Models面向音频领域 foundation model 的资源目录,已收录 FunAudioLLM 语音理解与生成论文及 SenseVoice 代码入口,方便语音、歌声和音乐模型读者发现项目。项目 README 和已合并 #26
Neural-Codec-and-Speech-Language-Models面向 neural codec、TTS 和 speech language model 的资源目录,已同时收录 Fun-ASR-Nano 与 SenseVoice,方便对比 ASR 和语音理解模型的读者发现项目。项目 README 和已合并 #4
awesome-LLM-resources中文 LLM 资源目录,已在 STT / ASR 资源中收录 FunASR 和 SenseVoice,为多模态与语音工具读者提供另一个维护中的发现入口。项目 README 和已合并 #162

采用社区集成前

  • 按上游项目的安装和发布说明操作,不要假设其依赖版本与 FunASR main 完全一致。
  • 用计划部署的模型、语种、音频格式和硬件路径做一次真实验证。
  • 应用或 adapter 问题优先反馈给集成项目;可复现的 FunASR 核心模型或 runtime 问题反馈到 FunASR issues

收录你的项目

如果你维护了 FunASR 集成,请提交 showcase issue,并提供:

  • 仓库链接和维护状态
  • 支持的 FunASR 模型或 runtime 路径
  • 安装方式和最小使用示例
  • 已合并改动、正式发布、benchmark 或其他可复现验证
  • 官方、社区维护或实验性项目的明确说明