快速结论
FunASR 是 ModelScope 组织维护的端到端语音识别工具箱,规范仓库为 modelscope/FunASR,官方文档为 modelscope.github.io/FunASR。它不是一个固定模型,而是把模型加载、训练/微调、离线识别、流式 WebSocket、VAD、标点恢复、说话人组件、OpenAI 兼容服务和边缘运行时放在统一项目中。中文会议、客服录音、字幕与实时转写是它的强项,但不同任务必须选择不同 checkpoint,不能把整个工具箱的能力都归给单个模型。
截至 2026-07-20,仓库仍活跃,PyPI 最新动态已到 1.3.22。官方模型选择包括面向中英日与中文方言的 Fun-ASR-Nano、独立的 31 语种 MLT-Nano、带五语种识别及情感/音频事件标签的 SenseVoiceSmall,以及支持低延迟流式中文识别的 Paraformer。它适合愿意自托管并建立录音合规流程的团队;若只想购买稳定 SLA、无需维护模型和服务,云 ASR 往往更省事。
核心功能
- 中文与多语种 ASR:Paraformer 面向中英识别及流式场景;Fun-ASR-Nano 覆盖中英日与中文方言,MLT-Nano 是单独的 31 语种 checkpoint,不能混写为同一个模型。
- 离线与实时流式:批量文件可走 CLI 或 Python;Paraformer streaming 和 Nano 实时服务可通过 WebSocket 接收音频块并持续返回结果。
- 组合式长音频流水线:
AutoModel可组合 FSMN-VAD、CT-Transformer 标点和 CAM++ 说话人模型,生成分段、时间戳和 speaker id;说话人能力来自独立组件,不是 SenseVoice 本体自带。 - SenseVoice 扩展标签:除五语种 ASR 外,可识别情感和笑声、掌声等音频事件;这些标签适合检索和辅助分析,不应自动用于人事、信贷或医疗决策。
- 热词与领域适配:Paraformer contextual 可增强产品名和行业词召回,但热词权重过高也可能制造误识别,需用真实业务集评测。
- 服务与 Agent 接入:
funasr-server可暴露 OpenAI 兼容转写端点,项目也提供 MCP 示例,便于接入 Dify、LangChain 等应用。 - 边缘运行时:官方提供 llama.cpp/GGUF 路径和预编译 CPU 包,可让 SenseVoice、Paraformer 或 Nano 在无 Python 环境运行;硬件兼容和量化质量仍要验收。
适合人群
- 需要中文会议、课堂、媒体或客服录音私有转写,并能维护 Python、模型缓存和 API 服务的工程团队。
- 对延迟有要求、希望使用流式识别和打断处理的字幕、会议或语音助手产品。
- 要在 CPU、边缘设备或隔离网络部署,不能把敏感录音发送给第三方云服务的组织。
- 需要 VAD、标点、说话人分段、热词和 ASR 组成可替换流水线的研究者。
如果需求只是个人会议整理,可比较 Otter AI;如果需要从文本生成语音而非识别音频,应看 GPT-SoVITS 或 CosyVoice。
使用场景
长录音转写可用 VAD 先分段,再调用 Paraformer 或 SenseVoice,随后加标点、时间戳和 CAM++ speaker id。客服实时质检可使用流式端点,但最终文本必须保留置信度、原始时间位置和人工复核入口,不能让 ASR 猜测直接触发退款、封号或高风险结论。行业热词应在独立测试集上比较召回和误报,而不是只看官方样例。
录音与声纹相关数据通常具有较高敏感性。采集前应确认有权处理录音或其他媒体,并明确告知转写、说话人区分、保留期限、共享对象和模型改进用途,再按所有参与者所在司法辖区核对通话录音的一方或全体同意要求。FunASR 本身只识别而不合成声音或头像,普通转写不必被夸大标成“合成媒体”;但在准确性或说话人归属可能被误解时,应说明文本由 AI 转写且未经或已经人工校对。不得篡改转写或滥用 speaker id 实施未经授权的身份利用、冒充、欺诈或骚扰。面向客服或语音 Agent 时,应在开场披露 AI 与录音事实,允许用户拒绝录音或转人工;身份认证、医疗建议、法律承诺和付款操作必须由独立验证或人工处理。
价格与版本
FunASR 仓库代码采用 MIT 许可证,软件本身不收订阅费。成本主要是 GPU/CPU、存储、监控、标注、人工校正和生产安全。Fun-ASR-Nano 配合 vLLM 更偏 GPU 高吞吐;SenseVoiceSmall 可在 CPU 场景使用;Paraformer streaming 适合实时中文;GGUF 路径降低运行依赖但会引入量化与硬件差异。
代码许可证与模型许可证必须分开。官方 README 明确指出,预训练权重按各自模型卡授权;有的链接到 FunASR Model Open Source License Agreement 1.1,要求注明来源、作者并保留模型名称,其他第三方模型可能采用不同条款。不能因为加载器是 MIT,就认定 Qwen3-ASR、SenseVoice、Paraformer、社区微调权重及其训练数据都可按 MIT 商用。上线时应建立 checkpoint 清单,记录来源、哈希、模型卡、许可版本与允许用途。
国内访问与使用体验
PyPI 可直接安装 funasr,模型可从 ModelScope 获取,国内下载体验通常优于只依赖 Hugging Face 的项目。快速原型可以从 AutoModel 开始;生产服务则应固定包版本、权重和设备配置,避免自动更新改变输出。官方提供 OpenAI 兼容 API、流式服务、Docker runtime、MCP 示例与 llama.cpp/GGUF 运行时,但不同路径的特性并不完全相同。
服务端应限制音频大小、时长、编码和采样率,隔离解码进程,保护 API token,并对录音和转写加密。不要把默认服务无认证暴露公网,也不要在日志中长期保存完整音频、转写文本或供应商密钥。对于多租户,应分离存储、缓存、向量索引和审计记录,并设置可执行的删除策略。
优点
- 中文离线和流式识别选择丰富,模型与运行时可按 GPU、CPU、边缘场景组合。
- VAD、标点、说话人、热词和长音频流程集中在同一工具箱,集成成本低于手工拼接多个项目。
- OpenAI 兼容服务、CLI、Python、WebSocket、MCP 和 GGUF 路径覆盖从试验到部署的多种入口。
- ModelScope 国内分发方便,适合私有化和隔离网络场景。
- 代码 MIT 且仓库持续维护,工程问题和版本状态相对可核验。
不足
- 模型很多,语言、延迟、硬件与附加能力均为 checkpoint-specific,初次选型容易把工具箱能力误认为单模型能力。
- 高吞吐 Nano/vLLM 方案需要合适 GPU;边缘量化方案则必须重新评估准确率和兼容性。
- 说话人分段、情感和音频事件标签都可能出错,不适合未经人工复核的高风险自动决策。
- MIT 只覆盖仓库代码,具体权重许可证不同,模型资产治理工作不可省略。
- 自托管不会自动提供同意管理、数据删除、租户隔离、监控、容灾和合规证明。
替代品对比
| 工具 | 更适合什么 | 主要差异 |
|---|---|---|
| Otter AI | 个人和团队会议记录 | 托管产品,上手快但数据与功能受平台控制 |
| MLX Audio | Apple silicon 本地音频模型实验 | 更偏 MLX 设备生态,不是同样完整的工业 ASR 工具箱 |
| GPT-SoVITS | 少样本语音合成 | 做 TTS/克隆,不是 speech-to-text |
| CosyVoice | 多语种语音生成 | 重点是生成语音而非转写和说话人流水线 |
| ElevenLabs | 托管语音 API 与生成 | 云服务运维少,但成本、数据驻留和能力边界不同 |
常见问题 FAQ
FunASR 是一个模型吗?
不是。它是工具箱和运行时,能够加载多种 ASR、VAD、标点、说话人及其他音频模型。选型和许可证都应落实到具体 checkpoint。
Fun-ASR-Nano 是否支持 31 种语言?
标准 Nano 主要覆盖中英日、中文方言和地区口音;31 语种对应独立的 Fun-ASR-MLT-Nano checkpoint。部署文档和测试报告应写清实际模型 ID。
SenseVoice 是否自带说话人分离?
SenseVoiceSmall 本身提供 ASR、情感与音频事件能力。官方示例通过额外配置 FSMN-VAD 和 CAM++ 组成说话人流水线,不能把 CAM++ 能力归给 SenseVoice checkpoint。
MIT 是否覆盖所有模型权重?
不覆盖。MIT 适用于 FunASR 仓库代码。每个权重按其模型卡授权,部分使用 FunASR 模型协议,第三方模型可能另有条款。
能否直接用说话人标签做身份认证?
不应这样做。diarization 的 speaker id 用于区分片段,不等于经过验证的真实身份。账户操作必须采用独立、多因素认证,并为异常情况提供人工处理。
如何处理客服录音合规?
在录音前披露 AI、录音和用途,确认所有适用司法辖区的同意要求,提供拒绝与转人工方式,限制保留与访问,并让用户可以查询、更正或删除数据。
总结
FunASR 的价值在于“工具箱”而不是某个宣传数字:团队可以按中文离线、实时流式、CPU、GPU、边缘和附加分析能力选择模型与部署方式。采用前先用真实业务音频做准确率、延迟、并发和错误类型验收,再逐个核对权重许可。把录音同意、身份披露、加密、租户隔离、删除和人工复核补齐后,它才适合作为长期维护的私有 ASR 基础设施。