我在本地部署了一个ASR模型和TTS模型,效果还行

最近一直在开发“林羽凡笔记”的多Agent协作系统,在语音Agent中用到了第三方平台的ASR和TTS。

这个是要花钱的,我在想能不能本地也部署一个,就可以随时使用ASR和TTS了。

大概搜了几个,最终选择了faster-whisper和moss-tts。

faster-whisper的语音识别速度可以,就是准确度差点意思。

moss-tts可以学习指定的声音,使用指定声音合成语音。

# 一、安装基础环境

这里我安装了最新的Nvidia cuda 13.3的版本,但faster-whisper要求是12的版本,后面我又降了版本。

图片

按着安装了一个多媒体处理组件(非常出名的FFMPEG),后续可以对音频进行本地处理。

图片

# 二、测试效果

### 1、faster-whisper语音识别

图片

faster-whisper的语音识别还行,我把昨天录的一个视频的音频识别了下,基本上还行。有一些专业词识别不怎么准确,其他的还行。

网页版的基本上也没有问题。

图片

图片

### 2、MOSS-TTS-Nano

这个不要看模型小,但是对我的声音克隆非常强,感觉基本上不输一些大模型的能力。

图片

实测非常nice,我想想看怎么接入到“林羽凡笔记”系统中。

评论列表 (1)

花非花 发表于 2026-06-22 15:28:17
TTS用来配音怎么样?之前给公司做广告审核片,用TTS配音,多少还有点机器味
林羽凡: 我用的这个还可以,把自己的声音录一个,就能克隆一个差不多的 2026-06-22 16:08:41
花非花: 那不行,用TTS配音就是不想自己的声纹泄漏啊 2026-06-22 16:13:11
林羽凡: 用别人的会有侵权风险,实在不行用你们老板的 2026-06-22 16:14:44
花非花: 哈哈,这操作666啊 2026-06-22 16:16:44
林羽凡: 把你们老板群里发语音导出来克隆,也不用怕老板告公司 2026-06-22 16:18:44
花非花: 有想法,还真的可以克隆一份备用啊 2026-06-22 16:20:23
林羽凡: 你搜下MOSS-TTS-Nano的部署教程,安装python3就可以,几步命令就搞定了,随便一个电脑都能运行,好像是4G内存就可以 2026-06-22 16:22:07
花非花: 收到,我来学习一下;有AI动漫生成的模型吗?对配置要求不高的 2026-06-22 16:25:04
林羽凡: 你看下Ideogram4,我前几天注意的,我没部署过 2026-06-22 16:26:39
花非花: 这是文生图啊?动画的试过没? 2026-06-22 16:31:29
林羽凡: 动画的没太关注过,你让ai给你推荐个 2026-06-22 16:34:08
花非花: 哈哈,这属于套娃了 2026-06-22 16:36:18
林羽凡: 你访问这个地址:https://www.linyufan.com/post/5865 2026-06-22 16:41:14