支持声纹注册,支持多用户数据隔离,支持区分说话人,支持语音转文字,支持自定义热词。音频数据不外传,不需要联网,本地跑模型,不会泄露数据,更加安全可靠可控,有源码,可以二次开发。适合部署到三大操作系统中,包括国产操作系统,同时支持使用CUDA加速模型推理,也可以单纯使用CPU。管理员才可以注册声纹,比如把张三的声纹注册到系统中,系统会计算张三的声纹特征值向量值,并将此保存到数据库中,之后用户提交会议录音到系统中的时候,可以识别哪些话是张三讲的,如果遇到没有注册的声纹,就会打上spk标识。https://www.bilibili.com/video/BV1q8DtBPEX1
这是今年新增的功能,支持通过音频URL方式注册声纹。也就是有两种方式,一种是通过上传音频文件方式,另外一种是通过音频URL方式。两种都要求这个音频时长不宜超过30秒,最好是10秒左右。这是通过使用阿里开源的cam++来计算注册的声纹特征值向量,然后持久化到数据库中,之后就遍历数据库中已有的声纹进行声纹对比,当达到设定的阈值时就认为是这个人,就打上这个人的标签。这个功能也是只能有管理员操作,管理员可以对已注册的声纹进行删除操作。非管理员是不会显示这个按钮的。这里补充一点,一定要通过nginx访问,不是直接访问python起的接口,前后端是分离开来的,当然我开发了几个版本,有四个版本,我这里主要讲的是main版本。我也有单纯api接口版本,不过这里讲的是main版本。api接口版本是没有前端图形界面的,单纯开发的接口,适合公司对接,需要你会写前端代码。这里再次提醒,一定要配置好nginx.conf,然后启动nginx,通过nginx访问前端页面。nginx.conf的配置如下所示。启动之后访问你本地的ip地址加上80端口,当然我这里没有使用ssl证书,你也可以配置上,如果你需要的话。你一定要记得,这个80端口不能被其它程序占用了,然后被占用了就需要你替换为其它的端口好,或者把占用这个端口的程序进程结束掉。然后就可以登录了,这里先用管理员用户登录,给你看看管理员和非管理员登录系统之后显示内容的不同。上面图是以管理员身份登录的系统,管理可以做声纹注册,声纹信息管理,声纹识别,用户管理,查看自己的转写记录。注意即使是管理员身份登录也只能查看自己的转写历史记录,不能随意查看他人的转写记录。是每个用户数据都隔离的,即使是管理员也不例外。下面图片是非管理员身份登录的,这里我注册了一个lukeewin的用户,登录进去之后是下面这样的。非管理员是不能注册声纹的,只能进行声纹识别,也就是上传会议录音进行转写,可以查看自己转写过的记录。同时也可以对记录进行修正。可以全局修正,也可以只修改一个地方。具体功能接下来会详细讲解。注册的声纹信息都会保存到这里显示出来,如果不需要了你可以删除它,当然前提是你是管理员身份登录。比如这里注册了一个声纹进来,并且打上了标签名为“迪丽热巴”。如果你不需要这个声纹了,就可以删除它。声纹识别功能包括了ASR功能。就是不单可以语音转写为文字,同时还会进行声纹识别,识别这个人在那段时间段讲的这些文字。可以上传会议录音文件,也可以填写音频URL地址。并且支持指定行业热词,提升ASR识别的准确率。注意每个热词之间通过"|"分隔开。比如下面这样。底层使用的模型是阿里开源的seaco-paraformer热词模型,可以在服务端加载热词,也可以像上图中一样在客户端(前端)定义热词。当然热词的数量你们可能会问有没有限制,原则上是无限制的,但是funasr官方社区人员也告诉我了,不宜定义过多的热词,不宜超过1000个,如果是服务端加载热词,要把热词写到一个hotwords.txt的文件中,并且每个热词写一行,这个与前端不一样。而声纹识别功能用的也是阿里开源的模型,用的是cam++模型。原理是这样的,先经过cam++识别输出带spk标签的内容,然后和已经注册的声纹进行声纹对比,当大于某个设定的阈值时说明就是这个已经注册声纹的标签,比如前面写到的“迪丽热巴”。该功能只有管理员可以使用,非管理登录是不会显示的。管理也可以对注册的用户进行管理,比如可以删除,还可以授权允许登录。新用户可以自己注册账号,但是一定要经过管理员的授权才可以登录进系统。当然这个root也就是管理员是不能不允许登录的,也不能删除的。后台接口不允许删除管理员账号的。如果能被删除,那就没有人可以管理这个系统了。每个用户都可以看到自己的转写历史记录,并且可以对其进行修正。每个用户的数据是隔离的,管理员都不可以随意查看别人的转写记录,这样更加保护每个用户的隐私性。同时我们还可以看到有一个下载的按钮,可以点击下载下来。下载保存的格式是txt格式文件,如下图所示。同时还支持修改,如果发现识别的说话人不正确,可以人工进行修改,可以全局修改,也可以单个修改。此外,修改讲话的文字内容也是可以的。点击右侧的“编辑”按钮就会弹出模态框,如下截图所示。这个会议转写记录系统是我基于阿里开源的几个模型实现的可以在本地私有化部署,无需联网,包括部署过程也不需要联网(不过最好部署过程还是给一下网络方便些,回想自己在2023年在银行纯内网环境部署openai whisper和FunASR的经历,我就害怕无网络情况下部署了,太麻烦了。)项目的底层核心基于FunASR依赖库,使用到了seaco-paraformer,cam++等模型。这个项目我记得是2025年开始开发,后面不断进行更新迭代。后面我打算对接本地或者线上大模型就行会议内容的总结分析,进一步优化这个基于AI的会议记录转写系统。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询