语音转文字终极方案 MOSS-Transcribe-Diarize整合包分享 本地离线整合包 区分说话人带时间戳一步到位
MOSS-Transcribe-Diarize 是一个端到端语音理解模型,支持中英文语音转写、说话人区分与时间戳标注。作者提供本地离线一键整合包,内置虚拟环境、CUDA组件与FFmpeg,适配低配硬件(如i5-8400+16GB内存无独显),支持批量音视频处理及TXT/SRT/ASS等多格式导出。
MOSS-Transcribe-Diarize解决核心痛点
作者长期需要语音转文字工具:配置要求低、中文识别准确率高、带时间戳、最关键的是能区分说话人,适用于电话录音、会议纪要等场景。此前尝试FunASR、SenseVoice、Qwen-audio、Whisper等开源项目,均存在非原生说话人区分、配置门槛高、无WebUI等问题,最终放弃。

端到端一体化模型优势
2026年7月6日,MOSS开源MOSS-Transcribe-Diarize 0.9B模型,支持区分说话人、带时间戳、主打中英文。该模型为端到端一体化设计,一次推理同步完成转写、说话人区分与时序标注;相较常见方案(语音识别与说话人区分两套模型分离运行),避免了时间戳错位、发言人匹配混乱问题,在重叠发言、多人交替对话场景下稳定性更好。
功能与实测表现
官方自带WebUI界面,上传音频即可直接转文字并区分说话人,实测3人对话无误;时间戳精准对应;支持热词设置(填入专业冷门词汇可提升识别准确率);支持字幕调节并添加到视频。峰值显存占用约3GB、内存约11GB(有独显);CPU模式下,i5-8400+16GB内存无显卡可正常运行,速度可接受。

本地一键整合包特性
为降低部署门槛,作者制作本地离线一键整合包:内置完整虚拟运行环境、适配好的CUDA组件与FFmpeg工具,无需单独安装Python,断网环境下亦可使用;双击启动.BAT文件自动拉起WebUI,显卡自动启用GPU加速,无独显时可切换CPU模式;预设长音频参数,支持批量导入音视频,结果可导出TXT、SRT、ASS等多种字幕格式。

操作流程与关键设置
操作流程为:双击启动.BAT → 自动弹出浏览器WebUI → 点开“高级”设置 → 配置热词(用逗号隔开)、输出tokens(长音频需调高)等参数 → 生成后下载TXT/SRT/ASS/JSON四种格式。说话人按音频人数自动生成(如S03),用户根据声音判断身份后填写,字幕即同步可用;右侧支持字号、字位置、显示人名、说话人颜色等自定义设置。





局域网部署注意事项
若在局域网开放服务,当前版本所有用户可见彼此生成任务记录(如张三的转写任务李四也能看到)。如需对外提供服务,须手动删除任务或实现用户隔离;个人单机使用则无需处理。
JOTO 企业落地观察
- 端到端语音理解模型大幅降低智能体工程中多模块串联的运维复杂度,企业无需再分别维护ASR、Diarization、Timestamping三套服务及其数据管道对齐逻辑。
- 本地离线部署能力使该类系统更易嵌入企业内网知识工程流程,例如会议纪要自动入库、培训录音结构化归档,规避公有云API的数据出境与隐私风险。
- 热词注入机制为企业RAG知识工程提供了轻量级领域适配入口,可在不重训模型前提下,通过业务术语表快速提升垂直场景识别准确率。
- CPU低配可运行的特性,意味着该技术可下沉至边缘设备或老旧办公终端,支撑一线团队在无GPU资源条件下开展基础语音内容处理。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


