文章详情
离线运行的本地音视频转字幕工具,一键音视频提取文字,支持导出为多种格式,完全免费! STT
这是一个离线运行的本地语音识别转文字工具,基于 fast-whipser 开源模型,可将视频/音频中的人类声音识别并转为文字,可输出json格式、srt字幕带时间戳格式、纯文字格式。
fast-whisper 开源模型有 tiny/base/small/medium/large-v3, 内置 tiny 模型,tiny->large-v3识别效果越来越好,但所需计算机资源也更多,根据需要可自行下载后解压到 models 目录下即可。

软件特点
- 离线运行的本地音视频转字幕工具,纯本地运行
- 支持cpu运行和GPU加速
- 完全免费,无需部署,一键运行
- 字幕支持输出json、srt字幕、纯文字txt格式
使用教程
-
下载后解压到某处,比如 E:/stt
-
双击 start.exe ,等待自动打开浏览器窗口即可
-
点击页面中的上传区域,在弹窗中找到想识别的音频或视频文件,或直接拖拽音频视频文件到上传区域,然后选择发生语言、文本输出格式、所用模型,点击“立即开始识别”,稍等片刻,底部文本框中会以所选格式显示识别结果
-
如果机器拥有英伟达GPU,并正确配置了CUDA环境,将自动使用CUDA加速注意:默认使用 cpu 运算,如果确定使用英伟达显卡,并且配置好了cuda环境,请修改 set.ini 中 `devtype=cpu`为`devtype=cuda`,并重新启动,可使用cuda加速
软件截图



注意事项