ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

Buzz 离线语音转文字完整指南:本地 Whisper 转录与字幕生成

Buzz 离线语音转文字完整指南:本地 Whisper 转录与字幕生成 Buzz 离线语音转文字完整指南本地 Whisper 转录与字幕生成【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz给两小时的讲座录音出字幕先别急着把音频传云端。Buzz 是一款本地运行的离线语音转文字工具基于 OpenAI 的 Whisper 模型转录全程在机器里完成。云端转录 vs Buzz隐私、费用、断网三点差在哪两套方案差别就三件事音频存在哪、钱怎么算、断网了怎么办。云端服务把完整音频送到远程服务器隐私交给第三方账单跟着音频时长和调用量走用得多花得多网络一断离线机器只能干瞪眼。Buzz 把这三条反过来做文件不出本机不分钟计费模型缓存完就照跑。云端转录服务Buzz音频上传远程服务器处理平台留存处理记录只在本地处理文件不离开机器按音频时长或调用量计费量越大越贵免费开源不按次收钱必须在线断网即不可用模型缓存后离线照常转录Windows、macOS、Linux 三种装法三个平台都有现成安装包差别只在装法。Windows未签名警告这样处理从发布渠道拿到安装程序直接运行。程序没有签名安装时会弹出安全警告点更多信息再选仍要运行即可继续。macOS拖进 .dmg 就行下载 .dmg 后拖进应用程序文件夹即可。注意较新版本只面向 Apple SiliconIntel Mac 只能装到 1.4.5 为止的旧版。Linux一条命令装好flatpak install flathub io.github.chidiwilliams.Buzz不管哪个平台第一次启动都要进模型设置挑一个模型下载缓存之后断网也能用。音频进去文字出来输入、引擎、加工三层看流程分三层看喂什么素材进去、哪个引擎干活、出来的文字怎么收拾。输入层。三类素材都能进本地音频WAV、MP3、FLAC 这类格式直接导入视频文件MP4、AVI 直接抽音轨转录在线链接贴一个 YouTube 地址自动下载再转录引擎层。后端共四种都属 Whisper 家族OpenAI Whisper原版Faster Whisper速度优先适合 6GB 以上显存的独显Whisper.cppC 实现最省资源Mac 与集显的推荐选择Hugging Face 兼容模型另支持接 OpenAI API 走服务端有 NVIDIA 独显的话开 CUDA 加速出字速度能快一截。实时场景有录音转录模式边说边出字配一个投大屏的演示窗口文字还能实时导成 TXT 喂给 OBS。吵的录音先跑语音分离再转录多人对话能标出不同说话人。加工层。文字出来还没完转录查看器能搜索、播放、调倍速文字与时间戳逐段可改导出有三种格式TXT 对应文稿SRT 与 VTT 对应字幕字幕 Resize长行按标点拆、短行合并、显示时长延长文件夹监控文件丢进去自动转录命令行接口能嵌进自动化脚本插件系统还有 AI 摘要这类扩展五个模型大小速度对照选模型其实是一道权衡题硬件愿意为准确率让出多少。模型大小速度准确度tiny约 75MB最快一般base约 142MB快可用small约 466MB中等较好medium约 1.5GB慢高large约 2.9GB最慢最高平时速记选 base 或 small值得反复听的重要资料再上 large。转录慢别先怪模型把后端切到 Whisper.cpp它更快也更省内存。几个值得动一次的设置语言别依赖自动检测手动选定一种口音重的素材更稳初始提示把人名、术语填进去专有名词的错字会少一截词级时间戳后面要逐词精调字幕才开平时关着三种角色的典型用法同一个工具三种角色各有一套用法。访谈研究员整理多人对话。需求两小时访谈变成带说话人标记的文字稿。操作转录前打开语音分离文字出来后在转录查看器里逐段指定说话人再导出 TXT。产出带时间戳、区分发言人 A / B的文字稿可边听边改。播客剪辑师出字幕文件。需求两小时节目配一份能直接进剪辑软件的字幕。操作拖入 MP3语言手动选中文词级时间戳打开格式选 SRT再用 Resize 按标点拆行、限制每行长度。产出时间码对齐的 SRT导入即用。活动组织者现场大字幕。需求把现场发言即时打到屏上。操作选录音转录任务选好麦克风打开演示窗口点录制同时启用实时文本导出。产出大屏字幕画面外加一份可供 OBS 同步的 TXT。四个高频坑先给结论再排查这四个问题出现频率最高每个都先给结论再按顺序查。转录不准。结论先别换模型。依次查语言有没有手动指定、录音是否嘈杂开语音分离、模型是否偏小升一级试试。专有名词反复错把那几个词直接填进初始提示。完全断网的机器。结论可以用。先在有网电脑下好模型从偏好设置 → 模型 → 显示文件位置打开模型文件夹整体拷到离线机同一路径。仓库里的模型批量下载脚本能一次备齐多个后端。转录太慢、机器卡。结论换后端或降模型。先切 Whisper.cpp或把模型降一级NVIDIA 独显显存 6GB 以上可试 Faster Whisper。实时录音转录务必选小模型否则跟不上说话速度。录音没声音、报 PaErrorCode。结论多半是麦克风权限。系统隐私设置里先放行 Buzz 使用麦克风再排除杀毒软件的拦截。三步上手数据留在本机三步就能上手装好 Buzz 导入一段短音频选 base 模型点运行完成后双击结果核对顺手导出文件。想深入某个功能先翻官方文档目录和命令行接口说明。从这一天起你录的每一段音、每一场会文字和字幕都留在自己机器上。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表