ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

一条命令把1小时播客变双语字幕:OpenLRC,简单快速的音频转LRC与AI字幕生成

一条命令把1小时播客变双语字幕:OpenLRC,简单快速的音频转LRC与AI字幕生成 一条命令把1小时播客变双语字幕OpenLRC简单快速的音频转LRC与AI字幕生成【免费下载链接】openlrcTranscribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPTClaude等)来转录、翻译你的音频为字幕文件。项目地址: https://gitcode.com/gh_mirrors/op/openlrc给播客配字幕你还在逐句听写到凌晨OpenLRC 是一个开源的音频转LRC工具把录音丢进去AI 字幕生成自动完成——Whisper 识别出文字LLM 翻译时间轴对齐同步歌词到手全程一条命令。不管是播客、课程还是会议录音流程都一样耗时从天缩到几十分钟。工具本身 MIT 开源免费只有翻译环节走 LLM API 计费。一小时的录音你打算逐句听写多久咱们有更短的路。一条命令从音频到 LRC 文件git clone https://gitcode.com/gh_mirrors/op/openlrc # 把仓库拉下来 pip install . # 本地装上 openlrc run -i 演讲录音.mp3 -t zh-cn # 音频进LRC 出-t是目标语言换成什么就翻什么想留原文就加--bilingual双语字幕一起给你。产出的就是带精确时间戳的标准 LRC 文件播放器直接能放。更多参数看仓库根目录的 README.md不想碰命令行也没关系下文有网页版。它到底做了什么30 秒看懂链路主链路比想象中短。ffmpeg 先对音频做预处理响度归一化可选降噪然后 Faster-Whisper——比普通 Whisper 快约 4 倍——把语音识别成带时间戳的文本。接着进入多智能体翻译系统Context Reviewer 先审查上下文Validator 校验翻译请求最后 Translator 调用 LLM 完成翻译时间轴还会按目标语言的阅读速度自动调整。一次丢多个文件时翻译端是并行的不用排队。想要深挖提示词设计可以看 openlrc/prompter.py。谁会用帮你对号入座 这个 AI 听写工具基本覆盖三类人场景原来怎么做现在多久音乐人做双语歌词找听写、再找翻译、手动调时间轴3-5 天上传一次30 分钟出双语 LRC省 80%在线课程做多语言字幕50 节课人工处理约两周批量 2 小时跑完提速 95%跨国公司会议纪要会后再人工整理录音实时生成字幕并导出 LRC整理时间少 60%一个人做创作还是带课的团队都能对号入座对不上号的话拿手头的音频试一把也行。选翻译模型1 小时音频成本不到 1 毛钱模型百万 token 成本输入/输出1 小时音频预估成本gpt-4o-mini$0.5 / $1.5$0.01claude-3-haiku$0.25 / $1.25$0.015gemini-1.5-flash$0.175 / $2.1$0.01deepseek-chat$0.18 / $2.2$0.01怎么选英语音频、要便宜快deepseek-chat、gpt-4o-mini、gemini-1.5-flash 够用非英语、要精度claude-3-5-sonnet 更稳。识别端另算先用 base 或 small 跑通流程就行高精度再上 large-v3识别准确率提升 15-20%。文件攒一批一起处理还能省 API 调用费。成本按 token 数估算实际会随语言和语速略有浮动。双语、降噪、自定义路由各给一条命令不解释原理直接抄openlrc run -i 英语听力.mp3 -t zh-cn --bilingual # 双语字幕lrcer.run(./data/test.mp3, target_langzh-cn, noise_suppressTrue) # 低音质音频降噪ModelConfig(providerModelProvider.OPENAI, nameanthropic/claude-3.5-haiku, base_url你的OpenAI兼容网关地址, api_keysk-xxx)最后这条是给翻译走任意 OpenAI 兼容的服务比如 OpenRouter用的。非技术用户打开浏览器就能用不想碰命令行还有 Web 版openlrc gui跑完会打印一个本地地址浏览器打开就行。左边侧栏填 API 密钥、选 Whisper 模型、计算类型、翻译模型全是下拉框右边拖拽上传支持 MP3、WAV、FLAC、M4A、MP4 等格式单文件最大 200MB。选好点一下LRC 文件生成的整个过程都在浏览器里完成。先试一把拿 5 分钟音频跑一遍别一上来就扔长音频。先截一段 5 分钟的播客片段用开头那条命令跑一遍检查生成的播客字幕时间戳偏不偏、翻译腔重不重。跑顺手了再去看源码——三个 Agent 的逻辑都在 openlrc/ 目录里。项目开源有问题或者想法欢迎提 Issue。【免费下载链接】openlrcTranscribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPTClaude等)来转录、翻译你的音频为字幕文件。项目地址: https://gitcode.com/gh_mirrors/op/openlrc创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表