ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

用 OpenLRC 把音频变成多语言 LRC 字幕:从安装到出活完整走一遍

用 OpenLRC 把音频变成多语言 LRC 字幕:从安装到出活完整走一遍 用 OpenLRC 把音频变成多语言 LRC 字幕从安装到出活完整走一遍【免费下载链接】openlrcTranscribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPTClaude等)来转录、翻译你的音频为字幕文件。项目地址: https://gitcode.com/gh_mirrors/op/openlrc你录了一段两小时的英文讲座想给学员配中文字幕可逐句听完、手动敲时间轴的活儿能让你干到凌晨两点。 OpenLRC 把音频转写并翻译输出带时间轴的 .lrc 多语言字幕文件。 它是个 Python 库转写跑在本地翻译调 LLM API你全程只需要给一个文件路径。 下面从安装开始三步出第一条字幕再补几个进阶用法。它到底靠什么干活转写底座是 faster-whisper也就是 CTranslate2 加速的 Whisper默认 large-v3 模型输出词级时间戳翻译环节则调用 OpenAI、Anthropic、Google 等 LLM。 输入是视频也没问题先用 ffmpeg 抽出音轨并做响度归一化这一步能明显减少 Whisper 在静音段的幻觉输出翻译按句子片段逐批进行标题、术语表、语气风格这些上下文会跟着进每次请求前后文不会翻断。 整条流水线的分工见下图核心能力一眼看完能力帮你省了什么事音频转写不用逐句听写、手动打时间轴LLM 多语言翻译不用逐段复制粘贴到翻译网站视频直接输入省掉手动提取音轨双语字幕省掉两份字幕手工对齐网页界面不用记参数名最小上手路径先装包需要 Python 3.10 到 3.12pip install openlrc把翻译用的 API key 放进环境变量默认调 gpt-4.1-nano有哪家服务就配哪家export OPENAI_API_KEYsk-xxxxxxxx一行处理文件跑完会在同目录生成与源文件同名的 .lrcpython -c from openlrc import LRCer; LRCer().run(./data/test.mp3, target_langzh-cn)不想敲命令一行启动网页界面streamlit run openlrc/gui_streamlit/home.py。左侧配 Whisper 模型和 API key右侧拖文件点 GO 就出结果。拿一个真实例子走一遍场景一段 40 分钟的英文产品评测视频要出能直接拖进剪辑软件的中文字幕。你给什么一个 review.mp4不用自己抽音轨视频路径直接传。跑什么from openlrc import LRCer lrc LRCer() lrc.run(./review.mp4, target_langzh-cn, bilingual_subTrue)出来什么三份文件。review.srt 是中文版视频输入会自动切 SRT 格式review_bilingual.srt 是双语版review_nontrans.srt 是未翻译原文。打开 review.srt 就能看到时间轴和中文字幕一一对应。整个过程的参数也可以在网页界面里配再玩深一点批量处理多个文件把文件路径列表传进 run 就行转写串行、翻译默认 4 线程并发多个文件时转写和翻译还能流水线并行lrc.run([a.mp3, b.mp3], target_langzh-cn)换翻译模型控制成本英文音频用小模型就够按项目给出的定价gpt-4o-mini 处理一小时音频约 0.01 美元非英语音频建议 claude-3-5-sonnet。改 TranslationConfig 里的 chatbot 即可。给专有名词挂术语表翻译游戏、硬件、学术内容时准备一份原词→译词的 JSON用TranslationConfig(glossary./glossary.json)传入LLM 会照表翻译。转写参数默认值在 transcribe.py翻译策略和提示词在 translate.py。别踩这几个坑问输出是 LRC 还是 SRT 答看输入。音频文件出 .lrc视频文件自动出 .srt开启双语后还会多出 bilingual 和 _nontrans 两个文件不是出错。问没有 NVIDIA 显卡能跑吗 答能但默认配置是 large-v3 cuda float16面向 GPU。CPU 下要把 TranscriptionConfig 的 device 改成 cpu、compute_type 改成 int8且 large-v3 在 CPU 上很慢建议同时把 whisper_model 换成 small。问翻译环节要花多少钱 答一小时音频约 0.01 美元gpt-4o-mini、gemini-1.5-flashclaude-3-5-sonnet 约 0.2 美元。fee_limit 默认 0.8单次请求超限会中止不会失控烧钱。它适合谁又不适合谁做播客和网课的人、需要反复精听外语材料的语言学习者、想把视频字幕翻成目标语的创作者都是它的目标用户。 转写过程数据不出本机只有文本片段会发给 LLM前提是你得能装 CUDA 和 ffmpeg并准备一个 LLM API key每次处理会花一点 API 费用。 如果你只是想把一段录音转成文字看看不关心时间轴也不翻译大概率用不上它。现在就装上试试pip install openlrc【免费下载链接】openlrcTranscribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPTClaude等)来转录、翻译你的音频为字幕文件。项目地址: https://gitcode.com/gh_mirrors/op/openlrc创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表