自动字幕 · LIGHTCUT 实验室

把语音 / 歌声转成带时间轴的字幕,全程在你浏览器本地运行,文件不上传。

检测设备中…
🎧
拖入音频或视频,或点击选择
支持 mp3 / wav / m4a / ogg / mp4 等 · 口播对白识别最准
准备中…

字幕结果

怎么用:选一段音频/视频 → 开始识别 → 出带时间轴的字幕,可下载 SRT 套进剪辑软件,或点某句跳到对应时间。
第一次会下载模型(之后缓存,离线也能用)。Chrome / Edge 有 WebGPU 加速最快;其它浏览器走 WASM,慢一些。
唱歌的歌词会比口播难识别(伴奏干扰)——后续可先做「人声分离」再识别,准确率明显提升。
装了「追光引擎」的用户:识别会自动切到本地 Qwen3-ASR,比浏览器 Whisper 更准更快,带 BGM 的素材差距尤其明显。 还没装?下载与安装教程在这里(跟声线织造的真人配音共用同一个引擎,只需要操作一次)。

自托管(国内推荐,不受墙):把模型放到你网站,识别完全走自己域名。
1. 在站点建目录 tools/models/whisper-base/(含子目录 onnx/)
2. 上传这 7 个文件(从 hf-mirror.com 直接下载即可):
  根目录:config.json · generation_config.json · preprocessor_config.json · tokenizer.json · tokenizer_config.json
  onnx/ 下:encoder_model_quantized.onnx · decoder_model_merged_quantized.onnx
3. 「模型源」选 自托管、模型选 base → 开始识别(同源加载,无需联网外站)。

两种识别引擎怎么选

不管选哪种,文件都不上传——全程在你自己的机器上完成,音视频不会离开本地。

提高识别准确率的几个做法

  1. 口播对白识别最准。如果素材里音乐很响,先用追光剪辑做一次人声分离,再拿人声轨来识别,准确率会有明显提升。
  2. 先指定语言,别用自动检测。中英混杂的素材,自动检测经常在开头就判错,然后整段都跑偏。
  3. 长素材先切段。一小时的整段识别一旦中途出问题,你要从头再来;切成十分钟一段更可控。
  4. 专有名词准备好替换列表。人名、地名、品牌名几乎一定会错,识别完统一批量替换,比逐句改快得多。

校对与时间轴

识别出来的字幕支持逐句校对和时间轴微调。有两个细节值得注意:一句字幕不要超过一行半,观众读不完;字幕的进出时间要留一点余量,紧贴着语音开始和结束会让人觉得跳。

时间轴上还有一个容易忽略的问题——由像素拖动换算出来的时间点,几乎不会正好落在帧边界上。字幕差半帧通常看不出来,但做逐字卡点时就会露馅。原理写在剪辑接缝为什么会闪一帧里。

导出的字幕可直接带回追光剪辑的字幕轨继续编辑。