把语音 / 歌声转成带时间轴的字幕,全程在你浏览器本地运行,文件不上传。
怎么用:选一段音频/视频 → 开始识别 → 出带时间轴的字幕,可下载 SRT 套进剪辑软件,或点某句跳到对应时间。
第一次会下载模型(之后缓存,离线也能用)。Chrome / Edge 有 WebGPU 加速最快;其它浏览器走 WASM,慢一些。
唱歌的歌词会比口播难识别(伴奏干扰)——后续可先做「人声分离」再识别,准确率明显提升。
装了「追光引擎」的用户:识别会自动切到本地 Qwen3-ASR,比浏览器 Whisper 更准更快,带 BGM 的素材差距尤其明显。
还没装?下载与安装教程在这里(跟声线织造的真人配音共用同一个引擎,只需要操作一次)。
自托管(国内推荐,不受墙):把模型放到你网站,识别完全走自己域名。
1. 在站点建目录 tools/models/whisper-base/(含子目录 onnx/)
2. 上传这 7 个文件(从 hf-mirror.com 直接下载即可):
根目录:config.json · generation_config.json · preprocessor_config.json · tokenizer.json · tokenizer_config.json
onnx/ 下:encoder_model_quantized.onnx · decoder_model_merged_quantized.onnx
3. 「模型源」选 自托管、模型选 base → 开始识别(同源加载,无需联网外站)。