← 博客

操作提示2026-06-18 · 6 阅读

硬字幕OCR不好用?先改框选抽帧和对比度

硬字幕OCR不好用?先改框选抽帧和对比度

硬字幕识别最常翻车的,不是模型「不够聪明」,而是你送给它的画面不对。台标、时钟、花字、进度条,都会被当成要读的字。先改框和抽帧,比换模型更立竿见影。

先改识别框

默认只看画面下方大约 40%。这覆盖了大多数横屏口播,但挡不住这些情况:

  • 竖屏字幕贴在中间或顶部
  • 右上角台标、左上角日期被框进去
  • 弹幕、点赞动画从字幕区刷过

原则很简单:框里只留字幕,框外全是干扰。台标、时钟、人头上的花字,一律排除。框可以略大于字,但不要大到把半个画面都吃进去。

再改抽帧

0.5~2 fps 通常够用。太密会把同一句拆成三五条重复轴;太疏会漏掉一闪而过的短句。

可以这样试:

  1. 先用 1 fps 跑一遍,看漏句多不多。
  2. 漏得多,提到 2 fps,不要一上来就 8 fps。
  3. 同一句被拆碎,降回 0.5 fps,再在审校里合并。

对比度低(黄字叠在浅色背景、描边很细)时,先提高素材亮度或换一段更干净的成片,比盲目加密抽帧有效。

审校仍然省不掉

OCR 会把「了」认成「子」,把英文专名拆开。识别完成后:

  • 合并被拆开的同一句
  • 删掉误读的台标和水印
  • 按气口微调起止点

从处理台上传、勾选硬字幕识别即可开始。如果视频其实有清晰原声,优先走语音识别,又快又稳,流程见十分钟加字幕。

看完不如直接做一条。免费额度即开即用。