← 部落格

操作提示2026-06-18 · 6 閱讀

硬字幕OCR不好用?先改框選抽幀和對比度

硬字幕OCR不好用?先改框選抽幀和對比度

硬字幕辨識最常翻車的,不是模型「不夠聰明」,而是你送給它的畫面不對。台標、時鐘、花字、進度條,都會被當成要讀的字。先改框和抽幀,比換模型更立竿見影。

先改辨識框

預設只看畫面下方大約 40%。這覆蓋了大多數橫式口播,但擋不住這些情況:

  • 直式字幕貼在中間或頂部
  • 右上角台標、左上角日期被框進去
  • 彈幕、點讚動畫從字幕區刷過

原則很簡單:框裡只留字幕,框外全是干擾。台標、時鐘、人頭上的花字,一律排除。框可以略大於字,但不要大到把半個畫面都吃進去。

再改抽幀

0.5~2 fps 通常夠用。太密會把同一句拆成三五條重複軸;太疏會漏掉一閃而過的短句。

可以這樣試:

  1. 先用 1 fps 跑一遍,看漏句多不多。
  2. 漏得多,提到 2 fps,不要一上來就 8 fps。
  3. 同一句被拆碎,降回 0.5 fps,再在審校裡合併。

對比度低(黃字疊在淺色背景、描邊很細)時,先提高素材亮度或換一段更乾淨的成片,比盲目加密抽幀有效。

審校仍然省不掉

OCR 會把「了」認成「子」,把英文專名拆開。辨識完成後:

  • 合併被拆開的同一句
  • 刪掉誤讀的台標和水印
  • 按氣口微調起止點

從處理台上傳、勾選硬字幕辨識即可開始。如果影片其實有清晰原聲,優先走語音辨識,又快又穩,流程見十分鐘加字幕。

看完不如直接做一條。免費額度即開即用。