
硬字幕辨識最常翻車的,不是模型「不夠聰明」,而是你送給它的畫面不對。台標、時鐘、花字、進度條,都會被當成要讀的字。先改框和抽幀,比換模型更立竿見影。
先改辨識框
預設只看畫面下方大約 40%。這覆蓋了大多數橫式口播,但擋不住這些情況:
- 直式字幕貼在中間或頂部
- 右上角台標、左上角日期被框進去
- 彈幕、點讚動畫從字幕區刷過
原則很簡單:框裡只留字幕,框外全是干擾。台標、時鐘、人頭上的花字,一律排除。框可以略大於字,但不要大到把半個畫面都吃進去。
再改抽幀
0.5~2 fps 通常夠用。太密會把同一句拆成三五條重複軸;太疏會漏掉一閃而過的短句。
可以這樣試:
- 先用 1 fps 跑一遍,看漏句多不多。
- 漏得多,提到 2 fps,不要一上來就 8 fps。
- 同一句被拆碎,降回 0.5 fps,再在審校裡合併。
對比度低(黃字疊在淺色背景、描邊很細)時,先提高素材亮度或換一段更乾淨的成片,比盲目加密抽幀有效。
審校仍然省不掉
OCR 會把「了」認成「子」,把英文專名拆開。辨識完成後:
- 合併被拆開的同一句
- 刪掉誤讀的台標和水印
- 按氣口微調起止點
看完不如直接做一條。免費額度即開即用。