
ハード字幕のOCRがよく失敗するのは、モデルが「賢くない」からではなく、渡した画面が違うからです。局ロゴ、時計、装飾文字、プログレスバーまで文字として読まれます。モデルを替える前に、枠と間引きを変えた方が効きます。
先に認識枠を変える
既定は画面下約40%です。横向きの口頭の多くはこれで足りますが、次では外れます。
- 縦動画の字幕が中央や上部にある
- 右上の局ロゴ、左上の日付が枠に入る
- コメントや「いいね」演出が字幕帯を横切る
原則は単純です。枠の中は字幕だけ、外はすべてノイズ。局ロゴ、時計、頭上の装飾は除外します。字より少し大きくて構いません。画面の半分を飲み込む大きさにはしないでください。
次に間引きを変える
0.5〜2 fps で足りることが多いです。密すぎると一文が複数の重複キューに割れ、疎すぎると一瞬の短文が落ちます。
こう試してください。
- まず 1 fps。欠落が多いか見る。
- 欠落が多ければ 2 fps。最初から 8 fps に飛ばない。
- 一文が砕けていれば 0.5 fps に戻し、校正で結合する。
コントラストが低い(薄い壁に黄文字、細い縁取り)ときは、間引きを増やすよりソースを明るくするか、よりきれいな完成映像に差し替えた方が効きます。
校正は省略できない
OCR は「了」を「子」にし、英語の固有名を分割します。認識後に:
- 一文に属するキューを結合する
- 誤読した局ロゴと透かしを消す
- 息継ぎに合わせてイン/アウトを微調整する
スタジオに上げ、「ハード字幕認識」を入れて始められます。原音声がはっきりしていれば音声認識の方が速く安定します。手順は10分で字幕です。
読み終わりましたか?1本作ってみましょう。無料回数の準備ができています。