
Quand l’OCR incrusté rate, le modèle va souvent bien. Le recadrage non. Logos, horloges, stickers et barres de progression sont lus comme des mots. Changez le cadre et la cadence avant d’accuser le moteur.
D’abord changer le cadre
Par défaut, le bas 40 % de l’image. Cela couvre la plupart des voix off paysage, et échoue quand :
- les sous-titres verticaux sont au milieu ou en haut
- un logo d’angle ou une date tombe dans le cadre
- des animations de likes balayent la bande de sous-titres
Gardez uniquement le sous-titre dans le cadre. Logos, horloges, stickers dehors. Un peu de marge va ; la moitié du cadre non.
Ensuite changer la cadence
0,5–2 fps suffisent en général. Trop dense : une phrase se coupe en plusieurs cues doubles. Trop espacé : un flash de texte disparaît.
Essayez ceci :
- Lancer 1 fps et voir ce qui manque.
- S’il manque des lignes, passer à 2 fps — ne pas sauter à 8.
- Si une phrase est déchiquetée, revenir à 0,5 fps et fusionner en relecture.
Faible contraste (jaune sur mur pâle, contour fin) : mieux vaut éclaircir la source que densifier l’échantillonnage.
La relecture reste obligatoire
L’OCR transforme 了 en 子 et casse les noms anglais. Après le passage :
- fusionner les cues d’une même phrase
- supprimer logos et filigranes mal lus
- coller entrée/sortie à la respiration
Démarrez dans le studio et cochez la reconnaissance incrustée. Si le fichier a une piste vocale propre, la reconnaissance vocale est plus rapide et plus stable — voir sous-titres en dix minutes.
Vous avez fini ? Faites-en une. Le quota gratuit est prêt.