Les derniers 10 % : ce que la machine ne peut pas caler pour toi
La transcription IA réussit les sous-titres à 90 %. Les derniers 10 % — timing, retours à la ligne, goût — c'est là que les légendes deviennent bonnes. Un regard sur la part humaine du sous-titrage, pour les monteurs vidéo et les créateurs de contenu.
La transcription automatique est aujourd’hui une vraie merveille. Donne une vidéo à un modèle de parole moderne et il revient avec les mots, grossièrement calés, en quelques secondes. Il y a dix ans, c’était un article de recherche avec une démo qui marchait à peu près ; aujourd’hui c’est une case à cocher dans une douzaine d’applis. Alors la question gênante mérite d’être posée : si la machine fait les légendes, que reste-t-il vraiment à faire pour un humain ?
Environ 10 %. Et il se trouve que ces 10 %, c’est toute la différence entre « sous-titré » et « bon ».
Ce que la machine réussit vraiment
Rendons justice aux robots, parce que SubSlap utilise ces mêmes 90 % comme point de départ — on ne prétend pas avoir réinventé la transcription.
- Les mots. Sur un audio propre, les modèles modernes transcrivent avec une précision quasi humaine, ponctuation comprise.
- Le timing grossier. Temps de début et de fin, assez proches pour suivre.
- Un premier découpage. Des lignes coupées à des longueurs à peu près lisibles.
Pour beaucoup de contenus décontractés, c’est tout le boulot. Publie et passe à autre chose. Les ennuis commencent quand « à peu près lisible » ne suffit plus.
Ce qu’elle ne peut structurellement pas faire
Voici la partie qu’aucun modèle plus gros ne corrige, parce que ce n’est pas un problème de savoir — c’est un problème de goût et de contexte :
- Couper sur la respiration, pas sur le compte. Les machines coupent à la longueur de caractères ; les gens coupent à la pensée. « le meilleur dans / toute cette histoire » se lit mal même si chaque mot est correct, parce que ça tranche une idée en deux lignes.
- Retenir pour l’effet. Un orateur marque une pause avant la chute. Le modèle ne sait pas que la chute arrive — toi si, parce que tu as regardé la vidéo et senti l’impact.
- Garder une voix. « gonna » doit-il rester « gonna » ou devenir « going to » ? Est-ce une légende décontractée ou un sous-titre formel ? C’est un choix éditorial sur le ton, et le ton n’est pas dans l’audio.
- Respecter la coupe. Une légende qui déborde d’un mot au-delà d’une coupe franche ressemble à une erreur. Le modèle ne voit pas ton montage ; il n’entend que les mots.
Bong Joon-ho, en recevant son Oscar pour Parasite, a appelé les sous-titres « la barrière haute d’un pouce ». Franchis bien cette barrière et le spectateur oublie qu’il lit ; franchis-la mal et il est sorti du film toutes les quelques secondes. Cette traversée est une décision de savoir-faire, frame par frame — exactement la part qu’un modèle ne peut pas sentir, parce qu’il ne s’est jamais assis dans une pièce sombre à regarder.
Pourquoi ça compte plus qu’avant
Deux choses ont changé. D’abord, l’essentiel de la vidéo sociale est maintenant regardé en silence, donc les légendes ne sont pas une commodité d’accessibilité — elles sont la performance elle-même. Ensuite, la barre du « ça a l’air pro » a discrètement monté, parce que le public voit des légendes propres en permanence. Une ligne qui casse en pleine pensée ne fait rien planter. Elle rend juste la vidéo légèrement amateur, et le spectateur ne saura généralement pas te dire pourquoi. Ce « ne sait pas dire pourquoi » est la partie dangereuse — ça te coûte de la confiance sans jamais remonter sous forme de plainte.
Comment vraiment posséder les 10 %
Le bon coup, c’est de traiter ces derniers 10 % comme leur propre étape, pas comme un truc qu’on jauge à l’œil. En pratique, ça veut dire :
- Lis les légendes comme un spectateur, pas comme l’auteur. Où ton œil bute-t-il ?
- Corrige les retours à la ligne d’abord — la plupart des sensations « bizarres » viennent des retours à la ligne, pas du timing.
- Puis règle le timing — cale les repères sur les temps et hors des coupes.
- Puis décide de la voix — contractions, ponctuation, ton — de façon cohérente sur toute la vidéo.
C’est toute la raison d’être du Mode Control Freak dans SubSlap : timing au frame près et contrôle des découpes, pour que tu corriges les suppositions du modèle au lieu de les livrer telles quelles. La machine réussit 90 %. Les derniers 10 %, c’est là que les légendes deviennent bonnes — et c’est la part qui reste, glorieusement, à toi.