Os últimos 10%: o que a máquina não consegue cronometrar por você
A transcrição por IA acerta 90% das legendas. Os 10% finais — tempo, quebras de linha, bom gosto — são onde as legendas ficam boas. Um olhar sobre a parte humana da legendagem pra editores de vídeo e criadores de conteúdo.
A transcrição automática é genuinamente uma maravilha agora. Alimente um vídeo pra um modelo de fala moderno e ele volta com as palavras, cronometradas por cima, em segundos. Dez anos atrás isso era um artigo de pesquisa com uma demo que quase funcionava; hoje é uma caixinha de seleção em uma dúzia de apps. Então é justo fazer a pergunta incômoda: se a máquina faz as legendas, o que sobra de fato pra um humano fazer?
Uns 10%. E acontece que esses 10% são a diferença inteira entre “legendado” e “bom”.
O que a máquina de fato acerta
Vamos dar aos robôs o que é deles, porque o SubSlap usa os mesmos 90% como ponto de partida — a gente não está fingindo ter reinventado a transcrição.
- As palavras. Em áudio limpo, os modelos modernos transcrevem com precisão quase humana, pontuação e tudo.
- Tempo aproximado. Horas de início e fim, perto o bastante pra acompanhar.
- Uma primeira divisão. Linhas cortadas em tamanhos mais ou menos legíveis.
Pra muito conteúdo casual, esse é o trabalho todo. Publica e segue a vida. O problema começa quando “mais ou menos legível” não é bom o suficiente.
O que ela estruturalmente não consegue fazer
Aqui vai a parte que nenhum modelo maior conserta, porque não é um problema de conhecimento — é um problema de bom gosto e contexto:
- Quebrar na respiração, não na contagem. As máquinas dividem pelo tamanho em caracteres; as pessoas dividem por pensamento. “a melhor parte disso / tudo” lê errado mesmo com cada palavra correta, porque corta uma ideia em duas linhas.
- Segurar pro efeito. Um falante faz uma pausa antes da tirada. O modelo não sabe que a tirada vem aí — você sabe, porque assistiu ao vídeo e sentiu o baque.
- Manter uma voz. “Tá” continua “tá” ou vira “está”? É uma legenda descontraída ou uma legenda formal? Isso é uma escolha editorial sobre o tom, e tom não está no áudio.
- Respeitar o corte. Uma legenda que vaza uma palavra depois de um corte seco parece um erro. O modelo não consegue ver a sua edição; ele só ouve as palavras.
Bong Joon-ho, ao aceitar seu Oscar por Parasita, chamou as legendas de “a barreira de dois centímetros e meio”. Cruze essa barreira bem e o espectador esquece que está lendo; cruze mal e ele é arrancado do filme a cada poucos segundos. Essa travessia é uma decisão de ofício quadro a quadro — exatamente a parte que um modelo não consegue sentir, porque nunca sentou numa sala escura assistindo.
Por que isso importa mais que antes
Duas coisas mudaram. Primeiro, a maior parte do vídeo social agora é assistida no mudo, então as legendas não são um agrado de acessibilidade — são a atuação em si. Segundo, a barra do “parece profissional” subiu de mansinho, porque o público vê legendas limpas o tempo todo. Uma linha que quebra no meio do pensamento não quebra nada. Ela só faz o vídeo parecer levemente amador, e o espectador normalmente não sabe dizer por quê. Esse “não sabe dizer por quê” é a parte perigosa — custa a sua confiança sem nunca aparecer como uma reclamação.
Como de fato dominar os 10%
A jogada é tratar esses últimos 10% como uma etapa própria, não algo que você resolve no olho. Na prática isso significa:
- Leia as legendas como um espectador, não como o autor. Onde o seu olho trava?
- Conserte as quebras primeiro — a maioria das sensações de “esquisito” é quebra de linha, não tempo.
- Aí ajuste o tempo — empurre as deixas pros baques e pra fora dos cortes.
- Aí decida a voz — contrações, pontuação, tom — de forma consistente no vídeo inteiro.
Essa é a razão inteira de o Modo Controle Total existir no SubSlap: tempo no nível do quadro e controle de divisão, pra você consertar os chutes do modelo em vez de publicá-los. A máquina acerta 90%. Os últimos 10% são onde as legendas ficam boas — e é a parte que ainda é, gloriosamente, sua.