마지막 10%: 기계가 널 위해 타이밍 잡아 줄 수 없는 것
AI 받아쓰기는 자막을 90% 맞힌다. 마지막 10% — 타이밍, 줄바꿈, 취향 — 그게 캡션이 좋아지는 지점이다. 영상 편집자와 콘텐츠 크리에이터를 위한 자막의 인간적 부분에 대한 시선.
자동 받아쓰기는 이제 진짜로 경이롭다. 최신 음성 모델에 영상을 먹이면 몇 초 만에 단어들이, 대충 타이밍 잡혀서 돌아온다. 10년 전엔 그게 대체로 작동하는 데모가 딸린 연구 논문이었다; 오늘은 열두어 앱에 있는 체크박스다. 그래서 불편한 질문을 던지는 게 공정하다: 기계가 캡션을 한다면, 인간이 할 일은 실제로 뭐가 남나?
약 10%. 그리고 알고 보니 그 10%가 “캡션 달림”과 “좋음” 사이의 통째 차이다.
기계가 진짜로 잘하는 것
로봇들에게 마땅한 몫을 주자, SubSlap도 같은 90%를 출발점으로 쓰니까 — 우리가 받아쓰기를 재발명한 척하는 게 아니다.
- 단어. 깨끗한 오디오에서, 최신 모델은 구두점까지 인간에 가까운 정확도로 받아쓴다.
- 대략의 타이밍. 따라가기에 충분히 근접한 시작·끝 시각.
- 초벌 분할. 읽을 만한 길이로 대충 잘린 줄들.
수많은 캐주얼 콘텐츠엔 그게 일의 전부다. 게시하고 넘어가라. 문제는 “읽을 만한 정도”가 충분하지 않을 때 시작된다.
그것이 구조적으로 할 수 없는 것
여기, 더 큰 모델로도 못 고치는 부분, 왜냐하면 그건 지식 문제가 아니라 — 취향과 맥락 문제이기 때문이다:
- 글자 수가 아니라 숨결에서 끊어라. 기계는 글자 길이로 나눈다; 사람은 생각으로 나눈다. “this whole thing에 관한 최고의 부분은 / 이거야” 는 단어 하나하나가 다 맞아도 잘못 읽힌다, 하나의 생각을 두 줄에 걸쳐 잘라 버리기 때문이다.
- 효과를 위해 멈춰라. 화자가 펀치라인 직전에 한 박자 멈춘다. 모델은 펀치라인이 온다는 걸 모른다 — 넌 안다, 영상을 봤고 그게 꽂히는 걸 느꼈으니까.
- 목소리를 지켜라. “gonna”는 “gonna”로 남아야 할까, 아니면 “going to”가 될까? 이건 산뜻한 캡션일까 격식 있는 자막일까? 그건 톤에 관한 편집상의 판단이고, 톤은 오디오에 없다.
- 컷을 존중하라. 하드 컷을 한 단어 넘겨 흘러가는 캡션은 실수처럼 보인다. 모델은 네 편집을 볼 수 없다; 단어만 들을 뿐이다.
봉준호는 기생충으로 오스카를 받으며 자막을 “1인치의 장벽”이라 불렀다. 그 장벽을 잘 넘으면 시청자는 자기가 읽고 있다는 걸 아예 잊는다; 못 넘으면 몇 초마다 영화 밖으로 끌려 나온다. 그 넘기는 프레임 단위의 장인적 결정이다 — 정확히 모델이 느낄 수 없는 부분, 어두운 방에 앉아 본 적이 한 번도 없으니까.
왜 이게 예전보다 더 중요한가
두 가지가 바뀌었다. 첫째, 이제 대부분의 소셜 영상이 음소거로 시청된다, 그래서 캡션은 접근성 배려가 아니라 — 연기 그 자체다. 둘째, “프로처럼 보인다”의 기준이 조용히 올라갔다, 관객이 깨끗한 캡션을 끊임없이 보기 때문이다. 생각 중간에 끊기는 줄 하나는 아무것도 망가뜨리지 않는다. 그저 영상을 살짝 아마추어처럼 느끼게 하고, 시청자는 대개 왜인지 말하지 못한다. 그 “왜인지 말 못 함”이 위험한 부분이다 — 불평으로 드러나지도 않은 채 네 신뢰를 앗아간다.
그 10%를 실제로 내 것으로 만드는 법
수는 그 마지막 10%를 눈대중할 무엇이 아니라 그 자체의 단계로 다루는 거다. 실전에선 이런 뜻이다:
- 작성자가 아니라 시청자처럼 캡션을 읽어라. 네 눈이 어디서 걸리나?
- 줄바꿈부터 고쳐라 — 대부분의 “어색함”은 타이밍이 아니라 줄바꿈이다.
- 그다음 타이밍을 손봐라 — 큐를 박자 위로 밀고 컷에서 떼어라.
- 그다음 목소리를 정해라 — 축약, 구두점, 톤 — 영상 전체에 걸쳐 일관되게.
그게 바로 SubSlap에 Control Freak Mode가 존재하는 이유다: 프레임 단위 타이밍과 분할 통제, 그래서 넌 모델의 추측을 그냥 내보내는 게 아니라 고친다. 기계가 90%를 맞힌다. 마지막 10%가 캡션이 좋아지는 지점이다 — 그리고 그건 여전히, 찬란하게도, 네 것이다.