Son %10: makinenin senin için zamanlayamadığı şey
Yapay zekâ transkripsiyonu altyazıların %90'ını doğru yapar. Son %10 — zamanlama, satır sonları, zevk — caption'ların iyileştiği yer. Video editörleri ve içerik üreticileri için altyazıcılığın insani kısmına bir bakış.
Otomatik transkripsiyon artık gerçekten bir mucize. Bir videoyu modern bir konuşma modeline ver, saniyeler içinde kelimeleri, kabaca zamanlanmış olarak geri getirsin. On yıl önce bu, demosu çoğunlukla çalışan bir araştırma makalesiydi; bugün bir düzine uygulamada bir onay kutusu. O yüzden rahatsız edici soruyu sormak yerinde: caption’ları makine yapıyorsa, bir insana yapacak ne kalıyor?
Yaklaşık %10. Ve bu %10’un, “caption’lanmış” ile “iyi” arasındaki bütün fark olduğu ortaya çıkıyor.
Makinenin gerçekten kusursuz yaptığı şey
Robotların hakkını verelim, çünkü SubSlap aynı %90’ı bir başlangıç noktası olarak kullanıyor — transkripsiyonu yeniden icat etmiş gibi yapmıyoruz.
- Kelimeler. Temiz seste modern modeller neredeyse insan doğruluğunda transkript çıkarır, noktalama işaretleriyle birlikte.
- Kabaca zamanlama. Başlangıç ve bitiş zamanları, takip etmeye yetecek kadar yakın.
- İlk geçiş bir bölünme. Satırlar okunabilirimsi uzunluklara doğranmış.
Pek çok gündelik içerik için bütün iş bu kadar. Yayınla ve devam et. Sorun “okunabilirimsi”nin yeterince iyi olmadığı yerde başlar.
Yapısal olarak yapamadığı şey
İşte hiçbir daha büyük modelin düzeltmediği kısım, çünkü bu bir bilgi sorunu değil — bir zevk-ve-bağlam sorunu:
- Sayıya değil, nefese göre kır. Makineler karakter uzunluğuna göre böler; insanlar düşünceye göre böler. “bu işin en güzel yanı / bütün mesele” yanlış okunur, her tek kelime doğru olsa bile, çünkü bir fikri iki satıra bölerek keser.
- Etki için bekle. Bir konuşmacı, can alıcı sözden önce bir an duraksar. Model can alıcı sözün geldiğini bilmez — sen bilirsin, çünkü videoyu izledin ve onun oturduğunu hissettin.
- Bir ses tut. “gonna” “gonna” mı kalmalı, yoksa “going to” mu olmalı? Bu esintili bir caption mı yoksa resmi bir altyazı mı? Bu, ton hakkında editöryel bir karar ve ton seste yok.
- Kesime saygı göster. Sert bir kesimden bir kelime taşan bir caption, hata gibi görünür. Model senin kurguyu göremez; sadece kelimeleri duyar.
Bong Joon-ho, Parazit için Oscar’ını alırken altyazılara “bir inç boyundaki bariyer” dedi. O bariyeri iyi aş, izleyici okuduğunu tamamen unutur; kötü aş, her birkaç saniyede bir filmden dışarı çekilir. O geçiş, kare-kare bir zanaat kararıdır — tam da bir modelin hissedemediği kısım, çünkü hiçbir zaman karanlık bir odada oturup izlemedi.
Bu neden eskisinden daha önemli
İki şey değişti. Birincisi, çoğu sosyal video artık sessizde izleniyor, yani caption’lar bir erişilebilirlik inceliği değil — performansın ta kendisi. İkincisi, “profesyonel görünüyor”un çıtası sessizce yükseldi, çünkü izleyiciler sürekli temiz caption’lar görüyor. Düşüncenin ortasında kırılan bir satır hiçbir şeyi çökertmez. Sadece videoyu hafifçe amatör hissettirir ve izleyici genellikle sana nedenini söyleyemez. O “nedenini söyleyemez” tehlikeli kısımdır — bir şikâyet olarak asla su yüzüne çıkmadan sana güvene mal olur.
Son %10’a gerçekten nasıl sahip çıkılır
Yapılacak hamle, o son %10’u göz kararı bir şey değil, kendi adımı olarak ele almak. Pratikte bu şu demek:
- Caption’ları bir izleyici gibi oku, yazar gibi değil. Gözün nerede takılıyor?
- Önce kırılmaları düzelt — çoğu “yanlış” hissi zamanlama değil, satır sonlarıdır.
- Sonra zamanlamayı ayarla — işaretleri vuruşlara dürt, kesimlerden uzaklaştır.
- Sonra sesi belirle — kısaltmalar, noktalama, ton — tüm video boyunca tutarlı biçimde.
Control Freak Mode’un SubSlap’te var olmasının bütün sebebi bu: kare düzeyinde zamanlama ve bölme kontrolü, böylece modelin tahminlerini yayınlamak yerine düzeltirsin. Makine %90’ını doğru yapar. Son %10, caption’ların iyileştiği yer — ve hâlâ, şükürler olsun, senin olan kısım.