毫不誇張地說,視頻內容行業目前正處於拐點。一方面,人工智能增強了內容創作者的創造潛力,但在大洋的另一邊,人工智能和錯誤信息的問題仍然存在。然而,人工智能的巨大潛力也不容忽視。
YouTube 的工作人員很好地使用了它,強調可訪問性和真實性。那麼,下一步是什麼?讓嘴唇自然地隨著任何語言的音調移動,即使視頻中的說話者不會說這種語言。在去年推出的自動配音功能的基礎上,該團隊現在推出了新的人工智能口型同步功能。
機器翻譯的音頻在過去幾個季度中得到了顯著改善,現在聽起來幾乎很自然。 Google NotebookLM 中的音頻概述就是一個很好的例子。但當涉及到視頻時,它們就會失敗,因為嘴唇的動作根本與演講者所說的內容與文本的翻譯版本不匹配。
這是非常煩人和噁心的。人工智能驅動的口型同步功能希望克服這種音頻和視覺上的不和諧。從我迄今為止看到的樣本來看,它們看起來異常正常。我與 YouTube 自動配音產品經理 Buddhika Kottahachchi 坐下來,了解口型同步的發展過程、其影響以及未來的發展方向。
更深入地研究技術方面
推出不到一年的時間裡,YouTube 的自動配音功能已被用於為 20 種語言的超過 6000 萬個視頻配音。但是,保持自然的語氣與對話語音的所有細微差別,然後將其與現實的嘴唇動作相匹配,提出了一個全新的挑戰。
久塔八告訴我,從表面上看,口型同步系統“調整屏幕上的像素以匹配翻譯後的語音”。谷歌首席執行官告訴我,這是一個專用的技術堆棧,並補充說他們需要開發對世界、嘴唇、牙齒、姿勢和麵部形狀的 3D 理解。
目前該技術適用於全高清(1080),但尚未適配4K視頻。 “但總的來說,它應該與您上傳的視頻分辨率兼容,”他指出。在語言支持方面,YouTube的AI口型同步功能支持英語、西班牙語、德語、葡萄牙語和法語。
這是一個非常有限的集合,但 Kottahachchi 告訴我,團隊正在努力擴展它,口型同步最終將支持自動配音功能可以處理的同一組語言(目前超過 20 種語言)。相比之下,Meta 針對 Facebook 和 Instagram 的 AI 口型同步功能僅支持英語、西班牙語、印地語和葡萄牙語。
現在,人工智能驅動的口型同步並不是一個完全陌生的概念。 Adobe 已經提供了自動口型同步功能。還有像 HeyGen 這樣的第三方選項,它聲稱免費提供此服務。但說到 YouTube,我們談論的是一個大規模集成在每天上傳 2000 萬個視頻的平台上的系統。
AI Babel 魚給你的臉
那麼,在可用性方面接下來會發生什麼? “我們還沒有準備好對它的可用性做出任何一般性的陳述,但我們希望將其提供給更多的創作者,並了解計算和質量的局限性,”Kutahachi 告訴我。這給我們帶來了成本的關鍵問題。
當我詢問此事時,YouTube 高管告訴我,他們無法預測所涉及的費用(如果他們能預測的話)。這也解釋了為什麼該功能仍然是一小群值得信賴的測試人員進行試點項目的一部分,以了解市場併計算成本。提醒一下,這是一個複雜的基於視覺的人工智能應用程序。
因此,就像人工智能生成的視頻一樣,你可以免費創建一些剪輯,但必須為更高的分辨率或嘗試付費,YouTube 也必須考慮計算成本並決定推出。但從創作者的角度來看,如果我正在尋找更廣泛的影響力,我可能會支付訂閱費。
人工智能的困境

自從人工智能視覺效果開始充斥互聯網以來,關於真實性和公平披露的爭論就一直激烈進行。 “什麼是真的?”在 OpenAI 的 Sora 應用程序製作的奇異逼真視頻出現後不久,社交媒體用戶更加熱情地提出了這個問題。
這些視頻有可見的水印,但已經有免費和付費工具可以從人工智能生成的剪輯中刪除 Sora 標籤。或者任何其他人工智能驅動的內容創建者,就此而言。谷歌作為人工智能最大的開發商和採用者之一,深知這一點。
該公司憑藉其 SynthID 系統成為 AI 指紋識別競賽的早期先驅,還在今年早些時候推出了 SynthID Detector 工具,幫助用戶驗證多媒體內容的來源。
依賴谷歌人工智能口型同步功能的 YouTube 視頻將採取更加謹慎的做法。 “我們將適當披露該視頻中的音頻和視頻是人為創建或更改的,”科塔哈奇告訴我。 “視頻內容本身也帶有指紋。”

文本披露將顯示在 YouTube 視頻標題下的描述框中,就像使用自動配音的視頻一樣。但是,如果創作者將 AI 配音、口型同步的 YouTube 視頻發佈到 Instagram 或 TikTok,其他平台將如何處理這些視頻呢?
算法會改進嗎?
TikTok 最近宣布,它將標記使用人工智能工具“創建或編輯”的視頻,並對它們進行指紋識別,以便用戶可以使用 C2PA 的驗證工具驗證其來源。 Meta 也有類似的系統。那麼,發佈在其他社交視頻平台上的人工智能剪輯視頻會怎樣呢?
它們會根據算法進行排名還是會被阻止出現在某些提要中?情況有點困難且難以預測。 “這是我們正在仔細監控的事情,但現在還為時過早,因為平台已經發布了聲明,但我們還沒有看到它們是如何有效實施的,”李說。 “一般來說,我們翻譯字幕,但不翻譯新內容。”

我還提出了不良行為者在未經內容創作者應有同意的情況下使用內容創作者的視頻、轉錄音頻並從不同渠道或平台推送它們的問題。自動配音和人工智能口型同步使這種技術上不道德的行為更容易實現,但可能不會變得一團糟。
“如果您的圖片在平台上的其他地方使用,您可以告訴我們並要求我們將其刪除,”Kotahatchi 告訴我。看看自動配音、富有表現力的音頻和口型同步視頻將如何使 YouTube 體驗更加多樣化,將會很有趣。從表面上看,這看起來像是一場胜利。
我迫不及待地想看到自己說西班牙語,儘管我幾年前就放棄了 Duolingo 計劃。









