為了讓網(wǎng)速慢的用戶用上高清通話,英偉達(dá)可謂絞盡腦汁。他們開發(fā)的新AI算法,可以將視頻通話的流量最高壓縮90%以上。
和其他視頻相比,通話的場(chǎng)景比較單一,基本上只有人的頭部在運(yùn)動(dòng)。因此只要能把頭像數(shù)據(jù)大規(guī)模壓縮,就能大大節(jié)約流量。
英偉達(dá)的新算法face vid2vid正是從這一點(diǎn)出發(fā)。只要一張圖片,就能實(shí)現(xiàn)重建各種頭部姿勢(shì)圖片。
H.264視頻所需的帶寬是這種新算法的2~12倍,從前面的演示也能看出,如果讓二者使用相同比特率,那么H.264視頻幾乎不可用。
轉(zhuǎn)動(dòng)面部不扭曲
英偉達(dá)提供了一個(gè)試用Demo,可以在Pitch(俯仰角)、Yaw(偏航角)、Roll(翻滾角)三個(gè)方向上任意旋轉(zhuǎn)。
輸入一張人臉,最多可以在每個(gè)方向上最多旋轉(zhuǎn)30度。以下是三個(gè)方向上旋轉(zhuǎn)到最大角度生成的圖片。
與相比之前的方法,英偉達(dá)的這種技術(shù)即使在面部轉(zhuǎn)動(dòng)幅度較大時(shí),人臉也不會(huì)扭曲變形。
然而,圖片終究是不動(dòng)的,要把生成的人臉放在運(yùn)動(dòng)的視頻中還要多一個(gè)步驟。
合成面部視頻
我們把上傳的清晰照片作為源圖像,從中獲取外貌特征。然后把視頻中一幀幀畫面作為重構(gòu)視頻的依據(jù),從中提取出面部表情和頭部姿勢(shì)等信息。
而表情和姿勢(shì)這兩個(gè)數(shù)據(jù)可以通過關(guān)鍵點(diǎn)進(jìn)行編碼,這樣就分離了人物身份信息和運(yùn)動(dòng)信息。在傳輸視頻時(shí)只要有運(yùn)動(dòng)信息即可,從而節(jié)約了流量。
從源圖像s中,我們得到了兩組數(shù)據(jù):關(guān)鍵點(diǎn)坐標(biāo)x和雅可比矩陣J。這兩組參數(shù)與面部的具體特征無關(guān),只包含人的幾何特征。
其中,雅可比矩陣表示如何通過仿射變換將關(guān)鍵點(diǎn)周圍的局部補(bǔ)丁轉(zhuǎn)換為另一幅圖像中的補(bǔ)丁。如果是恒等雅可比矩陣,則補(bǔ)丁將直接復(fù)制并粘貼到新位置。
下圖展示了計(jì)算前5個(gè)關(guān)鍵點(diǎn)的流程。給定源圖像以及模型預(yù)測(cè)的規(guī)范關(guān)鍵點(diǎn)。
從運(yùn)動(dòng)視頻估計(jì)的旋轉(zhuǎn)和平移應(yīng)用于關(guān)鍵點(diǎn),帶動(dòng)頭部姿勢(shì)的變化。然后可以感知表情的變形將關(guān)鍵點(diǎn)調(diào)整為目標(biāo)表情。
接下來開始合成視頻。使用源和運(yùn)動(dòng)的關(guān)鍵點(diǎn)與其雅可比矩陣來估計(jì)流wk,從生成流組合成掩碼m,將這兩組進(jìn)行線性組合即可產(chǎn)生合成流場(chǎng)w。
接著輸入人臉面部特征f,即可生成輸出圖像y。
這種方法不僅能用于視頻通話,也有其他“新玩法”。
比如覺得人物頭像有點(diǎn)歪,可以手動(dòng)輸入糾正后的數(shù)據(jù),從而將面部轉(zhuǎn)正。
又或者是,把一個(gè)人的面部特征點(diǎn)和雅可比矩陣用于另一個(gè)人,實(shí)現(xiàn)面部視頻動(dòng)作的遷移。
團(tuán)隊(duì)簡介
這篇文章的第一作者是來自英偉達(dá)的高級(jí)研究員Ting-Chun Wang。
文章的通訊作者是英偉達(dá)的著名研究員劉洺堉。
如果你長期關(guān)注CV領(lǐng)域,一定對(duì)這兩位作者非常熟悉。他們?cè)趫D像風(fēng)格遷移、GAN等方面做出了大量的工作。
△ GauGAN
兩人之前已經(jīng)有過多次合作。比如。無監(jiān)督圖像遷移網(wǎng)絡(luò)(NIPS 2017),還有從涂鴉生成照片的GauGAN(CVPR 2019),都是出自這二位之手。
責(zé)任編輯:PSY
-
算法
+關(guān)注
關(guān)注
23文章
4710瀏覽量
95399 -
開發(fā)
+關(guān)注
關(guān)注
0文章
373瀏覽量
41520 -
AI
+關(guān)注
關(guān)注
88文章
35164瀏覽量
279989 -
視頻通話
+關(guān)注
關(guān)注
0文章
49瀏覽量
12079 -
英偉達(dá)
+關(guān)注
關(guān)注
22文章
3953瀏覽量
93793
發(fā)布評(píng)論請(qǐng)先 登錄
IBM攜手英偉達(dá)AI數(shù)據(jù)平臺(tái)推動(dòng)企業(yè)級(jí)AI創(chuàng)新
《AI Agent 應(yīng)用與項(xiàng)目實(shí)戰(zhàn)》----- 學(xué)習(xí)如何開發(fā)視頻應(yīng)用
美銀分析師:英偉達(dá)加大“物理AI”投入為明智之舉
英偉達(dá)收購AI初創(chuàng)公司Run:ai

加速拋棄英偉達(dá),微軟又發(fā)布一顆芯片 #微軟 #英偉達(dá) #半導(dǎo)體 #芯片 #電路知識(shí)
英偉達(dá)與軟銀攜手共建日本AI基礎(chǔ)設(shè)施
英偉達(dá)超越蘋果成為市值最高 英偉達(dá)取代英特爾加入道指
成全球最高!英偉達(dá)市值超蘋果
英偉達(dá)AI服務(wù)器將革新采用插槽式設(shè)計(jì)
英偉達(dá)與阿聯(lián)酋G42合作開發(fā)天氣預(yù)測(cè)AI模型
英偉達(dá)投資日本AI公司Sakana AI

英偉達(dá)Blackwell架構(gòu)揭秘:下一個(gè)AI計(jì)算里程碑?# 英偉達(dá)# 英偉達(dá)Blackwell
AI芯片巨頭英偉達(dá)漲超4% 英偉達(dá)市值暴增7500億
英偉達(dá)Cosmos AI項(xiàng)目曝光:構(gòu)建先進(jìn)視頻模型

評(píng)論