從單聲道、立體聲、環(huán)繞聲發(fā)展到三維聲,音頻回放技術(shù)的迭代演進(jìn)是為了還原真實(shí)世界的聲音。其中,三維聲技術(shù)使用信號(hào)處理的方法對(duì)到達(dá)兩耳的聲音信號(hào)進(jìn)行模擬,將聲場(chǎng)還原為三維空間,更接近真實(shí)世界。憑借這個(gè)技術(shù),各廠商在游戲、影視、音樂等場(chǎng)景中為用戶創(chuàng)造更真實(shí)自然且沉浸的聽覺體驗(yàn),也實(shí)現(xiàn)了更好的用戶訂閱增長。
傳統(tǒng)3D音頻的制作需獲取原始的分軌素材(如錄制的人聲、鋼琴聲等),并使用專業(yè)的數(shù)字音頻工作站(DAW)和3D混音插件手工制作,因此制作周期長、生產(chǎn)效率低、成本高、門檻高。此外,開發(fā)者由于沒有歌曲的原始分軌,因此通過傳統(tǒng)方法進(jìn)行3D音頻制作的難度很大。HMS Core音頻編輯服務(wù)(Audio Editor Kit)提供了音源分離(獲取分軌)、空間音頻渲染能力,開發(fā)者僅需輸入立體聲,就能快速生成3D音頻內(nèi)容,提升用戶音頻體驗(yàn)和提升產(chǎn)品競(jìng)爭(zhēng)力!
HMS Core音頻編輯服務(wù)3D音頻生成示意圖
音源分離技術(shù)
由于我們當(dāng)前接觸到的音頻大都是立體聲,所有音頻對(duì)象(如音樂中的人聲、鋼琴、吉他等)都已經(jīng)混合在左右兩個(gè)聲道當(dāng)中,無法輕易地分開,更不要提將其渲染放置在不同的空間位置,因此將立體聲中的特定元素分離是3D化的一個(gè)核心技術(shù)。
華為算法團(tuán)隊(duì)通過對(duì)大量的音樂進(jìn)行深度學(xué)習(xí)建模,并結(jié)合傳統(tǒng)信號(hào)處理能力最終實(shí)現(xiàn)音源分離:首先利用短時(shí)傅里葉變換(STFT)將一維的音頻信號(hào)變換到二維的時(shí)頻譜;然后將得到的二維的時(shí)頻譜與原始的一維時(shí)域信號(hào)一起作為雙流輸入,通過多層的殘差編碼及大量數(shù)據(jù)的訓(xùn)練,獲得目標(biāo)樂器的隱空間表達(dá);最后進(jìn)一步通過一系列的變換矩陣最終還原成原始的對(duì)象立體聲信號(hào)。
上述處理過程中使用的變換矩陣和網(wǎng)絡(luò)結(jié)構(gòu)是華為的獨(dú)特技術(shù),是針對(duì)不同的樂器音色特點(diǎn)專門設(shè)計(jì)的,能夠確保每一個(gè)樂器都能盡可能的分離完整且干凈,為3D化提供足夠優(yōu)質(zhì)的分軌素材。其涉及的核心能力包括:
1、 音頻信號(hào)特征提取:包括通過編碼器從時(shí)域信號(hào)直接提取特征,以及通過短時(shí)傅里葉變換從時(shí)域信號(hào)提取時(shí)頻譜特征;
2、 深度學(xué)習(xí)模型構(gòu)建:加入殘差模塊與注意力機(jī)制,增強(qiáng)對(duì)不同樂器諧波建模能力與時(shí)序關(guān)聯(lián)能力;
3、 多通道維納濾波:結(jié)合傳統(tǒng)信號(hào)處理的能力,通過深度學(xué)習(xí)建模預(yù)測(cè)對(duì)象與非對(duì)象功率譜關(guān)系,構(gòu)建與處理濾波系數(shù)。
音頻分離技術(shù)示意圖
目前,HMS Core已對(duì)外開放了12種音源分離的能力(人聲、伴奏、鼓、小提琴、貝斯、鋼琴、木吉他、電吉他、弦樂、主唱、帶伴唱伴奏和管弦樂),幫助開發(fā)者快速地提取出自己想要的樂器進(jìn)行3D化編輯。
空間音頻渲染技術(shù)
僅通過兩只耳朵收聽外部聲音,人類為什么可分辨聲源的位置呢?這是由于從聲源傳遞到兩只耳朵的聲音實(shí)際上存在細(xì)微的差異,包括到達(dá)時(shí)間、接收到的能量、以及相位差等信息。而這些信息差綜合體現(xiàn)在一系列傳遞函數(shù),稱為頭相關(guān)傳遞函數(shù)(HRTF)。通過將HRTF疊加到單點(diǎn)聲源,我們就可以虛擬出真實(shí)世界中聲音的方位直達(dá)聲的部分。為解決因頭型、肩寬等人體體征的差異帶來的HRTF因人而異的難題,我們通過大量數(shù)據(jù)的分析,設(shè)計(jì)了一套較普適的HRTF,可以讓每個(gè)人都能享受到3D音頻。另外為了營造空間中聲音的反射、散射、干涉等物理現(xiàn)象,我們還通過疊加一系列的房間相應(yīng)函數(shù)(RIR)來構(gòu)建真實(shí)的空間,形成所謂的混響。因此,通過一系列的HRTF和RIR對(duì)聲源進(jìn)行濾波,我們就可以將之前分離的素材進(jìn)行3D化,形成3D音樂。
空間音頻渲染技術(shù)示意圖
目前,HMS Core音頻編輯服務(wù)提供的音源分離、空間音頻渲染服務(wù)這套組合拳已經(jīng)應(yīng)用在華為音樂的高級(jí)音效當(dāng)中,用戶可以進(jìn)入華為音樂音效頁面,在高級(jí)音效欄目中選擇聲空音效或聲樂純享,感受3D音頻的魅力。
華為音樂聲空音效與聲樂純享功能
下面是普通的立體聲與透過這套組合拳轉(zhuǎn)換成的3D音樂對(duì)比,建議您可佩戴耳機(jī)體驗(yàn),效果更佳。
以上技術(shù)來自華為2012實(shí)驗(yàn)室,通過HMS Core音頻編輯服務(wù)面向開發(fā)者開放,在音樂音頻領(lǐng)域?yàn)橛脩魩聿町惢?D音頻體驗(yàn)。其他更多關(guān)于HMS Core音頻編輯服務(wù)的信息,請(qǐng)?jiān)L問華為開發(fā)者聯(lián)盟-HMS Core音頻編輯服務(wù)官網(wǎng)。