1. 創(chuàng)業(yè)頭條
  2. 前沿領(lǐng)域
  3. AI智能
  4. 正文

真假難辨?獵戶星空10段話克隆你的聲音!

 2018-11-06 12:02  來源:互聯(lián)網(wǎng)  我來投稿 撤稿糾錯(cuò)

  阿里云優(yōu)惠券 先領(lǐng)券再下單

今日,獵豹移動(dòng)董事長(zhǎng)兼CEO傅盛在自己的抖音號(hào)上發(fā)布了一條視頻。作為一名“科技樂觀主義者”,傅盛和世界上的另一個(gè)“自己”進(jìn)行了一場(chǎng)隔空對(duì)話。短短幾十秒里,機(jī)器人“傅盛”的對(duì)答、繞口令樣樣精通。即使是仔細(xì)辨別,你也很難確認(rèn)哪一個(gè)才是真正的傅盛。

能夠達(dá)到如此驚艷的效果,其實(shí)要?dú)w功于獵豹移動(dòng)旗下人工智能公司獵戶星空研發(fā)的語音合成技術(shù)。只要聽十段你的話,就可以克隆你的聲音,聽起來是不是很炫酷?

在人機(jī)交互的過程中,與用戶體驗(yàn)感直接相關(guān)的,就是語音合成技術(shù)。這項(xiàng)技術(shù)是將文字轉(zhuǎn)化為聲音,可以簡(jiǎn)單地理解為人類的嘴巴。大家在各種智能語音助手中聽到的聲音,都是由TTS來生成的。所以,讓TTS合成的語音能夠“以假亂真”,正是TTS領(lǐng)域長(zhǎng)期以來不斷探索的主題。

傳統(tǒng)的TTS都是怎么做的?

在看獵戶星空如何實(shí)現(xiàn)“以小取大”的效果時(shí),我們可以先看看以往的TTS是如何實(shí)現(xiàn)的。

傳統(tǒng)的TTS系統(tǒng)通常包括前端、后端兩個(gè)模塊。前端模塊主要負(fù)責(zé)對(duì)輸入文本進(jìn)行分析,提取語言學(xué)信息,如果是中文還涉及文本正則化、分詞、詞性預(yù)測(cè)、多音字消歧、韻律預(yù)測(cè)等,后端模塊根據(jù)前端的分析結(jié)果,通過一定的方法生成語音波形。

后端系統(tǒng)的主流技術(shù)有兩種,一種是基于統(tǒng)計(jì)參數(shù)建模的語音合成,或者叫做參數(shù)合成、參數(shù)法,優(yōu)點(diǎn)是所需語料庫少,幾千句即可,訓(xùn)練與合成過程也都可以由程序自動(dòng)完成,但缺點(diǎn)是語音質(zhì)量不高,情感韻律平淡。

現(xiàn)在大家地圖導(dǎo)航軟件中的聽到的明星音,針對(duì)導(dǎo)航場(chǎng)景錄制了幾千句的語料,不僅聲音生澀感強(qiáng),而且需要的成本和周期較長(zhǎng),在其他領(lǐng)域的聲音效果不是很好。如果用戶預(yù)期不苛刻,這樣一種方式也未嘗不可。

另一種是基于單元挑選和波形拼接的語音合成,或者叫做拼接合成、拼接法,與參數(shù)法相反,優(yōu)點(diǎn)是合成語音自然度很好,缺點(diǎn)就是數(shù)據(jù)要求太大,至少萬句語料才能滿足商用需求,一些廠商會(huì)請(qǐng)聲優(yōu)為其智能產(chǎn)品錄制語料庫,前后時(shí)間長(zhǎng)達(dá)數(shù)月,花費(fèi)動(dòng)輒幾百萬。

獵戶星空:十段話合成人聲

魚和熊掌不可兼得,傳統(tǒng)的TTS存在著或多或少的問題。所以這個(gè)領(lǐng)域的核心,在于如何降低訓(xùn)練成本,用更少的語料合成高質(zhì)量的聲音。

隨著人工智能、深度學(xué)習(xí)的應(yīng)用,TTS也迎來了新的變革。2017年3月,Google 提出了一種新的端到端的語音合成系統(tǒng):Tacotron。它可將接收的輸入字符,輸出成相應(yīng)的原始頻譜圖,然后提供給Griffin-Lim重建算法生成語音。2017年底,Tacotron 2結(jié)合了WaveNet和Tacotron的優(yōu)勢(shì),不需要任何語法知識(shí)即可直接輸出文本對(duì)應(yīng)的語音。

在已有的技術(shù)創(chuàng)新鋪墊下,獵戶星空TTS團(tuán)隊(duì)在Tactron的基礎(chǔ)上,訓(xùn)練了大語料庫的語音庫作為基礎(chǔ)模型,目標(biāo)發(fā)音人只需要錄制10段話,通過Adapt自適應(yīng)模型,提取出目標(biāo)發(fā)音人的特征,再通過World聲碼器,即可合成出目標(biāo)發(fā)音人音色相同的語音。

所以,這項(xiàng)技術(shù)真正落地商用后,將為明星語音、個(gè)性化語音的合成帶來重大突破,尤其是很大程度上減少明星音合成的成本、縮短應(yīng)用研發(fā)的周期。

想象一下,以后你的語音助手中住著你喜歡的明星或心愛的人,每天都可以和TA互動(dòng)聊天,仿佛TA就是你的私人小秘書,是不是有點(diǎn)小激動(dòng)呢?

除此之外,獵戶星空已掌握麥克風(fēng)陣列、語音喚醒、語音識(shí)別、語義理解和語音合成等全套遠(yuǎn)場(chǎng)語音技術(shù),語音交互更快更準(zhǔn),垂直領(lǐng)域深度語義理解正確率96%,還首創(chuàng)了喚醒后人聲回應(yīng)。

獵戶語音OS成為行業(yè)標(biāo)配

在上文提到技術(shù)能力支撐之下,獵戶星空打造了獵戶tts——這個(gè)星球最溫暖的AI聲音。目前獵戶語音OS技術(shù)已經(jīng)應(yīng)用到了小米小愛同學(xué)、美的小美AI音箱、喜馬拉雅小雅音箱、獵豹移動(dòng)小豹AI音箱、華為智能AI音箱等多家合作伙伴產(chǎn)品中,已經(jīng)成為行業(yè)標(biāo)配。

截至目前,搭載獵戶語音合成技術(shù)的智能音箱產(chǎn)品在國(guó)內(nèi)份額已超30%,每天都超過2000萬次語音服務(wù)請(qǐng)求,比如小米AI助理小愛同學(xué)月活躍設(shè)備超過3000萬臺(tái),累計(jì)喚醒超50億次。

10月15日,中國(guó)人工智能產(chǎn)業(yè)發(fā)展聯(lián)盟(AIIA)在人工智能開發(fā)者大會(huì)公布了國(guó)內(nèi)智能音箱智能化評(píng)級(jí)結(jié)果,包括獵豹移動(dòng)、小米、喜馬拉雅、百度、京東在內(nèi)的五家主流廠商攜其智能音箱產(chǎn)品參與了首批測(cè)試評(píng)估。獵戶語音OS占據(jù)了獲評(píng)產(chǎn)品前五強(qiáng)中的三席,支撐起了智能音箱市場(chǎng)的大半壁江山。

結(jié)合自身人機(jī)交互的產(chǎn)品基因和獵戶星空擁有的行業(yè)唯一的全鏈條AI技術(shù),獵豹移動(dòng)也在不同行業(yè)推動(dòng)人工智能產(chǎn)品的場(chǎng)景化落地。未來,獵豹移動(dòng)與旗下獵戶星空還會(huì)將自主研發(fā)的視覺、導(dǎo)航、語音、機(jī)械臂技術(shù)等核心能力逐步對(duì)外開放,與合作伙伴一起,讓機(jī)器人產(chǎn)品走進(jìn)大眾生活。

申請(qǐng)創(chuàng)業(yè)報(bào)道,分享創(chuàng)業(yè)好點(diǎn)子。點(diǎn)擊此處,共同探討創(chuàng)業(yè)新機(jī)遇!

相關(guān)標(biāo)簽
ai技術(shù)
智能音箱
手機(jī)克隆

相關(guān)文章

  • 甌江論道:AI賦能綠色發(fā)展

    2025年10月25日,2025世界青年科學(xué)家峰會(huì)之人工智能(AI)融合創(chuàng)新發(fā)展論壇在浙江溫州成功舉辦。本次論壇由國(guó)際院士科創(chuàng)中心主辦,中國(guó)投資協(xié)會(huì)能源投資專業(yè)委員會(huì)、溫港院士科創(chuàng)中心承辦,中國(guó)電工技術(shù)學(xué)會(huì)、中科先進(jìn)技術(shù)溫州研究院與溫州市電力工程學(xué)會(huì)提供支持,以“甌江論道-AI賦能綠色發(fā)展”為主題,

    標(biāo)簽:
    ai技術(shù)
  • 王通:未來個(gè)人創(chuàng)業(yè)的十個(gè)機(jī)會(huì)

    個(gè)人創(chuàng)業(yè)需要啟動(dòng)成本低、無需龐大團(tuán)隊(duì)、可快速驗(yàn)證、能利用個(gè)人技能或資源。這里分享適合個(gè)人創(chuàng)業(yè)的十個(gè)機(jī)會(huì)一.AI內(nèi)容優(yōu)化與本地化服務(wù)·做什么:幫助企業(yè)或個(gè)人利用AI工具(如GPT-4,Midjourney)優(yōu)化內(nèi)容生產(chǎn)流程。例如,為跨境電商撰寫多語言產(chǎn)品描述,為小紅書博主生成爆款文案,為小公司制作營(yíng)銷

  • 百度智能云PaddleOCR 3.1正式發(fā)布:關(guān)鍵能力支持MCP

    百度AI團(tuán)隊(duì)今日正式推出PaddleOCR3.1版本,以突破性的多語言組合識(shí)別(MultilingualCompositionPerception,MCP)技術(shù)為核心,徹底重構(gòu)復(fù)雜文檔處理邊界。此次升級(jí)標(biāo)志著OCR領(lǐng)域首次實(shí)現(xiàn)對(duì)同一文檔內(nèi)任意混合語言文本的精準(zhǔn)識(shí)別,為全球化企業(yè)、跨境業(yè)務(wù)及多元文化場(chǎng)

    標(biāo)簽:
    ai智能
    ai技術(shù)
  • AI工具導(dǎo)航網(wǎng)站,未來的發(fā)展前景怎么樣?

    導(dǎo)航網(wǎng)站的崛起:從信息過載到精準(zhǔn)觸達(dá)隨著全球AI工具數(shù)量爆發(fā)式增長(zhǎng)(2025年已超數(shù)萬款),用戶面臨前所未有的選擇困境。傳統(tǒng)搜索引擎的“關(guān)鍵詞-鏈接”模式難以應(yīng)對(duì)工具篩選的場(chǎng)景需求,垂直化、場(chǎng)景化的AI導(dǎo)航網(wǎng)站應(yīng)運(yùn)而生。這類平臺(tái)通過聚合、評(píng)測(cè)、分類與推薦四重機(jī)制,將分散的工具資源整合為結(jié)構(gòu)化入口。例

  • 微信AI搜索被指“強(qiáng)行開盒”:名字成了數(shù)據(jù)入口,騰訊回應(yīng)“僅用公開信息”

    當(dāng)微信公眾號(hào)文章中出現(xiàn)一個(gè)人的名字,它會(huì)自動(dòng)變成藍(lán)色鏈接,點(diǎn)擊即可查看AI生成的“個(gè)人簡(jiǎn)歷”——這一微信新功能讓不少用戶感到被“扒光”在互聯(lián)網(wǎng)上。近日,微信新上線的“AI搜索”功能陷入隱私泄露爭(zhēng)議漩渦。多位網(wǎng)友在社交平臺(tái)反映,當(dāng)微信公眾號(hào)推文中出現(xiàn)本人姓名時(shí),名字會(huì)自動(dòng)變?yōu)樗{(lán)色超鏈接,點(diǎn)擊即可瀏覽由

    標(biāo)簽:
    ai技術(shù)
    ai搜索
  • 弈動(dòng) Dynamic·數(shù)智躍遷 博弈無界|2025TechWorld智慧安全大會(huì)在京召開

    在數(shù)字化與智能化深度交織的時(shí)代浪潮中,安全的邊界不斷延展,技術(shù)的演進(jìn)正引領(lǐng)產(chǎn)業(yè)邁向新一輪變革。10月24日,以“弈動(dòng)Dynamic·數(shù)智躍遷博弈無界”為主題的2025TechWorld智慧安全大會(huì)在北京盛大召開。來自國(guó)家部委、院士學(xué)者、高校科研機(jī)構(gòu)和企業(yè)的權(quán)威專家與業(yè)界精英齊聚北京,共議AI安全、數(shù)

    標(biāo)簽:
    弈動(dòng)
  • 甌江論道:AI賦能綠色發(fā)展

    2025年10月25日,2025世界青年科學(xué)家峰會(huì)之人工智能(AI)融合創(chuàng)新發(fā)展論壇在浙江溫州成功舉辦。本次論壇由國(guó)際院士科創(chuàng)中心主辦,中國(guó)投資協(xié)會(huì)能源投資專業(yè)委員會(huì)、溫港院士科創(chuàng)中心承辦,中國(guó)電工技術(shù)學(xué)會(huì)、中科先進(jìn)技術(shù)溫州研究院與溫州市電力工程學(xué)會(huì)提供支持,以“甌江論道-AI賦能綠色發(fā)展”為主題,

    標(biāo)簽:
    ai技術(shù)
  • AI云“分野”:阿里云們“賣鏟”,火山引擎奇襲“MaaS”

    AI云“分野”:阿里云們“賣鏟”,火山引擎奇襲“MaaS”

    標(biāo)簽:
    阿里巴巴
  • 未來5年,中國(guó)AI的“大洗牌”和“內(nèi)循環(huán)”

    我覺得我們AI的目標(biāo)是:從芯片設(shè)計(jì)到軟件生態(tài),全鏈路自主開發(fā),建立可控的世界級(jí)AI體系。所以這是俺對(duì)未來5年中國(guó)AI圈的展望和判斷。(1)2026年,英偉達(dá)造車、國(guó)產(chǎn)開車26年國(guó)產(chǎn)芯片會(huì)在推理和垂直場(chǎng)景上發(fā)力。以DeepSeek為代表,大多數(shù)AI大模型會(huì)以軟件彌補(bǔ)硬件不足,所以訓(xùn)練和推理分開,訓(xùn)練就

  • H20芯片開賣即叫停,英偉達(dá)如何解圍?

    文/道哥在深陷“后門”風(fēng)波、接受網(wǎng)信辦問詢之后,英偉達(dá)的“特供版”H20芯片,又有了新消息。近日,美國(guó)科技媒體《TheInformation》援引知情人士消息稱,英偉達(dá)已悄然向其關(guān)鍵供應(yīng)商——包括負(fù)責(zé)封裝的安靠科技、供應(yīng)高帶寬內(nèi)存的三星電子、以及承擔(dān)后端處理的富士康發(fā)出指令,要求暫停所有與H20AI

    標(biāo)簽:
    英偉達(dá)
  • 真正的「國(guó)產(chǎn)英偉達(dá)」來了

    文/二風(fēng)來源/節(jié)點(diǎn)財(cái)經(jīng)一場(chǎng)關(guān)于“中國(guó)芯”的IPO審議,正把投資者們的目光鎖定在上交所。根據(jù)上交所發(fā)布的公告,上市審核委員會(huì)已定于9月26日審議摩爾線程的科創(chuàng)板首發(fā)申請(qǐng)。作為中國(guó)半導(dǎo)體自主化浪潮中最受矚目的“考生”之一,包括其創(chuàng)始人顯赫的英偉達(dá)背景、高達(dá)80億元人民幣的募資雄心,以及在國(guó)產(chǎn)GPU領(lǐng)域取

    標(biāo)簽:
    英偉達(dá)