女人自慰AV免费观看内涵网,日韩国产剧情在线观看网址,神马电影网特片网,最新一级电影欧美,在线观看亚洲欧美日韩,黄色视频在线播放免费观看,ABO涨奶期羡澄,第一导航fulione,美女主播操b

0
  • 聊天消息
  • 系統消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發帖/加入社區
會員中心
創作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

語音識別是如何識別出各地方言的

454398 ? 來源:ST社區 ? 作者:ST社區 ? 2022-12-20 18:08 ? 次閱讀

來源:ST社區

語音對于人機交互的重要性毋庸置疑,無論是國內外企業,都在 語音識別 的速度、準確度以及多語種方面持續創新,但是當機器面對那些有 口音 的人來說,似乎就沒有那么靈敏了:不僅注意力會不集中,反應遲鈍,甚至還會成為一個獨立的個體,不予任何回應。如何解決口音識別問題,已成為智能語音下一階段的競爭焦點,但這不僅僅是單純的增加語料庫就能提升的,好在已經有少數公司,開始通過構建新的語音模型,來解決口音問題。

自IBM的Shoebox與Worlds of Wonders的Julie Doll問世以來,語音識別技術已經取得了長足進步。甚至有報道稱,到2018年底,谷歌Google Assistant將支持超過30種語言。除此以外,高通已經開發出了一款能夠識別單詞和短語的語音識別設備,準確率高達95%。而微軟也不甘示弱,其呼叫中心解決方案(智能語音客服)比人工展開的呼叫服務更準確,更高效。

但需要注意的是,盡管在機器學習的加持下,語音識別技術取得了巨大的進步,但現在的語音識別系統還是不完美的。比如,不同地區的口音,讓這項技術擁有了很強的“地域歧視性”。通常情況下,口音對人類來說不是什么大問題,有時還會讓人感覺到一種異國風情的魅力,但是對機器而言,這是一條難以跨越的鴻溝,可能是其發展過程中面臨的最大挑戰。

研究顯示口音是語音識別技術的挑戰之一

此前,華盛頓郵報與Globalme和Pulse Labs兩家語言研究公司合作,對搭載了語音識別技術的智能音箱設備的口音問題進行了研究,研究范圍來自美國近20個城市、超過100名參與者發出的數千條語音命令,結果顯示,這些系統在理解來自不同地區的人的語言時存在顯著差異。

舉個例子,谷歌智能音箱Google Home識別西岸口音的準確率比識別南方口音高3%;而亞馬遜語音助手Alexa識別中西部的口音的準確率要比東岸口音低2%。但面臨最大問題的是持非本土口音的人:在一項研究中,通過對比Alexa識別的內容與測試組的實際話語,結果顯示不準確率可達30%。此外,面對以西班牙語和漢語作為第一語言的人所說的英文,不管是Google Home還是Amazon Echo,其識別率都是最低的,要知道,拉丁裔和華裔是美國的兩大移民族群。

雖然這項研究是非正式的,也存在一定的限制,但其結果還是表明口音仍是語音識別技術面臨的主要挑戰之一。對此,亞馬遜在一份聲明中稱,“隨著越來越多的擁有不同口音的人與Alexa進行交流,Alexa的理解能力也會得到改善。”同時,谷歌也表示,“在擴大數據集的同時,我們也將繼續提高Google Home的語音識別能力。”

事實上,不只是Amazon Echo和Google Home,采用率更低一些的微軟Cortana和蘋果Siri也是如此,它們都需要及時提高自家的語音識別技術,以便讓用戶感到滿意的同時,又能在全球范圍內擴大自己的影響力。

即使增加語料庫,也無法解決口音識別問題

隨著人工智能的發展,語音已經成為了人與計算機交互的核心方式之一,所以即使理解上有極其微小的偏差,也可能意味著一個巨大的障礙。也就是說,這種語言差異可能會給那些現代科技的基礎系統帶來潛在的隱患,畢竟除了廚房和起居室,智能音箱在用戶的工作場所、學校、銀行、醫院以及酒店等地方也承擔著越來越重要的責任,除了控制設備還要傳遞信息,并完成一些預訂和購物工作等。

為了改善語音助手的口音識別情況,亞馬遜與谷歌等正在投入資源,用新的語言和口音訓練測試系統,包括創建游戲以鼓勵大家使用不同地區的 方言 進行交談。而像IBM和微軟這樣的公司,都會通過Switchboard語料庫來降低語音助手的出錯率。但是事實證明,語料庫也無法徹底解決語音助手的口音識別問題。

對此,埃森哲全球責任AI監理Rumman Chowdhury表示,“數據是混亂的,因為數據反映了人性。這就是算法最擅長的:尋找人類的行為模式。”

算法的這一情況被稱為“算法偏差”,用于反應機器學習模型對數據或設計產生的偏見程度。比如,現在有很多報告都顯示了面部識別技術的敏感性——尤其是亞馬遜AWS的圖像識別技術Rekognition——有很大的偏見傾向。此外,算法偏差還會出現在其他方面,像預測被告是否會在未來犯罪以及Google News等應用背后的內容推薦算法。

構建語音識別模型,提升方言識別率

雖然已經有不少巨頭針對算法偏見提出了解決方案,比如微軟、IBM、Facebook、高通和埃森哲等已經開發出了自動化工具,用于檢測AI算法中的偏見,但很少有企業針對語音識別技術面臨的口音問題提出具體的解決方案。對此,Speechmatics和Nuance成為了少數者之一。

Speechmetrics是一家專門從事企業語音識別軟件的劍橋科技公司,12年前就開始展開一項雄心勃勃的計劃,旨在開發比市場上任何產品都更準確,更全面的語言包。據了解,研究之初,該公司的主要工作是統計語言建模和循環神經網絡,并以此開發出了一種可以處理內存輸出序列的機器學習模型。

2014年,Speechmetrics通過一個10億字節的語料庫加速了其統計語言建模的進展,到2017年與卡塔爾計算研究所(QCRI)合作開發阿拉伯語言的文字轉換服務,可以說,這是該公司取得的一個里程碑式的進展。

而到了今年7月,該公司再次有所突破——成功研發了一款語音識別系統Global English,包括了全球40多個國家的數千小時的語音數據和數百億單詞,可支持“所有主要”英語口音的語音文本轉換。另外,這個系統是建立在Speechmatic的Automatic Linguist的基礎上,這是一個AI框架,通過利用已知語言中識別的模式來學習新語言的語言基礎。

而在特定的口音測試中,Global English的表現要優于谷歌的Cloud Speech API以及IBM Cloud中的英語語言包中。Speechmatic聲稱,在高端領域,該系統的準確率比其他產品還要高23%到55%。

但Speechmatics并不是唯一一家想要解決口音識別問題的公司。

總部位于馬薩諸塞州的Nuance表示,該公司正在采用多種方法確保其語音識別模型能夠以同樣的準確率來識別大約80種語言。

舉個例子,在其英語語音識別模型中,該公司收集了20個特定方言區域的語音和文本數據,包括每種方言的特有單詞及其發音。因此,Nuance的語音識別系統可以識別出單詞“Heathrow”的52種不同變體。

最近Nuance的語音識別系統也有了很大的提升。較新版本的Dragon是該公司發布的定制語音到文本軟件套件,所使用的機器學習模型,可根據用戶的口音在幾種不同的方言模型之間自動切換。另外,與沒有自動切換功能的舊版本相比,新版對帶有西班牙口音的英語識別的準確率要高22.5%,對于美國南部的方言來說,準確率要高16.5%,對于東南亞的英語口音的準確率要高17.4%。

事實上,研究人員很早之前就發現了語音識別面臨的口音問題。對此,語言學家和AI工程師紛紛表示,非本地語言通常是很難進行訓練的,因為語言之間的模式要一多種不同的方式進行切換。同時,語境也很重要,即使是細微差別也會改變對話雙方的反應。但可以肯定的是,缺乏多樣性的語音數據最終可能會無意中導致“地域歧視”的發生。也就是說,語料庫中語音樣本的數量和多樣性越高,得到的模型就越準確——至少在理論上是這樣。

當然,這也不僅僅是美國企業需要解決的問題。百度硅谷辦事處的高級研究員Gregory Diamos曾說,該公司面臨著自己的挑戰,即開發一款可以理解許多中國地方方言的人工智能。此外,很多工程師也表示,口音對于致力于開發那種不僅可以回答問題,還能隨意進行自然對話的軟件公司來說,是最嚴峻的挑戰之一。

審核編輯 黃昊宇

聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規問題,請聯系本站處理。 舉報投訴
  • 語音識別
    +關注

    關注

    39

    文章

    1773

    瀏覽量

    113855
收藏 人收藏

    評論

    相關推薦
    熱點推薦

    語音識別技術在通信領域中的應用實例

    語音識別技術也被稱為自動語音識別(Automatic Speech Recognition,ASR),是通過計算機對語音信號進行分析和
    的頭像 發表于 02-21 17:12 ?539次閱讀

    詳解語音識別技術在通信領域中的應用

    語音識別技術也被稱為自動語音識別(Automatic Speech Recognition,ASR),是通過計算機對語音信號進行分析和
    的頭像 發表于 02-21 17:05 ?649次閱讀
    詳解<b class='flag-5'>語音</b><b class='flag-5'>識別</b>技術在通信領域中的應用

    NRK3502系列芯片 | 制氧機離線語音識別方案

    NRK3502芯片制氧機離線語音識別方案制氧機離線語音識別方案是基于NRK3502藍牙雙模智能語音IoT芯片,依托于九芯電子在
    的頭像 發表于 12-04 01:02 ?378次閱讀
    NRK3502系列芯片 | 制氧機離線<b class='flag-5'>語音</b><b class='flag-5'>識別</b>方案

    語音識別與自然語言處理的關系

    在人工智能的快速發展中,語音識別和自然語言處理(NLP)成為了兩個重要的技術支柱。語音識別技術使得機器能夠理解人類的語音,而自然語言處理則讓
    的頭像 發表于 11-26 09:21 ?1192次閱讀

    語音識別技術的應用與發展

    語音識別技術的發展可以追溯到20世紀50年代,但直到近年來,隨著計算能力的提升和機器學習技術的進步,這項技術才真正成熟并廣泛應用于各個領域。語音識別技術的應用不僅提高了工作效率,也極大
    的頭像 發表于 11-26 09:20 ?1439次閱讀

    ASR與傳統語音識別的區別

    ASR(Automatic Speech Recognition,自動語音識別)與傳統語音識別在多個方面存在顯著的區別。以下是對這兩者的對比: 一、技術基礎 ASR : 基于深度學習算
    的頭像 發表于 11-18 15:22 ?1150次閱讀

    ASR語音識別技術應用

    ASR(Automatic Speech Recognition)語音識別技術,是計算機科學與人工智能領域的重要突破,能將人類語音轉換為文本,廣泛應用于智能家居、醫療、交通等多個領域。以下是對ASR
    的頭像 發表于 11-18 15:12 ?1797次閱讀

    物聯網系統智能控制產品的語音識別方案_離線語音識別芯片分析

    01 物聯網系統中為什么要使用離線語音識別芯片 物聯網系統中使用離線語音識別芯片的原因主要基于以下幾個方面: 1、實時性與可靠性 實時性好:離線語音
    的頭像 發表于 09-26 17:56 ?1311次閱讀
    物聯網系統智能控制產品的<b class='flag-5'>語音</b><b class='flag-5'>識別</b>方案_離線<b class='flag-5'>語音</b><b class='flag-5'>識別</b>芯片分析

    WTK6900FC語音識別模塊

    語音識別
    WT-深圳唯創知音電子有限公司
    發布于 :2024年09月25日 17:35:07

    唯創知音WT2605C用在離在線語音識別方案# #語音芯片 #語音識別 #唯創知音

    語音識別
    WT-深圳唯創知音電子有限公司
    發布于 :2024年09月12日 17:24:28

    什么是離線語音識別芯片?與在線語音識別的區別

    離線語音識別芯片適用于智能家電等,特點為小詞匯量、低成本、安全性高、響應快,無需聯網。在線語音識別功能更廣泛、識別準確率高,但依賴穩定網絡。
    的頭像 發表于 07-22 11:33 ?783次閱讀

    ESP32-WROOM跑了官方的語音識別中的asr例程,但是切換到語音識別就會出錯的原因?

    我是用的是ESP32-WROOM芯片,用的Vscode+IDF+ADF,我跑了一下官方的語音識別中的asr例程,但是我發現,語音喚醒可以,但是一旦切換到語音
    發表于 07-19 08:27

    有效提升智能會議系統語音識別準確性案例分享

    。多語言支持的語音識別技術還可以準確識別不同語言和方言,對于夸全球交流的國際會議必不可缺。語音識別
    的頭像 發表于 06-21 11:15 ?661次閱讀
    有效提升智能會議系統<b class='flag-5'>語音</b><b class='flag-5'>識別</b>準確性案例分享

    有效提升智能會議系統語音識別準確性案例分享

    。多語言支持的語音識別技術還可以準確識別不同語言和方言,對于夸全球交流的國際會議必不可缺。語音識別
    的頭像 發表于 06-21 11:13 ?755次閱讀
    有效提升智能會議系統<b class='flag-5'>語音</b><b class='flag-5'>識別</b>準確性案例分享

    中國電信發布首個支持30種方言混說語音大模型

    中國電信人工智能研究院(TeleAI)近日發布了一項引領業界的語音識別技術——星辰超多方言語音識別大模型。這一模型突破性地支持30種方言的自
    的頭像 發表于 05-28 09:14 ?798次閱讀