近日,第十九屆全國人機語音通訊學術會議 (NCMMSC 2024) 在新疆烏魯木齊成功舉辦。标貝科技攜語音數據産品亮相大會,并在工業論壇發表關于大模型數據标注服務的主題演講,和現場嘉賓探讨最前沿的語音領域數據方向以及語料庫建設成果。

本次會議由中國計算機學會和中國中文信息學會聯合主辦,通過大會報告、教程報告、青年學者論壇、學生論壇、企業論壇、特殊議題讨論、産品和技術展示等活動形式,吸引了包括中國移動研究院、中國科學院自動化研究所、清華大學、西北工業大學、新疆大學等高校以及頭部科技企業參與,共同探讨人機語音通訊技術的研究成果和應用前景。
會議期間,與會專家學者圍繞人機語音通訊技術的發展趨勢、關鍵技術、應用場景等方面展開了深入的交流與讨論。多位知名專家分别就語音識别、語音合成、情感計算、多模态交互等熱點問題發表主題報告,展示了人機語音通訊技術的進展。
标貝科技數據事業部副總經理吳本谷受邀做了《大模型場景下的數據标注》主題演講,分享了大模型産業中訓練數據的發展趨勢和機遇,以及标貝科技大模型數據平台能力和場景應用的實踐經驗。
在大模型場景下,高質量的數據集是模型成功的關鍵。吳本谷表示,語音大模型的研發過程中,數據集的質量直接決定了模型的訓練效果與最終性能。标貝科技結合強大的AI技術研發能力,推出覆蓋數據采标、管理、模型訓練與優化、部署與應用全流程服務的AI數據平台,為AI算法提供必需的語料資源,以提升大模型的性能和應用效果。
作為一款成熟的人機協同标注工具平台,标貝科技AI數據平台集标注工具、預标注模型、項目管理為一體,具備智能化的多模态數據标注處理能力,智能化提升數據标注效率70%以上,高效解決AI落地場景多樣性、複雜性的數據需求。
此外,标貝科技依托豐富的數據項目資源積累,形成了大批量自有産權的多模态預訓練語料庫和精調語料庫。涵蓋近百語種和方言,包括超10萬小時語音識别數據庫以及4000小時語音合成數據庫,廣泛應用于語音助手、智慧金融、智能客服、智能座艙、數字虛拟人等領域。
在本屆 NCMMSC 中,标貝科技集中展示了語音數據服務領域的創新産品,包括兩萬小時音頻數據、兩千人語音大模型數據、多人情感合成數據、中英混多音色情感合成數據等,吸引了現場衆多專家學者前來互動交流。

随着AI技術的快速發展,高質量數據集成為提升大模型性能不可或缺的基石。标貝科技将繼續聚焦大模型數據解決方案,以技術創新為引擎,持續優化一站式數據大模型處理平台能力,通過精準、可靠的數據資源,為客戶提供專業化、場景化、個性化的數據服務,加速推動大模型研發與落地應用。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

