中國發展改革報社記者杜壯
随着全球新一輪AI熱潮來臨,大量訓練數據已成為AI算法模型發展和演進必不可少的關鍵一環。數據的數量越多、質量越高,模型的訓練和性能優化就越充分、性能就越好,高質量的AI數據将助力人工智能應用具備更強大的服務能力。
9月6日,在2023年中國國際服務貿易交易會(以下簡稱“服貿會”)期間,雲測數據基于多年經驗積累,在去年服貿會發布的“AI工程化的數據解決方案”基礎上全面升級,面向垂直行業大模型提供全生命周期的AI數據解決方案,為大模型應用落地提供關鍵支撐。
雲測數據相關負責人介紹,雲測數據通過數據采集、數據清洗、數據标注等方式為企業引入AI數據處理,以标準API接口支持數據導入和導出、支持已有算法預标注功能。公司可以提供多項AI數據産品應用和AI數據服務,完成從原始數據到标注數據的快速積累,加速AI模型的開發進程。
2023年,受ChatGPT驅動,大模型發展邁向新階段,國産大模型一時間呈現出爆發式增長态勢。據相關機構統計,2023年1-7月,共計有64個大模型發布。截至2023年7月,中國累計已經有130個大模型問世。
當前大模型在各領域中百花齊放,但大模型産業化仍面臨諸多挑戰。值得注意的是,AI的突破将得益于高質量數據,這是大模型性能提升、行業應用落地的關鍵。如何獲取、使用垂直行業的高質量AI數據成為關鍵核心。
實際上,數據标注的标準和質量直接關系到機器學習模型的準确性和效率。與此同時,體積龐大的原始數據需要進行篩選、處理和标注等多項繁瑣工作,并且這些工作也需要耗費大量時間和人力成本。規劃有效的數據标注流程,可以較大程度地減少數據處理和标注的時間成本,同時提升工作效率,縮短機器學習模型開發的周期。
據悉,此次雲測數據發布的面向垂直行業大模型AI數據解決方案,注重三大能力的培養,即為持續預訓練賦能、定向垂直場景能力,基于下遊任務微調的人機耦合标注能力,以及基于定向垂直領域人員測試能力。
作為一家在企業級服務領域深耕多年的公司,雲測數據核心是以高質量、場景化的AI訓練數據服務為基礎,為人工智能相關企業提供通用數據集、數據标注平台&數據管理工具、數據采集/數據标注等服務,助力AI實現産業化落地。雲測數據面向垂直行業大模型AI數據解決方案可以為行業客戶深度定制數據采集方案,助力獲取高價值數據,同時在面對微調任務會根據大模型落地場景特點,提供包含QA-instruct、prompt等文本類任務項目和多模态大模型的相關能力支持。在完成微調後,雲測數據通過垂直領域的人員和專家積累+評測體系和服務,幫助企業對各個垂直應用落地領域進行評估。并通過以集成數據底座為核心的數據标注平台,将難例數據回流完成清洗标注,為更有效率的模型調優做準備。
目前,很多專注于垂直領域的科技公司也在探索特定領域的行業大模型,中國行業大模型覆蓋領域較為豐富,其中商業、金融、醫療等領域的行業大模型探索較多。高效率、高質量的AI數據解決方案,一定程度上将推動産業加速落地。以汽車智能駕駛行業為例,雲測數據近日推出的智能駕駛AI數據解決方案2.0面向智能駕駛領域不同落地場景下的高質量AI訓練數據需求,相較于1.0版本,解決方案2.0以集成數據底座為核心,在數據閉環能力、自動标注能力、數據管理工具鍊、人工效能評估等多方面進行了全方位升級。這一解決方案對駕駛領域,特别是在加速自動駕駛場景化落地、用戶體驗提升等方面具有積極意義。
随着人工智能深入自動駕駛、智慧醫療、智慧教育等諸多行業領域,AI算法對訓練數據維度和樣本複雜性的要求變得越來越高,對數據标注技術、标注平台能力、不同維度數據協同标注等都提出了挑戰。
雲測數據總經理賈宇航表示,當前,大模型正處在産業落地前期,高質量的數據是大模型實現産業化的關鍵要素。隻有化地發揮AI訓練數據的價值,推動數據要素有序發展及高效利用,才能更好地幫助垂直行業相關企業可以更好的落地大模型相關算法應用。
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

