AutoWSL2019 作為 11 月17- 19 日亞洲機器學習大會(ACML)主會議競賽單元之一,由第四範式、ChaLearn、RIKEN和微軟聯合舉辦,其中競賽分享和頒獎将與大會WSL-Workshop共同舉辦。據悉,AutoWSL是繼AutoCV、AutoCV2、AutoNLP、AutoSpeech之後的第 5 屆自動深度學習(AutoDL)挑戰賽,比賽已于 9 月 24 日正式開始。本次挑戰賽聚焦于弱監督學習相關任務的自動化解決方案,參賽者需要設計自動機器學習程序完成半監督學習、正例及未标記學習和噪聲标記學習三個熱門方向任務,解決不同應用領域的二分類問題。
現代機器學習正在向複雜模型(如深度神經網絡)的時代遷移,而複雜模型需要大量的優質标注數據。大公司有足夠的資源來收集優質的标注數據,然而對于初創公司或非營利組織來說,标記數據的高昂成本隻能讓他們望而卻步。此外,在特定領域的數據存在自然稀缺性(如阿爾茨海默病或地震預測等),優質的标注數據可能根本不存在。弱監督學習(WSL)方法試圖通過訪問比監督學習更少的标注信息,來達到監督學習相近的效果目标。正因為WSL不需要大量的标注數據,促使大家對弱監督學習進行研究和關注,以期望讓更多的用戶和企業享受低門檻的機器學習紅利。但傳統的弱監督學習方法有太多的超參數需要根據問題進行調整,需要付出衆多人力才能成功部署弱監督學習方法,而我們希望召集來自全球各地的參賽者一起通過自動化解決方法破解這一難題,降低弱監督學習方法的使用門檻。
本次賽事主要負責人、第四範式主任科學家塗威威表示:第四範式接觸到的現實業務中有非常多的弱監督學習場景,有效的自動弱監督學習方法對于規模化解決這些場景中的機器學習問題至關重要。第四範式聯合南京大學提出了自動半監督學習(AutoSSL)以及自動正例及未标記學習(AutoPU)等方法。但是相關的研究才剛剛起步,舉辦本次比賽也是希望吸引更多的研究人員和從業人員關注到自動化弱監督學習的問題,一起推動這個領域的技術進步,從而幫助更多的行業利用機器學習技術提升效益。
關于比賽
本次比賽是國際首屆自動弱監督學習競賽,旨在為與弱監督學習相關的任務提供自動化的解決方案,挑戰任務僅限于來自不同應用領域的二分類問題。大會為參賽者提供 3 個練習數據集,用于開發自動弱監督學習程序。随後,該程序将在無人工幹預的情況下在 18 個私有驗證數據集上進行反饋測試,選手可以通過驗證數據集上的反饋結果調整程序;最後在 18 個私有測試數據集上進行測試評估,測試結果将決定最終的競賽排名。
在AutoWSL競賽中,我們将重點關注弱監督學習中的三個熱門任務,即半監督學習(有些樣本是未标記的)、正例及未标記學習(樣本隻有正例或未标記,沒有負例)和從噪聲标記中學習(所有樣本都有标記,但有些标記可能是錯誤的)。這三個任務互不關聯,不會同時出現在同一個數據集中。另外,組委會提供輔助信息幫助參賽者确定他們需要在每個數據集上執行的任務。
賽事挑戰:
AutoWSL将對參賽者提出新的挑戰,如下所列:
-如何自動處理各種弱監督學習任務?
-如何為不同的任務自動提取有用的特征?
-如何自動處理不同數量的監督信息?
-如何自動設計有效的學習模型來處理各種結構化數據?
此外,參賽者還應考慮:
-如何自動和有效地選擇适當的超參數?
-如何提高解決方案通用性?即如何保證解決其在未知任務中的适用性?
-如何控制計算和内存成本?
賽制 介紹
本次比賽準備了總共 39 個分類數據集,參賽者首先下載三個可以下載的練習數據集,以便其可以離線開發他們的自動弱監督解決方案。此外,另外 18 個驗證數據集也提供給參與者,以評估其解決方案的公共排行榜分數。之後,解決方案将在沒有人工幹預的情況下用 18 個私有測試數據集盲測評估。
數據集
這一挑戰僅限于來自不同應用領域的二分類問題,競賽将重點關注WSL中的三個熱門任務,即半監督學習(部分樣本未标記)、正例及未标記學習(樣本隻有正例或未标記樣本,沒有負例)和從噪聲标簽中學習(所有樣本都有标記,但部分标簽可能是錯誤的),這三個不相交的任務不會同時出現在單個數據集中。
競賽 規則
這項挑戰分為三個階段。首先,參賽者将獲得可以下載的練習數據集,以便可以離線開發他們的AutoWSL程序;然後進入反饋階段,參賽者将AutoWSL代碼上傳到競賽平台上,程序将在 18 個驗證數據集中測試,并得到其方法性能的即時反饋。反饋階段結束後,競賽進入檢查階段,參與者隻允許在私有數據集上提交一次代碼以進行調試,該階段參賽者無法讀取閱讀詳細的日志,但可以查看代碼是否報告錯誤。最後進入最終階段,參賽者提交的程序将在 18 個私有測試數據集上進行評估。最終階段的排名将決定獲勝者。
提交的程序代碼是自動訓練和測試的,無需任何人工幹預。在反饋階段提交的代碼在所有 18 個反饋數據集上并行地運行在單獨的計算機上,每個數據集都有測試時間限制。
平台上用于測試的數據集的所有信息将被隐藏,數據将以原始形式提供(沒有特征提取),以鼓勵研究人員進行自動特征學習,所有問題都是二分類問題,任務完成受時間限制。
有關比賽更多詳細信息,請訪問比賽官方平台“第四範式”官網,進入“學術活動”頁面。
賽事時間:
北京時間(UTC+8)
2019 年 9 月 24 日23:59:反饋階段開始,練習數據集的發布。參賽者可以開始提交代碼并在排行榜中獲得即時反饋。
2019 年 10 月 22 日23:59:參賽者真實身份驗證。
2019 年 10 月 29 日23:59:反饋階段結束。
2019 年 10 月 30 日00:00:檢查階段開始。
2019 年 11 月 2 日19:59:檢查階段結束。
2019 年 11 月 2 日20:00:最終階段開始。
2019 年 11 月 4 日20:00:重新提交截止日期。
2019 年 11 月 6 日20:00:最終階段結束。
請注意,CODALAB平台使用UTC時間格式,請注意比賽官網其他地方的時間說明,以免錯過比賽各階段的時間點。
賽事獎勵:
第一名:$2000
第二名:$1500
第三名:$500
免責聲明:本文僅代表作者個人觀點,與每日科技網無關。其原創性以及文中陳述文字和内容未經本站證實,對本文以及其中全部或者部分内容、文字的真實性、完整性、及時性本站不作任何保證或承諾,請讀者僅作參考,并請自行核實相關内容。
本網站有部分内容均轉載自其它媒體,轉載目的在于傳遞更多信息,并不代表本網贊同其觀點和對其真實性負責,若因作品内容、知識産權、版權和其他問題,請及時提供相關證明等材料并與我們聯系,本網站将在規定時間内給予删除等相關處理.

