跳至主要內容

數據公益的未來…

2024年1月18日

 

如何縮小數據擁有者和數據匱乏者之間的差距

兩位利用數據造福社會的專家分享了成功案例,並探討如何擴大人才儲備,以確保每個人都能從數據科學中受益。

維姬·海曼

萬事達卡通訊總監

在印度,小農戶透過使用冷庫來減少收成損失並提高售價。冷庫與行動應用程式相連,可以即時追蹤農產品的保質期,實現數位化庫存管理

在莫三比克,許多工人透過在釘在樹上的木板上塗寫電話號碼來發布求職廣告。現在,他們可以直接透過手機獲取勞動力市場信息,還可以使用各種工具來提高他們的行銷和業務管理技能。

研究人員在審查哥倫比亞、墨西哥和印度的銀行貸款記錄時發現,未來對女性申請者有很高的歧視風險。現有數據中女性代表性不足,導致用於識別有信用資質申請人的演算法出現偏差。所以他們建造了一個性別平等的新建築。

十年前,這一切都不可能發生。但連網設備的興起和資料量的指數級增長,再加上人工智慧和機器學習的快速發展,釋放了資料科學的潛力。然而,直到最近,各國政府、非營利組織和公民組織都缺乏足夠的預算、人員和能力來充分利用數據科學來幫助更多的人。

data.org 萬事達卡包容性成長中心 洛克斐勒基金會 於 2020 年創立。透過與世界各地的合作夥伴建立聯繫,利用數據科學解決社會最迫切的問題,從而實現數據的民主化。其舉措包括:包容性成長和復甦挑戰,該挑戰資助了突破性數據促進社會公益的概念,包括上述三個概念;以及能力加速器網絡該網絡旨在通過遍布 20 多個國家(且數量還在增加)的中心,到 2032 年培訓一百萬名數據專業人員。萬事達卡將繼續支持 data.org,協助其透過大規模數據科學加速產生影響。

「數據有可能擴大富人和窮人之間的差距,」包容性成長中心創始人兼總裁沙米娜·辛格說。“我們需要繼續進行必要的工作,以確保數據科學在社會影響方面能夠創造包容性增長。”

萬事達卡新聞編輯室採訪了辛格和 data.org 的執行董事丹尼爾·米哈伊洛夫,探討瞭如何應對新興的社會影響數據領域面臨的挑戰,為什麼多樣性對於人才培養至關重要,以及他們在哪些方面取得了成功。

沙米娜,你在中心的工作旨在減少經濟不平等,縮小加劇這種不平等的數位落差。此外,還存在資訊不平等問題。什麼是「數據鴻溝」?它在中心開展工作的社區中是如何體現的?

辛格:數據就是力量,我們現在看到的圍繞人工智慧的巨大競爭就是最好的證明。我們需要牢記的是,那些在數據獲取方面處於劣勢的人,往往也是最能從數據獲取中受益的人。資訊不平等是指資訊具有巨大的力量和巨大的用途,那些能夠獲取資訊的人可以真正加速自身的發展,而那些無法獲取資訊或沒有能力獲取資訊的人則可能會被拋在後面。這與我們在普惠金融領域看到的情況相符,隨著越來越多的人進入數位經濟,我們看到越來越多的人被落下。

我們正努力透過數據驅動的舉措和有意識地實施新技術來彌合這些差距,並將包容性放在首位。我們在中心所做的是為社會部門創造能力,使其能夠認識到自身數據的力量,並將其用於造福社會。這就是此次合作和創建 data.org 的基礎——真正創建一個新的機構,一種利用新技術和新數據資源進行這項工作的新方法。

Danil,一年前,data.org 發布了一份報告,闡述了社會影響資料領域日趨成熟過程中的關鍵趨勢和矛盾。組織目前仍面臨哪些挑戰?有進展嗎?自從生成式人工智慧在過去一年普及以來,是否有任何新的進展出現?

米哈伊洛夫:沙米娜,我喜歡你對資訊不平等的描述:擁有數據的人和沒有數據的人。這仍然是現實。差距並沒有縮小。差距正在擴大。我們正在努力降低差距擴大的速度,並取得了一些進展。幾十年來,甚至幾個世紀以來,我們一直在不同領域使用數據。包括新一代人工智慧在內的當前一代資料科學技術非常新穎,變化也非常迅速,導致該領域非常分散。每個人都在推出自己的新創公司或新工具和新方法,這意味著很難將這個領域聚集起來,共同應對一些共同的挑戰。至於社會影響數據或影響人工智慧的定義——這些都是新術語,該領域尚未就其含義達成共識。data.org 正在做的是將該領域的許多參與者——社會影響組織、科技公司和新創公司、學術機構等——聚集在一起,圍繞我們對它們的定義展開討論。

你能舉個例子嗎?

米哈伊洛夫:我們做了很多工作來定義我們認為該領域缺少的一個角色——資料生態系統設計師。我們認為,從根本上講,要建立更健康的數據生態系統,我們需要找到那些致力於將各個組織圍繞某些原則團結起來的人。就像城市規劃一樣——建造一個擁有良好公共空間和私人空間、建築風格平衡的健康城市——你需要一個負責人。因此,我們一直在與其他組織合作,共同圍繞「符合倫理的資料生態系統設計」這一理念開展工作。那我們就需要解決資金問題。這項工作需要投入大量精力,而萬事達卡一直在為這類工作建立可持續的資金來源。科技產品價格昂貴。這是無法避免的。當你建構數據科學技術時,你是在與世界上的其他大型科技公司競爭。因此,我們所做的實際上是顛覆這種模式,透過與大型科技巨頭合作,將它們與社會影響力領域聯繫起來,提供一個管道來幫助該領域,並讓它們利用自身實力來幫助提升他人。

在萬事達卡普惠成長中心的支持下,data.org 的美國金融包容加速器透過一個包括傳統黑人學院和大學、西班牙裔服務機構和社區學院在內的聯盟,推進有關數據社會影響的課程。

我們希望確保新興技術,例如生成式人工智慧,從一開始就成為發展的一部分。從一開始就將包容性放在第一位。

Shamina Singh

為了實現這一目標,我們正在努力確保透過與 HBCU 網路和西班牙裔服務機構等機構的合作,提供培訓並建立數據科學領域的多樣性,以確保我們與這些解決方案旨在支持的人一起建設,而不僅僅是為這些人建立。這與通常情況有所不同,通常情況下,擁有數據或技術的人會首先獲得訪問權限,然後技術才會普及到其他人,而其他人不得不使用一些不一定是為他們而設計的東西。我們希望確保新興技術,例如生成式人工智慧,從一開始就成為發展的一部分。從一開始就將包容性放在第一位。

當你回想你透過 data.org 支持過的那些計畫時,你認為最能體現數據向善力量的例子是什麼?

米哈伊洛夫:我作弊,要兩個球。所以一個例子是真正高端的、全球性的,而另一個例子則更偏向在地化。因此,在高端層面上, Epiverse是一個全球合作組織,致力於開發數據分析生態系統,幫助每個人提前應對下一次公共衛生危機。它的目標是為公共衛生分析師、資料科學家、流行病學家等群體創建一套開源工具。顯然,這是受到疫情的啟發;我們需要在全球範圍內採取行動,並且需要能夠迅速分享見解。目前已涵蓋六個國家,預計在未來幾年內,還將擴展到另外 10 到 20 個國家。然後我會選擇我們的“包容性成長與復甦挑戰”,我們支持了世界各地的九個優秀項目,每個項目都位於非常具體的當地環境中,由當地社區推動,並產生了持久的影響。例如,幫助美國社區利用其城市棕地數據來幫助社區對這些土地進行改造。

辛格:讓我在此基礎上繼續說下去。包容性成長與復甦挑戰的重要性在於,我們希望創造對數據科學在社會影響方面的需求和供給,這是一個相對較新的概念。我們的目標是利用資金支持選定的獲獎者,幫助他們擴大規模並獲得進一步的投資,以便在發展他們自身使命的同時,也發展我們的使命。判斷它是否成功的標準是,該獎項是否能帶來更多投資。我們很高興看到這一目標得以實現,尤其值得一提的是,挑戰賽的獲勝者實際上已經獲得了約 3000 萬美元的額外投資。當其他人也參與能力建構時,你就知道改變正在發生。

 

橫幅照片:在莫三比克,非正式工人可以在 Biscate 商業平台上註冊,該平台將他們與客戶聯繫起來。由 data.org 包容性成長和復甦挑戰計劃部分資助的數據計劃,利用這類市場數據提供洞察,以幫助企業發展。

報告也指出,需要更多的資料科學家,尤其是在發展中國家,因為這項工作可以產生巨大的影響,但這些國家可能缺乏培養資料科學家的教育基礎設施。你們採取了哪些措施來解決這個問題?

米哈伊洛夫:我們需要更多的資料科學家。我們需要他們有所不同。我們需要把它們放在不同的地方。首先,我們來看數字。我們沒有為新經濟培養足夠的資料科學家,無論是在私部門或社會影響領域。因此,我們需要增加對大學的投入,增加非正式培訓,為已有工作的人提供更多職業培訓,幫助他們重新培訓並增加所需的技能。但我們也需要這些人與眾不同。因此,我們需要加大投入,確保有更多的女性資料科學家,以及更多來自不同背景(目前處於弱勢地位)的資料科學家,尤其是在全球南方。我們還需要具備與眾不同的技能。所以目前,我們只是把數據科學當作一門技術學科來教授——數學、編程,這些都非常重要。但通常情況下,要解決問題並產生社會影響,你需要了解相關主題。所以,例如,當你談論氣候、健康或經濟不平等問題時,你需要了解這些問題背後的原因是什麼?如果你只有技術技能,那麼在嘗試創建解決方案時,往往會弊大於利。因此,培養資料科學家具備技術知識和對主題的理解等跨學科技能,是我們能力加速器網路的重點。

辛格:在萬事達卡,我們一直說客戶是我們創新的中心,但事實是,如果你在編寫程式碼或創造技術或解決方案,你將會根據你所知道的、你是誰以及你的生活經驗來做到這一點。我們有意透過能力加速器網絡,在開發階段擴大技術人才庫,以確保投入能夠代表我們營運所在社區、國家和地區的多元化。