AI News HubLIVE
站內改寫3 分鐘閱讀

根據哈佛商學院線上課程,專業人士應瞭解的資料科學和AI知識

瞭解為什麼明確的業務目標、資料質量、簡單的模型、仔細的驗證、現實的成本以及人類判斷力比追逐最新技術更重要。本文融合了哈佛商學院教授Iavor Bojinov的見解和資料科學從業者Abid Ali Awan的經驗。

來源KDnuggets作者: Abid Ali Awan

資料科學和人工智慧並非資料科學家的專屬領域。任何專業人士都可以從中受益,前提是理解這些技術的能力、侷限性和評估方法。本文結合了哈佛商學院教授Iavor Bojinov的見解與資料科學從業者Abid Ali Awan的實踐經驗,為專業人士提供了一份實用的資料科學與AI素養指南。

首先,明確要解決的業務問題。不要為了使用AI而使用AI。例如,與其說“我想用AI做客戶分析”,不如說“我想識別可能流失的客戶,以便客服團隊及時干預”。這會將模型與可衡量的結果和實際行動聯絡起來。Bojinov強調,AI應被視為決策的輸入而非替代品,專業人士需要理解其能力與侷限,驗證其建議,並專注於更好的業務成果。

其次,重視資料質量。在訓練模型之前,先進行探索性資料分析:檢查缺失值、重複記錄、異常值和潛在偏差。一個模型即使準確率高達95%,也可能毫無意義——比如在只有5%客戶流失的情況下,預測所有客戶都不會流失。因此,專業人士應質疑指標是否真正反映業務目標,而不是被一個漂亮的分數迷惑。資料準備包括處理缺失值、修正格式、去除重複、轉換類別、選擇有用特徵以及分離訓練集和評估集。改善資料往往比用複雜模型替代簡單演算法帶來更大收益。

選擇模型時,堅持“簡單有效”原則。對於結構化資料(如客戶記錄、交易資料),迴歸或決策樹往往比通用大語言模型更合適。大語言模型擅長語言類任務,如總結文件、提取資訊、生成初稿或分析客戶反饋,但對於預測、分類和表格資料,傳統機器學習可能仍是更佳選擇。在選擇模型前,應比較預測效能、訓練和推理成本、速度、可擴充套件性、可解釋性、維護需求以及錯誤預測的代價。一個稍微更準確的模型如果更昂貴、更難解釋或維護,不一定是更好的選擇。

驗證必不可少。用未參與訓練的資料評估模型,並確保評估資料代表模型將面對的客戶、市場和條件。部署後應持續驗證,因為客戶行為、市場環境和資料管道都可能變化。Bojinov指出,驗證和測試薄弱是常見錯誤,組織可能因不當測試而對結果過度自信。專業人士應詢問模型如何評估、它犯什麼錯誤、測試資料是否具有代表性,以及效能將如何長期監測。信任應來自證據,而非系統看起來多先進或多自信。

客戶分析不應僅停留在儀表盤上。儀表盤顯示發生了什麼,預測模型估計接下來可能發生什麼,實驗則幫助確定應採取什麼行動。預測客戶可能流失只有在公司有現實的留存策略時才變得有價值,並且必須衡量干預是否真的有效。專業人士應避免混淆相關性與因果關係,採用實驗思維,測試干預措施,衡量結果,並從證據中學習。目標不是產生更多預測,而是做出更好的決策。

大語言模型使AI更加普及,可用於程式設計、研究、語法改進、資訊總結、創意生成和學習新事物。然而,流暢自信的語言並不等同於事實準確性。大語言模型可能誤解上下文、依賴過時資訊、編造來源、產生錯誤程式碼或忽略安全漏洞。我從不盲目信任它們的輸出,而是檢查重要宣告、審查程式碼、測試功能並檢查安全問題。我將LLM視為助手而非權威,任務後果越嚴重,輸出審查越應仔細。

根據Bojinov的觀點,資料素養、實驗思維和批判性評估AI輸出的能力將隨著這些工具的廣泛使用而變得越來越有價值。專業人士無需成為AI專家,但需要足夠的熟練度來提出正確問題、解釋證據、識別薄弱或不可靠的輸出,並理解何時可以信任答案。最終,脫穎而出的專業人士將是那些能將技術理解、領域知識和健全商業判斷相結合的人。

許多公司因不想落後而急於在各方面加入AI,但可能在沒有先問AI是否真正是正確解決方案的情況下,在API、基礎設施、培訓和維護上大量花費。熱潮終將退去,公司將學會AI在哪裡增加真實價值,哪裡人類仍然至關重要,以及哪裡更簡單便宜的解決方案就足夠了。成功的資料科學和AI專案不是從最新模型開始的,而是從清晰的問題、可靠的資料、適當的評估、現實的成本以及將結果轉化為行動的計劃開始的。目標不是到處使用AI,而是有目的地使用它,仔細驗證它,並將其應用於真正改進決策的地方。

Abid Ali Awan (@1abidaliawan) 是一位認證的資料科學專業人士,熱愛構建機器學習模型。目前他專注於內容創作,撰寫關於機器學習與資料科學技術的技術部落格。他擁有技術管理碩士學位和電信工程學士學位,願景是利用圖神經網路為有心理健康問題的學生構建AI產品。