AI News HubLIVE
站內改寫2 分鐘閱讀

Heidi x Fireworks:縮小前沿模型效能差距

Heidi Health與Fireworks AI合作,透過監督微調(SFT)和強化微調(RFT)技術,在臨床試驗筆記資料集上超越了Gemini Pro等前沿模型。合作伙伴關係不僅將延遲從25秒降至7秒,還實現了3.5倍的效能提升。成功的關鍵在於高質量資料過濾和大批次訓練(有效批次大小達150萬token),有效消除了噪聲並提升了模型質量。

Heidi Health,一家環境人工智慧醫療記錄領域的領導者,近日宣佈與Fireworks AI建立合作伙伴關係,成功實現並超越了專有前沿模型的質量水平,為臨床醫生提供更快、更可靠、更經濟的AI解決方案。Heidi的核心產品是一款環境AI醫療記錄工具,能夠轉錄醫患對話並生成專業的臨床筆記,幫助臨床醫生每天節省多達2小時的工作時間,顯著提高生產力和患者連線度。

合作伙伴關係:為何選擇Fireworks? Heidi原本尋求從封閉模型轉向開放模型,以獲得更強的控制力、更優效能和顯著的成本節約。他們選擇合作伙伴的標準包括:技術能力與高質量產品、信任與透明度以及協作團隊。Fireworks的解決方案在模型微調和推理最佳化方面表現出色。透過將通用模型轉化為針對Heidi用例定製的AI,Fireworks提升了模型效能和輸出質量,同時將延遲從25秒降至7秒,並實現了巨大的成本節約。從概念驗證到生產部署僅用了4周時間。

技術突破:超越前沿模型 聯合解決方案在模型質量上實現了兩大突破:

  • 監督微調(SFT):透過模仿基礎模型行為學習風格,模型在內部評估中超越了Gemini Flash系列。
  • 強化微調(RFT):透過引入偏好訊號使模型從模仿轉向“深度思考”,模型輸出在臨床筆記資料集上與Gemini Pro系列相比更受青睞。

成功藍圖:資料質量與批次大小 Heidi的技術研究表明,僅僅採用先進演算法(如直接偏好最佳化DPO)是不夠的。成功依賴於兩個關鍵操作槓桿:嚴格過濾的高質量資料和更大的有效批次大小。

  1. 激進的資料篩選:原始成對偏好資料存在噪聲,評估者常選擇包含幻覺的響應。有效的篩選策略包括:使用前沿模型生成高質量合成目標輸出作為“黃金標準”,以及利用LLM作為裁判進行資料預評估以去除噪聲。
  2. 擴充套件批次大小:在嚴格過濾後仍存在噪聲,Heidi將有效批次大小擴充套件至約150萬token(藉助Fireworks的梯度累積支援),確保每個權重更新基於大量樣本分佈,從而有效去噪。關鍵實驗表明,將有效批次大小從標準64k提升至768k token,模型對專有模型的勝率從48.0%提升至51.3%。

結論 實驗證明,開放模型在透過嚴格DPO訓練後,能夠與專有前沿模型競爭。最終的成功藍圖是:激進篩選資料(使用合成資料和經LLM Judge過濾的偏好訊號),擴充套件批次大小(透過梯度累積實現100萬token以上有效批次),並在訓練前執行預評估以捕捉迴歸風險。