AI News HubLIVE

研究動態

Gigatoken:一款 Rust BPE 分詞器,編碼速度高達 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍

Gigatoken 是斯坦福博士生 Marcel Rød 開發的一款 MIT 許可的 Rust BPE 分詞器,在 144 核 AMD EPYC 9565 上以 24.53 GB/s 的速度對 GPT-2 進行分詞,比 HuggingFace tokenizers 快 989 倍,比 tiktoken 快 681 倍。其速度提升並非來自更快的 BPE 合併迴圈,而是來自手寫的 SWAR 預分詞器和預分詞快取。支援 23 種分詞器家族,但 SentencePiece 詞彙表的速度提升僅為 7–22 倍。相容模式可保持精確輸出一致,但速度約為 200–300 倍。

  • Gigatoken 在 144 核 AMD EPYC 9565 上達到 24.53 GB/s,比 HuggingFace tokenizers 快 989 倍,比 tiktoken 快 681 倍。
  • 速度提升來自手寫 SWAR 預分詞器和預分詞快取,而非更快的 BPE 合併迴圈。
站內正文

遞迴自我改進的經濟學

Parker和Tom等9位經濟學家合著了一篇關於遞迴自我改進(RSI)的論文,透過簡單模型分析AI如何加速AI研發。文章強調了RSI的不同定義、反饋效應強度對能力加速的影響,以及實驗室應釋出更多相關資料。

  • RSI指模型能力對模型改進的反饋,但反饋強度不同導致定義分歧。
  • 論文將反饋效應分解,量化整體反饋強度,最不確定的是模型能力如何影響演算法進步速度。
站內正文

Show HN: Ours.network – 讓你的AI智慧體直接相連

Ours.network 推出了 ours-mcp,這是一種讓 AI 智慧體無需人類干預即可直接通訊的工具。它簡化了設定過程,透過一個可安裝的 MCP 伺服器,讓智慧體透過一次性邀請連線,避免了手動複製貼上的繁瑣。功能包括端到端加密、用於隱私保護的盲中繼,以及完全的人工控制。該工具處於早期 alpha 階段,原始碼可用,專為跨不同執行時(如 Claude Code 和 Codex)的智慧體間通訊而設計。

  • Ours-mcp 消除了人類在 AI 智慧體之間轉發訊息的需求,建立了直接連線。
  • 設定快速:安裝 MCP 伺服器、生成邀請、連線智慧體,大約兩分鐘即可完成。
站內正文

AI聊天機器人在情感支援方面可與人類媲美,有時甚至更勝一籌

曼徹斯特大學和杜倫大學的研究發現,AI聊天機器人在日常情感支援方面可以匹配甚至超越人類,尤其是在憤怒和恐懼情境中。研究強調,提供具體、可操作的建議是有效支援的關鍵,無論來自人類還是AI。

  • AI聊天機器人在憤怒和恐懼情境中提供的情感支援被認為比人類更有效。
  • 具體、可操作的建議(如呼吸技巧、逐步重構思維)是提升支援質量的關鍵。
站內正文

我為妻子構建了一個無廣告、事實核查並標記偏見的新簡報

BeamWire 提供個性化的、無廣告的每日新聞簡報,以電子郵件和播客形式傳送,包含事實核查、偏見檢測和可定製主題。它提供多種新聞和專題“光束”(Beams),涵蓋不同興趣,並配有AI主播和語調定製。價格從免費開始。

  • BeamWire 以電子郵件和播客形式提供每日精選新聞簡報,無廣告,去除偏見。
  • 使用者可以選擇預建的光束(主題)或建立自定義光束,配備AI主播和語調選項。
站內正文

PyPI 新規:釋出超過14天的版本將無法上傳新檔案

Python 包索引(PyPI)現已實施新安全措施:拒絕向超過14天的舊版本上傳新檔案。此舉旨在防止因釋出令牌或工作流洩露導致的供應鏈攻擊。

  • PyPI 拒絕向釋出超過14天的版本上傳新檔案。
  • 該限制是為了防止舊版本被惡意篡改。
站內正文

AI代理操作的公開可驗證收據,錨定到比特幣

Orphograph 為 AI 代理的每個關鍵操作生成錨定到比特幣區塊鏈的收據,確保記錄的存在時間不可篡改,且無需信任操作者即可驗證。

  • 自主操作日誌可由操作者隨意篡改,不能作為可靠證據。
  • 透過將操作記錄的雜湊錨定到比特幣區塊鏈,收據可提供時間戳和防篡改證明。
站內正文

Show HN: Searchdesk — AI驅動的求職工具,自動定製簡歷和求職信

Searchdesk是一款AI求職助手,它能自動搜尋真實職位、基於事實定製申請材料,並讓使用者在私人工作區中掌控每一個機會。所有草稿均由使用者稽核,不會自動提交申請。目前處於Alpha階段,歡迎反饋。

  • Searchdesk自動研究公開職位,結合使用者資料生成定製化的簡歷和求職信。
  • 使用者始終擁有最終決定權,AI不會自動提交任何申請。
站內正文

超聲心動圖域偏移:跨資料集左心室分割的可解釋量化與預測

該研究指出,跨資料集泛化是超聲心動圖左心室分割臨床部署的主要障礙。透過六個資料集的分析,發現幾何感知預處理能顯著改善域偏移,表明偏移主要源於視野和框架不一致,而非聲學差異。強度歸一化影響甚微。使用特定表示的距離度量可高精度預測分割效能下降。

  • 幾何感知預處理可減少超聲心動圖域偏移,因其主要源於視野和框架差異。
  • 基於區域無關特徵的轉移風險監測可達約70%的解釋力。
站內正文

用於攝護腺組織病理學的病理學家注意力對齊報告生成

該研究引入病理學家注意力來訓練報告生成模型,透過收集121例攝護腺全切片影像的多模態注意力資料集,最佳化模型注意力對齊,提升了報告生成和視覺問答的效能。

  • 收集了121例攝護腺WSI的病理學家多尺度視口軌跡、口頭描述和游標行動數據集
  • 使用注意力對齊損失微調兩個報告生成模型,使模型注意力匹配病理學家注意力分佈
站內正文

EGRNet:一種帶有邊緣門控細化和對抗性感知的輕量級語義分割網路

本文提出了一種輕量級語義分割網路EGRNet,透過深度可分離卷積、擴張殘差塊和新型邊緣門控細化(EGR)模組,在僅0.46M引數下實現Cityscapes資料集上65.28%的mIoU,並引入輕量級對抗攻擊檢測策略,適用於邊緣裝置上的即時應用。

  • EGRNet僅0.46M引數,在Cityscapes上達到65.28% mIoU
  • 提出邊緣門控細化(EGR)模組,透過可學習門控機制融合特徵,增強邊界保留
站內正文

VQ-Transplant: 針對預訓練視覺分詞器的高效VQ模組整合方法

VQ-Transplant提出了一種輕量級框架,能夠將新的向量量化模組無縫整合到凍結的預訓練分詞器中,無需昂貴的端到端重訓練。透過在ImageNet-1k上僅訓練5個epoch的輕量級解碼器適配策略,該方法解決了量化不匹配問題,在VAR等工業級模型上實現了接近最先進的重建保真度,同時訓練成本降低95%。這降低了量化研究門檻,使資源受限環境中的研究者也能探索前沿技術。

  • VQ-Transplant允許在不重新訓練編碼器-解碼器的情況下替換量化模組。
  • 輕量級解碼器適配只需在ImageNet-1k上訓練5個epoch。
站內正文

ChronoStitch:無需訓練的視覺KV記憶組合方法實現長時域推理

本文提出ChronoStitch,一種無需訓練的方法,用於組合獨立儲存的視覺鍵值(KV)記憶,以解決長影片問答中的時域推理問題。該方法透過將儲存的旋轉後鍵重新對映到全域性多模態RoPE座標系,並選擇性重計算部分高偏差視覺令牌,克服了樸素拼接導致的時間相位衝突和內容缺失。實驗表明,在Qwen2.5-VL-3B和TempCompass時域分割上,ChronoStitch在事件順序準確性上優於樸素組合和僅位置變體,且速度比完整聯合預填充快3.3倍。

  • 長影片問答需要模型隨時間儲存視覺證據,KV快取是一種實用方法,但獨立快取拼接會丟失全域性時間順序。
  • ChronoStitch透過重新基於全域性三軸多模態RoPE座標系調整鍵,並選擇性重計算高偏差令牌,實現了無需訓練的記憶組合。
站內正文

基於合成與派生訓練影像的校園垃圾檢測:YOLOv8n多種子評估

該研究評估了使用合成和派生影像提升YOLOv8n垃圾檢測器效能的效果。真實資料集包含148張校園照片,實驗發現所有合成增強方案均未超過僅使用真實影像的基線模型([email protected]為0.691)。手部複合實驗因測試集汙染而重建,校正後效果不顯著。研究強調測試集規模小限制了結論的可靠性。

  • 僅使用真實影像的YOLOv8n模型達到[email protected]為0.691,所有合成資料方案均未超越此基線。
  • 背景替換、隔離物體等合成方法反而降低了檢測精度,最高僅0.680。
站內正文

D3VL:利用語言模型理解3D時序資料和影片中的駕駛場景

本文提出D3VL,一種新型多模態大語言模型框架,融合2D和3D時序資料以提升自動駕駛場景理解。該模型在KITTI問答資料集上相比基線方法提升11%,並引入Waymo QA資料集擴充套件以評估3D和時間序列處理能力。

  • D3VL是首個將2D和3D時序資料整合到統一架構中的MLLM框架。
  • 在KITTI問答資料集上準確率提升11%。
站內正文

Crowd4D:場景感知的單目4D人群重建

Crowd4D是首個場景感知的4D人群重建框架,透過聯合最佳化單目RGB影片中的人群與場景,利用人-場景互動代理(HSIP)解決尺度與位置對齊難題,引入人群結構相干性正則化(CSCR)提升遮擋下的時間穩定性,在複雜大場景中優於現有方法。

  • 首次提出聯合最佳化人群與場景的單目4D重建框架,顯式利用場景幾何。
  • 引入人-場景互動代理(HSIP)作為中間表示,解決尺度與位置對齊。
站內正文

儘早檢測,極少升級:從壓縮位元流中即時檢測AI生成影片

本文提出一種新穎方法,透過分析壓縮位元流而非解碼畫素來即時檢測AI生成影片。該方法利用編解碼器已寫入的運動場資料,實現流式感知,並支援隨時決策。在GenVidBench上,該方法僅用畫素CNN五分之一數量級的計算量即達到0.64 AUC,同時透過延遲15%的片段將準確率從0.75提升至0.78,計算量減少7倍。

  • 將AI影片檢測重新定義為從壓縮位元流的流式感知
  • 利用編解碼器中已有的運動場,僅需解析而非畫素解碼
站內正文

利用依賴圖和鄰近特徵從歷史報紙中進行輕量級人物-地點關係抽取

HIPE-2026共享任務引入了從多語言歷史報紙中抽取人物-地點關係的新賽道。DS@GT HIPE團隊探索了在不使用預訓練語言模型的情況下,輕量級可解釋系統的效能上限。該系統基於依賴解析構建文件級圖,提取鄰近和詞性特徵,使用小型scikit-learn整合或緊湊圖注意力網路進行分類,引數量低於847K。在官方評估中,最佳執行達到宏召回率0.5142,效率排名第3,準確率中等。關鍵發現:最小字元距離單獨即可捕獲大部分訊號,額外特徵帶來不一致的收益;文件分組交叉驗證對於避免資料洩露至關重要。

  • 提出輕量級方法,不使用預訓練語言模型,僅用847K以下引數。
  • 最小字元距離是主要訊號,額外工程特徵收益不穩定。
站內正文

SLPO:透過替代策略擴充套件潛在推理

強化學習在顯式思維鏈推理器中的成功帶來了測試時擴充套件,但計算成本高昂。潛在推理使用連續向量進行中間計算,效率更高,但受限於模仿學習。本文提出替代潛在策略最佳化(SLPO),將結果獎勵強化學習引入自迴歸潛在推理器,透過替代策略密度進行軌跡級信用分配,並利用正確性監督的停止頭實現可變視界策略。實驗表明,SLPO在連續和軟思考設定下均能提升Pass@k,併為更難的例項分配更長的潛在計算,從而提高確定性準確率。

  • 潛在推理雖高效但缺乏結果獎勵RL訓練,SLPO彌補了這一空白。
  • SLPO透過替代策略密度和停止頭實現潛在推理器的結果獎勵最佳化。
站內正文

多掩碼擴散語言模型用於少步生成

提出多掩碼擴散模型(MultiMDM),透過引入多個掩碼狀態解決傳統掩碼擴散模型在少步生成中終端熵為零的問題,實現高質量少步文本生成。

  • 傳統掩碼擴散模型所有正向軌跡收斂到單一全掩碼狀態,缺乏終端熵,不利於少步生成。
  • MultiMDM在正向過程中將每個乾淨令牌先推向指定掩碼,再在掩碼集上混合,使反向過程具備預判能力。
站內正文

開放式問答中推理的無參考評估

提出一種基於推理的無參考框架,透過NLI和超圖結構審計LLM推理軌跡,在數學和醫療推理中比直接使用LLM評判更可靠。

  • 提出無參考審計框架,分解推理軌跡並分析前提-目標關係
  • 建立UroReason基準,包含真實臨床案例的LLM推理
站內正文

適應性的投降:LLM在脆弱性上下文中的結構性失敗模式

一篇新論文識別了一種名為“適應性的投降”的LLM失敗模式,即模型先確認使用者感受到的社會不公,然後卻詳細提供其名義上勸阻的獲取途徑。該研究對三個商業LLM進行了900次測試,提出了最小重歸因充分性(MRS)設計原則。

  • 描述了LLM在情感敏感情境中的結構性三難困境
  • 提出了“適應性的投降”這一新的失敗模式
站內正文

任務能力並非指令遵循:評估小語言模型中的指令衝突行為

研究表明,小語言模型在任務能力上表現良好,但在指令與常規任務行為衝突時,往往會忽略非標準指令。隨著模型規模增大,標準準確率和指令遵循能力均有所提升,但兩者之間的差距依然存在。這證明任務完成能力和指令遵循是兩種不同的能力。

  • 小模型在衝突指令下仍能保持任務正確率,但常忽略非標準指令。
  • 大模型在標準與非標準指令間的表現差距更明顯。
站內正文

基於超網路的大語言模型知識注入的縮放定律

研究者探索了使用超網路在訓練時將大規模事實知識注入大語言模型,並首次系統研究了超網路架構的縮放行為。實驗表明,超網路注入在損失、推理準確率及OOD泛化上遵循冪律縮放,且隨著規模增大,OOD泛化表現可靠,優於LoRA微調和全微調。他們建立了包含數千萬多跳問答樣本的MegaWikiQA資料集。

  • 超網路可以用於訓練時知識注入,生成固定LoRA介面卡嵌入目標模型。
  • 設計將超網路的注入能力與目標模型通用能力解耦,實現了縮放定律的嚴格研究。
站內正文

論結構泛化的計算複雜度

本文首次正式定義了結構泛化,並證明在標準計算複雜性假設下,純Transformer無法學習結構泛化,而神經符號系統透過硬編碼語義投影取得高分。

  • 提出結構泛化的正式數學定義,將組合結構與無限泛化翻譯為數學語言。
  • 證明純Transformer的學習能力上限為TC0,而結構泛化需要NC1能力,因此無法學習。
站內正文

當推理縮小動作空間:LLM遊戲中的多樣性崩潰

研究發現,監督微調(SFT)在將大語言模型適配到下游任務時,會顯著降低其行為多樣性,尤其是在順序決策任務中。透過在井字棋變體等確定性棋盤遊戲上的實驗,作者指出推理模式生成常常抑制動作多樣性,而標準SFT雖然提高準確率,卻導致過早的多樣性崩潰。動作增強(即訓練所有最優動作而非單一動作)可部分緩解這一問題。

  • 監督微調(SFT)會導致大語言模型在決策中過早失去動作多樣性。
  • 推理模式生成會抑制動作多樣性,但並非總是提高準確率。
站內正文

面向多輪對話大語言模型系統的狀態化護欄:對話風險累積框架

現有大語言模型安全護欄僅獨立評估每輪對話,忽略了對話過程中良性輪次累積導致的危害。本文提出對話風險累積(CRA)概念及會話層框架,跟蹤語義漂移、敏感資訊累積和順從度梯度三個軌跡訊號,併發布CRA-Bench基準和評估協議。

  • 提出對話風險累積(CRA)概念,涵蓋意圖漂移、禁止指令碎片化組裝和敏感披露累積。
  • 設計會話層框架,跟蹤語義漂移、資訊累積圖和順從度梯度。
站內正文

用於二維中子通量估計的神經運算元代理

該工作將一維單掃描神經運算元研究擴充套件到二維,使用傅立葉神經運算元(FNO)和U型神經運算元(UNO)構建代理模型。研究了三種代理:直接對映材料與源場到通量的FNO和UNO,以及額外輸入單掃描近似通量的FNO。透過離散縱座標求解器驗證,採用平均相對L_2誤差評估。探討單掃描輸入是否提高精度及對數通量訓練是否改善強衰減區域的精度。

  • 擴充套件一維神經運算元研究至二維中子通量估計
  • 比較FNO和UNO兩種直接對映代理
站內正文

透過分箱頻譜損失在非結構化網格上進行混沌動力學的尺度感知學習

該研究將分箱頻譜損失函式擴充套件到非結構化網格的替代模型,利用圖拉普拉斯頻帶代替傅立葉頻帶,並提出了可擴充套件的切比雪夫和多層近似方法,以改善長時滾動的保真度。實驗結果表明,該方法在非結構化網格上預測湍流時,優於確定性基線,提高了長時滾動保真度並保持了統計不變數。

  • 提出了基於圖拉普拉斯頻帶的分箱頻譜損失函式,適用於非結構化網格。
  • 引入切比雪夫多項式圖濾波器和多層圖架構(GLEAM)來提高計算效率。
站內正文

構建快,評估慢:流程選擇主導自動可解釋性得分方差

研究發現,稀疏自編碼器(SAE)的自動可解釋性得分受評估流程選擇的影響遠大於架構差異,導致跨論文比較可能反映的是流程而非架構的差異。

  • 方法方差在所有指標和模型中超過架構方差
  • 檢測指標最穩定,模糊測試不可靠
站內正文

STN-TGAT:基於先驗引導圖注意力和可學習軟閾值稀疏化的Top-K投資組合構建

本文提出STN-TGAT模型,結合時間Transformer和圖注意力網路,利用NMI先驗圖和軟閾值稀疏化機制,在真實投資環境下進行股票排名和投資組合構建,實驗表明其在預測準確性和投資回報上優於基線模型。

  • STN-TGAT融合時間Transformer與圖注意力網路,捕捉長期序列模式和動態股票關係。
  • 引入NMI先驗圖和可學習軟閾值稀疏化機制,增強結構魯棒性。
站內正文

SUM:面向聯邦類增量學習的時空自適應向量統一幾何手術

本文提出SUM,一種純伺服器端框架,透過在聚合過程中對自適應向量進行幾何手術,同時緩解聯邦類增量學習中的空間干擾和時間干擾,無需額外客戶端計算或通訊,在多個基準測試上實現高達22%的效能提升。

  • 聯邦類增量學習(FCIL)面臨空間和時間雙重干擾,導致災難性遺忘。
  • SUM將FCIL重新解釋為統一多工學習問題,在伺服器端進行幾何手術。
站內正文

持續學習在時間序列預測中的可解釋性挑戰

該研究探討了在自適應時間序列預測中,利用可解釋性作為理解持續學習的關鍵工具。透過持續學習和經驗回放策略,研究分析了PatchMixer、PatchTST和DLinear等神經預測架構,並採用注意力展開和梯度歸因方法(Grad-CAM)來解釋預測行為和取樣策略。實驗基於真實世界的地下水時間序列資料,揭示了可解釋性在非平穩預測場景中的挑戰和機遇。

  • 研究利用可解釋性分析持續學習在自適應時間序列預測中的作用。
  • 採用經驗回放、注意力展開和Grad-CAM等方法。
站內正文

空氣質量競技場:用於空氣質量預測的大規模多區域地面監測資料集與時間序列基礎模型基準

空氣汙染每年導致約790萬人過早死亡,準確預測成為公共衛生優先事項。現有基準在地域範圍和汙染物覆蓋上過於狹窄,且未評估最新時間序列基礎模型。本研究提出Air Quality Arena (AQA),一個覆蓋7個國家、4大洲、6種主要汙染物、超過14,000個站點-汙染物序列的大規模多國資料集和基準。透過11個時間序列基礎模型和經典基線評估,結果表明時間序列基礎模型在零樣本預測中有效且持續優於經典基線,最佳模型採用跨模態架構,利用視覺基礎模型進行時間序列預測。資料集和基準已公開發布。

  • AQA資料集覆蓋7國4大洲,含3年6種主要汙染物資料,共14,000多個站點-汙染物序列。
  • 對11個時間序列基礎模型和經典基線進行基準測試,評估短期空氣質量預測效能。
站內正文

CruiseBench:面向發動機剩餘壽命預測的實飛對齊N-CMAPSS基準

CruiseBench是專為航空發動機剩餘壽命預測設計的巡航階段基準,透過固定協議簡化N-CMAPSS資料集,提升模型比較的可重複性。

  • CruiseBench基於N-CMAPSS,提取巡航階段資料,減少工況干擾。
  • 引入CPM-N-CMAPSS掩碼,標識巡航區間。
站內正文

貝葉斯風洞用於模型選擇

本研究探討Transformer能否執行貝葉斯模型選擇,即從資料中識別正確的假設類。透過引入貝葉斯風洞環境,使用固定點自由對合等控制設定,作者發現小型Transformer能在純關係任務中實現接近貝葉斯最優的效能,但在需要算術運算時,使用不透明符號會徹底失敗,且該邊界在擴大模型規模後依然存在。對前沿LLM的探測顯示其定性上符合貝葉斯行為,但校準差距較大。

  • 引入模型選擇貝葉斯風洞,提供封閉形式的真實後驗機率。
  • 2.8M引數Transformer在固定點自由對合任務中達到0.01位元熵一致。
站內正文

原生多維亞二次運算元:透過輸入依賴的長卷積實現

論文提出HyenaND,一種直接對多維資料原生幾何結構進行操作的亞二次、全域性、輸入依賴運算元。它透過隱式引數化的全域性多維卷積核實現,避免了傳統注意力或迴圈模型中的結構破壞問題。CUDA實現nSubQ融合FFT卷積路徑,實現O(L log L)縮放加速。在長上下文基因組學、計算機視覺、醫學影像和PDE建模中,純HyenaND堆疊匹配強注意力基線,混合配置超越純注意力和強迴圈混合模型。

  • HyenaND是一種新型亞二次運算元,可直接處理多維資料原生幾何結構,無需光柵化。
  • 採用隱式引數化的全域性多維卷積核,實現輸入依賴性。
站內正文

面向LLM智慧體的輪廓圖記憶:透過敘事輪廓實現隱式跨實體遍歷

一篇新論文提出了MemHop多跳記憶基準和ProGraph兩層記憶架構,結合輪廓擴充套件和壓縮殘差,顯著提升了LLM智慧體的長期記憶能力。ProGraph在MemHop和LoCoMo基準上均取得優異結果,超越現有方法。

  • 提出了MemHop多跳記憶基準,包含1000個問題,覆蓋10個社交網路場景,跳數深度1-5,帶證據註釋。
  • 介紹了ProGraph兩層記憶架構:輪廓擴充套件(隱式實體遍歷)和壓縮殘差(零成本提取精確細節)。
站內正文

LISA:線性索引稀疏注意力助力高效長上下文推理

針對長鏈思維推理模型在測試時縮放中面臨的自注意力二次複雜度問題,本文提出LISA(線性索引稀疏注意力),一種即插即用的注意力替換模組,無需從頭預訓練。LISA並行整合線性注意力和閃電索引器,透過門控機制融合,將推理複雜度從O(n²)降至O(nM)。在DeepSeek蒸餾Qwen模型上的實驗表明,在16K上下文下實現50%推理加速,並在AIME和MATH-500等基準上平均提升5.6%的效能。

  • LISA 將自注意力複雜度從 O(n²) 降低到 O(nM),M << n。
  • 包含線性注意力(長距離記憶)和閃電索引器(選擇重要令牌)兩個並行元件。
站內正文

面向多目標生成式推薦系統的隨機原對偶解碼方法

本文提出一種輕量級推理時解碼層,用於增強自迴歸生成式推薦系統,使其在不修改或重新訓練模型的情況下支援多目標推薦列表生成。該方法將解碼過程建模為線上約束最佳化問題,透過隨機原對偶近似方案動態調整相關性及輔助目標之間的權衡,並提供了約束違反和遺憾的理論保證。離線實驗和線上A/B測試顯示,該方法在多目標權衡中取得了一致改進,在使用者滿意度不受影響的情況下輔助目標提升1.8%。

  • 提出一種無需重新訓練的推理時解碼層,可擴充套件生成式推薦系統以處理多目標約束。
  • 使用隨機原對偶近似即時平衡相關性與輔助目標(如公平性)。
站內正文

大型語言模型的資訊辨別能力

一項新研究揭示了大型語言模型(LLM)在整合外部資訊時存在顯著缺陷:它們幾乎無法區分可靠與不可靠的來源,對資訊真實性的判斷也接近隨機水平。研究引入了Learn2Discern框架,透過對13個模型、近67萬次試驗的測試,發現模型更傾向於依賴來源的流行度而非可靠性,並且無論資訊是否接近真相,其更新程度幾乎相同。使用者調查(n=299)證實,這些缺陷會降低使用者信任和使用意願。研究還提出了一些簡單的推理時干預措施,可部分改善資訊辨別能力。

  • LLM在資訊來源和真實性辨別上表現接近隨機。
  • 模型對來源流行度的依賴是可靠性的兩倍。
站內正文

FormulaSPIN:自對弈微呼叫於自然語言到電子表格公式生成

提出FORMULASPIN自對弈框架,利用公式可執行性作為隱性監督,透過兩玩家遊戲和ExecVote機制,無需額外資料即可提升效能,在NL2FORMULA基準上達到74.9%精確匹配和87.1%執行準確率。

  • 自對弈框架突破了監督微調的瓶頸,無需額外資料即可迭代自我改進。
  • 利用公式的二進位制可執行性區分語義錯誤與有效風格變體,解決原始SPIN的矛盾梯度問題。
站內正文

基於Intel TDX的NVIDIA H100機密GPU推理效能基準測試

一項新研究評估了在NVIDIA H100 GPU上啟用機密計算對大型語言模型推理效能的影響。測試使用Mistral-7B和Qwen3-30B-A3B模型,發現機密模式使首令牌延遲平均增加21.8%-27.8%,全域性令牌吞吐量下降17.7%-21.1%,且較大模型更早達到飽和。結果表明機密GPU推理在負載下仍可保持可用吞吐量,但容量規劃需考慮效能損失和早期飽和現象。

  • 機密計算正成為AI推理部署的實際需求,但效能成本因工作負載而異。
  • 在Intel TDX機密例項中,使用NVIDIA H100 GPU測試了兩種模型的機密與非機密模式。
站內正文

混合LSTM-圖神經網路框架實現穩健的金融欺詐檢測與對抗韌性

該論文提出FraudShield AI框架,融合LSTM網路與手工設計的圖拓撲特徵,以應對金融欺詐檢測中極端資料不平衡(0.13%欺詐率)和不斷演變的對抗逃避策略。透過引入PageRank中心性、入度動態和自定義流量比率等網路中心特徵,系統將檢測正規化從孤立交易分析轉向網路級取證。採用Focal Loss處理類別不平衡,並引入動態閾值機制增強對低額交易欺詐的韌性。在PaySim資料集上的實驗表明,該混合模型在精確率、召回率和F1分數上顯著優於邏輯迴歸和XGBoost基線,尤其在難以檢測的微交易欺詐模式上表現突出。消融研究證實了時間元件和拓撲元件的互補貢獻。

  • FraudShield AI結合LSTM和圖拓撲特徵,實現網路級取證。
  • 使用Focal Loss和動態閾值應對資料不平衡和低額攻擊。
站內正文

FineServe:細粒度的大語言模型服務負載資料集與特徵分析

大語言模型作為線上服務不斷部署,高效服務成為關鍵挑戰。現有研究多依賴代理軌跡或粗粒度特徵,無法捕捉多模型平臺的異構性。FineServe從全球商業市場收集多模型服務負載資料,提供細粒度的真實世界動態特徵。透過分析到達動態和令牌行為,揭示了不同模型架構、規模和任務意圖下的波動機制,並開發了負載生成器,用於評估路由、排程和容量規劃策略。

  • 提出FineServe資料集,包含多模型服務負載的細粒度特徵。
  • 分析顯示模型架構、規模和任務意圖導致的到達動態和令牌行為差異。
站內正文

AI真能構建資料管道?基於Apache SeaTunnel AI CLI對7個頂級LLM的100任務基準測試

本文介紹了一個基於Apache SeaTunnel AI CLI的基準測試框架,對7個領先的大型語言模型在100個ETL任務上進行了三層驗證(靜態驗證、CLI驗證、執行時驗證)。結果顯示,靜態驗證表現良好並不保證執行時成功率。該測試為AI輔助ETL提供了實用評估方法,強調工程團隊應根據工作負載複雜度、執行時成功率、錯誤恢復能力和運營成本選擇模型。

  • 基準測試包括100個ETL任務,覆蓋批處理、CDC、複雜DAG等多種場景,使用三層驗證框架:L1靜態配置驗證、L2 CLI和規則驗證、L3 Docker化環境執行時驗證。
  • 測試發現,模型在靜態驗證中的高透過率並不等同於實際執行時的高成功率,執行時驗證是衡量AI生成配置準確性的關鍵指標。
站內正文

獨立遊戲工作室本該愛上生成式AI,為何我採訪的25位開發者都避之不及?

儘管生成式AI被宣傳為能提升遊戲開發效率、降低成本,但眾多獨立開發者卻對其持反對態度。他們擔心AI會損害創造力、導致法律風險、扼殺初級崗位,並讓遊戲失去人性。本文采訪了超過30位開發者,其中約25位明確表示拒絕使用AI。

  • 獨立開發者普遍認為AI與遊戲創作的初衷相悖,強調手工製作的價值。
  • 開發者擔憂AI會取代初級崗位,削弱藝術表達和技能培養。
站內正文

NVIDIA AI超級計算機在海軍研究生院上線

輝達創始人兼CEO黃仁勳在加州蒙特雷的海軍研究生院(NPS)為一臺NVIDIA DGX GB300系統舉行了上線儀式,將全球最強大的AI平臺之一提供給該校超過1500名學生和600名教職員工使用。該系統用於天氣預測、網路安全、災害韌性等領域的模型訓練和推理,標誌著NPS與輝達在AI教育與應用合作的最新進展。

  • 黃仁勳主持了DGX GB300超級計算機的上線儀式,該系統專為軍事教育機構設計。
  • 系統將支援NPS的AI研究,涵蓋天氣預報、網路安全和災害響應。
站內正文

基準測試已死(至少對我們而言)

Poetiq 宣佈其遞迴自我改進(RSI)迴圈能夠自動為任何任務構建最先進的測試框架,在六個不同的基準測試中取得了最佳成績,且無需人工干預。該公司認為靜態基準測試不足以評估真正自我改進的AI系統,並建議轉向動態的、無法被訓練攻克的“活基準”。

  • Poetiq 的元系統利用RSI迴圈自動為基準測試構建框架,實現最先進(SOTA)結果。
  • 該系統在多個基準測試(如 ArXivMath、Haladir、Toolathlon)上超越領先模型(如 Claude Fable 5)。
站內正文

引用Thomas Ptacek

Thomas Ptacek認為,2025年的開源權重模型配合滲透測試工具,足以實現沙箱逃逸並侵入大多數網路。這一觀點之所以令人驚訝,是因為人們高估了OpenAI的沙箱安全性。

  • 開源權重模型具備強大的滲透測試能力
  • 沙箱逃逸成為可能
站內正文

主題導航

研究 — AI 主題新聞 | AI News Hub