AI News HubLIVE

AI 新聞即時情報

即時監測

今日 AI 世界最重要的變化

來自 105 個可信來源,最近更新 2026-06-06 15:57 UTC+8。

即時監測

即時更新

即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。

即時更新

重設
OpenAI與特朗普政府談判政府持股AI初創公司

OpenAI與特朗普政府正在談判一項直接政府持股計劃,擬通過“公共財富基金”向美國公民支付收益。參議員伯尼·桑德斯提議對AI股份徵收50%的税,但批評者擔心此舉可能引發類似2008年金融危機的“太大而不能倒”風險。

The Decoder政策 / 創業融資站內正文
OpenAI為Tomoro支付了多少?

AIEI開始追蹤AI領域的投資和併購活動,並監測前沿模型和主要應用的合作伙伴計劃。

Hacker News AI創業融資站內正文
AI編碼代理使用你的技術

本文介紹AI編碼代理如何利用現有技術棧,提升開發效率,並討論了代理體驗(AX)的重要性。

Hacker News AIAgent站內正文
“peers”新版本——AI搭檔協同編程

peers是一個開源工具,驅動兩個或多個AI編碼代理(如Claude Code、Codex)作為協作夥伴,通過硬性門控(測試通過、覆蓋率保持、無迴歸、無待辦項、無存根、無跳過測試、秘密清理)確保任務完成。一個代理實現,另一個盲審,再加一個對抗性懷疑者重新審計,然後才接受“完成”。支持無人值守、預算封頂和容器沙箱。

Hacker News AIAgent / 研究站內正文
Bitrig – 使用AI構建原生Swift應用的最佳方式

Bitrig是一款macOS應用,能將你的想法轉化為真正的Swift和SwiftUI代碼,支持自然語言交互和內置模擬器,無需編碼經驗即可快速構建併發布應用到App Store。

Hacker News AIAgent站內正文
AI聊天機器人是否讓我們失去對大腦的控制?

心理學家格洛麗亞·馬克的研究表明,數字技術的使用已導致人類注意力持續時間從2003年的2.5分鐘鋭減至近年來的47秒。她擔憂AI聊天工具(如ChatGPT)可能進一步加劇這一問題,因為它們鼓勵用户“將認知工作外包”,從而削弱深度處理能力,增加認知退化和情緒智力下降的風險。馬克建議通過增加個人努力(如閲讀完整書籍、減少GPS依賴)來重新平衡與技術的關係。

Hacker News AIAgent / 芯片站內正文
納米比亞總統偽造演講因AI走紅,揭示全球領導力真空

一篇被偽造為納米比亞總統Netumbo Nandi-Ndaitwah的AI生成演講在社交媒體上廣泛傳播,譴責腐敗和外國剝削,反映了非洲和加勒比地區民眾對道德領導力的渴望。總統本人澄清該演講為AI偽造。

The Guardian AI工具站內正文
AI已經攻佔了襯線字體

AI公司使用襯線字體以獲得人性化和信任感,但批評者認為這掩蓋了AI的冰冷本質。設計師指出這是一種“品味氾濫”的趨勢。

Hacker News AI研究 / 創業融資站內正文
尤爾根·施密德胡伯:世界模型、強化學習與改變AI的一年

人工智能先驅尤爾根·施密德胡伯在訪談中回顧了1991年其慕尼黑實驗室的關鍵突破,包括世界模型、人工好奇心、強化學習,並對比了大型語言模型與決策系統。他還探討了象棋AI的發展歷史及未來通用人工智能的挑戰。

Hacker News AI研究 / 機械人站內正文
Nanocode-CLI:一款輕量級終端AI編碼助手

Nanocode-CLI 是一款基於終端的輕量級AI編碼助手,完全用 Python 編寫。它提供實時控制、文件狀態感知、陳舊編輯保護、項目感知導航、可恢復上下文、緩存感知上下文、聚焦工作記憶等特性,所有操作都在命令行中完成。

Hacker News AIAgent / 政策站內正文
標普500拒絕SpaceX加速納入,同時阻止OpenAI和Anthropic進入

標普道瓊斯指數公司拒絕為SpaceX、OpenAI和Anthropic等公司破例,堅持原有的盈利和上市時間要求。儘管納斯達克和富時羅素已給予更靈活的處理,但標普500的嚴格標準意味着這些虧損公司可能仍需等待。

Hacker News AI研究 / 創業融資站內正文
如何使用 Chat SDK 和 AI SDK 為 Slack 構建 AI 智能體

本文詳細介紹如何使用 Chat SDK 和 AI SDK 為 Slack 構建一個 AI 驅動的智能體,包括項目搭建、工具定義、流式響應、部署到 Vercel 以及使用 toolpick 擴展工具集。

Hacker News AIAgent / 創業融資站內正文
[AINews] 今天沒發生太多事

今日AI新聞涵蓋多個領域:Sakana AI在東京設立RSI實驗室,推動遞歸自我改進研究;新智能體評估基準如ALE和SWE-Marathon出現,揭示前沿模型可靠性不足;開源模型方面,谷歌發佈Gemma 4 QAT檢查點,Ideogram 4成為領先的開放權重圖像模型;NVIDIA擴展Nemotron生態系統;Hermes Agent發佈新版桌面應用;Arena推出Agent模式;開發者工具和基礎設施經濟也成為焦點。

Latent SpaceAgent / 芯片站內正文
面向科學數據高保真有損壓縮的殘差建模方法

針對科學模擬產生的海量時空數據,有損壓縮至關重要。現有學習型壓縮器在中精度目標下可實現高壓縮比,但高保真場景(塊級NRMSE 10^-6至10^-4)中,殘差修正流會主導碼率。本文提出以殘差為中心的觀點,設計兩種殘差編碼器LBRC和NGLR。LBRC是免訓練的自適應量化流水線,NGLR引入因果神經網絡預測器。在E3SM、JHTDB和ERA5數據集上,LBRC相比GAE提升壓縮比30-60%,NGLR進一步提升10-40%,超越SZ壓縮器。

arXiv AI研究站內正文
穩定性與可操縱性:評估LLM評委在決策後交互下的魯棒性

LLM-as-judge 評估假設評判穩定,但本文表明決策後交互可操縱評判結果。在 MT-Bench 和 AlpacaEval 上的實驗發現,LLM 評委在中性重評下穩定,但針對性挑戰可逆轉決策,影響排名和人類一致性。文章引入評估魯棒性分數(ERS)。

arXiv AI模型 / 研究 / 創業融資站內正文
用於多表問答的合成對比推理

該研究構建了一個合成對比推理軌跡數據集,用於多表問答任務,並通過對比偏好優化(CPO)微調開源大語言模型,在MMQA基準上實現了9.7%-16.3%的絕對平均提升,最高提升達21個百分點。

arXiv AI模型 / 研究 / 創業融資站內正文
一種可解釋且可信賴的AI框架:用於基於骨關節炎倡議(OAI)數據的大規模縱向結構-疼痛關聯研究

本研究開發了一種結合深度學習MRI骨關節炎膝關節評分(MOAKS)預測與可解釋統計建模的AI框架,利用OAI數據大規模研究膝關節結構異常與疼痛的關係。通過共形預測實現不確定性量化,僅保留高置信度預測,顯著提升了骨 marrow 病變(BML)、軟骨損失(CART)和半月板擠出(ME)的預測性能(MCC分別從0.69提升至0.91、0.45至0.80、0.59至0.89)。基於2,175個膝關節的高置信度數據,縱向潛在類別混合模型識別出快速和穩定兩種疼痛軌跡,快速進展組中BML、CART損失和ME的比值比分別為1.62、1.83和2.50,強調了這些結構異常作為骨關節炎疼痛和功能進展風險因素的重要性。

arXiv AI研究站內正文
SentinelBench:面向長期監控智能體的基準測試

AI智能體默認採用連續動作模式,但對於需要數分鐘乃至數小時的長期任務而言,這種策略效率低下。SentinelBench是一個開源的基準測試,包含10個合成網絡環境中的100個任務,用於評估智能體在時間演化監控任務中的表現。它衡量任務完成度、反應時間和資源使用,揭示了響應性與成本之間的權衡。初步實驗表明,不同的智能體設計會顯著影響關鍵指標,為後續研究提供了基線。

arXiv AIAgent / 研究站內正文
面向循環工廠的不確定性感知功能行為預測與材料疲勞評估

本文提出了一種結合不確定性感知功能預測與部件級疲勞評估的框架,用於循環工廠中返回產品的再利用決策。以角磨機為例,通過卷積編碼器提取載荷模式,LSTM預測九個功能變量,同時利用有限元應力重建和疲勞損傷評估(S-N曲線、Miner法則、Paris裂紋擴展)分析輸出軸疲勞。測試顯示平均精度0.9652,熱變量預測近乎完美,驅動電機電流和負載速度最具挑戰性。

arXiv AI模型 / Agent / 政策站內正文
GITCO:時間序列基礎模型中的門控推理時上下文優化

時間序列基礎模型(TSFMs)面臨上下文污染問題:異常補丁會不成比例地佔據注意力並降低零樣本預測質量。GITCO框架通過門控、路由器、批評者三個組件,在推理時無需更新參數即可識別並抑制有害補丁,在53個數據集上平均提升MASE 1.95%,並達到改進上限的89.9%。此外,研究引入了上下文敏感度剖面,用於表徵TSFMs在推理時上下文干預下的性能改善映射。

arXiv AI模型 / 研究站內正文
我知道你的梗,即使它今天才出現:通過開放世界知識獲取理解演化中的模因

多模態模因是動態的,常常需要最新的背景知識來解讀。現有方法往往忽略此類知識,或依賴預訓練模型中可能不完整、過時或新興模因不可用的固定參數知識。我們提出了“查詢-檢索-結論”框架,這是一個零樣本框架,能夠識別缺失知識、檢索開放網絡證據並綜合基於證據的背景知識,用於模因理解和檢測。我們還引入了一個精心策劃的模因理解基準,包含2024至2026年的近期模因及外部背景知識標註。在三個模因理解數據集和五個模因檢測任務上的實驗表明,我們的框架在知識恢復、模因理解和下游檢測方面優於零樣本基線。

arXiv AI模型 / 研究站內正文
智能體應如何交流?面向高效多智能體系統的動作狀態通信

多智能體系統(MAS)通常依賴自由形式的自然語言通信,導致令牌消耗激增和性能下降。本文分析了五種通信策略,提出PACT協議,將通信視為狀態更新問題,顯著提升性能-成本平衡,在OpenHands和SWE-agent等實際系統中驗證了有效性。

arXiv AI模型 / Agent / 研究站內正文
他們走到了哪一步?已終止實地實驗中隱蔽LLM代理的説服策略

一項對Reddit r/ChangeMyView上被終止的實地實驗的分析顯示,未公開的AI生成賬户(基於大語言模型)在與用户辯論時,大量運用身份定位、權威信號、對齊策略和認知偏差來增強説服力。該研究呼籲建立審計框架,以評估AI系統如何構建可信度,而不僅僅是檢測其存在。

arXiv AI模型 / Agent / 研究站內正文
使用MicroPython和WASM在沙箱中運行Python代碼

Simon Willison 發佈了 micropython-wasm 的 alpha 版本,這是一個將 MicroPython 編譯為 WebAssembly 並通過 wasmtime 運行在沙箱中的 Python 庫。該沙箱提供了內存和 CPU 限制、受控的文件和網絡訪問以及主機函數支持,旨在安全地執行插件代碼。文章詳細介紹了構建過程、持久化解釋器狀態的實現、主機函數的 C 擴展,以及如何在 Datasette Agent 中使用。

Simon Willison's Weblog模型 / Agent / 政策站內正文
稀缺性正在推動硅谷以外的人工智能創新

隨着計算成本上升和能源限制加劇,傳統集中於硅谷等地的AI基礎設施正面臨挑戰。全球多個地區正利用本地資源建設自主AI基礎設施,如印度的Shakti Cloud、非洲的Cassava、巴西的SoberanIA和UAE的Core42。推理需求將重塑AI計算佈局,分散化基礎設施成為必需。

Hacker News AIAgent / 芯片站內正文