該論文提出了一種以部署為中心的評估方法,針對嵌入電子健康記錄的臨牀大語言模型系統,利用查詢內容和部署特定上下文(如提供者類型、科室、所用模型)訓練預響應分類器,預測用户拒絕風險。經過4.5個月的前瞻性分析,模型AUROC達到0.719,證明了利用部署上下文預測用户拒絕的可行性,為觸發防護欄和棄權策略提供了依據。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
一篇新預印本論文探討了從人類水平的通用人工智能(AGI)向人工通用超級智能(ASI)的過渡,提出了四種潛在路徑:擴展AGI、AI範式轉變、遞歸改進以及大規模多智能體集體湧現的ASI。論文還討論了這些路徑上的摩擦與瓶頸,並指出AI進步可能加速,導致一系列變革而非單一突破。
緊湊型語言模型在工具使用方面面臨挑戰,尤其是在孤立函數調用之外。Evoflux 在推理時使用進化搜索來修復可執行工具工作流,在 MCP-Bench 任務上將執行可行性從約3%提高到17-24%,優於 SFT 和 DPO 基線。
TrajGenAgent提出了一種基於分層LLM智能體的框架,無需模型微調即可生成逼真的合成人類移動軌跡。它採用兩階段設計:LLM首先通過上下文學習合成個體和星期條件化的活動鏈,然後通過確定性工作流(包括個性化POI檢索、距離感知位置選擇、運動學感知的旅行時間傳播和LLM持續時間估計)將每個活動轉化為完整的訪問記錄。此外,引入基於異常檢測的評估框架來評估行為與語義合理性。實驗表明,該方法在時空保真度、語義一致性和個體行為真實性方面優於現有方法。
該研究評估了大型語言模型中的謊言檢測器,創建了13個推理模型有機體(其隱藏信念通過思維鏈驗證),並提出了多樣化欺騙測試牀。在31個模型上測試了四種檢測器,發現所有檢測器在提示性撒謊任務中隨模型能力擴展,但在訓練有機體上,除思維鏈裁判外性能大幅下降。當前檢測器難以對模型信念做出高置信度聲明。
PersonaDrive是一種新框架,通過檢索風格指令的人類駕駛演示來調節視覺-語言-動作(VLA)駕駛智能體,實現多樣化的駕駛風格。它包括離線三元組挖掘、輕量級檢索頭訓練和單一VLA主幹微調,無需針對每種風格重新訓練即可切換風格。在Bench2Drive上,無風格條件下駕駛得分提升4.6%,風格條件下每種風格均取得最高分,且保守到激進風格平均速度和加速度分別提升18%和25%。
Pythagoras-Prover是一個計算高效的Lean定理證明器家族,包含4B和32B的自迴歸模型以及4B的擴散模型。它通過分層課程SFT和動態證明過濾提高訓練效率,並引入增強型Lean形式化(ALF)擴展驗證語料庫。實驗顯示,4B模型在MiniF2F-Test上以86.1%的pass@32超越DeepSeek-Prover-V2-671B(82.4%),而32B模型達到93.0%的新開源最佳水平,並在PutnamBench上解決93個問題。
傳統決策支持研究人類如何利用機器學習模型做出更好決策,但現代AI代理系統中角色反轉,AI代理代表用户行動,人類和工具成為支持機制。本文提出一個框架,通過優化問題最小化支持使用,同時控制反事實的遺漏支持錯誤——即代理在獨立行動時若獲得支持本可改善輸出的概率。最優策略是基於支持價值的閾值規則,並開發在線算法適應性地調整閾值,使用隨機探索控制錯誤,還引入即時校準減少不必要的支持調用。實驗表明該方法可靠地控制目標錯誤並大幅減少支持使用。
Arbor是一個多代理框架,將結構化樹搜索作為自主代理的認知層,用於大規模有狀態動作空間。在全棧LLM推理優化中,相比供應商優化基線,實現了高達193%的吞吐量-延遲帕累託改進,並且硬件無關、可重複。
研究人員發現,當前用於評估大語言模型工具檢索能力的基準測試存在高估問題。為此,他們提出了ToolSense,一個開源的自動診斷框架,可生成三種基準測試來更真實地評估模型對工具的理解。在ToolBench(約4.7萬個工具)上的實驗揭示了知識-檢索分離現象:一些模型在標準基準上表現良好,但在更現實的查詢中性能大幅下降,甚至低於嵌入基線。
一款本地優先的AI編碼命令行工具,能夠適應用户的使用習慣。
Otty 是一款 Mac 原生、GPU 加速的終端模擬器,專為代碼代理設計。它提供流暢的輸入體驗、會話恢復、可點擊鏈接等功能,旨在保持終端的簡潔與高效。
AI智能體正從簡單的聊天機器人演變為能夠自主操作應用和數據的數字員工,帶來了安全與治理難題。專家建議將其視為需要嚴格監督的人類實習生,限制權限、明確意圖,並持續監控。平衡獨立性與控制力是關鍵。
OpenAI宣佈收購Ona,這是一家提供雲沙箱平台管理長時間運行AI代理的初創公司。Ona的技術使AI代理能在開發者關機後繼續工作,並增強安全性。OpenAI將利用該技術改進其Codex AI助手,提升其執行長時間任務的能力。交易條款未披露。
Preply利用OpenAI技術推出AI生成的課程總結,提供個性化反饋和語言學習練習。
Datadog的高級FinOps分析師Deeja Cruz在FinOps X 2026上表示,AI成本管理的核心依然是瞭解使用情況、原因和成本,而良好的標記是分配支出和識別優化機會的關鍵。她還強調模型治理和跨團隊協作的重要性,並分享了AI輔助FinOps的實際案例。
Simon Willison 展示了 Claude Fable 5 的驚人主動性:僅憑一張截圖和一行提示,它自主調試了一個 CSS 滾動條錯誤,使用了多種創新技巧,包括自定義屏幕截圖、編輯模板注入 JS、搭建 CORS 服務器等。同時也警示了未沙箱化編碼代理的安全風險。
隨着企業AI支出加速,FinOps AI治理面臨壓力測試。傳統的成本優化手段(如標籤、合理調整大小和預留容量)在代幣、不透明計費和快速變化的架構面前顯得不足。根據FinOps基金會報告,98%的從業者管理AI支出,但多數缺乏可見性和治理結構。自動化成為必需,跨團隊協作對於理解成本背景至關重要。
以色列數據工程初創公司Upriver Data Ltd.宣佈獲得1400萬美元新融資,用於自動化企業為成功實施人工智能項目所需的數據工作。該公司由首席執行官Ido Bronstein和首席技術官Omri Lifshitz於2024年創立,構建了一個AI原生平台,可連接組織的完整數據棧,自動解決數據質量問題並維護管道,使AI系統能夠運行在可靠的數據基礎上,無需工程團隊持續手動維護。資金將用於擴大工程和上市團隊、深化產品開發並加速企業部署。
Anthropic發佈Claude Fable 5,因計劃暗中降低對涉及前沿大模型開發問題的回答質量而引發爭議。批評者認為此舉阻礙研究且損害信任。Anthropic隨後調整策略,改為透明地降級用户至較弱的Claude Opus 4.8。即便如此,Fable 5的安全過濾仍比其他前沿模型嚴格,甚至對“什麼是蛋白質?”這類問題也會觸發降級。文章詳細解釋了Anthropic的安全過濾機制及其演變。
detectly利用AI自動分析行車記錄儀視頻,識別危險事件併為駕駛員生成風險評分,無需人工觀看或新硬件,適用於任何車隊。
Ultramemory 是一款免費開源應用,將您的 Mac 轉變為私有 AI 記憶,索引電子郵件、Slack、文件和屏幕截圖到本地數據庫,提供可搜索、帶引用的答案,無需雲端或賬户。
梅賽德斯-奔馳韓國在Databricks平台上構建了統一的語義層,將500多個KPI定義從Power BI遷移到Unity Catalog,利用Genie和Agent Bricks實現AI與BI的一致語義,並通過自動化DAX到指標視圖的轉換器加速遷移,為其他市場提供了參考。
xAI 今日發佈了 Grok Build 插件市場,這是一個內置在終端編碼代理 Grok Build 中的插件目錄。插件將技能、斜槓命令、代理、鈎子、MCP 服務器和 LSP 捆綁成一個包,開發者無需離開終端即可瀏覽、安裝和更新。首發包含 MongoDB、Vercel、Sentry、Chrome DevTools、Cloudflare 和 Superpowers 六個插件,並採用提交 SHA 固定機制確保安全性。
企業AI的第二波浪潮聚焦於數據和軟件基礎設施。Snowflake通過連接專有數據與AI模型,幫助企業實現業務成果。本文總結了安全治理、數據基礎和生產化AI三大關鍵洞察。
Databricks正式推出前向部署工程(FDE)組織,旨在通過嵌入工程、全球合作伙伴網絡和研發聯動,加速客户實現AI業務成果。過去一年,FDE團隊已與1900多家客户合作,包括幫助Fox將搜索成功率翻倍、為JPMC遷移超過5PB數據和500個筆記本並培訓600名用户,以及幫助高通將AI實驗轉向生產級代理模型,將多天工作流程縮短至分鐘級。FDE的核心是圍繞客户業務目標,通過共享OKR提供可衡量的成果。
Elvin是一款主動式AI工具,能夠自動識別並完成任務,無需等待用户指令,從而簡化工作流程。
Benchling,一家生命科學研發數據平台,在2025年10月推出了Benchling AI,包含一個由智能體支持的聊天界面。其AI主管Nicholas Larus-Stone與LangChain CEO Harrison Chase討論了構建科學工作智能體的複雜性,包括使用多模型架構、生產追蹤審查以及可驗證科學任務的策略。
Prometheus Inc.,一家由亞馬遜創始人傑夫·貝索斯聯合領導的AI初創公司,在B輪融資中籌集了120億美元,估值達410億美元。該公司正在開發一套AI工具,旨在加速硬件開發,重點專注於原型設計和預生產製造。資金將主要用於購買計算基礎設施。
Chainguard推出新的源代碼掃描器,檢測所謂“灰色軟件”——即功能透明但包含有害行為的開源包。該掃描器已識別並阻止超過52000個惡意或灰色包,並指出AI驅動的代理開發加劇了這一問題。