AI News HubLIVE

AI 新聞即時情報

即時監測

今天 AI 世界最重要的變化

來自 105 個可信來源,最近更新 2026-05-29 12:00 UTC+8。

即時監測

即時更新

即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。

即時更新

重設
前沿LLM智慧體可突破自然表型本體註釋瓶頸

一項新研究利用Anthropic和OpenAI的五種前沿大語言模型作為智慧體策展人,在自包含工作空間中自動進行表型註釋。實驗表明,這些智慧體的一致性達到了人類策展人的變異範圍,並顯著優於傳統NLP工具,有望解決表型本體註釋中人工依賴強、難以規模化的問題。

arXiv AI模型 / Agent / 研究站內正文
擴散模型的正交概念擦除方法

本文提出正交概念擦除(OCE),透過乘法引數更新實現精確的概念擦除,同時保持擴散模型的生成能力,支援多概念擦除,速度快。

arXiv AI模型 / 研究站內正文
《評審街機:論LLM評審的人類對齊與可博弈性》

該論文透過實驗評估了大型語言模型(LLM)生成的科學論文評審與人類評審的對齊程度,發現對齊有限且因提示和模型而異。研究還發現,作者利用LLM評審進行迭代修改可顯著提升論文評分,最多35%的論文分數得到統計顯著提升。

arXiv AI模型 / Agent / 研究站內正文
認知範疇變換器:用於語言建模的範疇論歸納偏置

認知範疇變換器(CCT)是一種306M引數的架構,透過在預訓練的GPT-2 Small骨幹網路上新增源自範疇論和認知科學的元件,在WikiText-103上實現了21.27的驗證困惑度,相比微調基線降低2.92(12%)。消融實驗證實,84%的改進來自GT-Full單純訊息傳遞。研究還發現了結構/一致性區分模式。

arXiv AI模型 / 研究站內正文
行為感知的離線策略時序差分預測輔助修正

本文提出行為感知輔助修正,以穩定離線策略時序差分學習。透過用行為貝爾曼矩陣替代輔助協方差矩陣,作者引入BA-TDC和BA-TDRC演算法。理論分析證明了不動點保持和幾乎必然收斂。在標準基準上的實驗表明,行為感知替換可提高效能,但正則化對穩健結果必要。

arXiv AI模型 / 政策 / 研究站內正文
行為誘導的映象近端時間差分學習:加速離策略預測

本文提出了一種名為STHTD-MP的行為誘導映象近端時間差分方法,透過用行為策略貝爾曼矩陣的對稱部分替換協方差度量,改善了離策略預測的收斂速度。理論分析和數值實驗表明,該方法在多項基準測試中優於現有的GTD2-MP方法。

arXiv AI模型 / 政策 / 研究站內正文
Ruby發明者Matz藉助AI開發原生編譯器

Ruby建立者Yukihiro Matsumoto(Matz)正在Anthropic的Claude協助下構建Spinel,一個實驗性的Ruby提前編譯(AOT)編譯器。Spinel將Ruby程式碼轉換為C語言,效能提升顯著,但存在諸多限制,包括不支援eval、執行緒等特性。

Hacker News AIAgent / 研究站內正文
一次性軟體——如何停止擔憂並愛上AI程式碼

文章探討了“一次性軟體時代”的概念,認為AI生成的程式碼應被視為可丟棄的,就像工業革命中的傢俱一樣。作者透過一個實際案例展示瞭如何用AI重構程式碼,並提出了“一次性程式碼宣言”,強調程式碼需滿足意圖、要求和安全性。

Hacker News AI政策 / 研究站內正文
藉助 Rosalind Biodefense 增強社會韌性

OpenAI 推出 Rosalind Biodefense,為經過審查的開發者及美國政府合作伙伴提供 GPT-Rosalind 的受信訪問,助力生物防禦、公共衛生與大流行病防範。

OpenAI News模型站內正文
清華系團隊給大模型織了一張“智慧算力電網”

清華系創業公司是石科技透過自主研發的並行最佳化技術,構建異構算力資源池與推理最佳化引擎,實現單位Token成本降低40%,旨在打造國產Token調優工廠,降低AI落地門檻。

量子位模型 / Agent / 晶片站內正文
如何最佳化您的AI令牌使用量:repo-brain 工具介紹

repo-brain 是一款開源工具,能將整個程式碼庫壓縮成單個Markdown上下文檔案,實現高達96%的壓縮率,大幅減少AI令牌使用量。它支援多種程式語言的靜態分析、架構分析和語義關係發現,併相容多家AI提供商。

Hacker News AIAgent站內正文
ReadyToTalk – 專為小企業打造的AI前臺,由AI代理獨立構建

ReadyToTalk是一款專為小企業設計的AI前臺接待員,能在2秒內接聽所有來電,提供24/7全天候服務,支援30多種語言,並自動學習企業資訊。每月僅需39美元,無需技術知識即可在幾分鐘內完成設定。

Hacker News AIAgent / 政策站內正文
Overline

Overline 是一款 Chrome 擴充套件,可為任何瀏覽器影片提供即時 AI 字幕和即時翻譯,延遲低於一秒,無需字幕。

Product Hunt AI工具站內正文
Bixonimania – AI 上當的假疾病

一位研究人員製造了一種假疾病來測試AI,結果AI聊天機器人完全被騙了。這個實驗揭示了AI醫療建議的潛在風險,以及訓練資料缺乏人工審查的問題。

Hacker News AI研究 / 創業融資站內正文
Anthropic年化收入達470億美元

Anthropic在65億美元H輪融資公告中透露,其年化收入已超過470億美元,較4月份的300億美元大幅增長。該公司此前在2025年底為90億美元,2026年2月為140億美元,顯示出驚人的增長速度。文章還提到了一家客戶因未設定使用限制而單月花費5億美元的軼事。

Simon Willison's Weblog模型 / 創業融資站內正文
AI幻燈片工具值得使用嗎?

本文分析了AI演示工具Genspark的侷限性,並介紹了2026年六大替代方案,包括Smallppt、Plus AI、Prezi、Vector Shift、Beautiful.ai和ClickUp,各自具有獨特的優勢,幫助使用者根據需求選擇合適的工具。

Hacker News AIAgent / 研究站內正文
theta-spec:一個謙遜的、與框架無關的AI智慧體配置規範

theta-spec 是一個宣告式的、與任何AI編碼智慧體框架無關的配置標準。它透過一個單一的 theta.toml 檔案定義完整的配置表面(指令、規則、工具、技能、子智慧體),並規定了配置檔案的宣告週期協議。任何符合規範的實現都可以解析、鎖定並將配置轉換為任何支援的框架。該專案還提供了參考實現 theta CLI(Rust 編寫)。

Hacker News AIAgent / 研究站內正文
人工智慧與我們熟知的衰退的終結

對沖基金巨頭Citadel的創始人Ken Griffin對AI的態度從蔑視到沮喪,因為AI代理在數小時內完成之前需要數週或數月的工作。這引發了對經濟增長與就業脫鉤的擔憂,可能挑戰傳統GDP作為經濟健康指標的可靠性。

Hacker News AIAgent / 研究站內正文
Show HN:Trelk – 閱讀、思考、連線

Trelk 是一款一次性購買、無需訂閱的知識管理應用。它利用裝置端 AI 儲存、組織並連線文章、論文和筆記,提供混合搜尋、知識圖譜、RAG 聊天、閃卡間隔重複和社群集合等功能,注重隱私且可離線工作。

Hacker News AI研究站內正文
Together AI如何構建全球最快的語音轉文本技術棧

Together AI透過將語音識別視為端到端系統問題,而非單純的GPU推理問題,在Artificial Analysis榜單上實現了最快的語音轉文本速度。本文詳細介紹了其最佳化策略:包括針對真實音訊形狀的TensorRT多配置檔案引擎、條件CUDA圖消除CPU往返、共享記憶體減少資料複製、事件驅動I/O處理流式傳輸,以及透過gc.freeze()消除垃圾回收尾延遲。

Together AI BlogAgent / 晶片站內正文
AI每週第497期:AI的勞工戰爭全球爆發

本週,AI與工作的衝突在四個司法管轄區同時爆發:維基百科編輯因裁員組織罷工,亞馬遜員工將內部AI評級系統玩壞,中國法院開始執行禁止以AI為由裁員的規定,英國智庫呼籲員工在AI部署中擁有發言權。同時,前沿實驗室繼續深入政府合作。

AI Weekly晶片 / 政策站內正文
值得信賴的第三方評估共享手冊

OpenAI分享了第三方AI評估指南,涵蓋如何評估前沿系統的模型能力、安全措施和有效性。

OpenAI News研究 / 創業融資站內正文
強化學習是一個基礎設施問題

本文探討了強化學習在大型語言模型後訓練中的實際應用,指出當前的瓶頸並非演算法而是基礎設施。Modal分享了大規模執行RL後訓練的經驗,介紹了其開源庫如何幫助團隊解決多節點訓練、環境管理和GPU利用率等關鍵問題。

Modal BlogAgent / 晶片站內正文
PyTorch 效能分析(第一部分):torch.profiler 入門指南

本文是 PyTorch 效能分析系列的第一篇,從最簡單的矩陣乘加操作開始,引導讀者學習如何使用 torch.profiler 進行效能分析,包括設定分析器、解讀分析表和追蹤資料,以及理解 CPU 和 GPU 活動之間的時間關係。文章還討論了預熱和最佳化開銷等問題。

Hugging Face Blog晶片 / 創業融資站內正文
Claude Opus 4.8:'適度但切實的改進'

Anthropic釋出了Claude Opus 4.8,定位為對前代產品的適度但切實改進。主要亮點包括誠實性提升(減少無依據斷言,程式碼錯誤遺漏率降低四倍),以及支援對話中修改系統提示等新功能。定價未變,但快速模式價格顯著降低。

Simon Willison's Weblog模型 / Agent / 政策站內正文
llm-anthropic 0.25.1 釋出

llm-anthropic 0.25.1 版本新增對Claude Opus 4.8模型的支援,為有許可權的組織提供快速模式選項,並調整了各模型的預設最大令牌數為模型最大輸出而非8192。

Simon Willison's Weblog模型站內正文