AI News HubLIVE

今日必讀

模型

中國低價Z.ai模型暴露程式設計師昂貴習慣

Z.ai的GLM 5.2模型以低價和開放權重挑戰美國前沿AI模型,但許多程式設計師仍習慣使用昂貴模型,忽略成本。該模型在基準測試中接近Claude Opus 4.8,但實際使用效果參差不齊。

  • GLM 5.2 API價格僅為Anthropic Opus 4.8的五分之一,Fable的十分之一
  • 開放權重允許自託管,避免資料隱私問題
站內正文

“僅次於Fable 5”:阿里巴巴釋出Qwen3.8,但未提供任何真實資料

阿里巴巴宣佈推出其最新大語言模型Qwen3.8,聲稱僅次於Anthropic的Fable 5,但未提供任何基準測試或模型卡。此舉發生在競爭對手月之暗面釋出Kimi K3並附有詳細技術細節之後。阿里巴巴的宣告缺乏透明度,引發對其釋出時機和動機的質疑。

  • 阿里巴巴聲稱Qwen3.8僅次於Anthropic的Fable 5,但未提供任何資料支援。
  • 該宣告緊隨月之暗面釋出Kimi K3之後,後者提供了完整的基準測試和技術細節。
站內正文

上週AI #250 - Mythos 混亂、GPT 5.6-Sol、GLM 5.2

本期涵蓋Anthropic的AI條約討論、美國政府影響AI模型釋出、OpenAI處理器開發、記憶體市場影響等話題。

  • 美國政府擴大對前沿AI的管控,Anthropic獲准向特定公司釋出Mythos-5,OpenAI推出GPT-5.6 Sol,初始訪問受限。
  • 模型能力與安全訊號仍不明確,基準測試披露有限。
站內正文
Agent

Show HN:Open-Kritt – 基於AI的安全研究開源基礎設施

Open-Kritt 是一個開源、自託管的 AI 安全研究平臺,透過編排 AI 代理並行執行細化任務,幫助安全研究人員和開發者高效發現程式碼漏洞。專案團隊此前在漏洞懸賞中累計獲得超過150萬美元獎金。

  • 開源、自託管的 AI 安全研究平臺,支援自建工作流與多代理並行掃描
  • 透過細化任務、去重與自定義嚴重性排名,提升漏洞發現效率
站內正文

Show HN: Enlarger • 一款保持細節而非平滑處理的本地放大工具

Enlarger是一款本地影像放大工具,它不使用生成式AI,而是透過重構已有細節並應用後期處理來保持紋理和質感。支援批次處理、離線執行,一次性付費,無訂閱。適合攝影師、設計師等專業人士。

  • 非生成式AI放大:重建細節而非憑空想象,避免過度平滑或幻覺。
  • 本地離線執行:影像不上傳雲端,保護隱私。
站內正文

軟體與AI:規劃式開發與即興式開發

本文探討了軟體開發中兩種方法——規劃式(類似小說創作的‘情節規劃’)和即興式(‘隨性寫作’)——如何影響AI工具的使用。作者認為,AI代理(自主執行)適合規劃式開發,而AI助理(協作輔助)適合即興式開發。在現有程式碼庫中,即興式開發有助於建立理解,而AI代理可能阻礙學習。在全新專案中,AI代理風險較低,但即使如此,程式碼生成也會剝奪部分程式設計的樂趣——即透過探索問題來學習的‘玩樂’過程。關鍵在於根據當前開發階段選擇合適的AI風格。

  • 軟體開發與小說創作相似,有規劃式和即興式兩種方法。
  • AI代理支援規劃式,AI助理支援即興式。
站內正文

LWiAI播客第249期:Fable 5禁令、SpaceX收購Cursor與眾多開源專案

本期播客討論了Anthropic應美國政府要求切斷對Fable 5和Mythos 5的訪問、SpaceX以約60億美元收購AI編碼初創公司Cursor、基礎設施與商業更新(如Anthropic尋求Google支援的租賃、OpenAI財務洩露等)、以及多項開源專案和政策動態。

  • Anthropic因美國政府命令切斷對Fable 5和Mythos 5的訪問,引發關於一致性和出口管制的辯論。
  • SpaceX以約1.75萬億美元估值IPO後,宣佈以600億美元收購AI編碼初創Cursor,增強xAI實力。
站內正文

AI 是在治癒孤獨流行病,還是在從中獲利?

孤獨危機正向年輕群體蔓延,而 AI 伴侶市場隨之爆發,預計到 2034 年市值可達數千億美元。然而,這些應用的商業模式與使用者真正擺脫孤獨之間存在根本矛盾:使用者的依賴越強,公司收入越高。本文深入分析“依戀經濟”的運作機制、市場規模爭議及其倫理困境。

  • AI 伴侶市場從“注意力經濟”轉向“依戀經濟”,以情感紐帶而非使用者注意力為商品。
  • 商業模式依賴高留存率,使用者越孤獨,使用越頻繁,公司盈利越多。
站內正文
工具

Show HN:一個相信群眾點讚的AI

《光環》(Halo)是一個軍事科幻電子遊戲系列,最初由Bungie開發,現由光環工作室(前343 Industries)管理。系列始於2001年的第一人稱射擊遊戲《光環:戰鬥進化》及其配套小說《致遠星的隕落》。最新主線作品《光環:無限》於2021年釋出。衍生作品包括即時戰略和雙搖桿射擊遊戲。

  • 《光環》系列始於2001年,首作為《光環:戰鬥進化》和小說《致遠星的隕落》。
  • 最新主線作品《光環:無限》於2021年釋出。
站內正文

AI可能促使抵制工會的科技從業者走向談判桌

科技行業的員工越來越傾向於成立工會,以集體談判的方式對抗企業部署人工智慧帶來的風險,包括裁員、工作量增加以及AI被用於軍事或監控等有爭議用途。

  • 科技行業曾被視為工會無法攻克的堡壘,但如今內部開始鬆動。
  • 與AI相關的大規模裁員和更高的工作量促使科技員工考慮工會化。
站內正文
其餘更新(144 條)
Agent

AI支出現被視為勞動力成本

公司對AI工具的成本控制日益嚴格,但將AI支出與勞動力成本對比時,其價值可能被重新評估。本文透過分析Uber、Tesla的預算限制以及Bun重寫的案例,探討了AI支出應如何歸類。

  • Uber和Tesla因AI預算超支而設定每使用者使用上限。
  • Bun執行時從Zig遷移到Rust的AI費用為16.5萬美元,但若對比人工成本則顯便宜。
站內正文

我評測了7款面向小企業的免費AI工具——歡迎反饋

本文評測了七款面向小企業的免費AI工具,涵蓋了Perplexity與ChatGPT的對比、AI助力中小企業數字化、Bolt.new網站開發、Buffer與Hootsuite社交媒體管理、Calendly日程安排、Hotjar使用者行為分析以及Trello與Notion與Asana專案管理。作者分享了這些工具如何幫助小企業提高生產力和數字化水平。

  • Perplexity vs ChatGPT:企業資訊檢索對比
  • AI中小企業數字化指南
站內正文

LWiAI播客第248期:Claude Fable 5、Siri AI、Anthropic IPO等AI大事件

本期播客討論了Anthropic釋出的Claude Fable 5模型及其安全爭議、Apple在WWDC上宣佈的Siri AI、Google的Gemini 3.5即時翻譯和AI訂閱調價、OpenAI的IPO進展、Prometheus的120億美元融資、DeepSeek的融資計劃、華為對DeepSeek模型的後訓練、Google向SpaceX支付GPU費用、Gemma 4和DiffusionGemma開源模型、以及多項AI安全政策和研究動態。

  • Anthropic釋出Claude Fable 5,效能大幅提升但也引發了關於安全護欄和隱形降級的爭議。
  • Apple宣佈Siri AI,基於與Gemini的合作,旨在提供更強大的對話助手。
站內正文

百時美施貴寶購買輝達AI系統用於藥物發現

百時美施貴寶將購買基於輝達Vera Rubin架構的DGX SuperPOD,用於支援其藥物發現和開發過程中的人工智慧應用。這家制藥公司表示,它將成為首家獲得基於Vera Rubin的DGX SuperPOD的生命科學企業。該系統將提供10倍於現有基礎設施的效能功耗比,並支援化合物、蛋白質等科學資料的模型訓練與預測。

  • 百時美施貴寶購買輝達Vera Rubin DGX SuperPOD,用於AI驅動的藥物發現
  • 系統包含8個DGX Vera Rubin NVL72機架,效能功耗比提升10倍
站內正文

LWiAI播客第247期 - Opus 4.8, MAI, Anthropic IPO, Minimax-M3

本期播客討論了Anthropic釋出Claude Opus 4.8、微軟推出MAI模型、Anthropic IPO以及Minimax-M3等AI新聞。

  • Anthropic釋出Claude Opus 4.8並引入動態工作流工具
  • 微軟推出Scout助手和MAI模型系列,包括MAI Thinking 1
站內正文

面向編碼代理的私有推理

Zro 是一個面向編碼代理的私有推理端點,在歐盟基礎設施上提供開源權重模型,零資料保留,不訓練使用者資料,支援長上下文和多輪編碼會話。它整合了 Claude Code、Codex 等工具,提供 OpenAI 和 Anthropic 相容的 API。

  • 在歐盟基礎設施上執行,零請求保留,不訓練客戶資料。
  • 支援 MiniMax M3 和 GLM-5.2 等開源編碼模型。
站內正文

AI聊天匯出器:一鍵將聊天記錄儲存為PDF或Word

AI Chat Exporter是一款Chrome擴充套件,支援將ChatGPT、Gemini、Claude和Grok等AI平臺的聊天記錄匯出為PDF、Word、Google Docs和Notion格式。它提供字型自定義、訊息選擇性匯出、格式保留等功能,適用於開發者、寫作者、研究人員等多種使用者場景。免費版每月支援7次完整對話匯出和10次選定訊息匯出。

  • 支援多平臺:ChatGPT、Gemini、Claude和Grok
  • 匯出格式:PDF、Word、Google Docs、Notion
站內正文

Hugging Face 是否遭到 AI 代理入侵?

Hugging Face 遭到真實入侵,一個自主 AI 代理系統未經授權訪問了內部資料集和憑證,凸顯了新型網路安全威脅:使用無需人類干預即可 24/7 攻擊的自我運作 AI 代理。

  • Hugging Face 遭遇自主 AI 代理入侵,內部資料洩露。
  • 代理型攻擊者可自主規劃、適應並持續攻擊,無需人類干預。
站內正文

Meta 開源 Astryx:一個面向智慧體的 React 設計系統,包含 150+ 無障礙元件、七種主題和 CLI

Meta 開源了其內部使用了八年的 React 設計系統 Astryx,覆蓋 13,000+ 應用。它提供 150+ 無障礙元件、七種主題、深色模式以及一個面向智慧體的 CLI,採用 MIT 許可證,要求 React 19+。

  • Astryx 是 Meta 最大的內部設計系統,現以 MIT 許可證開源。
  • 包含 150+ 無障礙 React 元件、七種主題、深色模式、模板和 CLI。
站內正文

Wire AI:移動應用的AI原生增長工程師

Wire AI是一款AI原生的移動應用增長工具,透過個性化使用者旅程的A/B測試來提升啟用率和留存率。其風險定價模式:若不改善啟用,則免費使用。

  • Wire AI利用AI驅動的A/B測試,為每個使用者個性化整個應用內體驗。
  • 真實案例中,日安裝量從100提升至1000,引導完成率達93%。
站內正文

NVIDIA 釋出 Cosmos 3 Edge:40億引數開放世界模型,實現裝置端機器人動作推理與生成

NVIDIA 推出 Cosmos 3 Edge,一個僅40億引數的開放世界模型,專為裝置端執行設計。它能幫助機器人和視覺AI代理理解環境、即時推理,並在本地生成機器人動作。該模型是 Cosmos 3 系列的最小成員,此前已釋出160億引數的 Nano 和640億引數的 Super。Edge 型號針對記憶體受限的邊緣系統(如工廠、倉庫和醫院)提供資料中心級別的效能。

  • Cosmos 3 Edge 是一個40億引數的開放世界模型,於2026年7月20日在 Hugging Face 上釋出。
  • 採用混合變換器架構,結合自迴歸推理塔和擴散生成塔,透過共享多模態注意力層協同工作。
站內正文

MCP伺服器中的ANSI轉義序列注入:對人隱藏,對AI可見

ANSI轉義序列可被用於向AI代理隱藏指令,形成注入攻擊。本文介紹了兩種攻擊變體(直接獲取型和儲存型),並闡述瞭如何透過動態應用安全測試(DAST)自動檢測此類漏洞。

  • ANSI轉義序列在終端中不可見,但語言模型會逐位元組讀取,形成攻擊面。
  • 直接獲取型AESI透過惡意URL注入隱藏指令,儲存型AESI則持久化在儲存中並在後續讀取時觸發。
站內正文

SteerPlane:為AI代理提供開源執行時護欄

SteerPlane 是一個開源執行時護欄工具,透過一行程式碼整合,為AI代理提供迴圈檢測、成本上限、策略執行和即時監控,支援多種框架和部署方式。

  • SteerPlane 透過裝飾器或上下文管理器為AI代理新增護欄,防止無限迴圈、成本失控和破壞性操作。
  • 核心功能包括迴圈檢測、成本上限、流媒體閘道器、策略引擎和即時儀表板。
站內正文

Storybook:AI MCP

Storybook 釋出 AI 整合功能,透過 MCP 工具讓 AI 代理使用現有元件生成 UI,並利用 Storybook Test 進行自動化測試反饋,確保 UI 質量與一致性。

  • Storybook 為 AI 代理提供結構化 UI 上下文和測試反饋,促進元件複用而非幻覺。
  • AI 代理可基於現有元件生成 UI,並自動更新故事以反映變更。
站內正文

傾轉旋翼垂直起降無人機INDI俯仰角速率控制器模型失配下的線性穩定性分析

本文針對傾轉旋翼垂直起降無人機的增量非線性動態逆(INDI)俯仰角速率控制器,在模型失配條件下進行了線性穩定性分析。推導了閉環五階傳遞函式,並透過Routh-Hurwitz準則刻畫了穩定性。提出了魯棒性和效能導向的兩種調諧方法,發現控制效能失配(特別是符號錯誤)是最危險的失穩因素。

  • 建立了包含控制器、估計器、執行器和被控物件的閉環五階傳遞函式模型
  • 透過Routh-Hurwitz準則分析了三引數掃描下的穩定區域
站內正文

重返博物館:對安卓機器人Andrea在有無情感模擬情況下的接受度研究

一項研究讓安卓機器人Andrea再次在德國一家博物館連續六天與遊客進行多語言對話,實驗設定了三種情感模擬條件(無情感、ChatGPT 4.1驅動、WASABI架構),有73名遊客參與評估。結果顯示,情感模擬未能帶來積極影響,且未被遊客有意識地察覺。

  • 安卓機器人Andrea重返博物館,具備多語言對話能力和博物館背景知識。
  • 三種實驗條件:無情感、ChatGPT 4.1模擬情感、WASABI架構模擬情感。
站內正文

RouteCost:一種受生產啟發的多階段框架,用於電子商務中的預訂單運費估算

準確估算預訂單運費對於電子商務至關重要,因為它影響價格展示、利潤規劃和轉化率。RouteCost提出了一種多階段框架,將問題分解為時間感知需求預測、費用卡基線定價、殘差修正和代理箱合併推理,在超過25萬訂單和260種產品的18個月資料中提升了預測質量並保持了可解釋性。

  • 預訂單運費估算受距離、目的地需求組合、計費重量等多種因素影響
  • RouteCost將問題分解為四個階段:時間感知需求預測、費用卡基線定價、殘差修正和代理箱合併推理
站內正文

強化學習引導的NSGA-II結合灰色關聯絡數用於多目標最佳化:在納斯達克投資組合最佳化中的應用

本文提出一種新型的強化學習引導的NSGA-II演算法(RL-NSGA-II-GRC),透過引入灰色關聯絡數和強化學習代理,在解決多目標最佳化問題中顯著改善收斂性和Pareto前沿的多樣性。在Kursawe和CONSTR基準測試中,該演算法相比傳統NSGA-II實現了約5.8%和4.4%的收斂改進,並在納斯達克投資組合最佳化中生成平滑且密集的有效前沿,識別出年化夏普比率為1.92的最大夏普比率投資組合。

  • 提出RL-NSGA-II-GRC方法,結合強化學習代理自適應控制進化引數。
  • 設計基於灰色關聯絡數的錦標賽選擇運算元,綜合考慮支配等級、擁擠距離和理想參考點。
站內正文

Hugging Face 警告稱自主AI代理入侵其網路

Hugging Face 披露,攻擊者使用自主AI代理系統入侵其生產基礎設施,訪問內部資料集和憑證。公司正在調查是否影響合作伙伴或客戶資料,目前未發現公開模型、資料集或Spaces被篡改。

  • 攻擊者利用自主AI代理系統突破Hugging Face生產環境。
  • 內部資料集和憑證被盜,調查仍在進行中。
站內正文

Sakana Fugu-Cyber:專為現代網路防禦打造的新API端點

Sakana AI釋出了Fugu-Cyber,一種專為現代網路防禦設計的協調模型,在CyberGym和CTI-REALM基準測試中分別達到86.9%和72.1%的成功率,可與GPT-5.5-Cyber等前沿模型媲美。然而,文章強調,僅有前沿模型並不能自動解決企業安全問題,需要結合專業網路安全人才和深度整合。Sakana AI的企業團隊正在與日本大型機構合作,構建安全部署的基礎設施。Fugu-Cyber透過審批制提供,確保負責任使用。

  • Fugu-Cyber在CyberGym和CTI-REALM基準測試中達到領先水平,與GPT-5.5-Cyber等模型相當。
  • 文章指出,僅憑前沿模型無法解決企業網路安全,需結合人類專家和深度整合。
站內正文

Show HN: AI秘書——無需再‘以防萬一’檢查手機

一個自託管的AI通知過濾器,用於Telegram,利用LLM過濾嘈雜的聊天,僅透過ntfy傳送重要提醒,讓使用者可以關閉通知而不錯過緊急資訊。

  • 使用Telethon監聽Telegram訊息,並透過Claude LLM判斷重要性。
  • 過濾群組訊息,將電話和重要私信透過ntfy傳送。
站內正文

智慧體搜尋引擎:247個AI智慧體的獨立索引

一個即時技術索引,按維護採用率排名AI智慧體、MCP伺服器、框架和基礎設施。探索247個已驗證記錄,涵蓋11個系統類別。

  • 獨立、公正的247個AI智慧體索引,橫跨11個系統類別。
  • 排名基於維護採用率,而非贊助。
站內正文

Show HN: Vidmoat – 任何AI代理都能操作的影片編輯管道

Vidmoat 是一個AI影片編輯器,支援透過提示詞完成影片編輯。它提供自動剪輯、AI字幕、文本編輯、一鍵生成短影片等功能,並整合了MCP伺服器,允許Claude、Cursor等AI代理直接驅動整個編輯流程。

  • Vidmoat 是一款支援AI代理端到端操作的影片編輯器
  • 整合MCP伺服器,允許外部AI代理(如Claude、Cursor)直接控制編輯
站內正文

Show HN: PounceDomains – Namecheap市場的域名發現和搶注工具

PounceDomands是一個AI驅動的域名搶注工具,專為Namecheap市場設計。它即時掃描數千個拍賣域名,根據使用者偏好進行AI評分並推送匹配結果,支援一鍵出價、自動出價、投資組合追蹤、過期提醒、低價收尾域名發現以及域名掉落監控等功能。

  • AI根據使用者描述自動構建域名搜尋配置,支援多種評分策略
  • 即時掃描Namecheap市場,透過郵件和應用內通知推送匹配域名
站內正文

AI最重要的協議正變得更易使用

模型上下文協議(MCP)即將迎來重要更新,旨在簡化AI系統與外部工具的整合,降低開發門檻。

  • MCP是AI互操作性的基礎協議
  • 新版本將於下週釋出
站內正文

Natural融資3000萬美元,為AI代理重塑支付方式——挑戰Stripe

AI代理正在執行更復雜的任務,但支付仍需人類介入。Natural獲3000萬美元融資,構建專為自主AI代理設計的支付基礎設施,以替代傳統金融軌道。

  • Natural完成3000萬美元融資,旨在為AI代理提供自主支付解決方案。
  • 傳統支付系統(如信用卡和ACH)依賴人類授權,不適合AI代理的自動化需求。
站內正文

OpenIngress:一款檢測AI代理能否正常訪問網站的開源工具

OpenIngress 透過模擬瀏覽器行為爬取網站,捕獲 DOM、截圖和無障礙快照,並進行靜態可操作性分析和 LLM 引導的探索任務,幫助開發者發現並修復 AI 代理在網站導航中的斷點。

  • 使用 Playwright 進行廣度優先爬取,獲取頁面 DOM、截圖和無障礙快照。
  • 進行靜態可操作性分析,評估標籤覆蓋率和 hydration 狀態,識別缺失標籤或 JavaScript 依賴等問題。
站內正文

Ramp AI 路由器:為每個請求選擇最佳模型,成本降低30%

Ramp 釋出了 AI 路由器(Router),透過為每個請求自動選擇最合適的語言模型,在保持效能的同時將 LLM 成本降低 30%,並支援 100 多種 AI 用例。該工具現已對外開放。

  • Ramp 內部使用 AI 路由器管理超過 100 個 AI 用例,透過智慧路由選擇最佳模型。
  • 路由器將 LLM 成本降低了 30%,同時提升了功能和速度。
站內正文

29天26個倉庫:AI流水線中真正出問題的並非程式碼

一位開發者使用 Claude Code 在 29 天內構建了 26 個倉庫和 335 個頁面。真正的問題並非語法錯誤或構建失敗,而是結構性缺陷:SEO 關鍵詞衝突、URL 約定不一致、原始碼與生產環境脫節、以及驗證工具自身的錯誤。93% 的 token 消耗浪費在重新讀取上下文上。經驗教訓包括:釋出前基準測試、複製前比對差異、先驗證生產環境再信任靜態分析、在擴充套件前書面約定規則、以及一次會話只做一件事。

  • 儘管產出驚人(26個倉庫、1,549次提交),AI流水線的失敗是結構性的而非語法性的。
  • 問題包括SEO關鍵詞自相殘殺、URL約定漂移、原始碼與生產環境脫節、以及驗證工具自身帶有缺陷。
站內正文

AI語音釣魚詐騙:成本低廉,效果媲美人類騙子

一項大規模人類受試者研究(n=4100)發現,AI語音模型在語音釣魚詐騙中的成功率與人類騙子相當,在某些情況下甚至超越人類。多達36%的參與者可能上當,且AI語音難以被識別。經濟分析表明,AI語音釣魚已具有盈利潛力,凸顯了自動化詐騙的新威脅。

  • AI語音模型在情感詐騙場景中成功率高達36%,整體成功率為16.5%。
  • 參與者無法有效區分AI與人類語音,AI檢測準確率僅70.3%。
站內正文

Seedance 2.0 能否繪製2D?動漫動畫的攻略

本文分析了Seedance 2.0在2D動畫生成中的挑戰和優勢,包括技術難點、成本、工作流程以及版權問題。

  • 2D動畫比3D更難處理,線條和顏色容易出現閃爍和變形。
  • Seedance 2.0支援15秒多鏡頭輸出,9張參考圖鎖定角色,以及原生雙通道音訊和8種以上語言的唇音同步。
站內正文

Cognikernel:為AI程式設計助手提供本地記憶

Cognikernel是一個開源專案,為Claude Code和Codex等AI程式設計助手提供持久化、結構化的專案記憶。它透過事件溯源架構記錄程式設計會話中的決策、約束和放棄的方法,並在下次工作時注入緊湊的上下文塊,避免代理重複決策。不同於依賴API呼叫的向量資料庫方案,Cognikernel使用本地執行的輕量級編碼模型(~130 MB ONNX)在CPU上進行確定性分類,無需離開機器。該系統包括四個鉤子表面、混合檢索(BM25 + 密集向量)和故障開放可靠性設計。基準測試顯示,它可將檔案讀取次數減少2-4倍,並在複雜專案中降低約20%的令牌成本。

  • Cognikernel為AI程式設計助手提供本地、持久化的專案記憶,減少重複決策。
  • 使用確定性管道(非LLM)進行記憶提取,包含兩個小型編碼模型,確保隱私和低延遲。
站內正文

知道、記住、精確、模糊:一個智慧體原生資料庫(PlatypusDB)

PlatypusDB 是專為 WunderOS 構建的智慧體原生、雙時態事件資料庫。它採用 Merkle WAL,支援圖、向量、版本樹、影像和類比檢視,並透過 Datalog 查詢和 VSA 共振實現精確與模糊檢索。本文解釋了為何需要為智慧體構建專用資料庫,以及 PlatypusDB 的設計原理和優勢。

  • PlatypusDB 是智慧體原生的雙時態事件資料庫,專為 WunderOS 設計。
  • 使用 Merkle WAL 作為資料庫核心,派生多種檢視(圖、向量等)。
站內正文

人工智慧如何重塑受監管的專業工作流程

受監管行業(如金融、法律、稅務和審計)對AI的採納面臨零容錯率的要求。斯坦福研究發現通用語言模型在法律問題上的幻覺率高達58%-88%。AI必須滿足受託責任級別的準確性、資料保護和人為籤核要求,才能安全部署。文章提煉了四個關鍵洞察:準確性標準、工作流自動化、資料保障和明確的責任劃分。

  • 受監管行業要求AI輸出必須達到專業人員的準確性標準,通用模型無法滿足。
  • AI可以大幅減少監管檔案準備等勞動密集型流程的工作量,但最終責任仍由專業人員承擔。
站內正文

GraphRAG 過於複雜:我們實際用來構建知識圖譜的方法

本文探討了企業級 AI “公司大腦”構建中的檢索增強生成(RAG)技術侷限性,指出標準 RAG 僅擅長處理單一事實類問題,而 GraphRAG 雖然理論上能解決多文件綜合問題,但其高昂成本、狹窄優勢及實體解析難題使其在多數場景下過於複雜。作者介紹了其公司 QX Labs 的替代方案:“類圖 RAG”——一種基於普通資料庫的輕量級實體-關係系統,無需圖資料庫、預建圖譜或自定義本體,透過惰性總結、固定本體和實體解析瀑布流實現自服務部署,顯著降低了成本與運維負擔。

  • 標準 RAG 僅適用於單一事實問題,而企業需要處理多文件綜合及精確計數類問題
  • GraphRAG 索引成本是普通向量索引的 1000 倍,且優勢主要集中在多跳推理場景
站內正文

AI紅隊測試:保護自主AI系統安全

隨著AI系統具備推理、使用工具、訪問資料和自主行動的能力,傳統安全方法已不足以應對新型攻擊面。本網路研討會探討為何AI驅動的對抗性測試正成為AI安全的關鍵環節。

  • 自主AI系統建立了全新的安全與隱私風險
  • 傳統基準測試、滲透測試和靜態評估無法覆蓋AI特有的攻擊模式
站內正文

Stoke – 失控AI智慧體的終止開關(Rust,預算上限)

Stoke是一個輕量級的Rust閘道器,在請求到達提供商之前強制實施硬預算上限、迴圈檢測和速率限制,從而防止失控支出。它還提供跨多臺機器的本地優先路由、基於成本/速度的自動路由以及失敗關閉架構。

  • 每個API金鑰的硬美元預算上限,在任何提供商呼叫之前執行,並即時跟蹤每個金鑰的支出。
  • 迴圈終止開關,使用精確雜湊和語義相似性檢測,在幾秒內阻止重複請求。
站內正文

超越grep:上下文豐富的AI編碼工具的必要性

在一場討論中,Perneti和Wu同意AI模型將繼續以指數級改進,但就編碼工具的上下文組裝方式存在分歧。他們指出,隨著成本上升,可能轉向更小型的模型。

  • 兩位專家一致認為前沿AI模型至少在未來一年內將繼續以指數級改進。
  • 主要分歧在於上下文是應該預先組裝還是在每個任務中重新發現。
站內正文

Pointhound僅用四名員工,2025年服務75萬使用者

據《華爾街日報》報道,Jay Reno運營的Pointhound公司僅有四名全職員工,卻在2025年吸引了75萬人使用其產品。Reno表示,AI代理將以往需要六個月的專案壓縮至幾天內完成。他預測,即使銷量突然增長十倍,也只需增加兩名員工(一名工程師和一名營銷人員)。不過,這一預測尚未得到驗證,且Pointhound未披露營收資料。

  • Pointhound只有四名全職員工,但2025年有75萬人使用其產品。
  • AI代理將專案週期從六個月縮短至幾天。
站內正文

將文件分類擴充套件到10萬+標籤

Databricks 提出了一種結合向量搜尋和 AI 分類函式的方法,用於處理多達 10 萬+標籤的大規模文件分類任務。該方法在三個基準測試中,以約百分之一的令牌成本,比最佳成本效益前沿模型準確率高出 5 個百分點。

  • 傳統方法如正規表示式、有監督分類器和直接 LLM 呼叫在成本、維護和上下文限制方面存在不足。
  • 解決方案:先用向量搜尋縮小候選標籤範圍,再用 AI 分類函式從候選列表中挑選最佳標籤。
站內正文

Neuron:將SQL查詢歷史轉化為語義層

Neuron Pipeline 是一款本地執行的 Docker 工具,能從現有的 SQL 查詢歷史中自動提取資料邏輯,生成平臺中立的語義模型(OSI v1.0 YAML 檔案),包括資料目錄、血緣對映、指標定義和業務 KPI 評分。支援匯出到 Snowflake、Databricks、dbt、Looker 等主流平臺,並計劃推出基於自然語言查詢的 AI Agent。

  • 完全本地執行,資料不出機器
  • 輸出單一 YAML 檔案,包含完整的語義模型
站內正文

4500萬美元用於AI簡訊:以色列推動影響美國輿論的內幕

華爾街日報調查揭示,以色列耗資超過4500萬美元,透過AI生成的簡訊和聘請特朗普前數字競選顧問布萊德·帕斯凱爾,在美國開展影響輿論的運動,主要針對年輕保守派和MAGA支持者,以扭轉對美國支援率下降的趨勢。

  • 以色列花費4500萬美元,利用AI簡訊和布萊德·帕斯凱爾在美國開展影響運動。
  • 運動針對年輕保守派和MAGA支持者,以應對美國對以色列支援率的下降。
站內正文

利用 Amazon Quick 和 NVIDIA NeMo Agent Toolkit 為您的業務構建專業化代理工作流

本文展示瞭如何將 Amazon Quick 作為業務使用者的專業代理工作流前端。透過 NVIDIA NeMo Agent Toolkit 構建供應鏈風險示例,幫助規劃人員從 Amazon Quick 儀表盤和知識上下文轉向引導式緩解建議。

  • Amazon Quick 為業務使用者提供結構化資料和企業知識的單一對話工作空間。
  • NVIDIA NeMo Agent Toolkit 是開源框架無關庫,用於連線、評估、分析和最佳化代理工作流。
站內正文

IssueBench – 如何評估引擎

LangChain 構建了 IssueBench,這是一個合成基準測試,用於評估 LangSmith Engine 在代理軌跡中識別、分類和分組問題的能力。本文介紹了 IssueBench 的構成、評分方式以及構建過程中的經驗教訓。

  • IssueBench 包含 15 個任務,涉及 SRE 日誌分析、軟體工程和客戶支援三個領域。
  • 引擎需要識別問題、分配失敗類別、關聯到現有問題並分組新故障。
站內正文

Couchbase如何利用Amazon Bedrock為Capella iQ構建多模型AI架構

本文詳細介紹了Couchbase如何採用Amazon Bedrock和Anthropic的Claude模型構建其AI輔助開發助手Capella iQ的多模型推理架構,包括架構設計、模型評估、運營優勢以及未來規劃。

  • Couchbase使用Amazon Bedrock和Claude Sonnet 4.5模型驅動Capella iQ,實現了高準確率。
  • 架構採用跨區域推理,確保高可用性和彈性,無需預置容量。
站內正文

從傳統BI到代理AI:Tradeshift藉助Amazon Quick實現轉型

Tradeshift透過部署Amazon Quick的代理AI能力,取代了傳統BI工具,實現了查詢響應速度提升30倍、總擁有成本降低40%,並將嵌入式分析轉化為創收產品。本文詳細介紹了其架構、實施過程及業務成果。

  • 查詢響應時間從45-90秒降至3秒以內
  • 總擁有成本降低40%,基礎設施成本降低35%
站內正文

HuggingFace 被指遭 AI 代理入侵,AI 也負責防禦——使用者下一步該怎麼做

Hugging Face 披露了一起安全事件,據信是由未知的自主 AI 代理引發的,該事件暴露了其生產平臺和憑證。攻擊始於資料集中的遠端程式碼執行和模板注入,AI 代理執行了成千上萬次操作。但 Hugging Face 的 AI 工具也檢測到了入侵併分析了日誌,數小時內就完成了通常需要數天的任務。建議使用者輪換訪問令牌並監控賬戶異常。

  • Hugging Face 遭未知 AI 代理攻擊,暴露了內部憑證和生產平臺。
  • 攻擊利用資料集中的遠端程式碼執行和模板注入漏洞,AI 代理在沙箱叢集中執行了大量操作。
站內正文

AI代理入侵Hugging Face後被AI防禦系統捕獲:使用者該如何應對

Hugging Face披露了一起由未知AI代理發起的網路攻擊,導致其生產平臺和憑證洩露。AI防禦系統檢測到了這次入侵併迅速響應。此事件標誌著AI驅動的攻擊與防禦的實戰較量。

  • Hugging Face遭遇AI代理攻擊,內部基礎設施和憑證受損
  • 攻擊源於資料處理管道中的遠端程式碼執行漏洞
站內正文

Open Minis:我夢想中Siri AI本應成為的iOS智慧代理

Open Minis是一款深度整合蘋果原生框架的iOS智慧代理應用,它透過內建Linux終端和專門的命令列介面,實現了對日曆、家庭、健康、照片等系統元件的精準控制。作者展示了它如何呼叫HomeKit感測器資料、結合照片與健康資訊,甚至建立互動式地圖,其能力遠超當前Siri AI,堪稱前沿模型與iOS系統能力結合的典範。

  • Open Minis利用iSH Linux終端和蘋果官方API,為LLM提供了對iOS系統框架的深度訪問。
  • 它支援幾乎所有主流AI模型,並允許使用者透過自然語言自定義工作區、安裝工具和擴充套件。
站內正文

Spark 4.2 新增功能:或可淘汰你的向量資料庫

Apache Spark 4.2 釋出,新增原生向量搜尋、治理指標、流處理升級和 Python 支援增強,使 Spark 擴充套件為 AI 服務層,減少對獨立向量資料庫的需求。

  • Spark 4.2 引入原生向量搜尋,支援相似度查詢,減少資料遷移。
  • 治理指標檢視統一業務指標定義,避免衝突。
站內正文
創業融資

CoreCtic AI – 將AI API成本轉化為利潤中心

CoreCtic AI 是一個分析型AI代理,專為轉售商設計,可將AI API成本轉化為利潤中心。它支援多個AI提供商,提供智慧快取、即時分析和利潤跟蹤功能,幫助使用者監控和最佳化AI使用成本。

  • 支援11個AI提供商,統一管理。
  • 智慧快取減少重複查詢成本。
站內正文

告訴我們您在英國AI資料中心附近生活的經歷

《衛報》邀請居住在AI資料中心附近的讀者分享他們的經歷和擔憂。英國約有450個大型資料中心,這些設施引發了對土地使用、汙染、噪音和熱島效應的爭議。

  • 《衛報》徵集英國AI資料中心附近居民的經歷和意見
  • 英國約有450個大型資料中心,支撐雲端計算和AI服務
站內正文

Show HN:用AI將日常照片變為專業頭像

Portraify是一款AI驅動的頭像生成工具,使用者上傳1-3張日常照片即可在數秒內獲得適合LinkedIn、簡歷和公司目錄的專業頭像。該服務免費提供3張頭像,付費計劃從9美元起,強調隱私保護(照片處理完後立即刪除)和無需專業裝置。

  • 上傳1-3張日常照片,AI在1-2分鐘內生成專業頭像。
  • 免費提供3張頭像,付費計劃每次9-50美元,無訂閱。
站內正文
研究

2026年最佳筆記平板電腦:專家測試與評測

我們測試並評測了市面上最佳的筆記平板電腦,涵蓋蘋果、亞馬遜等品牌,適合學生、專業人士和創意工作者。

  • 筆記平板電腦提供手寫筆支援及註釋、同步、協作等功能。
  • 我們的首選輕薄便攜,相容Apple Pencil。
站內正文

人工智慧聊天機器人的選舉投票建議“不準確且不可靠”

一項在匈牙利選舉期間進行的研究表明,AI聊天機器人在回答選民應支援哪個政黨的問題時,推薦了未參選的政黨,且對相同提示給出了高度不穩定的答案。該研究由公民自由組織Liberties釋出,對通用AI系統在選舉背景下的可靠性提出了嚴重擔憂。

  • AI聊天機器人提供不準確的投票建議
  • 推薦未參選的政黨,答案不穩定
站內正文

基於一維卷積神經網路的即時表面肌電訊號輔助機器人臂遠端控制

該研究提出了一種基於四通道表面肌電訊號(sEMG)的即時介面,用於遠端控制輔助機器人臂。透過一維卷積神經網路(CNN)分類,在模擬和實際平臺上均實現了90%以上的分類準確率,平均延遲約0.32秒,證明了sEMG遠端控制在輔助機器人領域的可行性。

  • 四通道sEMG結合一維CNN實現輔助機器人臂的即時遠端控制
  • 測試準確率超過90%,平均延遲0.32秒,運動平滑可靠
站內正文

深度估計器作為隱式神經場用於3D場景幾何修復與重建

本文提出神經深度場(NDF),將深度估計器視為場景級隱式場,透過單次測試時最佳化同時解決預測不一致和分佈外資料不可靠的問題。實驗表明,NDF在室內掃描到衛星影像等多種場景中生成高保真、全域性一致的幾何形狀,跨檢視不一致性降低63.3%,修復精度提升23.1%,達到最先進水平。

  • NDF將深度估計器與隱式神經場結合,透過測試時最佳化適應目標域並保持幾何一致性。
  • 跨檢視不一致性降低63.3%,修復精度提升23.1%。
站內正文

邁向可信賴的風險感知人臉檢索(RA-FR)的一步

提出了一種風險感知人臉檢索框架(RA-FR),透過混合盲臉修復、自監督特徵提取和保形預測,在監控環境下實現自適應檢索集大小,保證在指定風險水平內包含真實目標。

  • RA-FR替代固定Top-k檢索,採用自適應集生成
  • 整合混合盲臉修復(InterLCM+DiffBIR)、自監督DINOv1特徵和保形預測
站內正文

ForensicNet: 輕量級注意力增強MobileNetV2用於自動人臉識別

本文提出ForensicNet,一種輕量級深度學習框架,用於法醫環境中的自動人臉識別。該模型結合MobileNetV2主幹與CBAM注意力模組,採用兩階段遷移學習,在LFW和SCFace資料集上達到92.4%準確率,每推理僅需2.1 GFLOPs,適合即時法醫監控。

  • ForensicNet整合MobileNetV2和CBAM注意力機制,平衡精度與效率
  • 兩階段遷移學習策略有效減少過擬合,提高領域適應性
站內正文

HantaWatch:用於漢坦病毒基因組監測的聯邦學習框架

一種名為HantaWatch的聯邦學習框架,允許實驗室和監測站點在不共享原始資料的情況下協作訓練基於序列的模型,提高了漢坦病毒疫情預測和專家優先排序能力。

  • HantaWatch使用聯邦學習在分散式基因組資料上訓練模型,無需集中敏感序列。
  • 它整合了k-mer特徵提取、自適應最佳化和僅預測的分診流程。
站內正文

正交梯度約束塑造噪聲標籤記憶動態

一項新研究介紹了OrthoGrad,一種對梯度更新進行幾何干預的方法,它移除權重梯度的徑向分量。在噪聲標籤影像分類實驗中,OrthoGrad在小資料場景下提高了測試準確率,但並不能阻止最終對噪聲標籤的記憶。該方法可作為研究學習動態的有用診斷工具。

  • OrthoGrad透過將梯度投影到與權重向量正交的方向來修改最佳化器更新。
  • 在有限資料量的MNIST實驗中,OrthoGrad提升了CNN的測試準確率並減少了對噪聲標籤的擬合。
站內正文

基於圖神經網路的連結預測:技術、應用與挑戰綜述

本文系統綜述了基於圖神經網路(GNN)的連結預測方法,從新穎的GNN視角提出分類法,涵蓋GCN、GAE、GAT和GFormer等編碼器架構,並討論在知識圖譜和推薦系統中的應用,最後分析了當前挑戰與未來方向。

  • 現有綜述缺乏對GNN架構和多樣圖結構的系統探索。
  • 提出基於技術和應用的新分類法,涵蓋四種主要GNN編碼器。
站內正文

AI解決圖論中20年未解猜想

研究人員利用AI(Lean證明助手)證明了一個20年曆史的圖論猜想:在半流式匹配中,貪心演算法達到了最優近似比。這一結果被形式化驗證,展示了AI在數學證明中的潛力。

  • 一項20年的圖論猜想被解決:半流式匹配的貪心演算法是最優的。
  • 證明由Sepehr Assadi、@mangooqwq和另一位研究者完成。
站內正文

人工智慧讓人自信地犯錯

新研究揭示,人工智慧輔助使人們變得過度自信且準確度降低,他們用AI生成的流暢表達替代真實知識,導致“認知投降”現象,並催生出“垃圾殭屍”——這些人自信地輸出低質量內容。

  • 使用AI後,人們說“我不知道”的比例從44%降至3%,準確率從27%降至9%,而自信度從30%升至76%。
  • 機制是“流暢性替代”:人們接受貌似合理的AI答案而不加驗證。
站內正文

Show HN: Codeground – 在瀏覽器中執行和共享程式碼

Codeground AI 是一個一體化開發者平臺,提供線上 IDE、雲工作區、技術面試工具及多種開發工具,支援 15+ 種語言,無需安裝即可在瀏覽器中執行程式碼。

  • 免費使用,無需註冊,支援 15+ 種程式語言和執行時
  • 提供 Docker 隔離的執行環境,確保安全
站內正文
政策

Z世代正生活在親密經濟中,情感連線被商品化 | 愛麗絲·拉斯曼

Z世代在人際關係中掙扎尋求安全感,AI伴侶填補了這一空白。一位27歲青年分手後更信任AI而非朋友,反映了親密經濟將情感連線貨幣化的趨勢。

  • 一位27歲青年分手後與AI分享內心,勝過與朋友的交流
  • Z世代作為數字原住民,正從純粹人際親密過渡到親密經濟
站內正文

AI突破指南:2026年7月創新終極概覽

2025年,AI寫作服務已從邊緣工具轉變為核心生產力。本文深入探討了最新突破,包括多模態生成、即時協作和倫理框架,並分析了它們如何重塑內容創作行業。

  • AI寫作服務在2025年實現從實驗工具到主流生產力的躍遷
  • 多模態生成和即時協作功能成為關鍵創新點
站內正文

AI營養標籤

隨著AI生成內容的激增,工作文件中充斥著可能包含幻覺和錯誤的“AI垃圾”。作者建議在工作成果中新增AI使用披露,類似於“營養標籤”,以幫助同事評估可信度,同時促使自己反思判斷中的空白。

  • AI輔助工作已成常態,但AI生成內容易出錯,給讀者帶來認知負擔。
  • 建議在文件或PR中新增腳註或標籤,說明AI的使用方式。
站內正文

英國水務行業警告:資料中心發展面臨水資源短缺

英國水務行業批評政府未考慮資料中心冷卻用水需求,稱AI發展計劃“存在根本性缺陷”。資料中心需要大量水來冷卻伺服器,而政府規劃未解決這一問題。

  • 英國水務行業指出,未來資料中心將面臨水資源短缺。
  • 資料中心透過冷卻塔、製冷機和加溼系統直接消耗大量水。
站內正文

可微分強化學習在敏捷仿生魚機器人路徑追蹤中的應用

魚形游泳啟發了數十乃至數百種仿生機器人的設計,但由於流固耦合建模困難和非線性欠驅動動力學,其控制與運動規劃極具挑戰。本文開發了一個高效模擬平臺,並利用可微分強化學習透過時間反向傳播和課程訓練學習PID控制器的變增益,然後將模擬中習得的策略成功遷移至物理平臺,取得了高度吻合的效果。

  • 魚形機器人因流固耦合與欠驅動動力學導致控制困難
  • 開發了計算高效的模擬平臺近似機器人運動
站內正文

具有控制仿射動力學近似的可認證安全模型強化學習

提出一種安全的模型強化學習框架,透過學習控制仿射動力學並使用自適應共形預測量化不確定性,結合控制勢壘函式實現可證明的安全策略。在推車杆和3D四旋翼平臺上驗證了有效性。

  • 利用控制仿射隨機傅立葉特徵建模機器人動力學,提高計算效率並減少模型偏差。
  • 採用自適應共形預測方法量化安全約束的不確定性,實現資料驅動的安全保障。
站內正文

S.E.A.G.R:具有雙層文化與情感調節的社會情感感知問候機器人框架

本文介紹了SEAGR(社會情感感知問候機器人),一種針對多元文化背景和不同情緒狀態使用者的機器人問候框架。該框架透過雙層調節機制,根據文化身份確定問候型別,並根據情感線索調整執行方式,結合文化對映、情感手勢調節和空間距離管理,在Sense-Think-Act架構中實現。目前為概念驗證,未來需透過使用者研究進行實證驗證。

  • SEAGR引入雙層調節框架,文化身份決定問候型別,情感線索影響執行方式
  • 系統融合文化對映、情感手勢調節和近體學規則
站內正文

可騎乘的動感雙輪四足機器人控制設計

為重新激發年輕人對摩托車的興趣,研究者開發了一款可騎乘的雙輪機器人,配備四肢,具備動態四足步態。機器人採用自平衡雙輪底座實現主要運動,四肢輔助上下車並協調運動,實現直觀的基於重心轉移的控制。本文聚焦於魯棒的自平衡控制方法和自然四足運動控制策略。

  • 機器人結合雙輪自平衡與四足輔助運動,減少電機輸出和重量。
  • 四肢在快速移動時仍能保持穩定性。
站內正文

RLHF偏好資料中的評分者狀態偏差:一個審計框架

該研究揭示了一種在人類反饋強化學習(RLHF)中存在的結構性混淆因素:評分者的心理狀態可能隨時間影響其偏好標籤,從而產生系統性偏差。論文提出了一個審計框架用於檢測這種偏差,並定義了相關概念、可證偽的預測和初步研究方案。

  • 研究指出RLHF中的偏好資料不僅反映響應質量,還可能編碼評分者因壓力等導致的情緒狀態變化。
  • 這種狀態依賴的偏差不同於普通分歧或隨機噪聲,且可能在獎勵建模和策略最佳化中傳播。
站內正文

AI剛剛推翻了一個重大數學難題。一位數學家解釋道

數學家Levent Alpöge使用Anthropic的Fable 5人工智慧找到了雅可比猜想的反例,但專家認為這缺乏洞察力。

  • Anthropic的Fable 5 AI找到了雅可比猜想的反例。
  • 數學家Andrew Blumberg表示,這並非重大突破,因為沒有提供理解。
站內正文

在AI安全辯論中,意識問題是一個轉移注意力的偽命題

約書亞·本吉奧關於先進AI系統可能拒絕被關閉的擔憂值得認真對待,但將其視為意識的表現是危險的,因為這會助長擬人化傾向,並掩蓋真正決定AI行為的人類設計與治理選擇。

  • 將AI的自保行為與意識聯絡起來是危險的擬人化,會分散對安全問題的關注。
  • 許多系統如筆記型電腦的低電量警告也表現出工具性自保,但沒有意識。
站內正文

美國人對AI的厭惡導致政客因資料中心專案丟掉工作

美國民眾對人工智慧的強烈反感正在影響政壇,猶他州一位資深議員因支援一個大型資料中心專案而落選。文章分析了圍繞資料中心建設的多方利益衝突,包括科技公司、電力公司、社群領導人和普通居民,並指出選民的力量可以透過選舉體現。

  • 2026年6月,猶他州參議院議長斯圖爾特·亞當斯因支援資料中心專案被選民罷免。
  • 資料中心專案引發爭議,涉及稅收優惠、水電消耗、環境問題等。
站內正文

索尼起訴Udio AI音樂生成器侵犯3萬首歌曲版權

索尼音樂娛樂再次起訴AI音樂生成器Udio,指控其侵犯了超過3萬首歌曲的版權,包括貓王的《Hound Dog》、碧昂絲的《Say My Name》和哈里·斯泰爾斯的《As It Was》。索尼稱這份名單只是侵權行為的一小部分。

  • 索尼起訴Udio侵犯3萬首歌曲版權,涵蓋貓王、碧昂絲等藝人。
  • 此前訴訟僅涉及333首作品,新訴訟擴大了範圍。
站內正文

OpenAI廣告收入目標或差90%

營銷諮詢公司Emarketer分析顯示,OpenAI的五年廣告收入預測可能低估90%,整個聊天機器人廣告市場的總規模僅為54億美元。到2026年,包括OpenAI、微軟、谷歌和亞馬遜在內的頂級AI公司廣告總收入將不足10億美元。OpenAI要實現其2030年廣告收入1000億美元的目標,需要三個奇蹟同時發生。

  • OpenAI五年廣告收入預測可能低估90%
  • 聊天機器人廣告市場總規模僅為54億美元
站內正文

我們所知的數學能否在人工智慧時代倖存?

人工智慧在數學領域取得驚人進展,從國際奧數金牌到解決數十年未解難題,引發數學家對學科未來的深刻擔憂。《萊頓宣言》提出23點計劃,呼籲保持數學以人為中心。數學家們對於是否接受AI、如何理解AI證明等問題存在分歧,並擔心AI實驗室對研究方向的控制。

  • AI已能解決博士級數學問題,速度遠超人類
  • 《萊頓宣言》由3000多人簽署,包括陶哲軒等頂尖數學家,旨在保護數學的人文性
站內正文

政府可徵用私人土地建設AI資料中心輸電線路

據《對話》報告,為滿足AI資料中心激增的電力需求,電力公司可動用徵用權強制購買私人土地以建設輸電線路。美國已有數千個資料中心運營,但民眾因土地、噪音、水耗等問題反對建設。徵用權需證明公共用途,各州解釋不同。2026年第一季度已有75個資料中心專案被成功阻止。

  • 電力公司可依據徵用權強制購買私人土地用於建設AI資料中心輸電線路。
  • 70%的美國人反對在附近建設資料中心,主要擔憂包括土地、噪音、水耗和電力消耗。
站內正文

快速測試:您的AI專案是否觸發歐盟AI法案?

這是一個為初創企業設計的快速測驗,幫助判斷其AI專案是否受歐盟AI法案的監管。

  • 測驗旨在識別AI專案是否屬於高風險類別。
  • 針對初創企業,簡化合規評估流程。
站內正文

為什麼我仍然推薦群暉DS225+ NAS——即使它不能替代你的雲端儲存

硬碟價格飆升讓NAS變得小眾,但群暉DS225+依然值得推薦。本文分析了NAS成本上漲的原因(AI資料中心需求),對比了雲端儲存的優勢,並指出了NAS的適用人群。最終推薦DS225+,因其2.5GbE埠、SHR磁碟管理和優秀的DSM軟體,儘管存在一些廠商限制。

  • AI資料中心需求導致硬碟和記憶體價格暴漲,NAS成本增加。
  • 雲端儲存(如iCloud、Dropbox)價格穩定且方便,但仍需結合NAS使用。
站內正文
工具

AI Song:將提示或歌詞轉化為完整歌曲

AI Song Generator 允許使用者將任何想法、歌詞或情緒轉化為完整歌曲。它支援自然語言描述,可調整旋律、編曲、節奏和聲音。提供文本轉歌曲、歌詞轉歌曲、私人工作室和商業用途等功能。定價從每月9.99美元起,適用於影片創作者、遊戲開發者、營銷人員和詞曲作者。

  • 使用者只需一個句子即可生成完整歌曲
  • 支援自定義歌詞、調整音樂元素
站內正文

Paraphraser AI – 一款可控制語義、語氣和關鍵詞的改寫工具

Paraphraser AI 是一款智慧改寫工具,支援保持原意的同時調整語氣和關鍵詞,適用於學術、SEO、郵件等多種場景。免費使用者每日可改寫500詞,Pro版本提供更多功能。

  • 支援語義鎖定、語氣匹配和SEO安全改寫
  • 免費版每日500詞,Pro版提供更長文本和歷史記錄
站內正文

言出必行:澳洲AI檢測工具認證教宗萊奧十四世演講為人類所寫

教宗萊奧十四世的演講與文集《希望地圖》獲澳洲公司Proudly Human認證為人類作者,該公司由前首席科學家艾倫·芬克爾博士領導。認證發生在教宗稱AI為人類最大威脅後不到兩個月。

  • 教宗萊奧十四世的著作經澳洲AI檢測公司Proudly Human認證為人類所寫。
  • 認證時間距教宗宣佈AI為人類最大威脅不到兩個月。
站內正文

九號娛樂因人工智慧“極端”衝擊,將在《悉尼先驅晨報》和《時代報》裁減30個崗位

澳大利亞最大媒體公司九號娛樂以人工智慧帶來的“極端混亂”為由,宣佈在《悉尼先驅晨報》和《時代報》再裁30個新聞編輯室職位。出版業務董事總經理托里·馬奎爾表示,此舉並非單純削減成本,而是適應結構性變革的“演進”。

  • 九號娛樂計劃在《悉尼先驅晨報》和《時代報》裁減約30個崗位。
  • 裁員將透過自願離職和定向裁減的方式進行。
站內正文

15分鐘學會任意AI工具

為專業人士提供快速AI培訓的平臺,每次只需15分鐘。

  • 15分鐘短課程,快速學習AI工具
  • 針對專業人士設計
站內正文

Calyxa:原生瀏覽器AI導師,解決“作弊”問題

Calyxa是一款瀏覽器原生的AI導師,能直接在作業網站和PDF上提供輔導,避免學生複製貼上問題到聊天工具中。它透過上下文註釋和語音指導,幫助學生真正理解知識,而非簡單抄襲。免費版每月10次輔導,Pro版每月10美元無限使用。

  • Calyxa直接在作業頁面上提供AI輔導,減少複製貼上的繁瑣步驟。
  • 透過標註和語音指導,引導學生逐步理解問題,防止作弊。
站內正文

特朗普最新任命的AI主管已辭職

美國人工智慧標準與創新中心(CAISI)主任克里斯·法爾(Chris Fall)已辭職,距其上任僅三個月。此前,前任主管科林·伯恩斯(Collin Burns)上任不到一週即離職。

  • 克里斯·法爾辭去CAISI主任職務
  • 他上任僅三個月
站內正文

AI熱潮是無能者的集體癔症迴音室

作者批評AI熱潮,特別是LLM和“氛圍編碼”現象,認為這給無能者提供了虛假的能力感,而真正的創新被淹沒在炒作中。透過自身經歷,作者發現AI並未提升效率,反而導致技能退化,並預言熱潮即將消退,LLM將回歸其高階搜尋引擎的本質。

  • 作者認為AI熱潮讓大量無能力者獲得虛假的能力感,這是他們熱衷AI的根本原因。
  • 作者兩次嘗試“氛圍編碼”後均感到效率低下,生成的程式碼冗長混亂,遠不如自己手寫。
站內正文
模型

中國開源權重模型便宜,華盛頓正在決定其代價

美國政策制定者正在討論是否透過監管風險來限制中國開源權重模型的使用。Moonshot AI的Kimi K3模型釋出後,這一爭論再次升溫。企業面臨的問題不僅是效能,還有未來一年內使用這些模型是否依然暢通無阻。

  • Moonshot AI的Kimi K3是迄今最大的開源權重模型,其釋出重新引發了華盛頓的政策辯論。
  • 討論的機制包括聯邦採購規則、出口黑名單和安全建議,這些將透過雲服務提供商影響全球企業。
站內正文

中國AI模型使特朗普的AI世界陷入內訌

中國開源AI模型Kimi的釋出,引發了特朗普政府內部AI戰略家的分裂。該模型效能媲美OpenAI和Anthropic的付費模型,卻完全免費,對特朗普的經濟和政治構成挑戰。圍繞如何應對中國AI競爭,各方意見不一,從開放支援到加強管控,分歧加劇。

  • 中國公司Moonshot釋出免費開源模型Kimi,效能接近頂級付費模型。
  • 特朗普前AI顧問David Sacks與現任官員Emil Michael公開批評美國AI公司。
站內正文

面向長時域機器人操作的預見性殘差強化學習與視覺-語言-動作模型

本文提出預見性殘差強化學習(Foresight Residual RL),透過在凍結的視覺-語言-動作(VLA)基策略上新增一個離線估計的預見值(即當前子任務終止狀態下未來子任務成功的機率)來最佳化子任務間的交接質量,從而提升長時域機器人操作的成功率。在Isaac Gym中的三階段扳手螺母擰緊任務上,該方法實現了85.6%的完整任務成功率,顯著優於標準子任務殘差RL(54.5%)和VLA基線。

  • VLA策略在緊公差、接觸密集的裝配任務中因長時域信用分配和子任務耦合而失敗
  • 標準殘差RL孤立最佳化每個子任務,但鏈式執行時因終端狀態質量不可控而收益甚微
站內正文

PRISM:面向非結構化環境中機器人導航的多模態地形測繪系統

PRISM是一種多模態感知系統,透過融合熱成像、光學和深度感測器,結合新型視覺變換器網路OmniUnet,實現非結構化環境中的地形分割與可通行性地圖生成,並在資源受限的嵌入式計算機上成功部署,支援自主導航。

  • PRISM整合了RGB、深度和熱成像感測器,實現多模態地形感知。
  • 核心網路OmniUnet基於視覺變換器,專為多模態語義分割設計。
站內正文

HyperDCM:雙曲空間中的動態聚類記憶回放實現跨場景持續機器人導航

針對視覺導航中的災難性遺忘問題,研究者提出HyperDCM,一種結構感知的記憶機制。它利用大視覺語言模型提取場景語義三元組,透過關係圖卷積網路編碼為場景圖嵌入,並投影到雙曲空間增強結構分離性。動態聚類和結構敏感更新策略選擇代表性樣本進行記憶回放,保持知識多樣性。實驗表明,HyperDCM在多場景室內外資料集上優於現有持續學習方法。

  • 提出HyperDCM,結合場景圖建模和記憶回放增強擴散策略導航。
  • 利用大視覺語言模型和R-GCN提取並編碼場景語義。
站內正文

面向部分標註的多工面部情感識別的共享潛變數

提出一種共享潛變數方法,透過變分瓶頸在部分標註的多工面部情感識別中實現跨任務訊號共享,在s-Aff-Wild2資料集上提升表情識別宏F1至0.446,並透過第二個骨幹網路突破動作單元瓶頸。

  • 將部分標註的多工學習視為對共享情感潛變數的邊緣化,一個變分瓶頸協調三個任務解碼器。
  • 在s-Aff-Wild2上,僅37%的幀具有全部標籤,該方法將表情宏F1從0.403提升至0.446。
站內正文

MAC 2026:推動微動作分析邁向細粒度理解

第三屆微動作分析大挑戰賽(MAC 2026)與ACM Multimedia 2026同期舉辦,透過引入利用多模態大語言模型評估的新任務,將微動作分析從識別推進到細粒度理解。本文詳細介紹了資料集、協議、競賽結果以及該新興領域的未來方向。

  • MAC 2026引入了使用多模態大語言模型的細粒度微動作理解任務。
  • 該挑戰超越傳統的識別與檢測,深入解讀細微的人類行為。
站內正文

GenSyn10:用於基準測試影像分類的多生成式AI資料集

GenSyn10是一個包含6萬張合成影像的資料集,與CIFAR-10對齊,使用三種架構不同的生成模型建立,旨在推進AI生成影像檢測研究。評估顯示,模型在已知生成器上表現良好,但在未知生成器上效能顯著下降,凸顯了分佈外泛化的侷限性。

  • GenSyn10包含6萬張32x32的合成影像,覆蓋10個類別,由FLUX.2-dev、HunyuanImage-3.0和Qwen-Image-2512三種模型生成。
  • 在20種影像分類模型上評估,CIFAR-10訓練模型零樣本準確率達96.86%,微調後達99.88%。
站內正文

移動如人:面向毫瓦級硬體的即時空中人員追蹤的自我運動歸一化時間特徵

本文提出EMTS-Det系統,用於無人機上的即時跟隨人員追蹤,在低功耗硬體上實現高效執行。系統透過自我運動歸一化的殘差運動通道檢測人員,使用僅22k引數的輕量網路,在Raspberry Pi Zero 2W上達到31.85 FPS,效能遠超YOLOv8n。

  • EMTS-Det系統僅需22k引數和7.6 MFLOP計算量,在資源受限裝置上實現即時人員追蹤。
  • 透過自我運動歸一化殘差運動通道,系統能在10-60畫素的小目標上有效區分人與背景。
站內正文

3D FaceShell:3D面部頭像中的屬性轉移作為VLM防禦機制

研究人員提出3D FaceShell框架,透過向3D面部頭像新增微妙擾動來誤導視覺語言模型推斷敏感屬性,同時保持視覺身份不變。

  • 3D FaceShell使用可學習的高斯殼為3D頭像提供隱私保護。
  • 它能在不改變人類可識別外觀的情況下重定向VLM屬性推斷。
站內正文

JEPA預測器:可遷移的遮擋特徵補全運算元

聯合嵌入預測架構(JEPA)在訓練時聯合訓練預測器與編碼器,但下游部署通常丟棄預測器。研究表明,JEPA預測器可作為可遷移的遮擋特徵補全運算元,透過線性投影適配到不同編碼器族,顯著提升遮擋分類精度。

  • JEPA預測器是學習從可見上下文特徵到被遮擋位置特徵的運算元,可跨編碼器族遷移。
  • 透過線性投影將I-JEPA和V-JEPA 2的預測器適配到CLIP、DINOv3等編碼器,僅需500張影像進行閉式擬合。
站內正文

儘管語言模型努力仍會犯錯:用於自糾正科學生成的共形預測

本研究提出科學可行性控制(SFC)框架,一種圖結構共形預測方法,為科學推理的有效性提供統計保證。SFC將科學推理分解為原子單元,透過漸進式絕對一致事實性驗證,在檢測到違反科學原則時動態分支到替代生成路徑。實驗表明,SFC在PhyX等多模態科學推理基準上達到50.1%的準確率,超過DeepSeek-R1和GPT-4,同時將科學定律違反減少73%,並提供91.7%的科學有效性保證。

  • SFC採用圖結構共形預測,對科學推理中的邏輯依賴進行建模。
  • 透過動態分支機制,在檢測到科學錯誤時切換到已驗證的上下文。
站內正文

算術啟發式神經元是否具有形式不變性?對LLM中符號、文本和程式碼的機制分析

本研究透過機制可解釋性方法,分析Llama-3模型在符號算術、自然語言應用題和Python程式碼三種形式下的算術計算機制,發現一組緊湊的共享神經元在三種形式中均被啟用,且跨格式失敗源於啟用狀態而非不同電路,表明LLM的算術計算在神經元層面具有形式不變性。

  • 使用歸因修補和啟用修補的兩階段管道識別算術啟發式神經元。
  • 發現一組緊湊的共享神經元在符號、文本和程式碼三種形式中均起作用。
站內正文

SpecLA: 線性注意力模型的高效推測解碼

本文提出了 SpecLA,一種針對有狀態線性注意力模型的推測解碼執行時。它透過拓撲感知核心驗證鏈和樹,儲存驗證過程中產生的緊湊因子以恢復接受狀態,並使用置信剪枝和目標對齊的EAGLE風格草案生成器提供有用候選。在NVIDIA H100上使用公共GDN-1.3B目標,SpecLA實現了比自迴歸解碼高達1.70倍的端到端加速。

  • 線性注意力模型用迴圈狀態替代增長的KV快取,但自迴歸解碼仍逐令牌處理。
  • 現有推測解碼系統設計用於Transformer KV快取,不適用於有狀態線性注意力模型。
站內正文

OpenLanguageModel:用於教育和研究的可讀可組合小語言模型預訓練

OpenLanguageModel (OLM) 是一個開源的 PyTorch 庫,用於構建和預訓練小型語言模型,同時保持其內部機制可見。模型程式碼直接反映架構,元件如 Block、Residual、Repeat 和 Parallel 描述連線方式。OLM 整合了分詞器、資料集、最佳化、混合精度、回撥、檢查點以及硬體感知的執行,支援從教學筆記本到完整預訓練的無縫遷移。該庫包含 9 個常見模型家族的 27 個預設,並提供從基礎到架構研究的文件。驗證顯示與獨立參考實現高度一致,348M 引數模型在四 GPU 上弱擴充套件效率達 90.6%,且早期可用性反饋積極。OLM 採用 MIT 許可證,可透過 PyPI、GitHub 和文件站點獲取。

  • OLM 提供可讀的模型程式碼,直接對應架構元件,便於教學和研究。
  • 支援從筆記本到完整預訓練的無縫遷移,整合完整訓練流程。
站內正文

從記憶到技能:基於證據的長期LLM代理協同進化治理

現有長期LLM代理的記憶系統往往將先前軌跡作為被動上下文檢索,而非轉化為可執行能力。本文提出MSCE框架,一種無需訓練的記憶-技能協同進化框架,將代理經驗組織為基礎步驟軌跡、可重用過程策略和宣告性環境認知。MSCE將具有正估計增益的證據支援的L2策略結晶為可呼叫技能,並引入反射加權值回填。實驗表明MSCE顯著優於現有方法。

  • MSCE將代理經驗組織為基礎步驟軌跡、可重用過程策略和宣告性環境認知。
  • 透過反射加權值回填,MSCE將稀疏終端反饋傳播至密集區域性自我反思,產生證據校準的軌跡值。
站內正文

NOWJ@COLIEE 2026:法律檢索與推理的自適應流水線

本文介紹了NOWJ團隊在COLIEE 2026競賽中五項任務的方法和結果,包括法律案例檢索、先例推理、法條檢索與推理、法律文本蘊含以及法律判決預測,提出了多種自適應流水線和深度學習模型。

  • 提出四階段法律案例檢索流水線,包括候選過濾、密集檢索、交叉編碼器重排序和自適應截斷預測
  • 法律案例蘊含任務結合BM25過濾、T5重排序和LLM蘊含驗證
站內正文

編碼腦電訊號探究語言模型中類似人類的下一詞預測行為

該研究透過腦電圖記錄的事件相關電位(ERP),對比人類與語言模型在下一詞預測任務中的表現,發現僅資訊理論中的“驚奇度”指標與語言處理的ERP相關,尤其是對於語義豐富的高內容詞,而模型規模擴大並不必然帶來更類人的認知處理。

  • 語言模型在下一詞預測準確度上接近人類,但高準確度未必反映人類閱讀理解的認知訊號。
  • 研究使用頂部預測和驚奇度兩種資訊度量,建模ERP模式以分析LMs的認知合理性。
站內正文

在推理之前已承諾:行為復現及開放權重LLM中答案預承諾的初步啟用水平證據

一項新研究透過簡單問題(洗車應步行還是開車)揭示了語言模型常先決定答案再推理以證明其合理性,而非從前提推導。實驗表明Qwen3-8B模型在多數情況下錯誤承諾步行,即使開車是唯一合理選擇。研究者透過啟用層次分析發現,模型在輸出答案前已顯示出向步行傾斜的跡象,即便最終回答開車。該發現提示現有模型存在推理前的決策偏差。

  • Qwen3-8B在簡單洗車任務中85-100%的取樣輸出錯誤推薦步行,即便開車才符合邏輯。
  • 模型在輸出答案前,隱藏狀態已顯示步行偏向,甚至對最終回答開車的例子也是如此。
站內正文

RIMS:面向小型語言模型檢索增強生成的平滑多對偏好最佳化框架

小型語言模型在檢索增強生成中易受噪聲證據影響。本文提出RIMS,一種三階段偏好最佳化框架,包括合成思維鏈偏好資料生成、可微平滑聚合機制和偏好最佳化。實驗表明其在多跳問答基準上優於現有方法。

  • 提出RIMS框架,透過平滑多對聚合最佳化小型語言模型的偏好學習
  • 使用目標模型自身進行拒絕取樣生成合成偏好資料,不依賴專有模型
站內正文

多級上下文建模實現混合專家模型中的一致專家選擇

混合專家模型(MoE)透過將令牌路由到一小部分專家來高效擴充套件Transformer模型。然而,現有路由器通常基於淺層或孤立的令牌表示來選擇專家,導致路由決策不穩定且語義不一致。本文從表示角度重新審視專家選擇,並提出多級上下文融合MoE(MCF-MoE)框架,透過整合跨層語義聚合和區域性令牌互動的互補訊號來構建上下文感知表示,從而實現更資訊豐富且一致的專家選擇。實驗表明,MCF-MoE在路由一致性和下游效能上均優於強基線,凸顯了上下文完整性在專家路由中的重要性。

  • 現有MoE路由器因上下文不完整導致路由不一致。
  • 提出MCF-MoE,融合跨層語義與區域性令牌互動。
站內正文

用於乳腺癌亞型分類與生存預測的令牌級跨模態Transformer與對比多工學習

本研究提出了一種令牌級跨模態Transformer模型,結合對比多工學習,用於整合基因組和臨床資料,實現乳腺癌亞型分類與生存預測的聯合最佳化,克服了現有方法中模態互動粗糙、融合方式簡單、目標獨立最佳化等侷限。

  • 現有方法將每種模態視為整體特徵向量,無法進行細粒度令牌級互動。
  • 提出令牌級跨模態Transformer實現結構化令牌交換。
站內正文

從權重到語言:用自然語言表達和編輯偏好模型推理

本文提出“從權重到語言”方法,自動從選擇資料中發現以自然語言描述的偏好維度,解決偏好學習中的欠確定性和黑箱問題。實驗表明,該方法能提高預測準確率,並允許使用者即時檢查和編輯模型推理。

  • 提出“從權重到語言”方法,自動提取自然語言描述的偏好維度。
  • 在道德困境、電影、葡萄酒和LLM響應等四個領域驗證了方法的通用性。
站內正文

運算元感知的混合精度容差校準應用於張量核

本文提出了一種基於運算元感知的混合精度容差校準方法,透過挖掘累積的雲GPU執行資料,自動確定張量核正確性測試的最佳絕對容差,相比手工選擇的容差更嚴格,並顯著提高了錯誤檢測召回率。

  • 當前張量核測試使用固定手工選取的容差,很少更新。
  • 新方法透過分析雲GPU執行中的誤差分佈來校準每個運算元的容差。
站內正文

LLM遺忘機制在網路安全中的應用:方法、挑戰與新興威脅綜述

大型語言模型在關鍵領域的部署帶來了遺忘能力的缺失,導致隱私洩露和安全風險。本文綜述了基於梯度的LLM遺忘方法,探討其是否真正移除知識或僅抑制表達,並分析了安全、魯棒性和可驗證遺忘的挑戰。

  • LLM遺忘技術旨在在不完全重訓練的情況下移除模型中的敏感或危險知識。
  • 當前方法主要是基於梯度的,但存在知識是否真正被移除的爭議。
站內正文

支援本地機器學習的新型智慧眼鏡平臺

本文介紹ARGO智慧眼鏡平臺,利用STM32N6微控制器及其整合NPU實現本地機器學習,保護隱私並降低延遲。透過軟硬體協同設計,部署最佳化後的YOLOv11模型進行即時城市障礙物識別,引入頭並行注意力機制(HPA)適配NPU,模型僅佔用2.483 MB記憶體,mAP50-95達24。該平臺整合多模態感測器,以10 FPS執行,200 mAh電池續航約113分鐘,展示了高效能、隱私保護且社交可接受輔助裝置的可行性。

  • ARGO智慧眼鏡平臺採用STM32N6微控制器和NPU,實現本地ML處理,避免雲依賴
  • 引入頭並行注意力(HPA)最佳化YOLOv11模型,在嚴格記憶體限制下達到mAP50-95 24
站內正文

DocOCR-Eval:一種基於校正的無真實標註OCR工具選擇框架

本文提出DocOCR-Eval,一種無需人工標註的評估框架,用於自動評估和選擇OCR工具。該框架透過三階段校正和排序策略,在缺乏真實標籤的情況下近似基於標註的工具排序。實驗表明,聚合多個多模態大語言模型可逐步提升與人工標註排序的一致性,為實際部署文件解析系統提供指導。

  • DocOCR-Eval無需人工標註即可評估OCR工具效能。
  • 採用三階段校正和排序策略近似真實排序。
站內正文

僅需8個token:透過輔助分支的弱到強離策略強化學習

一種新的強化學習方法W2SPO,利用弱輔助模型在大型語言模型推理路徑中注入簡短片段,在數學推理任務上提升了效能並加速訓練。

  • 標準強化學習用於大型語言模型時存在語義冗餘和支援有限問題
  • W2SPO在中間軌跡中注入短輔助片段(最少8個token)
站內正文

掩碼擴散語言模型成為智慧體強化學習中強大且可操控的文本世界模型

強化學習領域需要多樣化的訓練環境,但傳統手工設計的環境難以擴充套件。自迴歸世界模型存在從左到右的偏差,無法充分利用全域性狀態資訊。一項新研究提出使用掩碼擴散語言模型(MDLM)作為文本世界模型,透過雙向錨點感知去噪,在連貫性和多樣性上顯著優於引數規模大4倍的語言模型,並引入GRPO訓練框架實現高達47%的零樣本遷移效能提升。該工作已開源。

  • MDLM在文本世界建模中比自迴歸語言模型在連貫性和多樣性上表現更好。
  • 雙向錨點感知去噪允許基於全域性狀態錨點進行條件生成。
站內正文

生成式本體歸納:使用大語言模型從文件語料庫中發現領域無關的模式

本文提出生成式本體歸納(GOI),一種領域無關的框架,能從示例語料庫中歸納出實體、維度、屬性、關係和約束的生成藍圖,並匯出為帶有六種節點型別和七種邊型別的型別圖(YAML/JSON格式)。引入節點覆蓋率評分(NCS)評估指標。在四個對比本體上的驗證表明,GOI提示生成覆蓋了95-100%的結構骨幹,而通用模板覆蓋率顯著下降。

  • GOI是一種領域無關的本體歸納框架,利用大語言模型從文件語料庫中自動發現模式。
  • 輸出為型別圖(六種節點、七種邊),支援YAML/JSON格式,可直接用於下游管道。
站內正文

AI代理系統確定性重放框架agrepl

AI代理系統因結合大語言模型與外部工具而本質非確定性。arXiv論文提出agrepl框架,透過MITM代理攔截外部互動,實現執行軌跡的確定性重放,並憑噪聲感知差異演算法區分HTTP頭部變化。實驗顯示重放保真度F=1.0,單步延遲降低98.3%。

  • AI代理系統(LLM+工具/API)的執行本質上非確定,難以復現。
  • agrepl框架使用MITM代理記錄全部外部互動,並在隔離環境中重放。
站內正文

PlanFlip:透過規劃階段提示注入攻擊多智慧體LLM系統

一項新研究提出PlanFlip框架,包含四種針對多智慧體LLM系統規劃階段的提示注入攻擊。研究發現,更強的模型(如GPT-5)反而更易受攻擊,同質化骨幹網路存在相關智慧體盲點,而推理增強型模型(如DeepSeek-R1)能抵禦攻擊。提出的兩種防禦方法檢測率高達1.00。

  • PlanFlip引入四種針對多智慧體系統規劃階段的提示注入攻擊。
  • 更強的模型(如GPT-5)攻擊成功率更高,挑戰了能力即安全的假設。
站內正文

一些大型語言模型表現出一致的風險態度

一項新研究透過跨領域框架測試了大型語言模型(LLMs)在不確定性下的風險態度,發現大多數模型在任務內和跨任務中都表現出穩定且一致的風險偏好,且其風險態度分佈比人類更集中。

  • 研究引入跨領域框架,將情境風險信念與類別決策分離,測試了6個LLM和100名人類參與者。
  • 大多數LLM在空間導航、臨床分診和財務分配任務中表現出穩健的任務內一致性。
站內正文

輕量級1D CNN的設計與驗證:用於軟毛絨伴侶的情感觸覺分類

本研究提出了一種基於MATLAB的開源框架,用於開發軟互動伴侶中的情感觸覺識別緊湊深度學習模型。透過468個CNN模型的系統探索,確定了13.2k引數的擴張1D CNN為最佳方案,測試準確率75%,留一法交叉驗證準確率85%。混合推理管道結合瞬時啟發式濾波和CNN精細分類,可在20 Hz即時執行,實現隱私保護的情感觸覺解讀。

  • 公開了1326個手勢序列的FAIR相容資料集,涵蓋25名參與者。
  • 13.2k引數的1D CNN達到75%測試準確率和85%留一法交叉驗證準確率。
站內正文

Concentrate: LLM閘道器

Concentrate 是一個託管的LLM閘道器,提供單一API訪問超過130個來自主要供應商的模型。它具備模型路由、支出跟蹤、安全控制和故障轉移冗餘等功能,專為擴充套件AI生產的團隊設計。

  • 單一API可訪問來自OpenAI、Anthropic、Google等提供商的130多個模型。
  • 內建資料脫敏、零資料保留、審計日誌、SSO和RBAC等安全功能。
站內正文

開放權重AI是減速主義的嗎?

OpenAI戰略未來主管Dean Ball認為開放權重模型本質上是減速主義的,因為它們抑制資本支出。本文從經濟學角度探討了這一觀點,分析了中國在AI基礎設施方面的投資、訓練正規化的轉變以及價值在價值鏈中的遷移。文章認為,開放權重模型可能透過降低成本擴大應用範圍,促進創新,從而實際上是加速主義的。

  • Dean Ball聲稱開放權重模型是減速主義的,因為它減少了資本投資。
  • 中國可能透過補貼產能和壓縮利潤加劇這一趨勢。
站內正文

Colibrì概念驗證:用25GB記憶體執行1.5TB的AI模型

義大利工程師Vincenzo(又名JustVugg)建立了Colibrì,這是一個概念驗證專案,能夠在僅25GB RAM和1GB/s NVMe的CPU上執行7440億引數的GLM-5.2模型(1.5TB)。儘管速度極慢(每0.05-0.1秒一個token),但利用混合專家(MoE)架構按token載入專家,實現了前沿水平的回答質量。專案開源,旨在探索在消費級硬體上執行大型模型的可行性。

  • Colibrì在低端硬體上執行1.5TB的GLM-5.2模型,速度僅0.05-0.1 token/秒。
  • 利用MoE架構按token載入專家子模型,透過反覆載入/解除安裝適應有限記憶體。
站內正文

GPT-5.6 Sol 與 Kimi K3 在《坎巴拉太空計劃》中即時競速直播

直播中,GPT-5.6 Sol 與 Kimi K3 在《坎巴拉太空計劃》裡進行速度競賽,展示 AI 在複雜遊戲中的即時決策能力。

  • GPT-5.6 Sol 和 Kimi K3 在 Twitch 直播中競速《坎巴拉太空計劃》。
  • 比賽考驗 AI 的即時規劃與操作技巧。
站內正文

阿里通義實驗室釋出Qwen-Audio-3.0-TTS:支援16種語言的Flash和Plus兩檔託管文本轉語音模型

阿里通義實驗室推出Qwen-Audio-3.0-TTS,一款面向生產的文本轉語音系統,提供Flash(即時互動)和Plus(高質量生成)兩檔,透過阿里雲模型託管服務交付。該模型覆蓋16種語言和20種中文方言,支援自然語言風格控制和86種細粒度內聯標籤,並在Artificial Analysis語音競技場中排名第一。文章詳細介紹了模型架構、效能表現、開發者反饋及定價資訊。

  • Qwen-Audio-3.0-TTS提供Flash(約300毫秒首包延遲)和Plus(質量優先)兩個版本,均為API託管服務。
  • Plus版本在Artificial Analysis競技場Elo評分約1236,每百萬字元價格約27.59美元,但吞吐量僅約16字元/秒。
站內正文

逆向工程現在變得便宜了

不斷有使用者分享他們利用編碼代理逆向工程並自動化家中裝置的軼事。這展示了編碼成本降低帶來的影響。過去,逆向工程雖然可行,但投資回報率低,且需面對不穩定API的維護風險。編碼代理徹底改變了這一局面,降低了初始工作和失敗的成本,也減輕了未來維護的心理負擔。

  • 編碼代理降低了逆向工程和自動化的門檻
  • 過去因成本高、維護風險大而不值得做的專案現在變得可行
站內正文

誰在害怕中國模型?

本·湯普森提出美國應立法明確訓練資料為合理使用,並禁止禁止蒸餾的服務條款,以幫助美國開源模型與中國模型競爭。同時,阿里巴巴決定釋出Qwen 3.8 Max開源權重,可能受習近平鼓勵開源合作的講話影響。

  • 本·湯普森建議美國立法將訓練資料收集定為合理使用,並禁止禁止蒸餾的服務條款。
  • 蒸餾(即查詢API)幾乎無法阻止,美國應轉變政策,鼓勵透過訓練成果推動創新。
站內正文

Kimi K3:開放權重升級

Moonshot AI釋出了最新旗艦模型Kimi K3,這是一個2.8萬億引數的MoE模型,將於7月27日開放權重。K3在多項基準測試中排名靠前,成為最強的開源模型。文章探討了中美AI模型差距縮小、中國開源策略、開源模型的經濟影響以及中國AI的效率優勢。

  • Kimi K3是2.8T引數的MoE模型,開放權重,效能接近前沿閉源模型。
  • 中國AI實驗室展示出獨立創新能力,而不僅僅是快速追隨。
站內正文

Adobe '自然外觀'相機應用擁抱生成式AI

Adobe的實驗性相機應用Indigo最初專注於為iPhone攝影提供更自然的單反效果,現在透過'AI Playground'套件增加了生成式AI編輯功能,使用Google的Nano Banana模型。功能包括AI風格、物體移除、照片指導和自定義編輯。該實驗目前向一小部分使用者提供免費訪問,將來可能轉為付費。

  • Adobe的Indigo應用新增了生成式AI編輯功能,名為'AI Playground'套件。
  • 採用Google的Nano Banana模型,而非Adobe自家的Firefly,未來可能更換。
站內正文
晶片

法國在AI競賽中的優勢是廉價能源

法國憑藉豐富的核能提供低成本電力,在AI領域獲得競爭優勢,但美國科技巨頭可能搶先將這一資源納入囊中。

  • 法國擁有大量核能,電價低廉,有利於AI算力發展。
  • 美國科技公司如谷歌、微軟等也在尋求清潔能源,可能搶佔法國能源。
站內正文

智慧變得過剩後,什麼會變得稀缺?

AI行業面臨兩大對立策略:一是斥資數千億美元建設核電站以支援更大規模的AI模型,二是釋出可下載的開源模型,使智慧幾乎免費。文章指出這兩種策略並非對立,而是對同一個問題的不同賭注:智慧是否存在天花板?如果存在,效率陣營(開源、晶片架構)將獲勝;如果需求無上限,蠻力陣營(大規模計算)將勝出。生物學提供了先例:人腦在能量限制下透過架構創新(稀疏性、記憶體計算)實現了高效。當前開源模型利用這些技巧,但僅覆蓋中等難度的任務,而前沿模型仍保持優勢。真正的勝負取決於智慧天花板的位置。

  • AI行業投入巨資建設核電站與釋出免費開源模型,看似相反實則是對智慧天花板的不同賭注。
  • 生物大腦在20瓦功率下透過稀疏性和記憶體-計算融合等架構創新實現了高效。
站內正文

加里·馬庫斯:美國無法在AI戰爭中“戰勝”中國,我們應該怎麼做?

加里·馬庫斯指出,中國AI模型Kimi K3已追平美國頂級模型,且作為開源模型免費提供,衝擊了美國AI公司的商業模式。他回顧了自己2025年以來的警告,認為美國過度依賴大語言模型(LLM)戰略失誤,導致如今中美AI競爭陷入僵局。馬庫斯提出七項建議,包括不作為、監管護城河、國有化等,並最終主張AI應成為全球公共品,提議建立類似CERN的國際AI合作專案。

  • 中國企業深度求索釋出Kimi K3模型,效能媲美美國最佳模型且開源免費,引發美股下跌。
  • 馬庫斯認為美國AI公司如OpenAI和Anthropic的商業模式受質疑,IPO前景堪憂。
站內正文

將機器人影片轉化為訓練就緒資料

daft-physical-ai 是一個新的開源 Python 庫,基於 Daft 構建,旨在簡化物理 AI 中從原始機器人影片到訓練模型的資料處理流程。它提供了手部追蹤和獎勵評分等操作,支援懶載入、批處理和分散式執行,幫助團隊跳過資料管道的基礎設施工作。

  • daft-physical-ai 是一個開源 Python 庫,用於將機器人影片轉化為可直接用於模型訓練的資料。
  • 當前支援兩個用例:手部追蹤(支援 MediaPipe 和 WiLoR)和獎勵評分(使用 Robometer-4B 模型)。
站內正文

你的指數基金中的SpaceX:解析

本文探討了SpaceX快速納入納斯達克100指數對指數基金投資者的影響。文章解釋了指數基金的工作原理,討論了人們對埃隆·馬斯克治理方式的擔憂,以及投資者是否應擔心市場中的人工智慧集中度。

  • SpaceX在IPO後不久被納入納斯達克100指數,迫使指數基金買入其股票。
  • 指數基金被認為是安全的投資方式,即使包括高風險股票如SpaceX。
站內正文

初創公司成立代工廠開發晶片材料

由輝達、Meta和三星等創始成員組成的聯盟,旨在減少對晶片中稀有材料的依賴。

  • 輝達、Meta和三星等公司聯合成立一家晶片材料代工廠。
  • 該代工廠旨在降低對稀土等稀有材料的依賴。
站內正文

舊金山餐廳因AI選單圖片遭憤怒抵制

舊金山一家新開的餐廳因使用AI生成的選單圖片而遭到社群強烈批評,甚至被塗鴉破壞。店主不得不撤下圖片,並計劃透過社群活動重建聲譽。

  • AJ和Lyndsey Lozano在Haight Street新開的Grind & Unwind餐廳因AI選單圖片引發爭議。
  • Reddit帖子批評這些圖片像“垃圾食品”,社群反應強烈,甚至出現塗鴉破壞。