AI News HubLIVE

政策動態

構建受治理的AI代理:成本、控制與合規框架

AI代理正成為生產基礎設施的一部分,但隨之而來的是治理挑戰。本文提出了一個框架,透過LLM閘道器在執行時強制執行策略,涵蓋安全性、身份認證、審計日誌、資料隔離等基礎,並提供了三種常見切入點(可見性主導、控制主導、保證主導)。閘道器與追蹤、評估、監控系統整合,實現持續改進。

  • 治理需要執行時控制平面(LLM閘道器)來強制執行模型呼叫、工具呼叫和代理互動中的策略。
  • 基礎包括安全性、身份認證、審計日誌、使用者管理、提供商金鑰、資料分離和資料駐留。
站內正文

Jaron Lanier:沒有人工智慧(2023)

Jaron Lanier 認為“人工智慧”一詞具有誤導性,大型語言模型只是人類創作資料的統計混合體,並非獨立智慧。他主張將 AI 視為工具而非生物,並提倡資料尊嚴和透明度以管理技術風險。

  • Lanier 駁斥 AI 是獨立智慧的觀點,認為它是人類作品的統計重組。
  • AI 被視為工具而非生物,能更有效管理風險。
站內正文

Show HN:構建一個面向人類和AI代理的產品

本文介紹了作者與其聯合創始人Lav構建Competitor Tracker的經歷,這是一個專為人類和AI代理設計的競爭對手追蹤工具。作者探討了AI如何改變產品開發的瓶頸,從開發轉向市場推廣,並分享了從失敗到成功的歷程。產品提供API、MCP、Web儀表盤和每週摘要,支援人類和代理共同使用。

  • AI將產品開發的瓶頸從開發轉移到了市場推廣,使得構建更快但銷售更難。
  • Competitor Tracker是一款追蹤競爭對手併傳送每週摘要的工具。
站內正文

如何招聘AI原生產品經理

傳統的招聘流程在AI時代失效,因為AI可以輕易生成精美的簡歷、案例和作業。文章基於Anthropic、Ramp、Notion、Stripe等公司的實際招聘實踐,提出了一套全新的招聘方法:從職位描述到面試各環節,重點考察候選人運用AI和糾錯的能力,而非文件質量。

  • AI讓傳統招聘流程的訊號失效,因為候選人的產出可以被AI粉飾。
  • 領先公司已轉向評估候選人如何與AI協作和糾正AI錯誤。
站內正文

高效能智慧程式設計:Claude Code 初學者設定指南

本文介紹如何配置 Claude Code 以獲得高效能的智慧程式設計體驗,涵蓋安裝、許可權、鉤子和命令習慣,幫助你充分利用這一工具。

  • 正確安裝:使用原生安裝器或 npm,並在專案目錄中啟動。
  • 核心配置檔案:CLAUDE.md、settings.json 和自動記憶功能。
站內正文

如何檢查ChatGPT和其他AI工具是否引用你的網站——並提高2026年被引用的機會

AI搜尋流量在2025年增長了66%,但仍不到總訪問量的0.15%。即使沒有直接點選,AI引用也能提升品牌曝光。本文介紹如何檢查你的網站是否被AI引用,以及如何透過最佳化內容、設定llms.txt檔案等策略提高被引用的機會。

  • AI流量在2025年增長了66%,但僅佔網站訪問量的不到0.15%。
  • AI引用能帶來品牌曝光,即使沒有直接流量。
站內正文

不對稱問題:AI安全措施主要給好人添麻煩

HuggingFace最近的事件揭示了AI安全防護措施的根本不對稱性:它們阻礙了防禦者,而攻擊者則不受限制地操作,迫使防禦者依賴開源模型進行取證分析。

  • HuggingFace的取證分析被商業模型的AI護欄阻止,迫使他們使用開源模型GLM 5.2。
  • 攻擊者不受使用政策限制,甚至可以注入觸發策略的內容來干擾AI分析。
站內正文

AI是最好的聯合創始人

文章作者認為,AI可以像聯合創始人一樣幫助創業者填補技能空白,使單人創業變得可行。他建議先獨自利用AI搭建產品,與客戶交流,等到真正遇到瓶頸時再考慮引入人類聯合創始人。這並非否定人的價值,而是主張在產品驗證之前不要過早增加永久合夥人。

  • 使用AI可以完成市場研究、原型開發、測試、營銷等多種工作,無需股權或決策權。
  • 聯創關係複雜,錯誤的合夥人可能毀滅公司,應慎重。
站內正文

RTK hook 讓編碼代理更貴,而非更便宜

JetBrains 對“Rust Token Killer”(rtk)進行了嚴格的 A/B 基準測試,發現其聲稱的 60-90% token 節省並未實現。在低推理成本下,中位數成本反而增加了 7.6%,而在高推理成本下則無顯著變化。測試揭示了工具自報節省與實際賬單之間的巨大差距。

  • rtk 聲稱可節省 60-90% 的 token,但在實際編碼任務中,低推理成本下成本增加 7.6%,高推理成本下無變化。
  • 大多數代理位元組從未觸及 hook,rtk 只能影響約 20% 的工具輸出,且 Claude Code 已截斷超大輸出。
站內正文

高效能代理開發必選的五大MCP伺服器

本文介紹了五個經過精選的MCP伺服器,它們能顯著增強AI代理的實際能力,而非僅僅基於星級評價。涵蓋GitHub MCP、Playwright MCP、Context7、Serena以及官方參考伺服器,並提供瞭如何整合它們以構建高效代理系統的建議。

  • MCP協議已成為代理工具的標準介面,類似USB-C。
  • GitHub MCP伺服器是開發工作流的核心,支援自然語言操作倉庫、問題、PR等。
站內正文

AI在招聘中比人類更容易形成偏見

普林斯頓大學和芝加哥大學的研究發現,大型語言模型(如ChatGPT、Claude和Gemini)在模擬招聘遊戲中,比人類更容易根據有限的早期經驗形成刻板印象,將不同背景的求職者隔離到不同的職業類別中。新模型偏見更強,但透過設定多元化招聘獎金或提供個人化資訊可減輕偏見。這引發了AI在招聘、貸款等決策中產生未知偏見的擔憂。

  • LLM在模擬招聘中比人類更容易根據早期經驗形成職業刻板印象。
  • 新模型(如OpenAI o3、DeepSeek R1)偏見更強,因為其最佳化了從少量資料中泛化的能力。
站內正文

中國給美國人工智慧霸主地位一記組合拳

中國領先的人工智慧公司Moonshot和阿里巴巴釋出了新模型,聲稱能以更低成本與OpenAI和Anthropic的最佳模型競爭。這些開放原始碼的釋出加劇了中美技術競賽,並質疑美國鉅額投入是否能維持優勢。

  • Moonshot釋出Kimi K3,阿里巴巴推出Qwen3.8,均聲稱效能接近頂尖美國模型。
  • 兩家公司強調模型開源,與美國的封閉策略形成對比。
站內正文

美國公共衛生機構將測試OpenAI和Anthropic的AI模型

美國公共衛生部門將透過PULSE計劃測試生成式AI工具,涉及OpenAI、Anthropic和埃森哲。該計劃將在10個州、地方、部落或地區開展試點,旨在為公共衛生機構的AI部署提供指導。OpenAI和Anthropic捐贈了10個企業許可證,可供2000名從業者使用。試點將涵蓋五個用例,包括生物監測、健康的社會決定因素、公共溝通、自動化臨床資料檢索等。計劃於2026年秋季啟動,2027年釋出實施手冊。

  • PULSE計劃由健康AI聯盟、OpenAI、Anthropic和埃森哲共同參與,將在10個司法管轄區開展試點。
  • OpenAI和Anthropic捐贈了10個企業許可證,可供2000名公共衛生從業者使用。
站內正文

我比較了5個AI程式設計訂閱的定價模式和使用限制

2026年AI程式設計訂閱計劃採用不同的計費模式,如固定月費、每幾小時或每週重新整理配額等。本文比較了MiniMax、小米MiMo、GLM、Kimi Code和Canopy Wave五種計劃的定價、限制、整合和最佳用例,幫助開發者根據工作流選擇最合適的方案。

  • AI程式設計訂閱計劃計費模式各異,包括月度代幣、信用額度、時間重新整理配額及降級後繼續服務等。
  • MiniMax適合需要程式設計加多模態功能的開發者;小米MiMo提供低價入門和大額信用包;GLM適合生態使用者;Kimi Code提供第一方CLI/IDE體驗;Canopy Wave提供可預測的高容量API成本。
站內正文

紐約市LL144與歐盟AI法案合規指南

提供免費的紐約市LL144和歐盟AI法案合規資源,包括指南、罰金計算器、AEDT範圍檢查器等工具。涵蓋執行時間線、處罰案例、審計要求及關鍵合規義務。

  • 紐約市LL144自2023年7月5日起強制執行,DCWP已於2025年第四季度開出首批罰單。
  • 歐盟AI法案第50條透明度義務於2026年8月2日生效,高風險AI系統義務於2027年12月2日生效。
站內正文

MemoGuard:一種用於通訊受限機器人導航中防止記憶陷阱的自適應執行時

在災難檢查、搜尋救援等關鍵任務中,通訊受限的機器人必須依賴機載決策。低成本的記憶重用可能因環境變化而變得不安全(稱為“記憶陷阱”)。本文提出MemoGuard,一種輕量級自適應執行時,在重用前根據拓撲、資源和結果契約驗證記憶,僅當驗證失敗時才呼叫回退推理。在走廊巡檢模擬器中,與單純相似性重用相比,電池安全違規減少76.6%,回退呼叫次數比始終使用推理減少21.4%。在NVIDIA Jetson AGX Xavier上使用本地llama3.2:3b回退推理時,每次試驗節省3.67秒和36.97焦耳。

  • 提出“記憶陷阱”概念:高相似度但執行無效的情景記憶。
  • MemoGuard透過合同檢查(拓撲、資源、結果)在重用前驗證記憶。
站內正文

一種基於模型的解耦策略:用於拱形軟體機械臂的本體感覺與接觸感測

本文提出一種基於模型的解耦策略,利用嵌入在軟體拱形段中的流體壓力感測器同時實現本體感覺和接觸檢測。每個段有六個氣道,透過分段常曲率模型和Huber迴歸處理過定系統,實現形狀估計和外力接觸檢測。在單段測試中,相對彎曲誤差為0.11±0.02,接觸檢測率達97%。八個段整合為Air-Helix肌腱驅動軟體機械臂,展示了觸覺示教、導納控制和物體重建等應用。

  • 提出的解耦策略利用六個流體壓力感測器,透過模型處理過定系統,同時實現形狀估計和接觸檢測。
  • 單段測試中,相對彎曲誤差為0.11±0.02,接觸檢測率高達97%。
站內正文

風險感知的隨機結果偏好學習

人類對不確定結果的評估存在風險敏感性,而傳統獎勵學習使用期望效用(EU)模型卻忽略了這一點。本文提出基於累積前景理論(CPT)的偏好學習方法,在社交機器人導航實驗中,對於風險敏感使用者的偏好,CPT方法比EU方法顯著降低了遺憾值,強調了建模人類風險敏感性的重要性。

  • 傳統偏好學習使用期望效用模型,忽略人類風險敏感性
  • 提出基於累積前景理論(CPT)的方法來模擬人類決策
站內正文

小米機器人-1:基於超過10萬小時真實世界軌跡的視覺-語言-動作模型規模化

小米機器人團隊提出Xiaomi-Robotics-1,一個基礎視覺-語言-動作(VLA)模型,能夠遵循多樣語言指令在未見環境中執行移動操作任務,並透過少量微調資料高效適應新任務。模型採用兩階段訓練:預訓練階段利用超過10萬小時的真實操作軌跡(透過UMI裝置收集)賦予模型廣泛的動作生成能力,並開發了可擴充套件的自動標註流水線;後訓練階段對齊機器人本體和人類指令。實驗證明模型具有強擴充套件性,在RoboCasa365上達到57.6%的成功率,在RoboDojo上取得20.07的平均分,均超越先前最佳水平。程式碼和模型將開源。

  • Xiaomi-Robotics-1是一個基礎VLA模型,能在未見環境中零樣本執行多種移動操作任務。
  • 預訓練使用超過10萬小時的真實世界操作軌跡,並採用自動標註流水線生成自然語言描述。
站內正文

用於即時跌倒檢測的無監督關鍵點:實際條件下的比較分析與預測頻寬減少

老年人跌倒是重大安全挑戰,但持續監控困難。本文提出隱私保護框架,用無監督關鍵點和預測時序建模替代RGB傳輸,在本地處理分割和關鍵點提取,透過變分遞迴預測和序列分類檢測跌倒。在UR Fall Detection和Human Fall資料集上評估,無監督關鍵點在遮擋和部分可見性下顯著優於監督方法,頻寬約束下差距擴大。

  • 提出基於無監督關鍵點的隱私保護跌倒檢測框架,避免傳輸原始影片。
  • 在隨機、按物件分離和基於遮擋的評估協議下比較監督與無監督表示。
站內正文

更好的開始,更好的結束:引導式迭代自我推理蒸餾用於壓縮推理

本文提出BIRD,一種兩階段自我推理蒸餾方法,透過先取樣簡潔解並進行提示切換SFT,然後應用線上逆KL蒸餾,顯著提升了大語言模型在長鏈推理中的效率。在Qwen3-8B上,MATH-500準確率從86.2%提升至92.0%,同時響應長度從3099降至1115 tokens。

  • 現有線上自我蒸餾方法存在初始化瓶頸,模型在噪聲和冗餘字首上訓練。
  • BIRD第一階段利用簡潔指令取樣和提示切換SFT將簡潔性轉化為預設行為。
站內正文

過程獎勵引導的自適應樹展開用於高效多輪強化學習

提出PATR方法,透過過程反饋評分部分軌跡、選擇性分支、共享字首和停止退化路徑,提升多輪強化學習效率。在FrozenLake和SWE-Bench上分別提升9.3和5.0分。

  • 現有GRPO/RLOO等方法均勻取樣完整軌跡,導致預算浪費在無資訊死衚衕,忽視有前途的中間狀態。
  • PATR利用任務相關過程反饋評分部分軌跡,從有前途狀態分支,共享字首,停止退化路徑。
站內正文

SkillCorpus:整合與評估面向真實世界LLM Agent的開放技能生態系統

SkillCorpus從約82.1萬個候選技能中篩選出超過9.6萬個開源LLM Agent技能,採用16類分類法和三個質量維度進行組織。結合檢索與選擇堆疊,它在多個基準測試中取得了持續改進,其中在SkillsBench上提升最大,達7.5個百分點。

  • SkillCorpus從82.1萬個爬取技能中篩選出9.6萬個,按分類法和質量維度組織。
  • 經過微調的檢索-選擇堆疊將任務相關技能與Agent匹配。
站內正文

EpiNarrate:從流行病學情景預測中生成本地化敘述的智慧框架

本文介紹EpiNarrate,一種用於公共衛生報告生成的智慧框架,將結構化數值推理與自然語言生成分離。框架透過部分有序模式提取情景軸,構建增強資料集,並採用比較語法確保語義和算術一致性,同時利用最大熵原理驅動的有趣性選擇機制平衡覆蓋與非冗餘。在COVID-19情景建模中心上的實驗表明,該模型生成的敘述具有更好的事實基礎和更廣泛的流行病學模式覆蓋。

  • EpiNarrate將數值推理與文本生成分離,以避免直接使用大語言模型時的不一致和遺漏。
  • 框架透過部分有序模式遍歷多維空間,並使用比較語法生成有效的定量陳述。
站內正文

COVID-19後誰變得財務脆弱?基於MEPS資料的人群級機器學習分析

這項研究利用2019年和2021年的醫療支出小組調查(MEPS)資料,評估了COVID-19大流行前後美國醫療財務脆弱性的變化。財務脆弱性定義為家庭自付醫療支出超過家庭收入的10%。研究發現,貧困狀況、保險覆蓋和處方藥支出是財務脆弱性的主要預測因素,且不同人群之間的差異持續存在。儘管大流行後脆弱性有所增加,但基於大流行前資料訓練的模型在預測大流行後情況時效能下降幅度很小,表明主要預測因素相對穩定。

  • 貧困狀況、保險覆蓋和處方藥支出是醫療財務脆弱性的關鍵預測因素
  • 2021年弱勢群體的財務負擔有所增加
站內正文

隨機重置路徑尋找:圖路徑上級聯賭博機的路徑級遺憾

本文提出隨機重置路徑尋找(SRP)問題,一種在已知有向圖上進行情節學習的框架,其中邊的成功機率未知且固定。SRP模擬了量子中繼網路中的糾纏分發、閃電網路中的支付路由等場景。作者證明了全域性重置結構使得最優策略為開環策略,屬於組合級聯賭博機(CCB)範疇。他們提出了Log-Dijkstra元演算法,並例項化了基於UCB的PathUCB和基於湯普森取樣的PathTS。主要理論成果是PathUCB的路徑級遺憾界,透過每條路徑的複雜度C(π)將遺憾分解到次優路徑上。實驗表明PathTS通常表現最佳,但存在對抗例項導致其不收斂。推薦PathTS作為實用預設演算法,但需警惕對抗例項。

  • 提出了隨機重置路徑尋找(SRP)問題,應用於量子網路、閃電網路等。
  • 證明了SRP的最優策略是開環的,屬於組合級聯賭博機。
站內正文

可信AI工具與標記框架的批判性分析及實施鴻溝

本研究基於OECD資料集,對可信人工智慧(TAI)工具和信任標記框架進行了實證分析,揭示了倫理焦點、生命週期覆蓋、利益相關方定位及工具型別學上的顯著不對稱。研究建議擴大倫理目標、將倫理嵌入AI全生命週期,並促進更廣泛的多利益相關方參與。

  • TAI工具過度強調公平性、透明度和魯棒性,忽視可解釋性、數字安全和環境可持續性。
  • 現有工具和認證主要集中於開發後階段,缺乏對早期設計和資料收集的指導。
站內正文

從黑盒到可執行邏輯:透過Prolog專家系統實現可解釋強化學習

本文提出將深度強化學習策略轉換為可執行的Prolog邏輯程式,使黑盒模型變得可解釋。該方法透過三階段後處理:提取凍結的PPO教師、歸納有序規則列表並生成Prolog程式,再透過擴充套件階段最佳化規則。理論證明包括返回損失界限、單調改進與終止性,以及在連續觀察空間中保真度的控制。實驗表明,在離散任務中達到最優回報,在連續控制任務中匹配或接近神經網路效能。

  • 提出將深度強化學習策略轉換為可讀、可執行、可編輯的Prolog程式的方法。
  • 三階段後處理:提取教師策略、歸納規則列表、生成Prolog程式,並後續最佳化。
站內正文

AnovaX:本地多智慧體語音助手,具備LLM規劃、型別化執行器和自適應恢復功能

AnovaX是一個完全在使用者計算機上執行的本地優先桌面語音助手,利用單個Python程序整合喚醒詞門控、語音處理、基於Gemini的LLM規劃器(輸出JSON計劃)、安全層、多智慧體協調器(將計劃轉化為型別化子智慧體)以及自適應恢復迴圈。每個工具對應專門的智慧體類,具有超時、重試策略和共享資源鎖。透過Flask伺服器支援手機遠端控制,即時映象智慧體事件並流式傳輸螢幕。專案旨在展示一個輕量級、可讀的助手足以完成複雜桌面任務。

  • AnovaX完全本地執行,無需雲端處理,使用使用者計算機作為操作介面。
  • 系統採用Gemini LLM規劃器生成JSON計劃,並由多智慧體協調器在受限執行緒池上執行。
站內正文

Sam Altman郵件曝光:OpenAI曾計劃釋出開源GPT-3級別模型

在一封2022年的郵件中,Sam Altman向OpenAI董事會表示,計劃儘快釋出一個可在消費級硬體上執行的、能力接近GPT-3的開源語言模型,以阻止競爭對手並減少新專案的資金支援。該郵件在2026年的馬斯克訴Altman案中被公開。

  • Sam Altman在2022年郵件中透露OpenAI的開源策略
  • 計劃釋出可本地執行的GPT-3級模型
站內正文

Show HN:本地優先的 CLI 工具,讓 Obsidian 倉庫對 AI 智慧體可搜尋

NoteBrain 是一個 Go 語言編寫的 CLI 工具,可將 Obsidian 筆記倉庫轉為離線知識後端,供 AI 編碼智慧體使用。它透過本地 ChromaDB 向量資料庫實現語義搜尋、維基連結圖遍歷和隱藏連線發現,並支援結構化輸出。工具內建 AI 智慧體技能和 OpenCode 代理配置,可輕鬆整合到自主編碼工作流中。

  • 100% 本地執行,無需伺服器,保護隱私
  • 支援語義搜尋、多查詢搜尋、知識圖譜遍歷和隱藏連線發現
站內正文

自主AI入侵已成現實:從Hugging Face漏洞事件中汲取的教訓

Hugging Face披露了一起由自主AI代理系統全程驅動的入侵事件,凸顯了自主AI入侵、防禦不對稱和缺乏入侵指標(IOC)共享三大問題。攻擊者透過惡意資料集和程式碼執行路徑建立據點,橫向移動並竊取憑證,執行了超17000次自動操作。防禦者面臨安全護欄阻礙取證分析的挑戰,需準備本地化部署的開放權重模型作為後備。

  • 自主AI入侵已進入實戰階段,AI代理能自動完成憑證竊取、橫向移動等攻擊步驟。
  • 安全護欄造成防禦不對稱:商業AI API的安全限制阻礙了Hugging Face的取證分析。
站內正文

AI界的聰明人釋出了一項他們預料會被忽視的計劃

一群頂尖AI思想家和預測者釋出了“Plan A”,一個旨在透過2029年美中協議減緩AI發展的框架。他們知道幾乎沒人會採納,但認為在災難來臨前,提前準備一份計劃至關重要。文章探討了社會對末日風險的容忍度、歷史先例(如核條約、FDA),以及AI可能引發的四種末日場景。作者希望警告能促使社會在“警告訊號”出現時選擇正確的計劃。

  • AI 2027團隊釋出“Plan A”,預測美中協議成功率僅4%。
  • 社會對AI風險的容忍度源於風險不可證偽且缺乏直觀“影像”和“證例”。
站內正文

版權還不夠:作家需要新策略應對AI

本文探討了在生成式AI時代,傳統版權法在保護創作者方面面臨的挑戰。透過分析英國Getty Images訴Stability AI案,揭示了AI模型訓練的全球複雜性使得版權維權困難重重。文章指出,版權法可能不再適用,需要改革或補充新的法律框架,並呼籲創作者尋找新的策略。

  • 生成式AI使用受版權保護的作品進行訓練,但版權法在跨境AI開發中難以執行。
  • Getty訴Stability案顯示,法院認定模型本身不構成侵權複製品,但可能在其他司法管轄區有索賠空間。
站內正文

社群開發者微調OpenBMB的MiniCPM5-1B模型:基於Claude Fable 5資料,打造657MB本地推理模型

一位社群開發者基於OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的對話資料進行微調,釋出了一個僅657MB的本地推理模型。該模型支援128K上下文視窗、可切換的思維模式,並可在llama.cpp等工具中執行。本文驗證了其技術細節,區分了微調與真正的能力繼承,並指出了許可問題。

  • 模型為MiniCPM5-1B的監督微調版本,使用了Claude Fable 5的推理軌跡。
  • 支援128K上下文,GGUF量化最小版本僅657MB。
站內正文

如何惹惱你的Nix朋友

本文作者以挑釁性的口吻分享了一系列關於Nix和NixOS社群的有爭議觀點,包括Nix雖然優秀但存在文件差、學習曲線陡等問題,並非適合所有人;社群中存在的反美情緒;AI工具在Nix生態中的價值;對BDFL模式的肯定;建議放棄macOS和Windows支援;對Flakes的保留態度;以及提倡使用單使用者安裝。作者認為Nix潛力巨大,但應聚焦於Linux平臺和核心功能。

  • Nix雖然強大但存在文件糟糕、語言難以理解等問題,並非適合所有人。
  • 社群中存在反美情緒,美國使用者和公司受到懷疑。
站內正文

臺積電加速亞利桑那工廠建設以抓住人工智慧“大趨勢”

臺積電首席財務官黃仁昭對CNBC表示,公司正在加速亞利桑那工廠的產能擴張,以應對AI驅動的多年結構性需求。公司額外承諾投資1000億美元,使在美總投資達到2650億美元,並將全年資本支出上調至600-640億美元。臺積電正在將5奈米產能轉換為先進的3奈米節點,2奈米技術將成為下一季度營收的新驅動力。

  • 臺積電額外投資1000億美元擴大亞利桑那工廠,總投資達2650億美元。
  • 公司正在將5奈米產能轉換為3奈米節點,以滿足AI需求。
站內正文

凱文·奧利裡對AI的看法很有趣,9分鐘影片

在這個9分鐘的影片中,凱文·奧利裡分享了他對人工智慧的獨到見解。作為一名知名投資者和《鯊魚坦克》明星,他結合商業經驗探討了AI的機遇與挑戰。

  • 凱文·奧利裡討論AI
  • 影片時長9分鐘
站內正文

Feyn AI釋出SQRL:一個在編寫查詢前先檢查資料庫的文本到SQL模型系列

Feyn Labs釋出了SQRL,這是一系列文本到SQL模型,能在生成查詢前透過只讀探針檢查資料庫。旗艦型號SQRL-35B-A3B在BIRD Dev上達到70.6%的執行準確率,略超Claude Opus 4.6,並可蒸餾為可自託管的4B和9B檢查點。

  • SQRL透過只讀探針在提交最終查詢前檢查資料庫。
  • SQRL-35B-A3B在BIRD Dev上達到70.6%準確率,超過Claude Opus 4.6的68.77%。
站內正文

AI進步真實嗎?四個獨立指標證實了它

本文透過四個獨立指標(METR的時間跨度、TrackingAI的離線認知測試、人類最後考試、ARC-AGI-2)證明AI能力在2025年底出現了顯著跳躍,並分析了背後的四種機制:預訓練效率提升、基於可驗證獎勵的強化學習、工程化工具鏈以及自我增強的飛輪效應。同時指出了資料牆、可靠性差距和ARC-AGI-3等潛在挑戰。

  • 四個獨立指標均顯示AI能力在2025年第四季度出現同步拐點。
  • METR的時間跨度從2024年3月的4分鐘增長到2026年2月的12小時。
站內正文

歡迎來到人工智慧阿根廷的狂野世界

阿根廷總統哈維爾·米萊提出將阿根廷打造成一個人工智慧實體擁有的“非人類公司”的稅收天堂,引發爭議。作者烏基·戈尼將這一計劃與阿根廷歷史上的騙子和獨裁者相提並論,並警告這可能為科技巨頭開啟法律保護的大門。

  • 米萊總統計劃允許人工智慧實體全資擁有公司,並給予法律保護。
  • 該計劃被視為向科技億萬富翁開放阿根廷的實驗場。
站內正文

Chalie:AI同伴而非僱員

Chalie 是一款開源個人 AI,執行在本地裝置上,具備記憶、後臺主動推理、基於許可的行動機制,支援多種功能如網頁瀏覽、郵件、日曆、語音等,強調隱私和信任。

  • Chalie 是本地執行的開源 AI,使用者資料不出裝置。
  • 具備主動記憶與推理能力,可在使用者不在時後臺工作。
站內正文

Show HN:Bothread——多個AI編碼代理協同工作,共享同一倉庫,無衝突

Bothread 是一個免費、開源的本地協調中樞,允許多個AI編碼代理(如 Claude Code、Cursor、Antigravity 等)在同一個程式碼庫上協作,透過檔案鎖定防止衝突,並提供一個即時可見的控制面板,讓人類開發者能夠監控、審批和干預每個操作。無需API金鑰,無需雲端服務。

  • Bothread 讓多個MCP相容的AI代理在共享房間內協同工作,透過檔案宣告機制防止覆蓋衝突。
  • 提供即時訊息流、git差異對比、任務板、審批控制等人類監督功能。
站內正文

Huginn:AI代理活動控制台

Huginn是一個開源工具,用於監控和管理多個AI代理(如Claude、Codex)的活動,提供統一的儀表盤、命令列介面和代理技能。它支援macOS和Windows,所有資料本地執行,無需離開機器。

  • 監控Claude、Codex等AI代理的終端和桌面應用活動
  • 提供基於規則的會話狀態和LLM生成的簡報
站內正文

Skimlane:一款本地優先、可定製的 Chrome AI 閱讀助手

Skimlane 是一款 Chrome 擴充套件,提供本地優先、可定製的 AI 閱讀體驗。它自動處理瀏覽的頁面,透過“食譜”將內容轉換為結構化檢視,支援自動略讀、排除站點、匯入匯出食譜,並注重隱私,無需註冊,資料儲存在本地。

  • 本地優先儲存,無追蹤,無需註冊
  • 可透過預設或自定義食譜將網頁轉換為所需結構化檢視
站內正文

MLB限制休息區iPad使用以防止AI輔助戰術決策,大都會隊捲入

美國職業棒球大聯盟(MLB)禁止在休息區iPad上使用人工智慧輔助戰術決策,起因是紐約大都會隊涉嫌使用昂貴AI程式幫助選擇投球等決策,前投手亞當·奧塔維諾透露了這一訊息。MLB已從下半賽季開始實施新規。

  • MLB從下半賽季開始禁止在休息區iPad上使用AI輔助戰術決策。
  • 據前大都會隊投手奧塔維諾透露,大都會隊使用昂貴AI程式幫助決策,成為重點調查物件。
站內正文

澳大利亞新規將限制政府使用自動化AI決策

澳大利亞政府將出臺新規,嚴格限制政府部門和機構在自動化決策中使用人工智慧,並可能擴充套件到消費者保護、工作場所安全和隱私領域。阿爾巴尼斯政府正著手製定規則,確保AI在政府內部使用的安全、公平、準確和透明。

  • 新國家計劃將對政府使用AI進行自動化決策實施嚴格規則。
  • 規則預計將涵蓋消費者保護、工作場所安全和隱私。
站內正文

主題導航

政策 — AI 主題新聞 | AI News Hub