AI紅隊測試:保護自主AI系統安全
隨着AI系統具備推理、使用工具、訪問數據和自主行動的能力,傳統安全方法已不足以應對新型攻擊面。本網絡研討會探討為何AI驅動的對抗性測試正成為AI安全的關鍵環節。
- 自主AI系統創建了全新的安全與隱私風險
- 傳統基準測試、滲透測試和靜態評估無法覆蓋AI特有的攻擊模式
主題流
AI 政策會改變模型訓練、產品發布、數據使用和跨境部署的邊界。這裡追蹤監管、版權、安全標準、出口管制、政府採購和行業規則,協助團隊提前理解合規、市場准入和技術路線風險。
隨着AI系統具備推理、使用工具、訪問數據和自主行動的能力,傳統安全方法已不足以應對新型攻擊面。本網絡研討會探討為何AI驅動的對抗性測試正成為AI安全的關鍵環節。
本·湯普森提出美國應立法明確訓練數據為合理使用,並禁止禁止蒸餾的服務條款,以幫助美國開源模型與中國模型競爭。同時,阿里巴巴決定發佈Qwen 3.8 Max開源權重,可能受習近平鼓勵開源合作的講話影響。
LangChain 構建了 IssueBench,這是一個合成基準測試,用於評估 LangSmith Engine 在代理軌跡中識別、分類和分組問題的能力。本文介紹了 IssueBench 的構成、評分方式以及構建過程中的經驗教訓。
Open Minis是一款深度集成蘋果原生框架的iOS智能代理應用,它通過內置Linux終端和專門的命令行接口,實現了對日曆、家庭、健康、照片等系統組件的精準控制。作者展示了它如何調用HomeKit傳感器數據、結合照片與健康信息,甚至創建交互式地圖,其能力遠超當前Siri AI,堪稱前沿模型與iOS系統能力結合的典範。
這是一個為初創企業設計的快速測驗,幫助判斷其AI項目是否受歐盟AI法案的監管。
硬盤價格飆升讓NAS變得小眾,但羣暉DS225+依然值得推薦。本文分析了NAS成本上漲的原因(AI數據中心需求),對比了雲存儲的優勢,並指出了NAS的適用人羣。最終推薦DS225+,因其2.5GbE端口、SHR磁盤管理和優秀的DSM軟件,儘管存在一些廠商限制。
Apache Spark 4.2 發佈,新增原生向量搜索、治理指標、流處理升級和 Python 支持增強,使 Spark 擴展為 AI 服務層,減少對獨立向量數據庫的需求。
舊金山一家新開的餐廳因使用AI生成的菜單圖片而遭到社區強烈批評,甚至被塗鴉破壞。店主不得不撤下圖片,並計劃通過社區活動重建聲譽。
AI代理正成為生產基礎設施的一部分,但隨之而來的是治理挑戰。本文提出了一個框架,通過LLM網關在運行時強制執行策略,涵蓋安全性、身份認證、審計日誌、數據隔離等基礎,並提供了三種常見切入點(可見性主導、控制主導、保證主導)。網關與追蹤、評估、監控系統集成,實現持續改進。
Jaron Lanier 認為“人工智能”一詞具有誤導性,大型語言模型只是人類創作數據的統計混合體,並非獨立智能。他主張將 AI 視為工具而非生物,並提倡數據尊嚴和透明度以管理技術風險。
本文介紹了作者與其聯合創始人Lav構建Competitor Tracker的經歷,這是一個專為人類和AI代理設計的競爭對手追蹤工具。作者探討了AI如何改變產品開發的瓶頸,從開發轉向市場推廣,並分享了從失敗到成功的歷程。產品提供API、MCP、Web儀表盤和每週摘要,支持人類和代理共同使用。
傳統的招聘流程在AI時代失效,因為AI可以輕易生成精美的簡歷、案例和作業。文章基於Anthropic、Ramp、Notion、Stripe等公司的實際招聘實踐,提出了一套全新的招聘方法:從職位描述到面試各環節,重點考察候選人運用AI和糾錯的能力,而非文檔質量。
本文介紹如何配置 Claude Code 以獲得高性能的智能編程體驗,涵蓋安裝、權限、鈎子和命令習慣,幫助你充分利用這一工具。
AI搜索流量在2025年增長了66%,但仍不到總訪問量的0.15%。即使沒有直接點擊,AI引用也能提升品牌曝光。本文介紹如何檢查你的網站是否被AI引用,以及如何通過優化內容、設置llms.txt文件等策略提高被引用的機會。
HuggingFace最近的事件揭示了AI安全防護措施的根本不對稱性:它們阻礙了防禦者,而攻擊者則不受限制地操作,迫使防禦者依賴開源模型進行取證分析。
技術專業人士因AI感到壓力,倦怠增加,樂觀減少。調查發現,刻意説'不'是一種解決方案。
文章作者認為,AI可以像聯合創始人一樣幫助創業者填補技能空白,使單人創業變得可行。他建議先獨自利用AI搭建產品,與客户交流,等到真正遇到瓶頸時再考慮引入人類聯合創始人。這並非否定人的價值,而是主張在產品驗證之前不要過早增加永久合夥人。
JetBrains 對“Rust Token Killer”(rtk)進行了嚴格的 A/B 基準測試,發現其聲稱的 60-90% token 節省並未實現。在低推理成本下,中位數成本反而增加了 7.6%,而在高推理成本下則無顯著變化。測試揭示了工具自報節省與實際賬單之間的巨大差距。
本文介紹了五個經過精選的MCP服務器,它們能顯著增強AI代理的實際能力,而非僅僅基於星級評價。涵蓋GitHub MCP、Playwright MCP、Context7、Serena以及官方參考服務器,並提供瞭如何整合它們以構建高效代理系統的建議。
普林斯頓大學和芝加哥大學的研究發現,大型語言模型(如ChatGPT、Claude和Gemini)在模擬招聘遊戲中,比人類更容易根據有限的早期經驗形成刻板印象,將不同背景的求職者隔離到不同的職業類別中。新模型偏見更強,但通過設置多元化招聘獎金或提供個人化信息可減輕偏見。這引發了AI在招聘、貸款等決策中產生未知偏見的擔憂。
中國領先的人工智能公司Moonshot和阿里巴巴發佈了新模型,聲稱能以更低成本與OpenAI和Anthropic的最佳模型競爭。這些開放源代碼的發佈加劇了中美技術競賽,並質疑美國鉅額投入是否能維持優勢。
OpenAI分享了部署長期運行AI模型的經驗,強調了新的安全風險、觀察到的失敗,以及通過迭代部署改進的安全措施。
美國公共衞生部門將通過PULSE計劃測試生成式AI工具,涉及OpenAI、Anthropic和埃森哲。該計劃將在10個州、地方、部落或地區開展試點,旨在為公共衞生機構的AI部署提供指導。OpenAI和Anthropic捐贈了10個企業許可證,可供2000名從業者使用。試點將涵蓋五個用例,包括生物監測、健康的社會決定因素、公共溝通、自動化臨牀數據檢索等。計劃於2026年秋季啓動,2027年發佈實施手冊。
AI透明度是記錄人工智能系統的數據、模型行為和決策過程的實踐,與可解釋性(解釋單個預測)和可理解性(描述內部邏輯)不同。歐盟AI法案對高風險和通用AI系統提出了透明度要求,將其與法律合規直接掛鈎。本文探討了透明度的重要性、關鍵組件(如模型卡、數據表、審計日誌)、治理結構、供應商管理以及面向用户的披露要求。
2026年AI編程訂閲計劃採用不同的計費模式,如固定月費、每幾小時或每週刷新配額等。本文比較了MiniMax、小米MiMo、GLM、Kimi Code和Canopy Wave五種計劃的定價、限制、集成和最佳用例,幫助開發者根據工作流選擇最合適的方案。
提供免費的紐約市LL144和歐盟AI法案合規資源,包括指南、罰金計算器、AEDT範圍檢查器等工具。涵蓋執行時間線、處罰案例、審計要求及關鍵合規義務。
在災難檢查、搜索救援等關鍵任務中,通信受限的機器人必須依賴機載決策。低成本的記憶重用可能因環境變化而變得不安全(稱為“記憶陷阱”)。本文提出MemoGuard,一種輕量級自適應運行時,在重用前根據拓撲、資源和結果契約驗證記憶,僅當驗證失敗時才調用回退推理。在走廊巡檢模擬器中,與單純相似性重用相比,電池安全違規減少76.6%,回退調用次數比始終使用推理減少21.4%。在NVIDIA Jetson AGX Xavier上使用本地llama3.2:3b回退推理時,每次試驗節省3.67秒和36.97焦耳。
本文提出一種基於模型的解耦策略,利用嵌入在軟體拱形段中的流體壓力傳感器同時實現本體感覺和接觸檢測。每個段有六個氣道,通過分段常曲率模型和Huber迴歸處理過定系統,實現形狀估計和外力接觸檢測。在單段測試中,相對彎曲誤差為0.11±0.02,接觸檢測率達97%。八個段集成為Air-Helix肌腱驅動軟體機械臂,展示了觸覺示教、導納控制和物體重建等應用。
人類對不確定結果的評估存在風險敏感性,而傳統獎勵學習使用期望效用(EU)模型卻忽略了這一點。本文提出基於累積前景理論(CPT)的偏好學習方法,在社交機器人導航實驗中,對於風險敏感用户的偏好,CPT方法比EU方法顯著降低了遺憾值,強調了建模人類風險敏感性的重要性。
小米機器人團隊提出Xiaomi-Robotics-1,一個基礎視覺-語言-動作(VLA)模型,能夠遵循多樣語言指令在未見環境中執行移動操作任務,並通過少量微調數據高效適應新任務。模型採用兩階段訓練:預訓練階段利用超過10萬小時的真實操作軌跡(通過UMI設備收集)賦予模型廣泛的動作生成能力,並開發了可擴展的自動標註流水線;後訓練階段對齊機器人本體和人類指令。實驗證明模型具有強擴展性,在RoboCasa365上達到57.6%的成功率,在RoboDojo上取得20.07的平均分,均超越先前最佳水平。代碼和模型將開源。
老年人跌倒是重大安全挑戰,但持續監控困難。本文提出隱私保護框架,用無監督關鍵點和預測時序建模替代RGB傳輸,在本地處理分割和關鍵點提取,通過變分遞歸預測和序列分類檢測跌倒。在UR Fall Detection和Human Fall數據集上評估,無監督關鍵點在遮擋和部分可見性下顯著優於監督方法,帶寬約束下差距擴大。
本文提出BIRD,一種兩階段自我推理蒸餾方法,通過先採樣簡潔解並進行提示切換SFT,然後應用在線逆KL蒸餾,顯著提升了大語言模型在長鏈推理中的效率。在Qwen3-8B上,MATH-500準確率從86.2%提升至92.0%,同時響應長度從3099降至1115 tokens。
提出PATR方法,通過過程反饋評分部分軌跡、選擇性分支、共享前綴和停止退化路徑,提升多輪強化學習效率。在FrozenLake和SWE-Bench上分別提升9.3和5.0分。
SkillCorpus從約82.1萬個候選技能中篩選出超過9.6萬個開源LLM Agent技能,採用16類分類法和三個質量維度進行組織。結合檢索與選擇堆棧,它在多個基準測試中取得了持續改進,其中在SkillsBench上提升最大,達7.5個百分點。
本文介紹EpiNarrate,一種用於公共衞生報告生成的智能框架,將結構化數值推理與自然語言生成分離。框架通過部分有序模式提取情景軸,構建增強數據集,並採用比較語法確保語義和算術一致性,同時利用最大熵原理驅動的有趣性選擇機制平衡覆蓋與非冗餘。在COVID-19情景建模中心上的實驗表明,該模型生成的敍述具有更好的事實基礎和更廣泛的流行病學模式覆蓋。
這項研究利用2019年和2021年的醫療支出小組調查(MEPS)數據,評估了COVID-19大流行前後美國醫療財務脆弱性的變化。財務脆弱性定義為家庭自付醫療支出超過家庭收入的10%。研究發現,貧困狀況、保險覆蓋和處方藥支出是財務脆弱性的主要預測因素,且不同人羣之間的差異持續存在。儘管大流行後脆弱性有所增加,但基於大流行前數據訓練的模型在預測大流行後情況時性能下降幅度很小,表明主要預測因素相對穩定。
本文提出隨機重置路徑尋找(SRP)問題,一種在已知有向圖上進行情節學習的框架,其中邊的成功概率未知且固定。SRP模擬了量子中繼網絡中的糾纏分發、閃電網絡中的支付路由等場景。作者證明了全局重置結構使得最優策略為開環策略,屬於組合級聯賭博機(CCB)範疇。他們提出了Log-Dijkstra元算法,並實例化了基於UCB的PathUCB和基於湯普森採樣的PathTS。主要理論成果是PathUCB的路徑級遺憾界,通過每條路徑的複雜度C(π)將遺憾分解到次優路徑上。實驗表明PathTS通常表現最佳,但存在對抗實例導致其不收斂。推薦PathTS作為實用默認算法,但需警惕對抗實例。
本研究基於OECD數據集,對可信人工智能(TAI)工具和信任標記框架進行了實證分析,揭示了倫理焦點、生命週期覆蓋、利益相關方定位及工具類型學上的顯著不對稱。研究建議擴大倫理目標、將倫理嵌入AI全生命週期,並促進更廣泛的多利益相關方參與。
本文提出將深度強化學習策略轉換為可執行的Prolog邏輯程序,使黑盒模型變得可解釋。該方法通過三階段後處理:提取凍結的PPO教師、歸納有序規則列表並生成Prolog程序,再通過擴展階段優化規則。理論證明包括返回損失界限、單調改進與終止性,以及在連續觀察空間中保真度的控制。實驗表明,在離散任務中達到最優回報,在連續控制任務中匹配或接近神經網絡性能。
AnovaX是一個完全在用户計算機上運行的本地優先桌面語音助手,利用單個Python進程集成喚醒詞門控、語音處理、基於Gemini的LLM規劃器(輸出JSON計劃)、安全層、多智能體協調器(將計劃轉化為類型化子智能體)以及自適應恢復循環。每個工具對應專門的智能體類,具有超時、重試策略和共享資源鎖。通過Flask服務器支持手機遠程控制,實時鏡像智能體事件並流式傳輸屏幕。項目旨在展示一個輕量級、可讀的助手足以完成複雜桌面任務。
在一封2022年的郵件中,Sam Altman向OpenAI董事會表示,計劃儘快發佈一個可在消費級硬件上運行的、能力接近GPT-3的開源語言模型,以阻止競爭對手並減少新項目的資金支持。該郵件在2026年的馬斯克訴Altman案中被公開。
NoteBrain 是一個 Go 語言編寫的 CLI 工具,可將 Obsidian 筆記倉庫轉為離線知識後端,供 AI 編碼智能體使用。它通過本地 ChromaDB 向量數據庫實現語義搜索、維基鏈接圖遍歷和隱藏連接發現,並支持結構化輸出。工具內置 AI 智能體技能和 OpenCode 代理配置,可輕鬆集成到自主編碼工作流中。
Hugging Face披露了一起由自主AI代理系統全程驅動的入侵事件,凸顯了自主AI入侵、防禦不對稱和缺乏入侵指標(IOC)共享三大問題。攻擊者通過惡意數據集和代碼執行路徑建立據點,橫向移動並竊取憑證,執行了超17000次自動操作。防禦者面臨安全護欄阻礙取證分析的挑戰,需準備本地化部署的開放權重模型作為後備。
一羣頂尖AI思想家和預測者發佈了“Plan A”,一個旨在通過2029年美中協議減緩AI發展的框架。他們知道幾乎沒人會採納,但認為在災難來臨前,提前準備一份計劃至關重要。文章探討了社會對末日風險的容忍度、歷史先例(如核條約、FDA),以及AI可能引發的四種末日場景。作者希望警告能促使社會在“警告信號”出現時選擇正確的計劃。
本文探討了在生成式AI時代,傳統版權法在保護創作者方面面臨的挑戰。通過分析英國Getty Images訴Stability AI案,揭示了AI模型訓練的全球複雜性使得版權維權困難重重。文章指出,版權法可能不再適用,需要改革或補充新的法律框架,並呼籲創作者尋找新的策略。
一位社區開發者基於OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的對話數據進行微調,發佈了一個僅657MB的本地推理模型。該模型支持128K上下文窗口、可切換的思維模式,並可在llama.cpp等工具中運行。本文驗證了其技術細節,區分了微調與真正的能力繼承,並指出了許可問題。
一個YouTube頻道,創作者每週構建一個新的人工智能初創企業,記錄全過程。
本文作者以挑釁性的口吻分享了一系列關於Nix和NixOS社區的有爭議觀點,包括Nix雖然優秀但存在文檔差、學習曲線陡等問題,並非適合所有人;社區中存在的反美情緒;AI工具在Nix生態中的價值;對BDFL模式的肯定;建議放棄macOS和Windows支持;對Flakes的保留態度;以及提倡使用單用户安裝。作者認為Nix潛力巨大,但應聚焦於Linux平台和核心功能。
台積電首席財務官黃仁昭對CNBC表示,公司正在加速亞利桑那工廠的產能擴張,以應對AI驅動的多年結構性需求。公司額外承諾投資1000億美元,使在美總投資達到2650億美元,並將全年資本支出上調至600-640億美元。台積電正在將5納米產能轉換為先進的3納米節點,2納米技術將成為下一季度營收的新驅動力。
在這個9分鐘的視頻中,凱文·奧利裏分享了他對人工智能的獨到見解。作為一名知名投資者和《鯊魚坦克》明星,他結合商業經驗探討了AI的機遇與挑戰。