該影片演示了ReARM框架,旨在治理AI程式設計代理。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
谷歌宣佈對NotebookLM進行全面升級,採用Gemini 3.5模型,提升回答準確性和可靠性。使用者現在可以透過提問直接啟動研究專案,NotebookLM會利用Google搜尋查詢相關來源。此外,每個筆記本連線到安全的雲端計算機,支援編寫和執行程式碼,並能輸出多種檔案格式。該更新面向AI Ultra計劃使用者和Workspace客戶。
最新研究揭示,將文件編輯等任務委託給大型語言模型(LLM)時,模型可能會在互動過程中默默損壞文件內容。研究構建了DELEGATE-52基準測試,發現即使最先進的模型在20次互動後也會導致25%的內容損壞,原因包括錯誤累積、弱模型刪除與強模型幻覺、上下文過載以及領域熟悉度不足。代理式AI工具對此問題幫助有限。
本文介紹Nova Sonic測試框架,一個開源工具,可自動執行多輪對話、評估語音代理質量並檢測音訊幻覺。它支援快速迭代提示和工具配置,以及大規模迴歸測試。
本文透過案例研究展示瞭如何利用ScholarAPI獲取數百萬篇學術論文,構建高質量資料集並對大型語言模型進行微調,以打造專業領域AI助手。覆蓋了從資料收集、指令資料集生成、多模態增強到監督微調和檢索增強生成(RAG)的全流程。
本文是一組讀者來信。一位讀者批評在報道科技平臺負面影響時仍稱“社交媒體”,建議改稱“反社會媒體”。另一位讀者指出人工智慧雖能表現出關心,但缺乏真正的同理心。
波莉·克里德對一篇貶低母親工作重要性的文章中的引用提出異議,指出這種觀點無視了母親們作為專業人士和 unpaid 家務承擔者的巨大貢獻。
NudgeFile 是一款利用本地AI自動整理、重新命名和管理檔案的工具,注重隱私保護,可監控資料夾、自動化工作流程、檢測重複檔案,所有操作均在裝置本地完成。
AgentOps是自主AI代理在生產環境中的運維框架,涵蓋可觀測性、評估、成本治理、安全防護和持續改進五大支柱。本文介紹了AgentOps與傳統LLM監控的區別、工具生態系統、一個完整的工作程式碼示例,以及如何透過會話回放除錯代理故障。
人工智慧並未取代數學和理論物理學中的人類創造力,而是增強了它。AI能夠輔助證明檢查、反例搜尋和步驟建議,並在數學推理領域取得顯著進展。本文探討了AI在議程設定、思想形式化和猜想提出中的作用,並邀請研究人員積極採用AI工具。
許多企業員工在免費AI賬戶上執行工作任務,解決方法是透過管理者與員工合作選擇使用的工具。
RiskKernel是一個自託管的代理可靠性執行時,提供硬性成本、迴圈和時間預算,崩潰可恢復的檢查點,人工審批門控,以及自有的記憶體。它透過單一環境變數即可整合到現有代理中,防止無限迴圈和意外高額費用。
OpenEvidence是一個專為醫生設計的AI平臺,整合了NEJM、JAMA等頂級醫學期刊的內容,提供臨床決策支援。該平臺免費向美國醫療專業人士開放,並獲得了多家知名風投支援。
AI CostGuard是一個開源(MIT)的本地優先執行時安全層,專為AI代理設計,能在API呼叫執行前防止費用失控、迴圈、重試和預算超支。它包裝OpenAI相容客戶端和函式式SDK呼叫,本地估算請求成本,阻止預算超限,檢測重複提示,發出結構化事件,並提供CLI檢查和本地儀表板。
鎖定模式旨在防止攻擊者透過提示注入竊取你的個人資料,但會限制你對網路和部分功能的訪問。該模式現已向所有ChatGPT使用者開放,包括免費使用者。
SoulsOnly 是一種字型,它渲染出可讀的文本,但儲存的字元流是噪音,旨在阻止AI抓取。它透過將每個字元編碼為四個ASCII符號來實現,並附帶鍵盤韌體以輸入密文。該專案是宣告性的,並非絕對安全。
KPMG調查發現,僅有26%的公司對AI成本有完全可見性,許多公司因代幣計費模式面臨預算失控。
本指南全面介紹Claude Skills的概念、規劃、檔案結構、編寫方法、測試分發及故障排除,幫助使用者快速構建可複用的專業技能。
OpenAI近日向SEC秘密提交了S-1檔案,但尚未確定上市時間。
微軟AI執行長穆斯塔法·蘇萊曼在接受The Verge專訪時表示,超級智慧即將到來,但不會導致大規模失業。他詳細闡述了微軟與OpenAI合作關係的演變、新模型MAI-Thinking-1的釋出,並批評了Anthropic將Claude視為有意識的做法。蘇萊曼強調AI應以人類為中心,服務社會。
Multica 是一個開源平臺,將程式設計智慧體轉變為真正的團隊成員。您可以分配任務、跟蹤進度、積累技能,在同一個地方管理人類與智慧體員工隊伍。
AgentTrust ID 是一個開源授權平臺,為AI智慧體提供每次動作邊界的即時決策,包括細粒度許可權、可撤銷令牌、委託鏈和只讀會話。現已釋出生產版本,提供Python、Node.js、Go、Rust和Java SDK。
Intuned 是一個平臺,允許使用者透過自然語言描述需求,自動生成並部署 Playwright 程式碼,實現可靠的瀏覽器自動化。它支援爬蟲、抓取、RPA、AI 自動化等多種場景,提供內建防檢測、驗證碼解決、身份驗證、排程和自動擴充套件功能。還提供託管抓取服務和 Web Tasks API,後者可從自然語言指令執行瀏覽器任務,並支援學習最佳化。
OpenAI提升了ChatGPT的記憶功能,使其能根據聊天曆史構建使用者畫像。但測試顯示,該功能可能保留過時或錯誤的細節,導致未來答案失真。文章探討了技術細節、介面操作和隱私擔憂。
美國運通在2010年就開始將機器學習應用於欺詐檢測,如今已為幾乎所有員工提供AI工具,並在工程團隊中推廣AI輔助開發。其機器學習驅動的欺詐檢測系統每年監控超過1.2萬億美元的交易額,在毫秒內做出欺詐判定。公司正在探索70多個生成式AI用例,並透過Amex Ventures投資於信任與安全、企業效率和資料驅動體驗領域的初創公司。此外,運通還推出了代理商務(Agentic Commerce)開發工具包,為AI代理安全執行交易建立基礎設施。
作者在構建小型AI代理經濟模擬時發現,原本單一模型下會發生的市場崩盤,在換成五個不同實驗室的小模型後消失了。透過多次嘗試,作者意識到不能透過機械衝擊來控制異質代理群體的行為,而應在結算環節施加確定性覆蓋來獲得可靠結果。
谷歌與SpaceX達成價值300億美元的AI計算協議,這是SpaceX與競爭對手的第二項重大AI交易。
為了反抗AI生成藝術的超寫實主義,許多藝術家轉而擁抱不完美的手工風格。這一'反垃圾'運動是對AI不真實性的回應,可口可樂AI假日廣告的公眾反感凸顯了這一點。
雙支柱協議是一個針對AI時代軟體工程的成熟度模型,同時衡量個體認知能力(混音模式)和組織元軟體就緒度。它聲稱覆蓋了現有模型遺漏的18個特徵中的17個。本文介紹其背景、支柱以及參與診斷的方式。
Noren是一款由兩兄弟建立的AI工具,透過分析真實寫作樣本提取使用者的獨特寫作風格,並將其應用於AI生成的文本中,以對抗通用AI工具導致的同質化寫作問題。該工具生成結構化的個人聲音配置檔案,可與任何大型語言模型配合使用,保留寫作者的身份特徵。