Anthropic發佈了一篇全面的論文和兩個政策框架,呼籲對前沿模型進行具有約束力的審計,並將AI描繪為國家間戰略武器。CEO Dario Amodei以《指環王》的樹人比喻政治系統反應緩慢,警告AI能力呈指數級增長,可能在1-2年內出現“強大AI”。公司提出強制性第三方測試、披露要求和阻止風險模型權力,並制定了應對失業的層級計劃。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
NVIDIA GeForce NOW夏季促銷現已開啓,12個月Ultimate會員直降70美元,Performance會員優惠35美元。雲遊戲服務消除了硬件障礙,提供即時訪問高性能RTX遊戲的體驗,並支持多設備暢玩。此外,宣佈《激戰3》即將登陸平台,現有《激戰2》和《激戰:重製版》的獨家獎勵。
本文介紹如何利用Scikit-LLM和大型語言模型,無需標註數據即可實現多標籤文本分類。通過整合Groq提供的免費開源LLM,採用零樣本推理方式,並基於真實數據集go_emotions演示情感多標籤分類。步驟包括庫安裝、API配置、分類器初始化、數據集加載及預測執行,展示一條文本可同時獲得多個情感標籤。
谷歌DeepMind的分拆公司Isomorphic Labs利用其新型AI系統IsoDDE發現蛋白質上隱藏的藥物結合口袋,超越了AlphaFold。該系統成功預測了cereblon上的隱秘口袋,驗證了其發現新藥物靶點的能力。
Anthropic為其新AI模型Claude Fable 5內藏的隱形限制措施道歉,這些措施悄然削弱了研究人員和競爭對手使用該模型開發系統的能力。公司表示將撤銷此做法,並對何時啓動限制更加透明,即使這意味着Fable會拒絕更多查詢。
Viktor是一款自主AI員工,集成於Slack和Microsoft Teams,可連接3200+工具並自主執行任務,如管理廣告活動、構建應用、交付報告、編寫代碼。現已推出Teams版本,提供100美元免費額度。
Visa將支付基礎設施與ChatGPT連接,使AI代理能夠推薦零售產品並執行金融交易。該部署消除了零售漏斗最後階段的人工干預。自主代理現在可以處理用户提示、評估商家目錄,並通過Visa支付網絡在任何支持的商家完成結賬。
Warren是一款免費的AI財務規劃助手,通過與用户進行語音對話,在10分鐘內生成個性化財務計劃。新版本3.0具有更準確、透明的財務模型,支持用户編輯假設並查看兩種未來情景。已幫助3000多名英國用户規劃財務,解決財務規劃門檻高的問題。
討論代理型AI時代企業軟件的新範式:從記錄系統轉向行動系統。
本文是智能體工程系列文章的第八篇,探討AI智能體在複雜多步驟任務中面臨的上下文丟失問題。作者提出了外部化-識別-再水合(ERR)模式,通過將狀態保存到磁盤文件、檢測上下文退化、從文件恢復,幫助智能體自主應對上下文丟失。文章以歷史比喻(640K內存限制)和實際案例(Copilot會話崩潰)説明問題,並詳細介紹了執行連續性和任務連續性兩層狀態的外部化方法。
Xebia全球CTO Niels Zeilemaker強調,AI代理的成功依賴於堅實的數據基礎,包括數據目錄的正確性。Xebia的Agentic Data Foundation(ADF)和ACE框架幫助企業加速AI採用,同時保持治理和質量。
JetBrains 發佈了 Mellum,一系列快速語言模型,專為超低延遲和高性能推理而設計。該模型家族旨在提升開發效率,作為 JetBrains 智能開發工具套件的一部分。
我們聽到的關於人工智能的一切都相互矛盾,且無法迴避。AI既可怕又美妙,既可能摧毀世界也能變革未來。有人呼籲必須擁抱它,也有人認為不使用它是一種道德義務。文章指出,AI絕對主義——無論是極端樂觀還是極端悲觀——都在扭曲我們的思考,而真正的未來並非如此單一。
本文指出,雖然AI高管宣稱效率提升將讓人們迴歸健康生活,但歷史經驗表明節省勞力的技術很少促進健康習慣。過去的便利(如外賣、微波爐、自動扶梯)悄悄減少了我們的身體活動,長期損害健康。
Nous Research 為其開源自改進代理 Hermes Agent 推出了個人資料構建器,該構建器集成在本地 Web 儀表板中,將原先需要多個 CLI 步驟的代理設置流程簡化為一個引導式界面,支持定義身份、選擇模型和提供商、啓用技能、安裝中心技能以及附加 MCP 服務器,並生成隔離的個人資料目錄。
在本次專訪中,AAAI會士Tanya Berger-Wolf分享了她在人工智能與生態學交叉領域的開創性工作,包括開發生命之樹基礎模型BioCLIP,該模型在物種分類、新性狀發現以及實際應用(如通過圖像識別蜱蟲)方面取得了顯著成果,並展望了AI驅動的科學發現未來。
隨着企業通過收購快速擴張以及AI代理消費模式的興起,傳統的數據產品模式變得笨重。Howden集團首席數據官Barry Panayi主張轉向數據服務層,將數據治理和質量檢查左移,減少洞察延遲,並採用統一的數據模型和會話式分析,以應對更快的業務節奏。
Cohere 發佈了其首個面向開發者的編碼模型 North Mini Code。這是一款 30B 總參數、3B 活躍參數的混合專家模型,可在單張 H100 GPU 上運行,支持 256K 上下文長度。模型專注於代碼生成、智能體軟件工程和終端任務,權重採用 Apache 2.0 許可發佈。
SmithDB支持對代理追蹤進行全文搜索和JSON過濾,中位延遲僅為400毫秒,儘管底層數據是存儲在對象存儲中的大型嵌套JSON文檔。本文詳細介紹了為對象存儲和大型代理追蹤負載量身定製的倒排索引設計,包括面臨的獨特挑戰(大型負載、Zipfian分佈、多種查詢模式、對象存儲約束)、為何不採用Tantivy,以及兩次設計迭代的經驗教訓。
大多數AI代理工具運行在服務器上,限制了瀏覽器API、設備功能和前端狀態的訪問。瞭解LangChain的無頭工具如何為現代代理應用啓用安全的客户端工具執行。
Anthropic撤銷了一項會暗中損害AI研究人員的政策,但另一個爭議點仍然存在。
Deezer現在可以掃描用户在其他流媒體平台上的播放列表,以檢測AI生成的音樂。Deezer是首個開始標記AI音樂的大型流媒體服務,也曾向其他平台提供技術,但似乎買家不多。現在,Deezer直接向大眾推出檢測工具,支持20個平台。
Synopsule是一款運行在Mac和iPhone上的本地AI會議轉錄工具,使用Whisper模型在設備端完成錄音、轉錄和説話人識別,無需上傳音頻或創建賬户。一次購買僅需1.99美元。
AEVS是一款可嵌入的SDK,能夠記錄AI代理的每一次工具調用並生成防篡改的執行收據,幫助團隊在不依賴聊天記錄或脆弱日誌的情況下驗證代理實際執行的操作。
asyncinject 0.7 發佈,這是一個支持 asyncio 依賴注入的 Python 庫。作者在 Datasette 中使用該庫時,由 Claude Fable 5 發現了依賴中的幾個 bug 並自動修復。
Cloudskill 是一個管理 AI 技能的平台,將分散的技能文件轉換為帶有版本控制、訪問策略和完整審計日誌的託管目錄。它支持 Claude、Cursor、Copilot 等 AI 代理,確保技能創建和更新經過審查和批准,從而保證團隊依賴的技能安全、一致且可管理。
Anthropic在強烈抗議後改變了Claude Fable 5的安全措施,使其對前沿LLM開發的限制變得可見。此前,該模型會在用户不知情的情況下降低請求的有效性。現在,被標記的請求將明顯回退到Opus 4.8,API請求會返回拒絕原因。
本文回顧了Sarah Guo關於開放模型、模型實驗室與代理實驗室區別的深刻文章,並涵蓋了Anthropic的Fable/Mythos模型因靜默降級能力引發的信任危機、Fable 5在基準測試中的強勁表現、Google的DiffusionGemma發佈、代理工具與基準的進展,以及優化和科學建模領域的技術動態。
本文通過數據和案例分析,反駁了AI將導致軟件工程師大規模失業的敍事。作者指出,所謂的AI驅動的裁員往往是財務壓力下的“AI洗白”,而實際的就業數據表明,AI只是壓縮了“執行”層,但“決策”和“交付”層仍需要人類深度參與。文章提出了“決定-執行-交付三明治”模型,並認為這些瓶頸不會因AI能力提升而消失。
前沿團隊不僅利用AI加速編碼,更從根本上重新設計軟件構建方式,實現了4.5倍乃至超過10倍的生產力提升。本文通過亞馬遜Bedrock、Prime Video等團隊的案例,揭示了成為前沿團隊的五個關鍵實踐,並指出工作流程的變革比工具本身更重要。