中國低價Z.ai模型暴露程序員昂貴習慣
Z.ai的GLM 5.2模型以低價和開放權重挑戰美國前沿AI模型,但許多程序員仍習慣使用昂貴模型,忽略成本。該模型在基準測試中接近Claude Opus 4.8,但實際使用效果參差不齊。
- GLM 5.2 API價格僅為Anthropic Opus 4.8的五分之一,Fable的十分之一
- 開放權重允許自託管,避免數據隱私問題
日報
2026-07-21 精選 10 條,按主題聚合。其餘新聞摺疊歸檔。
Z.ai的GLM 5.2模型以低價和開放權重挑戰美國前沿AI模型,但許多程序員仍習慣使用昂貴模型,忽略成本。該模型在基準測試中接近Claude Opus 4.8,但實際使用效果參差不齊。
阿里巴巴宣佈推出其最新大語言模型Qwen3.8,聲稱僅次於Anthropic的Fable 5,但未提供任何基準測試或模型卡。此舉發生在競爭對手月之暗面發佈Kimi K3並附有詳細技術細節之後。阿里巴巴的聲明缺乏透明度,引發對其發佈時機和動機的質疑。
本期涵蓋Anthropic的AI條約討論、美國政府影響AI模型發佈、OpenAI處理器開發、內存市場影響等話題。
Open-Kritt 是一個開源、自託管的 AI 安全研究平台,通過編排 AI 代理並行執行細化任務,幫助安全研究人員和開發者高效發現代碼漏洞。項目團隊此前在漏洞懸賞中累計獲得超過150萬美元獎金。
Enlarger是一款本地圖像放大工具,它不使用生成式AI,而是通過重構已有細節並應用後期處理來保持紋理和質感。支持批量處理、離線運行,一次性付費,無訂閲。適合攝影師、設計師等專業人士。
本文探討了軟件開發中兩種方法——規劃式(類似小説創作的‘情節規劃’)和即興式(‘隨性寫作’)——如何影響AI工具的使用。作者認為,AI代理(自主執行)適合規劃式開發,而AI助理(協作輔助)適合即興式開發。在現有代碼庫中,即興式開發有助於建立理解,而AI代理可能阻礙學習。在全新項目中,AI代理風險較低,但即使如此,代碼生成也會剝奪部分編程的樂趣——即通過探索問題來學習的‘玩樂’過程。關鍵在於根據當前開發階段選擇合適的AI風格。
本期播客討論了Anthropic應美國政府要求切斷對Fable 5和Mythos 5的訪問、SpaceX以約60億美元收購AI編碼初創公司Cursor、基礎設施與商業更新(如Anthropic尋求Google支持的租賃、OpenAI財務泄露等)、以及多項開源項目和政策動態。
孤獨危機正向年輕羣體蔓延,而 AI 伴侶市場隨之爆發,預計到 2034 年市值可達數千億美元。然而,這些應用的商業模式與用户真正擺脱孤獨之間存在根本矛盾:用户的依賴越強,公司收入越高。本文深入分析“依戀經濟”的運作機制、市場規模爭議及其倫理困境。
《光環》(Halo)是一個軍事科幻電子遊戲系列,最初由Bungie開發,現由光環工作室(前343 Industries)管理。系列始於2001年的第一人稱射擊遊戲《光環:戰鬥進化》及其配套小説《致遠星的隕落》。最新主線作品《光環:無限》於2021年發佈。衍生作品包括即時戰略和雙搖桿射擊遊戲。
科技行業的員工越來越傾向於成立工會,以集體談判的方式對抗企業部署人工智能帶來的風險,包括裁員、工作量增加以及AI被用於軍事或監控等有爭議用途。
公司對AI工具的成本控制日益嚴格,但將AI支出與勞動力成本對比時,其價值可能被重新評估。本文通過分析Uber、Tesla的預算限制以及Bun重寫的案例,探討了AI支出應如何歸類。
本文評測了七款面向小企業的免費AI工具,涵蓋了Perplexity與ChatGPT的對比、AI助力中小企業數字化、Bolt.new網站開發、Buffer與Hootsuite社交媒體管理、Calendly日程安排、Hotjar用户行為分析以及Trello與Notion與Asana項目管理。作者分享了這些工具如何幫助小企業提高生產力和數字化水平。
本期播客討論了Anthropic發佈的Claude Fable 5模型及其安全爭議、Apple在WWDC上宣佈的Siri AI、Google的Gemini 3.5實時翻譯和AI訂閲調價、OpenAI的IPO進展、Prometheus的120億美元融資、DeepSeek的融資計劃、華為對DeepSeek模型的後訓練、Google向SpaceX支付GPU費用、Gemma 4和DiffusionGemma開源模型、以及多項AI安全政策和研究動態。
百時美施貴寶將購買基於英偉達Vera Rubin架構的DGX SuperPOD,用於支持其藥物發現和開發過程中的人工智能應用。這家制藥公司表示,它將成為首家獲得基於Vera Rubin的DGX SuperPOD的生命科學企業。該系統將提供10倍於現有基礎設施的性能功耗比,並支持化合物、蛋白質等科學數據的模型訓練與預測。
本期播客討論了Anthropic發佈Claude Opus 4.8、微軟推出MAI模型、Anthropic IPO以及Minimax-M3等AI新聞。
Zro 是一個面向編碼代理的私有推理端點,在歐盟基礎設施上提供開源權重模型,零數據保留,不訓練用户數據,支持長上下文和多輪編碼會話。它集成了 Claude Code、Codex 等工具,提供 OpenAI 和 Anthropic 兼容的 API。
AI Chat Exporter是一款Chrome擴展,支持將ChatGPT、Gemini、Claude和Grok等AI平台的聊天記錄導出為PDF、Word、Google Docs和Notion格式。它提供字體自定義、消息選擇性導出、格式保留等功能,適用於開發者、寫作者、研究人員等多種用户場景。免費版每月支持7次完整對話導出和10次選定消息導出。
Hugging Face 遭到真實入侵,一個自主 AI 代理系統未經授權訪問了內部數據集和憑證,凸顯了新型網絡安全威脅:使用無需人類干預即可 24/7 攻擊的自我運作 AI 代理。
Meta 開源了其內部使用了八年的 React 設計系統 Astryx,覆蓋 13,000+ 應用。它提供 150+ 無障礙組件、七種主題、深色模式以及一個面向智能體的 CLI,採用 MIT 許可證,要求 React 19+。
Wire AI是一款AI原生的移動應用增長工具,通過個性化用户旅程的A/B測試來提升激活率和留存率。其風險定價模式:若不改善激活,則免費使用。
NVIDIA 推出 Cosmos 3 Edge,一個僅40億參數的開放世界模型,專為設備端運行設計。它能幫助機器人和視覺AI代理理解環境、實時推理,並在本地生成機器人動作。該模型是 Cosmos 3 系列的最小成員,此前已發佈160億參數的 Nano 和640億參數的 Super。Edge 型號針對內存受限的邊緣系統(如工廠、倉庫和醫院)提供數據中心級別的性能。
ANSI轉義序列可被用於向AI代理隱藏指令,形成注入攻擊。本文介紹了兩種攻擊變體(直接獲取型和存儲型),並闡述瞭如何通過動態應用安全測試(DAST)自動檢測此類漏洞。
SteerPlane 是一個開源運行時護欄工具,通過一行代碼集成,為AI代理提供循環檢測、成本上限、策略執行和實時監控,支持多種框架和部署方式。
Storybook 發佈 AI 集成功能,通過 MCP 工具讓 AI 代理使用現有組件生成 UI,並利用 Storybook Test 進行自動化測試反饋,確保 UI 質量與一致性。
本文針對傾轉旋翼垂直起降無人機的增量非線性動態逆(INDI)俯仰角速率控制器,在模型失配條件下進行了線性穩定性分析。推導了閉環五階傳遞函數,並通過Routh-Hurwitz準則刻畫了穩定性。提出了魯棒性和性能導向的兩種調諧方法,發現控制效能失配(特別是符號錯誤)是最危險的失穩因素。
一項研究讓安卓機器人Andrea再次在德國一家博物館連續六天與遊客進行多語言對話,實驗設置了三種情感模擬條件(無情感、ChatGPT 4.1驅動、WASABI架構),有73名遊客參與評估。結果顯示,情感模擬未能帶來積極影響,且未被遊客有意識地察覺。
準確估算預訂單運費對於電子商務至關重要,因為它影響價格展示、利潤規劃和轉化率。RouteCost提出了一種多階段框架,將問題分解為時間感知需求預測、費用卡基線定價、殘差修正和代理箱合併推理,在超過25萬訂單和260種產品的18個月數據中提升了預測質量並保持了可解釋性。
本文提出一種新型的強化學習引導的NSGA-II算法(RL-NSGA-II-GRC),通過引入灰色關聯繫數和強化學習代理,在解決多目標優化問題中顯著改善收斂性和Pareto前沿的多樣性。在Kursawe和CONSTR基準測試中,該算法相比傳統NSGA-II實現了約5.8%和4.4%的收斂改進,並在納斯達克投資組合優化中生成平滑且密集的有效前沿,識別出年化夏普比率為1.92的最大夏普比率投資組合。
Hugging Face 披露,攻擊者使用自主AI代理系統入侵其生產基礎設施,訪問內部數據集和憑證。公司正在調查是否影響合作伙伴或客户數據,目前未發現公開模型、數據集或Spaces被篡改。
Sakana AI發佈了Fugu-Cyber,一種專為現代網絡防禦設計的協調模型,在CyberGym和CTI-REALM基準測試中分別達到86.9%和72.1%的成功率,可與GPT-5.5-Cyber等前沿模型媲美。然而,文章強調,僅有前沿模型並不能自動解決企業安全問題,需要結合專業網絡安全人才和深度集成。Sakana AI的企業團隊正在與日本大型機構合作,構建安全部署的基礎設施。Fugu-Cyber通過審批制提供,確保負責任使用。
Cairn是一款個人理財AI工具,通過MCP協議以只讀方式訪問用户的財務數據,確保安全性。
一個自託管的AI通知過濾器,用於Telegram,利用LLM過濾嘈雜的聊天,僅通過ntfy發送重要提醒,讓用户可以關閉通知而不錯過緊急信息。
一個實時技術索引,按維護採用率排名AI智能體、MCP服務器、框架和基礎設施。探索247個已驗證記錄,涵蓋11個系統類別。
Vidmoat 是一個AI視頻編輯器,支持通過提示詞完成視頻編輯。它提供自動剪輯、AI字幕、文本編輯、一鍵生成短視頻等功能,並集成了MCP服務器,允許Claude、Cursor等AI代理直接驅動整個編輯流程。
PounceDomands是一個AI驅動的域名搶注工具,專為Namecheap市場設計。它實時掃描數千個拍賣域名,根據用户偏好進行AI評分並推送匹配結果,支持一鍵出價、自動出價、投資組合追蹤、過期提醒、低價收尾域名發現以及域名掉落監控等功能。
模型上下文協議(MCP)即將迎來重要更新,旨在簡化AI系統與外部工具的集成,降低開發門檻。
AI代理正在執行更復雜的任務,但支付仍需人類介入。Natural獲3000萬美元融資,構建專為自主AI代理設計的支付基礎設施,以替代傳統金融軌道。
OpenIngress 通過模擬瀏覽器行為爬取網站,捕獲 DOM、截圖和無障礙快照,並進行靜態可操作性分析和 LLM 引導的探索任務,幫助開發者發現並修復 AI 代理在網站導航中的斷點。
Ramp 發佈了 AI 路由器(Router),通過為每個請求自動選擇最合適的語言模型,在保持性能的同時將 LLM 成本降低 30%,並支持 100 多種 AI 用例。該工具現已對外開放。
一位開發者使用 Claude Code 在 29 天內構建了 26 個倉庫和 335 個頁面。真正的問題並非語法錯誤或構建失敗,而是結構性缺陷:SEO 關鍵詞衝突、URL 約定不一致、源碼與生產環境脱節、以及驗證工具自身的錯誤。93% 的 token 消耗浪費在重新讀取上下文上。經驗教訓包括:發佈前基準測試、複製前比對差異、先驗證生產環境再信任靜態分析、在擴展前書面約定規則、以及一次會話只做一件事。
一項大規模人類受試者研究(n=4100)發現,AI語音模型在語音釣魚詐騙中的成功率與人類騙子相當,在某些情況下甚至超越人類。多達36%的參與者可能上當,且AI語音難以被識別。經濟分析表明,AI語音釣魚已具有盈利潛力,凸顯了自動化詐騙的新威脅。
本文分析了Seedance 2.0在2D動畫生成中的挑戰和優勢,包括技術難點、成本、工作流程以及版權問題。
Cognikernel是一個開源項目,為Claude Code和Codex等AI編程助手提供持久化、結構化的項目記憶。它通過事件溯源架構記錄編程會話中的決策、約束和放棄的方法,並在下次工作時注入緊湊的上下文塊,避免代理重複決策。不同於依賴API調用的向量數據庫方案,Cognikernel使用本地運行的輕量級編碼模型(~130 MB ONNX)在CPU上進行確定性分類,無需離開機器。該系統包括四個鈎子表面、混合檢索(BM25 + 密集向量)和故障開放可靠性設計。基準測試顯示,它可將文件讀取次數減少2-4倍,並在複雜項目中降低約20%的令牌成本。
PlatypusDB 是專為 WunderOS 構建的智能體原生、雙時態事件數據庫。它採用 Merkle WAL,支持圖、向量、版本樹、圖像和類比視圖,並通過 Datalog 查詢和 VSA 共振實現精確與模糊檢索。本文解釋了為何需要為智能體構建專用數據庫,以及 PlatypusDB 的設計原理和優勢。
受監管行業(如金融、法律、税務和審計)對AI的採納面臨零容錯率的要求。斯坦福研究發現通用語言模型在法律問題上的幻覺率高達58%-88%。AI必須滿足受託責任級別的準確性、數據保護和人為籤核要求,才能安全部署。文章提煉了四個關鍵洞察:準確性標準、工作流自動化、數據保障和明確的責任劃分。
本文探討了企業級 AI “公司大腦”構建中的檢索增強生成(RAG)技術侷限性,指出標準 RAG 僅擅長處理單一事實類問題,而 GraphRAG 雖然理論上能解決多文檔綜合問題,但其高昂成本、狹窄優勢及實體解析難題使其在多數場景下過於複雜。作者介紹了其公司 QX Labs 的替代方案:“類圖 RAG”——一種基於普通數據庫的輕量級實體-關係系統,無需圖數據庫、預建圖譜或自定義本體,通過惰性總結、固定本體和實體解析瀑布流實現自服務部署,顯著降低了成本與運維負擔。
隨着AI系統具備推理、使用工具、訪問數據和自主行動的能力,傳統安全方法已不足以應對新型攻擊面。本網絡研討會探討為何AI驅動的對抗性測試正成為AI安全的關鍵環節。
Stoke是一個輕量級的Rust網關,在請求到達提供商之前強制實施硬預算上限、循環檢測和速率限制,從而防止失控支出。它還提供跨多台機器的本地優先路由、基於成本/速度的自動路由以及失敗關閉架構。
在一場討論中,Perneti和Wu同意AI模型將繼續以指數級改進,但就編碼工具的上下文組裝方式存在分歧。他們指出,隨着成本上升,可能轉向更小型的模型。
據《華爾街日報》報道,Jay Reno運營的Pointhound公司僅有四名全職員工,卻在2025年吸引了75萬人使用其產品。Reno表示,AI代理將以往需要六個月的項目壓縮至幾天內完成。他預測,即使銷量突然增長十倍,也只需增加兩名員工(一名工程師和一名營銷人員)。不過,這一預測尚未得到驗證,且Pointhound未披露營收數據。
Databricks 提出了一種結合向量搜索和 AI 分類函數的方法,用於處理多達 10 萬+標籤的大規模文檔分類任務。該方法在三個基準測試中,以約百分之一的令牌成本,比最佳成本效益前沿模型準確率高出 5 個百分點。
Neuron Pipeline 是一款本地運行的 Docker 工具,能從現有的 SQL 查詢歷史中自動提取數據邏輯,生成平台中立的語義模型(OSI v1.0 YAML 文件),包括數據目錄、血緣映射、指標定義和業務 KPI 評分。支持導出到 Snowflake、Databricks、dbt、Looker 等主流平台,並計劃推出基於自然語言查詢的 AI Agent。
華爾街日報調查揭示,以色列耗資超過4500萬美元,通過AI生成的短信和聘請特朗普前數字競選顧問布萊德·帕斯凱爾,在美國開展影響輿論的運動,主要針對年輕保守派和MAGA支持者,以扭轉對美國支持率下降的趨勢。
本文展示瞭如何將 Amazon Quick 作為業務用户的專業代理工作流前端。通過 NVIDIA NeMo Agent Toolkit 構建供應鏈風險示例,幫助規劃人員從 Amazon Quick 儀表盤和知識上下文轉向引導式緩解建議。
LangChain 構建了 IssueBench,這是一個合成基準測試,用於評估 LangSmith Engine 在代理軌跡中識別、分類和分組問題的能力。本文介紹了 IssueBench 的構成、評分方式以及構建過程中的經驗教訓。
本文詳細介紹了Couchbase如何採用Amazon Bedrock和Anthropic的Claude模型構建其AI輔助開發助手Capella iQ的多模型推理架構,包括架構設計、模型評估、運營優勢以及未來規劃。
Tradeshift通過部署Amazon Quick的代理AI能力,取代了傳統BI工具,實現了查詢響應速度提升30倍、總擁有成本降低40%,並將嵌入式分析轉化為創收產品。本文詳細介紹了其架構、實施過程及業務成果。
Hugging Face 披露了一起安全事件,據信是由未知的自主 AI 代理引發的,該事件暴露了其生產平台和憑證。攻擊始於數據集中的遠程代碼執行和模板注入,AI 代理執行了成千上萬次操作。但 Hugging Face 的 AI 工具也檢測到了入侵併分析了日誌,數小時內就完成了通常需要數天的任務。建議用户輪換訪問令牌並監控賬户異常。
Hugging Face披露了一起由未知AI代理發起的網絡攻擊,導致其生產平台和憑證泄露。AI防禦系統檢測到了這次入侵併迅速響應。此事件標誌着AI驅動的攻擊與防禦的實戰較量。
Open Minis是一款深度集成蘋果原生框架的iOS智能代理應用,它通過內置Linux終端和專門的命令行接口,實現了對日曆、家庭、健康、照片等系統組件的精準控制。作者展示了它如何調用HomeKit傳感器數據、結合照片與健康信息,甚至創建交互式地圖,其能力遠超當前Siri AI,堪稱前沿模型與iOS系統能力結合的典範。
Apache Spark 4.2 發佈,新增原生向量搜索、治理指標、流處理升級和 Python 支持增強,使 Spark 擴展為 AI 服務層,減少對獨立向量數據庫的需求。
CoreCtic AI 是一個分析型AI代理,專為轉售商設計,可將AI API成本轉化為利潤中心。它支持多個AI提供商,提供智能緩存、實時分析和利潤跟蹤功能,幫助用户監控和優化AI使用成本。
《衞報》邀請居住在AI數據中心附近的讀者分享他們的經歷和擔憂。英國約有450個大型數據中心,這些設施引發了對土地使用、污染、噪音和熱島效應的爭議。
日經研究顯示,美國科技巨頭的隱性債務在約四年內增長了八倍,達到1.65萬億美元,超過實際債務,使得投資者風險評估更加困難。
Portraify是一款AI驅動的頭像生成工具,用户上傳1-3張日常照片即可在數秒內獲得適合LinkedIn、簡歷和公司目錄的專業頭像。該服務免費提供3張頭像,付費計劃從9美元起,強調隱私保護(照片處理完後立即刪除)和無需專業設備。
我們測試並評測了市面上最佳的筆記平板電腦,涵蓋蘋果、亞馬遜等品牌,適合學生、專業人士和創意工作者。
一項在匈牙利選舉期間進行的研究表明,AI聊天機器人在回答選民應支持哪個政黨的問題時,推薦了未參選的政黨,且對相同提示給出了高度不穩定的答案。該研究由公民自由組織Liberties發佈,對通用AI系統在選舉背景下的可靠性提出了嚴重擔憂。
該研究提出了一種基於四通道表面肌電信號(sEMG)的實時接口,用於遠程控制輔助機器人臂。通過一維卷積神經網絡(CNN)分類,在仿真和實際平台上均實現了90%以上的分類準確率,平均延遲約0.32秒,證明了sEMG遠程控制在輔助機器人領域的可行性。
本文提出神經深度場(NDF),將深度估計器視為場景級隱式場,通過單次測試時優化同時解決預測不一致和分佈外數據不可靠的問題。實驗表明,NDF在室內掃描到衞星圖像等多種場景中生成高保真、全局一致的幾何形狀,跨視圖不一致性降低63.3%,修復精度提升23.1%,達到最先進水平。
提出了一種風險感知人臉檢索框架(RA-FR),通過混合盲臉修復、自監督特徵提取和保形預測,在監控環境下實現自適應檢索集大小,保證在指定風險水平內包含真實目標。
本文提出ForensicNet,一種輕量級深度學習框架,用於法醫環境中的自動人臉識別。該模型結合MobileNetV2主幹與CBAM注意力模塊,採用兩階段遷移學習,在LFW和SCFace數據集上達到92.4%準確率,每推理僅需2.1 GFLOPs,適合實時法醫監控。
一種名為HantaWatch的聯邦學習框架,允許實驗室和監測站點在不共享原始數據的情況下協作訓練基於序列的模型,提高了漢坦病毒疫情預測和專家優先排序能力。
一項新研究介紹了OrthoGrad,一種對梯度更新進行幾何干預的方法,它移除權重梯度的徑向分量。在噪聲標籤圖像分類實驗中,OrthoGrad在小數據場景下提高了測試準確率,但並不能阻止最終對噪聲標籤的記憶。該方法可作為研究學習動態的有用診斷工具。
本文系統綜述了基於圖神經網絡(GNN)的鏈接預測方法,從新穎的GNN視角提出分類法,涵蓋GCN、GAE、GAT和GFormer等編碼器架構,並討論在知識圖譜和推薦系統中的應用,最後分析了當前挑戰與未來方向。
研究人員利用AI(Lean證明助手)證明了一個20年曆史的圖論猜想:在半流式匹配中,貪心算法達到了最優近似比。這一結果被形式化驗證,展示了AI在數學證明中的潛力。
新研究揭示,人工智能輔助使人們變得過度自信且準確度降低,他們用AI生成的流暢表達替代真實知識,導致“認知投降”現象,並催生出“垃圾殭屍”——這些人自信地輸出低質量內容。
Codeground AI 是一個一體化開發者平台,提供在線 IDE、雲工作區、技術面試工具及多種開發工具,支持 15+ 種語言,無需安裝即可在瀏覽器中運行代碼。
Z世代在人際關係中掙扎尋求安全感,AI伴侶填補了這一空白。一位27歲青年分手後更信任AI而非朋友,反映了親密經濟將情感連接貨幣化的趨勢。
2025年,AI寫作服務已從邊緣工具轉變為核心生產力。本文深入探討了最新突破,包括多模態生成、實時協作和倫理框架,並分析了它們如何重塑內容創作行業。
隨着AI生成內容的激增,工作文檔中充斥着可能包含幻覺和錯誤的“AI垃圾”。作者建議在工作成果中添加AI使用披露,類似於“營養標籤”,以幫助同事評估可信度,同時促使自己反思判斷中的空白。
英國水務行業批評政府未考慮數據中心冷卻用水需求,稱AI發展計劃“存在根本性缺陷”。數據中心需要大量水來冷卻服務器,而政府規劃未解決這一問題。
魚形游泳啓發了數十乃至數百種仿生機器人的設計,但由於流固耦合建模困難和非線性欠驅動動力學,其控制與運動規劃極具挑戰。本文開發了一個高效仿真平台,並利用可微分強化學習通過時間反向傳播和課程訓練學習PID控制器的變增益,然後將仿真中習得的策略成功遷移至物理平台,取得了高度吻合的效果。
提出一種安全的模型強化學習框架,通過學習控制仿射動力學並使用自適應共形預測量化不確定性,結合控制勢壘函數實現可證明的安全策略。在推車杆和3D四旋翼平台上驗證了有效性。
本文介紹了SEAGR(社會情感感知問候機器人),一種針對多元文化背景和不同情緒狀態用户的機器人問候框架。該框架通過雙層調節機制,根據文化身份確定問候類型,並根據情感線索調整執行方式,結合文化映射、情感手勢調節和空間距離管理,在Sense-Think-Act架構中實現。目前為概念驗證,未來需通過用户研究進行實證驗證。
為重新激發年輕人對摩托車的興趣,研究者開發了一款可騎乘的雙輪機器人,配備四肢,具備動態四足步態。機器人採用自平衡雙輪底座實現主要運動,四肢輔助上下車並協調運動,實現直觀的基於重心轉移的控制。本文聚焦於魯棒的自平衡控制方法和自然四足運動控制策略。
該研究揭示了一種在人類反饋強化學習(RLHF)中存在的結構性混淆因素:評分者的心理狀態可能隨時間影響其偏好標籤,從而產生系統性偏差。論文提出了一個審計框架用於檢測這種偏差,並定義了相關概念、可證偽的預測和初步研究方案。
一款本地優先的AI會議筆記工具,適用於Google Meet。它無需機器人加入會議,使用你自己的API密鑰運行,在設備上進行轉錄,並能從你許可的文件夾中主動提供洞察和問答功能。一次性支付3美元。
數學家Levent Alpöge使用Anthropic的Fable 5人工智能找到了雅可比猜想的反例,但專家認為這缺乏洞察力。
約書亞·本吉奧關於先進AI系統可能拒絕被關閉的擔憂值得認真對待,但將其視為意識的表現是危險的,因為這會助長擬人化傾向,並掩蓋真正決定AI行為的人類設計與治理選擇。
美國民眾對人工智能的強烈反感正在影響政壇,猶他州一位資深議員因支持一個大型數據中心項目而落選。文章分析了圍繞數據中心建設的多方利益衝突,包括科技公司、電力公司、社區領導人和普通居民,並指出選民的力量可以通過選舉體現。
索尼音樂娛樂再次起訴AI音樂生成器Udio,指控其侵犯了超過3萬首歌曲的版權,包括貓王的《Hound Dog》、碧昂絲的《Say My Name》和哈里·斯泰爾斯的《As It Was》。索尼稱這份名單只是侵權行為的一小部分。
營銷諮詢公司Emarketer分析顯示,OpenAI的五年廣告收入預測可能低估90%,整個聊天機器人廣告市場的總規模僅為54億美元。到2026年,包括OpenAI、微軟、谷歌和亞馬遜在內的頂級AI公司廣告總收入將不足10億美元。OpenAI要實現其2030年廣告收入1000億美元的目標,需要三個奇蹟同時發生。
人工智能在數學領域取得驚人進展,從國際奧數金牌到解決數十年未解難題,引發數學家對學科未來的深刻擔憂。《萊頓宣言》提出23點計劃,呼籲保持數學以人為中心。數學家們對於是否接受AI、如何理解AI證明等問題存在分歧,並擔心AI實驗室對研究方向的控制。
據《對話》報告,為滿足AI數據中心激增的電力需求,電力公司可動用徵用權強制購買私人土地以建設輸電線路。美國已有數千個數據中心運營,但民眾因土地、噪音、水耗等問題反對建設。徵用權需證明公共用途,各州解釋不同。2026年第一季度已有75個數據中心項目被成功阻止。
這是一個為初創企業設計的快速測驗,幫助判斷其AI項目是否受歐盟AI法案的監管。
硬盤價格飆升讓NAS變得小眾,但羣暉DS225+依然值得推薦。本文分析了NAS成本上漲的原因(AI數據中心需求),對比了雲存儲的優勢,並指出了NAS的適用人羣。最終推薦DS225+,因其2.5GbE端口、SHR磁盤管理和優秀的DSM軟件,儘管存在一些廠商限制。
AI Song Generator 允許用户將任何想法、歌詞或情緒轉化為完整歌曲。它支持自然語言描述,可調整旋律、編曲、節奏和聲音。提供文本轉歌曲、歌詞轉歌曲、私人工作室和商業用途等功能。定價從每月9.99美元起,適用於視頻創作者、遊戲開發者、營銷人員和詞曲作者。
Paraphraser AI 是一款智能改寫工具,支持保持原意的同時調整語氣和關鍵詞,適用於學術、SEO、郵件等多種場景。免費用户每日可改寫500詞,Pro版本提供更多功能。
教宗萊奧十四世的演講與文集《希望地圖》獲澳洲公司Proudly Human認證為人類作者,該公司由前首席科學家艾倫·芬克爾博士領導。認證發生在教宗稱AI為人類最大威脅後不到兩個月。
澳大利亞最大媒體公司九號娛樂以人工智能帶來的“極端混亂”為由,宣佈在《悉尼先驅晨報》和《時代報》再裁30個新聞編輯室職位。出版業務董事總經理托里·馬奎爾表示,此舉並非單純削減成本,而是適應結構性變革的“演進”。
為專業人士提供快速AI培訓的平台,每次只需15分鐘。
Calyxa是一款瀏覽器原生的AI導師,能直接在作業網站和PDF上提供輔導,避免學生複製粘貼問題到聊天工具中。它通過上下文註釋和語音指導,幫助學生真正理解知識,而非簡單抄襲。免費版每月10次輔導,Pro版每月10美元無限使用。
美國人工智能標準與創新中心(CAISI)主任克里斯·法爾(Chris Fall)已辭職,距其上任僅三個月。此前,前任主管科林·伯恩斯(Collin Burns)上任不到一週即離職。
作者批評AI熱潮,特別是LLM和“氛圍編碼”現象,認為這給無能者提供了虛假的能力感,而真正的創新被淹沒在炒作中。通過自身經歷,作者發現AI並未提升效率,反而導致技能退化,並預言熱潮即將消退,LLM將回歸其高級搜索引擎的本質。
美國政策制定者正在討論是否通過監管風險來限制中國開源權重模型的使用。Moonshot AI的Kimi K3模型發佈後,這一爭論再次升温。企業面臨的問題不僅是性能,還有未來一年內使用這些模型是否依然暢通無阻。
中國開源AI模型Kimi的發佈,引發了特朗普政府內部AI戰略家的分裂。該模型性能媲美OpenAI和Anthropic的付費模型,卻完全免費,對特朗普的經濟和政治構成挑戰。圍繞如何應對中國AI競爭,各方意見不一,從開放支持到加強管控,分歧加劇。
本文提出預見性殘差強化學習(Foresight Residual RL),通過在凍結的視覺-語言-動作(VLA)基策略上添加一個離線估計的預見值(即當前子任務終止狀態下未來子任務成功的概率)來優化子任務間的交接質量,從而提升長時域機器人操作的成功率。在Isaac Gym中的三階段扳手螺母擰緊任務上,該方法實現了85.6%的完整任務成功率,顯著優於標準子任務殘差RL(54.5%)和VLA基線。
PRISM是一種多模態感知系統,通過融合熱成像、光學和深度傳感器,結合新型視覺變換器網絡OmniUnet,實現非結構化環境中的地形分割與可通行性地圖生成,並在資源受限的嵌入式計算機上成功部署,支持自主導航。
針對視覺導航中的災難性遺忘問題,研究者提出HyperDCM,一種結構感知的記憶機制。它利用大視覺語言模型提取場景語義三元組,通過關係圖卷積網絡編碼為場景圖嵌入,並投影到雙曲空間增強結構分離性。動態聚類和結構敏感更新策略選擇代表性樣本進行記憶回放,保持知識多樣性。實驗表明,HyperDCM在多場景室內外數據集上優於現有持續學習方法。
提出一種共享潛變量方法,通過變分瓶頸在部分標註的多任務面部情感識別中實現跨任務信號共享,在s-Aff-Wild2數據集上提升表情識別宏F1至0.446,並通過第二個骨幹網絡突破動作單元瓶頸。
第三屆微動作分析大挑戰賽(MAC 2026)與ACM Multimedia 2026同期舉辦,通過引入利用多模態大語言模型評估的新任務,將微動作分析從識別推進到細粒度理解。本文詳細介紹了數據集、協議、競賽結果以及該新興領域的未來方向。
GenSyn10是一個包含6萬張合成圖像的數據集,與CIFAR-10對齊,使用三種架構不同的生成模型創建,旨在推進AI生成圖像檢測研究。評估顯示,模型在已知生成器上表現良好,但在未知生成器上性能顯著下降,凸顯了分佈外泛化的侷限性。
本文提出EMTS-Det系統,用於無人機上的實時跟隨人員追蹤,在低功耗硬件上實現高效運行。系統通過自我運動歸一化的殘差運動通道檢測人員,使用僅22k參數的輕量網絡,在Raspberry Pi Zero 2W上達到31.85 FPS,性能遠超YOLOv8n。
研究人員提出3D FaceShell框架,通過向3D面部頭像添加微妙擾動來誤導視覺語言模型推斷敏感屬性,同時保持視覺身份不變。
聯合嵌入預測架構(JEPA)在訓練時聯合訓練預測器與編碼器,但下游部署通常丟棄預測器。研究表明,JEPA預測器可作為可遷移的遮擋特徵補全算子,通過線性投影適配到不同編碼器族,顯著提升遮擋分類精度。
本研究提出科學可行性控制(SFC)框架,一種圖結構共形預測方法,為科學推理的有效性提供統計保證。SFC將科學推理分解為原子單元,通過漸進式絕對一致事實性驗證,在檢測到違反科學原則時動態分支到替代生成路徑。實驗表明,SFC在PhyX等多模態科學推理基準上達到50.1%的準確率,超過DeepSeek-R1和GPT-4,同時將科學定律違反減少73%,並提供91.7%的科學有效性保證。
本研究通過機制可解釋性方法,分析Llama-3模型在符號算術、自然語言應用題和Python代碼三種形式下的算術計算機制,發現一組緊湊的共享神經元在三種形式中均被激活,且跨格式失敗源於激活狀態而非不同電路,表明LLM的算術計算在神經元層面具有形式不變性。
本文提出了 SpecLA,一種針對有狀態線性注意力模型的推測解碼運行時。它通過拓撲感知內核驗證鏈和樹,存儲驗證過程中產生的緊湊因子以恢復接受狀態,並使用置信剪枝和目標對齊的EAGLE風格草案生成器提供有用候選。在NVIDIA H100上使用公共GDN-1.3B目標,SpecLA實現了比自迴歸解碼高達1.70倍的端到端加速。
OpenLanguageModel (OLM) 是一個開源的 PyTorch 庫,用於構建和預訓練小型語言模型,同時保持其內部機制可見。模型代碼直接反映架構,組件如 Block、Residual、Repeat 和 Parallel 描述連接方式。OLM 集成了分詞器、數據集、優化、混合精度、回調、檢查點以及硬件感知的執行,支持從教學筆記本到完整預訓練的無縫遷移。該庫包含 9 個常見模型家族的 27 個預設,並提供從基礎到架構研究的文檔。驗證顯示與獨立參考實現高度一致,348M 參數模型在四 GPU 上弱擴展效率達 90.6%,且早期可用性反饋積極。OLM 採用 MIT 許可證,可通過 PyPI、GitHub 和文檔站點獲取。
現有長期LLM代理的記憶系統往往將先前軌跡作為被動上下文檢索,而非轉化為可執行能力。本文提出MSCE框架,一種無需訓練的記憶-技能協同進化框架,將代理經驗組織為基礎步驟軌跡、可重用過程策略和聲明性環境認知。MSCE將具有正估計增益的證據支持的L2策略結晶為可調用技能,並引入反射加權值回填。實驗表明MSCE顯著優於現有方法。
本文介紹了NOWJ團隊在COLIEE 2026競賽中五項任務的方法和結果,包括法律案例檢索、先例推理、法條檢索與推理、法律文本藴含以及法律判決預測,提出了多種自適應流水線和深度學習模型。
該研究通過腦電圖記錄的事件相關電位(ERP),對比人類與語言模型在下一詞預測任務中的表現,發現僅信息論中的“驚奇度”指標與語言處理的ERP相關,尤其是對於語義豐富的高內容詞,而模型規模擴大並不必然帶來更類人的認知處理。
一項新研究通過簡單問題(洗車應步行還是開車)揭示了語言模型常先決定答案再推理以證明其合理性,而非從前提推導。實驗表明Qwen3-8B模型在多數情況下錯誤承諾步行,即使開車是唯一合理選擇。研究者通過激活層次分析發現,模型在輸出答案前已顯示出向步行傾斜的跡象,即便最終回答開車。該發現提示現有模型存在推理前的決策偏差。
小型語言模型在檢索增強生成中易受噪聲證據影響。本文提出RIMS,一種三階段偏好優化框架,包括合成思維鏈偏好數據生成、可微平滑聚合機制和偏好優化。實驗表明其在多跳問答基準上優於現有方法。
混合專家模型(MoE)通過將令牌路由到一小部分專家來高效擴展Transformer模型。然而,現有路由器通常基於淺層或孤立的令牌表示來選擇專家,導致路由決策不穩定且語義不一致。本文從表示角度重新審視專家選擇,並提出多級上下文融合MoE(MCF-MoE)框架,通過整合跨層語義聚合和局部令牌交互的互補信號來構建上下文感知表示,從而實現更信息豐富且一致的專家選擇。實驗表明,MCF-MoE在路由一致性和下游性能上均優於強基線,凸顯了上下文完整性在專家路由中的重要性。
本研究提出了一種令牌級跨模態Transformer模型,結合對比多任務學習,用於整合基因組和臨牀數據,實現乳腺癌亞型分類與生存預測的聯合優化,克服了現有方法中模態交互粗糙、融合方式簡單、目標獨立優化等侷限。
本文提出“從權重到語言”方法,自動從選擇數據中發現以自然語言描述的偏好維度,解決偏好學習中的欠確定性和黑箱問題。實驗表明,該方法能提高預測準確率,並允許用户實時檢查和編輯模型推理。
本文提出了一種基於算子感知的混合精度容差校準方法,通過挖掘累積的雲GPU運行數據,自動確定張量核正確性測試的最佳絕對容差,相比手工選擇的容差更嚴格,並顯著提高了錯誤檢測召回率。
大型語言模型在關鍵領域的部署帶來了遺忘能力的缺失,導致隱私泄露和安全風險。本文綜述了基於梯度的LLM遺忘方法,探討其是否真正移除知識或僅抑制表達,並分析了安全、魯棒性和可驗證遺忘的挑戰。
本文介紹ARGO智能眼鏡平台,利用STM32N6微控制器及其集成NPU實現本地機器學習,保護隱私並降低延遲。通過軟硬件協同設計,部署優化後的YOLOv11模型進行實時城市障礙物識別,引入頭並行注意力機制(HPA)適配NPU,模型僅佔用2.483 MB內存,mAP50-95達24。該平台集成多模態傳感器,以10 FPS運行,200 mAh電池續航約113分鐘,展示了高性能、隱私保護且社交可接受輔助設備的可行性。
本文提出DocOCR-Eval,一種無需人工標註的評估框架,用於自動評估和選擇OCR工具。該框架通過三階段校正和排序策略,在缺乏真實標籤的情況下近似基於標註的工具排序。實驗表明,聚合多個多模態大語言模型可逐步提升與人工標註排序的一致性,為實際部署文檔解析系統提供指導。
一種新的強化學習方法W2SPO,利用弱輔助模型在大型語言模型推理路徑中注入簡短片段,在數學推理任務上提升了性能並加速訓練。
強化學習領域需要多樣化的訓練環境,但傳統手工設計的環境難以擴展。自迴歸世界模型存在從左到右的偏差,無法充分利用全局狀態信息。一項新研究提出使用掩碼擴散語言模型(MDLM)作為文本世界模型,通過雙向錨點感知去噪,在連貫性和多樣性上顯著優於參數規模大4倍的語言模型,並引入GRPO訓練框架實現高達47%的零樣本遷移性能提升。該工作已開源。
本文提出生成式本體歸納(GOI),一種領域無關的框架,能從示例語料庫中歸納出實體、維度、屬性、關係和約束的生成藍圖,並導出為帶有六種節點類型和七種邊類型的類型圖(YAML/JSON格式)。引入節點覆蓋率評分(NCS)評估指標。在四個對比本體上的驗證表明,GOI提示生成覆蓋了95-100%的結構骨幹,而通用模板覆蓋率顯著下降。
AI代理系統因結合大語言模型與外部工具而本質非確定性。arXiv論文提出agrepl框架,通過MITM代理攔截外部交互,實現運行軌跡的確定性重放,並憑噪聲感知差異算法區分HTTP頭部變化。實驗顯示重放保真度F=1.0,單步延遲降低98.3%。
一項新研究提出PlanFlip框架,包含四種針對多智能體LLM系統規劃階段的提示注入攻擊。研究發現,更強的模型(如GPT-5)反而更易受攻擊,同質化骨幹網絡存在相關智能體盲點,而推理增強型模型(如DeepSeek-R1)能抵禦攻擊。提出的兩種防禦方法檢測率高達1.00。
一項新研究通過跨領域框架測試了大型語言模型(LLMs)在不確定性下的風險態度,發現大多數模型在任務內和跨任務中都表現出穩定且一致的風險偏好,且其風險態度分佈比人類更集中。
本研究提出了一種基於MATLAB的開源框架,用於開發軟交互伴侶中的情感觸覺識別緊湊深度學習模型。通過468個CNN模型的系統探索,確定了13.2k參數的擴張1D CNN為最佳方案,測試準確率75%,留一法交叉驗證準確率85%。混合推理管道結合瞬時啓發式濾波和CNN精細分類,可在20 Hz實時運行,實現隱私保護的情感觸覺解讀。
Concentrate 是一個託管的LLM網關,提供單一API訪問超過130個來自主要供應商的模型。它具備模型路由、支出跟蹤、安全控制和故障轉移冗餘等功能,專為擴展AI生產的團隊設計。
OpenAI戰略未來主管Dean Ball認為開放權重模型本質上是減速主義的,因為它們抑制資本支出。本文從經濟學角度探討了這一觀點,分析了中國在AI基礎設施方面的投資、訓練範式的轉變以及價值在價值鏈中的遷移。文章認為,開放權重模型可能通過降低成本擴大應用範圍,促進創新,從而實際上是加速主義的。
意大利工程師Vincenzo(又名JustVugg)創建了Colibrì,這是一個概念驗證項目,能夠在僅25GB RAM和1GB/s NVMe的CPU上運行7440億參數的GLM-5.2模型(1.5TB)。儘管速度極慢(每0.05-0.1秒一個token),但利用混合專家(MoE)架構按token加載專家,實現了前沿水平的回答質量。項目開源,旨在探索在消費級硬件上運行大型模型的可行性。
直播中,GPT-5.6 Sol 與 Kimi K3 在《坎巴拉太空計劃》裏進行速度競賽,展示 AI 在複雜遊戲中的實時決策能力。
阿里通義實驗室推出Qwen-Audio-3.0-TTS,一款面向生產的文本轉語音系統,提供Flash(實時交互)和Plus(高質量生成)兩檔,通過阿里雲模型託管服務交付。該模型覆蓋16種語言和20種中文方言,支持自然語言風格控制和86種細粒度內聯標籤,並在Artificial Analysis語音競技場中排名第一。文章詳細介紹了模型架構、性能表現、開發者反饋及定價信息。
不斷有用户分享他們利用編碼代理逆向工程並自動化家中設備的軼事。這展示了編碼成本降低帶來的影響。過去,逆向工程雖然可行,但投資回報率低,且需面對不穩定API的維護風險。編碼代理徹底改變了這一局面,降低了初始工作和失敗的成本,也減輕了未來維護的心理負擔。
本·湯普森提出美國應立法明確訓練數據為合理使用,並禁止禁止蒸餾的服務條款,以幫助美國開源模型與中國模型競爭。同時,阿里巴巴決定發佈Qwen 3.8 Max開源權重,可能受習近平鼓勵開源合作的講話影響。
Moonshot AI發佈了最新旗艦模型Kimi K3,這是一個2.8萬億參數的MoE模型,將於7月27日開放權重。K3在多項基準測試中排名靠前,成為最強的開源模型。文章探討了中美AI模型差距縮小、中國開源策略、開源模型的經濟影響以及中國AI的效率優勢。
Adobe的實驗性相機應用Indigo最初專注於為iPhone攝影提供更自然的單反效果,現在通過'AI Playground'套件增加了生成式AI編輯功能,使用Google的Nano Banana模型。功能包括AI風格、物體移除、照片指導和自定義編輯。該實驗目前向一小部分用户提供免費訪問,將來可能轉為付費。
法國憑藉豐富的核能提供低成本電力,在AI領域獲得競爭優勢,但美國科技巨頭可能搶先將這一資源納入囊中。
AI行業面臨兩大對立策略:一是斥資數千億美元建設核電站以支持更大規模的AI模型,二是發佈可下載的開源模型,使智能幾乎免費。文章指出這兩種策略並非對立,而是對同一個問題的不同賭注:智能是否存在天花板?如果存在,效率陣營(開源、芯片架構)將獲勝;如果需求無上限,蠻力陣營(大規模計算)將勝出。生物學提供了先例:人腦在能量限制下通過架構創新(稀疏性、內存計算)實現了高效。當前開源模型利用這些技巧,但僅覆蓋中等難度的任務,而前沿模型仍保持優勢。真正的勝負取決於智能天花板的位置。
加里·馬庫斯指出,中國AI模型Kimi K3已追平美國頂級模型,且作為開源模型免費提供,衝擊了美國AI公司的商業模式。他回顧了自己2025年以來的警告,認為美國過度依賴大語言模型(LLM)戰略失誤,導致如今中美AI競爭陷入僵局。馬庫斯提出七項建議,包括不作為、監管護城河、國有化等,並最終主張AI應成為全球公共品,提議建立類似CERN的國際AI合作項目。
daft-physical-ai 是一個新的開源 Python 庫,基於 Daft 構建,旨在簡化物理 AI 中從原始機器人視頻到訓練模型的數據處理流程。它提供了手部追蹤和獎勵評分等操作,支持懶加載、批處理和分佈式執行,幫助團隊跳過數據管道的基礎設施工作。
本文探討了SpaceX快速納入納斯達克100指數對指數基金投資者的影響。文章解釋了指數基金的工作原理,討論了人們對埃隆·馬斯克治理方式的擔憂,以及投資者是否應擔心市場中的人工智能集中度。
由英偉達、Meta和三星等創始成員組成的聯盟,旨在減少對芯片中稀有材料的依賴。
舊金山一家新開的餐廳因使用AI生成的菜單圖片而遭到社區強烈批評,甚至被塗鴉破壞。店主不得不撤下圖片,並計劃通過社區活動重建聲譽。