Datasette Agent 0.3a0 引入了新的 execute_write_sql 工具,該工具在執行數據庫寫入前請求用户批准,並嚴格遵循用户權限設置。同時增強了聊天模式的批准支持,新增 --unsafe 等選項以實現自動批准,極大提升了 Datasette 的交互性和安全性。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
LangChain與Fireworks合作微調開放模型,從生產追蹤中挖掘感知錯誤信號,以極低成本達到前沿模型性能。
本文探討了AI智能體的定義,提出智能體是一個使用LLM決定應用控制流的系統。作者贊同Andrew Ng的觀點,認為智能體能力是一個頻譜,並介紹了“智能體化”的概念及其在開發、運行、評估和監控中的意義。
LangChain構建了一個基於Deep Agents的GTM代理,自動完成潛在客户研究和郵件起草,並整合賬户情報,實現了線索轉化率提升250%,每位銷售代表每月節省40小時。
LangSmith 的新功能 Align Evals 幫助開發者校準評估器,使其更符合人類偏好,從而減少評估分數與人工判斷之間的差異。
本文分析了兩個看似對立的博客文章——Cognition團隊的“不要構建多智能體”和Anthropic團隊的“我們如何構建多智能體研究系統”,指出它們實際上有很多共同點,並提供了關於何時以及如何構建多智能體系統的見解。關鍵要點包括:上下文工程至關重要、以“讀”為主的多智能體系統比以“寫”為主的更容易、以及生產可靠性和工程挑戰。文章還介紹了LangGraph和LangSmith等工具如何幫助解決這些挑戰。
瞭解 Replit 如何利用 LangSmith 的觀測能力調試複雜的代理工作流,包括改進的追蹤性能、搜索功能和人機協同線程視圖。
Interrupt 2025 是 LangChain 舉辦的首屆行業大會,匯聚了來自全球的 800 名參與者。會議重點討論了代理工程作為新學科、多模型應用、LangGraph 用於構建可靠代理以及 AI 可觀測性等主題。同時,LangChain 發佈了一系列新產品,包括 LangGraph Platform 正式版、Open Agent Platform、LangGraph Studio v2、LangGraph Pre-Builts、LangSmith 可觀測性更新、Open Evals 和 LLM-as-Judge 等。
瞭解什麼是成對評估,為什麼在LLM應用開發中可能需要它,並通過LangChain的LangSmith示例瞭解如何使用它。
本教程介紹如何利用Pinecone Serverless、LangChain和LangServe構建生產級RAG應用,解決原型與生產之間的差距,包括向量存儲管理、快速部署和可觀測性。
OpenEvals和AgentEvals提供了預構建的評估器,支持LLM-as-judge、結構化數據和代理軌跡評估。這些開源包幫助開發者快速建立評估流程,確保LLM應用可靠性。
本文深入探討了構建可靠智能體系統的核心挑戰——確保LLM在每一步都擁有適當的上下文。作者比較了工作流與智能體、聲明式與命令式方法,並介紹了LangGraph框架的設計理念。文章還批評了OpenAI的智能體指南,讚賞了Anthropic的定義,並討論了框架的“天花板”與“地板”概念。
LangSmith推出自我改進的LLM評判器,通過將人工修正存儲為少樣本示例,無需提示工程即可使評判與人類偏好保持一致。
Promptim 是一個實驗性的提示優化庫,通過自動化迭代改進提示詞,幫助開發者節省時間、提升 AI 系統性能。它利用數據集和評估器進行優化循環,並支持人工反饋集成。
New Computer利用LangSmith改進其AI記憶檢索系統,實現了50%更高的召回率和40%更高的精確度,通過追蹤迴歸和調整對話提示來優化性能。
學習評估深度代理的5種模式:定製測試、單步驗證、完整回合、多輪模擬和環境設置。
Eva 是一款完全離線的 Android AI 助手,所有功能(包括語言模型、語音識別、文檔搜索、地圖、音樂和維基百科)均在設備上運行,無需賬户或雲端連接。它提供聊天、離線地圖導航、音樂播放器、文檔閲讀、圖像管理等功能,並支持通過語音或文本交互。
Spanly是一款新工具,能夠讓你實時觀察AI代理在你的MCP(模型上下文協議)服務器內部的具體操作和行為。
Recursive公司發佈了自動化AI研究系統的早期成果,在三個基準測試中實現了最先進的性能:固定預算語言模型訓練、小模型訓練速度和GPU內核優化。該系統自動化了研究循環,通過提出、實現、實驗、驗證和迭代來改進目標。在NanoChat任務中,系統以0.9109 BPB的表現超越了社區最佳結果;在NanoGPT Speedrun中,訓練時間縮短至77.5秒;在SOL-ExecBench中,GPU內核優化達到0.754的SOL得分。系統發現了多種創新技術,如哈希表增強的n-gram嵌入和字節級特徵。
Degen & Co. 是一個平台,允許用户創建具有不同個性的AI投資者,例如動量追逐者、股息保守派或末日預言者。每個AI交易員都有獨立的意見、交易策略,並會撰寫交易日誌。用户可以選擇原型、調整個性設置、設定硬性規則和初始投資組合,然後觀察AI的運行。
一段關於IBM和挪威主權基金CEO討論人工智能是否構成泡沫的YouTube視頻的頁面信息。
作者描述了一個AI編程助手(Claude Opus 4.6配合GitHub Copilot)在修復GoAWK程序中的bug時,雖然快速診斷出問題,但隨後在7種不同修復方案之間反覆切換了25次以上,暴露了AI模型在決策時的不確定性。
一項新調查顯示,AI使數字工作者每週節省約11小時,但同時也帶來超過6小時的'看管機器人'時間,即檢查AI輸出、修正錯誤和重新運行提示。儘管個人效率提升,但僅有13%的企業報告顯著業務增長。
Edgee Turbo 模型支持與 Claude Code、Kimi K2.7 Code、MiniMax M2.7 等多種代碼模型協同工作。
Cotypist是一款專為Mac設計的本地AI自動補全工具,可在郵件、Slack、筆記等幾乎所有應用中運行,實時提供建議,按Tab即可接受,所有處理均在本地完成,無需雲端或API調用,保護用户隱私。
康奈爾大學的研究表明,只需13個單詞的文本片段就能操縱ChatGPT和谷歌AI搜索等工具的搜索結果。品牌通過Reddit、Quora等平台植入推廣內容進行AI引擎優化(AEO),而AI系統難以區分虛假信息與真實內容。
AGIRAILS 是一個新平台,允許AI代理通過非託管鏈上託管在Base上相互僱傭和支付,無需人工干預。創始人展示了通過電子郵件讓兩個AI代理完成談判、鎖定資金、交付和支付的完整流程,所有交易公開可查。
作者描述了他們如何使用 OpenCode(一種與供應商無關的編碼代理,具有 Web UI 和 Git 集成)為其家庭實驗室創建 AI 開發平台。該設置通過受控的工作流程自動執行容器更新和運行狀況檢查等維護任務,其中 OpenCode 推送分支,作者查看和合並 PR,然後 GitOps 部署更改。
LangChain通過內部使用LangSmith LLM網關,實現對編碼助手AI支出的實時追蹤和預算控制,解決了AI使用成本失控的問題。
據Axios報道,Anthropic與美國政府之間的性格衝突導致其AI模型Mythos和Fable因出口管制而下線。消息人士稱,解決之道可能是讓模型無法被越獄,或者改善雙方態度。