本文介紹Matt Pocock開發的/grill-me技能,它透過反覆追問迫使開發者理清需求,避免在模糊的想法上耗費精力。文章詳細闡述了從/grill-me到最終實現的四步工作流,以及保持Claude Code高效執行的相關技巧。
AI 新聞即時情報
即時監測
即時更新
即時追蹤可信來源,保留出處、權限和站內閱讀模式,把噪音壓成可讀情報。
即時更新
OxyJen是一個開源的Java框架,用於編排LLM工作負載,提供圖形風格執行、上下文感知記憶體和確定性重試/回退。它專為Java企業環境設計,旨在提供可靠的生產級AI管道執行引擎。
位於上海沿海的全球首座風能水下資料中心已投入運營,旨在解決中國AI發展帶來的能源挑戰。該示範專案於5月啟動,容量24兆瓦,由HiCloud技術與中交集團聯合建設。
OpenLTM 是一個開源、MIT 許可的長期記憶外掛,專為 Claude Code、OpenCode 和 Pi 等 AI 程式設計代理設計。它提供自動語義記憶捕獲、回憶和重要性加權衰減,無需依賴雲服務。記憶儲存在本地 SQLite 資料庫中,並支援鉤子、命令和圖視覺化。
蘋果在AI上的投入遠低於其他科技巨頭(2026年資本支出預計140億美元,而四大雲廠商合計6700億美元)。作者認為,蘋果並非落後,而是基於真正的不信仰——它認為AI並非革命性技術。蘋果的CEO繼任者是非AI背景的硬體負責人,Siri開放給第三方模型,這些都體現了蘋果的堅定立場。相比之下,其他公司(如Meta、Google、微軟)的鉅額投資更像是帕斯卡賭注:一邊大肆宣傳,一邊悄悄對沖。蘋果是無所畏懼的無神論者,而矽谷其他公司則是恐懼的偽信徒。
EgoAERO是一個新穎的框架,能夠從單段第一人稱RGB-D人類演示中學習靈巧機器人操作,而無需預先掃描的物體資產。它重建接觸一致的手-物體軌跡,並透過兩階段殘差學習將其轉化為機器人策略。該框架還引入了線上質量評估機制,並構建了包含430萬RGB-D幀的大規模資料集EgoDex-R。實驗表明,其效能接近基於CAD的重建方法。
MuJoCo-Drones-Gym是一個基於MuJoCo物理引擎的開源多無人機模擬環境,支援任意數量的Crazyflie 2.x奈米無人機,提供模組化API選擇物理模型、動作介面和觀測空間,並整合PettingZoo並行環境以支援多智慧體強化學習,包含七種任務場景。
IntentNav是一種從人類演示中學習類人物體導航策略的框架。它透過前沿的人類意圖示註方法推斷高層搜尋意圖,並利用空間視覺候選空間實現高效探索。在多個基準測試中達到最先進效能,且零樣本遷移到多種機器人平臺。
Q-VGM是一種離策略強化學習方法,透過引入VGG-Flow將值梯度轉化為去噪時間值梯度場,避免了對去噪鏈的反向傳播,從而有效微調流匹配視覺-語言-動作(VLA)策略。在LIBERO、RoboTwin 2.0及真實機器人桌面任務上顯著提升了成功率。
PRISM是一種任務無關的框架,透過輕量級MLP直接從世界模型編碼器中提取狀態條件高斯先驗,並利用精度加權的高斯乘積更新融合到規劃器的取樣分佈中,顯著提高了連續控制任務的成功率。
本文提出一種名為X-OP的全身遙操作框架,僅使用單個擴充套件現實(XR)裝置即可跨不同形態機器人泛化,無需針對特定機器人重新訓練策略。該方法採用模型預測控制(MPC)運動重定向器,同時最佳化操作員意圖對齊和機器人動態可行性,並引入狀態同步和SLAM全域性位姿反饋以確保魯棒線上執行。模擬和真實實驗表明,該方法在類人機器人和移動操作手上均取得更高成功率,降低完成時間和能耗,實現零碰撞。
研究人員開發了一種基於時間卷積網路的即時端到端假肢控制器,無需手動調諧和意圖分類器。在平地、斜坡和樓梯等五種運動模式下測試,控制器表現出無縫適應能力,匹配訓練資料的縮放特性,並能在無需個體調整的情況下實現自然的樓梯過渡。
本文提出一種基於深度確定性策略梯度(DDPG)的路徑規劃方法,用於威脅環境中的自主車輛導航。該方法將威脅建模為圓形禁入區,透過強化學習訓練智慧體直接從狀態對映到安全動作。獎勵函式包含目標吸引、障礙排斥和能量消耗懲罰。與傳統最優控制方法相比,DDPG在保證路徑有效性的同時大幅提升計算速度,適用於即時應用。
MinNav是一種基於光流及其不確定性的導航堆疊,使微型空中機器人能夠在靜態和動態障礙物以及未知形狀的間隙中飛行,無需任何關於場景元件的先驗知識。在真實世界實驗中實現了70%的整體成功率,且計算量遠小於深度方法,可直接在微型機器人上執行。
本文提出VoLoAgent,一種利用視覺語言模型(VLM)編排多種機器人能力的系統,用於開放詞彙長程操控任務。該系統將機器人動作視為可中斷的工具,實現即時規劃、監控和故障恢復。同時引入RoboVoLo基準測試,實驗表明VoLoAgent顯著優於單一VLA/VLM或基於工具的系統。
NeuroAlign是一個分層多模態融合框架,整合fMRI和DTI資料用於輕度認知障礙(MCI)分析。它引入了雙模態分層對齊(DMHA)和雙域分層互動(DDHI)模組,以及無需梯度的協同啟用對映(SAM)歸因方法,在多個資料集上取得了有競爭力的效能。
提出AMN(自適應多尺度細胞核網路),一種雙編碼器分割框架,結合Swin Transformer和ResNet-50特徵金字塔,透過學習的每通道門控機制動態加權各編碼器貢獻。在CoNIC基準上平均Dice 0.82,F1 0.68,優於八種基線模型,並在MoNuSeg上展示強泛化能力。
本文針對非結構化城市交通中密集、遮擋和運動不規則等挑戰,提出了一種基於360度LiDAR的全方位感知框架,結合扇形區域全景處理與旋轉等變稀疏卷積,在印度城市交通資料集上驗證了其有效性。結果表明,該框架對汽車、公交車和卡車等大型物體檢測效能優異,但對行人、腳踏車和摩托車等小型可變交通參與者檢測仍有提升空間。
本研究提出SENTRY框架,利用有限種群抽樣理論對視覺Transformer(ViT)進行統計故障注入,以極少的樣本即可在99%置信度下將故障率控制在1%誤差範圍內,實驗成本降低高達10700倍。研究發現,雖然僅3%的FP32位翻轉導致故障,但這些故障幾乎都會造成災難性的精度崩塌,且脆弱性主要集中在歸一化層和IEEE-754格式的關鍵指數位。
這項研究探討了人類和前沿多模態大語言模型(MLLM)在辨別真實與AI生成的法律證據照片方面的能力。研究者構建了SLED-1400資料集,包含200張真實證據圖片和1200張由六種文本到影像生成器生成的合成圖片。實驗顯示,人類總體準確率為64.8%,在最強的生成器面前準確率近乎隨機;MLLM從未誤判真實影像,但漏檢了大量合成影像。結論是任何單一方法都不可靠,需要結合人類審查、MLLM篩查和來源追蹤技術。
本文介紹VisualLeakBench基準,用於評估視覺語言模型(VLM)在截圖、文件等場景中是否將敏感文本複製到工具引數中。測試顯示,基線條件下PII傳播率達78.8%,不安全文本傳播率達85.5%;防禦提示可降低PII傳播至2.0%但犧牲了實用性,不安全文本仍達52.6%。
麻省理工學院的研究人員分析了對抗性微調對視覺Transformer(ViT)在影像擾動下魯棒性的影響。他們發現,針對特定型別的影像退化(如低頻和高頻干擾)進行微調,確實能提升模型在該類退化上的表現和置信度,但無法泛化到未見過的退化型別。儘管模型各層的視覺注意力和知識演化發生了變化,但對抗性訓練並未根本改變ViT學習到的稀疏表示。
SlideCheck是一種輕量級工具,利用凍結的病理基礎模型補丁特徵對全切片影像中的異常和惡性進行評分,從而更好地控制預訓練資料的組成。實驗表明,SlideCheck定義的資料分佈影響下游ViT預訓練效能,策展的補丁子集可以達到全資料效能。
該博士論文提出兩種隱私保護框架,利用集體音影片訊號推斷群體情緒,避免個體監控風險。第一種採用交叉注意力融合與幀注意力池化,第二種變分編碼器多解碼器學習共享潛空間。實驗表明無需個體特徵即可達競爭效能。
一種基於超過48,000張歷史文件頁面影像微調的影像分類器,使用RegNetY-16GF達到99.16%的準確率,可實現自動分類以支援OCR和資料提取。CLIP模型雖然在測試集上表現優異,但在未標註資料上表現不佳。
本文擴充套件了基於Sinkhorn最優傳輸的MST-Direct方法,使其能夠處理多變數、條件和大規模場景。透過稀疏候選限制的Sinkhorn匹配器解決了可擴充套件性問題,利用FFT-MA高斯骨幹擴充套件至多變數,並透過克里金法實現硬資料條件化。驗證表明,該方法在保留精確聯合分佈的同時,優於PPMT近似方法。
本文提出CARTOGRAPH框架,為AI科學家提供可驗證的實驗引導與拒絕能力。該框架透過未解析子空間實驗引導、顯式模糊閉合和基於殘差的庫不足檢測,在多個測試中優於原始投影方法。在回顧性審計中,成功標記了A-Lab系統中所有後續被認定為不確定的主張。
擴散語言模型(DLM)中的雙向注意力機制導致傳統KV快取方法失效,模型精度近乎歸零。本文提出雙向字首快取(bicache),透過動態識別安全層深度重用共享字首KV,實現36.3%-98.3%的吞吐量提升,且精度下降僅0-1.8%。
準確監測碳排放對氣候政策至關重要,但城市級高頻監測資料極度稀缺,限制了深度學習模型的應用。TriHead-GAN是一種基於Transformer的對抗框架,其三頭判別器聯合監督聯合分佈的三個互補方面:分佈真實性、跨變數依賴性和時間平滑性。實驗表明,TriHead-GAN在多數設定下優於主流基線,生成的合成視窗能提高低資源碳監測場景的預測準確性。
STARIXNet 是一種輕量級神經網路,透過捕捉多系統指標間的時空關係,在多變數空間內指導資源分配決策,優先保障服務穩定性與成本效率。在沃爾瑪關鍵生產微服務中部署後,實現了 10% 至 50% 的顯著成本節約,並提升了服務穩定性與客戶體驗。