我曾説我對測試一無所知,但我的倉庫裏有342個測試
一位沒有編程背景的“氛圍編碼者”在AI輔助下完成項目後,驚訝地發現AI自動編寫了342個自動化測試。文章深入探討了技術債務、手工測試的盲點,以及測試對於非程序員批量運行AI代碼的關鍵作用。
- 作者完全依賴AI寫代碼,最初認為只要程序能運行就沒問題,但後來理解了技術債務的含義。
- 一次數據事故中,AI寫的修復工具幾乎造成更嚴重的問題,暴露了無測試環境的脆弱性。
主題流
研究動態揭示下一批產品能力和基礎設施需求。這裡追蹤論文、基準、數據集、實驗系統、實驗室發布和開源復現,重點關注哪些結果可能進入模型訓練、Agent 系統、機械人或開發者工具。
一位沒有編程背景的“氛圍編碼者”在AI輔助下完成項目後,驚訝地發現AI自動編寫了342個自動化測試。文章深入探討了技術債務、手工測試的盲點,以及測試對於非程序員批量運行AI代碼的關鍵作用。
Anthropic的Claude系列包括聊天機器人、編碼代理和工作流程代理。Claude Code專注於軟件開發,Claude Cowork處理計算機任務。文章通過汽車類比解釋Haiku、Sonnet、Opus、Fable和Mythos等模型,並討論了代理作為力量倍增器的潛力以及監督和安全的重要性。
本文介紹了七款比Claude Code更便宜、更快速的替代工具,包括開源選項、本地模型支持、MCP集成以及更好的上下文控制。
一個關於無人談論的最大AI競爭對手關係的論點。
Mindrift(Toloka AI)正在招聘一名高級軟件工程師,專注於AI智能體的評估工作。
在一場由多個AI模型參與的辯論中,探討了AI原生工具對獨立開發者的影響。辯論達成共識:執行成本崩潰,但發現成為關鍵瓶頸。分歧在於替代編碼的護城河是什麼——人際關係還是成為默認的AI工作流。
作者從元認識論角度論證,哲學期刊和學術通信應拒絕AI生成的文本,因為人類專家的措辭選擇(即使細微)反映了對議題的深層敏感性,而LLM的輸出會模糊這種專業性。通過分析《克拉拉與太陽》案例,展示了AI改寫如何丟失關鍵哲學微妙性。最後提出適當使用LLM輔助編輯的建議。
Gigatoken 是斯坦福博士生 Marcel Rød 開發的一款 MIT 許可的 Rust BPE 分詞器,在 144 核 AMD EPYC 9565 上以 24.53 GB/s 的速度對 GPT-2 進行分詞,比 HuggingFace tokenizers 快 989 倍,比 tiktoken 快 681 倍。其速度提升並非來自更快的 BPE 合併循環,而是來自手寫的 SWAR 預分詞器和預分詞緩存。支持 23 種分詞器家族,但 SentencePiece 詞彙表的速度提升僅為 7–22 倍。兼容模式可保持精確輸出一致,但速度約為 200–300 倍。
Parker和Tom等9位經濟學家合著了一篇關於遞歸自我改進(RSI)的論文,通過簡單模型分析AI如何加速AI研發。文章強調了RSI的不同定義、反饋效應強度對能力加速的影響,以及實驗室應發佈更多相關數據。
Ours.network 推出了 ours-mcp,這是一種讓 AI 智能體無需人類干預即可直接通信的工具。它簡化了設置過程,通過一個可安裝的 MCP 服務器,讓智能體通過一次性邀請連接,避免了手動複製粘貼的繁瑣。功能包括端到端加密、用於隱私保護的盲中繼,以及完全的人工控制。該工具處於早期 alpha 階段,源代碼可用,專為跨不同運行時(如 Claude Code 和 Codex)的智能體間通信而設計。
曼徹斯特大學和杜倫大學的研究發現,AI聊天機器人在日常情感支持方面可以匹配甚至超越人類,尤其是在憤怒和恐懼情境中。研究強調,提供具體、可操作的建議是有效支持的關鍵,無論來自人類還是AI。
BeamWire 提供個性化的、無廣告的每日新聞簡報,以電子郵件和播客形式發送,包含事實核查、偏見檢測和可定製主題。它提供多種新聞和專題“光束”(Beams),涵蓋不同興趣,並配有AI主播和語調定製。價格從免費開始。
Python 包索引(PyPI)現已實施新安全措施:拒絕向超過14天的舊版本上傳新文件。此舉旨在防止因發佈令牌或工作流泄露導致的供應鏈攻擊。
Orphograph 為 AI 代理的每個關鍵操作生成錨定到比特幣區塊鏈的收據,確保記錄的存在時間不可篡改,且無需信任操作者即可驗證。
Searchdesk是一款AI求職助手,它能自動搜索真實職位、基於事實定製申請材料,並讓用户在私人工作區中掌控每一個機會。所有草稿均由用户審核,不會自動提交申請。目前處於Alpha階段,歡迎反饋。
本文提出EgoRecovery框架,利用人類第一人稱視頻數據訓練機器人故障恢復策略,比傳統遙操作效率高10倍以上,通過協同訓練對齊人類與機器人糾正意圖,僅需少量機器人演示即可實現可靠恢復。
研究人員提出了一種名為Morphing MILR的線驅動無肢機器人,它通過滾動關節重新配置身體形態和柔順性,實現了側向波動、側繞、滾動和扭轉等多種運動模式。該機器人利用分佈式線驅動和可編程被動柔順性,無需複雜傳感即可實現穩健的接觸豐富運動。潛在應用包括搜索救援、環境監測和檢查。
研究人員提出了一種名為“接觸持續全驅動”的控制理論框架,用於評估無人機在物理接觸過程中的操作能力。該框架通過殘差權柄集和殘差權限邊界等概念,超越了傳統的全驅動機器人僅通過矩陣秩判據的認證方式。數值實驗表明,對於傾斜六旋翼無人機,僅滿足滿秩條件並不能保證接觸操作的可行性,而適當的傾斜角度能保留殘差權限。
本文提出一種去中心化的、抗欺騙的軌跡規劃框架,用於應對小型無人機系統在遠程ID(RID)位置欺騙攻擊下的運行。該框架將RID信息視為未驗證,並通過物理層觀測(如接收信號強度)檢測欺騙並概率定位欺騙源,將不確定性轉化為機會約束下的風險有界不安全區域,集成到基於馬爾可夫決策過程的規劃器中。仿真表明,與信任RID數據的規劃器相比,該方法減少了近碰撞事件,同時保持實時計算效率。
儘管通用機器人操作取得進展,現實世界中多物體雜亂環境仍具挑戰。LENS作為一種即插即用的解決方案,利用大語言模型自動生成場景特定的簡化抽象表示,通過合併或修剪實體來適應任務進展,從而提升各種操作方法的性能。
提出一種基於學習來自觸覺(LfH)的框架,通過稀疏演示學習用户偏好的安全乾預策略,採用可微控制屏障函數(CBF)優化層自動調整安全參數,實驗表明能有效減少觸覺反饋與用户偏好的不匹配。
盲人和低視力人羣依賴導盲犬進行實時導航,但傳統導盲犬成本高、等待時間長、壽命短。米洛(Milo)是一種基於Unitree Go2機器人的開源、低成本(約2000美元)的全自主機器人導盲犬平台,無需預先環境掃描,可室內外導航並避障,經測試導航更平滑且碰撞更少。
本研究探索在真實冬季駕駛條件下,漂移何時可能成為安全最優選擇。團隊提出一種具備漂移能力的非線性模型預測控制(MPC)系統,基於碰撞致死數據設計場景,並在高保真模擬器中測試。控制器能在後輪遇到冰面時自然啓動並維持漂移以保持道路,或避開滑入車道的對向車輛。與基準電子穩定控制(ESC)系統對比顯示,漂移控制器可在危險冬季駕駛場景中通過穩定性與可控性的權衡實現精確操控。蒙特卡洛研究進一步表明,該控制器在多個速度下實現更低的車道誤差中位數,且漂移主要在高速度時湧現。
現有遙操作系統通常針對特定的機器人硬件和任務領域定製,限制了可擴展性和適應性。ModPack提出了一種模塊化、可擴展的遙操作系統,通過集成計算、電源、通信和存儲的可穿戴“背包”作為核心,支持即插即用功能模塊,包括帶觸覺反饋的關節級遙操作、移動操作和主動感知。在兩個不同機器人平台上的實驗表明,ModPack為數據收集和策略學習提供了靈活且可複用的框架,並已開源全部硬件和軟件設計。
提出一種基於稀疏像素級監督的統一變分框架用於圖像分割,採用單純形約束的Potts模型和平滑周長正則化子,得到凸且平滑的能量泛函,可用於弱監督深度學習訓練損失或迭代優化。在RKHS中通過函數擴展構建模糊隸屬函數處理稀疏標籤,實驗表明優於基線和部分交叉熵方法。
該研究指出,跨數據集泛化是超聲心動圖左心室分割臨牀部署的主要障礙。通過六個數據集的分析,發現幾何感知預處理能顯著改善域偏移,表明偏移主要源於視野和框架不一致,而非聲學差異。強度歸一化影響甚微。使用特定表示的距離度量可高精度預測分割性能下降。
該研究引入病理學家注意力來訓練報告生成模型,通過收集121例前列腺全切片圖像的多模態注意力數據集,優化模型注意力對齊,提升了報告生成和視覺問答的性能。
本文提出了一種輕量級語義分割網絡EGRNet,通過深度可分離卷積、擴張殘差塊和新型邊緣門控細化(EGR)模塊,在僅0.46M參數下實現Cityscapes數據集上65.28%的mIoU,並引入輕量級對抗攻擊檢測策略,適用於邊緣設備上的實時應用。
VQ-Transplant提出了一種輕量級框架,能夠將新的向量量化模塊無縫集成到凍結的預訓練分詞器中,無需昂貴的端到端重訓練。通過在ImageNet-1k上僅訓練5個epoch的輕量級解碼器適配策略,該方法解決了量化不匹配問題,在VAR等工業級模型上實現了接近最先進的重建保真度,同時訓練成本降低95%。這降低了量化研究門檻,使資源受限環境中的研究者也能探索前沿技術。
本文提出ChronoStitch,一種無需訓練的方法,用於組合獨立存儲的視覺鍵值(KV)記憶,以解決長視頻問答中的時域推理問題。該方法通過將存儲的旋轉後鍵重新映射到全局多模態RoPE座標系,並選擇性重計算部分高偏差視覺令牌,克服了樸素拼接導致的時間相位衝突和內容缺失。實驗表明,在Qwen2.5-VL-3B和TempCompass時域分割上,ChronoStitch在事件順序準確性上優於樸素組合和僅位置變體,且速度比完整聯合預填充快3.3倍。
該研究評估了使用合成和派生圖像提升YOLOv8n垃圾檢測器性能的效果。真實數據集包含148張校園照片,實驗發現所有合成增強方案均未超過僅使用真實圖像的基線模型([email protected]為0.691)。手部複合實驗因測試集污染而重建,校正後效果不顯著。研究強調測試集規模小限制了結論的可靠性。
本文提出D3VL,一種新型多模態大語言模型框架,融合2D和3D時序數據以提升自動駕駛場景理解。該模型在KITTI問答數據集上相比基線方法提升11%,並引入Waymo QA數據集擴展以評估3D和時間序列處理能力。
Crowd4D是首個場景感知的4D人羣重建框架,通過聯合優化單目RGB視頻中的人羣與場景,利用人-場景交互代理(HSIP)解決尺度與位置對齊難題,引入人羣結構相干性正則化(CSCR)提升遮擋下的時間穩定性,在複雜大場景中優於現有方法。
本文提出一種新穎方法,通過分析壓縮比特流而非解碼像素來實時檢測AI生成視頻。該方法利用編解碼器已寫入的運動場數據,實現流式感知,並支持隨時決策。在GenVidBench上,該方法僅用像素CNN五分之一數量級的計算量即達到0.64 AUC,同時通過延遲15%的片段將準確率從0.75提升至0.78,計算量減少7倍。
HIPE-2026共享任務引入了從多語言歷史報紙中抽取人物-地點關係的新賽道。DS@GT HIPE團隊探索了在不使用預訓練語言模型的情況下,輕量級可解釋系統的性能上限。該系統基於依賴解析構建文檔級圖,提取鄰近和詞性特徵,使用小型scikit-learn集成或緊湊圖注意力網絡進行分類,參數量低於847K。在官方評估中,最佳運行達到宏召回率0.5142,效率排名第3,準確率中等。關鍵發現:最小字符距離單獨即可捕獲大部分信號,額外特徵帶來不一致的收益;文檔分組交叉驗證對於避免數據泄露至關重要。
強化學習在顯式思維鏈推理器中的成功帶來了測試時擴展,但計算成本高昂。潛在推理使用連續向量進行中間計算,效率更高,但受限於模仿學習。本文提出替代潛在策略優化(SLPO),將結果獎勵強化學習引入自迴歸潛在推理器,通過替代策略密度進行軌跡級信用分配,並利用正確性監督的停止頭實現可變視界策略。實驗表明,SLPO在連續和軟思考設置下均能提升Pass@k,併為更難的實例分配更長的潛在計算,從而提高確定性準確率。
提出多掩碼擴散模型(MultiMDM),通過引入多個掩碼狀態解決傳統掩碼擴散模型在少步生成中終端熵為零的問題,實現高質量少步文本生成。
提出一種基於推理的無參考框架,通過NLI和超圖結構審計LLM推理軌跡,在數學和醫療推理中比直接使用LLM評判更可靠。
一篇新論文識別了一種名為“適應性的投降”的LLM失敗模式,即模型先確認用户感受到的社會不公,然後卻詳細提供其名義上勸阻的獲取途徑。該研究對三個商業LLM進行了900次測試,提出了最小重歸因充分性(MRS)設計原則。
研究表明,小語言模型在任務能力上表現良好,但在指令與常規任務行為衝突時,往往會忽略非標準指令。隨着模型規模增大,標準準確率和指令遵循能力均有所提升,但兩者之間的差距依然存在。這證明任務完成能力和指令遵循是兩種不同的能力。
研究者探索了使用超網絡在訓練時將大規模事實知識注入大語言模型,並首次系統研究了超網絡架構的縮放行為。實驗表明,超網絡注入在損失、推理準確率及OOD泛化上遵循冪律縮放,且隨着規模增大,OOD泛化表現可靠,優於LoRA微調和全微調。他們創建了包含數千萬多跳問答樣本的MegaWikiQA數據集。
本文首次正式定義了結構泛化,並證明在標準計算複雜性假設下,純Transformer無法學習結構泛化,而神經符號系統通過硬編碼語義投影取得高分。
研究發現,監督微調(SFT)在將大語言模型適配到下游任務時,會顯著降低其行為多樣性,尤其是在順序決策任務中。通過在井字棋變體等確定性棋盤遊戲上的實驗,作者指出推理模式生成常常抑制動作多樣性,而標準SFT雖然提高準確率,卻導致過早的多樣性崩潰。動作增強(即訓練所有最優動作而非單一動作)可部分緩解這一問題。
現有大語言模型安全護欄僅獨立評估每輪對話,忽略了對話過程中良性輪次累積導致的危害。本文提出對話風險累積(CRA)概念及會話層框架,跟蹤語義漂移、敏感信息累積和順從度梯度三個軌跡信號,併發布CRA-Bench基準和評估協議。
該工作將一維單掃描神經算子研究擴展到二維,使用傅里葉神經算子(FNO)和U型神經算子(UNO)構建代理模型。研究了三種代理:直接映射材料與源場到通量的FNO和UNO,以及額外輸入單掃描近似通量的FNO。通過離散縱座標求解器驗證,採用平均相對L_2誤差評估。探討單掃描輸入是否提高精度及對數通量訓練是否改善強衰減區域的精度。
該研究將分箱頻譜損失函數擴展到非結構化網格的替代模型,利用圖拉普拉斯頻帶代替傅里葉頻帶,並提出了可擴展的切比雪夫和多層近似方法,以改善長時滾動的保真度。實驗結果表明,該方法在非結構化網格上預測湍流時,優於確定性基線,提高了長時滾動保真度並保持了統計不變量。
研究發現,稀疏自編碼器(SAE)的自動可解釋性得分受評估流程選擇的影響遠大於架構差異,導致跨論文比較可能反映的是流程而非架構的差異。
本文提出STN-TGAT模型,結合時間Transformer和圖注意力網絡,利用NMI先驗圖和軟閾值稀疏化機制,在真實投資環境下進行股票排名和投資組合構建,實驗表明其在預測準確性和投資回報上優於基線模型。
本文提出SUM,一種純服務器端框架,通過在聚合過程中對自適應向量進行幾何手術,同時緩解聯邦類增量學習中的空間干擾和時間干擾,無需額外客户端計算或通信,在多個基準測試上實現高達22%的性能提升。
該研究探討了在自適應時間序列預測中,利用可解釋性作為理解持續學習的關鍵工具。通過持續學習和經驗回放策略,研究分析了PatchMixer、PatchTST和DLinear等神經預測架構,並採用注意力展開和梯度歸因方法(Grad-CAM)來解釋預測行為和採樣策略。實驗基於真實世界的地下水時間序列數據,揭示了可解釋性在非平穩預測場景中的挑戰和機遇。