我曾说我对测试一无所知,但我的仓库里有342个测试
一位没有编程背景的“氛围编码者”在AI辅助下完成项目后,惊讶地发现AI自动编写了342个自动化测试。文章深入探讨了技术债务、手工测试的盲点,以及测试对于非程序员批量运行AI代码的关键作用。
- 作者完全依赖AI写代码,最初认为只要程序能运行就没问题,但后来理解了技术债务的含义。
- 一次数据事故中,AI写的修复工具几乎造成更严重的问题,暴露了无测试环境的脆弱性。
主题流
研究动态揭示下一批产品能力和基础设施需求。这里跟踪论文、基准、数据集、实验系统、实验室发布和开源复现,重点关注哪些结果可能进入模型训练、Agent 系统、机器人或开发者工具。
一位没有编程背景的“氛围编码者”在AI辅助下完成项目后,惊讶地发现AI自动编写了342个自动化测试。文章深入探讨了技术债务、手工测试的盲点,以及测试对于非程序员批量运行AI代码的关键作用。
Anthropic的Claude系列包括聊天机器人、编码代理和工作流程代理。Claude Code专注于软件开发,Claude Cowork处理计算机任务。文章通过汽车类比解释Haiku、Sonnet、Opus、Fable和Mythos等模型,并讨论了代理作为力量倍增器的潜力以及监督和安全的重要性。
本文介绍了七款比Claude Code更便宜、更快速的替代工具,包括开源选项、本地模型支持、MCP集成以及更好的上下文控制。
Mindrift(Toloka AI)正在招聘一名高级软件工程师,专注于AI智能体的评估工作。
在一场由多个AI模型参与的辩论中,探讨了AI原生工具对独立开发者的影响。辩论达成共识:执行成本崩溃,但发现成为关键瓶颈。分歧在于替代编码的护城河是什么——人际关系还是成为默认的AI工作流。
作者从元认识论角度论证,哲学期刊和学术通信应拒绝AI生成的文本,因为人类专家的措辞选择(即使细微)反映了对议题的深层敏感性,而LLM的输出会模糊这种专业性。通过分析《克拉拉与太阳》案例,展示了AI改写如何丢失关键哲学微妙性。最后提出适当使用LLM辅助编辑的建议。
Gigatoken 是斯坦福博士生 Marcel Rød 开发的一款 MIT 许可的 Rust BPE 分词器,在 144 核 AMD EPYC 9565 上以 24.53 GB/s 的速度对 GPT-2 进行分词,比 HuggingFace tokenizers 快 989 倍,比 tiktoken 快 681 倍。其速度提升并非来自更快的 BPE 合并循环,而是来自手写的 SWAR 预分词器和预分词缓存。支持 23 种分词器家族,但 SentencePiece 词汇表的速度提升仅为 7–22 倍。兼容模式可保持精确输出一致,但速度约为 200–300 倍。
Parker和Tom等9位经济学家合著了一篇关于递归自我改进(RSI)的论文,通过简单模型分析AI如何加速AI研发。文章强调了RSI的不同定义、反馈效应强度对能力加速的影响,以及实验室应发布更多相关数据。
Ours.network 推出了 ours-mcp,这是一种让 AI 智能体无需人类干预即可直接通信的工具。它简化了设置过程,通过一个可安装的 MCP 服务器,让智能体通过一次性邀请连接,避免了手动复制粘贴的繁琐。功能包括端到端加密、用于隐私保护的盲中继,以及完全的人工控制。该工具处于早期 alpha 阶段,源代码可用,专为跨不同运行时(如 Claude Code 和 Codex)的智能体间通信而设计。
曼彻斯特大学和杜伦大学的研究发现,AI聊天机器人在日常情感支持方面可以匹配甚至超越人类,尤其是在愤怒和恐惧情境中。研究强调,提供具体、可操作的建议是有效支持的关键,无论来自人类还是AI。
BeamWire 提供个性化的、无广告的每日新闻简报,以电子邮件和播客形式发送,包含事实核查、偏见检测和可定制主题。它提供多种新闻和专题“光束”(Beams),涵盖不同兴趣,并配有AI主播和语调定制。价格从免费开始。
Python 包索引(PyPI)现已实施新安全措施:拒绝向超过14天的旧版本上传新文件。此举旨在防止因发布令牌或工作流泄露导致的供应链攻击。
Orphograph 为 AI 代理的每个关键操作生成锚定到比特币区块链的收据,确保记录的存在时间不可篡改,且无需信任操作者即可验证。
Searchdesk是一款AI求职助手,它能自动搜索真实职位、基于事实定制申请材料,并让用户在私人工作区中掌控每一个机会。所有草稿均由用户审核,不会自动提交申请。目前处于Alpha阶段,欢迎反馈。
本文提出EgoRecovery框架,利用人类第一人称视频数据训练机器人故障恢复策略,比传统遥操作效率高10倍以上,通过协同训练对齐人类与机器人纠正意图,仅需少量机器人演示即可实现可靠恢复。
研究人员提出了一种名为Morphing MILR的线驱动无肢机器人,它通过滚动关节重新配置身体形态和柔顺性,实现了侧向波动、侧绕、滚动和扭转等多种运动模式。该机器人利用分布式线驱动和可编程被动柔顺性,无需复杂传感即可实现稳健的接触丰富运动。潜在应用包括搜索救援、环境监测和检查。
研究人员提出了一种名为“接触持续全驱动”的控制理论框架,用于评估无人机在物理接触过程中的操作能力。该框架通过残差权柄集和残差权限边界等概念,超越了传统的全驱动机器人仅通过矩阵秩判据的认证方式。数值实验表明,对于倾斜六旋翼无人机,仅满足满秩条件并不能保证接触操作的可行性,而适当的倾斜角度能保留残差权限。
本文提出一种去中心化的、抗欺骗的轨迹规划框架,用于应对小型无人机系统在远程ID(RID)位置欺骗攻击下的运行。该框架将RID信息视为未验证,并通过物理层观测(如接收信号强度)检测欺骗并概率定位欺骗源,将不确定性转化为机会约束下的风险有界不安全区域,集成到基于马尔可夫决策过程的规划器中。仿真表明,与信任RID数据的规划器相比,该方法减少了近碰撞事件,同时保持实时计算效率。
尽管通用机器人操作取得进展,现实世界中多物体杂乱环境仍具挑战。LENS作为一种即插即用的解决方案,利用大语言模型自动生成场景特定的简化抽象表示,通过合并或修剪实体来适应任务进展,从而提升各种操作方法的性能。
提出一种基于学习来自触觉(LfH)的框架,通过稀疏演示学习用户偏好的安全干预策略,采用可微控制屏障函数(CBF)优化层自动调整安全参数,实验表明能有效减少触觉反馈与用户偏好的不匹配。
盲人和低视力人群依赖导盲犬进行实时导航,但传统导盲犬成本高、等待时间长、寿命短。米洛(Milo)是一种基于Unitree Go2机器人的开源、低成本(约2000美元)的全自主机器人导盲犬平台,无需预先环境扫描,可室内外导航并避障,经测试导航更平滑且碰撞更少。
本研究探索在真实冬季驾驶条件下,漂移何时可能成为安全最优选择。团队提出一种具备漂移能力的非线性模型预测控制(MPC)系统,基于碰撞致死数据设计场景,并在高保真模拟器中测试。控制器能在后轮遇到冰面时自然启动并维持漂移以保持道路,或避开滑入车道的对向车辆。与基准电子稳定控制(ESC)系统对比显示,漂移控制器可在危险冬季驾驶场景中通过稳定性与可控性的权衡实现精确操控。蒙特卡洛研究进一步表明,该控制器在多个速度下实现更低的车道误差中位数,且漂移主要在高速度时涌现。
现有遥操作系统通常针对特定的机器人硬件和任务领域定制,限制了可扩展性和适应性。ModPack提出了一种模块化、可扩展的遥操作系统,通过集成计算、电源、通信和存储的可穿戴“背包”作为核心,支持即插即用功能模块,包括带触觉反馈的关节级遥操作、移动操作和主动感知。在两个不同机器人平台上的实验表明,ModPack为数据收集和策略学习提供了灵活且可复用的框架,并已开源全部硬件和软件设计。
提出一种基于稀疏像素级监督的统一变分框架用于图像分割,采用单纯形约束的Potts模型和平滑周长正则化子,得到凸且平滑的能量泛函,可用于弱监督深度学习训练损失或迭代优化。在RKHS中通过函数扩展构建模糊隶属函数处理稀疏标签,实验表明优于基线和部分交叉熵方法。
该研究指出,跨数据集泛化是超声心动图左心室分割临床部署的主要障碍。通过六个数据集的分析,发现几何感知预处理能显著改善域偏移,表明偏移主要源于视野和框架不一致,而非声学差异。强度归一化影响甚微。使用特定表示的距离度量可高精度预测分割性能下降。
该研究引入病理学家注意力来训练报告生成模型,通过收集121例前列腺全切片图像的多模态注意力数据集,优化模型注意力对齐,提升了报告生成和视觉问答的性能。
本文提出了一种轻量级语义分割网络EGRNet,通过深度可分离卷积、扩张残差块和新型边缘门控细化(EGR)模块,在仅0.46M参数下实现Cityscapes数据集上65.28%的mIoU,并引入轻量级对抗攻击检测策略,适用于边缘设备上的实时应用。
VQ-Transplant提出了一种轻量级框架,能够将新的向量量化模块无缝集成到冻结的预训练分词器中,无需昂贵的端到端重训练。通过在ImageNet-1k上仅训练5个epoch的轻量级解码器适配策略,该方法解决了量化不匹配问题,在VAR等工业级模型上实现了接近最先进的重建保真度,同时训练成本降低95%。这降低了量化研究门槛,使资源受限环境中的研究者也能探索前沿技术。
本文提出ChronoStitch,一种无需训练的方法,用于组合独立存储的视觉键值(KV)记忆,以解决长视频问答中的时域推理问题。该方法通过将存储的旋转后键重新映射到全局多模态RoPE坐标系,并选择性重计算部分高偏差视觉令牌,克服了朴素拼接导致的时间相位冲突和内容缺失。实验表明,在Qwen2.5-VL-3B和TempCompass时域分割上,ChronoStitch在事件顺序准确性上优于朴素组合和仅位置变体,且速度比完整联合预填充快3.3倍。
该研究评估了使用合成和派生图像提升YOLOv8n垃圾检测器性能的效果。真实数据集包含148张校园照片,实验发现所有合成增强方案均未超过仅使用真实图像的基线模型([email protected]为0.691)。手部复合实验因测试集污染而重建,校正后效果不显著。研究强调测试集规模小限制了结论的可靠性。
本文提出D3VL,一种新型多模态大语言模型框架,融合2D和3D时序数据以提升自动驾驶场景理解。该模型在KITTI问答数据集上相比基线方法提升11%,并引入Waymo QA数据集扩展以评估3D和时间序列处理能力。
Crowd4D是首个场景感知的4D人群重建框架,通过联合优化单目RGB视频中的人群与场景,利用人-场景交互代理(HSIP)解决尺度与位置对齐难题,引入人群结构相干性正则化(CSCR)提升遮挡下的时间稳定性,在复杂大场景中优于现有方法。
本文提出一种新颖方法,通过分析压缩比特流而非解码像素来实时检测AI生成视频。该方法利用编解码器已写入的运动场数据,实现流式感知,并支持随时决策。在GenVidBench上,该方法仅用像素CNN五分之一数量级的计算量即达到0.64 AUC,同时通过延迟15%的片段将准确率从0.75提升至0.78,计算量减少7倍。
HIPE-2026共享任务引入了从多语言历史报纸中抽取人物-地点关系的新赛道。DS@GT HIPE团队探索了在不使用预训练语言模型的情况下,轻量级可解释系统的性能上限。该系统基于依赖解析构建文档级图,提取邻近和词性特征,使用小型scikit-learn集成或紧凑图注意力网络进行分类,参数量低于847K。在官方评估中,最佳运行达到宏召回率0.5142,效率排名第3,准确率中等。关键发现:最小字符距离单独即可捕获大部分信号,额外特征带来不一致的收益;文档分组交叉验证对于避免数据泄露至关重要。
强化学习在显式思维链推理器中的成功带来了测试时扩展,但计算成本高昂。潜在推理使用连续向量进行中间计算,效率更高,但受限于模仿学习。本文提出替代潜在策略优化(SLPO),将结果奖励强化学习引入自回归潜在推理器,通过替代策略密度进行轨迹级信用分配,并利用正确性监督的停止头实现可变视界策略。实验表明,SLPO在连续和软思考设置下均能提升Pass@k,并为更难的实例分配更长的潜在计算,从而提高确定性准确率。
提出多掩码扩散模型(MultiMDM),通过引入多个掩码状态解决传统掩码扩散模型在少步生成中终端熵为零的问题,实现高质量少步文本生成。
提出一种基于推理的无参考框架,通过NLI和超图结构审计LLM推理轨迹,在数学和医疗推理中比直接使用LLM评判更可靠。
一篇新论文识别了一种名为“适应性的投降”的LLM失败模式,即模型先确认用户感受到的社会不公,然后却详细提供其名义上劝阻的获取途径。该研究对三个商业LLM进行了900次测试,提出了最小重归因充分性(MRS)设计原则。
研究表明,小语言模型在任务能力上表现良好,但在指令与常规任务行为冲突时,往往会忽略非标准指令。随着模型规模增大,标准准确率和指令遵循能力均有所提升,但两者之间的差距依然存在。这证明任务完成能力和指令遵循是两种不同的能力。
研究者探索了使用超网络在训练时将大规模事实知识注入大语言模型,并首次系统研究了超网络架构的缩放行为。实验表明,超网络注入在损失、推理准确率及OOD泛化上遵循幂律缩放,且随着规模增大,OOD泛化表现可靠,优于LoRA微调和全微调。他们创建了包含数千万多跳问答样本的MegaWikiQA数据集。
本文首次正式定义了结构泛化,并证明在标准计算复杂性假设下,纯Transformer无法学习结构泛化,而神经符号系统通过硬编码语义投影取得高分。
研究发现,监督微调(SFT)在将大语言模型适配到下游任务时,会显著降低其行为多样性,尤其是在顺序决策任务中。通过在井字棋变体等确定性棋盘游戏上的实验,作者指出推理模式生成常常抑制动作多样性,而标准SFT虽然提高准确率,却导致过早的多样性崩溃。动作增强(即训练所有最优动作而非单一动作)可部分缓解这一问题。
现有大语言模型安全护栏仅独立评估每轮对话,忽略了对话过程中良性轮次累积导致的危害。本文提出对话风险累积(CRA)概念及会话层框架,跟踪语义漂移、敏感信息累积和顺从度梯度三个轨迹信号,并发布CRA-Bench基准和评估协议。
该工作将一维单扫描神经算子研究扩展到二维,使用傅里叶神经算子(FNO)和U型神经算子(UNO)构建代理模型。研究了三种代理:直接映射材料与源场到通量的FNO和UNO,以及额外输入单扫描近似通量的FNO。通过离散纵坐标求解器验证,采用平均相对L_2误差评估。探讨单扫描输入是否提高精度及对数通量训练是否改善强衰减区域的精度。
该研究将分箱频谱损失函数扩展到非结构化网格的替代模型,利用图拉普拉斯频带代替傅里叶频带,并提出了可扩展的切比雪夫和多层近似方法,以改善长时滚动的保真度。实验结果表明,该方法在非结构化网格上预测湍流时,优于确定性基线,提高了长时滚动保真度并保持了统计不变量。
研究发现,稀疏自编码器(SAE)的自动可解释性得分受评估流程选择的影响远大于架构差异,导致跨论文比较可能反映的是流程而非架构的差异。
本文提出STN-TGAT模型,结合时间Transformer和图注意力网络,利用NMI先验图和软阈值稀疏化机制,在真实投资环境下进行股票排名和投资组合构建,实验表明其在预测准确性和投资回报上优于基线模型。
本文提出SUM,一种纯服务器端框架,通过在聚合过程中对自适应向量进行几何手术,同时缓解联邦类增量学习中的空间干扰和时间干扰,无需额外客户端计算或通信,在多个基准测试上实现高达22%的性能提升。
该研究探讨了在自适应时间序列预测中,利用可解释性作为理解持续学习的关键工具。通过持续学习和经验回放策略,研究分析了PatchMixer、PatchTST和DLinear等神经预测架构,并采用注意力展开和梯度归因方法(Grad-CAM)来解释预测行为和采样策略。实验基于真实世界的地下水时间序列数据,揭示了可解释性在非平稳预测场景中的挑战和机遇。
空气污染每年导致约790万人过早死亡,准确预测成为公共卫生优先事项。现有基准在地域范围和污染物覆盖上过于狭窄,且未评估最新时间序列基础模型。本研究提出Air Quality Arena (AQA),一个覆盖7个国家、4大洲、6种主要污染物、超过14,000个站点-污染物序列的大规模多国数据集和基准。通过11个时间序列基础模型和经典基线评估,结果表明时间序列基础模型在零样本预测中有效且持续优于经典基线,最佳模型采用跨模态架构,利用视觉基础模型进行时间序列预测。数据集和基准已公开发布。