AI News HubLIVE

研究动态

Gigatoken:一款 Rust BPE 分词器,编码速度高达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍

Gigatoken 是斯坦福博士生 Marcel Rød 开发的一款 MIT 许可的 Rust BPE 分词器,在 144 核 AMD EPYC 9565 上以 24.53 GB/s 的速度对 GPT-2 进行分词,比 HuggingFace tokenizers 快 989 倍,比 tiktoken 快 681 倍。其速度提升并非来自更快的 BPE 合并循环,而是来自手写的 SWAR 预分词器和预分词缓存。支持 23 种分词器家族,但 SentencePiece 词汇表的速度提升仅为 7–22 倍。兼容模式可保持精确输出一致,但速度约为 200–300 倍。

  • Gigatoken 在 144 核 AMD EPYC 9565 上达到 24.53 GB/s,比 HuggingFace tokenizers 快 989 倍,比 tiktoken 快 681 倍。
  • 速度提升来自手写 SWAR 预分词器和预分词缓存,而非更快的 BPE 合并循环。
站内正文

递归自我改进的经济学

Parker和Tom等9位经济学家合著了一篇关于递归自我改进(RSI)的论文,通过简单模型分析AI如何加速AI研发。文章强调了RSI的不同定义、反馈效应强度对能力加速的影响,以及实验室应发布更多相关数据。

  • RSI指模型能力对模型改进的反馈,但反馈强度不同导致定义分歧。
  • 论文将反馈效应分解,量化整体反馈强度,最不确定的是模型能力如何影响算法进步速度。
站内正文

Show HN: Ours.network – 让你的AI智能体直接相连

Ours.network 推出了 ours-mcp,这是一种让 AI 智能体无需人类干预即可直接通信的工具。它简化了设置过程,通过一个可安装的 MCP 服务器,让智能体通过一次性邀请连接,避免了手动复制粘贴的繁琐。功能包括端到端加密、用于隐私保护的盲中继,以及完全的人工控制。该工具处于早期 alpha 阶段,源代码可用,专为跨不同运行时(如 Claude Code 和 Codex)的智能体间通信而设计。

  • Ours-mcp 消除了人类在 AI 智能体之间转发消息的需求,建立了直接连接。
  • 设置快速:安装 MCP 服务器、生成邀请、连接智能体,大约两分钟即可完成。
站内正文

AI聊天机器人在情感支持方面可与人类媲美,有时甚至更胜一筹

曼彻斯特大学和杜伦大学的研究发现,AI聊天机器人在日常情感支持方面可以匹配甚至超越人类,尤其是在愤怒和恐惧情境中。研究强调,提供具体、可操作的建议是有效支持的关键,无论来自人类还是AI。

  • AI聊天机器人在愤怒和恐惧情境中提供的情感支持被认为比人类更有效。
  • 具体、可操作的建议(如呼吸技巧、逐步重构思维)是提升支持质量的关键。
站内正文

我为妻子构建了一个无广告、事实核查并标记偏见的新简报

BeamWire 提供个性化的、无广告的每日新闻简报,以电子邮件和播客形式发送,包含事实核查、偏见检测和可定制主题。它提供多种新闻和专题“光束”(Beams),涵盖不同兴趣,并配有AI主播和语调定制。价格从免费开始。

  • BeamWire 以电子邮件和播客形式提供每日精选新闻简报,无广告,去除偏见。
  • 用户可以选择预建的光束(主题)或创建自定义光束,配备AI主播和语调选项。
站内正文

PyPI 新规:发布超过14天的版本将无法上传新文件

Python 包索引(PyPI)现已实施新安全措施:拒绝向超过14天的旧版本上传新文件。此举旨在防止因发布令牌或工作流泄露导致的供应链攻击。

  • PyPI 拒绝向发布超过14天的版本上传新文件。
  • 该限制是为了防止旧版本被恶意篡改。
站内正文

AI代理操作的公开可验证收据,锚定到比特币

Orphograph 为 AI 代理的每个关键操作生成锚定到比特币区块链的收据,确保记录的存在时间不可篡改,且无需信任操作者即可验证。

  • 自主操作日志可由操作者随意篡改,不能作为可靠证据。
  • 通过将操作记录的哈希锚定到比特币区块链,收据可提供时间戳和防篡改证明。
站内正文

Show HN: Searchdesk — AI驱动的求职工具,自动定制简历和求职信

Searchdesk是一款AI求职助手,它能自动搜索真实职位、基于事实定制申请材料,并让用户在私人工作区中掌控每一个机会。所有草稿均由用户审核,不会自动提交申请。目前处于Alpha阶段,欢迎反馈。

  • Searchdesk自动研究公开职位,结合用户资料生成定制化的简历和求职信。
  • 用户始终拥有最终决定权,AI不会自动提交任何申请。
站内正文

超声心动图域偏移:跨数据集左心室分割的可解释量化与预测

该研究指出,跨数据集泛化是超声心动图左心室分割临床部署的主要障碍。通过六个数据集的分析,发现几何感知预处理能显著改善域偏移,表明偏移主要源于视野和框架不一致,而非声学差异。强度归一化影响甚微。使用特定表示的距离度量可高精度预测分割性能下降。

  • 几何感知预处理可减少超声心动图域偏移,因其主要源于视野和框架差异。
  • 基于区域无关特征的转移风险监测可达约70%的解释力。
站内正文

用于前列腺组织病理学的病理学家注意力对齐报告生成

该研究引入病理学家注意力来训练报告生成模型,通过收集121例前列腺全切片图像的多模态注意力数据集,优化模型注意力对齐,提升了报告生成和视觉问答的性能。

  • 收集了121例前列腺WSI的病理学家多尺度视口轨迹、口头描述和光标移动数据集
  • 使用注意力对齐损失微调两个报告生成模型,使模型注意力匹配病理学家注意力分布
站内正文

EGRNet:一种带有边缘门控细化和对抗性感知的轻量级语义分割网络

本文提出了一种轻量级语义分割网络EGRNet,通过深度可分离卷积、扩张残差块和新型边缘门控细化(EGR)模块,在仅0.46M参数下实现Cityscapes数据集上65.28%的mIoU,并引入轻量级对抗攻击检测策略,适用于边缘设备上的实时应用。

  • EGRNet仅0.46M参数,在Cityscapes上达到65.28% mIoU
  • 提出边缘门控细化(EGR)模块,通过可学习门控机制融合特征,增强边界保留
站内正文

VQ-Transplant: 针对预训练视觉分词器的高效VQ模块集成方法

VQ-Transplant提出了一种轻量级框架,能够将新的向量量化模块无缝集成到冻结的预训练分词器中,无需昂贵的端到端重训练。通过在ImageNet-1k上仅训练5个epoch的轻量级解码器适配策略,该方法解决了量化不匹配问题,在VAR等工业级模型上实现了接近最先进的重建保真度,同时训练成本降低95%。这降低了量化研究门槛,使资源受限环境中的研究者也能探索前沿技术。

  • VQ-Transplant允许在不重新训练编码器-解码器的情况下替换量化模块。
  • 轻量级解码器适配只需在ImageNet-1k上训练5个epoch。
站内正文

ChronoStitch:无需训练的视觉KV记忆组合方法实现长时域推理

本文提出ChronoStitch,一种无需训练的方法,用于组合独立存储的视觉键值(KV)记忆,以解决长视频问答中的时域推理问题。该方法通过将存储的旋转后键重新映射到全局多模态RoPE坐标系,并选择性重计算部分高偏差视觉令牌,克服了朴素拼接导致的时间相位冲突和内容缺失。实验表明,在Qwen2.5-VL-3B和TempCompass时域分割上,ChronoStitch在事件顺序准确性上优于朴素组合和仅位置变体,且速度比完整联合预填充快3.3倍。

  • 长视频问答需要模型随时间保存视觉证据,KV缓存是一种实用方法,但独立缓存拼接会丢失全局时间顺序。
  • ChronoStitch通过重新基于全局三轴多模态RoPE坐标系调整键,并选择性重计算高偏差令牌,实现了无需训练的记忆组合。
站内正文

基于合成与派生训练图像的校园垃圾检测:YOLOv8n多种子评估

该研究评估了使用合成和派生图像提升YOLOv8n垃圾检测器性能的效果。真实数据集包含148张校园照片,实验发现所有合成增强方案均未超过仅使用真实图像的基线模型([email protected]为0.691)。手部复合实验因测试集污染而重建,校正后效果不显著。研究强调测试集规模小限制了结论的可靠性。

  • 仅使用真实图像的YOLOv8n模型达到[email protected]为0.691,所有合成数据方案均未超越此基线。
  • 背景替换、隔离物体等合成方法反而降低了检测精度,最高仅0.680。
站内正文

D3VL:利用语言模型理解3D时序数据和视频中的驾驶场景

本文提出D3VL,一种新型多模态大语言模型框架,融合2D和3D时序数据以提升自动驾驶场景理解。该模型在KITTI问答数据集上相比基线方法提升11%,并引入Waymo QA数据集扩展以评估3D和时间序列处理能力。

  • D3VL是首个将2D和3D时序数据集成到统一架构中的MLLM框架。
  • 在KITTI问答数据集上准确率提升11%。
站内正文

Crowd4D:场景感知的单目4D人群重建

Crowd4D是首个场景感知的4D人群重建框架,通过联合优化单目RGB视频中的人群与场景,利用人-场景交互代理(HSIP)解决尺度与位置对齐难题,引入人群结构相干性正则化(CSCR)提升遮挡下的时间稳定性,在复杂大场景中优于现有方法。

  • 首次提出联合优化人群与场景的单目4D重建框架,显式利用场景几何。
  • 引入人-场景交互代理(HSIP)作为中间表示,解决尺度与位置对齐。
站内正文

尽早检测,极少升级:从压缩比特流中实时检测AI生成视频

本文提出一种新颖方法,通过分析压缩比特流而非解码像素来实时检测AI生成视频。该方法利用编解码器已写入的运动场数据,实现流式感知,并支持随时决策。在GenVidBench上,该方法仅用像素CNN五分之一数量级的计算量即达到0.64 AUC,同时通过延迟15%的片段将准确率从0.75提升至0.78,计算量减少7倍。

  • 将AI视频检测重新定义为从压缩比特流的流式感知
  • 利用编解码器中已有的运动场,仅需解析而非像素解码
站内正文

利用依赖图和邻近特征从历史报纸中进行轻量级人物-地点关系抽取

HIPE-2026共享任务引入了从多语言历史报纸中抽取人物-地点关系的新赛道。DS@GT HIPE团队探索了在不使用预训练语言模型的情况下,轻量级可解释系统的性能上限。该系统基于依赖解析构建文档级图,提取邻近和词性特征,使用小型scikit-learn集成或紧凑图注意力网络进行分类,参数量低于847K。在官方评估中,最佳运行达到宏召回率0.5142,效率排名第3,准确率中等。关键发现:最小字符距离单独即可捕获大部分信号,额外特征带来不一致的收益;文档分组交叉验证对于避免数据泄露至关重要。

  • 提出轻量级方法,不使用预训练语言模型,仅用847K以下参数。
  • 最小字符距离是主要信号,额外工程特征收益不稳定。
站内正文

SLPO:通过替代策略扩展潜在推理

强化学习在显式思维链推理器中的成功带来了测试时扩展,但计算成本高昂。潜在推理使用连续向量进行中间计算,效率更高,但受限于模仿学习。本文提出替代潜在策略优化(SLPO),将结果奖励强化学习引入自回归潜在推理器,通过替代策略密度进行轨迹级信用分配,并利用正确性监督的停止头实现可变视界策略。实验表明,SLPO在连续和软思考设置下均能提升Pass@k,并为更难的实例分配更长的潜在计算,从而提高确定性准确率。

  • 潜在推理虽高效但缺乏结果奖励RL训练,SLPO弥补了这一空白。
  • SLPO通过替代策略密度和停止头实现潜在推理器的结果奖励优化。
站内正文

多掩码扩散语言模型用于少步生成

提出多掩码扩散模型(MultiMDM),通过引入多个掩码状态解决传统掩码扩散模型在少步生成中终端熵为零的问题,实现高质量少步文本生成。

  • 传统掩码扩散模型所有正向轨迹收敛到单一全掩码状态,缺乏终端熵,不利于少步生成。
  • MultiMDM在正向过程中将每个干净令牌先推向指定掩码,再在掩码集上混合,使反向过程具备预判能力。
站内正文

开放式问答中推理的无参考评估

提出一种基于推理的无参考框架,通过NLI和超图结构审计LLM推理轨迹,在数学和医疗推理中比直接使用LLM评判更可靠。

  • 提出无参考审计框架,分解推理轨迹并分析前提-目标关系
  • 创建UroReason基准,包含真实临床案例的LLM推理
站内正文

适应性的投降:LLM在脆弱性上下文中的结构性失败模式

一篇新论文识别了一种名为“适应性的投降”的LLM失败模式,即模型先确认用户感受到的社会不公,然后却详细提供其名义上劝阻的获取途径。该研究对三个商业LLM进行了900次测试,提出了最小重归因充分性(MRS)设计原则。

  • 描述了LLM在情感敏感情境中的结构性三难困境
  • 提出了“适应性的投降”这一新的失败模式
站内正文

任务能力并非指令遵循:评估小语言模型中的指令冲突行为

研究表明,小语言模型在任务能力上表现良好,但在指令与常规任务行为冲突时,往往会忽略非标准指令。随着模型规模增大,标准准确率和指令遵循能力均有所提升,但两者之间的差距依然存在。这证明任务完成能力和指令遵循是两种不同的能力。

  • 小模型在冲突指令下仍能保持任务正确率,但常忽略非标准指令。
  • 大模型在标准与非标准指令间的表现差距更明显。
站内正文

基于超网络的大语言模型知识注入的缩放定律

研究者探索了使用超网络在训练时将大规模事实知识注入大语言模型,并首次系统研究了超网络架构的缩放行为。实验表明,超网络注入在损失、推理准确率及OOD泛化上遵循幂律缩放,且随着规模增大,OOD泛化表现可靠,优于LoRA微调和全微调。他们创建了包含数千万多跳问答样本的MegaWikiQA数据集。

  • 超网络可以用于训练时知识注入,生成固定LoRA适配器嵌入目标模型。
  • 设计将超网络的注入能力与目标模型通用能力解耦,实现了缩放定律的严格研究。
站内正文

论结构泛化的计算复杂度

本文首次正式定义了结构泛化,并证明在标准计算复杂性假设下,纯Transformer无法学习结构泛化,而神经符号系统通过硬编码语义投影取得高分。

  • 提出结构泛化的正式数学定义,将组合结构与无限泛化翻译为数学语言。
  • 证明纯Transformer的学习能力上限为TC0,而结构泛化需要NC1能力,因此无法学习。
站内正文

当推理缩小动作空间:LLM游戏中的多样性崩溃

研究发现,监督微调(SFT)在将大语言模型适配到下游任务时,会显著降低其行为多样性,尤其是在顺序决策任务中。通过在井字棋变体等确定性棋盘游戏上的实验,作者指出推理模式生成常常抑制动作多样性,而标准SFT虽然提高准确率,却导致过早的多样性崩溃。动作增强(即训练所有最优动作而非单一动作)可部分缓解这一问题。

  • 监督微调(SFT)会导致大语言模型在决策中过早失去动作多样性。
  • 推理模式生成会抑制动作多样性,但并非总是提高准确率。
站内正文

面向多轮对话大语言模型系统的状态化护栏:对话风险累积框架

现有大语言模型安全护栏仅独立评估每轮对话,忽略了对话过程中良性轮次累积导致的危害。本文提出对话风险累积(CRA)概念及会话层框架,跟踪语义漂移、敏感信息累积和顺从度梯度三个轨迹信号,并发布CRA-Bench基准和评估协议。

  • 提出对话风险累积(CRA)概念,涵盖意图漂移、禁止指令碎片化组装和敏感披露累积。
  • 设计会话层框架,跟踪语义漂移、信息累积图和顺从度梯度。
站内正文

用于二维中子通量估计的神经算子代理

该工作将一维单扫描神经算子研究扩展到二维,使用傅里叶神经算子(FNO)和U型神经算子(UNO)构建代理模型。研究了三种代理:直接映射材料与源场到通量的FNO和UNO,以及额外输入单扫描近似通量的FNO。通过离散纵坐标求解器验证,采用平均相对L_2误差评估。探讨单扫描输入是否提高精度及对数通量训练是否改善强衰减区域的精度。

  • 扩展一维神经算子研究至二维中子通量估计
  • 比较FNO和UNO两种直接映射代理
站内正文

通过分箱频谱损失在非结构化网格上进行混沌动力学的尺度感知学习

该研究将分箱频谱损失函数扩展到非结构化网格的替代模型,利用图拉普拉斯频带代替傅里叶频带,并提出了可扩展的切比雪夫和多层近似方法,以改善长时滚动的保真度。实验结果表明,该方法在非结构化网格上预测湍流时,优于确定性基线,提高了长时滚动保真度并保持了统计不变量。

  • 提出了基于图拉普拉斯频带的分箱频谱损失函数,适用于非结构化网格。
  • 引入切比雪夫多项式图滤波器和多层图架构(GLEAM)来提高计算效率。
站内正文

构建快,评估慢:流程选择主导自动可解释性得分方差

研究发现,稀疏自编码器(SAE)的自动可解释性得分受评估流程选择的影响远大于架构差异,导致跨论文比较可能反映的是流程而非架构的差异。

  • 方法方差在所有指标和模型中超过架构方差
  • 检测指标最稳定,模糊测试不可靠
站内正文

STN-TGAT:基于先验引导图注意力和可学习软阈值稀疏化的Top-K投资组合构建

本文提出STN-TGAT模型,结合时间Transformer和图注意力网络,利用NMI先验图和软阈值稀疏化机制,在真实投资环境下进行股票排名和投资组合构建,实验表明其在预测准确性和投资回报上优于基线模型。

  • STN-TGAT融合时间Transformer与图注意力网络,捕捉长期序列模式和动态股票关系。
  • 引入NMI先验图和可学习软阈值稀疏化机制,增强结构鲁棒性。
站内正文

SUM:面向联邦类增量学习的时空自适应向量统一几何手术

本文提出SUM,一种纯服务器端框架,通过在聚合过程中对自适应向量进行几何手术,同时缓解联邦类增量学习中的空间干扰和时间干扰,无需额外客户端计算或通信,在多个基准测试上实现高达22%的性能提升。

  • 联邦类增量学习(FCIL)面临空间和时间双重干扰,导致灾难性遗忘。
  • SUM将FCIL重新解释为统一多任务学习问题,在服务器端进行几何手术。
站内正文

持续学习在时间序列预测中的可解释性挑战

该研究探讨了在自适应时间序列预测中,利用可解释性作为理解持续学习的关键工具。通过持续学习和经验回放策略,研究分析了PatchMixer、PatchTST和DLinear等神经预测架构,并采用注意力展开和梯度归因方法(Grad-CAM)来解释预测行为和采样策略。实验基于真实世界的地下水时间序列数据,揭示了可解释性在非平稳预测场景中的挑战和机遇。

  • 研究利用可解释性分析持续学习在自适应时间序列预测中的作用。
  • 采用经验回放、注意力展开和Grad-CAM等方法。
站内正文

空气质量竞技场:用于空气质量预测的大规模多区域地面监测数据集与时间序列基础模型基准

空气污染每年导致约790万人过早死亡,准确预测成为公共卫生优先事项。现有基准在地域范围和污染物覆盖上过于狭窄,且未评估最新时间序列基础模型。本研究提出Air Quality Arena (AQA),一个覆盖7个国家、4大洲、6种主要污染物、超过14,000个站点-污染物序列的大规模多国数据集和基准。通过11个时间序列基础模型和经典基线评估,结果表明时间序列基础模型在零样本预测中有效且持续优于经典基线,最佳模型采用跨模态架构,利用视觉基础模型进行时间序列预测。数据集和基准已公开发布。

  • AQA数据集覆盖7国4大洲,含3年6种主要污染物数据,共14,000多个站点-污染物序列。
  • 对11个时间序列基础模型和经典基线进行基准测试,评估短期空气质量预测性能。
站内正文

CruiseBench:面向发动机剩余寿命预测的实飞对齐N-CMAPSS基准

CruiseBench是专为航空发动机剩余寿命预测设计的巡航阶段基准,通过固定协议简化N-CMAPSS数据集,提升模型比较的可重复性。

  • CruiseBench基于N-CMAPSS,提取巡航阶段数据,减少工况干扰。
  • 引入CPM-N-CMAPSS掩码,标识巡航区间。
站内正文

贝叶斯风洞用于模型选择

本研究探讨Transformer能否执行贝叶斯模型选择,即从数据中识别正确的假设类。通过引入贝叶斯风洞环境,使用固定点自由对合等控制设置,作者发现小型Transformer能在纯关系任务中实现接近贝叶斯最优的性能,但在需要算术运算时,使用不透明符号会彻底失败,且该边界在扩大模型规模后依然存在。对前沿LLM的探测显示其定性上符合贝叶斯行为,但校准差距较大。

  • 引入模型选择贝叶斯风洞,提供封闭形式的真实后验概率。
  • 2.8M参数Transformer在固定点自由对合任务中达到0.01比特熵一致。
站内正文

原生多维亚二次算子:通过输入依赖的长卷积实现

论文提出HyenaND,一种直接对多维数据原生几何结构进行操作的亚二次、全局、输入依赖算子。它通过隐式参数化的全局多维卷积核实现,避免了传统注意力或循环模型中的结构破坏问题。CUDA实现nSubQ融合FFT卷积路径,实现O(L log L)缩放加速。在长上下文基因组学、计算机视觉、医学影像和PDE建模中,纯HyenaND堆栈匹配强注意力基线,混合配置超越纯注意力和强循环混合模型。

  • HyenaND是一种新型亚二次算子,可直接处理多维数据原生几何结构,无需光栅化。
  • 采用隐式参数化的全局多维卷积核,实现输入依赖性。
站内正文

面向LLM智能体的轮廓图记忆:通过叙事轮廓实现隐式跨实体遍历

一篇新论文提出了MemHop多跳记忆基准和ProGraph两层记忆架构,结合轮廓扩展和压缩残差,显著提升了LLM智能体的长期记忆能力。ProGraph在MemHop和LoCoMo基准上均取得优异结果,超越现有方法。

  • 提出了MemHop多跳记忆基准,包含1000个问题,覆盖10个社交网络场景,跳数深度1-5,带证据注释。
  • 介绍了ProGraph两层记忆架构:轮廓扩展(隐式实体遍历)和压缩残差(零成本提取精确细节)。
站内正文

LISA:线性索引稀疏注意力助力高效长上下文推理

针对长链思维推理模型在测试时缩放中面临的自注意力二次复杂度问题,本文提出LISA(线性索引稀疏注意力),一种即插即用的注意力替换模块,无需从头预训练。LISA并行集成线性注意力和闪电索引器,通过门控机制融合,将推理复杂度从O(n²)降至O(nM)。在DeepSeek蒸馏Qwen模型上的实验表明,在16K上下文下实现50%推理加速,并在AIME和MATH-500等基准上平均提升5.6%的性能。

  • LISA 将自注意力复杂度从 O(n²) 降低到 O(nM),M << n。
  • 包含线性注意力(长距离记忆)和闪电索引器(选择重要令牌)两个并行组件。
站内正文

面向多目标生成式推荐系统的随机原对偶解码方法

本文提出一种轻量级推理时解码层,用于增强自回归生成式推荐系统,使其在不修改或重新训练模型的情况下支持多目标推荐列表生成。该方法将解码过程建模为在线约束优化问题,通过随机原对偶近似方案动态调整相关性及辅助目标之间的权衡,并提供了约束违反和遗憾的理论保证。离线实验和在线A/B测试显示,该方法在多目标权衡中取得了一致改进,在用户满意度不受影响的情况下辅助目标提升1.8%。

  • 提出一种无需重新训练的推理时解码层,可扩展生成式推荐系统以处理多目标约束。
  • 使用随机原对偶近似实时平衡相关性与辅助目标(如公平性)。
站内正文

大型语言模型的信息辨别能力

一项新研究揭示了大型语言模型(LLM)在整合外部信息时存在显著缺陷:它们几乎无法区分可靠与不可靠的来源,对信息真实性的判断也接近随机水平。研究引入了Learn2Discern框架,通过对13个模型、近67万次试验的测试,发现模型更倾向于依赖来源的流行度而非可靠性,并且无论信息是否接近真相,其更新程度几乎相同。用户调查(n=299)证实,这些缺陷会降低用户信任和使用意愿。研究还提出了一些简单的推理时干预措施,可部分改善信息辨别能力。

  • LLM在信息来源和真实性辨别上表现接近随机。
  • 模型对来源流行度的依赖是可靠性的两倍。
站内正文

FormulaSPIN:自对弈微调用于自然语言到电子表格公式生成

提出FORMULASPIN自对弈框架,利用公式可执行性作为隐性监督,通过两玩家游戏和ExecVote机制,无需额外数据即可提升性能,在NL2FORMULA基准上达到74.9%精确匹配和87.1%执行准确率。

  • 自对弈框架突破了监督微调的瓶颈,无需额外数据即可迭代自我改进。
  • 利用公式的二进制可执行性区分语义错误与有效风格变体,解决原始SPIN的矛盾梯度问题。
站内正文

基于Intel TDX的NVIDIA H100机密GPU推理性能基准测试

一项新研究评估了在NVIDIA H100 GPU上启用机密计算对大型语言模型推理性能的影响。测试使用Mistral-7B和Qwen3-30B-A3B模型,发现机密模式使首令牌延迟平均增加21.8%-27.8%,全局令牌吞吐量下降17.7%-21.1%,且较大模型更早达到饱和。结果表明机密GPU推理在负载下仍可保持可用吞吐量,但容量规划需考虑性能损失和早期饱和现象。

  • 机密计算正成为AI推理部署的实际需求,但性能成本因工作负载而异。
  • 在Intel TDX机密实例中,使用NVIDIA H100 GPU测试了两种模型的机密与非机密模式。
站内正文

混合LSTM-图神经网络框架实现稳健的金融欺诈检测与对抗韧性

该论文提出FraudShield AI框架,融合LSTM网络与手工设计的图拓扑特征,以应对金融欺诈检测中极端数据不平衡(0.13%欺诈率)和不断演变的对抗逃避策略。通过引入PageRank中心性、入度动态和自定义流量比率等网络中心特征,系统将检测范式从孤立交易分析转向网络级取证。采用Focal Loss处理类别不平衡,并引入动态阈值机制增强对低额交易欺诈的韧性。在PaySim数据集上的实验表明,该混合模型在精确率、召回率和F1分数上显著优于逻辑回归和XGBoost基线,尤其在难以检测的微交易欺诈模式上表现突出。消融研究证实了时间组件和拓扑组件的互补贡献。

  • FraudShield AI结合LSTM和图拓扑特征,实现网络级取证。
  • 使用Focal Loss和动态阈值应对数据不平衡和低额攻击。
站内正文

FineServe:细粒度的大语言模型服务负载数据集与特征分析

大语言模型作为在线服务不断部署,高效服务成为关键挑战。现有研究多依赖代理轨迹或粗粒度特征,无法捕捉多模型平台的异构性。FineServe从全球商业市场收集多模型服务负载数据,提供细粒度的真实世界动态特征。通过分析到达动态和令牌行为,揭示了不同模型架构、规模和任务意图下的波动机制,并开发了负载生成器,用于评估路由、调度和容量规划策略。

  • 提出FineServe数据集,包含多模型服务负载的细粒度特征。
  • 分析显示模型架构、规模和任务意图导致的到达动态和令牌行为差异。
站内正文

AI真能构建数据管道?基于Apache SeaTunnel AI CLI对7个顶级LLM的100任务基准测试

本文介绍了一个基于Apache SeaTunnel AI CLI的基准测试框架,对7个领先的大型语言模型在100个ETL任务上进行了三层验证(静态验证、CLI验证、运行时验证)。结果显示,静态验证表现良好并不保证运行时成功率。该测试为AI辅助ETL提供了实用评估方法,强调工程团队应根据工作负载复杂度、运行时成功率、错误恢复能力和运营成本选择模型。

  • 基准测试包括100个ETL任务,覆盖批处理、CDC、复杂DAG等多种场景,使用三层验证框架:L1静态配置验证、L2 CLI和规则验证、L3 Docker化环境运行时验证。
  • 测试发现,模型在静态验证中的高通过率并不等同于实际运行时的高成功率,运行时验证是衡量AI生成配置准确性的关键指标。
站内正文

独立游戏工作室本该爱上生成式AI,为何我采访的25位开发者都避之不及?

尽管生成式AI被宣传为能提升游戏开发效率、降低成本,但众多独立开发者却对其持反对态度。他们担心AI会损害创造力、导致法律风险、扼杀初级岗位,并让游戏失去人性。本文采访了超过30位开发者,其中约25位明确表示拒绝使用AI。

  • 独立开发者普遍认为AI与游戏创作的初衷相悖,强调手工制作的价值。
  • 开发者担忧AI会取代初级岗位,削弱艺术表达和技能培养。
站内正文

NVIDIA AI超级计算机在海军研究生院上线

英伟达创始人兼CEO黄仁勋在加州蒙特雷的海军研究生院(NPS)为一台NVIDIA DGX GB300系统举行了上线仪式,将全球最强大的AI平台之一提供给该校超过1500名学生和600名教职员工使用。该系统用于天气预测、网络安全、灾害韧性等领域的模型训练和推理,标志着NPS与英伟达在AI教育与应用合作的最新进展。

  • 黄仁勋主持了DGX GB300超级计算机的上线仪式,该系统专为军事教育机构设计。
  • 系统将支持NPS的AI研究,涵盖天气预报、网络安全和灾害响应。
站内正文

基准测试已死(至少对我们而言)

Poetiq 宣布其递归自我改进(RSI)循环能够自动为任何任务构建最先进的测试框架,在六个不同的基准测试中取得了最佳成绩,且无需人工干预。该公司认为静态基准测试不足以评估真正自我改进的AI系统,并建议转向动态的、无法被训练攻克的“活基准”。

  • Poetiq 的元系统利用RSI循环自动为基准测试构建框架,实现最先进(SOTA)结果。
  • 该系统在多个基准测试(如 ArXivMath、Haladir、Toolathlon)上超越领先模型(如 Claude Fable 5)。
站内正文

引用Thomas Ptacek

Thomas Ptacek认为,2025年的开源权重模型配合渗透测试工具,足以实现沙箱逃逸并侵入大多数网络。这一观点之所以令人惊讶,是因为人们高估了OpenAI的沙箱安全性。

  • 开源权重模型具备强大的渗透测试能力
  • 沙箱逃逸成为可能
站内正文

主题导航

研究 — AI 话题新闻 | AI News Hub