Aryabhata 2是一个针对竞争性STEM考试(如JEE和NEET)优化的推理语言模型,基于GPT-OSS-20B通过强化学习后训练。它利用PhysicsWallah的内部题库构建高质量课程,并通过逐步增大的rollout组规模来扩展探索。实验表明,Aryabhata 2在多个基准测试中优于基础模型,同时输出令牌减少高达64%。
AI 新闻实时情报
实时监测
实时更新
实时跟踪可信来源,保留出处、权限和站内阅读模式,把噪声压成可读情报。
实时更新
大语言模型在长文本生成中容易出现幻觉,现有检索增强模型无法保证关键信息靠近输出。本文提出的微宏检索(M2R)框架通过宏观检索粗粒度证据和微观检索关键信息库,显著减少了长文本任务中的幻觉,并采用基于课程学习的强化学习策略进行训练。
本文介绍了一个518M参数的阿拉伯语专用大型语言模型RightNow-Arabic-0.5B-Turbo,基于Qwen2.5-0.5B构建。通过词汇注入和边缘优先部署,该模型在阿拉伯语基准测试中达到35.9%的平均准确率,超越了同类开源模型,并在COPA-ar上与1.5B参数量的Falcon-H1-1.5B持平,而体积仅为后者的三分之一。量化后模型仅398 MB,在单块H100上可实现635 tokens/s的推理速度。所有代码和权重均已开源。
一篇新论文分析了17个大型语言模型(参数规模4.1亿至1000亿以上),发现指令微调系统系统地压缩了语言熵,尤其是在话语和结构维度上,平均放大效应达1,949%至16,853%,峰值可达5,181%至209,675%。复杂标点符号的使用频率被抑制到基线的3.2%至23.2%。这些效应在RLHF下并未恶化。弱干预(lambda=1.0)使崩溃加剧240%,而强控制(lambda=5.0)实现了40.5%的改进,尽管规模劣势达200-1000倍,仍比前沿模型性能高出96.7-98.2%。强控制还带来了15%更高的distinct-4、27%更高的词汇多样性以及78%更低的重复率。研究表明,对齐需要足够的控制强度,而非仅仅是分布平滑。
新框架MechELK利用机制可解释性从大型语言模型中提取隐藏知识。它结合了稀疏自编码器、因果探针和表征工程,实现了84.7%的准确率,超越了现有方法。该框架在模型给出错误或回避性回答时尤其有效。
该研究提出了一种模块化框架,用于生成可发音、类型学合理且语义结构清晰的人工词汇。框架从PHOIBLE数据库中采样音位清单,在可互换的音系语法(确定性、OT和MaxEnt)下生成词形,并通过Swadesh-Leipzig-Jakarta本体分配含义。评估表明,概率语法在音位连贯性和类型学真实性方面始终优于确定性和随机基线。
随着大型语言模型(LLM)影响力的扩大,理解其决策过程变得至关重要。本文提出通过构建低成本、可广泛应用的线性探测工具,检测LLM嵌入中概念的存在与否,从而揭示模型“思考”的内容。研究展示了概念界定、探测训练与跨上下文追踪的完整流程,并在三个LLM上对四个概念进行了验证,为未来大规模监控模型行为奠定了基础。
多模态学习常面临模态不平衡问题,即收敛快的模态主导优化,其他模态训练不足。现有方法大多通过加强弱模态或调整梯度来补偿优化速率差异,但可能牺牲强模态的优化能力。本文提出平衡多模态标签重塑(BMLR),首次从标签端设计促进多模态平衡。BMLR重塑跨模态标签空间以均衡各模态的映射难度,从而促进模态交互并为每个模态注入更丰富的类间信息。实验表明,BMLR能持续提升多模态性能,且与多种模型设计兼容。
宏基因组分类注释旨在识别环境样本中DNA片段的微生物起源。传统方法依赖序列相似性,受限于微生物多样性和参考数据库的不完整性。TaxDistill提出一种知识蒸馏框架,利用500M参数的基因组基础模型GenomeOcean作为教师网络提取深层语义特征并生成基于置信度的软标签,将软标签信息蒸馏到轻量级学生网络中,有效减少初始检索工具引入的标签噪声。在七个CAMI2数据集上的实验表明,TaxDistill在多数场景下优于现有基线,例如在胃肠道数据集上将MMseqs2的F1分数从0.763提升至0.941。
PrismFlow提出了一种新的流匹配方法,通过科普曼启发的动力学专家来修正标准流匹配中的估计器平滑问题,从而恢复时间序列中的高频率和精细结构。该方法在多个基准测试中取得了最先进性能,Context-FID提升15.6%,判别分数提升38.6%。
本文提出COM方法,通过在初始化和训练阶段引入几何约束,保留时间序列标记的连续性和序数性,显著提升基于令牌的时间序列大语言模型(TS-LLM)的性能。实验表明,COM在多个基准上取得一致改进和强泛化能力。
本研究在四人纸牌游戏大老二中探索自对弈强化学习框架,对比多种算法发现PPO优于蒙特卡洛Q近似、SARSA和Q学习。适度的熵正则化可防止策略过于确定,当前策略自对弈比检查点自对弈或固定对手训练提供更強的有限预算课程。结果表明大老二是不完全信息、多人互动、延迟奖励和可变动作集下深度强化学习的有用受控基准。
提出TRACE,一种轨迹感知的LLM推理代理,用于分子先导优化,通过将工具选择建模为序列决策问题,实现前向优化的结构约束改进,在ADMET优化任务中取得更高成功率、更大性能提升和更高有效性。
最近研究表明,强化学习(RL)比监督微调(SFT)更能保持大语言模型的先前能力。本文从机制层面延伸,引入差分电路脆弱性度量,衡量微调中电路退化程度。在Qwen2.5-3B-Instruct科学问答实验中发现,SFT适应目标任务更快,但造成更大的电路破坏和遗忘,而RL保留更多基础电路,但任务适应较慢。结果表明电路保留有助于解释RL对灾难性遗忘的鲁棒性。
本研究利用TradeArena测试平台,分析大型语言模型(LLM)交易代理在金融决策中的行为对齐与表示动态。研究发现失败前的可测量迹象:规划嵌入偏离正常状态,有效秩收缩。结构化的风险反馈可作为外部对齐信号,但并非通用性能增强器。此外,51只股票的日内实验揭示了相关性盲点:LLM理由常证明对耦合资产的集中敞口是合理的。
本文研究知识编辑方法(如ROME和MEMIT)在Transformer模型中的内在机制。作者发现尽管每次编辑修改不同的权重,但所有编辑都依赖于一个共同的权重子集。通过训练一个紧凑的二进制掩码,他们成功逆转了训练集上80%的编辑和测试集上超过70%的编辑,验证了不同编辑共享共有功能结构。掩码通过消除后期层的过度注意来逆转编辑,且注入该掩码会使编辑成功率从98%骤降至38%,表明该机制是编辑成功的必要条件。研究发现编辑实际上抑制而非覆盖知识,这解释了ROME和MEMIT无法将更改传播到相关事实的原因。该发现有助于检测和防御未授权编辑。
VFEAgent是一个端到端多智能体系统,可直接从输入图像和问题描述自动完成有限元分析(FEA)建模与仿真。它结合了多模态视觉语言多智能体管道和验证优先的代码合成框架,通过ReAct推理提取结构化FEA规范,并具有自调试和回退机制以确保可执行性和物理有效性。实验表明,VFEAgent在生成完整且物理有效的仿真方面成功率很高,在可靠性和正确性上优于基于LLM的基线方法,有望将工程师从繁琐的手动分析中解放出来。
一项新研究利用Anthropic和OpenAI的五种前沿大语言模型作为智能体策展人,在自包含工作空间中自动进行表型注释。实验表明,这些智能体的一致性达到了人类策展人的变异范围,并显著优于传统NLP工具,有望解决表型本体注释中人工依赖强、难以规模化的问题。
本文提出正交概念擦除(OCE),通过乘法参数更新实现精确的概念擦除,同时保持扩散模型的生成能力,支持多概念擦除,速度快。
该论文通过实验评估了大型语言模型(LLM)生成的科学论文评审与人类评审的对齐程度,发现对齐有限且因提示和模型而异。研究还发现,作者利用LLM评审进行迭代修改可显著提升论文评分,最多35%的论文分数得到统计显著提升。
认知范畴变换器(CCT)是一种306M参数的架构,通过在预训练的GPT-2 Small骨干网络上添加源自范畴论和认知科学的组件,在WikiText-103上实现了21.27的验证困惑度,相比微调基线降低2.92(12%)。消融实验证实,84%的改进来自GT-Full单纯消息传递。研究还发现了结构/一致性区分模式。
本文提出行为感知辅助修正,以稳定离线策略时序差分学习。通过用行为贝尔曼矩阵替代辅助协方差矩阵,作者引入BA-TDC和BA-TDRC算法。理论分析证明了不动点保持和几乎必然收敛。在标准基准上的实验表明,行为感知替换可提高性能,但正则化对稳健结果必要。
本文提出了一种名为STHTD-MP的行为诱导镜像近端时间差分方法,通过用行为策略贝尔曼矩阵的对称部分替换协方差度量,改善了离策略预测的收敛速度。理论分析和数值实验表明,该方法在多项基准测试中优于现有的GTD2-MP方法。
Ruby创建者Yukihiro Matsumoto(Matz)正在Anthropic的Claude协助下构建Spinel,一个实验性的Ruby提前编译(AOT)编译器。Spinel将Ruby代码转换为C语言,性能提升显著,但存在诸多限制,包括不支持eval、线程等特性。
文章探讨了“一次性软件时代”的概念,认为AI生成的代码应被视为可丢弃的,就像工业革命中的家具一样。作者通过一个实际案例展示了如何用AI重构代码,并提出了“一次性代码宣言”,强调代码需满足意图、要求和安全性。
OpenAI 推出 Rosalind Biodefense,为经过审查的开发者及美国政府合作伙伴提供 GPT-Rosalind 的受信访问,助力生物防御、公共卫生与大流行病防范。
清华系创业公司是石科技通过自主研发的并行优化技术,构建异构算力资源池与推理优化引擎,实现单位Token成本降低40%,旨在打造国产Token调优工厂,降低AI落地门槛。
repo-brain 是一款开源工具,能将整个代码库压缩成单个Markdown上下文文件,实现高达96%的压缩率,大幅减少AI令牌使用量。它支持多种编程语言的静态分析、架构分析和语义关系发现,并兼容多家AI提供商。
Anthropic以9650亿美元估值完成650亿美元H轮融资,同时披露470亿美元年化收入,并发布Claude Opus 4.8更新(提升判断力、诚实度和长时自主工作能力)以及Claude Code的Dynamic Workflows功能(支持数百个并行子代理)。
ReadyToTalk是一款专为小企业设计的AI前台接待员,能在2秒内接听所有来电,提供24/7全天候服务,支持30多种语言,并自动学习企业信息。每月仅需39美元,无需技术知识即可在几分钟内完成设置。