机器学习、AI与深度学习研究课题
本文广泛综述了机器学习研究课题,涵盖几何深度学习、误差分解与双下降、图基础模型、Transformer 局限与效率、扩散与流匹配、LLM 训练与对齐、图机器学习流程以及医学 AI 应用。
本文回顾了机器学习、人工智能和深度学习领域的重要研究方向,内容覆盖从理论到应用的广泛话题。首先,几何深度学习探讨如何将神经网络推广到非欧几里得空间。文中涉及欧几里得几何、群不变性定理、万能近似定理、罗森布拉特感知机、维度灾难、新认知机和 LeNet-5 等经典概念。软件 1.0 与 2.0 的区分、图神经网络与 Weisfeiler-Lehman 测试、DeepSets 等也被提及。CNN 具有平移等变性,GNN 层具有置换等变性,而图读出是置换不变的。几何深度学习的 5G 框架包括网格、群、图、测地线和规范。
在监督学习方面,文章讨论了误差的三个来源:近似误差、估计误差和优化误差,以及经验风险最小化。误差分解表明总超额误差由这三部分组成,并随模型复杂度变化。最近邻分类器、近似率、Sobolev 类的维度诅咒、良性优化景观和 Lipschitz 估计误差等概念均在文中出现。双下降现象揭示了误差随模型复杂度非单调变化的规律。
图基础模型部分涉及知识图谱 TransE、消息传递神经网络、知识图谱上的链接预测与可迁移性。Transformer 研究仍有众多空白,例如二次复杂度问题,可通过 LoRA、KV 缓存优化、稀疏或线性注意力、FlashAttention 等技术缓解。固定上下文窗口的限制可通过长上下文训练、位置编码缩放、滑动窗口注意力、RAG 等方式解决。归纳偏置的缺乏促使研究者引入局部性、等变性、递归或结构化位置编码。此外,Transformer 在数学推理方面仍面临困难。
扩散模型与流匹配是生成建模的重要方向。扩散通常采用随机动力学,流匹配则学习确定性 ODE 向量场,两者框架可相互重叠。文章还总结了 ML 成功的配方:大规模多样化数据集、明确的性能标准、退化解空间、合适的假设类与可处理的优化。某些训练数据空白区域包括简单算术、排序、恒温器调节和道德推理。在语言建模中,ELMo 利用深层双向 LSTM 生成上下文嵌入,而 RNN 因时间反向传播难以并行化。Transformer 通过自注意力、残差连接、层归一化和位置编码解决了这些问题,并支持因果语言建模。
效率技术方面,KV 缓存优化面向推理,4 位量化可显著减少内存占用,LoRA 用于参数高效微调,vLLM 等系统提升推理吞吐量。多模态模型如 LLaVA 结合视觉和语言,脉冲神经网络和状态空间模型提供了新架构。模型蒸馏和长上下文方法(RoPE、ALiBi)也是研究热点。在 LLM 基础上,ABC 缩放、涌现能力、MMLU 基准和思维链提示等主题被讨论。推理时扩展和智能体系统(如带记忆检索工具的 LLM)结合 RAG,增强了问答和推理能力。
图机器学习领域提出从关系数据库到关系图再到图问题的处理管线。RelBench 提供基准任务,异构 GNN、时序 GNN 和关系深度学习架构用于解决这些问题。GNN 与特征工程的比较、关系基础模型 KumoRFM 和 Griffin 等展示了图神经网络的进步。图 Transformer(如 Graphormer、ViT/MLP-Mixer)和谱 GNN 是重要的架构方向。将 LLM 与 GNN 结合,并使用图 RAG,可减轻幻觉并处理有限的上下文窗口,在基于图的任务中取得更优性能。
最后,医学 AI 强调了从模型中心走向系统中心,关注数据隐私、低端设备和边缘计算。成功指标应改善健康系统性能而非算法新颖性。全球健康应用包括 AI 辅助产科超声等。文中也提到 LVLM 中的幻觉和数据模型不确定性,提示在安全关键领域需要谨慎。