5门免费课程:从AI新手到实践者
本文介绍了一个由5门免费课程组成的路线图,从经典算法到从头训练大语言模型,帮助有Python基础的学习者系统掌握AI技能。
- 哈佛CS50 AI课程建立AI逻辑基础
- 谷歌机器学习速成课程掌握数学与TensorFlow
主题流
模型更新是 AI 产品和基础设施变化的源头。这里跟踪前沿模型、多模态能力、开源权重、上下文窗口、评测结果、API 变化和部署路径,帮助读者判断新模型是否真正改变成本、质量或可用性。
本文介绍了一个由5门免费课程组成的路线图,从经典算法到从头训练大语言模型,帮助有Python基础的学习者系统掌握AI技能。
Z.ai的GLM 5.2模型以低价和开放权重挑战美国前沿AI模型,但许多程序员仍习惯使用昂贵模型,忽略成本。该模型在基准测试中接近Claude Opus 4.8,但实际使用效果参差不齐。
阿里巴巴宣布推出其最新大语言模型Qwen3.8,声称仅次于Anthropic的Fable 5,但未提供任何基准测试或模型卡。此举发生在竞争对手月之暗面发布Kimi K3并附有详细技术细节之后。阿里巴巴的声明缺乏透明度,引发对其发布时机和动机的质疑。
本期涵盖Anthropic的AI条约讨论、美国政府影响AI模型发布、OpenAI处理器开发、内存市场影响等话题。
美国政策制定者正在讨论是否通过监管风险来限制中国开源权重模型的使用。Moonshot AI的Kimi K3模型发布后,这一争论再次升温。企业面临的问题不仅是性能,还有未来一年内使用这些模型是否依然畅通无阻。
中国开源AI模型Kimi的发布,引发了特朗普政府内部AI战略家的分裂。该模型性能媲美OpenAI和Anthropic的付费模型,却完全免费,对特朗普的经济和政治构成挑战。围绕如何应对中国AI竞争,各方意见不一,从开放支持到加强管控,分歧加剧。
本文提出预见性残差强化学习(Foresight Residual RL),通过在冻结的视觉-语言-动作(VLA)基策略上添加一个离线估计的预见值(即当前子任务终止状态下未来子任务成功的概率)来优化子任务间的交接质量,从而提升长时域机器人操作的成功率。在Isaac Gym中的三阶段扳手螺母拧紧任务上,该方法实现了85.6%的完整任务成功率,显著优于标准子任务残差RL(54.5%)和VLA基线。
PRISM是一种多模态感知系统,通过融合热成像、光学和深度传感器,结合新型视觉变换器网络OmniUnet,实现非结构化环境中的地形分割与可通行性地图生成,并在资源受限的嵌入式计算机上成功部署,支持自主导航。
针对视觉导航中的灾难性遗忘问题,研究者提出HyperDCM,一种结构感知的记忆机制。它利用大视觉语言模型提取场景语义三元组,通过关系图卷积网络编码为场景图嵌入,并投影到双曲空间增强结构分离性。动态聚类和结构敏感更新策略选择代表性样本进行记忆回放,保持知识多样性。实验表明,HyperDCM在多场景室内外数据集上优于现有持续学习方法。
提出一种共享潜变量方法,通过变分瓶颈在部分标注的多任务面部情感识别中实现跨任务信号共享,在s-Aff-Wild2数据集上提升表情识别宏F1至0.446,并通过第二个骨干网络突破动作单元瓶颈。
第三届微动作分析大挑战赛(MAC 2026)与ACM Multimedia 2026同期举办,通过引入利用多模态大语言模型评估的新任务,将微动作分析从识别推进到细粒度理解。本文详细介绍了数据集、协议、竞赛结果以及该新兴领域的未来方向。
GenSyn10是一个包含6万张合成图像的数据集,与CIFAR-10对齐,使用三种架构不同的生成模型创建,旨在推进AI生成图像检测研究。评估显示,模型在已知生成器上表现良好,但在未知生成器上性能显著下降,凸显了分布外泛化的局限性。
本文提出EMTS-Det系统,用于无人机上的实时跟随人员追踪,在低功耗硬件上实现高效运行。系统通过自我运动归一化的残差运动通道检测人员,使用仅22k参数的轻量网络,在Raspberry Pi Zero 2W上达到31.85 FPS,性能远超YOLOv8n。
研究人员提出3D FaceShell框架,通过向3D面部头像添加微妙扰动来误导视觉语言模型推断敏感属性,同时保持视觉身份不变。
联合嵌入预测架构(JEPA)在训练时联合训练预测器与编码器,但下游部署通常丢弃预测器。研究表明,JEPA预测器可作为可迁移的遮挡特征补全算子,通过线性投影适配到不同编码器族,显著提升遮挡分类精度。
本研究提出科学可行性控制(SFC)框架,一种图结构共形预测方法,为科学推理的有效性提供统计保证。SFC将科学推理分解为原子单元,通过渐进式绝对一致事实性验证,在检测到违反科学原则时动态分支到替代生成路径。实验表明,SFC在PhyX等多模态科学推理基准上达到50.1%的准确率,超过DeepSeek-R1和GPT-4,同时将科学定律违反减少73%,并提供91.7%的科学有效性保证。
本研究通过机制可解释性方法,分析Llama-3模型在符号算术、自然语言应用题和Python代码三种形式下的算术计算机制,发现一组紧凑的共享神经元在三种形式中均被激活,且跨格式失败源于激活状态而非不同电路,表明LLM的算术计算在神经元层面具有形式不变性。
本文提出了 SpecLA,一种针对有状态线性注意力模型的推测解码运行时。它通过拓扑感知内核验证链和树,存储验证过程中产生的紧凑因子以恢复接受状态,并使用置信剪枝和目标对齐的EAGLE风格草案生成器提供有用候选。在NVIDIA H100上使用公共GDN-1.3B目标,SpecLA实现了比自回归解码高达1.70倍的端到端加速。
OpenLanguageModel (OLM) 是一个开源的 PyTorch 库,用于构建和预训练小型语言模型,同时保持其内部机制可见。模型代码直接反映架构,组件如 Block、Residual、Repeat 和 Parallel 描述连接方式。OLM 集成了分词器、数据集、优化、混合精度、回调、检查点以及硬件感知的执行,支持从教学笔记本到完整预训练的无缝迁移。该库包含 9 个常见模型家族的 27 个预设,并提供从基础到架构研究的文档。验证显示与独立参考实现高度一致,348M 参数模型在四 GPU 上弱扩展效率达 90.6%,且早期可用性反馈积极。OLM 采用 MIT 许可证,可通过 PyPI、GitHub 和文档站点获取。
现有长期LLM代理的记忆系统往往将先前轨迹作为被动上下文检索,而非转化为可执行能力。本文提出MSCE框架,一种无需训练的记忆-技能协同进化框架,将代理经验组织为基础步骤轨迹、可重用过程策略和声明性环境认知。MSCE将具有正估计增益的证据支持的L2策略结晶为可调用技能,并引入反射加权值回填。实验表明MSCE显著优于现有方法。
本文介绍了NOWJ团队在COLIEE 2026竞赛中五项任务的方法和结果,包括法律案例检索、先例推理、法条检索与推理、法律文本蕴含以及法律判决预测,提出了多种自适应流水线和深度学习模型。
该研究通过脑电图记录的事件相关电位(ERP),对比人类与语言模型在下一词预测任务中的表现,发现仅信息论中的“惊奇度”指标与语言处理的ERP相关,尤其是对于语义丰富的高内容词,而模型规模扩大并不必然带来更类人的认知处理。
一项新研究通过简单问题(洗车应步行还是开车)揭示了语言模型常先决定答案再推理以证明其合理性,而非从前提推导。实验表明Qwen3-8B模型在多数情况下错误承诺步行,即使开车是唯一合理选择。研究者通过激活层次分析发现,模型在输出答案前已显示出向步行倾斜的迹象,即便最终回答开车。该发现提示现有模型存在推理前的决策偏差。
小型语言模型在检索增强生成中易受噪声证据影响。本文提出RIMS,一种三阶段偏好优化框架,包括合成思维链偏好数据生成、可微平滑聚合机制和偏好优化。实验表明其在多跳问答基准上优于现有方法。
混合专家模型(MoE)通过将令牌路由到一小部分专家来高效扩展Transformer模型。然而,现有路由器通常基于浅层或孤立的令牌表示来选择专家,导致路由决策不稳定且语义不一致。本文从表示角度重新审视专家选择,并提出多级上下文融合MoE(MCF-MoE)框架,通过整合跨层语义聚合和局部令牌交互的互补信号来构建上下文感知表示,从而实现更信息丰富且一致的专家选择。实验表明,MCF-MoE在路由一致性和下游性能上均优于强基线,凸显了上下文完整性在专家路由中的重要性。
本研究提出了一种令牌级跨模态Transformer模型,结合对比多任务学习,用于整合基因组和临床数据,实现乳腺癌亚型分类与生存预测的联合优化,克服了现有方法中模态交互粗糙、融合方式简单、目标独立优化等局限。
本文提出“从权重到语言”方法,自动从选择数据中发现以自然语言描述的偏好维度,解决偏好学习中的欠确定性和黑箱问题。实验表明,该方法能提高预测准确率,并允许用户实时检查和编辑模型推理。
本文提出了一种基于算子感知的混合精度容差校准方法,通过挖掘累积的云GPU运行数据,自动确定张量核正确性测试的最佳绝对容差,相比手工选择的容差更严格,并显著提高了错误检测召回率。
大型语言模型在关键领域的部署带来了遗忘能力的缺失,导致隐私泄露和安全风险。本文综述了基于梯度的LLM遗忘方法,探讨其是否真正移除知识或仅抑制表达,并分析了安全、鲁棒性和可验证遗忘的挑战。
本文介绍ARGO智能眼镜平台,利用STM32N6微控制器及其集成NPU实现本地机器学习,保护隐私并降低延迟。通过软硬件协同设计,部署优化后的YOLOv11模型进行实时城市障碍物识别,引入头并行注意力机制(HPA)适配NPU,模型仅占用2.483 MB内存,mAP50-95达24。该平台集成多模态传感器,以10 FPS运行,200 mAh电池续航约113分钟,展示了高性能、隐私保护且社交可接受辅助设备的可行性。
本文提出DocOCR-Eval,一种无需人工标注的评估框架,用于自动评估和选择OCR工具。该框架通过三阶段校正和排序策略,在缺乏真实标签的情况下近似基于标注的工具排序。实验表明,聚合多个多模态大语言模型可逐步提升与人工标注排序的一致性,为实际部署文档解析系统提供指导。
一种新的强化学习方法W2SPO,利用弱辅助模型在大型语言模型推理路径中注入简短片段,在数学推理任务上提升了性能并加速训练。
强化学习领域需要多样化的训练环境,但传统手工设计的环境难以扩展。自回归世界模型存在从左到右的偏差,无法充分利用全局状态信息。一项新研究提出使用掩码扩散语言模型(MDLM)作为文本世界模型,通过双向锚点感知去噪,在连贯性和多样性上显著优于参数规模大4倍的语言模型,并引入GRPO训练框架实现高达47%的零样本迁移性能提升。该工作已开源。
本文提出生成式本体归纳(GOI),一种领域无关的框架,能从示例语料库中归纳出实体、维度、属性、关系和约束的生成蓝图,并导出为带有六种节点类型和七种边类型的类型图(YAML/JSON格式)。引入节点覆盖率评分(NCS)评估指标。在四个对比本体上的验证表明,GOI提示生成覆盖了95-100%的结构骨干,而通用模板覆盖率显著下降。
AI代理系统因结合大语言模型与外部工具而本质非确定性。arXiv论文提出agrepl框架,通过MITM代理拦截外部交互,实现运行轨迹的确定性重放,并凭噪声感知差异算法区分HTTP头部变化。实验显示重放保真度F=1.0,单步延迟降低98.3%。
一项新研究提出PlanFlip框架,包含四种针对多智能体LLM系统规划阶段的提示注入攻击。研究发现,更强的模型(如GPT-5)反而更易受攻击,同质化骨干网络存在相关智能体盲点,而推理增强型模型(如DeepSeek-R1)能抵御攻击。提出的两种防御方法检测率高达1.00。
一项新研究通过跨领域框架测试了大型语言模型(LLMs)在不确定性下的风险态度,发现大多数模型在任务内和跨任务中都表现出稳定且一致的风险偏好,且其风险态度分布比人类更集中。
本研究提出了一种基于MATLAB的开源框架,用于开发软交互伴侣中的情感触觉识别紧凑深度学习模型。通过468个CNN模型的系统探索,确定了13.2k参数的扩张1D CNN为最佳方案,测试准确率75%,留一法交叉验证准确率85%。混合推理管道结合瞬时启发式滤波和CNN精细分类,可在20 Hz实时运行,实现隐私保护的情感触觉解读。
Concentrate 是一个托管的LLM网关,提供单一API访问超过130个来自主要供应商的模型。它具备模型路由、支出跟踪、安全控制和故障转移冗余等功能,专为扩展AI生产的团队设计。
OpenAI战略未来主管Dean Ball认为开放权重模型本质上是减速主义的,因为它们抑制资本支出。本文从经济学角度探讨了这一观点,分析了中国在AI基础设施方面的投资、训练范式的转变以及价值在价值链中的迁移。文章认为,开放权重模型可能通过降低成本扩大应用范围,促进创新,从而实际上是加速主义的。
意大利工程师Vincenzo(又名JustVugg)创建了Colibrì,这是一个概念验证项目,能够在仅25GB RAM和1GB/s NVMe的CPU上运行7440亿参数的GLM-5.2模型(1.5TB)。尽管速度极慢(每0.05-0.1秒一个token),但利用混合专家(MoE)架构按token加载专家,实现了前沿水平的回答质量。项目开源,旨在探索在消费级硬件上运行大型模型的可行性。
直播中,GPT-5.6 Sol 与 Kimi K3 在《坎巴拉太空计划》里进行速度竞赛,展示 AI 在复杂游戏中的实时决策能力。
阿里通义实验室推出Qwen-Audio-3.0-TTS,一款面向生产的文本转语音系统,提供Flash(实时交互)和Plus(高质量生成)两档,通过阿里云模型托管服务交付。该模型覆盖16种语言和20种中文方言,支持自然语言风格控制和86种细粒度内联标签,并在Artificial Analysis语音竞技场中排名第一。文章详细介绍了模型架构、性能表现、开发者反馈及定价信息。
不断有用户分享他们利用编码代理逆向工程并自动化家中设备的轶事。这展示了编码成本降低带来的影响。过去,逆向工程虽然可行,但投资回报率低,且需面对不稳定API的维护风险。编码代理彻底改变了这一局面,降低了初始工作和失败的成本,也减轻了未来维护的心理负担。
本·汤普森提出美国应立法明确训练数据为合理使用,并禁止禁止蒸馏的服务条款,以帮助美国开源模型与中国模型竞争。同时,阿里巴巴决定发布Qwen 3.8 Max开源权重,可能受习近平鼓励开源合作的讲话影响。
Moonshot AI发布了最新旗舰模型Kimi K3,这是一个2.8万亿参数的MoE模型,将于7月27日开放权重。K3在多项基准测试中排名靠前,成为最强的开源模型。文章探讨了中美AI模型差距缩小、中国开源策略、开源模型的经济影响以及中国AI的效率优势。
Adobe的实验性相机应用Indigo最初专注于为iPhone摄影提供更自然的单反效果,现在通过'AI Playground'套件增加了生成式AI编辑功能,使用Google的Nano Banana模型。功能包括AI风格、物体移除、照片指导和自定义编辑。该实验目前向一小部分用户提供免费访问,将来可能转为付费。
Inertia-1是一个统一的运动基础模型,通过在手腕数据上进行大规模自监督学习,创建可泛化到不同身体部位和传感器类型的表示,并揭示了采样率、窗口大小等设计选择对实际性能的影响。
不透明的定价和滞后的账单迫使企业重新思考其AI模型策略。
Meta监督委员会的一项研究发现,包括美国公司构建的主要AI系统更倾向于拒绝批评限制性领导人或政府的请求,引发了对AI技术可能扩展国家对言论自由限制的担忧。