Inertia-1:统一运动基础模型的开源探索
Inertia-1是一个统一的运动基础模型,通过在手腕数据上进行大规模自监督学习,创建可泛化到不同身体部位和传感器类型的表示,并揭示了采样率、窗口大小等设计选择对实际性能的影响。
- 通过大规模自监督学习,在1800万小时加速度计数据上预训练,无需标签。
- 手腕预训练模型可零成本迁移到其他身体部位和传感器类型。
主题流
模型更新是 AI 产品和基础设施变化的源头。这里跟踪前沿模型、多模态能力、开源权重、上下文窗口、评测结果、API 变化和部署路径,帮助读者判断新模型是否真正改变成本、质量或可用性。
Inertia-1是一个统一的运动基础模型,通过在手腕数据上进行大规模自监督学习,创建可泛化到不同身体部位和传感器类型的表示,并揭示了采样率、窗口大小等设计选择对实际性能的影响。
不透明的定价和滞后的账单迫使企业重新思考其AI模型策略。
Meta监督委员会的一项研究发现,包括美国公司构建的主要AI系统更倾向于拒绝批评限制性领导人或政府的请求,引发了对AI技术可能扩展国家对言论自由限制的担忧。
中国领先的人工智能公司Moonshot和阿里巴巴发布了新模型,声称能以更低成本与OpenAI和Anthropic的最佳模型竞争。这些开放源代码的发布加剧了中美技术竞赛,并质疑美国巨额投入是否能维持优势。
美国公共卫生部门将通过PULSE计划测试生成式AI工具,涉及OpenAI、Anthropic和埃森哲。该计划将在10个州、地方、部落或地区开展试点,旨在为公共卫生机构的AI部署提供指导。OpenAI和Anthropic捐赠了10个企业许可证,可供2000名从业者使用。试点将涵盖五个用例,包括生物监测、健康的社会决定因素、公共沟通、自动化临床数据检索等。计划于2026年秋季启动,2027年发布实施手册。
月之暗面发布Kimi K3,一个拥有2.8万亿参数的开放权重模型,采用混合专家架构、量化训练和Delta注意力机制,以内存池化策略应对美国芯片限制。尽管参数庞大,但模型通过降低计算需求来适配受限硬件,实际部署仍需数据中心级基础设施,且软件生态尚未完全就绪。
Thinking Machines Lab 发布了其首个通用开放权重基础模型 Inkling。该模型拥有 9750 亿参数(其中 410 亿激活)、100 万 token 上下文窗口,采用多模态稀疏 MoE 架构,支持文本、图像和音频处理。Inkling 以可定制的开源模型形态,面向多模态推理、智能体、编程、工具使用及企业微调场景。本文详解其架构、训练、基准测试、部署及微调工作流。
Zlvox AI Humanizer 是一款免费且无限使用的在线工具,利用 Groq Llama 3.3 将 AI 生成的文本转化为自然的人类语言,能够绕过 GPTZero、Turnitin 等检测器。它提供多种人性化级别、写作风格调整、语法修复、改写和摘要功能,支持 ChatGPT、Claude 等所有主流 AI 模型的输出,且无需注册。
在灾难检查、搜索救援等关键任务中,通信受限的机器人必须依赖机载决策。低成本的记忆重用可能因环境变化而变得不安全(称为“记忆陷阱”)。本文提出MemoGuard,一种轻量级自适应运行时,在重用前根据拓扑、资源和结果契约验证记忆,仅当验证失败时才调用回退推理。在走廊巡检模拟器中,与单纯相似性重用相比,电池安全违规减少76.6%,回退调用次数比始终使用推理减少21.4%。在NVIDIA Jetson AGX Xavier上使用本地llama3.2:3b回退推理时,每次试验节省3.67秒和36.97焦耳。
本文提出PACE框架,通过对话引导动态生成个性化、心理上合理的机器人身份,并在Ameca人形机器人上实现。实验表明,相比静态基线,动态个性显著提升用户信任、拟人化感知和交互质量。
本文提出了一套基于双组分硅胶浇注铸造的软气动致动器稳健制造流程,解决了内部腔体堵塞和气密性问题,并开发了薄膜柔性传感器的嵌入方法。通过有限元分析、PID压力控制实验以及自动图像处理校准,验证了致动器性能。阶梯波和正弦波驱动实验表明其具有高重复性和低滞后,且经过两位操作者24次成功制造验证,为软体机器人的规模化应用提供了可靠基础。
小米机器人团队提出Xiaomi-Robotics-1,一个基础视觉-语言-动作(VLA)模型,能够遵循多样语言指令在未见环境中执行移动操作任务,并通过少量微调数据高效适应新任务。模型采用两阶段训练:预训练阶段利用超过10万小时的真实操作轨迹(通过UMI设备收集)赋予模型广泛的动作生成能力,并开发了可扩展的自动标注流水线;后训练阶段对齐机器人本体和人类指令。实验证明模型具有强扩展性,在RoboCasa365上达到57.6%的成功率,在RoboDojo上取得20.07的平均分,均超越先前最佳水平。代码和模型将开源。
跨视角地理定位将地面观测与卫星图像匹配。最新方法利用视频片段等序列查询获得更丰富的时空线索,但忽略了路线描述这一互补模态。本文提出SeqGeo-VL数据集(约3.9万视频-文本-卫星三元组)和TrajLoc统一框架,同时处理视频和路线描述,通过密集视觉与抽象语言语义相互增强。还提出TrajMod轻量模块,根据轨迹几何条件化查询嵌入,实现空间感知表示。实验表明TrajLoc在视频和文本地理定位上显著超越现有方法。
使用部分信息分解(PID)框架在训练前选择最优的MRI对比度组合,以降低多对比度3D MRI脑肿瘤分割的计算成本。研究选取T1c+T2-FLAIR作为最佳输入对,在轻量级3D U-Nets上表现接近全输入配置,平均Dice 0.676 vs 0.687,验证了PID的实际价值。
多模态大语言模型(MLLMs)能够从自然语言查询中定位整个物体,但在查询指定部件而非物体时表现不佳。本文提出物体-部件层次化反射式定位(OP-HRG),一种由粗到细的推理引导定位策略:先定位父物体,再锁定其中的部件。自检步骤会反思结果,并扩展为重新编码预测裁剪区域以检查纠正的区域。我们引入部件感知的GRPO框架,通过阶段奖励训练该流程。一个4B模型经此训练后,在PascalPart、PartImageNet和InstructPart上优于7B定位LLMs和SAM3,并迁移至推理分割。
该研究提出一种完全无需训练的开放词汇3D点云分割方法,利用冻结的视觉语言模型(RegionPLC)和提示概念分割器(SAM3)通过跨视图一致性实现广义少样本分割,在ScanNet200和ScanNet++基准上显著提升了新类分割性能,且无需任何训练或少样本支持。
AI生成视频(AIGV)通常包含帧间不一致导致的细微时间伪影。然而,使用标准全局读出层的视频骨干网络在AIGV检测中往往不如强图像预训练探测器。本文提出Velocity Gated Patch Velocity Profiling(V-PVP),一种轻量级读出模块,仅替换聚合层,增加约0.5M可训练参数,在AIGVDBench上达到95.28 AUC,且骨干网络完全冻结。
大型语言模型(LLM)在回答预设问题方面表现优异,但其在开放式、结论前阶段的探索能力尚未得到充分评估。本文提出前瞻性假设发现(PHD)任务,要求模型从不确定证据中自主构建有依据、可区分且可检验的假设空间。为评估该能力,研究者推出HypoArena基准,包含涵盖六个科学分析领域的988个案例的HypoData数据集及HypoEval评估框架。实验表明,15个前沿LLM在该任务上表现出明显的能力分层,并揭示了结构化分析技能对模型性能的依赖效应。
本文提出BIRD,一种两阶段自我推理蒸馏方法,通过先采样简洁解并进行提示切换SFT,然后应用在线逆KL蒸馏,显著提升了大语言模型在长链推理中的效率。在Qwen3-8B上,MATH-500准确率从86.2%提升至92.0%,同时响应长度从3099降至1115 tokens。
本文提出AdaLook,一种用于掩码扩散语言模型的自适应多步前瞻解码框架。通过基于候选分数方差动态决定前瞻深度并支持分支扩展,AdaLook在保持高效的同时提升了生成质量,实验表明其优于现有单步前瞻方法。
提出PATR方法,通过过程反馈评分部分轨迹、选择性分支、共享前缀和停止退化路径,提升多轮强化学习效率。在FrozenLake和SWE-Bench上分别提升9.3和5.0分。
SkillCorpus从约82.1万个候选技能中筛选出超过9.6万个开源LLM Agent技能,采用16类分类法和三个质量维度进行组织。结合检索与选择堆栈,它在多个基准测试中取得了持续改进,其中在SkillsBench上提升最大,达7.5个百分点。
本文介绍EpiNarrate,一种用于公共卫生报告生成的智能框架,将结构化数值推理与自然语言生成分离。框架通过部分有序模式提取情景轴,构建增强数据集,并采用比较语法确保语义和算术一致性,同时利用最大熵原理驱动的有趣性选择机制平衡覆盖与非冗余。在COVID-19情景建模中心上的实验表明,该模型生成的叙述具有更好的事实基础和更广泛的流行病学模式覆盖。
研究人员通过新解释性技术“雅可比透镜”发现,大型语言模型中存在一个类似于人类意识全局工作空间的功能结构——J空间。该空间中的表征可以被言语报告、故意调用和保持,用于中间推理步骤,并传递给任意下游计算,而自动处理则无需它们。J空间在中间层携带连贯内容,同时容纳数十个概念,并通过权重广播更广泛。在一致性审计中,它揭示了策略性思考、评估意识和训练中产生的错误倾向,而这些从未出现在输出中。后训练将助手的观点安装到工作空间中。反事实反思训练通过仅训练模型在被打断并要求反思时会说的话来改善行为。这些发现表明语言模型维持着一小部分特权表征,具有意识访问的功能特征。
该研究提出将电子健康记录中的多模态数据(包括结构化检测值和自由文本临床叙述)全部转换为自然语言序列,直接微调预训练语言模型,无需专门的多模态融合架构。在住院死亡率、移植后移植物失效和急诊分诊三项临床预测任务中,该方法与或超过特定任务的多模态基线,并优于临床部署的梯度提升模型,大幅降低了系统复杂度。
LLM4EHR是一种新型临床基础模型,结合领域适配的大语言模型和Transformer时间序列编码器,通过正则化对比目标对齐EHR事件与时间序列,在ICU预测任务上表现优异,并支持通过k-shot迁移到新群体。
一篇系统评估五个大型语言模型(LLM)在技术市场分析中表现的研究论文,发现GPT-4 Turbo实现最高年化收益率和夏普比率,而FinGPT通过领域微调展现出有竞争力的风险调整后表现。研究还指出了数值幻觉、上下文窗口限制等常见缺陷。
本文提出一种基于伯努利朴素贝叶斯(BNB)模型的统计驱动框架,通过监督χ²引导的统计二值化将连续变量转化为阈值,实现完全可解释的规则化临床分类。在皮马印第安人糖尿病、威斯康星乳腺癌和心力衰竭预测三个基准数据集上,AUC得分分别为0.800、0.984和0.919。概率校准通过Brier分数和beta校准得到改善。模型推理仅需参考表和基本算术,无需专有工具,为医疗AI的可信性和泛化提供实用方案。
本研究基于OECD数据集,对可信人工智能(TAI)工具和信任标记框架进行了实证分析,揭示了伦理焦点、生命周期覆盖、利益相关方定位及工具类型学上的显著不对称。研究建议扩大伦理目标、将伦理嵌入AI全生命周期,并促进更广泛的多利益相关方参与。
互联网模因融合了视觉、文本和文化背景,使得幽默、讽刺与恶意共存的情况难以解读。现有多模态分类器要么忽略这些相互依赖关系,要么可解释性有限。本文提出MAR-12框架,利用视觉语言模型(VLM)从12个结构化视角解读模因,通过角色感知软门控注意力机制学习各视角贡献,再基于原型分类器进行预测,并综合视角推理和注意力权重生成解释。在PrideMM和Memotion数据集上,幽默检测准确率达80.3%,仇恨检测达75.9%,优于现有方法,且生成的解释连贯可信。
一项新研究通过四种嵌套的Codex智能体实验,揭示了可执行世界模型、计划性简化和精确回放验证在ARC-AGI-3任务中的贡献。结果表明,更强的模型和更高的推理努力始终提升性能,但各组件效果因设置而异,完整的验证处理表现最佳但资源消耗大。
DrawingVQA 是首个专为评估多模态大语言模型(MLLM)在真实施工图纸上表现而设计的基准。它包含33张“签发施工”图纸和92个专家策划的问答对,涵盖感知理解、上下文解释和领域专家推理三个深度。通过双分类框架,该基准首次将工程工作流映射到AI推理能力,评估显示最先进的MLLM与专家性能之间仍存在显著差距,尤其是在高推理深度上。
一项对4,181道数学问题的研究表明,在多智能体系统中,规划-执行-评审流水线的高精度评审者并不能保证批评被实际用于改进答案。广播式同伴讨论在难题上实现了更高的准确率,凸显了检测与采纳之间的差距。
AnovaX是一个完全在用户计算机上运行的本地优先桌面语音助手,利用单个Python进程集成唤醒词门控、语音处理、基于Gemini的LLM规划器(输出JSON计划)、安全层、多智能体协调器(将计划转化为类型化子智能体)以及自适应恢复循环。每个工具对应专门的智能体类,具有超时、重试策略和共享资源锁。通过Flask服务器支持手机远程控制,实时镜像智能体事件并流式传输屏幕。项目旨在展示一个轻量级、可读的助手足以完成复杂桌面任务。
Cura 1T是一个专为医疗场景设计的大型语言模型,通过人工门控的自我进化循环进行训练。它能处理患者咨询、图文临床推理、交互式诊断和电子健康记录工具使用。在医疗评估套件中,Cura 1T排名顶尖,同时在通用推理和智能体基准测试上也保持竞争力。
本文提出Causal-Audit框架,将因果推理显式建模为结构化因果图上的四阶段推理,而非隐式端到端预测。核心创新包括目标感知的因果图构建策略和路径级因果证据聚合机制,有效抑制无关变量和虚假因果,提升复杂干预下的鲁棒性。在三个基准测试上,该方法优于现有LLM方法,并提供可解释、可审计的推理轨迹。
GraphDx是一种结合知识图谱和多智能体协作的框架,通过自动化构建医疗诊断知识图谱和三个智能体(感知、推理、决策)的协同工作,在序贯诊断中平衡准确性和资源成本。在MedQA和MIMIC-IV数据集上的实验表明,GraphDx将诊断成功率从50-68%提升至79-93%,同时将测试成本降低20-54%,为自动化临床诊断提供了稳健、经济且可解释的解决方案。
在一封2022年的邮件中,Sam Altman向OpenAI董事会表示,计划尽快发布一个可在消费级硬件上运行的、能力接近GPT-3的开源语言模型,以阻止竞争对手并减少新项目的资金支持。该邮件在2026年的马斯克诉Altman案中被公开。
一位社区开发者基于OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的对话数据进行微调,发布了一个仅657MB的本地推理模型。该模型支持128K上下文窗口、可切换的思维模式,并可在llama.cpp等工具中运行。本文验证了其技术细节,区分了微调与真正的能力继承,并指出了许可问题。
本文对比了六款适合单张24GB GPU(如RTX 3090/4090)的开放权重模型,涵盖Qwen3.6、Gemma 4、Mistral Small等,并解释了内存分配、量化策略以及各模型的优势场景。
为AI研究人员整理的免费资源合集,包括超过1000美元的免费计算积分、研究指南、社区论坛等,帮助学生在不花费一分钱的情况下开始AI研究。
Feyn Labs发布了SQRL,这是一系列文本到SQL模型,能在生成查询前通过只读探针检查数据库。旗舰型号SQRL-35B-A3B在BIRD Dev上达到70.6%的执行准确率,略超Claude Opus 4.6,并可蒸馏为可自托管的4B和9B检查点。
阿里巴巴Qwen团队预览了Qwen3.8-Max-Preview,一个2.4万亿参数的多模态MoE模型,号称“仅次于Fable 5”。该预览已在Token Plan、Qoder和QoderWork上以标准定价的10%提供。但尚未提供任何基准测试表、模型卡、许可证、每token价格或激活参数数量。本文区分了阿里巴巴确认的内容和仅声称的内容。
CallBro是一款免费的私有会议笔记应用,可在本地转录通话,并使用AI(Codex、Claude Code或本地LLM)生成摘要和行动项。所有数据保留在设备上,无需云上传,支持多种平台,并通过MCP与工具集成。
KloofStreet.online 是一个专注于开普敦克鲁夫街的 AI 驱动指南。该街道被 Time Out 评为 2025 年全球第 22 酷街及非洲最酷街道。网站收录了 50 多家餐厅、养生馆、艺术画廊等商户,并提供名为 Street Pass 的会员计划,包括 AI 礼宾服务、折扣和专属体验。
Qwen 3.8 Max是Qwen系列的最新模型,已在其官网发布。
本文介绍了10个开源的无代码或低代码AI平台,用于构建大型语言模型应用、检索增强生成系统和AI智能体。每个平台都经过许可验证,并提供了仓库链接和最佳用例。这些工具通过可视化界面、Web UI和自然语言提示,使开发者能够快速原型设计并实现数据自托管。
一门创新的多变量微积分课程,将大语言模型融入教学,从向量部分开始。
中国三家实验室的旗舰开源MoE模型——Kimi K3、DeepSeek V4 Pro和GLM-5.2——在基准测试、许可条款和服务成本上各有优劣。Kimi K3性能最强但仅限API,DeepSeek V4 Pro成本最低且立即开源,GLM-5.2平衡了速度与可部署性。
本教程详细介绍了如何在Google Colab上使用单个GPU,通过NVIDIA NeMo AutoModel对Qwen3-0.6B模型进行LoRA参数高效微调。涵盖环境验证、源码安装、配方加载与调整、命令行训练、模型评估以及Python API调用。