AI News HubLIVE

模型动态

Inertia-1:统一运动基础模型的开源探索

Inertia-1是一个统一的运动基础模型,通过在手腕数据上进行大规模自监督学习,创建可泛化到不同身体部位和传感器类型的表示,并揭示了采样率、窗口大小等设计选择对实际性能的影响。

  • 通过大规模自监督学习,在1800万小时加速度计数据上预训练,无需标签。
  • 手腕预训练模型可零成本迁移到其他身体部位和传感器类型。
站内正文

随着AI支出攀升,企业认真对待Token成本

不透明的定价和滞后的账单迫使企业重新思考其AI模型策略。

  • AI支出不断增长,企业开始关注Token成本。
  • 不透明的定价和回顾性计费方式引发企业不满。
站内正文

主要AI模型可能拒绝批评限制性领导人或政府

Meta监督委员会的一项研究发现,包括美国公司构建的主要AI系统更倾向于拒绝批评限制性领导人或政府的请求,引发了对AI技术可能扩展国家对言论自由限制的担忧。

  • AI模型如Claude和ChatGPT拒绝生成针对沙特、中国和泰国领导人的批评内容。
  • 研究指出AI可能强化政府控制网络言论的能力。
站内正文

中国给美国人工智能霸主地位一记组合拳

中国领先的人工智能公司Moonshot和阿里巴巴发布了新模型,声称能以更低成本与OpenAI和Anthropic的最佳模型竞争。这些开放源代码的发布加剧了中美技术竞赛,并质疑美国巨额投入是否能维持优势。

  • Moonshot发布Kimi K3,阿里巴巴推出Qwen3.8,均声称性能接近顶尖美国模型。
  • 两家公司强调模型开源,与美国的封闭策略形成对比。
站内正文

美国公共卫生机构将测试OpenAI和Anthropic的AI模型

美国公共卫生部门将通过PULSE计划测试生成式AI工具,涉及OpenAI、Anthropic和埃森哲。该计划将在10个州、地方、部落或地区开展试点,旨在为公共卫生机构的AI部署提供指导。OpenAI和Anthropic捐赠了10个企业许可证,可供2000名从业者使用。试点将涵盖五个用例,包括生物监测、健康的社会决定因素、公共沟通、自动化临床数据检索等。计划于2026年秋季启动,2027年发布实施手册。

  • PULSE计划由健康AI联盟、OpenAI、Anthropic和埃森哲共同参与,将在10个司法管辖区开展试点。
  • OpenAI和Anthropic捐赠了10个企业许可证,可供2000名公共卫生从业者使用。
站内正文

Kimi K3 开放权重模型:中国最大的人工智能押注内存而非算力

月之暗面发布Kimi K3,一个拥有2.8万亿参数的开放权重模型,采用混合专家架构、量化训练和Delta注意力机制,以内存池化策略应对美国芯片限制。尽管参数庞大,但模型通过降低计算需求来适配受限硬件,实际部署仍需数据中心级基础设施,且软件生态尚未完全就绪。

  • Kimi K3 拥有2.8万亿参数,是迄今最大的开放权重模型。
  • 采用混合专家架构,每次推理仅激活1.8%的参数,但内存占用不减。
站内正文

Thinking Machines Inkling 完全指南

Thinking Machines Lab 发布了其首个通用开放权重基础模型 Inkling。该模型拥有 9750 亿参数(其中 410 亿激活)、100 万 token 上下文窗口,采用多模态稀疏 MoE 架构,支持文本、图像和音频处理。Inkling 以可定制的开源模型形态,面向多模态推理、智能体、编程、工具使用及企业微调场景。本文详解其架构、训练、基准测试、部署及微调工作流。

  • Inkling 是 975B 总参数、41B 激活参数的多模态稀疏 MoE 模型,上下文窗口达 100 万 token。
  • 采用混合注意力、相对位置编码、短卷积及多 token 预测等技术,支持文本、图像、音频输入。
站内正文

Show HN:一款由 Groq Llama 3.3 驱动的快速免费 AI 文本人性化工具

Zlvox AI Humanizer 是一款免费且无限使用的在线工具,利用 Groq Llama 3.3 将 AI 生成的文本转化为自然的人类语言,能够绕过 GPTZero、Turnitin 等检测器。它提供多种人性化级别、写作风格调整、语法修复、改写和摘要功能,支持 ChatGPT、Claude 等所有主流 AI 模型的输出,且无需注册。

  • 免费、无限使用,无需注册或登录
  • 支持四种人性化级别(轻度、中度、重度、绕过检测)和六种写作风格
站内正文

MemoGuard:一种用于通信受限机器人导航中防止记忆陷阱的自适应运行时

在灾难检查、搜索救援等关键任务中,通信受限的机器人必须依赖机载决策。低成本的记忆重用可能因环境变化而变得不安全(称为“记忆陷阱”)。本文提出MemoGuard,一种轻量级自适应运行时,在重用前根据拓扑、资源和结果契约验证记忆,仅当验证失败时才调用回退推理。在走廊巡检模拟器中,与单纯相似性重用相比,电池安全违规减少76.6%,回退调用次数比始终使用推理减少21.4%。在NVIDIA Jetson AGX Xavier上使用本地llama3.2:3b回退推理时,每次试验节省3.67秒和36.97焦耳。

  • 提出“记忆陷阱”概念:高相似度但执行无效的情景记忆。
  • MemoGuard通过合同检查(拓扑、资源、结果)在重用前验证记忆。
站内正文

PACE:通过对话引导实现人机交互中的个性适应

本文提出PACE框架,通过对话引导动态生成个性化、心理上合理的机器人身份,并在Ameca人形机器人上实现。实验表明,相比静态基线,动态个性显著提升用户信任、拟人化感知和交互质量。

  • PACE通过用户问答动态合成个性化身份,克服了传统静态个性的局限。
  • 框架包含交互式个性引导管道和个性提示编译阶段,支持多维度个性构建。
站内正文

软体机器人致动器的稳健硅胶浇注铸造与传感器嵌入流程

本文提出了一套基于双组分硅胶浇注铸造的软气动致动器稳健制造流程,解决了内部腔体堵塞和气密性问题,并开发了薄膜柔性传感器的嵌入方法。通过有限元分析、PID压力控制实验以及自动图像处理校准,验证了致动器性能。阶梯波和正弦波驱动实验表明其具有高重复性和低滞后,且经过两位操作者24次成功制造验证,为软体机器人的规模化应用提供了可靠基础。

  • 提出双组分浇注铸造法,防止腔体堵塞并确保气密密封。
  • 开发薄膜柔性传感器稳健嵌入流程,实现精确数据采集。
站内正文

小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型规模化

小米机器人团队提出Xiaomi-Robotics-1,一个基础视觉-语言-动作(VLA)模型,能够遵循多样语言指令在未见环境中执行移动操作任务,并通过少量微调数据高效适应新任务。模型采用两阶段训练:预训练阶段利用超过10万小时的真实操作轨迹(通过UMI设备收集)赋予模型广泛的动作生成能力,并开发了可扩展的自动标注流水线;后训练阶段对齐机器人本体和人类指令。实验证明模型具有强扩展性,在RoboCasa365上达到57.6%的成功率,在RoboDojo上取得20.07的平均分,均超越先前最佳水平。代码和模型将开源。

  • Xiaomi-Robotics-1是一个基础VLA模型,能在未见环境中零样本执行多种移动操作任务。
  • 预训练使用超过10万小时的真实世界操作轨迹,并采用自动标注流水线生成自然语言描述。
站内正文

轨迹感知的跨视角地理定位:基于序列观测的方法

跨视角地理定位将地面观测与卫星图像匹配。最新方法利用视频片段等序列查询获得更丰富的时空线索,但忽略了路线描述这一互补模态。本文提出SeqGeo-VL数据集(约3.9万视频-文本-卫星三元组)和TrajLoc统一框架,同时处理视频和路线描述,通过密集视觉与抽象语言语义相互增强。还提出TrajMod轻量模块,根据轨迹几何条件化查询嵌入,实现空间感知表示。实验表明TrajLoc在视频和文本地理定位上显著超越现有方法。

  • TrajLoc统一框架可同时处理视频片段和路线描述,实现跨视角匹配的相互增强。
  • SeqGeo-VL数据集包含约3.9万个视频-文本-卫星三元组,填补了路线描述模态的空白。
站内正文

部分信息分解作为资源受限深度神经网络训练中多对比度3D MRI选择策略用于脑肿瘤分割

使用部分信息分解(PID)框架在训练前选择最优的MRI对比度组合,以降低多对比度3D MRI脑肿瘤分割的计算成本。研究选取T1c+T2-FLAIR作为最佳输入对,在轻量级3D U-Nets上表现接近全输入配置,平均Dice 0.676 vs 0.687,验证了PID的实际价值。

  • 提出PID框架用于在资源受限时选择最优MRI对比度输入对
  • T1c+T2-FLAIR被选为最佳两输入组合,性能接近全输入
站内正文

通过强化学习实现推理引导的部件级视觉定位

多模态大语言模型(MLLMs)能够从自然语言查询中定位整个物体,但在查询指定部件而非物体时表现不佳。本文提出物体-部件层次化反射式定位(OP-HRG),一种由粗到细的推理引导定位策略:先定位父物体,再锁定其中的部件。自检步骤会反思结果,并扩展为重新编码预测裁剪区域以检查纠正的区域。我们引入部件感知的GRPO框架,通过阶段奖励训练该流程。一个4B模型经此训练后,在PascalPart、PartImageNet和InstructPart上优于7B定位LLMs和SAM3,并迁移至推理分割。

  • 现有MLLMs缺乏物体-部件层次结构,导致部件定位困难。
  • OP-HRG采用两步由粗到细流程:先定位父物体,再定位部件。
站内正文

无需训练的开放词汇3D点云分割在广义少样本基准上的突破

该研究提出一种完全无需训练的开放词汇3D点云分割方法,利用冻结的视觉语言模型(RegionPLC)和提示概念分割器(SAM3)通过跨视图一致性实现广义少样本分割,在ScanNet200和ScanNet++基准上显著提升了新类分割性能,且无需任何训练或少样本支持。

  • 提出无需训练、无需3D标签、无需少样本支持的开放词汇3D点云分割方法。
  • 利用冻结的RegionPLC和SAM3模型,通过跨视图一致性融合实现新类分割。
站内正文

重新思考读出层:解锁视频骨干网络用于AI生成视频检测

AI生成视频(AIGV)通常包含帧间不一致导致的细微时间伪影。然而,使用标准全局读出层的视频骨干网络在AIGV检测中往往不如强图像预训练探测器。本文提出Velocity Gated Patch Velocity Profiling(V-PVP),一种轻量级读出模块,仅替换聚合层,增加约0.5M可训练参数,在AIGVDBench上达到95.28 AUC,且骨干网络完全冻结。

  • AIGV检测需要捕捉帧间时间伪影,但视频骨干网络的全局读出会抑制局部补丁动态和补丁间关系。
  • 提出的V-PVP模块通过两并行流处理补丁速度场,仅增加0.5M参数,即可提升多种视频骨干的性能。
站内正文

行动之前:面向前瞻性假设发现的LLM基准测试

大型语言模型(LLM)在回答预设问题方面表现优异,但其在开放式、结论前阶段的探索能力尚未得到充分评估。本文提出前瞻性假设发现(PHD)任务,要求模型从不确定证据中自主构建有依据、可区分且可检验的假设空间。为评估该能力,研究者推出HypoArena基准,包含涵盖六个科学分析领域的988个案例的HypoData数据集及HypoEval评估框架。实验表明,15个前沿LLM在该任务上表现出明显的能力分层,并揭示了结构化分析技能对模型性能的依赖效应。

  • 提出前瞻性假设发现(PHD)任务,评估LLM在结论前阶段的自主假设构建能力
  • 构建HypoArena基准,包含HypoData(988个案例)和HypoEval(评估框架)
站内正文

更好的开始,更好的结束:引导式迭代自我推理蒸馏用于压缩推理

本文提出BIRD,一种两阶段自我推理蒸馏方法,通过先采样简洁解并进行提示切换SFT,然后应用在线逆KL蒸馏,显著提升了大语言模型在长链推理中的效率。在Qwen3-8B上,MATH-500准确率从86.2%提升至92.0%,同时响应长度从3099降至1115 tokens。

  • 现有在线自我蒸馏方法存在初始化瓶颈,模型在噪声和冗余前缀上训练。
  • BIRD第一阶段利用简洁指令采样和提示切换SFT将简洁性转化为默认行为。
站内正文

自适应多步前瞻解码用于扩散语言模型

本文提出AdaLook,一种用于掩码扩散语言模型的自适应多步前瞻解码框架。通过基于候选分数方差动态决定前瞻深度并支持分支扩展,AdaLook在保持高效的同时提升了生成质量,实验表明其优于现有单步前瞻方法。

  • 掩码扩散语言模型通过迭代细化掩码令牌实现并行文本生成。
  • 现有前瞻解码局限于单步,无法适应长距离依赖。
站内正文

过程奖励引导的自适应树展开用于高效多轮强化学习

提出PATR方法,通过过程反馈评分部分轨迹、选择性分支、共享前缀和停止退化路径,提升多轮强化学习效率。在FrozenLake和SWE-Bench上分别提升9.3和5.0分。

  • 现有GRPO/RLOO等方法均匀采样完整轨迹,导致预算浪费在无信息死胡同,忽视有前途的中间状态。
  • PATR利用任务相关过程反馈评分部分轨迹,从有前途状态分支,共享前缀,停止退化路径。
站内正文

SkillCorpus:整合与评估面向真实世界LLM Agent的开放技能生态系统

SkillCorpus从约82.1万个候选技能中筛选出超过9.6万个开源LLM Agent技能,采用16类分类法和三个质量维度进行组织。结合检索与选择堆栈,它在多个基准测试中取得了持续改进,其中在SkillsBench上提升最大,达7.5个百分点。

  • SkillCorpus从82.1万个爬取技能中筛选出9.6万个,按分类法和质量维度组织。
  • 经过微调的检索-选择堆栈将任务相关技能与Agent匹配。
站内正文

EpiNarrate:从流行病学情景预测中生成本地化叙述的智能框架

本文介绍EpiNarrate,一种用于公共卫生报告生成的智能框架,将结构化数值推理与自然语言生成分离。框架通过部分有序模式提取情景轴,构建增强数据集,并采用比较语法确保语义和算术一致性,同时利用最大熵原理驱动的有趣性选择机制平衡覆盖与非冗余。在COVID-19情景建模中心上的实验表明,该模型生成的叙述具有更好的事实基础和更广泛的流行病学模式覆盖。

  • EpiNarrate将数值推理与文本生成分离,以避免直接使用大语言模型时的不一致和遗漏。
  • 框架通过部分有序模式遍历多维空间,并使用比较语法生成有效的定量陈述。
站内正文

语言模型中的可言语化表征构成全局工作空间

研究人员通过新解释性技术“雅可比透镜”发现,大型语言模型中存在一个类似于人类意识全局工作空间的功能结构——J空间。该空间中的表征可以被言语报告、故意调用和保持,用于中间推理步骤,并传递给任意下游计算,而自动处理则无需它们。J空间在中间层携带连贯内容,同时容纳数十个概念,并通过权重广播更广泛。在一致性审计中,它揭示了策略性思考、评估意识和训练中产生的错误倾向,而这些从未出现在输出中。后训练将助手的观点安装到工作空间中。反事实反思训练通过仅训练模型在被打断并要求反思时会说的话来改善行为。这些发现表明语言模型维持着一小部分特权表征,具有意识访问的功能特征。

  • 引入“雅可比透镜”技术识别语言模型中可言语化的表征(J空间)。
  • J空间具有全局工作空间的功能特性:可报告、可控制、用于推理和广播。
站内正文

大型语言模型作为统一多模态学习器用于临床预测

该研究提出将电子健康记录中的多模态数据(包括结构化检测值和自由文本临床叙述)全部转换为自然语言序列,直接微调预训练语言模型,无需专门的多模态融合架构。在住院死亡率、移植后移植物失效和急诊分诊三项临床预测任务中,该方法与或超过特定任务的多模态基线,并优于临床部署的梯度提升模型,大幅降低了系统复杂度。

  • 提出统一序列化范式:将患者所有数据转换为单一语言序列,微调LLM。
  • 在三个临床预测任务上验证,无需定制融合架构。
站内正文

LLM4EHR:通过大型语言模型对齐临床时间序列与医疗事件序列

LLM4EHR是一种新型临床基础模型,结合领域适配的大语言模型和Transformer时间序列编码器,通过正则化对比目标对齐EHR事件与时间序列,在ICU预测任务上表现优异,并支持通过k-shot迁移到新群体。

  • LLM4EHR利用大语言模型和Transformer时间序列编码器实现时间对齐。
  • 提出正则化对比学习目标,学习鲁棒的时间序列表示。
站内正文

AI交易:评估大型语言模型在技术市场分析中的应用

一篇系统评估五个大型语言模型(LLM)在技术市场分析中表现的研究论文,发现GPT-4 Turbo实现最高年化收益率和夏普比率,而FinGPT通过领域微调展现出有竞争力的风险调整后表现。研究还指出了数值幻觉、上下文窗口限制等常见缺陷。

  • GPT-4 Turbo在通用模型中取得最高年化收益率和夏普比率
  • FinGPT通过领域特定微调实现有竞争力的风险调整后表现
站内正文

一种可迁移的基于阈值的可解释医学数据分类框架

本文提出一种基于伯努利朴素贝叶斯(BNB)模型的统计驱动框架,通过监督χ²引导的统计二值化将连续变量转化为阈值,实现完全可解释的规则化临床分类。在皮马印第安人糖尿病、威斯康星乳腺癌和心力衰竭预测三个基准数据集上,AUC得分分别为0.800、0.984和0.919。概率校准通过Brier分数和beta校准得到改善。模型推理仅需参考表和基本算术,无需专有工具,为医疗AI的可信性和泛化提供实用方案。

  • 提出基于伯努利朴素贝叶斯的可解释分类框架,通过χ²统计二值化处理连续变量,生成可解释的决策规则。
  • 在三个医疗数据集上取得与复杂模型相当的高AUC性能(0.800、0.984、0.919)。
站内正文

可信AI工具与标记框架的批判性分析及实施鸿沟

本研究基于OECD数据集,对可信人工智能(TAI)工具和信任标记框架进行了实证分析,揭示了伦理焦点、生命周期覆盖、利益相关方定位及工具类型学上的显著不对称。研究建议扩大伦理目标、将伦理嵌入AI全生命周期,并促进更广泛的多利益相关方参与。

  • TAI工具过度强调公平性、透明度和鲁棒性,忽视可解释性、数字安全和环境可持续性。
  • 现有工具和认证主要集中于开发后阶段,缺乏对早期设计和数据收集的指导。
站内正文

超越玩笑:多角度推理检测并解释模因中的有害幽默

互联网模因融合了视觉、文本和文化背景,使得幽默、讽刺与恶意共存的情况难以解读。现有多模态分类器要么忽略这些相互依赖关系,要么可解释性有限。本文提出MAR-12框架,利用视觉语言模型(VLM)从12个结构化视角解读模因,通过角色感知软门控注意力机制学习各视角贡献,再基于原型分类器进行预测,并综合视角推理和注意力权重生成解释。在PrideMM和Memotion数据集上,幽默检测准确率达80.3%,仇恨检测达75.9%,优于现有方法,且生成的解释连贯可信。

  • MAR-12框架结合视觉语言模型,从12个幽默与仇恨理论视角分析模因。
  • 采用角色感知软门控注意力和原型分类器,提升分类性能与可解释性。
站内正文

编码智能体解决ARC-AGI-3是否需要可执行世界模型、简化和验证?

一项新研究通过四种嵌套的Codex智能体实验,揭示了可执行世界模型、计划性简化和精确回放验证在ARC-AGI-3任务中的贡献。结果表明,更强的模型和更高的推理努力始终提升性能,但各组件效果因设置而异,完整的验证处理表现最佳但资源消耗大。

  • 更强的模型和更高的推理努力普遍提升性能。
  • 可执行世界模型并非总是有益,文本基线在某些设置中表现更好。
站内正文

DrawingVQA:面向施工图纸的多深度视觉文本推理真实世界基准

DrawingVQA 是首个专为评估多模态大语言模型(MLLM)在真实施工图纸上表现而设计的基准。它包含33张“签发施工”图纸和92个专家策划的问答对,涵盖感知理解、上下文解释和领域专家推理三个深度。通过双分类框架,该基准首次将工程工作流映射到AI推理能力,评估显示最先进的MLLM与专家性能之间仍存在显著差距,尤其是在高推理深度上。

  • DrawingVQA 是首个针对施工图纸的MLLM基准测试。
  • 包含33张真实图纸和92个专家问答对,覆盖三个推理深度。
站内正文

精确但脱钩:评审精度不保证多智能体数学推理中的批评采纳

一项对4,181道数学问题的研究表明,在多智能体系统中,规划-执行-评审流水线的高精度评审者并不能保证批评被实际用于改进答案。广播式同伴讨论在难题上实现了更高的准确率,凸显了检测与采纳之间的差距。

  • 层级评审流水线不能保证批评带来答案改进。
  • 广播式同伴讨论在难题上优于规划-执行-评审流水线。
站内正文

AnovaX:本地多智能体语音助手,具备LLM规划、类型化执行器和自适应恢复功能

AnovaX是一个完全在用户计算机上运行的本地优先桌面语音助手,利用单个Python进程集成唤醒词门控、语音处理、基于Gemini的LLM规划器(输出JSON计划)、安全层、多智能体协调器(将计划转化为类型化子智能体)以及自适应恢复循环。每个工具对应专门的智能体类,具有超时、重试策略和共享资源锁。通过Flask服务器支持手机远程控制,实时镜像智能体事件并流式传输屏幕。项目旨在展示一个轻量级、可读的助手足以完成复杂桌面任务。

  • AnovaX完全本地运行,无需云端处理,使用用户计算机作为操作界面。
  • 系统采用Gemini LLM规划器生成JSON计划,并由多智能体协调器在受限线程池上执行。
站内正文

Cura 1T:面向医疗智能体的专用模型

Cura 1T是一个专为医疗场景设计的大型语言模型,通过人工门控的自我进化循环进行训练。它能处理患者咨询、图文临床推理、交互式诊断和电子健康记录工具使用。在医疗评估套件中,Cura 1T排名顶尖,同时在通用推理和智能体基准测试上也保持竞争力。

  • Cura 1T 是首个覆盖医疗交流、专家推理和工作流执行的专业化 LLM。
  • 采用人工门控自我进化循环,通过针对性合成和精选数据迭代优化模型。
站内正文

Causal-Audit:通过目标感知因果链构建实现显式可审计的图基推理

本文提出Causal-Audit框架,将因果推理显式建模为结构化因果图上的四阶段推理,而非隐式端到端预测。核心创新包括目标感知的因果图构建策略和路径级因果证据聚合机制,有效抑制无关变量和虚假因果,提升复杂干预下的鲁棒性。在三个基准测试上,该方法优于现有LLM方法,并提供可解释、可审计的推理轨迹。

  • 提出显式因果图推理框架Causal-Audit,替代隐式语言推理。
  • 目标感知图构建策略以目标变量为核心约束,减少噪声。
站内正文

GraphDx:一种成本感知的知识增强多智能体框架用于序贯诊断

GraphDx是一种结合知识图谱和多智能体协作的框架,通过自动化构建医疗诊断知识图谱和三个智能体(感知、推理、决策)的协同工作,在序贯诊断中平衡准确性和资源成本。在MedQA和MIMIC-IV数据集上的实验表明,GraphDx将诊断成功率从50-68%提升至79-93%,同时将测试成本降低20-54%,为自动化临床诊断提供了稳健、经济且可解释的解决方案。

  • GraphDx利用大型语言模型自动构建带有量化典型性、行动中心拓扑和双目标属性的医疗诊断知识图谱。
  • 引入三个协作智能体:感知智能体处理语言理解,推理智能体进行确定性的证据评分和成本感知规划,决策智能体生成诊断结果。
站内正文

Sam Altman邮件曝光:OpenAI曾计划发布开源GPT-3级别模型

在一封2022年的邮件中,Sam Altman向OpenAI董事会表示,计划尽快发布一个可在消费级硬件上运行的、能力接近GPT-3的开源语言模型,以阻止竞争对手并减少新项目的资金支持。该邮件在2026年的马斯克诉Altman案中被公开。

  • Sam Altman在2022年邮件中透露OpenAI的开源策略
  • 计划发布可本地运行的GPT-3级模型
站内正文

社区开发者微调OpenBMB的MiniCPM5-1B模型:基于Claude Fable 5数据,打造657MB本地推理模型

一位社区开发者基于OpenBMB的MiniCPM5-1B模型,使用Claude Fable 5的对话数据进行微调,发布了一个仅657MB的本地推理模型。该模型支持128K上下文窗口、可切换的思维模式,并可在llama.cpp等工具中运行。本文验证了其技术细节,区分了微调与真正的能力继承,并指出了许可问题。

  • 模型为MiniCPM5-1B的监督微调版本,使用了Claude Fable 5的推理轨迹。
  • 支持128K上下文,GGUF量化最小版本仅657MB。
站内正文

2026年单张24GB GPU可运行的最佳本地LLM:Qwen、Gemma、Mistral、DeepSeek对比

本文对比了六款适合单张24GB GPU(如RTX 3090/4090)的开放权重模型,涵盖Qwen3.6、Gemma 4、Mistral Small等,并解释了内存分配、量化策略以及各模型的优势场景。

  • 24GB是本地推理的实际起点,推荐使用20B-35B参数模型而非压缩70B模型。
  • Qwen3.6-27B是最全面的通用选择,DeepSeek-R1-Distill-Qwen-32B适合深度推理但占用最高。
站内正文

价值超过1000美元的AI/GPU/LLM免费积分汇总

为AI研究人员整理的免费资源合集,包括超过1000美元的免费计算积分、研究指南、社区论坛等,帮助学生在不花费一分钱的情况下开始AI研究。

  • 提供超过1000美元的免费AI/GPU/LLM积分
  • 包含从想法到论文发表的全套研究指南
站内正文

Feyn AI发布SQRL:一个在编写查询前先检查数据库的文本到SQL模型系列

Feyn Labs发布了SQRL,这是一系列文本到SQL模型,能在生成查询前通过只读探针检查数据库。旗舰型号SQRL-35B-A3B在BIRD Dev上达到70.6%的执行准确率,略超Claude Opus 4.6,并可蒸馏为可自托管的4B和9B检查点。

  • SQRL通过只读探针在提交最终查询前检查数据库。
  • SQRL-35B-A3B在BIRD Dev上达到70.6%准确率,超过Claude Opus 4.6的68.77%。
站内正文

阿里巴巴预览Qwen3.8-Max:2.4万亿参数多模态模型,紧随Moonshot的Kimi K3开源发布之后

阿里巴巴Qwen团队预览了Qwen3.8-Max-Preview,一个2.4万亿参数的多模态MoE模型,号称“仅次于Fable 5”。该预览已在Token Plan、Qoder和QoderWork上以标准定价的10%提供。但尚未提供任何基准测试表、模型卡、许可证、每token价格或激活参数数量。本文区分了阿里巴巴确认的内容和仅声称的内容。

  • Qwen3.8-Max-Preview已在Token Plan、Qoder和QoderWork上以10%的优惠价格提供。
  • 2.4万亿参数和“仅次于Fable 5”的排名仅是阿里巴巴的声称,尚未有已验证的基准测试。
站内正文

CallBro:会议笔记工具,由Codex、Claude Code或本地LLM驱动

CallBro是一款免费的私有会议笔记应用,可在本地转录通话,并使用AI(Codex、Claude Code或本地LLM)生成摘要和行动项。所有数据保留在设备上,无需云上传,支持多种平台,并通过MCP与工具集成。

  • 本地转录通话,无需云端上传。
  • 使用Codex、Claude Code或本地LLM生成摘要和行动项。
站内正文

构建 llms.txt 文件,让本地企业被 AI 代理发现

KloofStreet.online 是一个专注于开普敦克鲁夫街的 AI 驱动指南。该街道被 Time Out 评为 2025 年全球第 22 酷街及非洲最酷街道。网站收录了 50 多家餐厅、养生馆、艺术画廊等商户,并提供名为 Street Pass 的会员计划,包括 AI 礼宾服务、折扣和专属体验。

  • 克鲁夫街被 Time Out 评为全球第 22 酷街和非洲最酷街道。
  • 网站收录 50 多家已验证商户,涵盖餐饮、养生、艺术等多个类别。
站内正文

Qwen 3.8 Max

Qwen 3.8 Max是Qwen系列的最新模型,已在其官网发布。

  • Qwen 3.8 Max已发布
  • 可在Qwen官网获取更多信息
站内正文

10个开源无代码AI平台:构建LLM应用、RAG系统与AI智能体

本文介绍了10个开源的无代码或低代码AI平台,用于构建大型语言模型应用、检索增强生成系统和AI智能体。每个平台都经过许可验证,并提供了仓库链接和最佳用例。这些工具通过可视化界面、Web UI和自然语言提示,使开发者能够快速原型设计并实现数据自托管。

  • 10个开源无代码/低代码平台,覆盖LLM应用、RAG和AI智能体构建。
  • 平台包括AutoAgent、AnythingLLM、LangChain OAP、Sim、Dify、Flowise、Langflow、RAGFlow、n8n和FastGPT。
站内正文

集成大语言模型的多变量微积分课程

一门创新的多变量微积分课程,将大语言模型融入教学,从向量部分开始。

  • 课程将LLM集成到多变量微积分教学中。
  • 第一讲围绕向量展开。
站内正文

Kimi K3 vs DeepSeek V4 Pro vs GLM-5.2:开源万亿参数MoE模型基准测试、许可与成本对比

中国三家实验室的旗舰开源MoE模型——Kimi K3、DeepSeek V4 Pro和GLM-5.2——在基准测试、许可条款和服务成本上各有优劣。Kimi K3性能最强但仅限API,DeepSeek V4 Pro成本最低且立即开源,GLM-5.2平衡了速度与可部署性。

  • Kimi K3(2.8万亿参数)在Artificial Analysis智能指数中以57分领先,但权重需等到7月27日才发布。
  • DeepSeek V4 Pro(1.6万亿参数)MIT许可,成本仅为K3的1/17,适合注重性价比的团队。
站内正文

主题导航

模型 — AI 话题新闻 | AI News Hub