跳到主要内容
AI News HubLIVE
公开文章 89采集文章 96可信度 90刷新频率 5 分钟
健康状态 自动暂停来源类型 官方原文权限 官方原文最近入库 2026-07-15ID huggingface-blog运行状态 未启用

Official source; confirm license per article before full body display.

最新公开文章

构建Shippy:AI代理在海洋安全领域的经验教训

Shippy是一个用于实时海洋领域感知的AI代理,其设计注重可靠性、模块化和可审计性。文章详细介绍了其架构:由“灵魂”(系统提示)、技能(结构化Markdown文件)和配置组成。通过专用CLI与Skylight API交互,并使用Mothership平台进行沙盒托管和用户隔离。评估系统针对真实场景和加权标准对整体代理进行评分。未来计划包括代理驱动的UI控制、模型路由和跨线程记忆。

Hugging Face Blog站内正文构建Shippy:AI代理在海洋安全领域的经验教训

模型路由看似简单,实则不然?

本文探讨了AI代理中模型路由的复杂性,指出路由不仅仅是分类问题,而是系统优化问题。文章通过三个维度(成本、复杂度、延迟)揭示了常见误解,并介绍了IBM Research团队构建的基于优化的路由解决方案。

Hugging Face Blog站内正文模型路由看似简单,实则不然?

欢迎Inkling:Thinking Machines的多模态大模型

Thinking Machines发布了Inkling,一个拥有约1万亿参数的开源多模态模型,支持图像、文本和音频输入,可处理高达100万token的上下文。该模型采用混合专家架构,仅激活410亿参数,并配有相对注意力和短卷积等创新设计。Inkling已在Hugging Face上发布,并得到transformers、SGLang和llama.cpp的即日支持。

Hugging Face Blog站内正文欢迎Inkling:Thinking Machines的多模态大模型

推出真实世界VoiceEQ:衡量语音AI的人类化质量

现有的基准测试显示语音AI接近人类水平,但实际对话却大不相同。Hume AI发布了Real World VoiceEQ基准,从超过40个语音模型在15+维度和60+指标上进行评估,基于超过100万人类评分。关键发现包括:语音AI进展日益专业化、模型更擅长说话而非倾听、传统基准高估了实际性能、人类评估仍然不可或缺。

Hugging Face Blog站内正文推出真实世界VoiceEQ:衡量语音AI的人类化质量

智能体的数据

NVIDIA 通过开放数据和合成数据推动智能体 AI 发展,强调数据质量、可检查性和信任。

Hugging Face Blog站内正文智能体的数据

原生速度的vLLM transformers建模后端

Hugging Face的Transformers库的vLLM后端现在在多种LLM架构上达到了与原生vLLM实现相当甚至更快的推理速度。模型作者无需额外编码即可自动利用其Transformers实现获得超快推理。

Hugging Face Blog站内正文原生速度的vLLM transformers建模后端

从Hugging Face一键直达Amazon SageMaker Studio

Hugging Face与Amazon SageMaker AI深度集成,开发者现在可以通过一键操作从模型发现直接进入SageMaker Studio进行实验。该集成自动配置权限、显示GPU配额,并支持模型微调和部署,大幅缩短从灵感到部署的路径。

Hugging Face Blog站内正文从Hugging Face一键直达Amazon SageMaker Studio

LeRobot v0.6.0:想象、评估、改进

LeRobot v0.6.0 引入了世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),新一批VLA模型(GR00T N1.7、MolmoAct2等),奖励模型API(Robometer、TOPReward),六个新仿真基准,以及部署CLI、深度感知、数据集注解加速等功能,旨在闭环机器人学习循环。

Hugging Face Blog站内正文LeRobot v0.6.0:想象、评估、改进

PRX 第四部分:我们的数据策略

本文详细介绍了PRX(一个7B文本到图像模型)背后的数据管道。关键点包括从公开和内部数据集构建多样化的预训练数据集,使用VLM生成长而准确的标题,并利用Lance构建数据集、MDS进行流式处理。团队解释了选择质量92的JPEG编码、实时计算文本潜在向量以及关于数据碎片化的经验教训。

Hugging Face Blog站内正文PRX 第四部分:我们的数据策略

🤗 Kernels:重大更新

Hugging Face 的 Kernels 项目旨在标准化自定义内核的打包、分发和使用方式。本文总结了近期重大更新:引入新的“内核”仓库类型以提升可发现性;通过受信任的发布者和代码签名增强安全性;重构 CLI 以明确职责划分;扩展对 Torch Stable ABI 和 Apache TVM FFI 等框架的支持;为 AI 代理开发内核奠定基础;以及改进环境配置和兼容性检查工具。

Hugging Face Blog站内正文🤗 Kernels:重大更新

Hugging Face 与 Cerebras 携手将 Gemma 4 引入实时语音 AI

Hugging Face 与 Cerebras 合作,利用 Gemma 4 模型打造实时语音 AI 系统,通过开放模块化架构显著降低延迟,实现更自然的对话体验。该系统集成 Nvidia 的语音识别、Cerebras 的推理加速和 Alibaba 的语音合成,已在 9000 多台 Reachy Mini 机器人中应用。

Hugging Face Blog站内正文Hugging Face 与 Cerebras 携手将 Gemma 4 引入实时语音 AI

ScarfBench:面向企业Java框架迁移的AI智能体基准测试

IBM Research推出ScarfBench,这是一个用于评估AI智能体在企业Java中跨框架迁移任务的开源基准。该基准包含34个应用程序、102个框架实现和204个迁移任务。目前顶尖智能体的行为成功率低于10%,突显了在迁移过程中保持行为的难度。

Hugging Face Blog站内正文ScarfBench:面向企业Java框架迁移的AI智能体基准测试

专业化为何不可避免

本文从优化理论、进化生物学、竞争市场和机器学习四个角度论证了专业化是资源有限条件下系统提升性能的必然路径。作者指出,通用性并非性能优势,在有限资源下,集中资源于有限任务集比分散到无限范围更有效。文章还澄清了专业化和领域知识的区别,指出规模扩展不会改变这一根本约束。

Hugging Face Blog站内正文专业化为何不可避免

将Every Eval Ever结果集成到Hugging Face模型页面

Every Eval Ever (EEE) 与 Hugging Face Community Evals 实现互操作,允许用户交叉发布和解读评估结果,同时链接到开放模型、排行榜和统一的标准化元数据存储。

Hugging Face Blog站内正文将Every Eval Ever结果集成到Hugging Face模型页面

DiScoFormer:一个用于密度和分数的变换器,跨分布通用

DiScoFormer是一种新型变换器模型,能通过一次前向传播从数据点估计分布的密度和分数(对数密度的梯度),无需重新训练。它结合了跨注意力机制和共享骨干网络,利用密度与分数的数学关系进行无标签一致性学习。在100维空间中,其分数误差比最佳KDE降低约6.5倍,密度误差降低超过37倍,且能泛化到未见的高斯和非高斯分布。

Hugging Face Blog站内正文DiScoFormer:一个用于密度和分数的变换器,跨分布通用

一行命令在 HF Jobs 上运行 vLLM 服务器

本文介绍如何通过一行命令在 Hugging Face 基础设施上快速启动一个私有、兼容 OpenAI 的 LLM 端点,无需配置服务器或 Kubernetes,按秒计费。涵盖从启动、查询、清理到扩展为大模型、创建聊天 UI、SSH 调试及作为编码代理后端的完整流程,并与 Inference Endpoints 进行比较。

Hugging Face Blog站内正文一行命令在 HF Jobs 上运行 vLLM 服务器

混合模型在哪些token上预测得更好?

Ai2团队比较了7B参数规模的Transformer模型Olmo 3和混合模型Olmo Hybrid,发现混合模型在内容词(名词、动词、形容词)和需要上下文推理的token上表现更优,但在重复token和闭合括号上优势消失。研究表明,基于token的损失过滤可以揭示架构间的细微差异。

Hugging Face Blog站内正文混合模型在哪些token上预测得更好?

使用NVIDIA NeMo AutoModel加速Transformer微调

NVIDIA NeMo AutoModel基于HuggingFace Transformers v5,通过专家并行、DeepEP融合通信和TransformerEngine内核,将MoE模型微调的训练吞吐量提升3.4-3.7倍,GPU内存减少29-32%,且无需更改API。

Hugging Face Blog站内正文使用NVIDIA NeMo AutoModel加速Transformer微调

使用CUGA构建真实的智能体应用:轻量级框架上的二十多个工作示例

CUGA是IBM开源的智能体框架,处理了智能体构建中的管道工作,让开发者只需编写工具列表和提示词即可。本文通过一个IBM云架构顾问示例,展示了如何用少量代码构建一个完整的智能体应用,并介绍了CUGA的规划、执行、反射步骤和策略系统。

Hugging Face Blog站内正文使用CUGA构建真实的智能体应用:轻量级框架上的二十多个工作示例

在Transformers.js中试验提出的跨域存储API

本文介绍了跨域存储(COS)API提案,该API允许Web应用跨域共享大型文件(如AI模型和Wasm运行时),通过加密哈希而非URL标识文件,从而避免重复下载和存储。文章以Transformers.js为例,展示了当前浏览器缓存隔离导致的问题,以及COS如何通过哈希标识、可升级的访问控制和安全完整性检查来解决这些问题。

Hugging Face Blog站内正文在Transformers.js中试验提出的跨域存储API

每周发布huggingface_hub:借助AI、开源工具和人工审核

Hugging Face团队通过结合AI和开源工具,将huggingface_hub的发布周期从4-6周缩短至每周一次,同时保留人工审核环节以确保质量。该流程基于GitHub Actions、OpenCode和开放权重模型,每次发布成本仅约0.25美元。

Hugging Face Blog站内正文每周发布huggingface_hub:借助AI、开源工具和人工审核

PP-OCRv6 在 Hugging Face 上:从 1.5M 到 34.5M 参数的 50 种语言 OCR

PP-OCRv6 是 PaddleOCR 的最新通用 OCR 模型系列,支持从 1.5M 到 34.5M 参数的三个层级,覆盖 50 种语言。相比 PP-OCRv5_server,检测准确率提升 4.6 个百分点,识别准确率提升 5.1 个百分点。新架构包括 PPLCNetV4 骨干网络、RepLKFPN 检测模块和 EncoderWithLightSVTR 识别模块。支持 Paddle Inference、Transformers 和 ONNX Runtime 后端。

Hugging Face Blog站内正文PP-OCRv6 在 Hugging Face 上:从 1.5M 到 34.5M 参数的 50 种语言 OCR

我们让本地模型免费(*)为OpenClaw仓库进行问题分类!

OpenClaw维护者利用本地开源模型(Gemma、Qwen)在智能体框架中,实时对问题和拉取请求进行分类,性能媲美闭源模型,仅需硬件电费成本。

Hugging Face Blog站内正文我们让本地模型免费(*)为OpenClaw仓库进行问题分类!

MosaicLeaks:你的研究代理能保守秘密吗?

深度研究代理结合私有文档与网页搜索时,可能通过查询日志无意中泄露敏感信息。MosaicLeaks基准量化了这种隐私风险,并提出了一种名为隐私感知深度研究(PA-DR)的训练方法,可以在保持任务性能的同时,将信息泄露减少3倍以上。

Hugging Face Blog站内正文MosaicLeaks:你的研究代理能保守秘密吗?

超越LoRA:你能击败最流行的微调技术吗?

LoRA是目前最流行的参数高效微调(PEFT)技术,但研究表明其他方法在某些任务上表现更好。本文介绍了Hugging Face的PEFT库及其基准测试,探讨了如何根据具体需求选择合适的PEFT技术,并指出LoRA并非总是最佳选择。

Hugging Face Blog站内正文超越LoRA:你能击败最流行的微调技术吗?

它足够智能体化了吗?使用自有工具对开源模型进行基准测试

一个全新的基准测试框架专注于评估AI智能体使用软件库的整个过程工作量,以Hugging Face的Transformers库为案例。通过测量令牌使用量、时间、错误率等指标,揭示不同模型和工具层级下的性能权衡,为库维护者和智能体用户提供关键见解。

Hugging Face Blog站内正文它足够智能体化了吗?使用自有工具对开源模型进行基准测试

MolmoMotion:语言引导的3D运动预测

MolmoMotion是一种新型3D运动预测模型,能够根据视频帧、物体上的3D点以及语言指令预测未来几秒内物体点的3D轨迹。该模型在多个下游任务中表现出色,如机器人规划和可控视频生成。同时发布了最大的3D点轨迹数据集MolmoMotion-1M和基准测试PointMotionBench。

Hugging Face Blog站内正文MolmoMotion:语言引导的3D运动预测

从Hugging Face Hub到机器人硬件:Strands Agents与LeRobot的集成

AWS开源SDK Strands Robots集成了LeRobot,允许开发者通过单一Agent工作流从Hub数据集训练并在模拟或实体机器人上部署策略。本文介绍了五步流程,并提供了可在笔记本上运行的示例。

Hugging Face Blog站内正文从Hugging Face Hub到机器人硬件:Strands Agents与LeRobot的集成

GLM-5.2:专为长周期任务构建

GLM-5.2 是 Z.AI 推出的最新旗舰模型,专为长周期任务设计,拥有稳定的 1M 上下文窗口,在编码基准测试中表现优异,并引入 IndexShare 架构以降低计算成本,同时提供灵活的努力水平控制。该模型采用 MIT 开源许可证,无区域限制。

Hugging Face Blog站内正文GLM-5.2:专为长周期任务构建

全部来源