构建Shippy:AI代理在海洋安全领域的经验教训 2026-07-16 01:29 UTC+8 Shippy是一个用于实时海洋领域感知的AI代理,其设计注重可靠性、模块化和可审计性。文章详细介绍了其架构:由“灵魂”(系统提示)、技能(结构化Markdown文件)和配置组成。通过专用CLI与Skylight API交互,并使用Mothership平台进行沙盒托管和用户隔离。评估系统针对真实场景和加权标准对整体代理进行评分。未来计划包括代理驱动的UI控制、模型路由和跨线程记忆。
Shippy采用三层架构:灵魂(系统提示)、技能(Markdown文件)和配置,便于版本控制和审计。 通过专用CLI访问Skylight API,减少模型直接调用API的错误,提高可靠性。 模型路由看似简单,实则不然? 2026-07-16 01:27 UTC+8 本文探讨了AI代理中模型路由的复杂性,指出路由不仅仅是分类问题,而是系统优化问题。文章通过三个维度(成本、复杂度、延迟)揭示了常见误解,并介绍了IBM Research团队构建的基于优化的路由解决方案。
路由的实际成本受缓存影响,模型标价并非真实成本。 任务复杂度难以在路由时准确评估,路由器需平衡多个目标。 欢迎Inkling:Thinking Machines的多模态大模型 2026-07-15 08:00 UTC+8 Thinking Machines发布了Inkling,一个拥有约1万亿参数的开源多模态模型,支持图像、文本和音频输入,可处理高达100万token的上下文。该模型采用混合专家架构,仅激活410亿参数,并配有相对注意力和短卷积等创新设计。Inkling已在Hugging Face上发布,并得到transformers、SGLang和llama.cpp的即日支持。
Inkling是首个约1万亿参数的开源模型,原生支持图像、文本和音频输入,上下文窗口达100万token。 采用混合专家架构,总参数9750亿,但仅激活410亿,实现高效推理。 推出真实世界VoiceEQ:衡量语音AI的人类化质量 2026-07-15 08:00 UTC+8 现有的基准测试显示语音AI接近人类水平,但实际对话却大不相同。Hume AI发布了Real World VoiceEQ基准,从超过40个语音模型在15+维度和60+指标上进行评估,基于超过100万人类评分。关键发现包括:语音AI进展日益专业化、模型更擅长说话而非倾听、传统基准高估了实际性能、人类评估仍然不可或缺。
Real World VoiceEQ通过超过100万人类评分评估40多个语音模型在15+维度和60+指标上的表现。 研究发现语音模型在表达和倾听能力上存在差距,许多模型仍依赖文本转录而忽略语调、情感等副语言信息。 智能体的数据 2026-07-09 01:16 UTC+8 NVIDIA 通过开放数据和合成数据推动智能体 AI 发展,强调数据质量、可检查性和信任。
NVIDIA 发布了 Nemotron 系列开放数据集,包括预训练和后训练样本。 合成数据有助于在保护公司机密的同时共享有用信号。 原生速度的vLLM transformers建模后端 2026-07-08 08:00 UTC+8 Hugging Face的Transformers库的vLLM后端现在在多种LLM架构上达到了与原生vLLM实现相当甚至更快的推理速度。模型作者无需额外编码即可自动利用其Transformers实现获得超快推理。
Transformers vLLM后端在Qwen3 4B、32B和235B MoE模型上达到或超过了原生vLLM的吞吐量。 通过torch.fx和ast在运行时动态应用推理特定的层融合,匹配自定义代码实现的速度。 从Hugging Face一键直达Amazon SageMaker Studio 2026-07-08 05:15 UTC+8 Hugging Face与Amazon SageMaker AI深度集成,开发者现在可以通过一键操作从模型发现直接进入SageMaker Studio进行实验。该集成自动配置权限、显示GPU配额,并支持模型微调和部署,大幅缩短从灵感到部署的路径。
一键从Hugging Face模型页面跳转至SageMaker Studio,模型预加载、环境自动配置。 新Studio环境自动配置完整权限,包括微调、训练、笔记本实验和端点部署。 在任何云上运行AI工作负载,数据存储在Hugging Face:SkyPilot实现零出口存储 2026-07-07 08:00 UTC+8 SkyPilot与Hugging Face合作,允许用户将模型和数据集存储在Hugging Face Hub上,并通过SkyPilot在任何云上运行计算任务,无需支付数据传输费用。
通过hf:// URL和HF_TOKEN直接挂载Hugging Face存储到SkyPilot任务中 支持20多个云平台、Kubernetes和本地集群 LeRobot v0.6.0:想象、评估、改进 2026-07-07 08:00 UTC+8 LeRobot v0.6.0 引入了世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),新一批VLA模型(GR00T N1.7、MolmoAct2等),奖励模型API(Robometer、TOPReward),六个新仿真基准,以及部署CLI、深度感知、数据集注解加速等功能,旨在闭环机器人学习循环。
新增三种世界模型策略,使机器人能够通过想象未来辅助决策。 集成GR00T N1.7、MolmoAct2等VLA模型,支持微调和部署。 PRX 第四部分:我们的数据策略 2026-07-06 23:30 UTC+8 本文详细介绍了PRX(一个7B文本到图像模型)背后的数据管道。关键点包括从公开和内部数据集构建多样化的预训练数据集,使用VLM生成长而准确的标题,并利用Lance构建数据集、MDS进行流式处理。团队解释了选择质量92的JPEG编码、实时计算文本潜在向量以及关于数据碎片化的经验教训。
预训练数据由公开和内部数据集混合组成,并使用VLM重新生成标题以确保一致性。 长而准确的标题至关重要;它们将不完美转化为可控属性。 🤗 Kernels:重大更新 2026-07-06 08:00 UTC+8 Hugging Face 的 Kernels 项目旨在标准化自定义内核的打包、分发和使用方式。本文总结了近期重大更新:引入新的“内核”仓库类型以提升可发现性;通过受信任的发布者和代码签名增强安全性;重构 CLI 以明确职责划分;扩展对 Torch Stable ABI 和 Apache TVM FFI 等框架的支持;为 AI 代理开发内核奠定基础;以及改进环境配置和兼容性检查工具。
引入新的“内核”仓库类型,方便用户按加速器、操作系统和后端版本筛选内核。 安全性提升:默认仅加载受信任发布者的内核,并增加代码签名功能,使用 Sigstore 的临时密钥。 Hugging Face 与 Cerebras 携手将 Gemma 4 引入实时语音 AI 2026-07-01 08:00 UTC+8 Hugging Face 与 Cerebras 合作,利用 Gemma 4 模型打造实时语音 AI 系统,通过开放模块化架构显著降低延迟,实现更自然的对话体验。该系统集成 Nvidia 的语音识别、Cerebras 的推理加速和 Alibaba 的语音合成,已在 9000 多台 Reachy Mini 机器人中应用。
Hugging Face 和 Cerebras 推出基于 Gemma 4 的实时语音 AI 演示,延迟极低。 系统采用开放的级联架构:语音输入→语音识别→模型推理→语音合成→语音输出。 ScarfBench:面向企业Java框架迁移的AI智能体基准测试 2026-07-01 02:32 UTC+8 IBM Research推出ScarfBench,这是一个用于评估AI智能体在企业Java中跨框架迁移任务的开源基准。该基准包含34个应用程序、102个框架实现和204个迁移任务。目前顶尖智能体的行为成功率低于10%,突显了在迁移过程中保持行为的难度。
ScarfBench评估AI智能体在Spring、Jakarta EE和Quarkus之间的框架迁移能力,要求构建、部署和行为验证。 基准包含34个应用程序、约2000个源文件和测试文件,以及1331个专家编写的测试。 专业化为何不可避免 2026-06-30 22:39 UTC+8 本文从优化理论、进化生物学、竞争市场和机器学习四个角度论证了专业化是资源有限条件下系统提升性能的必然路径。作者指出,通用性并非性能优势,在有限资源下,集中资源于有限任务集比分散到无限范围更有效。文章还澄清了专业化和领域知识的区别,指出规模扩展不会改变这一根本约束。
优化理论中的“没有免费午餐”定理表明,任何算法都有其适用边界,专业化是高性能的关键。 生物学和市场经济中,资源有限导致专业化成为生存和发展策略。 将Every Eval Ever结果集成到Hugging Face模型页面 2026-06-30 08:00 UTC+8 Every Eval Ever (EEE) 与 Hugging Face Community Evals 实现互操作,允许用户交叉发布和解读评估结果,同时链接到开放模型、排行榜和统一的标准化元数据存储。
EEE 和 Hugging Face Community Evals 现已兼容,支持评估结果的交叉发布。 EEE 提供统一的 JSON 模式记录评估细节,包括运行者、模型、设置等。 DiScoFormer:一个用于密度和分数的变换器,跨分布通用 2026-06-30 02:02 UTC+8 DiScoFormer是一种新型变换器模型,能通过一次前向传播从数据点估计分布的密度和分数(对数密度的梯度),无需重新训练。它结合了跨注意力机制和共享骨干网络,利用密度与分数的数学关系进行无标签一致性学习。在100维空间中,其分数误差比最佳KDE降低约6.5倍,密度误差降低超过37倍,且能泛化到未见的高斯和非高斯分布。
DiScoFormer通过堆叠变换器块,一次前向传播同时估计密度和分数。 模型利用密度与分数之间的数学关系,通过一致性损失实现无监督适应。 一行命令在 HF Jobs 上运行 vLLM 服务器 2026-06-26 08:00 UTC+8 本文介绍如何通过一行命令在 Hugging Face 基础设施上快速启动一个私有、兼容 OpenAI 的 LLM 端点,无需配置服务器或 Kubernetes,按秒计费。涵盖从启动、查询、清理到扩展为大模型、创建聊天 UI、SSH 调试及作为编码代理后端的完整流程,并与 Inference Endpoints 进行比较。
使用 hf jobs run 命令结合 vLLM Docker 镜像,通过 --expose 8000 暴露端口,即可在 HF Jobs 上运行 vLLM 服务器。 端点通过 Hugging Face token 进行认证,仅限有读取权限的用户访问,支持使用 curl 或 OpenAI Python 客户端查询。 混合模型在哪些token上预测得更好? 2026-06-26 00:11 UTC+8 Ai2团队比较了7B参数规模的Transformer模型Olmo 3和混合模型Olmo Hybrid,发现混合模型在内容词(名词、动词、形容词)和需要上下文推理的token上表现更优,但在重复token和闭合括号上优势消失。研究表明,基于token的损失过滤可以揭示架构间的细微差异。
混合模型在含义丰富的token(如实词)上预测更准确,而在重复token上优势消失。 混合模型使用递归层替代部分注意力层,具有固定大小的记忆,适合跟踪序列变化。 使用NVIDIA NeMo AutoModel加速Transformer微调 2026-06-25 00:00 UTC+8 NVIDIA NeMo AutoModel基于HuggingFace Transformers v5,通过专家并行、DeepEP融合通信和TransformerEngine内核,将MoE模型微调的训练吞吐量提升3.4-3.7倍,GPU内存减少29-32%,且无需更改API。
NeMo AutoModel继承AutoModelForCausalLM,仅需更改导入行即可实现性能提升。 在550B规模模型上,专家并行使全微调在16节点H100集群上可行,而Transformers v5因内存不足无法运行。 使用CUGA构建真实的智能体应用:轻量级框架上的二十多个工作示例 2026-06-23 20:51 UTC+8 CUGA是IBM开源的智能体框架,处理了智能体构建中的管道工作,让开发者只需编写工具列表和提示词即可。本文通过一个IBM云架构顾问示例,展示了如何用少量代码构建一个完整的智能体应用,并介绍了CUGA的规划、执行、反射步骤和策略系统。
CUGA是一个开源智能体框架,简化了智能体应用的构建过程,开发者只需定义工具和提示。 本文展示了二十多个单文件应用,其中一个IBM云顾问示例详细说明了实现。 在Transformers.js中试验提出的跨域存储API 2026-06-23 08:00 UTC+8 本文介绍了跨域存储(COS)API提案,该API允许Web应用跨域共享大型文件(如AI模型和Wasm运行时),通过加密哈希而非URL标识文件,从而避免重复下载和存储。文章以Transformers.js为例,展示了当前浏览器缓存隔离导致的问题,以及COS如何通过哈希标识、可升级的访问控制和安全完整性检查来解决这些问题。
当前浏览器缓存按源隔离,导致跨域应用重复下载相同的AI模型和Wasm文件。 跨域存储(COS)API使用加密哈希标识文件,实现跨域共享。 每周发布huggingface_hub:借助AI、开源工具和人工审核 2026-06-23 08:00 UTC+8 Hugging Face团队通过结合AI和开源工具,将huggingface_hub的发布周期从4-6周缩短至每周一次,同时保留人工审核环节以确保质量。该流程基于GitHub Actions、OpenCode和开放权重模型,每次发布成本仅约0.25美元。
发布周期从4-6周缩短为每周一次 AI生成发布说明初稿,但通过确定性脚本验证准确性 PP-OCRv6 在 Hugging Face 上:从 1.5M 到 34.5M 参数的 50 种语言 OCR 2026-06-22 21:18 UTC+8 PP-OCRv6 是 PaddleOCR 的最新通用 OCR 模型系列,支持从 1.5M 到 34.5M 参数的三个层级,覆盖 50 种语言。相比 PP-OCRv5_server,检测准确率提升 4.6 个百分点,识别准确率提升 5.1 个百分点。新架构包括 PPLCNetV4 骨干网络、RepLKFPN 检测模块和 EncoderWithLightSVTR 识别模块。支持 Paddle Inference、Transformers 和 ONNX Runtime 后端。
发布三个模型层级:tiny(1.5M)、small(7.7M)、medium(34.5M),适配不同部署场景。 支持 50 种语言,包括中、英、日及 46 种拉丁语系语言。 我们让本地模型免费(*)为OpenClaw仓库进行问题分类! 2026-06-22 08:00 UTC+8 OpenClaw维护者利用本地开源模型(Gemma、Qwen)在智能体框架中,实时对问题和拉取请求进行分类,性能媲美闭源模型,仅需硬件电费成本。
本地模型(如Gemma和Qwen)能有效对GitHub问题和PR进行分类,用于问题分派。 系统使用带有只读shell(reposhell)的智能体框架,安全地检查代码。 MosaicLeaks:你的研究代理能保守秘密吗? 2026-06-19 02:13 UTC+8 深度研究代理结合私有文档与网页搜索时,可能通过查询日志无意中泄露敏感信息。MosaicLeaks基准量化了这种隐私风险,并提出了一种名为隐私感知深度研究(PA-DR)的训练方法,可以在保持任务性能的同时,将信息泄露减少3倍以上。
MosaicLeaks引入了一个多跳研究链基准,这些链交织了私有本地文档和公共网页查询,测量了三种泄露程度:意图、答案和完整信息。 仅针对任务性能进行训练会同时提高成功率和泄露率;使用PA-DR训练可将答案/完整信息泄露从34.0%降至9.9%,同时保持严格链条成功率为58.7%。 超越LoRA:你能击败最流行的微调技术吗? 2026-06-18 08:00 UTC+8 LoRA是目前最流行的参数高效微调(PEFT)技术,但研究表明其他方法在某些任务上表现更好。本文介绍了Hugging Face的PEFT库及其基准测试,探讨了如何根据具体需求选择合适的PEFT技术,并指出LoRA并非总是最佳选择。
LoRA在PEFT技术中占主导地位,但可能不是最优选择。 Hugging Face的PEFT库提供了统一API和基准测试,帮助用户选择合适的PEFT技术。 它足够智能体化了吗?使用自有工具对开源模型进行基准测试 2026-06-18 08:00 UTC+8 一个全新的基准测试框架专注于评估AI智能体使用软件库的整个过程工作量,以Hugging Face的Transformers库为案例。通过测量令牌使用量、时间、错误率等指标,揭示不同模型和工具层级下的性能权衡,为库维护者和智能体用户提供关键见解。
标准基准测试仅检查最终答案,而该框架测量整个过程的令牌成本、时间和错误 测试了三种工具层级:裸安装、克隆源码和打包Skill,各有不同的开销 MolmoMotion:语言引导的3D运动预测 2026-06-17 23:26 UTC+8 MolmoMotion是一种新型3D运动预测模型,能够根据视频帧、物体上的3D点以及语言指令预测未来几秒内物体点的3D轨迹。该模型在多个下游任务中表现出色,如机器人规划和可控视频生成。同时发布了最大的3D点轨迹数据集MolmoMotion-1M和基准测试PointMotionBench。
MolmoMotion利用语言指令引导3D运动预测,显著优于现有方法。 模型支持自回归和流匹配两种变体,分别适用于确定性和不确定性场景。 从Hugging Face Hub到机器人硬件:Strands Agents与LeRobot的集成 2026-06-17 18:18 UTC+8 AWS开源SDK Strands Robots集成了LeRobot,允许开发者通过单一Agent工作流从Hub数据集训练并在模拟或实体机器人上部署策略。本文介绍了五步流程,并提供了可在笔记本上运行的示例。
Strands Robots SDK将LeRobot暴露为可组合的AgentTools,实现从数据集到机器人硬件的端到端控制。 模拟和硬件场景共享相同的DatasetRecorder和LeRobotDataset格式,确保数据集兼容。 GLM-5.2:专为长周期任务构建 2026-06-17 17:01 UTC+8 GLM-5.2 是 Z.AI 推出的最新旗舰模型,专为长周期任务设计,拥有稳定的 1M 上下文窗口,在编码基准测试中表现优异,并引入 IndexShare 架构以降低计算成本,同时提供灵活的努力水平控制。该模型采用 MIT 开源许可证,无区域限制。
GLM-5.2 提供稳定的 1M token 上下文,支持长周期工程任务。 在 FrontierSWE、PostTrainBench 等长周期编码基准上表现领先,接近封闭源模型。