AI News HubLIVE
站内改写2 分钟阅读

Srenix – 30MB二进制文件中的自愈型Kubernetes(Apache-2.0)

Srenix 是一个开源的 Kubernetes 自愈工具,仅包含一个约 30MB 的 Go 二进制文件,能够自动检测、诊断并修复集群问题,无需依赖大语言模型 (LLM)。它提供 16 个 Kubernetes 探测、14 个只读分析器、30 个云探测(AWS/GCP/Azure)和 5 个策略受限的修复器,所有修复操作都会重新验证,并可集成 Slack、Alertmanager 等通知。支持离线快照模式和集群内运行,保证 GitOps 兼容,适用于值班工程师减少手动排查工作量。

来源Hacker News AI作者: srenix-ai

Srenix 是一个新型的开源工具,旨在为 Kubernetes 集群提供自动化的自愈能力。整个工具打包成一个约 30MB 的 Go 二进制文件,基于 Apache-2.0 许可证发布。它的设计初衷是解决运维人员常见的痛点:凌晨三点被告警吵醒,然后花二十分钟手动排查日志,最后发现原因往往很简单(比如过期的 Secret 密钥、卡住的 ExternalSecret 或者未更新的证书)。Srenix 的目标是以确定性的方式自动完成这些排查工作,并提供可信赖的自动修复能力。

Srenix 的核心架构分为三个层次:检测、诊断和修复。它内置了 16 个 Kubernetes 探测器和 30 个云平台探测器(覆盖 AWS、GCP 和 Azure),能够全面监控集群和云资源的状态。14 个只读分析器负责分析探测结果,定位根本原因并给出修复提示。当问题被识别且符合预设策略时,5 个策略受限的修复器会自动执行修复操作;否则,它会向人工提供精确的修复建议。所有自动修复都会重新验证效果,并通过 Slack、Alertmanager 或 OpenProject 等渠道发送报告。

为了确保安全性,Srenix 的热路径完全脱离大语言模型 (LLM),采用纯 Go 实现,保证相同输入产生相同输出。修复器仅处理预定义的安全模式(如过期的 Error Pod、重命名 Secret 键导致的卡住 Job、过时的 ReplicaSet Pod 等),不会自动修改 Secrets、ConfigMaps 或通用 CRD。此外,它具备 GitOps 意识,会跳过由 Argo/Flux/Helm 管理的资源,避免与声明式配置冲突。

Srenix 提供两种运行模式:离线快照模式和集群内实时模式。离线模式无需安装或 RBAC 权限,只需提供一个通过 kubectl get ... -o json 捕获的集群快照即可进行诊断。实时模式则通过 Helm Chart 安装为 CronJob,使用两个权限范围明确的 ClusterRole,并支持可选的 Operator (AgenticSRE CRD) 进行部署管理。

该项目目前包含 138 个发布版本,最新版本为 agentic-sre-0.1.0-alpha.1。除了开源版本,Srenix 还提供企业版,增加基于 LLM 的 Investigator 和更高级的自动规划功能,但所有核心功能在开源版本中均可正常使用。

Srenix 的创建者 Salil 表示,这个项目源于他个人的值班经历,希望提供一个值得信任的、可无人值守的故障排除工具。社区可以通过 GitHub Discussions 进行交流,项目也欢迎贡献。