搜索精彩内容
包含"故障"的全部内容
基于OneAgent的可观测性方案实现
采用alloy + prometheus + loki + tempo + alertmanager + grafana 实现可观测性一、云原生可观测性现状在云原生架构深入落地的背景下,微服务、容器化和Serverless等技术的大规模应用,使得系...
Ceph RBD 故障排查实录:从 PG Inactive 到对象异常定位
!! 大家好,我是wanger,一个爱折腾的运维工程,一个睡觉都被自己丑醒的云原生爱好者。作者:wanger公众号:运维开发故事博客:https://www.devopstory.cn/一、事故背景在一次异常重启后,...
开发 Operator 调度 GPU 实例资源池
!! 大家好,我是乔克,一个爱折腾的运维工程,一个睡觉都被自己丑醒的云原生爱好者。 作者:乔克 公众号:运维开发故事 博客:https://jokerbai.com ✍ 道路千万条,安全第一条。操作不规...
山洪灾害后的 Ceph 惨案:PG incomplete 到 RBD 镜像消失
!! 大家好,我是wanger,一个爱折腾的运维工程师。 作者:wanger 公众号:运维开发故事 博客:https://devopstory.cn 背景 在一次山洪灾害后,机房的服务器全部断电,等供电恢复后进入系统...
AIOps系列 | 开发 K8s GPT 故障诊断工具
!! 大家好,我是乔克,一个爱折腾的运维工程,一个睡觉都被自己丑醒的云原生爱好者。 作者:乔克 公众号:运维开发故事 博客:https://jokerbai.com ✍ 道路千万条,安全第一条。操作不规...
基于Prometheus的自动化巡检
!! 大家好,我是乔克,一个爱折腾的运维工程,一个睡觉都被自己丑醒的云原生爱好者。 作者:乔克 公众号:运维开发故事 ✍ 道路千万条,安全第一条。操作不规范,运维两行泪。 前言 目前...
探索AI+k8s:如何使用Deepseek大模型增强k8s-dashboard
一、导读 Kubernetes(简称K8s)的普及让开发和运维工作变得更加高效,但它的复杂性却让许多人在使用时面临挑战。从网络配置到故障排查,每一步都需要深入的技术积累。然而,随着人工智能技术的...
告警平台2.0——仿出强大
✍ 道路千万条,安全第一条。操作不规范,运维两行泪。 在《告警平台1.0》中,我们实现了告警平台,可以实现纳管通过AlertManager推送的告警信息,然后进行灵活的告警通知发送。 在这个基础上...
基于Prometheus的自动化巡检
!! 大家好,我是乔克,一个爱折腾的运维工程,一个睡觉都被自己丑醒的云原生爱好者。 作者:乔克 公众号:运维开发故事 ✍ 道路千万条,安全第一条。操作不规范,运维两行泪。 前言 目前,...
AIOps系列 | 基础理论学习
!! 大家好,我是乔克,一个爱折腾的运维工程,一个睡觉都被自己丑醒的云原生爱好者。 作者:乔克 公众号:运维开发故事 博客:https://jokerbai.com ✍ 道路千万条,安全第一条。操作不规范...
