<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0"><channel><title>SRE</title><link>https://sreai.net/zh/tags/sre/</link><description>聚焦 SRE 与 AI，记录一个技术人的探索与沉淀</description><language>zh</language><lastBuildDate>Thu, 13 Aug 2026 23:52:33 +0800</lastBuildDate><item><title>深度学习在 SRE 智能运维中的实践探索</title><link>https://sreai.net/zh/posts/aiops-practice/</link><guid isPermaLink="true">https://sreai.net/zh/posts/aiops-practice/</guid><pubDate>Mon, 20 Jul 2026 10:00:00 +0800</pubDate><description>随着微服务架构与云原生规模的扩大，传统基于阈值的告警已无法满足快速止血需求。本文探讨了基于深度学习的智能异常检测系统如何帮助 SRE 团队从被动响应转向主动预测。</description><category>SRE架构</category><category>SRE</category><category>AIOps</category><category>机器学习</category></item><item><title>云原生混沌工程落地指南</title><link>https://sreai.net/zh/posts/chaos-engineering/</link><guid isPermaLink="true">https://sreai.net/zh/posts/chaos-engineering/</guid><pubDate>Thu, 18 Jun 2026 10:00:00 +0800</pubDate><description>通过 Chaos Mesh 模拟网络延迟、节点宕机与 Pod 异常，持续检验系统韧性与自动化自愈机制。</description><category>SRE架构</category><category>SRE</category><category>混沌工程</category><category>Kubernetes</category></item><item><title>Kubernetes 集群高可用与故障自动愈合实践</title><link>https://sreai.net/zh/posts/kubernetes-ha/</link><guid isPermaLink="true">https://sreai.net/zh/posts/kubernetes-ha/</guid><pubDate>Thu, 25 Jun 2026 00:00:00 +0000</pubDate><description>深入探讨控制面多活部署、etcd 集群调优、Pod 反亲和策略与自定义 Controller 实现故障自愈的最佳实践。</description><category>SRE架构</category><category>Kubernetes</category><category>SRE</category><category>高可用</category></item><item><title>构建高效 On-Call 体系：从事后复盘到主动防御</title><link>https://sreai.net/zh/posts/incident-management/</link><guid isPermaLink="true">https://sreai.net/zh/posts/incident-management/</guid><pubDate>Sat, 25 Jul 2026 00:00:00 +0000</pubDate><description>从告警策略设计、值班排班管理到故障响应流程，系统化构建高效的 On-Call 体系，实现从被动救火到主动防御的转变。</description><category>技术管理</category><category>On-Call</category><category>技术管理</category><category>SRE</category></item></channel></rss>