研究AIOps有一段时间了,手头已经积累了不少可以落地的方案,后续打算把这些内容系统性地整理到课程里。最近OpenClaw热度很高,作为在AIOps领域持续探索的从业者,我也在想怎么把OpenClaw的能力和运维场景结合起来。
这两天空下来,把ClawHub里跟运维相关的Skills做了一次全面梳理,筛出了20个核心方向。这份清单,可以看作是运维技能树的一个数字化切片——从基础设施管理到可观测性,从CI/CD到数据库运维,基本覆盖了现代运维工程师的日常工具箱。

编排与容器化
Kubernetes已经是运维基本功了,围绕它的Skills自然也最多。
kubernetes 承担的是“全流程管家”角色——从部署、排障到扩缩容,网络存储的日常问题都能处理。用法上有个关键技巧:先让它收集上下文(命名空间、异常Pod、事件、节点状态),然后按优先级输出方案,先恢复服务再做根因分析,最后要求它给出可复制的命令和回滚方案。典型的场景就是生产环境Pod反复CrashLoopBackOff、节点状态NotReady、或者发布后5xx错误飙升。
k8s 这个Skill更偏向通用操作助手,快速生成或修正kubectl命令和常见YAML是它的强项。比如直接说“给一个带探针和资源限制的Deployment”,它就能把YAML骨架搭好,同时输出检查命令和验证步骤。新服务上集群、日常巡检脚本、YAML快速生成,用这个效率很高。
kube-medic 则是一个“医生”型排障工具,专注故障定位和健康体检。遇到慢响应、频繁重启、拉镜像失败、连接超时这类问题,让它做一份“体检报告”——从症状到怀疑点,再到验证命令和修复动作,整个过程结构化得很清晰。跨团队值班时,这个Skill能帮新手快速缩小故障排查范围。
基础设施即代码与自动化
主机配置和批量变更自动化,离不开 ansible。它的核心价值在于幂等和可重复执行。实际使用时,先让它生成inventory和playbook骨架,然后要求加入check mode、handlers和回滚思路。批量装Agent、统一sysctl参数、发布基础组件,这些都是高频场景。
Terraform这边有两个Skill值得关注。terraform 负责基础设施即代码的落地,统一管理云资源生命周期。输入目标架构——VPC、子网、安全组、实例、数据库——然后要求输出模块化结构、plan的风险点、状态管理建议。新环境搭建、资源标准化、跨环境复制,它都能胜任。
terraform-engineer 则在Terraform基础上更强调工程化——模块拆分、规范制定、代码审查。多人协作的IaC仓库治理是个老大难问题,这个Skill能按团队规范输出目录结构、变量命名和工作区策略,还会附上一份常见反模式清单,帮助团队少走弯路。
DevOps与可观测性
devops 这个Skill的关键是把开发、测试、发布、回滚的整个流程串起来,偏重CI/CD。用法也很有讲究:先描述现状——“现在只有手工发布”——然后让它给出分阶段改造方案,从先可用到再稳定,最后提效。很多团队从脚本发布升级到流水线发布时,可以参考这个路线图。
可观测体系方面,logging-observability 和 monitoring 可以配合使用。前者负责日志、指标、追踪的完整体系设计,按“黄金信号”来搭建监控面板和告警阈值,同时产出采集链路和字段规范。后者则更侧重通用监控方案设计和告警分级——给业务SLO(可用性、延迟、错误率),让它输出系统层、应用层、业务层的监控项矩阵。从“有监控”到“监控有效”,中间的关键一步就在这里。
prometheus 作为指标采集和告警治理的专项Skill,使用起来很直接。提出需求——抓哪些目标、保留多久、告警怎么分级——它就能生成 scrape_configs 和告警规则样例。K8s集群或主机群的统一指标平台建设,绕不开它。
数据库运维
数据库运维的Skill覆盖了主流类型。database-operations 是一个综合性工具,擅长将变更、备份、恢复、巡检等流程标准化。输入数据库类型和风险级别,它就能输出“变更前检查—执行—验证—回退”的完整SOP。DDL变更、慢查询治理、容量告警处理,都可以用这套流程来管理。
mysql 专项Skill聚焦参数调优、索引分析、慢SQL治理、复制和备份恢复。遇到CPU飙升、锁等待、主从延迟,先描述症状,让它给“先止血后优化”的分步动作。业务高峰抖动、慢SQL突增,用它来分析很顺手。
PostgreSQL方面,pg 这个Skill提供版本适配、负载模式分析和慢SQL样本处理。报表查询变慢、连接数耗尽、vacuum问题——这些都是PGSQL运维的典型痛点,它能输出索引优化、执行计划分析和参数调整建议。
对于缓存层,redis-store 负责Redis运维的内存管理、淘汰策略、持久化和主从哨兵配置。遇到命中率低、延迟高、内存暴涨,让它分两路分析——数据模型问题还是参数问题。缓存击穿、热点key、延迟抖动,这些场景都能覆盖。
存储与备份
存储规划层面,storage 提供通用容量、IO和可靠性建议。给工作负载画像——随机读写、吞吐量、延迟要求——它就能输出存储选型和性能基线。应用上云前的存储架构评审,可以拿它做个参考。
cloud-storage 则聚焦对象、块、文件存储在云上的使用和治理。备份归档、静态资源托管、日志冷存——输入目标后,它能给出分层存储和成本优化方案。备份上云、冷热分层、跨区容灾,这几个场景尤其合适。
K8s相关的数据保护,k8s-backup 专门处理资源与数据的备份恢复策略。指定RPO/RTO目标,输出备份频率、恢复演练和校验步骤。关键命名空间容灾、集群迁移前兜底,这个Skill的价值就在这里。
k8-autoscaling 处理弹性伸缩策略,HPA、VPA、Cluster Autoscaler的思路都能覆盖。提供流量波峰波谷和资源成本目标,它会给出“稳定优先”和“成本优先”两套参数建议。流量波动大、人工扩缩容跟不上的团队,可以重点参考。
另外,openclaw-backup 专门针对OpenClaw自身的配置与数据备份。升级前兜底、主机迁移、误删恢复——先盘点必须备份项,再输出定时备份和恢复演练流程。
最后是 cloud-devops,它把云上DevOps实践和流水线、云资源协同结合起来。输入云厂商和现有工具链,输出“构建-发布-回滚-审计”的完整闭环。多环境发布、跨团队协作、审计合规,这些场景借助它可以做得更规范。
这20个Skills基本勾勒出了运维工程师从基础操作到工程化治理的进阶路径。无论是刚入门的运维新人,还是正在搭建自动化体系的团队,都可以对照这份清单查漏补缺,逐步完善自己的运维能力栈。
