{"id":"dc0206f7-31c3-4d14-94ce-154f0c25ef4c","shortId":"fBSp7Q","kind":"skill","title":"p10b-aiops-case","tagline":"'AI Native 产品方法论——AIOps 行业案例模板 Skill。","description":"# AIOps 案例模板 Skill\n\n## 使用场景\n\n- 运维团队希望引入 AI 能力，需要系统性方法论指导\n- 需要为 AIOps 产品设计从方向到生产的完整路径\n- 关注高风险、强约束、重责任场景的 AI 化方法\n\n## AIOps 特征与适配性\n\n| AIOps 特征 | 对方法论的影响 |\n|------------|--------------|\n| 高风险：错误建议直接导致故障扩大 | 必须有强审计放行和人在回路机制 |\n| 知识密集：依赖专家经验 | 需要知识沉淀和检索增强 |\n| 实时性强：响应时间要求高 | 模型延迟必须纳入评估 |\n| 可解释性：决策必须可追溯 | 上下文工程和日志是基础设施 |\n| 责任边界清晰：谁决策谁负责 | Agent 边界设计是核心 |\n\n## AIOps 方法论路径\n\n```\n@ai-native-direction-framing\n  → 选择最值得先 AI 化的运维节点\n  → 输出：Direction Brief\n\n@p2a-experiment-overview + @p2b-experiment-engine\n  → 验证日志解释、告警聚类、案例召回能力\n  → 输出：实验结论报告\n\n@p2c-process-redesign\n  → 值班升级链设计\n  → 输出：人机协作矩阵\n\n@p2e-shadow-validation\n  → 影子系统并行验证\n  → 输出：影子验证报告\n\n@ai-native-audit-release\n  → 高风险场景审计放行\n  → 输出：放行决策\n\n@ai-native-production-ops\n  → 值班面板和生产观测\n  → 输出：生产运行方案\n\n@p10a-value-discovery-loop\n  → 价值信号识别与反馈\n  → 输出：价值发现方案\n```\n\n## 典型 AIOps 能力分层\n\n### 第一层：值班辅助（低风险）\n- 日志解释与摘要\n- 告警聚类与去重\n- 案例召回与相似故障推荐\n- → 适合：自动 + 人在回路中\n\n### 第二层：分诊辅助（中风险）\n- 故障影响范围判断\n- 根因概率排序\n- 处置建议推荐\n- → 适合：Copilot + 人在回路中\n\n### 第三层：自动处置（高风险）\n- 自动扩缩容\n- 自动切流\n- 自动补丁\n- → 适合：人在监督中，且需强审计\n\n## AIOps 案例 Skill 输出模板\n\n\\`\\`\\`yaml\n# AIOps 案例方案\n\n方向定界:\n  核心问题: [选择最值得先 AI 化的运维节点]\n  目标场景: [故障分诊 / 告警处理 / 日志分析 / 容量规划]\n  约束条件: [响应时间要求 / 风险边界 / 可解释性要求]\n  Direction Brief: [输出]\n\n试验展开:\n  能力实验:\n    - 日志解释: [模型/准确率/结论]\n    - 告警聚类: [模型/准确率/结论]\n    - 案例召回: [模型/准确率/结论]\n  产品实验:\n    - 值班面板原型\n    - 采纳率/满意度\n  商业实验:\n    - MTTR 缩短目标\n    - ROI 测算\n\n系统构建:\n  Agent 设计:\n    - 值班 Agent\n    - 分诊 Agent\n    - 知识库 Agent\n  Memory: [会话状态 / 故障上下文 / 历史案例]\n  Context: [告警上下文 / 服务拓扑 / 业务影响]\n  RAG: [运维知识库 / SOP / 历史故障库]\n  审计规则: [风险等级 / 升级条件 / 人工接管点]\n\n审计放行:\n  RAX 评估: [风险/接受度/体验评分]\n  放行条件: [通过/附条件/拒绝]\n  约束: [高风险动作必须人工确认]\n\n生产运行:\n  可观测性: [五层观测设计]\n  反馈回灌: [故障案例 → 知识库更新]\n  循环优化: [月度复盘 + 季度能力沉淀]\n\\`\\`\\`\n\n## 与其他 Skill 的关系\n\n- **核心协同**：@ai-native-direction-framing, @p2a-experiment-overview, @ai-native-audit-release, @ai-native-production-ops\n- **配套**：@ai-native-memory-system（会话状态管理），@ai-native-knowledge-rag（运维知识沉淀），@p10a-value-discovery-loop（价值发现）\n- **案例 Skill**：@p10c-customer-service-case（客服场景），@p10d-saas-case（数据分析场景）\n\n## 适用边界\n\n- ✅ 故障分诊、告警处理、日志分析、容量预测等场景\n- ✅ 高风险、强约束、重责任的运维环境\n- ❌ 需要直接自动执行高危操作（建议用人在监督中 + 强审计）\n- ❌ 实时性要求极高的交易系统（延迟和准确率难以兼顾）\n\n## 核心概念\n\n### 1. 故障分诊优先于自动处置\n\nAIOps 最值得先改写的不是\"最终执行动作\"，而是\"高频、重复、信息密集的故障分诊与判断链\"。故障分诊同时满足四个条件：高频、重复、可比较、价值直接。系统能更快做出初步判断，值班工程师就能缩短定位时间、减少无效升级，并把注意力放到真正高风险的信号上。\n\n### 2. 能力分层递进\n\nAIOps 系统应按风险等级分三层递进建设：\n- **值班辅助层**（低风险）：日志解释、告警聚类、案例召回——适合自动 + 人在回路中\n- **分诊辅助层**（中风险）：故障影响判断、根因排序、处置建议——适合 Copilot + 人在回路中\n- **自动处置层**（高风险）：自动扩缩容、切流、补丁——适合人在监督中 + 强审计\n\n### 3. 证据链驱动的可解释性\n\nAIOps 输出的不应该只是一个\"可能原因\"，还应该包含：基于什么证据、建议优先看哪些线索、是否命中历史故障模式、以及什么情况下必须升级人工。没有证据链的 AIOps 充其量只是一个生成式分析器。\n\n### 4. 经验复利与组织沉淀\n\n过去分散在群聊、个人习惯和少数专家脑中的判断逻辑，应被写进案例库、规则系统和反馈回路里。每一次新故障、每一次人工修正、每一次升级路径变化，都会反过来让系统更懂本组织真实的运行环境。AIOps 的长期价值不只是\"帮人快一点看日志\"，而是把值班体系从依赖少数人，逐步推进到依赖组织能力。\n\n### 5. 边界先于自动化\n\nAIOps 场景最大的特点，是错误代价往往远高于一般信息类产品。一次错误归因可能让工程师沿错误方向排查半小时；一次错误建议可能触发错误扩容或重启；一次边界失守可能把局部问题放大成跨服务事故。因此，审计放行不是附加动作，而是产品成立的一部分。\n\n## 分步执行\n\n### 步骤 1：方向定界——选择最值得先 AI 化的运维节点\n\n**输入**：运维团队现状、历史故障工单、监控体系、值班流程\n\n**执行要点**：\n- 判断基础条件：历史故障工单是否充足？日志样本是否可得？监控信号是否覆盖？处理手册和复盘材料是否具备？\n- 选择第一批高频且可比较的故障模式，例如：告警去噪、故障摘要、相似案例召回、初步归因和升级建议\n- 输出 Direction Brief：明确目标场景、约束条件和成功标准\n\n**输出**：Direction Brief（含目标场景、风险边界、响应时间要求、可解释性要求）\n\n### 步骤 2：试验展开——验证三层能力是否稳定\n\n**输入**：Direction Brief、历史样本、评估标准\n\n**执行要点**：\n- **理解能力验证**：系统能否解释单条日志和单个告警？\n- **关联能力验证**：系统能否把多源信号拼起来看出异常模式？\n- **经验调用验证**：系统能否从历史案例中召回相似处置路径？\n- 重点识别：哪些故障模式已进入稳定区？哪些仍依赖专家直觉？哪些看上去有效但真实环境会失真？\n\n**输出**：能力实验报告（含各故障模式的准确率、召回率和置信度分析）\n\n### 步骤 3：系统构建——把值班经验写进系统\n\n**输入**：试验结论、可用数据源、系统架构约束\n\n**执行要点**：\n- 拆分能力单元：日志解释 Skill、故障摘要 Skill、相似案例召回 Skill、风险提示 Skill、升级建议 Skill\n- 构建 Agent 编排：值班 Agent（理解告警 → 选择 Skill → 组织结果）、分诊 Agent、知识库 Agent\n- 设计 Memory：会话状态、故障上下文、历史案例\n- 设计 Context：告警上下文、服务拓扑、业务影响范围\n- 设计 RAG：运维知识库、SOP、历史故障库\n- 设计升级链：值班工程师 → 领域专家 → 服务负责人 → 跨团队协作\n\n**输出**：系统架构方案（含 Agent 设计、Skill 清单、Tool 映射、升级路径）\n\n### 步骤 4：审计放行——明确建议边界和人工接管条件\n\n**输入**：系统架构方案、风险评估标准\n\n**执行要点**：\n- 定义 RAX 评估：风险（Risk）、接受度（Acceptance）、体验（eXperience）\n- 设置边界规则：哪些输出只能作为建议？哪些动作需要双人确认？哪些生产环境永远不能让 AI 直接下指令？\n- 设计回退机制：异常一旦出现必须强制回退到人工\n- 设计证据展示：每个建议必须附带证据链和置信度\n\n**输出**：放行决策（通过 / 附条件 / 拒绝）+ 审计规则清单\n\n### 步骤 5：生产运行——让新故障和人工修正变成组织资产\n\n**输入**：放行决策、生产环境配置\n\n**执行要点**：\n- 设计五层可观测性：基础设施层、模型性能层、业务效果层、用户行为层、价值发现层\n- 建立反馈回灌机制：故障案例 → 知识库更新 → 模型优化\n- 持续观测信号：故障分诊时间是否缩短？哪些建议最常被采纳？哪些故障模式最容易误判？哪些场景始终需要专家主导？\n- 建立循环优化节奏：月度复盘 + 季度能力沉淀\n\n**输出**：生产运行方案（含监控面板、反馈流程、优化节奏）\n\n### 步骤 6：价值发现——识别和放大效率、组织与治理价值\n\n**输入**：生产运行数据、业务目标\n\n**执行要点**：\n- 效率层价值：故障分诊、定位和交接速度提升\n- 组织层价值：专家经验不再只留在少数人手里，新人也能借助系统完成高质量初步判断\n- 治理层价值：团队开始更清楚地知道哪些场景可以自动辅助，哪些场景必须保留人工裁决\n- 建立价值信号识别机制：MTTR 缩短、升级率下降、新人上手速度提升\n\n**输出**：价值发现方案\n\n## 示例 1：电商平台 AIOps 故障分诊系统\n\n### 背景\n\n某电商平台运维团队有 15 人，日均告警 200+ 条，大促期间峰值 1000+ 条。当前痛点：\n- 值班工程师每天花 60% 时间在告警筛选和初步分诊上\n- 高峰期告警风暴导致关键告警被淹没\n- 故障定位平均耗时 45 分钟，其中 30 分钟在理解局面\n- 专家经验只存在于 3 个资深工程师脑中\n\n### Skill 执行输出\n\n```yaml\n# AIOps 案例方案：电商故障分诊\n\n方向定界:\n  核心问题: 告警风暴中的故障分诊是最高频、最重复、最值得先 AI 化的节点\n  目标场景: 告警聚类 + 故障分诊 + 案例召回\n  约束条件:\n    - 响应时间: 分诊建议必须在 30 秒内返回\n    - 风险边界: 所有建议仅供参考，禁止直接执行任何生产操作\n    - 可解释性: 每个建议必须附带证据链\n  Direction Brief: 优先将告警聚类和故障分诊 AI 化，目标 MTTR 缩短 40%\n\n试验展开:\n  能力实验:\n    告警聚类:\n      模型: 基于服务拓扑 + 时间窗口的聚类算法\n      准确率: 92%（同类告警正确聚合）\n      结论: 稳定可用\n    日志解释:\n      模型: LLM + 日志模板匹配\n      准确率: 78%（关键字段正确提取）\n      结论: 可用于辅助，需人工确认\n    案例召回:\n      模型: 向量检索 + 相似度排序\n      准确率: 85%（Top3 命中历史案例）\n      结论: 稳定可用，长尾案例需补充\n  产品实验:\n    值班面板原型: 告警聚合视图 + 分诊建议 + 案例推荐\n    采纳率: 72%（值班工程师采纳分诊建议的比例）\n  商业实验:\n    MTTR 目标: 从 45 分钟缩短到 25 分钟\n    ROI: 每次故障减少损失约 5 万元，月均 20 次故障 → 月节省 100 万元\n\n系统构建:\n  Agent 设计:\n    值班 Agent: 接收告警 → 聚类分析 → 选择分诊 Skill → 组织建议\n    分诊 Agent: 分析根因概率 → 推荐处置优先级\n    知识库 Agent: 检索历史案例 → 推荐处置路径\n  Memory:\n    - 会话状态: 当前值班上下文\n    - 故障上下文: 当前活跃故障链\n    - 历史案例: 近 6 个月故障库（2000+ 条）\n  Context:\n    - 告警上下文: 服务名、时间窗口、告警级别\n    - 服务拓扑: 上下游依赖关系（CMDB）\n    - 业务影响: 订单量、支付成功率、页面 PV\n  RAG:\n    - 运维知识库: SOP 文档 50+ 篇\n    - 历史故障库: 复盘报告 200+ 篇\n    - 值班手册: 标准操作流程\n  审计规则:\n    - 低风险（自动辅助）: 告警聚类、日志摘要、案例推荐\n    - 中风险（人工确认）: 根因建议、处置路径推荐\n    - 高风险（禁止执行）: 任何直接操作生产的动作\n\n审计放行:\n  RAX 评估:\n    风险: 中（错误建议可能导致排查方向偏移）\n    接受度: 高（值班工程师反馈积极）\n    体验: 中（需优化证据展示）\n  放行条件: 附条件通过\n  约束:\n    - 所有分诊建议标注\"仅供参考\"\n    - 置信度 < 70% 时必须标注\"不确定，需人工确认\"\n    - 禁止任何直接操作生产的动作\n\n生产运行:\n  可观测性:\n    - 基础设施: 推理延迟 < 5s，可用性 > 99.5%\n    - 模型性能: 告警聚类准确率、分诊建议采纳率\n    - 业务效果: MTTR、误判率、升级率\n    - 用户行为: 建议查看率、采纳率、修改率\n    - 价值发现: 故障处理效率趋势\n  反馈回灌:\n    - 每次人工修正 → 更新分诊规则\n    - 每次新故障 → 沉淀到案例库\n    - 每次误判 → 分析原因并优化模型\n  循环优化:\n    - 月度: 复盘误判案例，更新知识库\n    - 季度: 评估能力分层，决定是否进入下一层\n```\n\n### 关键决策点\n\n| 决策点 | 选择 | 理由 |\n|--------|------|------|\n| 第一批能力 | 告警聚类 + 故障分诊 | 高频、可比较、价值直接 |\n| 自动处置时机 | 暂不进入 | 边界和回退机制尚未验证 |\n| 人工接管设计 | 所有建议仅供参考 | 高风险场景，边界先于自动化 |\n| 知识沉淀方式 | 案例库 + 规则库 + 反馈回灌 | 形成组织级能力资产 |\n\n---\n\n## 示例 2：金融行业 AIOps 运维知识系统\n\n### 背景\n\n某银行核心系统运维团队有 30 人，管理 500+ 微服务。当前痛点：\n- 核心交易系统故障响应要求 5 分钟内定位\n- 运维知识分散在 wiki、群聊、个人笔记中\n- 新人培养周期 6 个月以上\n- 专家经验难以传承，人员流动风险高\n\n### Skill 执行输出\n\n```yaml\n# AIOps 案例方案：金融运维知识系统\n\n方向定界:\n  核心问题: 运维知识碎片化导致故障响应速度依赖个人经验\n  目标场景: 运维知识沉淀 + 智能检索 + 分诊辅助\n  约束条件:\n    - 合规要求: 所有操作必须可审计\n    - 安全要求: 数据不出生产网络\n    - 响应要求: 核心系统故障 5 分钟内给出初步判断\n  Direction Brief: 构建运维知识系统，将专家经验转化为可检索、可复用的组织能力\n\n试验展开:\n  能力实验:\n    知识抽取:\n      模型: LLM + 结构化模板\n      准确率: 82%（从复盘报告中提取故障模式）\n      结论: 可用，需人工审核\n    智能检索:\n      模型: 向量检索 + 关键词混合\n      命中率: 88%（Top5 命中相关知识）\n      结论: 稳定可用\n    分诊建议:\n      模型: 规则引擎 + LLM\n      准确率: 75%（初步归因正确率）\n      结论: 需配合专家确认\n  产品实验:\n    知识工作台: 故障模式库 + 检索 + 分诊建议\n    使用率: 日均查询 50+ 次\n  商业实验:\n    新人培养周期: 从 6 个月缩短到 3 个月\n    故障响应时间: 从 15 分钟缩短到 5 分钟\n\n系统构建:\n  Agent 设计:\n    知识 Agent: 从复盘报告、SOP、群聊中抽取结构化知识\n    检索 Agent: 理解运维问题 → 检索相关知识 → 组织答案\n    分诊 Agent: 分析告警 → 匹配故障模式 → 推荐处置路径\n  Memory:\n    - 服务画像: 每个服务的历史故障、依赖关系、SLA\n    - 专家画像: 每个专家擅长的领域和历史判断\n  RAG:\n    - 复盘报告库: 500+ 篇结构化复盘\n    - SOP 库: 200+ 篇标准操作流程\n    - 值班日志: 近 2 年值班记录\n  审计规则:\n    - 知识引用: 必须标注来源文档\n    - 分诊建议: 必须附带历史案例支撑\n    - 操作建议: 必须经过双人确认\n\n审计放行:\n  RAX 评估:\n    风险: 高（金融系统，错误建议可能导致资金损失）\n    接受度: 高（团队对知识系统需求强烈）\n    体验: 中（检索准确率需持续优化）\n  放行条件: 附条件通过\n  约束:\n    - 分诊建议仅用于辅助定位，禁止自动执行\n    - 涉及资金操作的建议必须双人确认\n    - 所有知识引用必须可追溯\n\n生产运行:\n  可观测性:\n    - 知识覆盖率: 已沉淀故障模式占历史故障的比例\n    - 检索准确率: Top5 命中率\n    - 使用频率: 日均查询次数、活跃用户数\n    - 业务效果: 新人培养周期、故障响应时间\n  反馈回灌:\n    - 每次新故障复盘 → 自动抽取并更新知识库\n    - 每次检索未命中 → 标记知识缺口\n    - 每次人工修正 → 更新分诊规则\n  循环优化:\n    - 月度: 知识覆盖率评估，补充缺口\n    - 季度: 分诊准确率评估，优化模型\n```\n\n### 关键决策点\n\n| 决策点 | 选择 | 理由 |\n|--------|------|------|\n| 第一批能力 | 知识沉淀 + 智能检索 | 解决知识碎片化核心痛点 |\n| 分诊能力 | 辅助建议模式 | 金融场景风险高，暂不做自动分诊 |\n| 知识来源 | 复盘报告 + SOP + 值班日志 | 结构化程度高，质量可控 |\n| 审计要求 | 全链路可追溯 | 金融合规要求 |","tags":["p10b","aiops","case","native","product","agent","skills","gmaxxxie","agent-skills","ai-agent","ai-native","ai-product"],"capabilities":["skill","source-gmaxxxie","skill-p10b-aiops-case","topic-agent-skills","topic-ai-agent","topic-ai-native","topic-ai-product","topic-methodology","topic-product-management","topic-product-methodology","topic-product-thinking","topic-skills"],"categories":["ai-native-product-agent-skills"],"synonyms":[],"warnings":[],"endpointUrl":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/p10b-aiops-case","protocol":"skill","transport":"skills-sh","auth":{"type":"none","details":{"cli":"npx skills add gmaxxxie/ai-native-product-agent-skills","source_repo":"https://github.com/gmaxxxie/ai-native-product-agent-skills","install_from":"skills.sh"}},"qualityScore":"0.478","qualityRationale":"deterministic score 0.48 from registry signals: · indexed on github topic:agent-skills · 56 github stars · SKILL.md body (8,255 chars)","verified":false,"liveness":"unknown","lastLivenessCheck":null,"agentReviews":{"count":0,"score_avg":null,"cost_usd_avg":null,"success_rate":null,"latency_p50_ms":null,"narrative_summary":null,"summary_updated_at":null},"enrichmentModel":"deterministic:skill-github:v1","enrichmentVersion":1,"enrichedAt":"2026-05-18T18:57:27.463Z","embedding":null,"createdAt":"2026-05-01T01:02:53.825Z","updatedAt":"2026-05-18T18:57:27.463Z","lastSeenAt":"2026-05-18T18:57:27.463Z","tsv":"'1':304,389,600 '100':720 '1000':612 '15':606,969 '2':322,424,869,1008 '20':717 '200':609,772,1004 '2000':749 '25':710 '3':348,448,626,965 '30':623,648,875 '4':361,511 '40':663 '45':620,708 '5':376,544,714,882,913,971 '50':768,958 '500':878,1000 '5s':816 '6':575,747,889,963 '60':616 '70':807 '72':702 '75':947 '78':680 '82':927 '85':690 '88':937 '92':671 '99.5':818 'accept':524 'agent':46,190,193,195,197,468,471,477,479,503,723,726,733,737,974,977,982,987 'ai':5,16,25,51,56,89,97,152,240,249,254,260,266,392,531,639,658 'ai-native-audit-releas':88,248 'ai-native-direction-fram':50,239 'ai-native-knowledge-rag':265 'ai-native-memory-system':259 'ai-native-production-op':96,253 'aiop':3,8,11,20,27,29,48,113,142,147,306,324,350,359,371,378,602,631,871,896 'audit':91,251 'brief':60,164,413,418,429,656,916 'case':4,283,288 'cmdb':758 'context':202,486,751 'copilot':131,339 'custom':281 'direct':53,59,163,242,412,417,428,655,915 'discoveri':107,274 'engin':68 'experi':63,67,246,526 'frame':54,243 'knowledg':268 'llm':677,924,945 'loop':108,275 'memori':198,262,481,740,991 'mttr':185,593,661,705,823 'nativ':6,52,90,98,241,250,255,261,267 'op':100,257 'overview':64,247 'p10a':105,272 'p10a-value-discovery-loop':104,271 'p10b':2 'p10b-aiops-case':1 'p10c':280 'p10c-customer-service-case':279 'p10d':286 'p10d-saas-case':285 'p2a':62,245 'p2a-experiment-overview':61,244 'p2b':66 'p2b-experiment-engine':65 'p2c':75 'p2c-process-redesign':74 'p2e':82 'p2e-shadow-validation':81 'process':76 'product':99,256 'pv':763 'rag':206,269,491,764,998 'rax':215,519,790,1018 'redesign':77 'releas':92,252 'risk':522 'roi':187,712 'saa':287 'servic':282 'shadow':83 'skill':10,13,144,236,278,458,460,462,464,466,474,505,628,730,893 'skill-p10b-aiops-case' 'sla':995 'sop':208,493,766,979,1002,1078 'source-gmaxxxie' 'system':263 'tool':507 'top3':691 'top5':938,1042 'topic-agent-skills' 'topic-ai-agent' 'topic-ai-native' 'topic-ai-product' 'topic-methodology' 'topic-product-management' 'topic-product-methodology' 'topic-product-thinking' 'topic-skills' 'valid':84 'valu':106,273 'wiki':885 'yaml':146,630,895 '一次边界失守可能把局部问题放大成跨服务事故':383 '一次错误建议可能触发错误扩容或重启':382 '一次错误归因可能让工程师沿错误方向排查半小时':381 '万元':715,721 '上下文工程和日志是基础设施':43 '上下游依赖关系':757 '不确定':809 '与其他':235 '专家画像':996 '专家经验不再只留在少数人手里':587 '专家经验只存在于':625 '专家经验难以传承':891 '且需强审计':141 '业务影响':205,759 '业务影响范围':489 '业务效果':822,1047 '业务效果层':554 '业务目标':581 '个人习惯和少数专家脑中的判断逻辑':364 '个人笔记中':887 '个月':966 '个月以上':890 '个月故障库':748 '个月缩短到':964 '个资深工程师脑中':627 '中':793,799,1028 '中风险':126,334,782 '五层观测设计':228 '产品实验':180,696,951 '产品方法论':7 '产品设计从方向到生产的完整路径':21 '人':607,876 '人员流动风险高':892 '人在回路中':123,132,332,340 '人在监督中':140 '人工接管点':213 '人工接管设计':859 '人工确认':783 '人机协作矩阵':80 '仅供参考':805 '从':707,962,968 '从复盘报告':978 '从复盘报告中提取故障模式':928 '以及什么情况下必须升级人工':357 '价值信号识别与反馈':109 '价值发现':276,576,830 '价值发现层':556 '价值发现方案':111,598 '价值直接':317,855 '任何直接操作生产的动作':788 '优先将告警聚类和故障分诊':657 '优化模型':1063 '优化节奏':573 '会话状态':199,482,741 '会话状态管理':264 '低风险':117,327,777 '体验':525,798,1027 '体验评分':219 '使用场景':14 '使用率':956 '使用频率':1044 '例如':406 '依赖专家经验':36 '依赖关系':994 '信息密集的故障分诊与判断链':312 '修改率':829 '值班':192,470,725 '值班升级链设计':78 '值班工程师':496 '值班工程师反馈积极':797 '值班工程师就能缩短定位时间':319 '值班工程师每天花':615 '值班工程师采纳分诊建议的比例':703 '值班手册':774 '值班日志':1006,1079 '值班流程':398 '值班辅助':116 '值班辅助层':326 '值班面板原型':181,697 '值班面板和生产观测':101 '充其量只是一个生成式分析器':360 '全链路可追溯':1083 '关注高风险':22 '关联能力验证':435 '关键决策点':846,1064 '关键字段正确提取':681 '关键词混合':935 '其中':622 '典型':112 '决定是否进入下一层':845 '决策必须可追溯':42 '决策点':847,1065 '准确率':170,174,178,670,679,689,926,946 '减少无效升级':320 '分析原因并优化模型':838 '分析告警':988 '分析根因概率':734 '分步执行':387 '分诊':194,476,732,986 '分诊准确率评估':1062 '分诊建议':699,942,955,1013 '分诊建议仅用于辅助定位':1033 '分诊建议必须在':647 '分诊建议采纳率':821 '分诊能力':1072 '分诊辅助':125,905 '分诊辅助层':333 '分钟':621,711,972 '分钟内定位':883 '分钟内给出初步判断':914 '分钟在理解局面':624 '分钟缩短到':709,970 '切流':344 '初步归因和升级建议':410 '初步归因正确率':948 '判断基础条件':400 '化':659 '化方法':26 '化的节点':640 '化的运维节点':57,153,393 '匹配故障模式':989 '升级建议':465 '升级条件':212 '升级率':825 '升级率下降':595 '升级路径':509 '历史故障工单':396 '历史故障工单是否充足':401 '历史故障库':209,494,770 '历史样本':430 '历史案例':201,484,745 '反馈回灌':229,832,866,1050 '反馈流程':572 '召回率和置信度分析':446 '可复用的组织能力':919 '可比较':316,854 '可用':930 '可用于辅助':683 '可用性':817 '可用数据源':453 '可能原因':352 '可观测性':227,813,1038 '可解释性':41,653 '可解释性要求':162,422 '合规要求':907 '同类告警正确聚合':672 '向量检索':687,934 '含':502 '含各故障模式的准确率':445 '含监控面板':571 '含目标场景':419 '告警上下文':203,487,752 '告警去噪':407 '告警处理':156,292 '告警级别':755 '告警聚合视图':698 '告警聚类':70,172,329,642,666,779,851 '告警聚类与去重':119 '告警聚类准确率':820 '告警风暴中的故障分诊是最高频':636 '命中历史案例':692 '命中率':936,1043 '命中相关知识':939 '响应时间':646 '响应时间要求':160,421 '响应时间要求高':39 '响应要求':911 '哪些仍依赖专家直觉':441 '哪些动作需要双人确认':529 '哪些场景始终需要专家主导':565 '哪些场景必须保留人工裁决':591 '哪些建议最常被采纳':563 '哪些故障模式已进入稳定区':440 '哪些故障模式最容易误判':564 '哪些生产环境永远不能让':530 '哪些看上去有效但真实环境会失真':442 '哪些输出只能作为建议':528 '商业实验':184,704,960 '因此':384 '团队对知识系统需求强烈':1026 '团队开始更清楚地知道哪些场景可以自动辅助':590 '场景最大的特点':379 '基于什么证据':354 '基于服务拓扑':668 '基础设施':814 '基础设施层':552 '处理手册和复盘材料是否具备':404 '处置建议':337 '处置建议推荐':129 '处置路径推荐':785 '复盘报告':771,1077 '复盘报告库':999 '复盘误判案例':841 '大促期间峰值':611 '季度':843,1061 '季度能力沉淀':234,568 '安全要求':909 '定义':518 '定位和交接速度提升':585 '实时性强':38 '实时性要求极高的交易系统':301 '实验结论报告':73 '审计放行':214,512,789,1017 '审计放行不是附加动作':385 '审计要求':1082 '审计规则':210,776,1010 '审计规则清单':542 '客服场景':284 '容量规划':158 '容量预测等场景':294 '对方法论的影响':31 '将专家经验转化为可检索':918 '已沉淀故障模式占历史故障的比例':1040 '帮人快一点看日志':373 '年值班记录':1009 '并把注意力放到真正高风险的信号上':321 '库':1003 '应被写进案例库':365 '延迟和准确率难以兼顾':302 '建立价值信号识别机制':592 '建立反馈回灌机制':557 '建立循环优化节奏':566 '建议优先看哪些线索':355 '建议查看率':827 '建议用人在监督中':299 '异常一旦出现必须强制回退到人工':534 '强审计':300,347 '强约束':23,296 '当前值班上下文':742 '当前活跃故障链':744 '当前痛点':614,880 '形成组织级能力资产':867 '影子系统并行验证':85 '影子验证报告':87 '循环优化':232,839,1057 '微服务':879 '必须有强审计放行和人在回路机制':34 '必须标注来源文档':1012 '必须经过双人确认':1016 '必须附带历史案例支撑':1014 '所有分诊建议标注':804 '所有建议仅供参考':651,860 '所有操作必须可审计':908 '所有知识引用必须可追溯':1036 '执行要点':399,432,455,517,550,582 '执行输出':629,894 '把值班经验写进系统':450 '拆分能力单元':456 '拒绝':223,541 '持续观测信号':561 '接受度':218,523,795,1024 '接收告警':727 '推理延迟':815 '推荐处置优先级':735 '推荐处置路径':739,990 '操作建议':1015 '支付成功率':761 '放行决策':95,538,548 '放行条件':220,801,1030 '故障上下文':200,483,743 '故障分诊':155,291,584,643,852 '故障分诊优先于自动处置':305 '故障分诊同时满足四个条件':313 '故障分诊时间是否缩短':562 '故障分诊系统':603 '故障响应时间':967,1049 '故障处理效率趋势':831 '故障定位平均耗时':619 '故障影响判断':335 '故障影响范围判断':127 '故障摘要':408,459 '故障案例':230,558 '故障模式库':953 '效率层价值':583 '数据不出生产网络':910 '数据分析场景':289 '文档':767 '新人上手速度提升':596 '新人也能借助系统完成高质量初步判断':588 '新人培养周期':888,961,1048 '方向定界':149,390,634,899 '方法论路径':49 '日均告警':608 '日均查询':957 '日均查询次数':1045 '日志分析':157,293 '日志摘要':780 '日志样本是否可得':402 '日志模板匹配':678 '日志解释':168,328,457,675 '日志解释与摘要':118 '时必须标注':808 '时间在告警筛选和初步分诊上':617 '时间窗口':754 '时间窗口的聚类算法':669 '明确建议边界和人工接管条件':513 '明确目标场景':414 '映射':508 '是否命中历史故障模式':356 '是错误代价往往远高于一般信息类产品':380 '智能检索':904,932,1070 '暂不做自动分诊':1075 '暂不进入':857 '更新分诊规则':834,1056 '更新知识库':842 '最值得先':638 '最值得先改写的不是':307 '最终执行动作':308 '最重复':637 '月均':716 '月度':840,1058 '月度复盘':233,567 '月节省':719 '服务名':753 '服务拓扑':204,488,756 '服务画像':992 '服务负责人':498 '条':610,613,750 '构建':467 '构建运维知识系统':917 '某电商平台运维团队有':605 '某银行核心系统运维团队有':874 '标准操作流程':775 '标记知识缺口':1054 '核心交易系统故障响应要求':881 '核心协同':238 '核心概念':303 '核心系统故障':912 '核心问题':150,635,900 '根因建议':784 '根因排序':336 '根因概率排序':128 '案例':143,277 '案例召回':176,330,644,685 '案例召回与相似故障推荐':120 '案例召回能力':71 '案例库':864 '案例推荐':700,781 '案例方案':148,632,897 '案例模板':12 '检索':954,981 '检索准确率':1041 '检索准确率需持续优化':1029 '检索历史案例':738 '检索相关知识':984 '模型':169,173,177,667,676,686,923,933,943 '模型优化':560 '模型延迟必须纳入评估':40 '模型性能':819 '模型性能层':553 '次':959 '次故障':718 '步骤':388,423,447,510,543,574 '每一次人工修正':368 '每一次升级路径变化':369 '每一次新故障':367 '每个专家擅长的领域和历史判断':997 '每个建议必须附带证据链':654 '每个建议必须附带证据链和置信度':536 '每个服务的历史故障':993 '每次人工修正':833,1055 '每次故障减少损失约':713 '每次新故障':835 '每次新故障复盘':1051 '每次检索未命中':1053 '每次误判':837 '沉淀到案例库':836 '没有证据链的':358 '治理层价值':589 '活跃用户数':1046 '测算':188 '涉及资金操作的建议必须双人确认':1035 '清单':506 '满意度':183 '特征':30 '特征与适配性':28 '理由':849,1067 '理解告警':472 '理解能力验证':433 '理解运维问题':983 '生产环境配置':549 '生产运行':226,545,812,1037 '生产运行数据':580 '生产运行方案':103,570 '用户行为':826 '用户行为层':555 '电商平台':601 '电商故障分诊':633 '的关系':237 '的长期价值不只是':372 '监控体系':397 '监控信号是否覆盖':403 '目标':660,706 '目标场景':154,641,902 '直接下指令':532 '相似度排序':688 '相似案例召回':409,461 '知识':976 '知识密集':35 '知识工作台':952 '知识库':196,478,736 '知识库更新':231,559 '知识引用':1011 '知识抽取':922 '知识来源':1076 '知识沉淀':1069 '知识沉淀方式':863 '知识覆盖率':1039 '知识覆盖率评估':1059 '示例':599,868 '禁止任何直接操作生产的动作':811 '禁止执行':787 '禁止直接执行任何生产操作':652 '禁止自动执行':1034 '秒内返回':649 '稳定可用':674,694,941 '第一层':115 '第一批能力':850,1068 '第三层':133 '第二层':124 '管理':877 '篇':769,773 '篇标准操作流程':1005 '篇结构化复盘':1001 '系统应按风险等级分三层递进建设':325 '系统构建':189,449,722,973 '系统架构方案':501,515 '系统架构约束':454 '系统能否从历史案例中召回相似处置路径':438 '系统能否把多源信号拼起来看出异常模式':436 '系统能否解释单条日志和单个告警':434 '系统能更快做出初步判断':318 '约束':224,803,1032 '约束条件':159,645,906 '约束条件和成功标准':415 '组织与治理价值':578 '组织层价值':586 '组织建议':731 '组织答案':985 '组织结果':475 '经验复利与组织沉淀':362 '经验调用验证':437 '结构化模板':925 '结构化程度高':1080 '结论':171,175,179,673,682,693,929,940,949 '编排':469 '缩短':594,662 '缩短目标':186 '置信度':806 '群聊':886 '群聊中抽取结构化知识':980 '而是':309 '而是产品成立的一部分':386 '而是把值班体系从依赖少数人':374 '聚类分析':728 '背景':604,873 '能力':17 '能力分层':114 '能力分层递进':323 '能力实验':167,665,921 '能力实验报告':444 '自动':122 '自动切流':137 '自动处置':134 '自动处置层':341 '自动处置时机':856 '自动扩缩容':136,343 '自动抽取并更新知识库':1052 '自动补丁':138 '自动辅助':778 '行业案例模板':9 '补丁':345 '补充缺口':1060 '规则库':865 '规则引擎':944 '规则系统和反馈回路里':366 '解决知识碎片化核心痛点':1071 '订单量':760 '让新故障和人工修正变成组织资产':546 '设置边界规则':527 '设计':191,480,485,490,504,724,975 '设计五层可观测性':551 '设计升级链':495 '设计回退机制':533 '设计证据展示':535 '证据链驱动的可解释性':349 '评估':216,520,791,1019 '评估标准':431 '评估能力分层':844 '识别和放大效率':577 '试验展开':166,425,664,920 '试验结论':452 '误判率':824 '谁决策谁负责':45 '责任边界清晰':44 '质量可控':1081 '跨团队协作':499 '辅助建议模式':1073 '输入':394,427,451,514,547,579 '输出':58,72,79,86,94,102,110,165,411,416,443,500,537,569,597 '输出模板':145 '输出的不应该只是一个':351 '边界先于自动化':377,862 '边界和回退机制尚未验证':858 '边界设计是核心':47 '过去分散在群聊':363 '运维团队希望引入':15 '运维团队现状':395 '运维知识分散在':884 '运维知识库':207,492,765 '运维知识沉淀':270,903 '运维知识碎片化导致故障响应速度依赖个人经验':901 '运维知识系统':872 '近':746,1007 '还应该包含':353 '适合':121,130,139,338 '适合人在监督中':346 '适合自动':331 '适用边界':290 '选择':473,848,1066 '选择分诊':729 '选择最值得先':55,151,391 '选择第一批高频且可比较的故障模式':405 '逐步推进到依赖组织能力':375 '通过':221,539 '都会反过来让系统更懂本组织真实的运行环境':370 '配套':258 '采纳率':182,701,828 '重复':311,315 '重点识别':439 '重责任场景的':24 '重责任的运维环境':297 '金融合规要求':1084 '金融场景风险高':1074 '金融系统':1022 '金融行业':870 '金融运维知识系统':898 '错误建议可能导致排查方向偏移':794 '错误建议可能导致资金损失':1023 '错误建议直接导致故障扩大':33 '长尾案例需补充':695 '附条件':222,540 '附条件通过':802,1031 '需人工审核':931 '需人工确认':684,810 '需优化证据展示':800 '需要为':19 '需要直接自动执行高危操作':298 '需要知识沉淀和检索增强':37 '需要系统性方法论指导':18 '需配合专家确认':950 '页面':762 '领域专家':497 '风险':217,521,792,1020 '风险提示':463 '风险等级':211 '风险评估标准':516 '风险边界':161,420,650 '验证三层能力是否稳定':426 '验证日志解释':69 '高':796,1021,1025 '高峰期告警风暴导致关键告警被淹没':618 '高频':310,314,853 '高风险':32,135,295,342,786 '高风险动作必须人工确认':225 '高风险场景':861 '高风险场景审计放行':93","prices":[{"id":"bc836c74-c971-4aab-81c0-32f672f6a2c8","listingId":"dc0206f7-31c3-4d14-94ce-154f0c25ef4c","amountUsd":"0","unit":"free","nativeCurrency":null,"nativeAmount":null,"chain":null,"payTo":null,"paymentMethod":"skill-free","isPrimary":true,"details":{"org":"gmaxxxie","category":"ai-native-product-agent-skills","install_from":"skills.sh"},"createdAt":"2026-05-01T01:02:53.825Z"}],"sources":[{"listingId":"dc0206f7-31c3-4d14-94ce-154f0c25ef4c","source":"github","sourceId":"gmaxxxie/ai-native-product-agent-skills/p10b-aiops-case","sourceUrl":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/p10b-aiops-case","isPrimary":false,"firstSeenAt":"2026-05-01T01:02:53.825Z","lastSeenAt":"2026-05-18T18:57:27.463Z"}],"details":{"listingId":"dc0206f7-31c3-4d14-94ce-154f0c25ef4c","quickStartSnippet":null,"exampleRequest":null,"exampleResponse":null,"schema":null,"openapiUrl":null,"agentsTxtUrl":null,"citations":[],"useCases":[],"bestFor":[],"notFor":[],"kindDetails":{"org":"gmaxxxie","slug":"p10b-aiops-case","github":{"repo":"gmaxxxie/ai-native-product-agent-skills","stars":56,"topics":["agent-skills","ai-agent","ai-native","ai-product","methodology","product-management","product-methodology","product-thinking","skills"],"license":null,"html_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills","pushed_at":"2026-05-06T07:19:36Z","description":"AI Native Product Methodology — 80 executable skills across P0-P14 stages, covering needs discovery to aesthetic authority. From 8 books.","skill_md_sha":"d02599c251752df4fee94939b0441f3ff919fa4d","skill_md_path":"skills/p10b-aiops-case/SKILL.md","default_branch":"main","skill_tree_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/p10b-aiops-case"},"layout":"multi","source":"github","category":"ai-native-product-agent-skills","frontmatter":{"name":"p10b-aiops-case","description":"'AI Native 产品方法论——AIOps 行业案例模板 Skill。"},"skills_sh_url":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/p10b-aiops-case"},"updatedAt":"2026-05-18T18:57:27.463Z"}}