{"id":"bc15a664-8fc0-4b78-82bf-b50790c0bff9","shortId":"tTptQa","kind":"skill","title":"ai-native-audit-release","tagline":"AI Native 产品方法论——审计放行阶段的实操 Skill。\n用户提供系统构建方案，Skill 自动执行审计放行流程：\n设计证据 → 评估证据 → Shadow 证据 → 放行边界判断 → go/no-go 决策 → 输出放行方案。\n基于《AI Native 产品方法论》第17章。","description":"# AI Native 审计放行 Skill\n\n## 使用场景\n\n- 系统构建已完成，需要判断能否进入生产环境\n- 需要建立审计放行的证据链和决策机制\n- 需要设计 Shadow System 验证系统在真实环境中的表现\n\n## 执行步骤\n\n1. **设计证据收集**：检查系统设计是否清晰定义了能力范围、失败模式、边界条件和治理机制。\n2. **评估证据收集**：收集能力评估（样本/边界/长尾测试）、安全评估（权限/数据/渗透测试）和性能评估（延迟/吞吐/成本）结果。\n3. **Shadow 证据收集**：设计并运行 Shadow System，在真实环境中收集系统输出与人工处理结果的对比数据。\n4. **放行边界判断**：定义自动执行区、人工接管区和禁用区三个区域的范围和控制措施。\n5. **六类审计检查**：执行可靠性、安全与权限、执行边界、成本与性能、可追溯性、合规与治理六类审计。\n6. **go/no-go 决策**：基于证据链完整性和放行边界清晰度做出放行或拒绝决定。\n7. **输出放行方案**：如果 go，下发生产要求、监控指标和回滚方案；如果 no-go，说明缺失条件和补充要求。\n\n## 核心概念\n\n- **审计放行（Audit）**：把能力、风险、证据和放行条件压缩到同一套判断机制中的阶段\n- **go / no-go**：是否允许系统进入真实执行链路的组织级决定\n- **放行边界**：允许自动执行的范围、必须人工接管的范围和必须禁用的范围\n- **证据链**：从设计、评估、Shadow 到运行准备的连续证据，而不是单点结果\n\n## 审计放行流程\n\n```\n设计证据\n  → 评估证据\n    → Shadow 证据\n      → 放行边界判断\n        → go / no-go\n          → 生产要求下发\n```\n\n如果没有连续证据链，审计放行就会退化成主观印象或形式化审批。\n\n## 第一步：设计证据\n\n系统设计是否清晰地定义了：\n\n- 能力范围：系统能做什么、不能做什么\n- 失败模式：已知的失败类型和处理策略\n- 边界条件：什么情况下必须回退或交还给人\n- 治理机制：如何监控、如何审计、如何回滚\n\n## 第二步：评估证据\n\n评估结果是否充分：\n\n- 能力评估：样本测试、边界测试、长尾测试\n- 安全评估：权限边界、数据保护、渗透测试\n- 性能评估：延迟、吞吐、成本、稳定性\n\n## 第三步：Shadow 证据\n\nShadow System 是审计放行的关键机制：\n\n- 系统在真实环境中运行，但不直接影响用户\n- 同时收集系统输出和人工处理结果进行对比\n- 证明系统在真实数据上的表现\n\nShadow 的价值在于：它让系统在不影响用户的情况下接触真实世界。\n\n## 第四步：放行边界判断\n\n明确三个区域：\n\n### 自动执行区\n- 系统可以独立完成的任务\n- 失败后果可控、可回退\n- 已经过充分验证\n\n### 人工接管区\n- 高风险任务\n- 涉及敏感操作\n- 系统信心度不足的场景\n\n### 禁用区\n- 超出系统能力范围的任务\n- 未经验证的新场景\n- 涉及合规或安全红线的操作\n\n## 第五步：go / no-go 决策\n\n### go 条件\n\n- 连续证据链完整\n- 放行边界清晰\n- 回退机制可靠\n- 监控体系就绪\n- 团队准备就绪\n\n### no-go 情况\n\n- 证据链中断\n- 边界不清晰\n- 回退机制不可靠\n- 监控体系缺失\n- 团队未就绪\n\n## 审计放行要审的六类问题\n\n1. **可靠性**：回答是否稳定，任务是否真的完成，是否存在幻觉、错误归因或不一致输出\n2. **安全与权限**：是否可能泄露敏感信息，是否存在越权读取、越权调用、Prompt 注入、工具滥用\n3. **执行边界**：哪些动作允许自动执行，哪些必须审批，哪些高风险动作要彻底禁用\n4. **成本与性能**：延迟、令牌消耗、工具链长度、重试策略是否可控，流量放大后是否失稳\n5. **可追溯性**：是否能复盘输入、上下文、模型版本、工具调用、人工接管、最终结果\n6. **合规与治理**：角色责任是否清晰，审计记录是否保留，异常处理是否有明确流程\n\n## 输出物：放行方案\n\n1. **证据链汇总**：设计、评估、Shadow 的证据摘要\n2. **放行边界图**：自动执行区、人工接管区、禁用区\n3. **go/no-go 决策**：明确的放行或拒绝决定\n4. **生产要求**：上线后必须持续监控的指标、阈值、应急预案\n5. **回滚方案**：如果出现问题如何快速回滚\n\n## 使用方式\n\n当用户提供系统构建方案时，自动执行：\n\n1. 收集设计证据\n2. 收集评估证据\n3. 设计 Shadow 方案并收集 Shadow 证据\n4. 定义放行边界\n5. 执行六类审计检查\n6. 做出 go/no-go 决策\n7. 如果 go，下发生产要求和回滚方案\n8. 输出放行方案\n\n## 示例\n\n### 示例：AIOps 系统审计放行\n\n**场景描述**：\nAIOps 故障分诊系统已完成构建，需要审计是否可进入生产环境。\n\n**用户输入**：\n\"我们的 AIOps 系统已开发完成，准备上线，需要进行审计放行\"\n\n**Skill 执行流程**：\n\n1. **设计证据收集**\n\n| 检查项 | 状态 | 证据 |\n|--------|------|------|\n| 能力范围定义 | ✅ | 明确只做分诊建议，不做自动处置 |\n| 失败模式 | ✅ | 已定义5类失败及回退策略 |\n| 边界条件 | ✅ | 置信度<70%时必须人工确认 |\n| 治理机制 | ✅ | 日志审计、监控告警、回滚方案 |\n\n2. **评估证据收集**\n\n| 评估类型 | 结果 | 是否满足 |\n|----------|------|----------|\n| 能力评估 | 日志解释88%，告警聚类82%，案例召回75% | ✅ 满足 |\n| 安全评估 | 无越权调用，数据已脱敏 | ✅ 通过 |\n| 性能评估 | P95延迟<2s，支持100并发 | ✅ 通过 |\n| 边界测试 | 20个边界案例，18个正确处理 | ✅ 达标 |\n\n3. **Shadow 证据收集**\n\n```yaml\nShadow 方案:\n  运行周期: 2周\n  数据量: 50次真实故障\n  \n对比结果:\n  系统建议采纳率: 55%\n  辅助参考价值率: 80%\n  错误归因数: 2次（均被工程师识别，未造成误判）\n  平均定位时间:\n    - 纯人工: 45分钟\n    - 系统辅助: 25分钟\n    \n关键发现:\n  - 系统在\"看什么\"上表现好\n  - 系统在\"怎么做\"上仍需人工判断\n  - 高约束设计有效避免了错误放大\n```\n\n4. **放行边界定义**\n\n| 区域 | 范围 | 控制措施 |\n|------|------|----------|\n| 自动执行区 | 无 | 系统不执行任何自动动作 |\n| 人工接管区 | 全部输出 | 所有建议需工程师确认 |\n| 禁用区 | 自动修复、自动重启 | 明确禁止的功能 |\n\n5. **六类审计检查**\n\n| 审计项 | 检查结果 | 风险等级 |\n|--------|----------|----------|\n| 可靠性 | 幻觉率<5%，无错误归因 | 低 |\n| 安全与权限 | 无越权，已脱敏 | 低 |\n| 执行边界 | 明确只做建议 | 低 |\n| 成本与性能 | 单次调用<$0.01 | 低 |\n| 可追溯性 | 全链路审计日志 | 低 |\n| 合规与治理 | 责任清晰，流程明确 | 低 |\n\n6. **go/no-go 决策**\n\n```yaml\n决策: GO（条件放行）\n\n放行条件:\n  - 仅限值班辅助场景\n  - 所有输出必须有\"供参考\"标识\n  - 不得用于无人值守场景\n  \n上线后监控:\n  - 采纳率是否维持>50%\n  - 是否有未识别的错误归因\n  - 是否有工程师绕过确认直接执行\n  \n应急预案:\n  - 发现严重问题可5分钟内关闭AI建议\n  - 回退到纯人工分诊流程\n```\n\n**输出结果**：\n\n```yaml\n# 放行方案：AIOps 故障分诊系统\n\n证据链汇总:\n  设计证据: ✅ 完整\n  评估证据: ✅ 通过\n  Shadow证据: ✅ 2周运行，采纳率55%\n\n放行边界:\n  自动执行区: 无（仅建议模式）\n  人工接管区: 全部输出\n  禁用区: [自动修复, 自动重启, 自动切流]\n\ngo/no-go决策: ✅ GO - 条件放行\n\n生产要求:\n  必须监控指标:\n    - 采纳率: >50%\n    - 误判率: <5%\n    - 响应时间: P95<2s\n    \n  必须保留记录:\n    - 每次故障的输入+输出\n    - 工程师采纳/拒绝行为\n    - 最终人工处理结果\n    \n  定期审计:\n    - 每周审查误判案例\n    - 每月评估是否需调整边界\n    \n回滚方案:\n  触发条件:\n    - 误判导致生产事故\n    - 采纳率持续低于40%\n    - 安全漏洞\n    \n  回滚步骤:\n    1. 关闭AI建议开关（5分钟内）\n    2. 通知值班团队\n    3. 启动根因分析\n    4. 修复后重新走审计流程\n\n风险提示:\n  - 当前系统适用于\"辅助判断\"，不适用于\"自动处置\"\n  - 工程师需培训：理解AI建议的局限性\n  - 建立快速上报通道：异常建议及时反馈\n```\n\n---\n\n### 示例2：金融风控反欺诈系统审计放行\n\n**场景描述**：\n金融风控反欺诈系统已完成构建，需审计决定是否可投入生产环境进行实时交易风险评估。\n\n**用户输入**：\n\"我们的AI反欺诈系统准备好了，需要审计放行\"\n\n**Skill 执行流程**：\n\n1. **设计证据收集**\n\n| 检查项 | 状态 | 证据 |\n|--------|------|------|\n| 能力范围定义 | ✅ | 仅限风险评分（0-100），不做拦截决策 |\n| 失败模式 | ✅ | 定义误杀、漏杀、特征漂移三类失败 |\n| 边界条件 | ✅ | 高风险交易（>80分）必须人工复核 |\n| 治理机制 | ✅ | 模型监控、特征监控、审批流 |\n\n2. **评估证据收集**\n\n| 评估类型 | 结果 | 是否满足 |\n|----------|------|----------|\n| 能力评估 | 欺诈识别率 92%，误报率 8% | ✅ 达标 |\n| 安全评估 | 模型防攻击测试通过 | ✅ 通过 |\n| 性能评估 | P99延迟 <50ms，支持10万TPS | ✅ 满足 |\n| 公平性评估 | 各群体FPR差异 <2% | ✅ 通过 |\n\n3. **Shadow 证据收集**\n\n```yaml\nShadow 方案:\n  运行周期: 4周\n  数据量: 500万笔真实交易\n  \n对比结果:\n  系统评分与人工规则对比:\n    - 一致性: 87%\n    - 系统识别新增风险: 3.2%（人工规则未覆盖）\n    - 误报增量: +1.5%（可接受范围）\n  \n  业务指标:\n    - 欺诈损失率: 从0.15%降至0.08%\n    - 误杀投诉: 日均12起（可接受）\n    - 高风险交易人工复核率: 18%\n```\n\n4. **放行边界定义**\n\n| 区域 | 范围 | 控制措施 |\n|------|------|----------|\n| 自动执行区 | 风险评分计算、低风险标记 | 无需人工干预 |\n| 人工接管区 | 高风险交易(>80分) | 必须人工复核 |\n| 禁用区 | 直接拦截、冻结账户 | 系统无权执行 |\n\n5. **六类审计检查**\n\n| 审计项 | 检查结果 | 风险等级 |\n|--------|----------|----------|\n| 可靠性 | OOD检测、置信度校准到位 | 低 |\n| 安全与权限 | 模型防投毒、特征防泄露 | 低 |\n| 执行边界 | 评分与决策分离 | 低 |\n| 成本与性能 | 单次评分<$0.001，延迟可控 | 低 |\n| 可追溯性 | 每笔交易评分原因可查 | 低 |\n| 合规与治理 | 符合金融监管要求 | 中 |\n\n6. **合规特殊审查（金融场景）**\n\n| 合规项 | 检查结果 |\n|--------|----------|\n| 模型可解释性 | ✅ 提供Top5特征贡献 |\n| 公平性审计 | ✅ 各 demographics FPR差异<2% |\n| 人工复核机制 | ✅ 高风险100%人工复核 |\n| 误杀申诉 | ✅ 建立快速申诉通道 |\n| 数据隐私 | ✅ 符合GDPR/个人信息保护法 |\n\n7. **go/no-go 决策**\n\n```yaml\n决策: GO（条件放行）\n\n放行条件:\n  - 风险评分仅作辅助参考\n  - 所有拦截决策必须人工确认\n  - 建立实时监控系统\n  \n上线后监控:\n  - 欺诈识别率维持>90%\n  - 误报率维持<10%\n  - 特征漂移监控\n  - 公平性指标持续监控\n  \n应急预案:\n  - 模型异常时切换规则引擎（30秒内）\n  - 误杀激增时启动白名单机制\n```\n\n**输出结果**：\n\n```yaml\n# 放行方案：金融风控反欺诈系统\n\n证据链汇总:\n  设计证据: ✅ 完整，评分与决策分离\n  评估证据: ✅ 通过，92%识别率/8%误报\n  Shadow证据: ✅ 4周运行，业务指标正向\n  合规矩阵: ✅ 全部通过\n\n放行边界:\n  自动执行区: [风险评分计算, 特征工程, 低风险标记]\n  人工接管区: 高风险交易(>80分)\n  禁用区: [直接拦截, 冻结账户, 自动拒绝]\n\ngo/no-go决策: ✅ GO - 条件放行\n\n生产要求:\n  实时监控:\n    - 欺诈识别率: >90%\n    - 误报率: <10%\n    - P99延迟: <50ms\n    - 特征漂移: 每日检测\n    - 公平性: 每周审计\n    \n  人工复核:\n    - 高风险交易(>80分): 100%复核\n    - 中风险交易(60-80分): 抽样复核10%\n    - 建立复核SOP和时效要求\n    \n  可解释性:\n    - 每笔评分附带Top5特征\n    - 提供自然语言解释\n    - 客服可查评分依据\n\n回滚方案:\n  触发条件:\n    - 误杀率超过15%\n    - 模型预测分布异常\n    - 监管合规问题\n    \n  回滚步骤:\n    1. 切换至备用规则引擎(30秒)\n    2. 通知风控团队\n    3. 冻结模型自动更新\n    4. 启动根因分析\n\n特别说明:\n  - 反欺诈是持续对抗，需定期模型更新\n  - 建立黑产情报联动机制\n  - 误杀投诉处理时效: 4小时内响应\n```\n\n---\n\n### 示例3：医疗辅助诊断系统审计放行\n\n**场景描述**：\n医院AI辅助诊断系统已完成开发，需审计决定是否可投入临床辅助使用。\n\n**用户输入**：\n\"我们的AI影像诊断辅助系统需要审计放行\"\n\n**Skill 执行流程**：\n\n1. **设计证据收集**\n\n| 检查项 | 状态 | 证据 |\n|--------|------|------|\n| 能力范围定义 | ✅ | 仅作\"第二意见\"参考，非诊断结论 |\n| 失败模式 | ✅ | 定义漏诊、误诊、置信度不足三类 |\n| 边界条件 | ✅ | 置信度<85%时必须医生确认 |\n| 治理机制 | ✅ | 临床审计、质控流程、责任界定 |\n\n2. **评估证据收集**\n\n| 评估类型 | 结果 | 是否满足 |\n|----------|------|----------|\n| 能力评估 | 病灶识别AUC 0.94，敏感度 91% | ✅ 达标 |\n| 安全评估 | 通过医疗器械软件安全测试 | ✅ 通过 |\n| 性能评估 | P95延迟 <3s，并发50 | ✅ 满足 |\n| 鲁棒性 | 不同设备/参数下稳定性>95% | ✅ 通过 |\n\n3. **Shadow 证据收集**\n\n```yaml\nShadow 方案:\n  运行周期: 8周\n  数据量: 2000例真实患者影像\n  \n对比结果:\n  与专家诊断对比:\n    - 一致性: 89%\n    - 系统发现专家遗漏: 4.2%（经复核确认）\n    - 专家发现系统遗漏: 2.8%\n  \n  临床价值:\n    - 阅片时间: 从15分钟降至10分钟\n    - 医生满意度: 82%\n    - 无重大误诊事故\n```\n\n4. **医疗合规特殊审查**\n\n| 合规项 | 检查结果 |\n|--------|----------|\n| 医疗器械注册 | ✅ 通过二类医疗器械认证 |\n| 临床验证 | ✅ 完成多中心临床试验 |\n| 医生培训 | ✅ 参与科室医生100%培训 |\n| 知情同意 | ✅ 患者知情同意流程到位 |\n| 责任界定 | ✅ 明确AI辅助，诊断责任归医生 |\n\n5. **放行边界定义**\n\n| 区域 | 范围 | 控制措施 |\n|------|------|----------|\n| 自动执行区 | 影像预处理、病灶标记辅助 | 仅处理 |\n| 人工接管区 | 所有诊断输出 | 医生100%确认 |\n| 禁用区 | 独立诊断、治疗方案建议 | 系统永远不输出 |\n\n6. **六类审计检查**\n\n| 审计项 | 检查结果 | 风险等级 |\n|--------|----------|----------|\n| 可靠性 | 鲁棒性验证通过，临床数据支持 | 中 |\n| 安全与权限 | 数据隐私、访问控制到位 | 低 |\n| 执行边界 | 仅辅助，不替代医生 | 中 |\n| 成本与性能 | 单次<$0.05，延迟可接受 | 低 |\n| 可追溯性 | 病例、影像、输出全记录 | 低 |\n| 合规与治理 | 医疗器械认证、临床准入 | 中 |\n\n7. **go/no-go 决策**\n\n```yaml\n决策: GO（严格条件放行）\n\n放行条件（最严格）:\n  - 仅用于已培训科室\n  - 所有输出必须有\"仅供参考\"标识\n  - 医生对最终诊断负全责\n  - 建立临床质控委员会\n  \n上线后监控（最高标准）:\n  - 每月临床质量评估\n  - 每季度多科室效果对比\n  - 持续不良事件监测\n  - 年度临床试验更新\n```\n\n**输出结果**：\n\n```yaml\n# 放行方案：医疗AI辅助诊断系统\n\n证据链汇总:\n  设计证据: ✅ 明确辅助定位\n  评估证据: ✅ AUC 0.94，临床试验通过\n  Shadow证据: ✅ 8周运行，无重大事故\n  医疗准入: ✅ 二类医疗器械认证\n\n放行边界（最保守）:\n  自动执行区: [影像预处理, 图像增强]\n  人工接管区: 全部诊断相关输出\n  禁用区: [独立诊断, 治疗方案, 预后判断]\n\ngo/no-go决策: ✅ GO - 严格条件放行\n\n生产要求:\n  使用前必备:\n    - 科室医生完成专项培训\n    - 患者签署知情同意书\n    - 质控委员会建立\n    \n  持续监控:\n    - 敏感性/特异性: 月度统计\n    - 医生采纳率: 实时监控\n    - 不良事件: 24小时内上报\n    - 质控委员会: 季度评审\n    \n  责任界定:\n    - 系统: 仅提供算法分析\n    - 医生: 对诊断结论负全部责任\n    - 医院: 建立投诉处理机制\n\n回滚方案:\n  触发条件:\n    - 重大漏诊/误诊事故\n    - 敏感性下降至<85%\n    - 监管合规问题\n    \n  回滚步骤:\n    1. 立即暂停系统使用\n    2. 通知所有使用科室\n    3. 启动医疗安全事件调查\n    4. 向监管部门报告\n    5. 修复后重新临床验证\n\n风险提示（医疗场景）:\n  ⚠️ 医疗风险不可逆，容错率极低\n  ⚠️ AI只是工具，不能替代医生专业判断\n  ⚠️ 持续收集临床反馈，迭代优化\n  ⚠️ 建立快速通道处理医生质疑\n```\n\n---\n\n### 示例4：AI 客服系统上线审计\n\n**场景描述**：\n电商平台 AI 客服 Copilot 系统已完成构建，核心能力包括意图理解、订单查询、规则检索、候选回复生成和服务升级路由。系统设计为\"建议模式\"——AI 生成候选回复供人工客服确认后发送，涉及退款、赔付、时效承诺等高风险节点自动升级至主管审批。团队需要审计该系统是否可进入生产环境。\n\n**用户输入**：\n\"我们的 AI 客服系统已经完成了系统构建，候选回复生成、订单查询、规则检索和升级路由都已打通。现在需要审计放行，准备在真实客服团队中上线。\"\n\n**Skill 执行流程**：\n\n1. **设计证据收集**\n\n| 检查项 | 状态 | 证据 |\n|--------|------|------|\n| 能力范围定义 | ✅ | 明确为建议模式，AI 不直接面向用户，所有回复需人工确认后发送 |\n| 失败模式 | ✅ | 定义 5 类失败：意图误判、订单查询超时、规则检索偏差、高风险承诺、上下文丢失 |\n| 边界条件 | ✅ | 退款/赔付/时效承诺节点自动标记为高风险，强制升级主管；置信度 <75% 时只展示\"不确定\"提示 |\n| 治理机制 | ✅ | 对话全链路日志、人工改写追踪、升级路径记录、满意度回灌 |\n\n2. **评估证据收集**\n\n| 评估类型 | 结果 | 是否满足 |\n|----------|------|----------|\n| 能力评估 | 意图识别 93%、订单查询准确 96%、规则检索命中 88%、候选回复可用率 78% | ✅ 达标 |\n| 安全评估 | Prompt 注入防护通过、无越权读取非关联订单、敏感信息（手机号/地址）自动脱敏 | ✅ 通过 |\n| 性能评估 | 首响 <1.5s（P95），候选回复生成 <3s（P95），支持 200 并发会话 | ✅ 满足 |\n| 风险场景测试 | 50 个高风险边界用例（含诱导承诺、投诉升级、特殊政策），46 个正确标记或升级 | ✅ 达标 |\n\n3. **Shadow 证据收集**\n\n```yaml\nShadow 方案:\n  运行周期: 3 周\n  覆盖量: 1,200 通真实客服会话\n  \n对比结果:\n  候选回复采纳率: 68%\n  人工改写率: 22%（主要是措辞调整，非方向性修改）\n  高风险标记触发率: 12%\n  高风险标记准确率: 91%（11 次误标，0 次漏标）\n  \n  效率指标:\n    首响时间: 纯人工 28s → 系统辅助 8s\n    平均处理时长: 纯人工 6.2min → 系统辅助 4.1min\n    \n  风险事件:\n    - 0 次错误承诺（高风险节点全部拦截成功）\n    - 2 次规则检索偏差（客服人工修正，未造成用户投诉）\n    - 1 次上下文丢失（长会话 >20 轮时出现，已记录为已知限制）\n\n关键发现:\n  - 系统在高频重复问题上效果显著（物流查询、退换货流程）\n  - 复杂投诉场景仍需人工主导，AI 辅助定位规则\n  - 服务升级链设计有效，高风险节点拦截无遗漏\n```\n\n4. **放行边界定义**\n\n| 区域 | 范围 | 控制措施 |\n|------|------|----------|\n| 自动执行区 | 意图识别、订单查询、规则检索、物流状态查询 | 可自动完成，结果直接展示给客服 |\n| 人工接管区 | 候选回复生成、高风险话题标记、升级路由建议 | 候选回复必须人工确认后发送；高风险标记供参考但最终由客服/主管判断 |\n| 禁用区 | 直接面向用户自动回复、自主承诺退款赔付、修改用户账户信息 | 任何情况下系统不得绕过人工直接执行 |\n\n5. **六类审计检查**\n\n| 审计项 | 检查结果 | 风险等级 |\n|--------|----------|----------|\n| 可靠性 | 候选回复可用率 78%，高风险标记准确率 91% | 低 |\n| 安全与权限 | 无越权读取、敏感信息脱敏、Prompt 注入防护 | 低 |\n| 执行边界 | 建议模式，高风险节点强制升级 | 低 |\n| 成本与性能 | 单次会话 <$0.03，延迟可控 | 低 |\n| 可追溯性 | 全链路日志：输入→意图→检索→候选回复→人工改写→最终发送 | 低 |\n| 合规与治理 | 服务升级链清晰、人工确认流程到位 | 低 |\n\n6. **go/no-go 决策**\n\n```yaml\n决策: GO（条件放行）\n\n放行条件:\n  - 仅限客服 Copilot 建议模式，AI 不直接面向终端用户\n  - 高风险节点（退款/赔付/时效承诺）必须经过主管审批\n  - 候选回复必须经人工确认后发送\n  - 新客服需完成 AI 工具培训后方可使用\n\n上线后监控:\n  - 候选回复采纳率: 维持 >60%\n  - 高风险标记漏标率: <2%\n  - 人工改写率: 持续监控，若突增则可能知识库已过期\n  - 用户满意度: 不低于上线前基线\n  - 升级率: 监控是否因 AI 标记导致升级过多或过少\n\n应急预案:\n  - 升级链故障时: 关闭 AI 建议，回退纯人工流程（<5 分钟）\n  - 发现错误承诺: 立即下线该场景能力，人工补救\n  - 知识库过期: 暂停规则检索能力，仅保留订单查询\n```\n\n**输出结果**：\n\n```yaml\n# 放行方案：AI 客服 Copilot 系统\n\n证据链汇总:\n  设计证据: ✅ 建议模式+升级链+边界清晰\n  评估证据: ✅ 意图 93%、回复可用 78%、高风险标记 91%\n  Shadow证据: ✅ 3 周 / 1,200 通会话，0 次错误承诺\n\n放行边界:\n  自动执行区: [意图识别, 订单查询, 规则检索, 物流查询]\n  人工接管区: [候选回复, 高风险标记, 升级路由]\n  禁用区: [直接面向用户自动回复, 自主承诺退款赔付, 修改账户]\n\ngo/no-go决策: ✅ GO - 条件放行\n\n生产要求:\n  必须监控指标:\n    - 候选回复采纳率: >60%\n    - 高风险标记准确率: >90%\n    - 首响时间 P95: <2s\n    - 用户满意度: ≥上线前基线\n\n  服务经验沉淀:\n    - 人工改写回灌: 每日同步至知识库\n    - 失败案例归档: 每周审查并更新规则\n    - 升级路径优化: 每月分析升级数据\n\n  定期审计:\n    - 每周: 审查高风险标记漏标/误标案例\n    - 每月: 评估规则库覆盖度和候选回复质量\n    - 每季度: 全面评估是否可扩大自动执行区\n\n回滚方案:\n  触发条件:\n    - 错误承诺导致用户投诉或赔付损失\n    - 高风险标记漏标率持续 >5%\n    - 升级链失效\n\n  回滚步骤:\n    1. 关闭 AI 建议开关（<5 分钟）\n    2. 通知客服团队切换纯人工模式\n    3. 启动根因分析\n    4. 修复后重新走审计流程\n\n风险提示:\n  - 系统当前适用于\"客服辅助\"，不适用于\"自动客服\"\n  - 服务经验复利需持续运营：人工改写、失败案例、升级路径是长期资产\n  - 高峰流量期需关注成本和延迟波动\n```\n\n---\n\n### 示例5：AI 智能运维值班助手投产检查\n\n**场景描述**：\n某互联网公司的 AIOps 值班助手系统已完成构建，核心能力包括多源告警聚合、日志智能摘要、相似故障案例召回、初步归因建议和值班升级路由建议。系统设计为\"值班副驾驶\"模式——AI 在值班工程师工作台上提供辅助判断，所有处置动作仍由人工执行。经过 2 周 Shadow 运行后，团队决定启动正式投产审计。\n\n**用户输入**：\n\"AIOps 值班助手 Shadow 阶段已经跑了 2 周，50 次真实故障都有记录，现在需要正式审计放行，看能不能从 Shadow 转入正式值班辅助。\"\n\n**Skill 执行流程**：\n\n1. **设计证据收集**\n\n| 检查项 | 状态 | 证据 |\n|--------|------|------|\n| 能力范围定义 | ✅ | 明确为值班副驾驶模式：告警聚合、日志摘要、案例召回、归因建议；不执行任何自动修复动作 |\n| 失败模式 | ✅ | 定义 4 类失败：误归因（沿错误方向排查）、漏告警（未聚合关键信号）、案例召回偏差、升级建议不当 |\n| 边界条件 | ✅ | 置信度 <70% 时仅展示原始信号不给建议；生产环境操作（重启/扩容/切流）明确禁止 AI 触发 |\n| 治理机制 | ✅ | 全链路 Trace（输入→聚合→摘要→召回→建议→工程师行为→最终处置）、值班日报自动生成 |\n\n2. **评估证据收集**\n\n| 评估类型 | 结果 | 是否满足 |\n|----------|------|----------|\n| 能力评估 | 告警聚合 90%、日志摘要可用率 85%、案例召回 Top3 命中 72%、归因方向正确率 78% | ✅ 达标 |\n| 安全评估 | 无越权访问生产数据库、仅读取监控和日志接口、无法触发任何写操作 | ✅ 通过 |\n| 性能评估 | 告警聚合 <5s、日志摘要 <8s、案例召回 <3s，支持 50 并发故障会话 | ✅ 满足 |\n| 边界测试 | 30 个边界场景（含复合故障、全新故障类型、信号缺失），25 个正确降级或提示不确定 | ✅ 达标 |\n\n3. **Shadow 证据收集**\n\n```yaml\nShadow 方案:\n  运行周期: 2 周\n  数据量: 50 次真实线上故障（P0-P3 级）\n  \n对比结果:\n  系统建议采纳率: 55%（工程师参考了系统建议并采取类似方向）\n  辅助参考价值率: 80%（工程师认为系统输出对定位有帮助）\n  误归因数: 2 次（均在 P3 级故障，工程师自行识别未采纳）\n  \n  效率指标:\n    故障平均定位时间: 纯人工 45min → 系统辅助 25min\n    告警确认时间: 纯人工 8min → 系统辅助 2min\n    交接时间: 纯人工 15min → 系统辅助 5min（系统自动生成故障摘要）\n    \n  风险事件:\n    - 0 次自动执行操作（系统无写权限，设计有效）\n    - 2 次误归因（P3 级，工程师自行修正，未造成生产影响）\n    - 3 次案例召回为空（全新故障类型，系统正确提示\"无历史相似案例\"）\n\n关键发现:\n  - 系统在\"看什么\"上表现好（告警聚合、日志摘要、案例召回）\n  - 系统在\"怎么做\"上仍需人工判断（归因建议仅为参考方向）\n  - 高约束设计有效避免了错误放大：无写权限 + 低置信度时降级\n  - 交接效率提升最显著，值班团队反馈积极\n```\n\n4. **放行边界定义**\n\n| 区域 | 范围 | 控制措施 |\n|------|------|----------|\n| 自动执行区 | 无 | 系统不执行任何自动动作，仅提供信息和建议 |\n| 人工接管区 | 全部输出 | 所有告警聚合、日志摘要、案例召回和归因建议均需工程师确认后采纳 |\n| 禁用区 | 自动修复、自动重启、自动扩容、自动切流、自动回滚 | 明确禁止，系统无生产环境写权限 |\n\n5. **六类审计检查**\n\n| 审计项 | 检查结果 | 风险等级 |\n|--------|----------|----------|\n| 可靠性 | 误归因率 <5%（2/50），均为低级别，工程师自行识别 | 低 |\n| 安全与权限 | 仅读权限、无写操作能力、数据不外传 | 低 |\n| 执行边界 | 严格建议模式，无自动执行能力 | 低 |\n| 成本与性能 | 单次故障辅助调用 <$0.05，延迟可控 | 低 |\n| 可追溯性 | 全链路 Trace：告警→聚合→摘要→召回→建议→工程师行为→最终处置 | 低 |\n| 合规与治理 | 值班升级链清晰、双人确认规则到位、值班日报自动归档 | 低 |\n\n6. **go/no-go 决策**\n\n```yaml\n决策: GO（条件放行）\n\n放行条件:\n  - 仅限值班辅助场景，所有输出标注\"供参考\"\n  - 不得用于无人值守或自动处置场景\n  - 工程师需培训：理解 AI 建议的局限性和适用范围\n  - 保留随时关闭 AI 建议的开关\n\n上线后监控:\n  - 采纳率是否维持 >50%（低于此值可能说明建议质量下降）\n  - 是否有未识别的误归因（重点监控 P0/P1 级故障）\n  - 是否有工程师绕过确认直接按建议执行（行为监控）\n  - 故障定位时间是否持续改善\n  - 新故障类型覆盖率（案例召回为空的频率）\n\n应急预案:\n  - 发现严重误归因导致生产事故: 5 分钟内关闭 AI 建议\n  - 系统延迟异常: 切换至降级模式（仅展示原始告警和日志）\n  - 回退到纯人工值班流程\n```\n\n**输出结果**：\n\n```yaml\n# 放行方案：AIOps 值班助手\n\n证据链汇总:\n  设计证据: ✅ 副驾驶模式+无写权限+升级链清晰\n  评估证据: ✅ 聚合 90%、摘要 85%、召回 72%、归因 78%\n  Shadow证据: ✅ 2 周 / 50 次故障，0 次误操作，定位时间缩短 44%\n\n放行边界:\n  自动执行区: 无（纯建议模式）\n  人工接管区: 全部输出\n  禁用区: [自动修复, 自动重启, 自动扩容, 自动切流, 自动回滚]\n\ngo/no-go决策: ✅ GO - 条件放行\n\n生产要求:\n  必须监控指标:\n    - 建议采纳率: >50%\n    - 误归因率: <5%（P0/P1 级要求 0%）\n    - 响应时间 P95: 告警聚合 <5s, 日志摘要 <8s\n    - 案例召回命中率: >65%\n\n  经验沉淀机制:\n    - 误归因案例: 每周复盘，更新归因知识库\n    - 新故障类型: 纳入案例库，扩大召回覆盖\n    - 人工处置路径: 每月回灌为新案例模板\n    - 升级路径变化: 实时更新值班升级链\n\n  定期审计:\n    - 每周: 审查误归因和漏告警案例\n    - 每月: 评估归因准确率趋势和案例库覆盖度\n    - 每季度: 全面评估是否可扩大能力范围\n\n回滚方案:\n  触发条件:\n    - 误归因导致 P0/P1 级生产事故\n    - 建议采纳率持续低于 30%\n    - 系统延迟导致值班效率下降\n\n  回滚步骤:\n    1. 关闭 AI 建议开关（<5 分钟）\n    2. 通知值班团队切换纯人工模式\n    3. 启动根因分析（重点审查误归因链路）\n    4. 修复后重新走审计流程\n\n风险提示:\n  - 当前系统适用于\"值班辅助\"，不适用于\"自动运维\"\n  - 高约束设计是本系统的核心安全机制：无写权限 + 低置信度降级\n  - 值班团队需培训：理解 AI 建议的来源和局限性\n  - 建议建立\"AI 辅助值班\"与\"纯人工值班\"的效率对比看板\n  - 长期目标：将值班经验逐步沉淀为组织级能力，而非依赖个人经验\n```","tags":["native","audit","release","product","agent","skills","gmaxxxie","agent-skills","ai-agent","ai-native","ai-product","methodology"],"capabilities":["skill","source-gmaxxxie","skill-ai-native-audit-release","topic-agent-skills","topic-ai-agent","topic-ai-native","topic-ai-product","topic-methodology","topic-product-management","topic-product-methodology","topic-product-thinking","topic-skills"],"categories":["ai-native-product-agent-skills"],"synonyms":[],"warnings":[],"endpointUrl":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/ai-native-audit-release","protocol":"skill","transport":"skills-sh","auth":{"type":"none","details":{"cli":"npx skills add gmaxxxie/ai-native-product-agent-skills","source_repo":"https://github.com/gmaxxxie/ai-native-product-agent-skills","install_from":"skills.sh"}},"qualityScore":"0.478","qualityRationale":"deterministic score 0.48 from registry signals: · indexed on github topic:agent-skills · 56 github stars · SKILL.md body (14,807 chars)","verified":false,"liveness":"unknown","lastLivenessCheck":null,"agentReviews":{"count":0,"score_avg":null,"cost_usd_avg":null,"success_rate":null,"latency_p50_ms":null,"narrative_summary":null,"summary_updated_at":null},"enrichmentModel":"deterministic:skill-github:v1","enrichmentVersion":1,"enrichedAt":"2026-05-18T18:57:23.401Z","embedding":null,"createdAt":"2026-05-01T01:02:49.090Z","updatedAt":"2026-05-18T18:57:23.401Z","lastSeenAt":"2026-05-18T18:57:23.401Z","tsv":"'+1.5':595 '-100':540 '-80':746 '/8':704 '0':539,1157,1173,1334,1581,1742,1770 '0.001':641 '0.01':423 '0.03':1242 '0.05':907,1657 '0.94':813,949 '1':40,209,250,276,316,504,532,760,784,1001,1052,1141,1180,1331,1387,1447,1806 '1.5':1112 '10':685,732 '100':742 '11':1155 '12':1152 '15min':1576 '18':605 '18个正确处理':355 '2':45,215,256,278,334,507,554,575,661,763,806,1003,1086,1176,1285,1393,1427,1437,1491,1540,1557,1585,1738,1812 '2.8':848 '2/50':1642 '20':1183 '200':1119,1142,1332 '2000例真实患者影像':839 '20个边界案例':354 '22':1148 '24小时内上报':983 '25':1530 '25min':1568 '25分钟':380 '28s':1162 '2min':1573 '2s':350,488,1362 '2周':364 '2周运行':464 '2次':373 '3':60,223,261,280,357,509,577,765,830,1005,1131,1138,1329,1395,1533,1591,1814 '3.2':592 '30':1525,1803 '30秒':762 '30秒内':690 '3s':822,1116,1519 '4':67,228,265,286,389,511,606,767,855,1007,1195,1397,1461,1612,1817 '4.1':1170 '4.2':845 '44':1745 '45min':1566 '45分钟':378 '46':1128 '4周':584 '4周运行':707 '4小时内响应':774 '5':71,235,270,288,404,411,485,623,871,1009,1064,1219,1301,1384,1391,1634,1641,1710,1767,1810 '50':447,483,1123,1439,1521,1543,1697,1740,1765 '500万笔真实交易':586 '50ms':570,734 '50次真实故障':366 '55':369,1551 '5min':1578 '5s':1515,1774 '5分钟内':506 '6':79,243,290,432,650,888,1258,1676 '6.2':1167 '60':745,1283,1357 '65':1778 '68':1146 '7':83,294,670,919 '70':328,1471 '72':1504,1734 '75':1077 '78':1099,1226,1325,1506,1736 '8':298,563 '80':371,1554 '80分':548,617,718,741 '82':853 '85':800,998,1500,1732 '87':590 '88':1097 '89':843 '8min':1571 '8s':1164,1517,1776 '8周':837 '8周运行':952 '90':683,730,1359,1498,1730 '91':815,1154,1228,1327 '92':561,702 '93':1093,1323 '95':828 '96':1095 'ai':2,6,23,27,1021,1025,1035,1043,1059,1191,1269,1278,1293,1298,1312,1389,1410,1423,1478,1690,1693,1712,1808,1829,1832 'ai-native-audit-releas':1 'aiop':302,305,310,456,1414,1433,1721 'ai只是工具':1015 'auc':948 'audit':4,96 'copilot':1027,1267,1314 'demograph':659 'fpr差异':660 'go':86,92,100,103,120,123,187,190,192,201,296,437,478,675,725,924,969,1263,1352,1681,1760 'go/no-go':19,80,262,292,433,476,671,723,920,967,1259,1350,1677,1758 'min':1168,1171 'nativ':3,7,24,28 'no-go':90,101,121,188,199 'ood检测':629 'p0':1546 'p0-p3':1545 'p0/p1':1701,1768,1800 'p3':1547,1560,1587 'p95':487,1114,1117,1361,1772 'p95延迟':349,821 'p99延迟':569,733 'prompt':220,1102,1233 'releas':5 'shadow':16,36,61,64,111,117,158,160,167,254,282,284,358,361,578,581,831,834,1132,1135,1429,1435,1443,1534,1537 'shadow证据':463,706,951,1328,1737 'skill':10,12,30,314,530,782,1050,1445 'skill-ai-native-audit-release' 'source-gmaxxxie' 'system':37,65,161 'top3':1502 'topic-agent-skills' 'topic-ai-agent' 'topic-ai-native' 'topic-ai-product' 'topic-methodology' 'topic-product-management' 'topic-product-methodology' 'topic-product-thinking' 'topic-skills' 'trace':1482,1662 'yaml':360,435,454,580,673,693,833,922,941,1134,1261,1310,1536,1679,1719 '一致性':589,842 '上下文':238 '上下文丢失':1070 '上仍需人工判断':387,1605 '上线前基线':1364 '上线后必须持续监控的指标':267 '上线后监控':445,681,934,1280,1695 '上表现好':384,1599 '下发生产要求':87 '下发生产要求和回滚方案':297 '不低于上线前基线':1290 '不做拦截决策':541 '不做自动处置':323 '不同设备':826 '不得用于无人值守场景':444 '不得用于无人值守或自动处置场景':1687 '不执行任何自动修复动作':1458 '不替代医生':903 '不直接面向用户':1060 '不直接面向终端用户':1270 '不确定':1079 '不能做什么':132 '不能替代医生专业判断':1016 '不良事件':982 '不适用于':516,1402,1822 '与':1834 '与专家诊断对比':841 '专家发现系统遗漏':847 '业务指标':597 '业务指标正向':708 '严格建议模式':1652 '严格条件放行':925,970 '个人信息保护法':669 '个正确标记或升级':1129 '个正确降级或提示不确定':1531 '个边界场景':1526 '个高风险边界用例':1124 '中':649,896,904,918 '中风险交易':744 '临床价值':849 '临床准入':917 '临床审计':803 '临床数据支持':895 '临床试验通过':950 '临床验证':861 '主管判断':1213 '主要是措辞调整':1149 '二类医疗器械认证':955 '交接效率提升最显著':1610 '交接时间':1574 '产品方法论':8,25 '人工处置路径':1786 '人工复核':664,739 '人工复核机制':662 '人工接管':241 '人工接管区':178,259,397,470,615,716,880,961,1207,1342,1621,1750 '人工接管区和禁用区三个区域的范围和控制措施':70 '人工改写':1251,1405 '人工改写回灌':1366 '人工改写率':1147,1286 '人工改写追踪':1083 '人工确认流程到位':1256 '人工补救':1305 '人工规则未覆盖':593 '什么情况下必须回退或交还给人':136 '仅作':790 '仅供参考':930 '仅保留订单查询':1308 '仅处理':879 '仅展示原始告警和日志':1716 '仅建议模式':469 '仅提供信息和建议':1620 '仅提供算法分析':988 '仅用于已培训科室':928 '仅读取监控和日志接口':1510 '仅读权限':1647 '仅辅助':902 '仅限值班辅助场景':440,1684 '仅限客服':1266 '仅限风险评分':538 '从0.15':599 '从15分钟降至10分钟':851 '从设计':109 '令牌消耗':231 '任何情况下系统不得绕过人工直接执行':1218 '任务是否真的完成':212 '但不直接影响用户':164 '低':413,417,420,424,427,431,631,635,638,643,646,900,909,914,1229,1235,1239,1244,1253,1257,1645,1650,1654,1659,1670,1675 '低于此值可能说明建议质量下降':1698 '低置信度时降级':1609 '低置信度降级':1826 '低风险标记':613,715 '使用前必备':972 '使用场景':31 '使用方式':273 '供参考':442,1686 '保留随时关闭':1692 '信号缺失':1529 '修复后重新临床验证':1010 '修复后重新走审计流程':512,1398,1818 '修改用户账户信息':1217 '修改账户':1349 '候选回复':1250,1343 '候选回复可用率':1098,1225 '候选回复必须人工确认后发送':1211 '候选回复必须经人工确认后发送':1276 '候选回复生成':1045,1115,1208 '候选回复生成和服务升级路由':1032 '候选回复采纳率':1145,1281,1356 '值班副驾驶':1421 '值班助手':1434,1722 '值班助手系统已完成构建':1415 '值班升级链清晰':1672 '值班团队反馈积极':1611 '值班团队需培训':1827 '值班日报自动归档':1674 '值班日报自动生成':1490 '值班辅助':1821 '做出':291 '允许自动执行的范围':106 '全新故障类型':1528,1593 '全部诊断相关输出':962 '全部输出':398,471,1622,1751 '全部通过':710 '全链路':1481,1661 '全链路审计日志':426 '全链路日志':1246 '全面评估是否可扩大能力范围':1796 '全面评估是否可扩大自动执行区':1379 '公平性':737 '公平性审计':657 '公平性指标持续监控':687 '公平性评估':573 '六类审计检查':72,405,624,889,1220,1635 '关键发现':381,1186,1596 '关闭':1297,1388,1807 '关闭ai建议开关':505 '决策':20,81,191,263,293,434,436,477,672,674,724,921,923,968,1260,1262,1351,1678,1680,1759 '冻结模型自动更新':766 '冻结账户':621,721 '准备上线':312 '准备在真实客服团队中上线':1049 '分':747 '分钟':1302,1392,1811 '分钟内关闭':1711 '切换至备用规则引擎':761 '切换至降级模式':1715 '切流':1476 '初步归因建议和值班升级路由建议':1419 '到运行准备的连续证据':112 '副驾驶模式':1725 '区域':391,608,873,1197,1614 '医生':989 '医生100':882 '医生培训':863 '医生对最终诊断负全责':932 '医生满意度':852 '医生采纳率':980 '医疗ai辅助诊断系统':943 '医疗准入':954 '医疗合规特殊审查':856 '医疗器械注册':859 '医疗器械认证':916 '医疗场景':1012 '医疗辅助诊断系统审计放行':776 '医疗风险不可逆':1013 '医院':991 '医院ai辅助诊断系统已完成开发':778 '升级建议不当':1468 '升级率':1291 '升级路径优化':1370 '升级路径变化':1788 '升级路径是长期资产':1407 '升级路径记录':1084 '升级路由':1345 '升级路由建议':1210 '升级链':1319 '升级链失效':1385 '升级链故障时':1296 '升级链清晰':1727 '单次':906 '单次会话':1241 '单次故障辅助调用':1656 '单次评分':640 '单次调用':422 '参与科室医生100':864 '参数下稳定性':827 '参考':792 '双人确认规则到位':1673 '反欺诈是持续对抗':770 '发现严重误归因导致生产事故':1709 '发现严重问题可5分钟内关闭ai建议':451 '发现错误承诺':1303 '召回':1486,1666,1733 '可回退':176 '可接受':603 '可接受范围':596 '可自动完成':1205 '可解释性':750 '可追溯性':77,236,425,644,910,1245,1660 '可靠性':210,409,628,893,1224,1639 '各':658 '各群体fpr差异':574 '合规与治理':244,428,647,915,1254,1671 '合规与治理六类审计':78 '合规特殊审查':651 '合规矩阵':709 '合规项':653,857 '同时收集系统输出和人工处理结果进行对比':165 '向监管部门报告':1008 '吞吐':57,154 '含复合故障':1527 '含诱导承诺':1125 '启动医疗安全事件调查':1006 '启动根因分析':510,768,1396,1815 '告警':1663 '告警确认时间':1569 '告警聚合':1454,1497,1514,1600,1773 '告警聚类82':341 '周':1139,1330,1428,1438,1541,1739 '命中':1503 '和性能评估':55 '响应时间':486,1771 '哪些动作允许自动执行':225 '哪些必须审批':226 '哪些高风险动作要彻底禁用':227 '回复可用':1324 '回滚方案':271,333,498,754,993,1380,1797 '回滚步骤':503,759,1000,1386,1805 '回答是否稳定':211 '回退到纯人工值班流程':1717 '回退到纯人工分诊流程':452 '回退机制不可靠':205 '回退机制可靠':196 '回退纯人工流程':1300 '团队决定启动正式投产审计':1431 '团队准备就绪':198 '团队未就绪':207 '团队需要审计该系统是否可进入生产环境':1040 '图像增强':960 '在值班工程师工作台上提供辅助判断':1424 '在真实环境中收集系统输出与人工处理结果的对比数据':66 '地址':1107 '场景描述':304,524,777,1023,1412 '均为低级别':1643 '均在':1559 '均被工程师识别':374 '培训':865 '基于':22 '基于证据链完整性和放行边界清晰度做出放行或拒绝决定':82 '复杂投诉场景仍需人工主导':1190 '复核':743 '失败后果可控':175 '失败案例':1406 '失败案例归档':1368 '失败模式':43,133,324,542,794,1062,1459 '如何回滚':140 '如何审计':139 '如何监控':138 '如果':85,89,295 '如果出现问题如何快速回滚':272 '如果没有连续证据链':125 '季度评审':985 '它让系统在不影响用户的情况下接触真实世界':169 '安全与权限':74,216,414,632,897,1230,1646 '安全漏洞':502 '安全评估':51,148,344,565,817,1101,1508 '完成多中心临床试验':862 '完整':460,698 '定义':1063,1460 '定义放行边界':287 '定义漏诊':795 '定义自动执行区':69 '定义误杀':543 '定位时间缩短':1744 '定期审计':495,1372,1790 '实时更新值班升级链':1789 '实时监控':728,981 '审批流':553 '审查误归因和漏告警案例':1792 '审查高风险标记漏标':1374 '审计放行':29,95 '审计放行就会退化成主观印象或形式化审批':126 '审计放行流程':114 '审计放行要审的六类问题':208 '审计放行阶段的实操':9 '审计记录是否保留':246 '审计项':406,625,890,1221,1636 '客服':1026,1313 '客服人工修正':1178 '客服可查评分依据':753 '客服系统上线审计':1022 '客服系统已经完成了系统构建':1044 '客服辅助':1401 '容错率极低':1014 '对比结果':367,587,840,1144,1549 '对诊断结论负全部责任':990 '对话全链路日志':1082 '将值班经验逐步沉淀为组织级能力':1838 '工具培训后方可使用':1279 '工具滥用':222 '工具调用':240 '工具链长度':232 '工程师参考了系统建议并采取类似方向':1552 '工程师自行修正':1589 '工程师自行识别':1644 '工程师自行识别未采纳':1562 '工程师行为':1488,1668 '工程师认为系统输出对定位有帮助':1555 '工程师采纳':492 '工程师需培训':518,1688 '已定义5类失败及回退策略':325 '已知的失败类型和处理策略':134 '已经过充分验证':177 '已脱敏':416 '已记录为已知限制':1185 '平均处理时长':1165 '平均定位时间':376 '年度临床试验更新':939 '并发50':823 '并发会话':1120 '并发故障会话':1522 '幻觉率':410 '应急预案':269,450,688,1295,1708 '延迟':56,153,230 '延迟可接受':908 '延迟可控':642,1243,1658 '建立临床质控委员会':933 '建立复核sop和时效要求':749 '建立实时监控系统':680 '建立快速上报通道':520 '建立快速申诉通道':666 '建立快速通道处理医生质疑':1019 '建立投诉处理机制':992 '建立黑产情报联动机制':772 '建议':1299,1487,1667,1713 '建议建立':1831 '建议开关':1390,1809 '建议模式':1034,1237,1268,1318 '建议的局限性和适用范围':1691 '建议的开关':1694 '建议的来源和局限性':1830 '建议采纳率':1764 '建议采纳率持续低于':1802 '异常处理是否有明确流程':247 '异常建议及时反馈':521 '强制升级主管':1075 '归因':1735 '归因建议':1457 '归因建议仅为参考方向':1606 '归因方向正确率':1505 '当前系统适用于':514,1820 '当用户提供系统构建方案时':274 '影像':912 '影像预处理':877,959 '必须人工复核':549,618 '必须人工接管的范围和必须禁用的范围':107 '必须保留记录':489 '必须监控指标':481,1355,1763 '必须经过主管审批':1275 '怎么做':386,1604 '性能评估':152,348,568,820,1110,1513 '患者知情同意流程到位':867 '患者签署知情同意书':974 '情况':202 '意图':1248,1322 '意图识别':1092,1201,1338 '意图误判':1066 '成本':58,155 '成本与性能':76,229,421,639,905,1240,1655 '我们的':309,1042 '我们的ai反欺诈系统准备好了':528 '我们的ai影像诊断辅助系统需要审计放行':781 '所有告警聚合':1623 '所有回复需人工确认后发送':1061 '所有处置动作仍由人工执行':1425 '所有建议需工程师确认':399 '所有拦截决策必须人工确认':679 '所有诊断输出':881 '所有输出必须有':441,929 '所有输出标注':1685 '手机号':1106 '执行六类审计检查':289 '执行可靠性':73 '执行步骤':39 '执行流程':315,531,783,1051,1446 '执行边界':75,224,418,636,901,1236,1651 '扩大召回覆盖':1785 '扩容':1475 '把能力':97 '投诉升级':1126 '抽样复核10':748 '拒绝行为':493 '持续不良事件监测':938 '持续收集临床反馈':1017 '持续监控':976,1287 '控制措施':393,610,875,1199,1616 '提供top5特征贡献':656 '提供自然语言解释':752 '提示':1080 '摘要':1485,1665,1731 '支持':1118,1520 '支持100并发':351 '支持10万tps':571 '收集能力评估':47 '收集设计证据':277 '收集评估证据':279 '放行方案':249,455,694,942,1311,1720 '放行条件':439,677,926,1265,1683 '放行边界':105,466,711,956,1336,1746 '放行边界判断':18,68,119,171 '放行边界图':257 '放行边界定义':390,607,872,1196,1613 '放行边界清晰':195 '故障分诊系统':457 '故障分诊系统已完成构建':306 '故障定位时间是否持续改善':1705 '故障平均定位时间':1564 '效率指标':1159,1563 '敏感信息':1105 '敏感信息脱敏':1232 '敏感度':814 '敏感性':977 '敏感性下降至':997 '数据':53 '数据不外传':1649 '数据保护':150 '数据已脱敏':346 '数据量':365,585,838,1542 '数据隐私':667,898 '新客服需完成':1277 '新故障类型':1783 '新故障类型覆盖率':1706 '方案':362,582,835,1136,1538 '方案并收集':283 '无':395,468,1618,1748 '无写操作能力':1648 '无写权限':1608,1726,1825 '无历史相似案例':1595 '无法触发任何写操作':1511 '无自动执行能力':1653 '无越权':415 '无越权访问生产数据库':1509 '无越权读取':1231 '无越权读取非关联订单':1104 '无越权调用':345 '无重大事故':953 '无重大误诊事故':854 '无错误归因':412 '无需人工干预':614 '日均12起':602 '日志审计':331 '日志摘要':1455,1516,1601,1624,1775 '日志摘要可用率':1499 '日志智能摘要':1417 '日志解释88':340 '时仅展示原始信号不给建议':1472 '时只展示':1078 '时必须人工确认':329 '时必须医生确认':801 '时效承诺':1274 '时效承诺等高风险节点自动升级至主管审批':1039 '时效承诺节点自动标记为高风险':1074 '明确ai辅助':869 '明确三个区域':172 '明确为值班副驾驶模式':1453 '明确为建议模式':1058 '明确只做分诊建议':322 '明确只做建议':419 '明确的放行或拒绝决定':264 '明确禁止':1477,1632 '明确禁止的功能':403 '明确辅助定位':946 '是否允许系统进入真实执行链路的组织级决定':104 '是否可能泄露敏感信息':217 '是否存在幻觉':213 '是否存在越权读取':218 '是否有工程师绕过确认直接执行':449 '是否有工程师绕过确认直接按建议执行':1703 '是否有未识别的误归因':1699 '是否有未识别的错误归因':448 '是否满足':338,558,810,1090,1495 '是否能复盘输入':237 '是审计放行的关键机制':162 '智能运维值班助手投产检查':1411 '暂停规则检索能力':1307 '更新归因知识库':1782 '最严格':927 '最保守':957 '最终人工处理结果':494 '最终发送':1252 '最终处置':1489,1669 '最终结果':242 '最高标准':935 '月度统计':979 '服务升级链清晰':1255 '服务升级链设计有效':1193 '服务经验复利需持续运营':1404 '服务经验沉淀':1365 '未经验证的新场景':184 '未聚合关键信号':1466 '未造成生产影响':1590 '未造成用户投诉':1179 '未造成误判':375 '权限':52 '权限边界':149 '条件':193 '条件放行':438,479,676,726,1264,1353,1682,1761 '某互联网公司的':1413 '标记导致升级过多或过少':1294 '标识':443,931 '样本':48 '样本测试':145 '核心概念':94 '核心能力包括多源告警聚合':1416 '核心能力包括意图理解':1029 '案例召回':1456,1501,1518,1602 '案例召回75':342 '案例召回为空的频率':1707 '案例召回偏差':1467 '案例召回命中率':1777 '案例召回和归因建议均需工程师确认后采纳':1625 '检查系统设计是否清晰定义了能力范围':42 '检查结果':407,626,654,858,891,1222,1637 '检查项':318,534,786,1054,1449 '检索':1249 '模型可解释性':655 '模型异常时切换规则引擎':689 '模型版本':239 '模型监控':551 '模型防投毒':633 '模型防攻击测试通过':566 '模型预测分布异常':757 '模式':1422 '次':1558 '次上下文丢失':1181 '次故障':1741 '次案例召回为空':1592 '次漏标':1158 '次真实故障都有记录':1440 '次真实线上故障':1544 '次自动执行操作':1582 '次规则检索偏差':1177 '次误归因':1586 '次误操作':1743 '次误标':1156 '次错误承诺':1174,1335 '欺诈损失率':598 '欺诈识别率':560,729 '欺诈识别率维持':682 '每周':1373,1791 '每周复盘':1781 '每周审查并更新规则':1369 '每周审查误判案例':496 '每周审计':738 '每季度':1378,1795 '每季度多科室效果对比':937 '每日同步至知识库':1367 '每日检测':736 '每月':1376,1793 '每月临床质量评估':936 '每月分析升级数据':1371 '每月回灌为新案例模板':1787 '每月评估是否需调整边界':497 '每次故障的输入':490 '每笔交易评分原因可查':645 '每笔评分附带top5特征':751 '治理机制':137,330,550,802,1081,1480 '治疗方案':965 '治疗方案建议':886 '沿错误方向排查':1464 '注入':221 '注入防护':1234 '注入防护通过':1103 '流程明确':430 '流量放大后是否失稳':234 '涉及合规或安全红线的操作':185 '涉及敏感操作':180 '涉及退款':1037 '渗透测试':54,151 '满意度回灌':1085 '满足':343,572,824,1121,1523 '漏告警':1465 '漏杀':544 '物流查询':1188,1341 '物流状态查询':1204 '特别说明':769 '特异性':978 '特征工程':714 '特征漂移':735 '特征漂移三类失败':545 '特征漂移监控':686 '特征监控':552 '特征防泄露':634 '特殊政策':1127 '状态':319,535,787,1055,1450 '独立诊断':885,964 '现在需要审计放行':1048 '现在需要正式审计放行':1441 '理解':1689,1828 '理解ai建议的局限性':519 '生产环境操作':1473 '生产要求':266,480,727,971,1354,1762 '生产要求下发':124 '生成候选回复供人工客服确认后发送':1036 '用户提供系统构建方案':11 '用户满意度':1289,1363 '用户输入':308,527,780,1041,1432 '电商平台':1024 '病例':911 '病灶标记辅助':878 '病灶识别auc':812 '的价值在于':168 '的效率对比看板':1836 '的证据摘要':255 '监控体系就绪':197 '监控体系缺失':206 '监控告警':332 '监控指标和回滚方案':88 '监控是否因':1292 '监管合规问题':758,999 '直接拦截':620,720 '直接面向用户自动回复':1215,1347 '相似故障案例召回':1418 '看什么':383,1598 '看能不能从':1442 '知情同意':866 '知识库过期':1306 '确认':883 '示例':300,301 '示例2':522 '示例3':775 '示例4':1020 '示例5':1409 '禁用区':182,260,400,472,619,719,884,963,1214,1346,1626,1752 '科室医生完成专项培训':973 '稳定性':156 '立即下线该场景能力':1304 '立即暂停系统使用':1002 '符合gdpr':668 '符合金融监管要求':648 '第17章':26 '第一步':127 '第三步':157 '第二意见':791 '第二步':141 '第五步':186 '第四步':170 '类失败':1065,1462 '系统':987,1315 '系统不执行任何自动动作':396,1619 '系统信心度不足的场景':181 '系统发现专家遗漏':844 '系统可以独立完成的任务':174 '系统在':382,385,1597,1603 '系统在真实环境中运行':163 '系统在高频重复问题上效果显著':1187 '系统审计放行':303 '系统已完成构建':1028 '系统已开发完成':311 '系统延迟导致值班效率下降':1804 '系统延迟异常':1714 '系统建议采纳率':368,1550 '系统当前适用于':1400 '系统无写权限':1583 '系统无权执行':622 '系统无生产环境写权限':1633 '系统构建已完成':32 '系统正确提示':1594 '系统永远不输出':887 '系统能做什么':131 '系统自动生成故障摘要':1579 '系统设计为':1033,1420 '系统设计是否清晰地定义了':129 '系统评分与人工规则对比':588 '系统识别新增风险':591 '系统辅助':379,1163,1169,1567,1572,1577 '级':1548,1588 '级故障':1561,1702 '级生产事故':1801 '级要求':1769 '纯人工':377,1161,1166,1565,1570,1575 '纯人工值班':1835 '纯建议模式':1749 '纳入案例库':1784 '经复核确认':846 '经过':1426 '经验沉淀机制':1779 '结果':59,337,557,809,1089,1494 '结果直接展示给客服':1206 '维持':1282 '置信度':327,799,1076,1470 '置信度不足三类':797 '置信度校准到位':630 '而不是单点结果':113 '而非依赖个人经验':1839 '聚合':1484,1664,1729 '能力范围':130 '能力范围定义':321,537,789,1057,1452 '能力评估':144,339,559,811,1091,1496 '自主承诺退款赔付':1216,1348 '自动修复':401,473,1627,1753 '自动切流':475,1630,1756 '自动回滚':1631,1757 '自动处置':517 '自动客服':1403 '自动执行':275 '自动执行区':173,258,394,467,611,712,876,958,1200,1337,1617,1747 '自动执行审计放行流程':13 '自动扩容':1629,1755 '自动拒绝':722 '自动脱敏':1108 '自动运维':1823 '自动重启':402,474,1628,1754 '若突增则可能知识库已过期':1288 '范围':392,609,874,1198,1615 '行为监控':1704 '覆盖量':1140 '规则检索':1031,1203,1340 '规则检索偏差':1068 '规则检索命中':1096 '规则检索和升级路由都已打通':1047 '角色责任是否清晰':245 '触发':1479 '触发条件':499,755,994,1381,1798 '订单查询':1030,1046,1202,1339 '订单查询准确':1094 '订单查询超时':1067 '设计':252,281 '设计并运行':63 '设计有效':1584 '设计证据':14,115,128,459,697,945,1317,1724 '设计证据收集':41,317,533,785,1053,1448 '访问控制到位':899 '证据':17,118,159,285,320,536,788,1056,1451 '证据和放行条件压缩到同一套判断机制中的阶段':99 '证据收集':62,359,579,832,1133,1535 '证据链':108 '证据链中断':203 '证据链汇总':251,458,696,944,1316,1723 '证明系统在真实数据上的表现':166 '评估':110,253 '评估归因准确率趋势和案例库覆盖度':1794 '评估类型':336,556,808,1088,1493 '评估结果是否充分':143 '评估规则库覆盖度和候选回复质量':1377 '评估证据':15,116,142,461,700,947,1321,1728 '评估证据收集':46,335,555,807,1087,1492 '评分与决策分离':637,699 '识别率':703 '诊断责任归医生':870 '误判导致生产事故':500 '误判率':484 '误归因':1463 '误归因导致':1799 '误归因数':1556 '误归因案例':1780 '误归因率':1640,1766 '误报':705 '误报增量':594 '误报率':562,731 '误报率维持':684 '误杀投诉':601 '误杀投诉处理时效':773 '误杀激增时启动白名单机制':691 '误杀率超过15':756 '误杀申诉':665 '误标案例':1375 '误诊':796 '误诊事故':996 '说明缺失条件和补充要求':93 '责任清晰':429 '责任界定':805,868,986 '质控委员会':984 '质控委员会建立':975 '质控流程':804 '赔付':1038,1073,1273 '超出系统能力范围的任务':183 '越权调用':219 '转入正式值班辅助':1444 '轮时出现':1184 '辅助值班':1833 '辅助判断':515 '辅助参考价值率':370,1553 '辅助定位规则':1192 '输入':1247,1483 '输出':491 '输出全记录':913 '输出放行方案':21,84,299 '输出物':248 '输出结果':453,692,940,1309,1718 '边界':49 '边界不清晰':204 '边界条件':135,326,546,798,1071,1469 '边界条件和治理机制':44 '边界测试':146,353,1524 '边界清晰':1320 '达标':356,564,816,1100,1130,1507,1532 '运行后':1430 '运行周期':363,583,836,1137,1539 '连续证据链完整':194 '迭代优化':1018 '退换货流程':1189 '退款':1072,1272 '通会话':1333 '通真实客服会话':1143 '通知值班团队':508 '通知值班团队切换纯人工模式':1813 '通知客服团队切换纯人工模式':1394 '通知所有使用科室':1004 '通知风控团队':764 '通过':347,352,462,567,576,701,819,829,1109,1512 '通过二类医疗器械认证':860 '通过医疗器械软件安全测试':818 '采纳率':482 '采纳率55':465 '采纳率持续低于40':501 '采纳率是否维持':446,1696 '重启':1474 '重大漏诊':995 '重点审查误归因链路':1816 '重点监控':1700 '重试策略是否可控':233 '金融场景':652 '金融风控反欺诈系统':695 '金融风控反欺诈系统审计放行':523 '金融风控反欺诈系统已完成构建':525 '错误归因或不一致输出':214 '错误归因数':372 '错误承诺导致用户投诉或赔付损失':1382 '长会话':1182 '长尾测试':50,147 '长期目标':1837 '阅片时间':850 '阈值':268 '阶段已经跑了':1436 '降至0.08':600 '需定期模型更新':771 '需审计决定是否可投入临床辅助使用':779 '需审计决定是否可投入生产环境进行实时交易风险评估':526 '需要判断能否进入生产环境':33 '需要审计放行':529 '需要审计是否可进入生产环境':307 '需要建立审计放行的证据链和决策机制':34 '需要设计':35 '需要进行审计放行':313 '非方向性修改':1150 '非诊断结论':793 '预后判断':966 '风险':98 '风险事件':1172,1580 '风险场景测试':1122 '风险提示':513,1011,1399,1819 '风险等级':408,627,892,1223,1638 '风险评分仅作辅助参考':678 '风险评分计算':612,713 '首响':1111 '首响时间':1160,1360 '验证系统在真实环境中的表现':38 '高峰流量期需关注成本和延迟波动':1408 '高约束设计是本系统的核心安全机制':1824 '高约束设计有效避免了错误放大':388,1607 '高风险100':663 '高风险交易':547,616,717,740 '高风险交易人工复核率':604 '高风险任务':179 '高风险承诺':1069 '高风险标记':1326,1344 '高风险标记供参考但最终由客服':1212 '高风险标记准确率':1153,1227,1358 '高风险标记漏标率':1284 '高风险标记漏标率持续':1383 '高风险标记触发率':1151 '高风险节点':1271 '高风险节点全部拦截成功':1175 '高风险节点强制升级':1238 '高风险节点拦截无遗漏':1194 '高风险话题标记':1209 '鲁棒性':825 '鲁棒性验证通过':894","prices":[{"id":"1f2dbcf8-2f8f-435a-8eeb-527cb6bceae2","listingId":"bc15a664-8fc0-4b78-82bf-b50790c0bff9","amountUsd":"0","unit":"free","nativeCurrency":null,"nativeAmount":null,"chain":null,"payTo":null,"paymentMethod":"skill-free","isPrimary":true,"details":{"org":"gmaxxxie","category":"ai-native-product-agent-skills","install_from":"skills.sh"},"createdAt":"2026-05-01T01:02:49.090Z"}],"sources":[{"listingId":"bc15a664-8fc0-4b78-82bf-b50790c0bff9","source":"github","sourceId":"gmaxxxie/ai-native-product-agent-skills/ai-native-audit-release","sourceUrl":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/ai-native-audit-release","isPrimary":false,"firstSeenAt":"2026-05-01T01:02:49.090Z","lastSeenAt":"2026-05-18T18:57:23.401Z"}],"details":{"listingId":"bc15a664-8fc0-4b78-82bf-b50790c0bff9","quickStartSnippet":null,"exampleRequest":null,"exampleResponse":null,"schema":null,"openapiUrl":null,"agentsTxtUrl":null,"citations":[],"useCases":[],"bestFor":[],"notFor":[],"kindDetails":{"org":"gmaxxxie","slug":"ai-native-audit-release","github":{"repo":"gmaxxxie/ai-native-product-agent-skills","stars":56,"topics":["agent-skills","ai-agent","ai-native","ai-product","methodology","product-management","product-methodology","product-thinking","skills"],"license":null,"html_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills","pushed_at":"2026-05-06T07:19:36Z","description":"AI Native Product Methodology — 80 executable skills across P0-P14 stages, covering needs discovery to aesthetic authority. From 8 books.","skill_md_sha":"5b2ed866123199b17044a31a4367dac6edf7bc7a","skill_md_path":"skills/ai-native-audit-release/SKILL.md","default_branch":"main","skill_tree_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/ai-native-audit-release"},"layout":"multi","source":"github","category":"ai-native-product-agent-skills","frontmatter":{"name":"ai-native-audit-release","description":"AI Native 产品方法论——审计放行阶段的实操 Skill。\n用户提供系统构建方案，Skill 自动执行审计放行流程：\n设计证据 → 评估证据 → Shadow 证据 → 放行边界判断 → go/no-go 决策 → 输出放行方案。\n基于《AI Native 产品方法论》第17章。"},"skills_sh_url":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/ai-native-audit-release"},"updatedAt":"2026-05-18T18:57:23.401Z"}}