{"id":"2b4e32a4-5dea-42ab-8eae-3650eb1c485e","shortId":"cDqpuV","kind":"skill","title":"p2e-shadow-validation","tagline":"'AI Native 产品方法论——影子验证的实操 Skill。","description":"# 影子验证 Skill\n\n## 使用场景\n\n- 收敛决策已完成，需要在真实环境中验证系统是否具备进入工程化的条件\n- 离线实验效果良好，但不确定真实流量下表现是否一致\n- 需要为审计放行准备真实的、可量化的证据\n\n## 核心概念\n\n- **影子验证（Shadow Validation）**：让 AI 在真实场景中并行运行，但暂不直接接管业务结果\n- **影子系统（Shadow System）**：承载这种验证方式的系统形态，与人工流程并行存在\n- **离线评估**：在样本集上检验能力边界\n- **灰度上线**：让系统在有限真实范围内直接影响业务结果\n\n## 影子验证 vs 其他验证方式\n\n| 验证方式 | 真实性 | 风险 | 证据质量 | 适用阶段 |\n|---------|--------|------|---------|---------|\n| 离线评估 | 最低 | 无 | 中（样本偏差） | 能力实验 |\n| 影子验证 | 中 | 低 | 高（真实流量） | 放行前验证 |\n| 灰度上线 | 高 | 中 | 最高 | 生产运行 |\n\n## 影子验证流程\n\n```\n收敛决策通过\n  → 影子系统设计\n    → 并行运行方案\n      → 人工对比机制\n        → 失败模式沉淀\n          → 审计放行证据\n            → 灰度上线 / 继续影子验证\n```\n\n## 第一步：影子系统设计\n\n影子系统的核心设计原则：\n\n1. **输出可见但不执行**：AI 给出建议，但业务动作仍由人工执行\n2. **完整记录**：每次 AI 输出都记录，包括输入、上下文、置信度、人工对比结果\n3. **可开关**：发现重大问题时能快速切换到纯人工模式\n\n### 影子系统架构\n\n```yaml\n真实工单进入\n  → 人工流程（正常执行）\n    → 影子系统（并行生成建议）\n      → 建议存储（不外发）\n        → 周度人工对比\n          → 失败模式沉淀\n            → 系统优化\n```\n\n## 第二步：并行运行方案\n\n运行参数设计：\n\n| 参数 | 设计 | 理由 |\n|------|------|------|\n| 并行比例 | 从5%开始，逐步扩到50% | 控制初期风险 |\n| 场景筛选 | 先从低风险场景开始 | 避免高风险场景先行暴雷 |\n| 扩量节奏 | 采纳率连续2周>60%再扩 | 确保质量稳定后再放量 |\n| 熔断机制 | 连续3次高风险误判自动暂停 | 防止持续出错 |\n\n## 第三步：人工对比机制\n\n每周人工对比：\n\n- 随机抽取影子系统建议（≥50条）\n- 人工标注：正确 / 可接受 / 错误 / 风险误判\n- 计算采纳率、错误率、风险漏过率\n\n## 第四步：失败模式沉淀\n\n每次对比后沉淀失败案例：\n\n| 失败类型 | 数量 | 占比 | 根因 | 改进方向 |\n|---------|------|------|------|---------|\n| 上下文丢失 | 12 | 24% | 会话状态未保留 | 补充记忆系统 |\n| 风险漏过 | 5 | 10% | 边界规则不完善 | 收紧风险规则 |\n| 知识缺失 | 8 | 16% | 知识库覆盖不足 | 补充知识库 |\n\n## 第五步：审计放行证据准备\n\n影子验证报告需包含：\n\n1. **运行概况**：并行时长、工单量、场景分布\n2. **质量指标**：采纳率、错误率、风险漏过率\n3. **失败模式分析**：Top失败类型及根因\n4. **与离线评估对比**：是否出现离线未发现的问题\n5. **放行建议**：是否具备进入工程化/灰度上线条件\n\n## 输出物：影子验证报告\n\n1. **影子系统配置**：并行比例、场景选择、熔断规则\n2. **质量趋势图**：采纳率、错误率随时间的变化\n3. **失败模式报告**：Top问题、根因和改进建议\n4. **审计放行证据包**：符合 @ai-native-audit-release 输入要求的完整证据\n\n## 与其他 Skill 的关系\n\n- **前置**：@p2d-convergence-decision（收敛决策通过）\n- **后置**：@ai-native-audit-release（审计放行输入）、@ai-native-system-building（通过后进入工程化）\n- **协同**：@ai-native-production-ops（生产环境准备）\n\n## 示例\n\n### 用户输入\n\"客服 Copilot 收敛决策通过，准备进入影子验证\"\n\n### Skill 执行\n\n```yaml\n影子系统设计:\n  架构: 侧边栏建议面板（不外发）\n  记录: 每次建议+人工对比+采纳标记\n  熔断: 连续3次赔付类误判自动暂停\n\n并行运行方案:\n  第1周: 5%工单（低风险场景：订单查询）\n  第2周: 20%工单（+物流解释）\n  第3周: 50%工单（全场景）\n  扩量条件: 采纳率连续2周>65%\n\n人工对比（第1周结果）:\n  样本: 60条\n  采纳率: 68%\n  错误率: 12%（主要：上下文丢失）\n  风险漏过率: 5%（主要：退款承诺）\n\n失败模式:\n  Top1: 多轮上下文丢失（35%）→ 补充会话状态设计\n  Top2: 退款承诺误判（25%）→ 增加规则拦截\n  Top3: 知识库缺失（20%）→ 补充200条FAQ\n\n审计放行证据:\n  ✅ 采纳率68% > 60%阈值\n  ⚠️ 风险漏过率5%（需强化规则后再放行高风险场景）\n  建议: 低风险场景先行灰度，高风险场景继续影子\n```\n\n---\n\n## 深入核心概念\n\n基于书稿第10章，以下概念在执行本 Skill 时需深入理解：\n\n- **影子系统是真实环境验证机制**：AI 产品最常见的问题是离线实验看起来成立，但进入真实环境效果波动。原因是真实用户请求、真实业务数据、真实流程边界和真实异常情况远比实验集复杂。影子系统与生产系统并行运行，接收真实请求但不直接返回结果给用户，因此能在不影响用户体验的前提下验证 AI 在真实环境中的表现。\n- **影子系统在方法论中的位置**：影子系统不是主循环中的独立阶段，而是试验展开通往系统构建/审计放行/生产运行的关键桥梁。它帮助回答两个实际问题：实验里的能力能否扛住真实流量，系统准备上线前还有哪些隐性风险。\n- **四类价值**：① 用真实数据验证 AI 能力（而非只看离线样本）；② 在系统构建阶段提前暴露稳定性、性能和边界问题；③ 在审计放行阶段持续观察幻觉、越权、错误调用和风险输出；④ 在正式上线前为生产运行建立更稳的信心和评估依据。\n- **双轨并行结构**：用户请求同时进入生产系统（返回实际响应）和影子系统（生成影子结果）。第二条链路不直接影响用户，但为团队提供能力评估、差异比较、模型优化、流程修正和风险发现的依据。\n- **工程实现核心**：常见方式是流量复制或事件镜像（API Gateway、消息队列、事件流等）。关键不在于\"复制到哪里\"，而在于如何记录结果差异、如何定义评估指标、如何防止影子链路反向影响生产链路。\n\n## 分步执行指南\n\n基于书稿方法论，本 Skill 的完整执行分为 6 步：\n\n### 步骤 1：影子系统设计\n- 设计三条核心原则：输出可见但不执行（AI 给建议，业务动作仍由人工执行）、完整记录（每次 AI 输出都记录输入/上下文/置信度/人工对比结果）、可开关（发现重大问题时能快速切到纯人工模式）\n- 设计影子系统架构：真实请求 → 人工流程（正常执行）+ 影子系统（并行生成建议）→ 建议存储 → 周度人工对比 → 失败模式沉淀 → 系统优化\n- 确保影子链路不会反向影响生产链路\n\n### 步骤 2：并行运行参数设计\n- 并行比例：从 5% 开始，逐步扩到 50%（控制初期风险）\n- 场景筛选：先从低风险场景开始（避免高风险场景先行暴雷）\n- 扩量节奏：采纳率连续 2 周 > 60% 再扩（确保质量稳定后再放量）\n- 熔断机制：连续 3 次高风险误判自动暂停（防止持续出错）\n\n### 步骤 3：人工对比机制建立\n- 每周人工对比：随机抽取影子系统建议（≥ 50 条）\n- 人工标注四类：正确 / 可接受 / 错误 / 风险误判\n- 计算三个核心指标：采纳率、错误率、风险漏过率\n- 对比结果与离线评估：是否出现离线未发现的新问题\n\n### 步骤 4：失败模式沉淀与分析\n- 每次对比后沉淀失败案例，按类型分类：上下文丢失、风险漏过、知识缺失、幻觉输出、权限越界等\n- 分析每类失败的根因和占比\n- 制定改进方向：补充记忆系统、收紧风险规则、补充知识库、增加输出过滤等\n- 将失败模式反馈到系统优化循环\n\n### 步骤 5：审计放行证据准备\n- 整理影子验证报告：运行概况（并行时长、工单量、场景分布）、质量指标（采纳率、错误率、风险漏过率）、失败模式分析（Top 问题及根因）、与离线评估对比、放行建议\n- 确保证据包符合审计放行输入要求\n- 明确哪些场景可以进入灰度，哪些需要继续影子验证\n\n### 步骤 6：放行决策\n- 低风险场景：质量指标达标 → 灰度上线\n- 高风险场景：质量指标未完全达标 → 继续影子验证\n- 全场景：质量指标全面达标 → 进入系统构建/正式上线\n- 输出影子验证报告和放行决策\n\n## 示例一：客服 Copilot 影子验证\n\n### 用户输入\n\"客服 Copilot 收敛决策通过，准备进入影子验证。已确定低风险场景（订单查询）和高风险场景（退款赔付）。\"\n\n### Skill 执行\n\n```yaml\n影子系统设计:\n  架构:\n    生产链路: 真实工单 → 客服正常处理 → 回复客户\n    影子链路: 同一工单 → AI 生成建议 → 建议存储（不外发）\n  三条原则:\n    输出可见不执行: AI 建议仅在客服侧边栏显示，不自动发送\n    完整记录: 每次建议记录输入上下文、AI输出、置信度、客服是否采纳\n    可开关: 管理后台一键暂停影子系统\n  熔断规则:\n    连续 3 次赔付类误判 → 暂停该场景\n    风险漏过率 > 10% → 暂停全场景，人工排查\n\n并行运行方案:\n  第 1 周:\n    并行比例: 5% 工单（约 25 条/天）\n    场景: 仅低风险（订单查询、物流状态）\n    目标: 验证基础流程是否通畅\n  第 2 周:\n    并行比例: 20% 工单（约 100 条/天）\n    场景: +物流解释、FAQ 回复\n    扩量条件: 第 1 周采纳率 > 60%\n  第 3 周:\n    并行比例: 50% 工单（约 250 条/天）\n    场景: 全场景（含售后政策）\n    扩量条件: 第 2 周采纳率 > 60% 且风险漏过率 < 5%\n  第 4 周:\n    并行比例: 50%（维持）\n    场景: 全场景\n    目标: 稳定运行，准备放行决策\n\n人工对比（周度执行）:\n  第 1 周结果:\n    样本: 60 条\n    正确: 41 条（68%）\n    可接受: 10 条（17%）\n    错误: 7 条（12%）\n    风险误判: 2 条（3%）\n    采纳率: 68%\n    风险漏过率: 3%\n\n  第 2 周结果:\n    样本: 120 条\n    正确: 78 条（65%）\n    可接受: 22 条（18%）\n    错误: 14 条（12%）\n    风险误判: 6 条（5%）\n    采纳率: 65%\n    风险漏过率: 5%\n\n失败模式分析:\n  Top 1: 多轮上下文丢失（占比 35%）\n    现象: 超过 3 轮对话后 AI 忘记前文\n    根因: 会话状态未保留到影子系统\n    改进: 补充会话记忆模块\n  Top 2: 退款承诺误判（占比 25%）\n    现象: AI 建议的退款金额超出政策允许范围\n    根因: 退款规则边界不清晰\n    改进: 增加退款规则硬编码拦截\n  Top 3: 知识库缺失（占比 20%）\n    现象: 特定品类的售后政策 AI 无法回答\n    根因: 该品类 FAQ 尚未入库\n    改进: 补充 200 条品类 FAQ\n  Top 4: 情绪误判（占比 12%）\n    率象: 客户已明显不满但 AI 未标记情绪风险\n    根因: 情绪检测模型未集成\n    改进: 集成情绪检测作为辅助信号\n  Top 5: 格式问题（占比 8%）\n    现象: AI 回复格式不统一\n    根因: 输出模板未强制\n    改进: 增加输出格式校验\n\n与离线评估对比:\n  离线准确率: 88%\n  影子准确率: 83%（下降 5%）\n  新发现问题: 多轮上下文丢失（离线未测试）、情绪场景（离线样本不足）\n  结论: 影子验证发现了离线评估未覆盖的问题，验证了影子机制的必要性\n\n审计放行证据:\n  运行概况:\n    并行时长: 4 周\n    总工单量: 约 2,800 条\n    场景分布: 订单查询 40%、物流 25%、售后 20%、其他 15%\n  质量指标:\n    采纳率: 66%（> 60% 阈值 ✅）\n    错误率: 12%（< 15% 阈值 ✅）\n    风险漏过率: 4.5%（< 5% 阈值 ✅）\n  放行建议:\n    ✅ 低风险场景（订单查询、物流状态）: 达标，可进入灰度上线\n    ⚠️ 中风险场景（售后政策）: 基本达标，建议灰度后继续观察\n    ❌ 高风险场景（退款赔付）: 风险漏过仍存在，继续影子验证\n  后续计划:\n    灰度上线: 低风险场景先行，10% → 30% → 50% 逐步放量\n    继续影子: 高风险场景（退款赔付）再验证 2 周\n    系统优化: 会话记忆+退款规则拦截+品类FAQ补充（优先级从高到低）\n```\n\n## 示例二：AI 文档审核影子验证（对比案例）\n\n### 用户输入\n\"文档审核收敛决策通过，条款提取和批量初筛两个方向进入影子验证。审核对象是合同文档。\"\n\n### Skill 执行\n\n```yaml\n影子系统设计:\n  架构:\n    生产链路: 法务上传合同 → 人工审核 → 出具审核意见\n    影子链路: 同一合同 → AI 提取条款+初筛分级 → 结果存储（不外发）\n  三条原则:\n    输出可见不执行: AI 结果在审核面板显示，不替代人工审核\n    完整记录: 每次提取记录输入文档、AI输出、置信度、法务对比结果\n    可开关: 法务主管可一键暂停\n  熔断规则:\n    条款提取遗漏率 > 10% → 暂停该合同类型\n    分级错误率 > 15% → 暂停自动分级\n\n并行运行方案:\n  第 1 周:\n    并行比例: 10% 合同（约 15 份/天）\n    场景: 标准采购合同（模板化程度高）\n    目标: 验证条款提取准确率\n  第 2 周:\n    并行比例: 25% 合同\n    场景: +服务合同、租赁合同\n    扩量条件: 第 1 周提取准确率 > 88%\n  第 3 周:\n    并行比例: 50% 合同\n    场景: 全类型合同\n    目标: 验证批量初筛分级效果\n  第 4 周:\n    并行比例: 50%（维持）\n    场景: 全类型\n    目标: 稳定运行，准备放行决策\n\n人工对比（周度执行）:\n  第 1 周结果:\n    样本: 40 份合同\n    条款提取:\n      正确: 36 份（90%）\n      部分遗漏: 3 份（7.5%）\n      严重遗漏: 1 份（2.5%）\n    初筛分级:\n      正确分级: 34 份（85%）\n      错误分级: 6 份（15%）\n    法务采纳率: 72%（用于辅助参考）\n\n  第 2 周结果:\n    样本: 80 份合同\n    条款提取准确率: 87%（非标合同比标准合同低 5%）\n    初筛分级准确率: 83%\n    法务采纳率: 68%\n\n失败模式分析:\n  Top 1: 非标条款遗漏（占比 40%）\n    现象: 非标准模板合同中的特殊条款被遗漏\n    根因: 训练样本以标准合同为主，非标样本不足\n    改进: 补充 100 份非标合同样本\n  Top 2: 跨页条款断裂（占比 25%）\n    现象: 跨页的长条款被截断，只提取了部分内容\n    根因: 文档解析未处理跨页连贯性\n    改进: 优化文档解析器，增加跨页合并逻辑\n  Top 3: 分级标准偏差（占比 20%）\n    现象: 高风险合同被分为中风险\n    根因: 分级阈值需调整\n    改进: 收紧高风险判定阈值\n  Top 4: 格式识别错误（占比 15%）\n    现象: 表格中的条款未被正确识别\n    根因: 表格解析能力不足\n    改进: 增强表格解析模块\n\n审计放行证据:\n  运行概况:\n    并行时长: 4 周\n    总合同量: 约 650 份\n    合同类型: 采购 45%、服务 30%、租赁 15%、其他 10%\n  质量指标:\n    条款提取准确率: 88%（> 85% 阈值 ✅）\n    初筛分级准确率: 84%（> 80% 阈值 ✅）\n    法务采纳率: 70%（> 65% 阈值 ✅）\n    条款遗漏率: 5%（< 8% 阈值 ✅）\n  放行建议:\n    ✅ 标准采购合同: 条款提取和初筛均达标，可进入灰度\n    ⚠️ 服务合同: 基本达标，灰度后继续观察\n    ⚠️ 租赁合同: 样本量偏少，继续影子验证 2 周\n    ❌ 非标合同: 准确率不足，继续影子验证\n  后续计划:\n    灰度上线: 标准采购合同先行，逐步扩展到服务合同\n    继续影子: 租赁合同+非标合同再验证\n    系统优化: 非标合同样本补充+跨页合并+表格解析增强+分级阈值调整\n```","tags":["p2e","shadow","validation","native","product","agent","skills","gmaxxxie","agent-skills","ai-agent","ai-native","ai-product"],"capabilities":["skill","source-gmaxxxie","skill-p2e-shadow-validation","topic-agent-skills","topic-ai-agent","topic-ai-native","topic-ai-product","topic-methodology","topic-product-management","topic-product-methodology","topic-product-thinking","topic-skills"],"categories":["ai-native-product-agent-skills"],"synonyms":[],"warnings":[],"endpointUrl":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/p2e-shadow-validation","protocol":"skill","transport":"skills-sh","auth":{"type":"none","details":{"cli":"npx skills add gmaxxxie/ai-native-product-agent-skills","source_repo":"https://github.com/gmaxxxie/ai-native-product-agent-skills","install_from":"skills.sh"}},"qualityScore":"0.478","qualityRationale":"deterministic score 0.48 from registry signals: · indexed on github topic:agent-skills · 56 github stars · SKILL.md body (7,541 chars)","verified":false,"liveness":"unknown","lastLivenessCheck":null,"agentReviews":{"count":0,"score_avg":null,"cost_usd_avg":null,"success_rate":null,"latency_p50_ms":null,"narrative_summary":null,"summary_updated_at":null},"enrichmentModel":"deterministic:skill-github:v1","enrichmentVersion":1,"enrichedAt":"2026-05-18T18:57:32.681Z","embedding":null,"createdAt":"2026-05-01T01:03:00.124Z","updatedAt":"2026-05-18T18:57:32.681Z","lastSeenAt":"2026-05-18T18:57:32.681Z","tsv":"'1':73,163,185,373,545,576,613,666,859,884,911,926,957 '10':152,540,623,799,852,862,1022 '100':567,968 '12':146,279,629,655,714,775 '120':642 '14':653 '15':768,776,855,865,937,998,1020 '16':157 '17':625 '18':651 '2':78,168,190,401,415,561,594,631,639,681,757,807,874,942,971,1050 '2.5':928 '20':262,297,564,696,766,987 '200':707 '22':649 '24':147 '25':293,551,684,764,877,974 '250':586 '3':87,173,194,422,426,536,580,633,637,672,693,888,922,984 '30':800,1018 '34':931 '35':289,669 '36':918 '4':176,198,444,600,711,753,898,995,1008 '4.5':779 '40':762,914,960 '41':619 '45':1016 '5':151,179,257,283,405,461,548,598,659,663,724,741,780,950,1037 '50':266,408,430,583,603,801,891,901 '50条':128 '6':370,481,657,935 '60':118,301,417,578,596,616,772 '60条':275 '65':271,647,661,1034 '650':1012 '66':771 '68':277,621,635,954 '7':627 '7.5':924 '70':1033 '72':939 '78':645 '8':156,727,1038 '80':945,1030 '800':758 '83':739,952 '84':1029 '85':933,1026 '87':948 '88':737,886,1025 '90':920 'ai':5,24,75,81,202,218,224,231,314,323,335,377,382,518,524,674,686,699,717,729,815,833,840 'ai-native-audit-releas':201,217 'ai-native-production-op':230 'ai-native-system-build':223 'ai输出':529,845 'api':356 'audit':204,220 'build':227 'converg':213 'copilot':239,496,500 'decis':214 'faq':572,703,709 'gateway':357 'nativ':6,203,219,225,232 'op':234 'p2d':212 'p2d-convergence-decision':211 'p2e':2 'p2e-shadow-validation':1 'product':233 'releas':205,221 'shadow':3,21,28 'skill':9,11,208,242,311,368,507,822 'skill-p2e-shadow-validation' 'source-gmaxxxie' 'system':29,226 'top':473,665,680,692,710,723,956,970,983,994 'top1':287 'top2':291 'top3':295 'topic-agent-skills' 'topic-ai-agent' 'topic-ai-native' 'topic-ai-product' 'topic-methodology' 'topic-product-management' 'topic-product-methodology' 'topic-product-thinking' 'topic-skills' 'top失败类型及根因':175 'top问题':196 'valid':4,22 'vs':37 'yaml':91,244,509,824 '三条原则':522,838 '上下文':84,384 '上下文丢失':145,281,448 '下降':740 '不外发':98,248,521,837 '不替代人工审核':842 '不自动发送':526 '与人工流程并行存在':31 '与其他':207 '与离线评估对比':177,475,735 '且风险漏过率':597 '业务动作仍由人工执行':379 '严重遗漏':925 '中':47,51,58 '中风险场景':788 '主要':280,284 '事件流等':359 '产品方法论':7 '产品最常见的问题是离线实验看起来成立':315 '人工审核':829 '人工对比':251,272,610,908 '人工对比机制':65,125 '人工对比机制建立':427 '人工对比结果':86,386 '人工排查':542 '人工标注':129 '人工标注四类':432 '人工流程':93,391 '仅低风险':555 '从':404 '从5':109 '以下概念在执行本':310 '份':866,919,923,927,932,936,1013 '份合同':915,946 '份非标合同样本':969 '优先级从高到低':813 '优化文档解析器':981 '会话状态未保留':148 '会话状态未保留到影子系统':677 '会话记忆':810 '但不确定真实流量下表现是否一致':16 '但业务动作仍由人工执行':77 '但为团队提供能力评估':350 '但暂不直接接管业务结果':26 '但进入真实环境效果波动':316 '低':52 '低风险场景':259,483,783 '低风险场景先行':798 '低风险场景先行灰度':306 '使用场景':12 '侧边栏建议面板':247 '先从低风险场景开始':114,411 '全场景':268,489,590,606 '全类型':904 '全类型合同':894 '关键不在于':360 '其他':767,1021 '其他验证方式':38 '再扩':119,418 '再验证':806 '准备放行决策':609,907 '准备进入影子验证':241,502 '准确率不足':1053 '出具审核意见':830 '分析每类失败的根因和占比':453 '分步执行指南':365 '分级标准偏差':985 '分级错误率':854 '分级阈值调整':1066 '分级阈值需调整':991 '初筛分级':835,929 '初筛分级准确率':951,1028 '制定改进方向':454 '前置':210 '包括输入':83 '协同':229 '占比':142,668,683,695,713,726,959,973,986,997 '原因是真实用户请求':317 '参数':105 '双轨并行结构':344 '发现重大问题时能快速切到纯人工模式':388 '发现重大问题时能快速切换到纯人工模式':89 '只提取了部分内容':977 '可开关':88,387,532,848 '可接受':131,434,622,648 '可进入灰度':1043 '可进入灰度上线':787 '可量化的证据':18 '合同':863,878,892 '合同类型':1014 '同一合同':832 '同一工单':517 '后续计划':796,1055 '后置':216 '含售后政策':591 '周':416,546,562,581,601,754,808,860,875,889,899,1009,1051 '周度人工对比':99,396 '周度执行':611,909 '周提取准确率':885 '周结果':614,640,912,943 '周采纳率':577,595 '和影子系统':347 '和高风险场景':505 '品类faq补充':812 '哪些需要继续影子验证':479 '售后':765 '售后政策':789 '四类价值':333 '回复':573 '回复客户':515 '回复格式不统一':730 '因此能在不影响用户体验的前提下验证':322 '在审计放行阶段持续观察幻觉':340 '在样本集上检验能力边界':33 '在正式上线前为生产运行建立更稳的信心和评估依据':343 '在真实场景中并行运行':25 '在真实环境中的表现':324 '在系统构建阶段提前暴露稳定性':338 '场景':554,570,589,605,868,879,893,903 '场景分布':167,467,760 '场景筛选':113,410 '场景选择':188 '基于书稿方法论':366 '基于书稿第10章':309 '基本达标':790,1045 '增加规则拦截':294 '增加跨页合并逻辑':982 '增加输出格式校验':734 '增加输出过滤等':458 '增加退款规则硬编码拦截':691 '增强表格解析模块':1004 '复制到哪里':361 '多轮上下文丢失':288,667,743 '天':553,569,588,867 '失败模式':286 '失败模式分析':174,472,664,955 '失败模式报告':195 '失败模式沉淀':66,100,138,397 '失败模式沉淀与分析':445 '失败类型':140 '如何定义评估指标':363 '如何防止影子链路反向影响生产链路':364 '它帮助回答两个实际问题':330 '完整记录':79,380,527,843 '实验里的能力能否扛住真实流量':331 '审核对象是合同文档':821 '审计放行':328 '审计放行证据':67,299,750,1005 '审计放行证据准备':161,462 '审计放行证据包':199 '审计放行输入':222 '客户已明显不满但':716 '客服':238,495,499 '客服是否采纳':531 '客服正常处理':514 '对比案例':817 '对比结果与离线评估':441 '将失败模式反馈到系统优化循环':459 '尚未入库':704 '工单':258,263,267,549,565,584 '工单量':166,466 '工程实现核心':354 '差异比较':351 '已确定低风险场景':503 '常见方式是流量复制或事件镜像':355 '并行时长':165,465,752,1007 '并行比例':108,187,403,547,563,582,602,861,876,890,900 '并行生成建议':96,394 '并行运行参数设计':402 '并行运行方案':64,103,255,543,857 '幻觉输出':451 '建议':305 '建议仅在客服侧边栏显示':525 '建议存储':97,395,520 '建议灰度后继续观察':791 '建议的退款金额超出政策允许范围':687 '开始':110,406 '影子准确率':738 '影子系统':27,95,393 '影子系统不是主循环中的独立阶段':326 '影子系统与生产系统并行运行':320 '影子系统在方法论中的位置':325 '影子系统是真实环境验证机制':313 '影子系统架构':90 '影子系统的核心设计原则':72 '影子系统设计':63,71,245,374,510,825 '影子系统配置':186 '影子链路':516,831 '影子验证':10,20,36,50,497 '影子验证发现了离线评估未覆盖的问题':748 '影子验证报告':184 '影子验证报告需包含':162 '影子验证流程':61 '影子验证的实操':8 '忘记前文':675 '性能和边界问题':339 '总合同量':1010 '总工单量':755 '情绪场景':745 '情绪检测模型未集成':720 '情绪误判':712 '执行':243,508,823 '扩量条件':269,574,592,882 '扩量节奏':116,413 '承载这种验证方式的系统形态':30 '按类型分类':447 '接收真实请求但不直接返回结果给用户':321 '控制初期风险':112,409 '提取条款':834 '收敛决策已完成':13 '收敛决策通过':62,215,240,501 '收紧风险规则':154,456 '收紧高风险判定阈值':993 '改进':678,690,705,721,733,966,980,992,1003 '改进方向':144 '放行决策':482 '放行前验证':55 '放行建议':180,476,782,1040 '数量':141 '整理影子验证报告':463 '文档审核影子验证':816 '文档审核收敛决策通过':819 '文档解析未处理跨页连贯性':979 '新发现问题':742 '无':46 '无法回答':700 '时需深入理解':312 '明确哪些场景可以进入灰度':478 '是否具备进入工程化':181 '是否出现离线未发现的新问题':442 '是否出现离线未发现的问题':178 '暂停全场景':541 '暂停自动分级':856 '暂停该合同类型':853 '暂停该场景':538 '最低':45 '最高':59 '服务':1017 '服务合同':880,1044 '未标记情绪风险':718 '本':367 '权限越界等':452 '条':431,552,568,587,617,620,624,628,632,643,646,650,654,658,759 '条品类':708 '条款提取':916 '条款提取准确率':947,1024 '条款提取和初筛均达标':1042 '条款提取和批量初筛两个方向进入影子验证':820 '条款提取遗漏率':851 '条款遗漏率':1036 '架构':246,511,826 '标准采购合同':869,1041 '标准采购合同先行':1057 '样本':274,615,641,913,944 '样本偏差':48 '样本量偏少':1048 '核心概念':19 '根因':143,676,688,701,719,731,963,978,990,1001 '根因和改进建议':197 '格式识别错误':996 '格式问题':725 '模型优化':352 '模板化程度高':870 '次赔付类误判':537 '次高风险误判自动暂停':423 '正常执行':94,392 '正式上线':492 '正确':130,433,618,644,917 '正确分级':930 '步':371 '步骤':372,400,425,443,460,480 '每周人工对比':126,428 '每次':80,381 '每次对比后沉淀失败案例':139,446 '每次建议':250 '每次建议记录输入上下文':528 '每次提取记录输入文档':844 '法务上传合同':828 '法务主管可一键暂停':849 '法务对比结果':847 '法务采纳率':938,953,1032 '流程修正和风险发现的依据':353 '消息队列':358 '深入核心概念':308 '灰度上线':34,56,68,485,797,1056 '灰度上线条件':182 '灰度后继续观察':1046 '熔断':253 '熔断机制':121,420 '熔断规则':189,534,850 '物流':763 '物流状态':557,785 '物流解释':264,571 '特定品类的售后政策':698 '率象':715 '现象':670,685,697,728,961,975,988,999 '理由':107 '生产环境准备':235 '生产运行':60 '生产运行的关键桥梁':329 '生产链路':512,827 '生成建议':519 '生成影子结果':348 '用于辅助参考':940 '用户请求同时进入生产系统':345 '用户输入':237,498,818 '用真实数据验证':334 '的关系':209 '的完整执行分为':369 '目标':558,607,871,895,905 '真实业务数据':318 '真实工单':513 '真实工单进入':92 '真实性':40 '真实流程边界和真实异常情况远比实验集复杂':319 '真实流量':54 '真实请求':390 '知识库缺失':296,694 '知识库覆盖不足':158 '知识缺失':155,450 '确保影子链路不会反向影响生产链路':399 '确保证据包符合审计放行输入要求':477 '确保质量稳定后再放量':120,419 '示例':236 '示例一':494 '示例二':814 '离线准确率':736 '离线实验效果良好':15 '离线未测试':744 '离线样本不足':746 '离线评估':32,44 '租赁':1019 '租赁合同':881,1047,1060 '稳定运行':608,906 '符合':200 '第':544,560,575,579,593,599,612,638,858,873,883,887,897,910,941 '第1周':256 '第1周结果':273 '第2周':261 '第3周':265 '第一步':70 '第三步':124 '第二条链路不直接影响用户':349 '第二步':102 '第五步':160 '第四步':137 '管理后台一键暂停影子系统':533 '系统优化':101,398,809,1062 '系统准备上线前还有哪些隐性风险':332 '约':550,566,585,756,864,1011 '结果在审核面板显示':841 '结果存储':836 '结论':747 '给出建议':76 '给建议':378 '继续影子':803,1059 '继续影子验证':69,488,795,1049,1054 '维持':604,902 '置信度':85,385,530,846 '而在于如何记录结果差异':362 '而是试验展开通往系统构建':327 '而非只看离线样本':337 '能力':336 '能力实验':49 '补充':706,967 '补充200条faq':298 '补充会话状态设计':290 '补充会话记忆模块':679 '补充知识库':159,457 '补充记忆系统':149,455 '表格中的条款未被正确识别':1000 '表格解析增强':1065 '表格解析能力不足':1002 '计算三个核心指标':437 '计算采纳率':134 '订单查询':260,504,556,761,784 '让':23 '让系统在有限真实范围内直接影响业务结果':35 '训练样本以标准合同为主':964 '记录':249 '设计':106 '设计三条核心原则':375 '设计影子系统架构':389 '证据质量':42 '该品类':702 '质量指标':169,468,769,1023 '质量指标全面达标':490 '质量指标未完全达标':487 '质量指标达标':484 '质量趋势图':191 '超过':671 '越权':341 '跨页合并':1064 '跨页条款断裂':972 '跨页的长条款被截断':976 '轮对话后':673 '输入要求的完整证据':206 '输出可见不执行':523,839 '输出可见但不执行':74,376 '输出影子验证报告和放行决策':493 '输出模板未强制':732 '输出物':183 '输出都记录':82 '输出都记录输入':383 '边界规则不完善':153 '达标':786 '运行参数设计':104 '运行概况':164,464,751,1006 '返回实际响应':346 '进入系统构建':491 '连续':421,535 '连续3次赔付类误判自动暂停':254 '连续3次高风险误判自动暂停':122 '退款承诺':285 '退款承诺误判':292,682 '退款规则拦截':811 '退款规则边界不清晰':689 '退款赔付':506,793,805 '适用阶段':43 '逐步扩到':407 '逐步扩到50':111 '逐步扩展到服务合同':1058 '逐步放量':802 '通过后进入工程化':228 '避免高风险场景先行暴雷':115,412 '部分遗漏':921 '采纳标记':252 '采纳率':170,192,276,438,469,634,660,770 '采纳率68':300 '采纳率连续':414 '采纳率连续2周':117,270 '采购':1015 '错误':132,435,626,652 '错误分级':934 '错误率':135,171,278,439,470,774 '错误率随时间的变化':193 '错误调用和风险输出':342 '问题及根因':474 '阈值':302,773,777,781,1027,1031,1035,1039 '防止持续出错':123,424 '随机抽取影子系统建议':127,429 '集成情绪检测作为辅助信号':722 '需强化规则后再放行高风险场景':304 '需要为审计放行准备真实的':17 '需要在真实环境中验证系统是否具备进入工程化的条件':14 '非标准模板合同中的特殊条款被遗漏':962 '非标合同':1052 '非标合同再验证':1061 '非标合同样本补充':1063 '非标合同比标准合同低':949 '非标条款遗漏':958 '非标样本不足':965 '风险':41 '风险漏过':150,449 '风险漏过仍存在':794 '风险漏过率':136,172,282,440,471,539,636,662,778 '风险漏过率5':303 '风险误判':133,436,630,656 '验证了影子机制的必要性':749 '验证基础流程是否通畅':559 '验证批量初筛分级效果':896 '验证方式':39 '验证条款提取准确率':872 '高':53,57 '高风险合同被分为中风险':989 '高风险场景':486,792,804 '高风险场景继续影子':307","prices":[{"id":"faa1569f-51cf-42ef-91d4-fba9b70ce03e","listingId":"2b4e32a4-5dea-42ab-8eae-3650eb1c485e","amountUsd":"0","unit":"free","nativeCurrency":null,"nativeAmount":null,"chain":null,"payTo":null,"paymentMethod":"skill-free","isPrimary":true,"details":{"org":"gmaxxxie","category":"ai-native-product-agent-skills","install_from":"skills.sh"},"createdAt":"2026-05-01T01:03:00.124Z"}],"sources":[{"listingId":"2b4e32a4-5dea-42ab-8eae-3650eb1c485e","source":"github","sourceId":"gmaxxxie/ai-native-product-agent-skills/p2e-shadow-validation","sourceUrl":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/p2e-shadow-validation","isPrimary":false,"firstSeenAt":"2026-05-01T01:03:00.124Z","lastSeenAt":"2026-05-18T18:57:32.681Z"}],"details":{"listingId":"2b4e32a4-5dea-42ab-8eae-3650eb1c485e","quickStartSnippet":null,"exampleRequest":null,"exampleResponse":null,"schema":null,"openapiUrl":null,"agentsTxtUrl":null,"citations":[],"useCases":[],"bestFor":[],"notFor":[],"kindDetails":{"org":"gmaxxxie","slug":"p2e-shadow-validation","github":{"repo":"gmaxxxie/ai-native-product-agent-skills","stars":56,"topics":["agent-skills","ai-agent","ai-native","ai-product","methodology","product-management","product-methodology","product-thinking","skills"],"license":null,"html_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills","pushed_at":"2026-05-06T07:19:36Z","description":"AI Native Product Methodology — 80 executable skills across P0-P14 stages, covering needs discovery to aesthetic authority. From 8 books.","skill_md_sha":"1f7c0d93a71f860610873a0590fb1fcaa8870859","skill_md_path":"skills/p2e-shadow-validation/SKILL.md","default_branch":"main","skill_tree_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/p2e-shadow-validation"},"layout":"multi","source":"github","category":"ai-native-product-agent-skills","frontmatter":{"name":"p2e-shadow-validation","description":"'AI Native 产品方法论——影子验证的实操 Skill。"},"skills_sh_url":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/p2e-shadow-validation"},"updatedAt":"2026-05-18T18:57:32.681Z"}}