{"id":"24c7b02b-9cff-45a2-8bc2-9bf2f35c08c6","shortId":"hP64hV","kind":"skill","title":"p2a-experiment-overview","tagline":"'AI Native 产品方法论——试验展开概述的实操 Skill。","description":"# 试验展开概述 Skill\n\n## 使用场景\n\n- 方向定界已完成，需要进入试验展开阶段\n- 需要设计一套可验证、可比较、可放弃、可继承的实验体系\n- 需要理解能力实验、产品实验、商业实验三层关系\n\n## 核心概念\n\n- **能力实验**：验证某项 AI 能力在真实任务中是否成立\n- **产品实验**：验证用户是否愿意以某种交互或流程使用这项能力\n- **商业实验**：验证客户是否愿意为这类能力投入预算或试点资源\n- **评估（Evaluation）**：用样本、对照和失败案例判断能力是否成立\n\n## 三层实验关系\n\n```\n能力实验（技术上限）\n  → 产品实验（用户接受度）\n    → 商业实验（价值密度）\n      → 实验结论报告\n```\n\n能力实验是基础：先确认 AI 能力能否做到，再验证用户是否愿意用，最后验证客户是否愿意付费。\n\n## 第一步：资料准备评估\n\n试验前必须确认四类资料：\n\n| 资料类型 | 内容 | 评估标准 |\n|----------|------|---------|\n| 外部资料 | 行业知识、公开规则、产品文档 | 覆盖度 > 80% |\n| 内部业务资料 | SOP、历史工单、对话记录 | 代表性样本 > 200条 |\n| 样本集 | 正例、负例、边界案例、长尾问题 | 边界案例 > 20% |\n| 评估标准（Rubric） | 什么算对、什么算错、什么算可接受 | 已明确定义 |\n\n资料不足时，应先补充资料，而非直接开始实验。\n\n## 第二步：能力实验设计\n\n原则：**先用最强模型看能力上限，再压缩成本**\n\n1. 用最强模型（GPT-4o/Claude Opus）测试能力天花板\n2. 确定能力上限足够高后，再用更便宜模型测试能否保住目标效果\n3. 如果最强模型也无法达到可接受水平，应放弃或重新定义问题\n\n### 能力实验要验证的问题\n\n- AI 到底能做到什么深度\n- 哪些场景能够稳定成立\n- 哪些场景只能做到辅助，不能做到自动化\n- 哪些场景即使技术可行，也没有足够高的价值密度\n\n## 第三步：产品实验设计\n\n验证用户是否愿意以某种交互或流程使用这项能力：\n\n- 用户如何表达目标\n- 系统如何展示状态和建议\n- 用户如何纠偏或确认\n- 任务完成率和满意度\n\n## 第四步：商业实验设计\n\n验证价值密度：\n\n- 客户是否愿意付费试点\n- 续期意愿如何\n- 场景扩展可能性\n- 与现有解决方案的成本对比\n\n## 第五步：建立评估 Rubric\n\n评估不是看主观感觉，必须量化：\n\n- **准确率**：正确输出 / 总输出\n- **边界案例通过率**：长尾问题中正确处理的比例\n- **采纳率**：用户接受 AI 建议的比例\n- **效率提升**：相比纯人工的时长缩短比例\n\n## 输出物：试验展开总体方案\n\n1. **资料准备清单**：四类资料的覆盖度和缺口\n2. **能力实验方案**：实验批次、模型选择、成功标准\n3. **产品实验方案**：交互形式、验证指标\n4. **商业实验方案**：定价假设、试点设计\n5. **评估 Rubric**：定义明确的量化指标\n6. **实验节奏**：各层实验的时间安排\n\n## 与其他 Skill 的关系\n\n- **前置**：@ai-native-direction-framing（提供 Direction Brief）\n- **后置**：@p2b-product-form-exploration、@p2c-process-redesign、@p2d-convergence-decision、@p2e-shadow-validation（覆盖5个子阶段）\n- **协同**：@ai-native-experiment-engine（整体包覆版，仍可独立使用）\n\n## 示例\n\n### 用户输入\n\"我们已完成方向定界，Direction Brief 是 AI 客服协同系统，需要设计试验展开方案\"\n\n### Skill 执行\n\n```yaml\n资料准备评估:\n  已有: FAQ(500条)、工单样本(1000条)、物流规则文档\n  缺口: 边界案例(仅8%)、情绪问题样本(缺失)\n  建议: 补充100条边界案例和50条情绪问题样本后再开始实验\n\n能力实验方案:\n  第1批: GPT-4o 测试订单查询/物流解释/售后政策（目标>85%准确率）\n  第2批: 边界案例测试（目标>70%通过率）\n  第3批: 压缩成本测试（GPT-4o-mini，目标保住85%效果）\n\n产品实验方案:\n  形式: Copilot 影子模式（建议+人工确认）\n  指标: 采纳率>60%、满意度>80分\n\n商业实验方案:\n  试点设计: 2个部门3个月试点\n  定价锚: 首响时间缩短X分钟，培训周期缩短Y天\n\n实验节奏:\n  第1-2周: 补充资料\n  第3-4周: 能力实验\n  第5-6周: 产品实验\n  第7周: 商业验证\n  第8周: 汇总实验结论报告\n```\n\n---\n\n## 深入核心概念\n\n基于书稿第06章，以下概念在执行本 Skill 时需深入理解：\n\n- **实验即产品定义**：试验展开不是技术团队先去\"试试看\"，而是产品、工程、领域团队共同定义产品边界的过程。很多真正重要的产品决策，都是在实验阶段做出来的，而不是在 PRD 阶段做出来的。\n- **四要素框架（Data → Model → Method → Evaluation）**：Data 决定实验贴近真实任务的程度；Model 决定能力上限、成本结构和推理特性；Method 决定用提示词、RAG、工作流、智能体还是组合；Evaluation 决定如何判断结果是否真正成立。缺少任何一项，实验都会变成不可复用的偶然成功。\n- **先看能力上限再压缩成本**：先用最强模型（如 GPT-4o / Claude Opus）验证问题有没有机会被解决；等任务定义、资料供给和评估方式基本稳定后，再测试更便宜、更快的模型。团队不会因为一开始就选了便宜模型而误判方向不可行。\n- **资料供给是实验前提**：真正决定实验质量的，往往是资料是否足够——包括外部资料（行业知识、法规、竞品材料）和内部业务资料（SOP、历史工单、规则说明、失败案例）。资料必须经过脱敏、权限分层、结构化和场景打包。\n- **实验必须产出可继承结论**：好的试验展开要输出：哪些任务已可做（含边界）、哪些暂时不能做（失败在哪）、哪些虽能做但价值密度不足、哪些值得进入产品化、哪些资料和评估条件必须保留到下一阶段。\n\n## 分步执行指南\n\n基于书稿方法论，本 Skill 的完整执行分为 6 步：\n\n### 步骤 1：资料准备评估与缺口分析\n- 盘点四类资料：外部资料、内部业务资料、样本集、评估标准\n- 评估覆盖度：外部资料覆盖度 > 80%、内部资料代表性样本 > 200 条、边界案例 > 20%\n- 资料预处理：脱敏（去除隐私和敏感字段）、权限分层（区分通用实验与受控环境）、结构化（转为可检索可对比材料）、场景打包（按任务场景整理成实验包）\n- 资料不足时必须先补充，而非直接开始实验\n\n### 步骤 2：能力实验设计与执行\n- 原则：先用最强模型看能力天花板，再压缩成本\n- 第 1 批：用最强模型测试核心场景（目标 > 85% 准确率）\n- 第 2 批：边界案例测试（目标 > 70% 通过率）\n- 第 3 批：成本压缩测试（换更便宜模型，看能否保住目标准确率）\n- 记录每个场景的能力上限、稳定性和失败模式\n\n### 步骤 3：产品实验设计与执行\n- 设计用户如何进入能力入口（问答 / Copilot / 工作台 / 自动流程 / Agent）\n- 设计系统如何展示状态和建议\n- 设计用户纠偏和确认机制\n- 在真实工作流中测试，记录任务完成率、采纳率和满意度\n\n### 步骤 4：商业实验设计与执行\n- 设计试点方案（至少 2 个部门 / 3 个月）\n- 定义价值锚点（首响时间缩短、培训周期缩短、人力成本降低）\n- 收集续期意愿和场景扩展可能性\n- 与现有解决方案做成本对比\n\n### 步骤 5：建立量化评估 Rubric\n- 定义准确率、边界案例通过率、采纳率、效率提升等指标\n- 定义什么算对、什么算错、什么算可接受\n- 建立对照组和失败案例库\n- 确保评估标准可复现、可比较\n\n### 步骤 6：汇总试验展开总体方案\n- 整理资料准备清单（覆盖度和缺口）\n- 整理能力 / 产品 / 商业三类实验方案\n- 制定实验节奏（各层实验时间安排）\n- 输出试验展开总体方案文档\n- 判断是否满足进入下一阶段的闸门条件\n\n## 示例一：AI 客服协同系统完整试验方案\n\n### 用户输入\n\"我们已完成方向定界，Direction Brief 是 AI 客服协同系统，目标是缩短客服首响时间和培训周期。目前有 FAQ 500 条、工单样本 1000 条、物流规则文档。需要设计完整试验展开方案。\"\n\n### Skill 执行\n\n```yaml\n资料准备评估:\n  已有资料:\n    - FAQ: 500条（覆盖度约 65%）\n    - 工单样本: 1000条（含订单查询、物流咨询、售后申请）\n    - 物流规则文档: 完整\n  缺口分析:\n    - 边界案例: 仅占 8%，需补充至 20%+（目标 100 条）\n    - 情绪问题样本: 完全缺失（需 50 条）\n    - 售后政策文档: 过时版本，需更新\n    - 评估标准（Rubric）: 未定义\n  资料预处理:\n    脱敏: 移除客户姓名、手机号、订单号后四位\n    权限分层: 售后赔付类仅在受控环境使用\n    结构化: 工单按场景分类打包（查询/物流/售后/投诉）\n    场景打包: 每个场景含正例10条、负例5条、边界5条\n\n能力实验方案:\n  第1批（第3周）: GPT-4o 测试\n    场景: 订单查询、物流解释、售后政策\n    样本: 每场景 50 条\n    目标: 准确率 > 85%\n  第2批（第4周）: 边界案例测试\n    场景: 多轮上下文、跨场景切换、模糊表述\n    样本: 100 条边界案例\n    目标: 通过率 > 70%\n  第3批（第4周）: 成本压缩测试\n    模型: GPT-4o-mini\n    目标: 保住 85% 效果，成本降低 50%+\n\n产品实验方案:\n  形态: Copilot（侧边栏建议 + 人工确认）\n  交互原型:\n    入口: 工单进入时自动触发\n    输出: 候选回复 + 风险标记 + 规则引用\n    反馈: 一键采纳 / 快速编辑 / 标记不准确\n    降级: 高风险场景强制人工\n  验证指标:\n    采纳率目标 > 60%\n    满意度目标 > 80 分\n    首响时间缩短目标 > 40%\n\n商业实验方案:\n  试点设计: 2 个部门 × 3 个月\n  价值锚点:\n    - 首响时间: 从 X 分钟缩短到 Y 分钟\n    - 培训周期: 从 X 天缩短到 Y 天\n    - 人力成本: 减少 Z 名初级客服\n  续期意愿: 试点结束后问卷收集\n\n评估 Rubric:\n  准确率: 正确输出 / 总输出\n  边界案例通过率: 长尾问题中正确处理的比例\n  采纳率: 客服接受 AI 建议的比例\n  效率提升: 相比纯人工的时长缩短比例\n  风险漏过率: 高风险场景中 AI 未标记的比例（目标 < 5%）\n\n实验节奏:\n  第1-2周: 资料补充（边界案例、情绪样本、更新售后文档、建立 Rubric）\n  第3周: 能力实验第1批\n  第4周: 能力实验第2、3批\n  第5-6周: 产品实验\n  第7周: 商业验证\n  第8周: 汇总实验结论报告，判断是否进入下一阶段\n\n进入下一阶段闸门:\n  - ✅ 能力在关键场景稳定成立（准确率 > 85%）\n  - ✅ 资料供给足够、可控、可复现\n  - ✅ 失败边界已初步识别\n  - ✅ 用户使用方式和价值信号开始出现\n```\n\n## 示例二：AI 运维故障分析系统试验方案（对比案例）\n\n### 用户输入\n\"方向定界已完成，Direction Brief 是 AI 运维故障分析系统，帮助运维工程师更快理解告警和定位根因。目前有历史告警日志 5000 条、处理记录 800 条、基础设施架构文档。需要设计试验方案。\"\n\n### Skill 执行\n\n```yaml\n资料准备评估:\n  已有资料:\n    - 历史告警日志: 5000 条（覆盖主要告警类型）\n    - 处理记录: 800 条（含根因和处理步骤）\n    - 基础设施架构文档: 完整\n  缺口分析:\n    - 复合故障样本: 仅 3%（需补充至 15%+）\n    - 跨系统关联案例: 缺失（需 50 条）\n    - 误报告警样本: 不足（需补充 100 条）\n    - 评估标准: 未定义\n  资料预处理:\n    脱敏: 移除 IP 地址、域名、内部服务名称（替换为代号）\n    权限分层: 生产环境日志仅在受控环境使用\n    结构化: 按故障类型打包（基础设施/应用/网络/安全）\n    场景打包: 每场景含正常案例、边界案例、复合故障\n\n能力实验方案:\n  第1批（第3周）: 单一故障根因分析\n    模型: Claude Opus\n    场景: CPU 异常、内存泄漏、磁盘满、网络超时\n    样本: 每场景 30 条\n    目标: 根因识别准确率 > 80%\n  第2批（第4周）: 复合故障与跨系统关联\n    样本: 80 条复合故障\n    目标: 能正确识别至少一个根因 > 60%\n  第3批（第4周）: 成本压缩\n    模型: Claude Sonnet\n    目标: 保住 80% 效果，延迟 < 5 秒\n\n产品实验方案:\n  形态: 工作台（告警面板 + 根因分析面板 + 建议处理步骤）\n  交互原型:\n    入口: 告警触发时自动展示分析面板\n    输出: 疑似根因列表 + 置信度 + 关联日志 + 建议操作\n    反馈: 确认根因 / 标记不准确 / 补充信息\n    降级: 低置信度时提示\"建议人工排查\"\n  验证指标:\n    采纳率目标 > 50%（运维场景保守）\n    平均排障时间缩短目标 > 30%\n    满意度目标 > 75 分\n\n商业实验方案:\n  试点设计: 1 个运维团队 × 2 个月（运维团队更谨慎）\n  价值锚点:\n    - 平均排障时间（MTTR）: 缩短 X%\n    - 误处理率: 降低 Y%\n    - 运维人力: 高峰期减少 Z 人值守\n  风险: 运维场景出错代价高，需严格限制自动化范围\n\n评估 Rubric:\n  根因识别准确率: Top-3 命中率\n  关联分析准确率: 跨系统关联是否正确\n  建议操作采纳率: 运维人员接受建议的比例\n  MTTR 缩短比例: 相比纯人工排障的时间缩短\n  误报过滤率: AI 正确识别误报告警的比例\n\n实验节奏:\n  第1-2周: 资料补充（复合故障、跨系统案例、误报样本）\n  第3周: 能力实验第1批\n  第4周: 能力实验第2、3批\n  第5-6周: 产品实验\n  第7周: 商业验证\n  第8周: 汇总结论\n\n进入下一阶段闸门:\n  - ✅ 单一故障根因识别准确率 > 80%\n  - ✅ 复合故障至少识别一个根因 > 60%\n  - ✅ 运维人员采纳率 > 50%\n  - ✅ MTTR 缩短 > 30%（真实工单验证）\n  - ⚠️ 若准确率不稳定，延长影子验证而非直接工程化\n```","tags":["p2a","experiment","overview","native","product","agent","skills","gmaxxxie","agent-skills","ai-agent","ai-native","ai-product"],"capabilities":["skill","source-gmaxxxie","skill-p2a-experiment-overview","topic-agent-skills","topic-ai-agent","topic-ai-native","topic-ai-product","topic-methodology","topic-product-management","topic-product-methodology","topic-product-thinking","topic-skills"],"categories":["ai-native-product-agent-skills"],"synonyms":[],"warnings":[],"endpointUrl":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/p2a-experiment-overview","protocol":"skill","transport":"skills-sh","auth":{"type":"none","details":{"cli":"npx skills add gmaxxxie/ai-native-product-agent-skills","source_repo":"https://github.com/gmaxxxie/ai-native-product-agent-skills","install_from":"skills.sh"}},"qualityScore":"0.478","qualityRationale":"deterministic score 0.48 from registry signals: · indexed on github topic:agent-skills · 56 github stars · SKILL.md body (6,524 chars)","verified":false,"liveness":"unknown","lastLivenessCheck":null,"agentReviews":{"count":0,"score_avg":null,"cost_usd_avg":null,"success_rate":null,"latency_p50_ms":null,"narrative_summary":null,"summary_updated_at":null},"enrichmentModel":"deterministic:skill-github:v1","enrichmentVersion":1,"enrichedAt":"2026-05-18T18:57:32.054Z","embedding":null,"createdAt":"2026-05-01T01:02:59.206Z","updatedAt":"2026-05-18T18:57:32.054Z","lastSeenAt":"2026-05-18T18:57:32.054Z","tsv":"'-3':870 '/claude':93 '1':88,142,369,402,846 '100':521,577,748 '1000':494 '1000条':221,508 '15':739 '2':96,145,396,409,442,624,848 '20':73,383,519 '200':380 '200条':66 '2个部门3个月试点':267 '2周':274,669,885 '3':99,150,416,424,444,626,737 '30':787,840,912 '3批':680,894 '4':154,438 '40':621 '4o':92,234,250,328,556,588 '4周':278 '5':158,453,665,812 '50':526,564,595,743,837,909 '500':491 '5000':712,725 '500条':219,504 '6':162,366,467 '60':262,616,800,907 '65':506 '6周':282,683,897 '70':244,413,581 '75':842 '8':517 '80':60,378,618,791,796,809,905 '800':715,729 '80分':264 '85':239,406,568,592,693 'agent':431 'ai':5,25,45,103,136,170,198,210,479,486,656,662,700,708,880 'ai-native-direction-fram':169 'ai-native-experiment-engin':197 'brief':176,208,484,706 'claud':329,777,805 'converg':189 'copilot':256,428,598 'cpu':780 'data':305,309 'decis':190 'direct':172,175,207,483,705 'engin':201 'evalu':32,308,319 'experi':3,200 'explor':182 'faq':218,490,503 'form':181 'frame':173 'gpt':91,233,249,327,555,587 'gpt-4o':90,232,326,554 'gpt-4o-mini':248,586 'ip':755 'method':307,314 'mini':251,589 'model':306,311 'mttr':853,876,910 'nativ':6,171,199 'opus':94,330,778 'overview':4 'p2a':2 'p2a-experiment-overview':1 'p2b':179 'p2b-product-form-exploration':178 'p2c':184 'p2c-process-redesign':183 'p2d':188 'p2d-convergence-decision':187 'p2e':192 'p2e-shadow-validation':191 'prd':302 'process':185 'product':180 'rag':316 'redesign':186 'rubric':75,126,160,455,532,648,675,867 'shadow':193 'skill':9,11,166,213,291,364,498,719 'skill-p2a-experiment-overview' 'sonnet':806 'sop':62,345 'source-gmaxxxie' 'top':869 'topic-agent-skills' 'topic-ai-agent' 'topic-ai-native' 'topic-ai-product' 'topic-methodology' 'topic-product-management' 'topic-product-methodology' 'topic-product-thinking' 'topic-skills' 'valid':194 'x':631,637,855 'y':633,639,858 'yaml':215,500,721 'z':643,861 '一键采纳':609 '三层实验关系':35 '不能做到自动化':107 '不足':746 '与其他':165 '与现有解决方案做成本对比':451 '与现有解决方案的成本对比':123 '个月':445,627,849 '个运维团队':847 '个部门':443,625 '也没有足够高的价值密度':109 '交互原型':601,820 '交互形式':152 '产品':472 '产品实验':20,27,38,283,684,898 '产品实验方案':151,254,596,814 '产品实验设计':111 '产品实验设计与执行':425 '产品文档':58 '产品方法论':7 '人值守':862 '人力成本':641 '人力成本降低':449 '人工确认':259,600 '什么算可接受':78,462 '什么算对':76 '什么算错':77,461 '仅':736 '仅8':225 '仅占':516 '仍可独立使用':203 '从':630,636 '代表性样本':65 '以下概念在执行本':290 '价值密度':41 '价值锚点':628,851 '任务完成率和满意度':116 '低置信度时提示':833 '使用场景':12 '侧边栏建议':599 '保住':591,808 '候选回复':605 '先用最强模型':324 '先用最强模型看能力上限':86 '先用最强模型看能力天花板':399 '先看能力上限再压缩成本':323 '先确认':44 '入口':602,821 '公开规则':57 '关联分析准确率':872 '关联日志':826 '内存泄漏':782 '内容':53 '内部业务资料':61,373 '内部服务名称':758 '内部资料代表性样本':379 '再压缩成本':87,400 '再测试更便宜':334 '再用更便宜模型测试能否保住目标效果':98 '再验证用户是否愿意用':47 '决定如何判断结果是否真正成立':320 '决定实验贴近真实任务的程度':310 '决定用提示词':315 '决定能力上限':312 '准确率':129,240,407,567,649,692 '减少':642 '分':619,843 '分步执行指南':361 '分钟':634 '分钟缩短到':632 '判断是否满足进入下一阶段的闸门条件':477 '判断是否进入下一阶段':689 '到底能做到什么深度':104 '制定实验节奏':474 '前置':168 '包括外部资料':340 '区分通用实验与受控环境':388 '协同':196 '单一故障根因分析':775 '单一故障根因识别准确率':904 '历史告警日志':724 '历史工单':63,346 '压缩成本测试':247 '原则':85,398 '去除隐私和敏感字段':386 '反馈':608,828 '可复现':696 '可控':695 '可放弃':17 '可比较':16,465 '可继承的实验体系':18 '各层实验时间安排':475 '各层实验的时间安排':164 '名初级客服':644 '后置':177 '含根因和处理步骤':731 '含订单查询':509 '含边界':355 '告警触发时自动展示分析面板':822 '告警面板':817 '命中率':871 '和内部业务资料':344 '哪些任务已可做':354 '哪些值得进入产品化':359 '哪些场景即使技术可行':108 '哪些场景只能做到辅助':106 '哪些场景能够稳定成立':105 '哪些暂时不能做':356 '哪些虽能做但价值密度不足':358 '哪些资料和评估条件必须保留到下一阶段':360 '售后':545 '售后政策':237,561 '售后政策文档':528 '售后申请':511 '售后赔付类仅在受控环境使用':540 '商业三类实验方案':473 '商业实验':29,40 '商业实验三层关系':21 '商业实验方案':155,265,622,844 '商业实验设计':118 '商业实验设计与执行':439 '商业验证':285,686,900 '四类资料的覆盖度和缺口':144 '四要素框架':304 '团队不会因为一开始就选了便宜模型而误判方向不可行':336 '在真实工作流中测试':434 '地址':756 '场景':558,572,779 '场景打包':391,547,768 '场景扩展可能性':122 '域名':757 '培训周期':635 '培训周期缩短':448 '培训周期缩短y天':270 '基于书稿方法论':362 '基于书稿第06章':289 '基础设施':764 '基础设施架构文档':717,732 '处理记录':714,728 '复合故障':771,887 '复合故障与跨系统关联':794 '复合故障样本':735 '复合故障至少识别一个根因':906 '外部资料':55,372 '外部资料覆盖度':377 '多轮上下文':573 '天':640 '天缩短到':638 '失败在哪':357 '失败案例':348 '失败边界已初步识别':697 '好的试验展开要输出':353 '如':325 '如果最强模型也无法达到可接受水平':100 '安全':767 '完全缺失':524 '完整':513,733 '定义什么算对':460 '定义价值锚点':446 '定义准确率':456 '定义明确的量化指标':161 '定价假设':156 '定价锚':268 '实验即产品定义':293 '实验必须产出可继承结论':352 '实验批次':147 '实验结论报告':42 '实验节奏':163,271,666,882 '实验都会变成不可复用的偶然成功':322 '客户是否愿意付费试点':120 '客服协同系统':211,487 '客服协同系统完整试验方案':480 '客服接受':655 '对比案例':702 '对照和失败案例判断能力是否成立':34 '对话记录':64 '工作台':429,816 '工作流':317 '工单按场景分类打包':542 '工单样本':220,493,507 '工单进入时自动触发':603 '工程':297 '已明确定义':79 '已有':217 '已有资料':502,723 '帮助运维工程师更快理解告警和定位根因':710 '平均排障时间':852 '平均排障时间缩短目标':839 '应先补充资料':81 '应放弃或重新定义问题':101 '应用':765 '延迟':811 '延长影子验证而非直接工程化':915 '建立':674 '建立对照组和失败案例库':463 '建立评估':125 '建立量化评估':454 '建议':228,258 '建议人工排查':834 '建议处理步骤':819 '建议操作':827 '建议操作采纳率':874 '建议的比例':137,657 '异常':781 '形式':255 '形态':597,815 '影子模式':257 '往往是资料是否足够':339 '很多真正重要的产品决策':299 '必须量化':128 '快速编辑':610 '总输出':131,651 '情绪样本':672 '情绪问题样本':226,523 '成功标准':149 '成本压缩':803 '成本压缩测试':418,584 '成本结构和推理特性':313 '成本降低':594 '我们已完成方向定界':206,482 '手机号':537 '执行':214,499,720 '批':403,410,417 '技术上限':37 '投诉':546 '指标':260 '按任务场景整理成实验包':392 '按故障类型打包':763 '换更便宜模型':419 '提供':174 '收集续期意愿和场景扩展可能性':450 '效果':253,593,810 '效率提升':138,658 '效率提升等指标':459 '整体包覆版':202 '整理能力':471 '整理资料准备清单':469 '方向定界已完成':13,704 '时需深入理解':292 '是':209,485,707 '智能体还是组合':318 '更快的模型':335 '更新售后文档':673 '替换为代号':759 '最后验证客户是否愿意付费':48 '未定义':533,751 '未标记的比例':663 '本':363 '权限分层':350,387,539,760 '条':381,492,495,522,527,565,713,716,726,730,744,749,788 '条复合故障':797 '条边界案例':578 '查询':543 '标记不准确':611,830 '样本':562,576,785,795 '样本集':67,374 '核心概念':22 '根因分析面板':818 '根因识别准确率':790,868 '模型':585,776,804 '模型选择':148 '模糊表述':575 '正例':68 '正确识别误报告警的比例':881 '正确输出':130,650 '步':367 '步骤':368,395,423,437,452,466 '每个场景含正例10条':548 '每场景':563,786 '每场景含正常案例':769 '汇总实验结论报告':287,688 '汇总结论':902 '汇总试验展开总体方案':468 '法规':342 '测试':557 '测试能力天花板':95 '测试订单查询':235 '深入核心概念':288 '满意度':263 '满意度目标':617,841 '物流':544 '物流咨询':510 '物流规则文档':222,496,512 '物流解释':236,560 '生产环境日志仅在受控环境使用':761 '用户使用方式和价值信号开始出现':698 '用户如何纠偏或确认':115 '用户如何表达目标':113 '用户接受':135 '用户接受度':39 '用户输入':205,481,703 '用最强模型':89 '用最强模型测试核心场景':404 '用样本':33 '疑似根因列表':824 '的关系':167 '的完整执行分为':365 '盘点四类资料':371 '目前有':489 '目前有历史告警日志':711 '目标':238,243,405,412,520,566,579,590,664,789,798,807 '目标保住85':252 '目标是缩短客服首响时间和培训周期':488 '相比纯人工排障的时间缩短':878 '相比纯人工的时长缩短比例':139,659 '看能否保住目标准确率':420 '真实工单验证':913 '真正决定实验质量的':338 '确保评估标准可复现':464 '确定能力上限足够高后':97 '确认根因':829 '磁盘满':783 '示例':204 '示例一':478 '示例二':699 '秒':813 '移除':754 '移除客户姓名':536 '稳定性和失败模式':422 '竞品材料':343 '第':401,408,415 '第1':273,668,884 '第1-2周':272,667,883 '第1批':231,552,773 '第2批':241,569,792 '第3':277 '第3-4周':276 '第3周':553,676,774,890 '第3批':246,582,801 '第4周':570,583,678,793,802,892 '第5':281,682,896 '第5-6周':280,681,895 '第7周':284,685,899 '第8周':286,687,901 '第一步':49 '第三步':110 '第二步':83 '第五步':124 '第四步':117 '等任务定义':332 '系统如何展示状态和建议':114 '结构化':389,541,762 '结构化和场景打包':351 '续期意愿':645 '续期意愿如何':121 '缩短':854,911 '缩短比例':877 '缺口':223 '缺口分析':514,734 '缺失':227,741 '缺少任何一项':321 '网络':766 '网络超时':784 '置信度':825 '而不是在':301 '而是产品':296 '而非直接开始实验':82,394 '能力在关键场景稳定成立':691 '能力在真实任务中是否成立':26 '能力实验':23,36,279 '能力实验方案':146,230,551,772 '能力实验是基础':43 '能力实验第1批':677,891 '能力实验第2':679,893 '能力实验要验证的问题':102 '能力实验设计':84 '能力实验设计与执行':397 '能力能否做到':46 '能正确识别至少一个根因':799 '脱敏':385,535,753 '自动流程':430 '至少':441 '若准确率不稳定':914 '行业知识':56,341 '补充100条边界案例和50条情绪问题样本后再开始实验':229 '补充信息':831 '补充资料':275 '覆盖5个子阶段':195 '覆盖主要告警类型':727 '覆盖度':59 '覆盖度和缺口':470 '覆盖度约':505 '规则引用':607 '规则说明':347 '订单号后四位':538 '订单查询':559 '记录任务完成率':435 '记录每个场景的能力上限':421 '设计用户如何进入能力入口':426 '设计用户纠偏和确认机制':433 '设计系统如何展示状态和建议':432 '设计试点方案':440 '评估':31,159,647,866 '评估不是看主观感觉':127 '评估标准':54,74,375,531,750 '评估覆盖度':376 '试点结束后问卷收集':646 '试点设计':157,266,623,845 '试试看':295 '试验前必须确认四类资料':51 '试验展开不是技术团队先去':294 '试验展开总体方案':141 '试验展开概述':10 '试验展开概述的实操':8 '误处理率':856 '误报告警样本':745 '误报样本':889 '误报过滤率':879 '负例':69 '负例5条':549 '资料不足时':80 '资料不足时必须先补充':393 '资料供给和评估方式基本稳定后':333 '资料供给是实验前提':337 '资料供给足够':694 '资料准备清单':143 '资料准备评估':50,216,501,722 '资料准备评估与缺口分析':370 '资料必须经过脱敏':349 '资料类型':52 '资料补充':670,886 '资料预处理':384,534,752 '跨场景切换':574 '跨系统关联是否正确':873 '跨系统关联案例':740 '跨系统案例':888 '转为可检索可对比材料':390 '输出':604,823 '输出物':140 '输出试验展开总体方案文档':476 '边界5条':550 '边界案例':70,72,224,382,515,671,770 '边界案例测试':242,411,571 '边界案例通过率':132,457,652 '过时版本':529 '运维人力':859 '运维人员接受建议的比例':875 '运维人员采纳率':908 '运维团队更谨慎':850 '运维场景保守':838 '运维场景出错代价高':864 '运维故障分析系统':709 '运维故障分析系统试验方案':701 '进入下一阶段闸门':690,903 '通过率':245,414,580 '都是在实验阶段做出来的':300 '采纳率':134,261,458,654 '采纳率和满意度':436 '采纳率目标':615,836 '长尾问题':71 '长尾问题中正确处理的比例':133,653 '问答':427 '阶段做出来的':303 '降低':857 '降级':612,832 '需':525,742 '需严格限制自动化范围':865 '需更新':530 '需补充':747 '需补充至':518,738 '需要理解能力实验':19 '需要设计一套可验证':15 '需要设计完整试验展开方案':497 '需要设计试验展开方案':212 '需要设计试验方案':718 '需要进入试验展开阶段':14 '领域团队共同定义产品边界的过程':298 '风险':863 '风险标记':606 '风险漏过率':660 '首响时间':629 '首响时间缩短':447 '首响时间缩短x分钟':269 '首响时间缩短目标':620 '验证价值密度':119 '验证客户是否愿意为这类能力投入预算或试点资源':30 '验证指标':153,614,835 '验证某项':24 '验证用户是否愿意以某种交互或流程使用这项能力':28,112 '验证问题有没有机会被解决':331 '高峰期减少':860 '高风险场景中':661 '高风险场景强制人工':613","prices":[{"id":"bd14b157-caf9-4184-a9f2-ba23120780ca","listingId":"24c7b02b-9cff-45a2-8bc2-9bf2f35c08c6","amountUsd":"0","unit":"free","nativeCurrency":null,"nativeAmount":null,"chain":null,"payTo":null,"paymentMethod":"skill-free","isPrimary":true,"details":{"org":"gmaxxxie","category":"ai-native-product-agent-skills","install_from":"skills.sh"},"createdAt":"2026-05-01T01:02:59.206Z"}],"sources":[{"listingId":"24c7b02b-9cff-45a2-8bc2-9bf2f35c08c6","source":"github","sourceId":"gmaxxxie/ai-native-product-agent-skills/p2a-experiment-overview","sourceUrl":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/p2a-experiment-overview","isPrimary":false,"firstSeenAt":"2026-05-01T01:02:59.206Z","lastSeenAt":"2026-05-18T18:57:32.054Z"}],"details":{"listingId":"24c7b02b-9cff-45a2-8bc2-9bf2f35c08c6","quickStartSnippet":null,"exampleRequest":null,"exampleResponse":null,"schema":null,"openapiUrl":null,"agentsTxtUrl":null,"citations":[],"useCases":[],"bestFor":[],"notFor":[],"kindDetails":{"org":"gmaxxxie","slug":"p2a-experiment-overview","github":{"repo":"gmaxxxie/ai-native-product-agent-skills","stars":56,"topics":["agent-skills","ai-agent","ai-native","ai-product","methodology","product-management","product-methodology","product-thinking","skills"],"license":null,"html_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills","pushed_at":"2026-05-06T07:19:36Z","description":"AI Native Product Methodology — 80 executable skills across P0-P14 stages, covering needs discovery to aesthetic authority. From 8 books.","skill_md_sha":"3f7091095864b99c15e41a331a7f917f17ce7da8","skill_md_path":"skills/p2a-experiment-overview/SKILL.md","default_branch":"main","skill_tree_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/p2a-experiment-overview"},"layout":"multi","source":"github","category":"ai-native-product-agent-skills","frontmatter":{"name":"p2a-experiment-overview","description":"'AI Native 产品方法论——试验展开概述的实操 Skill。"},"skills_sh_url":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/p2a-experiment-overview"},"updatedAt":"2026-05-18T18:57:32.054Z"}}