{"id":"85a29ce6-919a-4a1d-a742-bad42e2c0839","shortId":"6cPMkr","kind":"skill","title":"ai-native-experiment-engine","tagline":"'AI Native 产品方法论——试验展开阶段的实操 Skill。","description":"# AI Native 试验展开 Skill\n\n## 使用场景\n\n- 方向定界已完成，需要进入实验验证阶段\n- 需要设计一组可验证、可比较、可放弃、可继承的实验体系\n- 需要判断某个 AI 能力在真实任务中是否成立\n\n## 核心概念\n\n- **能力实验（Capability Experiment）**：验证某项 AI 能力在真实任务中是否成立\n- **产品实验（Product Experiment）**：验证用户是否愿意以某种交互或流程使用这项能力\n- **商业实验（Business Experiment）**：验证客户是否愿意为这类能力投入预算或试点资源\n- **评估（Evaluation）**：用样本、对照和失败案例判断能力是否成立\n\n## 试验展开流程\n\n```\n资料准备\n  → 能力实验（先用最强模型看天花板）\n    → 产品实验（验证交互和流程）\n      → 商业实验（验证价值密度和付费意愿）\n        → 评估与失败分析\n          → 输出实验结论报告\n```\n\n## 第一步：资料准备\n\n试验前必须准备：\n\n1. **外部资料**：行业知识、公开规则、产品文档\n2. **内部业务资料**：SOP、历史工单、对话记录、专家经验\n3. **样本集**：正例、负例、边界案例、长尾问题\n4. **评估标准（Rubric）**：什么算对、什么算错、什么算可接受\n\n没有资料准备的实验会漂浮。\n\n## 第二步：能力实验\n\n### 原则：先看能力上限，再压缩成本\n\n1. 先用最强模型（如 GPT-4o/Claude Opus）测试能力天花板\n2. 确定能力上限足够高后，再用更便宜模型测试能否保住目标效果\n3. 如果最强模型也无法达到可接受水平，应该放弃或重新定义问题\n\n### 能力实验要验证的问题\n\n- AI 到底能做到什么深度\n- 哪些场景能够稳定成立\n- 哪些场景只能做到辅助，不能做到自动化\n- 哪些场景即使技术可行，也没有足够高的价值密度\n\n### 实验产物\n\n- 流程类 demo：任务流程、节点跳转、人工接管点、审批逻辑\n- 功能类 demo：问答、分类、归因、生成建议\n- 界面类 demo：单页界面、工作台原型、表单交互或 Copilot 面板\n- 系统说明文档：边界、模块、接口草稿、评估方式、失败处理\n\n## 第三步：产品实验\n\n验证用户是否愿意以某种交互或流程使用这项能力：\n\n- 用户如何表达目标\n- 系统如何展示状态和建议\n- 用户如何纠偏或确认\n- 任务完成率和满意度\n\n## 第四步：商业实验\n\n验证价值密度：\n\n- 客户是否愿意付费试点\n- 续期意愿如何\n- 场景扩展可能性\n- 与现有解决方案的成本对比\n\n## 第五步：评估与失败分析\n\n### 评估不是看主观感觉\n\n- 用样本、对照和失败案例判断能力是否成立\n- 建立评估 Rubric：明确什么算对、什么算错、什么算可接受\n- 每次实验都应有可量化的评估结果\n\n### 失败分析是实验最重要的产物\n\n- 哪些场景能稳定成立，哪些不能\n- 哪些问题资料还不够\n- 哪些能力只适合做建议，哪些已经有机会进入产品化\n- 失败案例应该被沉淀为下一轮优化的输入\n\n## 输出物：实验结论报告\n\n1. **能力边界**：哪些场景能稳定成立，哪些不能\n2. **产品形态建议**：问答、Copilot、工作流、智能体，哪种更适合\n3. **资料缺口**：还需要补充哪些材料才能进入系统构建\n4. **风险边界**：哪些动作必须人工接管\n5. **进入系统构建的条件**：什么条件满足后可以进入系统构建\n\n## 使用方式\n\n当用户提供 Direction Brief 或问题方向时，自动执行：\n\n1. 检查资料准备是否充分\n2. 设计能力实验方案（先强模型看上限）\n3. 设计产品实验方案（交互与流程验证）\n4. 设计商业实验方案（价值密度验证）\n5. 建立评估 Rubric 并执行评估\n6. 沉淀失败案例和人工修正\n7. 输出实验结论报告\n\n## 示例\n\n### 示例1：AI 客服 Copilot 能力验证\n\n**场景描述**：\n基于方向定界输出的 Direction Brief，验证 AI 客服候选回复生成的能力边界。\n\n**用户输入**：\nDirection Brief：AI 客服协同系统（已完成方向定界）\n\n**Skill 执行流程**：\n\n1. **资料准备验证**\n   - 检查已有：FAQ（500条）、工单样本（1000条）、物流规则\n   - 需要补充：50条边界案例（模糊问题、多轮对话、情绪问题）\n   - 评估标准：准确性、完整性、风险识别率\n\n2. **能力实验**\n   \n   | 实验批次 | 模型 | 场景 | 准确率 | 结论 |\n   |----------|------|------|--------|------|\n   | 第1批 | GPT-4o | 订单查询 | 92% | ✅ 能力强 |\n   | 第2批 | GPT-4o | 物流异常解释 | 85% | ✅ 可用 |\n   | 第3批 | Claude 3.5 | 售后政策咨询 | 78% | ⚠️ 需资料补充 |\n   | 第4批 | GPT-4o-mini | 订单查询 | 88% | ✅ 可压缩成本 |\n\n3. **产品实验（影子验证）**\n   - 在真实会话中运行系统，输出候选回复但不发送\n   - 对比人工客服实际回复与系统建议\n   - 评估：采纳率65%，人工修改率35%\n   - 发现问题：多轮上下文丢失、异常情况处理不足\n\n4. **商业实验**\n   - 与客服主管访谈：预计节省30%培训时间\n   - 测算：首响时间从5分钟→1分钟，但人工审核增加20%\n   - 结论：净效益正向，ROI > 200%\n\n5. **失败分析**\n   \n   | 失败类型 | 数量 | 原因 | 解决方案 |\n   |----------|------|------|----------|\n   | 上下文丢失 | 12 | 会话状态未保留 | 加入记忆系统 |\n   | 敏感承诺 | 5 | 未识别价格承诺 | 增加规则拦截 |\n   | 过度承诺 | 8 | 超出政策范围 | 收紧生成边界 |\n\n**输出结果**：\n\n```markdown\n# 实验结论报告：AI 客服 Copilot\n\n## 能力边界（已验证）\n✅ 订单查询：92%准确率，可用\n✅ 物流解释：85%准确率，可用  \n⚠️ 售后政策：78%准确率，需补充资料\n❌ 投诉处理：不适合AI独立完成\n\n## 产品形态建议\n- 类型：Copilot（人工确认模式）\n- 界面：侧边栏候选回复 + 风险标记\n- 关键交互：一键采纳、快速编辑、风险提示\n\n## 资料缺口\n- 需要补充200条售后政策边界案例\n- 需要建立敏感承诺规则库\n- 需要测试集覆盖更多长尾问题\n\n## 风险边界\n- 退款、赔付相关：必须人工确认\n- 价格相关：必须引用最新数据源\n- 情感升级：自动转人工\n\n## 进入系统构建条件\n✅ 能力边界已清晰\n✅ 产品形态已验证\n⚠️ 需补充售后政策资料（预计1周）\n✅ ROI已验证正向\n```\n\n---\n\n### 示例2：AIOps 故障分诊能力验证\n\n**场景描述**：\n验证 AI 在告警聚类、日志解释、案例召回上的能力边界。\n\n**用户输入**：\nDirection Brief：AIOps 故障分诊辅助系统\n\n**Skill 执行流程**：\n\n1. **资料准备**\n   - 样本集：50个历史故障（含日志、告警、处理记录）\n   - 评估标准：召回率 > 80%，误报率 < 20%\n\n2. **分层能力实验**\n\n   **第一层：日志解释能力**\n   - 测试：100条典型日志\n   - 结果：GPT-4o 解释准确 88%，Claude 3.5 85%\n   - 结论：✅ 能力成立\n\n   **第二层：告警聚类能力**  \n   - 测试：10次真实故障的告警流（共300条）\n   - 结果：相关告警聚类准确率 82%\n   - 失败案例：跨服务依赖关系未识别\n   - 结论：⚠️ 基本可用，需改进依赖分析\n\n   **第三层：案例召回能力**\n   - 测试：新故障发生时召回历史相似案例\n   - 结果：Top3 召回准确率 75%\n   - 结论：⚠️ 可用但需优化索引策略\n\n3. **产品实验（影子验证）**\n   - 值班工程师处理故障时，系统并行输出分诊建议\n   - 对比结果：系统建议 vs 工程师实际判断\n   - 评估：采纳率55%，辅助参考率80%\n   - 关键发现：系统擅长\"看什么\"，弱于\"怎么做\"\n\n4. **商业与风险评估**\n   - 价值：平均定位时间从45分钟→25分钟\n   - 风险：2次错误归因建议（被工程师识别后忽略）\n   - 结论：高风险场景需强化边界控制\n\n5. **失败案例分析**\n\n   | 失败场景 | 原因 | 改进方向 |\n   |----------|------|----------|\n   | 新型异常未识别 | 超出历史案例库 | 建立未知异常标记机制 |\n   | 依赖关系误判 | 缺少服务拓扑数据 | 补充CMDB集成 |\n   | 时序相关故障遗漏 | 未关联时间窗口 | 加入时间序列分析 |\n\n**输出结果**：\n\n```markdown\n# 实验结论报告：AIOps 故障分诊系统\n\n## 能力边界（验证结果）\n✅ 日志解释：88%准确率\n⚠️ 告警聚类：82%准确率（依赖分析弱）\n⚠️ 案例召回：75%准确率（需优化索引）\n❌ 自动修复：明确不做（高风险）\n\n## 产品形态建议\n- 主形态：值班面板辅助（非自动执行）\n- 输出：故障摘要卡 + 相似案例 + \"建议先看\"\n- 边界：不提供操作建议，只提供信息组织\n\n## 资料缺口\n- 需要服务依赖拓扑数据\n- 需要更多跨服务故障案例\n- 需要建立异常标记与升级规则\n\n## 风险边界（高约束设计）\n- AI输出 = 建议，不是命令\n- 所有AI建议需人工确认后执行\n- 生产操作权限永不开放给AI\n- 误判路径100%可追溯\n\n## 进入系统构建条件\n✅ 三层能力通过验证\n⚠️ 需CMDB数据接入（2周）\n✅ 风险边界已明确\n✅ 影子验证完成（采纳率55%）\n```\n\n---\n\n### 示例3：法律合同审查助手能力验证\n\n**场景描述**：\n基于方向定界，验证 AI 在法律合同条款识别和风险提示上的能力边界。\n\n**用户输入**：\nDirection Brief：法律合同审查助手（限定为非最终决策，仅辅助）\n\n**Skill 执行流程**：\n\n1. **资料准备**\n   - 样本集：100份标准合同（NDA、服务协议、劳动合同）\n   - 法律条款库：常见风险条款模板\n   - 评估标准：条款识别准确率、风险判断准确率\n\n2. **分层能力实验**\n\n   **第一层：条款识别能力**\n   | 合同类型 | 测试数量 | GPT-4o | Claude 3.5 | 结论 |\n   |----------|----------|--------|------------|------|\n   | NDA保密协议 | 30份 | 90% | 88% | ✅ 可用 |\n   | 服务协议 | 40份 | 85% | 82% | ✅ 可用 |\n   | 劳动合同 | 30份 | 78% | 75% | ⚠️ 需补充 |\n\n   **第二层：风险提示能力**\n   - 测试：识别\"不对等条款\"（如单方解约权、无限责任）\n   - 结果：高风险条款识别率 82%，但部分隐蔽条款漏检\n   - 失败案例：隐含在\"其他\"条款中的风险未能识别\n\n   **第三层：成本压缩测试**\n   - GPT-4o-mini：准确率下降 8%，但成本降低 70%\n   - 结论：对于初筛场景，可使用低成本模型\n\n3. **产品实验（影子验证）**\n   - 法务专员审查合同，AI 并行分析\n   - 对比：专员实际标记 vs AI 标记\n   - 结果：\n     - AI 辅助发现额外风险点数量：平均 1.2 个/份合同\n     - 专员对 AI 建议采纳率：45%\n     - 审查时间：从 1.5小时 → 45分钟\n\n4. **失败分析**\n\n   | 失败类型 | 比例 | 原因 | 改进措施 |\n   |----------|------|------|----------|\n   | 隐含条款遗漏 | 15% | 风险不在标准条款中 | 建立隐含风险模式库 |\n   | 行业特殊条款 | 12% | 特定行业术语不理解 | 补充行业词典 |\n   | 上下文误判 | 8% | 条款组合效应未识别 | 增强上下文分析 |\n\n**输出结果**：\n\n```markdown\n# 实验结论报告：法律合同审查助手\n\n## 能力边界\n✅ 标准条款识别（NDA、服务协议）：88%+\n⚠️ 复杂合同（劳动、股权）：75-78%，需改进\n✅ 高风险条款标记：82%\n❌ 隐含风险识别：能力不足\n\n## 产品形态建议\n- Copilot 模式：并排显示原始合同 + AI 标记\n- 人机协作：AI 初筛 → 人工复核\n- 输出：checklist + 风险条款高亮 + 修改建议\n\n## 关键发现\n- 适合标准合同快速审查\n- 复杂交易合同仍需资深律师主导\n- AI 发现的问题平均 40% 被专员认可采纳\n\n## 进入系统构建条件\n⚠️ 补充200份劳动/股权合同样本\n✅ 法务团队认可边界设定\n✅ 影子验证通过\n```\n\n---\n\n### 示例4：HR 智能简历筛选助手\n\n**场景描述**：\n验证 AI 在简历解析、候选人匹配、初筛评估上的能力，需特别注意公平性和偏见问题。\n\n**用户输入**：\nDirection Brief：HR 智能简历筛选助手\n\n**Skill 执行流程**：\n\n1. **资料准备**\n   - 样本集：1000份历史简历（已脱敏去除姓名、性别、年龄）\n   - 岗位要求：5个标准岗位（Java开发、产品经理、销售等）\n   - 评估标准：匹配准确率、偏见检测\n\n2. **能力实验**\n\n   **技能点1：简历信息提取**\n   - 测试：从PDF/Word中提取结构化信息\n   - 结果：\n     - 教育背景：94% 准确率\n     - 工作经历：87% 准确率（部分非标准格式简历困难）\n     - 技能标签：79% 准确率（技能同义词识别不足）\n\n   **技能点2：岗位匹配评分**\n   - 测试：根据JD要求给候选人打分\n   - 结果：\n     - Top10 推荐命中率：68%\n     - 与 HR 专员评分相关性：0.72（中等相关）\n\n   **技能点3：偏见检测**\n   - 测试：匿名化简历 vs 完整简历的评分差异\n   - 关键发现：\n     - 去除性别信息后，技术岗男女得分无显著差异 ✅\n     - 但某些管理岗仍略有偏差 ⚠️（需持续监控）\n\n3. **产品实验**\n   - 在真实招聘流程中并行运行\n   - HR 先按原流程筛选，再看 AI 建议\n   - 结果：\n     - AI 发现\"遗漏候选人\"比例：12%\n     - 这些被遗漏候选人中，最终面试通过率：35%\n     - 说明 AI 发现了一些人类筛选中的盲点\n\n4. **公平性评估**\n\n   | 维度 | 测试结果 | 风险等级 |\n   |------|----------|----------|\n   | 性别偏见 | 无显著差异 | 🟢 低风险 |\n   | 学历偏好 | 存在过度偏好985/211 | 🟡 中风险 |\n   | 年龄相关 | 无明显年龄歧视 | 🟢 低风险 |\n   | 地域相关 | 部分地域词汇偏见 | 🟡 中风险 |\n\n**输出结果**：\n\n```markdown\n# 实验结论报告：HR 智能简历筛选助手\n\n## 能力边界\n✅ 简历信息提取：教育94%、经历87%\n⚠️ 岗位匹配：Top10命中率68%，有提升空间\n⚠️ 公平性：整体可控，但需监控学历/地域偏见\n\n## 重要发现：AI 发现人类盲点\n- AI 识别出 HR 遗漏的合格候选人 12%\n- 这些候选人面试通过率 35%\n- AI 在\"非标准背景但有潜力\"的识别上有优势\n\n## 产品形态建议\n- 初筛助手：辅助而非替代 HR 筛选\n- 盲筛模式：默认隐藏可能导致偏见的信息\n- 透明度：显示匹配依据（哪些JD要求被满足）\n- 反馈闭环：HR 驳回时标记原因，优化模型\n\n## 公平性保障措施\n- 定期偏见审计（A/B 测试）\n- 多样性指标监控\n- 申诉机制：候选人可请求人工复核\n\n## 进入系统构建条件\n⚠️ 建立偏见监控 dashboard\n✅ HR 团队培训完成（理解 AI 辅助边界）\n✅ 法务确认合规性\n```\n\n---\n\n### 示例5：内容创作智能助手（营销文案）\n\n**场景描述**：\n验证 AI 在营销文案创作上的能力，包括多风格适应、品牌一致性、合规风险检测。\n\n**用户输入**：\nDirection Brief：营销文案智能创作助手\n\n**Skill 执行流程**：\n\n1. **资料准备**\n   - 品牌资料：品牌调性指南、过往优质文案100篇\n   - 产品信息：功能清单、卖点、目标用户画像\n   - 合规资料：广告法禁用词、行业敏感词库\n\n2. **多维度能力实验**\n\n   **维度1：创作质量**\n   | 场景 | 人工评分 | 采纳率 |\n   |------|----------|--------|\n   | 社交媒体短文案（微博/小红书） | 4.2/5 | 68% |\n   | 电商详情页长文案 | 3.8/5 | 52% |\n   | 邮件营销标题 | 4.0/5 | 60% |\n   | 视频脚本 | 3.5/5 | 42% |\n\n   **维度2：品牌一致性**\n   - 测试：给定品牌调性，生成文案\n   - 评估：品牌团队判断是否符合调性\n   - 结果：符合率 73%，主要偏差在情感强度控制\n\n   **维度3：合规风险**\n   - 测试：100篇 AI 生成文案的合规检测\n   - 结果：\n     - 检出禁用词：准确率 95%\n     - 夸大宣传：检出率 60%（部分较为隐蔽）\n     - 竞品对比：合规性 100%（无不当对比）\n\n3. **风格适应实验**\n   - 同一产品，生成不同风格文案\n   - 结果：风格区分度明显，但在\"高级 but 接地气\"的平衡上仍有困难\n\n4. **A/B 测试（影子验证）**\n   - 选择 20% 流量，对比 AI 文案 vs 人工文案\n   - 结果：\n     - 点击率：AI 文案 3.2% vs 人工 3.5%（略低）\n     - 转化率：AI 文案 1.8% vs 人工 2.1%（略低）\n     - 但生成速度：AI 平均 2分钟 vs 人工平均 2小时\n\n5. **失败分析**\n\n   | 问题类型 | 描述 | 改进方向 |\n   |----------|------|----------|\n   | 同质化 | 多个产品文案风格过于相似 | 增强产品差异化输入 |\n   | 情感过度 | 有时过于夸张 | 细化情感强度控制 |\n   | 长尾场景 | 小众产品理解不足 | 补充小众样本 |\n\n**输出结果**：\n\n```markdown\n# 实验结论报告：内容创作智能助手\n\n## 能力边界\n✅ 短文案创作：质量4.2/5，可用\n⚠️ 长文案详情页：质量3.8/5，需改进\n⚠️ 品牌一致性：73%，需调优\n✅ 合规检测：禁用词检出率95%\n\n## 关键发现\n- 效率优势：2分钟 vs 2小时（60倍提升）\n- 质量差距：点击率和转化率略低（-10%）\n- 适用场景：更适合批量、快速、标准化文案\n- 不适合：品牌大推、需要深度创意的campaign\n\n## 产品形态建议\n- 初稿生成：AI 快速产出多版本草稿\n- 人工精修：创作者在 AI 基础上优化\n- 合规预检：发布前自动检测风险\n- 风格模板：提供多风格快速切换\n\n## 商业模式\n- 内部赋能：提升创作团队效率\n- 外部售卖：小型商家自助生成基础文案\n\n## 进入系统构建条件\n✅ 品牌团队认可质量标准\n⚠️ 建立质量反馈闭环机制\n✅ 法务确认合规流程\n```","tags":["experiment","engine","native","product","agent","skills","gmaxxxie","agent-skills","ai-agent","ai-native","ai-product","methodology"],"capabilities":["skill","source-gmaxxxie","skill-p2-experiment-engine","topic-agent-skills","topic-ai-agent","topic-ai-native","topic-ai-product","topic-methodology","topic-product-management","topic-product-methodology","topic-product-thinking","topic-skills"],"categories":["ai-native-product-agent-skills"],"synonyms":[],"warnings":[],"endpointUrl":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/p2-experiment-engine","protocol":"skill","transport":"skills-sh","auth":{"type":"none","details":{"cli":"npx skills add gmaxxxie/ai-native-product-agent-skills","source_repo":"https://github.com/gmaxxxie/ai-native-product-agent-skills","install_from":"skills.sh"}},"qualityScore":"0.478","qualityRationale":"deterministic score 0.48 from registry signals: · indexed on github topic:agent-skills · 56 github stars · SKILL.md body (8,609 chars)","verified":false,"liveness":"unknown","lastLivenessCheck":null,"agentReviews":{"count":0,"score_avg":null,"cost_usd_avg":null,"success_rate":null,"latency_p50_ms":null,"narrative_summary":null,"summary_updated_at":null},"enrichmentModel":"deterministic:skill-github:v1","enrichmentVersion":1,"enrichedAt":"2026-05-18T18:57:31.963Z","embedding":null,"createdAt":"2026-05-01T01:02:58.685Z","updatedAt":"2026-05-18T18:57:31.963Z","lastSeenAt":"2026-05-18T18:57:31.963Z","tsv":"'-10':1054 '-78':682 '/5':926,930,934,938 '/claude':92 '/word':752 '0.72':777 '1':57,86,169,195,235,397,557,731,903 '1.2':639 '1.5':648 '1.8':1004 '100':967 '1000份历史简历':734 '1000条':241 '100份标准合同':560 '100条典型日志':414 '100篇':954 '10次真实故障的告警流':429 '12':319,662,803,850 '15':658 '1分钟':306 '2':62,95,173,197,252,409,569,746,915 '2.1':1007 '20':408,985 '200':311 '25分钟':470 '2分钟':1012,1048 '2周':538 '2小时':1015,1050 '2次错误归因建议':472 '3':68,98,180,200,287,449,624,790,969 '3.2':996 '3.5':275,422,579,937,999 '3.8':929 '30份':582,592 '35':806,852 '4':74,183,203,299,466,651,810,980 '4.0':933 '4.2':925 '40':707 '40份':587 '42':939 '45':645 '45分钟':650 '4o':91,262,269,282,418,577,615 '5':186,206,312,323,476,1016 '500条':239 '50个历史故障':400 '50条边界案例':244 '52':931 '5个标准岗位':739 '6':210 '60':935,963 '60倍提升':1051 '68':773,927 '7':212 '70':620 '73':949,1042 '75':446,505,594,681 '78':277,347,593 '79':763 '8':327,618,666 '80':406 '82':433,501,589,605,685 '85':271,343,423,588 '87':759 '88':285,420,498,584,677 '90':583 '92':264,339 '94':756 '95':960 'a/b':873,981 'ai':2,6,11,23,30,102,216,225,230,333,386,547,628,633,636,643,692,695,705,719,796,799,808,844,846,853,884,892,955,988,994,1002,1010,1064,1068 'ai-native-experiment-engin':1 'aiop':382,393,493 'ai输出':528 'brief':192,223,229,392,551,726,899 'busi':37 'capabl':27 'checklist':699 'claud':274,421,578 'copilot':127,176,218,335,354,689 'dashboard':880 'demo':111,117,123 'direct':191,222,228,391,550,725,898 'engin':5 'evalu':41 'experi':4,28,34,38 'faq':238 'gpt':90,261,268,281,417,576,614 'gpt-4o':89,260,267,416,575 'gpt-4o-mini':280,613 'hr':715,727,775,793,830,848,860,868,881 'java开发':740 'markdown':331,491,670,828,1031 'mini':283,616 'nativ':3,7,12 'nda':561,675 'nda保密协议':581 'opus':93 'product':33 'roi':310 'roi已验证正向':380 'rubric':76,155,208 'skill':10,14,233,395,555,729,901 'skill-p2-experiment-engine' 'sop':64 'source-gmaxxxie' 'top10':771 'top10命中率68':837 'top3':444 'topic-agent-skills' 'topic-ai-agent' 'topic-ai-native' 'topic-ai-product' 'topic-methodology' 'topic-product-management' 'topic-product-methodology' 'topic-product-thinking' 'topic-skills' 'vs':456,632,783,990,997,1005,1013,1049 '一键采纳':360 '三层能力通过验证':536 '上下文丢失':318 '上下文误判':665 '不对等条款':600 '不提供操作建议':520 '不是命令':530 '不能做到自动化':106 '不适合':1059 '不适合ai独立完成':351 '与':774 '与客服主管访谈':301 '与现有解决方案的成本对比':148 '专员实际标记':631 '专员对':642 '专员评分相关性':776 '专家经验':67 '个':640 '中提取结构化信息':753 '中等相关':778 '中风险':820,826 '主形态':512 '主要偏差在情感强度控制':950 '也没有足够高的价值密度':108 '交互与流程验证':202 '产品信息':908 '产品实验':32,48,136,288,450,625,791 '产品形态已验证':377 '产品形态建议':174,352,511,688,857,1062 '产品文档':61 '产品方法论':8 '产品经理':741 '人工':998,1006 '人工修改率35':295 '人工复核':697 '人工平均':1014 '人工接管点':114 '人工文案':991 '人工确认模式':355 '人工精修':1066 '人工评分':920 '人机协作':694 '什么条件满足后可以进入系统构建':188 '什么算可接受':79,158 '什么算对':77 '什么算错':78,157 '仅辅助':554 '从':647 '从pdf':751 '价值':468 '价值密度验证':205 '价格相关':371 '任务完成率和满意度':141 '任务流程':112 '份合同':641 '优化模型':870 '会话状态未保留':320 '但人工审核增加20':307 '但在':975 '但成本降低':619 '但某些管理岗仍略有偏差':788 '但生成速度':1009 '但部分隐蔽条款漏检':606 '但需监控学历':841 '低风险':817,823 '使用场景':15 '使用方式':189 '依赖关系误判':484 '依赖分析弱':503 '侧边栏候选回复':357 '修改建议':701 '候选人匹配':721 '候选人可请求人工复核':877 '值班工程师处理故障时':452 '值班面板辅助':513 '偏见检测':745,780 '先强模型看上限':199 '先按原流程筛选':794 '先用最强模型':87 '先用最强模型看天花板':47 '先看能力上限':84 '公平性':839 '公平性保障措施':871 '公平性评估':811 '公开规则':60 '共300条':430 '关键交互':359 '关键发现':461,702,785,1046 '其他':609 '内容创作智能助手':888,1033 '内部业务资料':63 '内部赋能':1075 '再压缩成本':85 '再用更便宜模型测试能否保住目标效果':97 '再看':795 '净效益正向':309 '准确性':249 '准确率':257,340,344,348,499,502,506,757,760,764,959 '准确率下降':617 '分层能力实验':410,570 '分类':119 '创作者在':1067 '创作质量':918 '初稿生成':1063 '初筛':696 '初筛助手':858 '初筛评估上的能力':722 '到底能做到什么深度':103 '功能清单':909 '功能类':116 '加入时间序列分析':489 '加入记忆系统':321 '劳动':679 '劳动合同':563,591 '包括多风格适应':894 '匹配准确率':744 '匿名化简历':782 '单页界面':124 '卖点':910 '历史工单':65 '原则':83 '原因':316,479,655 '去除性别信息后':786 '反馈闭环':867 '发布前自动检测风险':1071 '发现':800 '发现了一些人类筛选中的盲点':809 '发现人类盲点':845 '发现的问题平均':706 '发现问题':296 '只提供信息组织':521 '召回准确率':445 '召回率':405 '可使用低成本模型':623 '可压缩成本':286 '可放弃':20 '可比较':19 '可用':272,341,345,585,590,1037 '可用但需优化索引策略':448 '可继承的实验体系':21 '可追溯':534 '合同类型':573 '合规性':966 '合规检测':1044 '合规资料':912 '合规预检':1070 '合规风险':952 '合规风险检测':896 '同一产品':971 '同质化':1021 '含日志':401 '告警':402 '告警聚类':500 '告警聚类能力':427 '品牌一致性':895,941,1041 '品牌团队判断是否符合调性':946 '品牌团队认可质量标准':1080 '品牌大推':1060 '品牌调性指南':906 '品牌资料':905 '哪些jd要求被满足':866 '哪些不能':162,172 '哪些动作必须人工接管':185 '哪些场景即使技术可行':107 '哪些场景只能做到辅助':105 '哪些场景能够稳定成立':104 '哪些场景能稳定成立':161,171 '哪些已经有机会进入产品化':165 '哪些能力只适合做建议':164 '哪些问题资料还不够':163 '哪种更适合':179 '售后政策':346 '售后政策咨询':276 '商业与风险评估':467 '商业实验':36,50,143,300 '商业模式':1074 '团队培训完成':882 '在':854 '在告警聚类':387 '在法律合同条款识别和风险提示上的能力边界':548 '在真实会话中运行系统':290 '在真实招聘流程中并行运行':792 '在简历解析':720 '在营销文案创作上的能力':893 '地域偏见':842 '地域相关':824 '场景':256,919 '场景扩展可能性':147 '场景描述':220,384,544,717,890 '培训时间':303 '基于方向定界':545 '基于方向定界输出的':221 '基本可用':437 '基础上优化':1069 '增加规则拦截':325 '增强上下文分析':668 '增强产品差异化输入':1023 '处理记录':403 '复杂交易合同仍需资深律师主导':704 '复杂合同':678 '外部售卖':1077 '外部资料':58 '多个产品文案风格过于相似':1022 '多样性指标监控':875 '多维度能力实验':916 '多轮上下文丢失':297 '多轮对话':246 '失败分析':313,652,1017 '失败分析是实验最重要的产物':160 '失败场景':478 '失败处理':134 '失败案例':434,607 '失败案例分析':477 '失败案例应该被沉淀为下一轮优化的输入':166 '失败类型':314,653 '夸大宣传':961 '如':88 '如单方解约权':601 '如果最强模型也无法达到可接受水平':99 '存在过度偏好985/211':819 '学历偏好':818 '完整性':250 '完整简历的评分差异':784 '定期偏见审计':872 '实验产物':109 '实验批次':254 '实验结论报告':168,332,492,671,829,1032 '审批逻辑':115 '审查时间':646 '客户是否愿意付费试点':145 '客服':217,334 '客服候选回复生成的能力边界':226 '客服协同系统':231 '对于初筛场景':622 '对比':630,987 '对比人工客服实际回复与系统建议':292 '对比结果':454 '对照和失败案例判断能力是否成立':43,153 '对话记录':66 '小众产品理解不足':1028 '小型商家自助生成基础文案':1078 '小时':649 '小红书':924 '岗位匹配':836 '岗位匹配评分':767 '岗位要求':738 '工作台原型':125 '工作流':177 '工作经历':758 '工单样本':240 '工程师实际判断':457 '已完成方向定界':232 '已脱敏去除姓名':735 '已验证':337 '常见风险条款模板':565 '平均':638,1011 '平均定位时间从45分钟':469 '年龄':737 '年龄相关':821 '并执行评估':209 '并排显示原始合同':691 '并行分析':629 '广告法禁用词':913 '应该放弃或重新定义问题':100 '建立偏见监控':879 '建立未知异常标记机制':483 '建立评估':154,207 '建立质量反馈闭环机制':1081 '建立隐含风险模式库':660 '建议':529,797 '建议先看':518 '建议采纳率':644 '异常情况处理不足':298 '弱于':464 '归因':120 '当用户提供':190 '影子验证':289,451,626,983 '影子验证完成':540 '影子验证通过':713 '微博':923 '必须人工确认':370 '必须引用最新数据源':372 '快速':1057 '快速产出多版本草稿':1065 '快速编辑':361 '怎么做':465 '性别':736 '性别偏见':815 '情感升级':373 '情感过度':1024 '情绪问题':247 '成本压缩测试':612 '或问题方向时':193 '所有ai建议需人工确认后执行':531 '执行流程':234,396,556,730,902 '技术岗男女得分无显著差异':787 '技能同义词识别不足':765 '技能标签':762 '技能点1':748 '技能点2':766 '技能点3':779 '投诉处理':350 '接口草稿':132 '接地气':978 '推荐命中率':772 '描述':1019 '提供多风格快速切换':1073 '提升创作团队效率':1076 '收紧生成边界':329 '改进措施':656 '改进方向':480,1020 '故障分诊系统':494 '故障分诊能力验证':383 '故障分诊辅助系统':394 '故障摘要卡':516 '效率优势':1047 '敏感承诺':322 '教育94':834 '教育背景':755 '数量':315 '整体可控':840 '文案':989,995,1003 '新型异常未识别':481 '新故障发生时召回历史相似案例':442 '方向定界已完成':16 '无不当对比':968 '无明显年龄歧视':822 '无显著差异':816 '无限责任':602 '日志解释':388,497 '日志解释能力':412 '时序相关故障遗漏':487 '明确不做':509 '明确什么算对':156 '显示匹配依据':865 '智能体':178 '智能简历筛选助手':716,728,831 '更适合批量':1056 '最终面试通过率':805 '有提升空间':838 '有时过于夸张':1025 '服务协议':562,586,676 '未关联时间窗口':488 '未识别价格承诺':324 '条款中的风险未能识别':610 '条款组合效应未识别':667 '条款识别准确率':567 '条款识别能力':572 '标准化文案':1058 '标准条款识别':674 '标记':634,693 '样本集':69,399,559,733 '核心概念':25 '根据jd要求给候选人打分':769 '案例召回':504 '案例召回上的能力边界':389 '案例召回能力':440 '检出率':962 '检出禁用词':958 '检查已有':237 '检查资料准备是否充分':196 '模块':131 '模型':255 '模式':690 '模糊问题':245 '正例':70 '每次实验都应有可量化的评估结果':159 '比例':654,802 '沉淀失败案例和人工修正':211 '没有资料准备的实验会漂浮':80 '法务专员审查合同':627 '法务团队认可边界设定':712 '法务确认合规性':886 '法务确认合规流程':1082 '法律合同审查助手':552,672 '法律合同审查助手能力验证':543 '法律条款库':564 '流程类':110 '流量':986 '测算':304 '测试':413,428,441,598,750,768,781,874,942,953,982 '测试数量':574 '测试结果':813 '测试能力天花板':94 '点击率':993 '点击率和转化率略低':1053 '物流异常解释':270 '物流规则':242 '物流解释':342 '特定行业术语不理解':663 '理解':883 '生产操作权限永不开放给ai':532 '生成不同风格文案':972 '生成建议':121 '生成文案':944 '生成文案的合规检测':956 '用户如何纠偏或确认':140 '用户如何表达目标':138 '用户输入':227,390,549,724,897 '用样本':42,152 '申诉机制':876 '电商详情页长文案':928 '界面':356 '界面类':122 '略低':1000,1008 '的平衡上仍有困难':979 '的识别上有优势':856 '目标用户画像':911 '盲筛模式':862 '相似案例':517 '相关告警聚类准确率':432 '看什么':463 '短文案创作':1035 '确定能力上限足够高后':96 '示例':214 '示例1':215 '示例2':381 '示例3':542 '示例4':714 '示例5':887 '社交媒体短文案':922 '禁用词检出率95':1045 '竞品对比':965 '符合率':948 '第1批':259 '第2批':266 '第3批':273 '第4批':279 '第一层':411,571 '第一步':54 '第三层':439,611 '第三步':135 '第二层':426,596 '第二步':81 '第五步':149 '第四步':142 '筛选':861 '简历信息提取':749,833 '类型':353 '系统如何展示状态和建议':139 '系统并行输出分诊建议':453 '系统建议':455 '系统擅长':462 '系统说明文档':129 '细化情感强度控制':1026 '经历87':835 '结果':415,431,443,603,635,754,770,798,947,957,973,992 '结论':258,308,424,436,447,474,580,621 '给定品牌调性':943 '续期意愿如何':146 '维度':812 '维度1':917 '维度2':940 '维度3':951 '缺少服务拓扑数据':485 '股权':680 '股权合同样本':711 '能力不足':687 '能力在真实任务中是否成立':24,31 '能力实验':26,46,82,253,747 '能力实验要验证的问题':101 '能力强':265 '能力成立':425 '能力边界':170,336,495,673,832,1034 '能力边界已清晰':376 '能力验证':219 '自动修复':508 '自动执行':194 '自动转人工':374 '节点跳转':113 '营销文案':889 '营销文案智能创作助手':900 '行业敏感词库':914 '行业特殊条款':661 '行业知识':59 '补充200份劳动':710 '补充cmdb集成':486 '补充小众样本':1029 '补充行业词典':664 '表单交互或':126 '被专员认可采纳':708 '被工程师识别后忽略':473 '视频脚本':936 '解决方案':317 '解释准确':419 '订单查询':263,284,338 '设计产品实验方案':201 '设计商业实验方案':204 '设计能力实验方案':198 '评估':40,293,458,945 '评估不是看主观感觉':151 '评估与失败分析':52,150 '评估方式':133 '评估标准':75,248,404,566,743 '识别':599 '识别出':847 '试验前必须准备':56 '试验展开':13 '试验展开流程':44 '试验展开阶段的实操':9 '误判路径100':533 '误报率':407 '说明':807 '负例':71 '质量3.8/5':1039 '质量4.2/5':1036 '质量差距':1052 '资料准备':45,55,398,558,732,904 '资料准备验证':236 '资料缺口':181,363,522 '赔付相关':369 '超出历史案例库':482 '超出政策范围':328 '跨服务依赖关系未识别':435 '转化率':1001 '辅助参考率80':460 '辅助发现额外风险点数量':637 '辅助而非替代':859 '辅助边界':885 '输出':515,698 '输出候选回复但不发送':291 '输出实验结论报告':53,213 '输出物':167 '输出结果':330,490,669,827,1030 '边界':130,519 '边界案例':72 '过度承诺':326 '过往优质文案100篇':907 '还需要补充哪些材料才能进入系统构建':182 '这些候选人面试通过率':851 '这些被遗漏候选人中':804 '进入系统构建条件':375,535,709,878,1079 '进入系统构建的条件':187 '退款':368 '适合标准合同快速审查':703 '适用场景':1055 '选择':984 '透明度':864 '遗漏候选人':801 '遗漏的合格候选人':849 '邮件营销标题':932 '部分地域词汇偏见':825 '部分较为隐蔽':964 '部分非标准格式简历困难':761 '采纳率':921 '采纳率55':459,541 '采纳率65':294 '重要发现':843 '销售等':742 '长尾场景':1027 '长尾问题':73 '长文案详情页':1038 '问答':118,175 '问题类型':1018 '限定为非最终决策':553 '隐含在':608 '隐含条款遗漏':657 '隐含风险识别':686 '需cmdb数据接入':537 '需优化索引':507 '需持续监控':789 '需改进':683,1040 '需改进依赖分析':438 '需特别注意公平性和偏见问题':723 '需补充':595 '需补充售后政策资料':378 '需补充资料':349 '需要判断某个':22 '需要建立异常标记与升级规则':525 '需要建立敏感承诺规则库':365 '需要更多跨服务故障案例':524 '需要服务依赖拓扑数据':523 '需要测试集覆盖更多长尾问题':366 '需要深度创意的campaign':1061 '需要补充':243 '需要补充200条售后政策边界案例':364 '需要设计一组可验证':18 '需要进入实验验证阶段':17 '需调优':1043 '需资料补充':278 '非标准背景但有潜力':855 '非自动执行':514 '面板':128 '预计1周':379 '预计节省30':302 '风格区分度明显':974 '风格模板':1072 '风格适应实验':970 '风险':471 '风险不在标准条款中':659 '风险判断准确率':568 '风险提示':362 '风险提示能力':597 '风险条款高亮':700 '风险标记':358 '风险等级':814 '风险识别率':251 '风险边界':184,367,526 '风险边界已明确':539 '首响时间从5分钟':305 '驳回时标记原因':869 '验证':224,385,546,718,891 '验证交互和流程':49 '验证价值密度':144 '验证价值密度和付费意愿':51 '验证客户是否愿意为这类能力投入预算或试点资源':39 '验证某项':29 '验证用户是否愿意以某种交互或流程使用这项能力':35,137 '验证结果':496 '高约束设计':527 '高级':976 '高风险':510 '高风险场景需强化边界控制':475 '高风险条款标记':684 '高风险条款识别率':604 '默认隐藏可能导致偏见的信息':863","prices":[{"id":"26651d1c-159b-4519-8e6b-f72a6d5911b2","listingId":"85a29ce6-919a-4a1d-a742-bad42e2c0839","amountUsd":"0","unit":"free","nativeCurrency":null,"nativeAmount":null,"chain":null,"payTo":null,"paymentMethod":"skill-free","isPrimary":true,"details":{"org":"gmaxxxie","category":"ai-native-product-agent-skills","install_from":"skills.sh"},"createdAt":"2026-05-01T01:02:58.685Z"}],"sources":[{"listingId":"85a29ce6-919a-4a1d-a742-bad42e2c0839","source":"github","sourceId":"gmaxxxie/ai-native-product-agent-skills/p2-experiment-engine","sourceUrl":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/p2-experiment-engine","isPrimary":false,"firstSeenAt":"2026-05-01T01:02:58.685Z","lastSeenAt":"2026-05-18T18:57:31.963Z"}],"details":{"listingId":"85a29ce6-919a-4a1d-a742-bad42e2c0839","quickStartSnippet":null,"exampleRequest":null,"exampleResponse":null,"schema":null,"openapiUrl":null,"agentsTxtUrl":null,"citations":[],"useCases":[],"bestFor":[],"notFor":[],"kindDetails":{"org":"gmaxxxie","slug":"p2-experiment-engine","github":{"repo":"gmaxxxie/ai-native-product-agent-skills","stars":56,"topics":["agent-skills","ai-agent","ai-native","ai-product","methodology","product-management","product-methodology","product-thinking","skills"],"license":null,"html_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills","pushed_at":"2026-05-06T07:19:36Z","description":"AI Native Product Methodology — 80 executable skills across P0-P14 stages, covering needs discovery to aesthetic authority. From 8 books.","skill_md_sha":"4965f34be95b4b9848ac0690e5735a7aa1c9f1e3","skill_md_path":"skills/p2-experiment-engine/SKILL.md","default_branch":"main","skill_tree_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/p2-experiment-engine"},"layout":"multi","source":"github","category":"ai-native-product-agent-skills","frontmatter":{"name":"ai-native-experiment-engine","description":"'AI Native 产品方法论——试验展开阶段的实操 Skill。"},"skills_sh_url":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/p2-experiment-engine"},"updatedAt":"2026-05-18T18:57:31.963Z"}}