{"id":"becea876-2b7a-4b15-be7b-f8692e2cc1bf","shortId":"b7fgWH","kind":"skill","title":"ai-native-experiment-engine","tagline":"AI Native 产品方法论——试验展开阶段的实操 Skill。\n用户提供 Direction Brief 或问题方向，Skill 自动执行试验展开流程：\n资料准备 → 能力实验 → 产品实验 → 商业实验 → 评估与失败分析 → 输出实验结论报告。\n覆盖《AI Native 产品方法论》第06-10章。","description":"# AI Native 试验展开 Skill\n\n## 触发条件\n\n当用户提供 Direction Brief 或已通过方向定界的问题方向，需要进入实验验证阶段时，触发此 Skill。\n\n## 使用场景\n\n- 方向定界已完成，需要进入实验验证阶段\n- 需要设计一组可验证、可比较、可放弃、可继承的实验体系\n- 需要判断某个 AI 能力在真实任务中是否成立\n\n## 执行步骤\n\n1. **资料准备**：准备外部资料、内部业务资料、样本集（正例/负例/边界案例）和评估标准（Rubric）。\n2. **能力实验**：先用最强模型测试能力天花板，确定上限后用更便宜模型测试成本压缩空间。\n3. **产品实验**：验证用户是否愿意以某种交互或流程使用这项能力，评估任务完成率和满意度。\n4. **商业实验**：验证客户是否愿意付费试点，评估续期意愿和场景扩展可能性。\n5. **评估与失败分析**：用样本、对照和失败案例判断能力是否成立，沉淀失败模式为下一轮优化输入。\n6. **输出实验结论报告**：整合能力边界、产品形态建议、资料缺口、风险边界和进入系统构建的条件。\n\n## 整合子方法（原 p2a–p2e）\n\n### p2a: 试验展开概述\n从 Direction Brief 出发，执行资料准备评估→三层实验体系设计（能力/产品/商业）→评估 Rubric 建立→实验节奏规划，输出试验展开总体方案。确保每轮实验可验证、可比较、可放弃、可继承。\n\n### p2b: 产品形态探索\n在能力实验结论基础上，通过能力边界分析→交互原型设计→工作流嵌入测试→产品形态判断，用实验驱动设计（而非拍脑袋）决定最终形态：问答、Copilot、工作流还是 Agent。\n\n### p2c: 流程重构与任务设计\n产品形态确定后，执行任务拆解→人机协作模式选择（助手/协同/自主）→工作流设计→节点标注（Human-in-the-Loop vs on-the-Loop）→验证与迭代，输出流程重构方案。\n\n### p2d: 目标收敛与产品决策\n多轮实验完成后，整理实验记录→证据对比分析→收敛信号识别（稳定成功率/清晰边界/用户接受度/价值密度）→做出继续/延后/转向/停止的产品决策，输出收敛报告。\n\n### p2e: 影子验证\n收敛决策后，设计影子系统→与人工流程并行运行→建立人工对比机制→沉淀失败模式→为审计放行准备真实可量化证据。影子验证是离线评估与灰度上线之间的关键桥梁。\n\n## 核心概念\n\n- **能力实验（Capability Experiment）**：验证某项 AI 能力在真实任务中是否成立\n- **产品实验（Product Experiment）**：验证用户是否愿意以某种交互或流程使用这项能力\n- **商业实验（Business Experiment）**：验证客户是否愿意为这类能力投入预算或试点资源\n- **评估（Evaluation）**：用样本、对照和失败案例判断能力是否成立\n\n## 试验展开流程\n\n```\n资料准备\n  → 能力实验（先用最强模型看天花板）\n    → 产品实验（验证交互和流程）\n      → 商业实验（验证价值密度和付费意愿）\n        → 评估与失败分析\n          → 输出实验结论报告\n```\n\n## 第一步：资料准备\n\n试验前必须准备：\n\n1. **外部资料**：行业知识、公开规则、产品文档\n2. **内部业务资料**：SOP、历史工单、对话记录、专家经验\n3. **样本集**：正例、负例、边界案例、长尾问题\n4. **评估标准（Rubric）**：什么算对、什么算错、什么算可接受\n\n没有资料准备的实验会漂浮。\n\n## 第二步：能力实验\n\n### 原则：先看能力上限，再压缩成本\n\n1. 先用最强模型（如 GPT-4o/Claude Opus）测试能力天花板\n2. 确定能力上限足够高后，再用更便宜模型测试能否保住目标效果\n3. 如果最强模型也无法达到可接受水平，应该放弃或重新定义问题\n\n### 能力实验要验证的问题\n\n- AI 到底能做到什么深度\n- 哪些场景能够稳定成立\n- 哪些场景只能做到辅助，不能做到自动化\n- 哪些场景即使技术可行，也没有足够高的价值密度\n\n### 实验产物\n\n- 流程类 demo：任务流程、节点跳转、人工接管点、审批逻辑\n- 功能类 demo：问答、分类、归因、生成建议\n- 界面类 demo：单页界面、工作台原型、表单交互或 Copilot 面板\n- 系统说明文档：边界、模块、接口草稿、评估方式、失败处理\n\n## 第三步：产品实验\n\n验证用户是否愿意以某种交互或流程使用这项能力：\n\n- 用户如何表达目标\n- 系统如何展示状态和建议\n- 用户如何纠偏或确认\n- 任务完成率和满意度\n\n## 第四步：商业实验\n\n验证价值密度：\n\n- 客户是否愿意付费试点\n- 续期意愿如何\n- 场景扩展可能性\n- 与现有解决方案的成本对比\n\n## 第五步：评估与失败分析\n\n### 评估不是看主观感觉\n\n- 用样本、对照和失败案例判断能力是否成立\n- 建立评估 Rubric：明确什么算对、什么算错、什么算可接受\n- 每次实验都应有可量化的评估结果\n\n### 失败分析是实验最重要的产物\n\n- 哪些场景能稳定成立，哪些不能\n- 哪些问题资料还不够\n- 哪些能力只适合做建议，哪些已经有机会进入产品化\n- 失败案例应该被沉淀为下一轮优化的输入\n\n## 输出物：实验结论报告\n\n1. **能力边界**：哪些场景能稳定成立，哪些不能\n2. **产品形态建议**：问答、Copilot、工作流、智能体，哪种更适合\n3. **资料缺口**：还需要补充哪些材料才能进入系统构建\n4. **风险边界**：哪些动作必须人工接管\n5. **进入系统构建的条件**：什么条件满足后可以进入系统构建\n\n## 使用方式\n\n当用户提供 Direction Brief 或问题方向时，自动执行：\n\n1. 检查资料准备是否充分\n2. 设计能力实验方案（先强模型看上限）\n3. 设计产品实验方案（交互与流程验证）\n4. 设计商业实验方案（价值密度验证）\n5. 建立评估 Rubric 并执行评估\n6. 沉淀失败案例和人工修正\n7. 输出实验结论报告\n\n## 示例\n\n### 示例1：AI 客服 Copilot 能力验证\n\n**场景描述**：\n基于方向定界输出的 Direction Brief，验证 AI 客服候选回复生成的能力边界。\n\n**用户输入**：\nDirection Brief：AI 客服协同系统（已完成方向定界）\n\n**Skill 执行流程**：\n\n1. **资料准备验证**\n   - 检查已有：FAQ（500条）、工单样本（1000条）、物流规则\n   - 需要补充：50条边界案例（模糊问题、多轮对话、情绪问题）\n   - 评估标准：准确性、完整性、风险识别率\n\n2. **能力实验**\n   \n   | 实验批次 | 模型 | 场景 | 准确率 | 结论 |\n   |----------|------|------|--------|------|\n   | 第1批 | GPT-4o | 订单查询 | 92% | ✅ 能力强 |\n   | 第2批 | GPT-4o | 物流异常解释 | 85% | ✅ 可用 |\n   | 第3批 | Claude 3.5 | 售后政策咨询 | 78% | ⚠️ 需资料补充 |\n   | 第4批 | GPT-4o-mini | 订单查询 | 88% | ✅ 可压缩成本 |\n\n3. **产品实验（影子验证）**\n   - 在真实会话中运行系统，输出候选回复但不发送\n   - 对比人工客服实际回复与系统建议\n   - 评估：采纳率65%，人工修改率35%\n   - 发现问题：多轮上下文丢失、异常情况处理不足\n\n4. **商业实验**\n   - 与客服主管访谈：预计节省30%培训时间\n   - 测算：首响时间从5分钟→1分钟，但人工审核增加20%\n   - 结论：净效益正向，ROI > 200%\n\n5. **失败分析**\n   \n   | 失败类型 | 数量 | 原因 | 解决方案 |\n   |----------|------|------|----------|\n   | 上下文丢失 | 12 | 会话状态未保留 | 加入记忆系统 |\n   | 敏感承诺 | 5 | 未识别价格承诺 | 增加规则拦截 |\n   | 过度承诺 | 8 | 超出政策范围 | 收紧生成边界 |\n\n**输出结果**：\n\n```markdown\n# 实验结论报告：AI 客服 Copilot\n\n## 能力边界（已验证）\n✅ 订单查询：92%准确率，可用\n✅ 物流解释：85%准确率，可用  \n⚠️ 售后政策：78%准确率，需补充资料\n❌ 投诉处理：不适合AI独立完成\n\n## 产品形态建议\n- 类型：Copilot（人工确认模式）\n- 界面：侧边栏候选回复 + 风险标记\n- 关键交互：一键采纳、快速编辑、风险提示\n\n## 资料缺口\n- 需要补充200条售后政策边界案例\n- 需要建立敏感承诺规则库\n- 需要测试集覆盖更多长尾问题\n\n## 风险边界\n- 退款、赔付相关：必须人工确认\n- 价格相关：必须引用最新数据源\n- 情感升级：自动转人工\n\n## 进入系统构建条件\n✅ 能力边界已清晰\n✅ 产品形态已验证\n⚠️ 需补充售后政策资料（预计1周）\n✅ ROI已验证正向\n```\n\n---\n\n### 示例2：AIOps 故障分诊能力验证\n\n**场景描述**：\n验证 AI 在告警聚类、日志解释、案例召回上的能力边界。\n\n**用户输入**：\nDirection Brief：AIOps 故障分诊辅助系统\n\n**Skill 执行流程**：\n\n1. **资料准备**\n   - 样本集：50个历史故障（含日志、告警、处理记录）\n   - 评估标准：召回率 > 80%，误报率 < 20%\n\n2. **分层能力实验**\n\n   **第一层：日志解释能力**\n   - 测试：100条典型日志\n   - 结果：GPT-4o 解释准确 88%，Claude 3.5 85%\n   - 结论：✅ 能力成立\n\n   **第二层：告警聚类能力**  \n   - 测试：10次真实故障的告警流（共300条）\n   - 结果：相关告警聚类准确率 82%\n   - 失败案例：跨服务依赖关系未识别\n   - 结论：⚠️ 基本可用，需改进依赖分析\n\n   **第三层：案例召回能力**\n   - 测试：新故障发生时召回历史相似案例\n   - 结果：Top3 召回准确率 75%\n   - 结论：⚠️ 可用但需优化索引策略\n\n3. **产品实验（影子验证）**\n   - 值班工程师处理故障时，系统并行输出分诊建议\n   - 对比结果：系统建议 vs 工程师实际判断\n   - 评估：采纳率55%，辅助参考率80%\n   - 关键发现：系统擅长\"看什么\"，弱于\"怎么做\"\n\n4. **商业与风险评估**\n   - 价值：平均定位时间从45分钟→25分钟\n   - 风险：2次错误归因建议（被工程师识别后忽略）\n   - 结论：高风险场景需强化边界控制\n\n5. **失败案例分析**\n\n   | 失败场景 | 原因 | 改进方向 |\n   |----------|------|----------|\n   | 新型异常未识别 | 超出历史案例库 | 建立未知异常标记机制 |\n   | 依赖关系误判 | 缺少服务拓扑数据 | 补充CMDB集成 |\n   | 时序相关故障遗漏 | 未关联时间窗口 | 加入时间序列分析 |\n\n**输出结果**：\n\n```markdown\n# 实验结论报告：AIOps 故障分诊系统\n\n## 能力边界（验证结果）\n✅ 日志解释：88%准确率\n⚠️ 告警聚类：82%准确率（依赖分析弱）\n⚠️ 案例召回：75%准确率（需优化索引）\n❌ 自动修复：明确不做（高风险）\n\n## 产品形态建议\n- 主形态：值班面板辅助（非自动执行）\n- 输出：故障摘要卡 + 相似案例 + \"建议先看\"\n- 边界：不提供操作建议，只提供信息组织\n\n## 资料缺口\n- 需要服务依赖拓扑数据\n- 需要更多跨服务故障案例\n- 需要建立异常标记与升级规则\n\n## 风险边界（高约束设计）\n- AI输出 = 建议，不是命令\n- 所有AI建议需人工确认后执行\n- 生产操作权限永不开放给AI\n- 误判路径100%可追溯\n\n## 进入系统构建条件\n✅ 三层能力通过验证\n⚠️ 需CMDB数据接入（2周）\n✅ 风险边界已明确\n✅ 影子验证完成（采纳率55%）\n```\n\n---\n\n### 示例3：法律合同审查助手能力验证\n\n**场景描述**：\n基于方向定界，验证 AI 在法律合同条款识别和风险提示上的能力边界。\n\n**用户输入**：\nDirection Brief：法律合同审查助手（限定为非最终决策，仅辅助）\n\n**Skill 执行流程**：\n\n1. **资料准备**\n   - 样本集：100份标准合同（NDA、服务协议、劳动合同）\n   - 法律条款库：常见风险条款模板\n   - 评估标准：条款识别准确率、风险判断准确率\n\n2. **分层能力实验**\n\n   **第一层：条款识别能力**\n   | 合同类型 | 测试数量 | GPT-4o | Claude 3.5 | 结论 |\n   |----------|----------|--------|------------|------|\n   | NDA保密协议 | 30份 | 90% | 88% | ✅ 可用 |\n   | 服务协议 | 40份 | 85% | 82% | ✅ 可用 |\n   | 劳动合同 | 30份 | 78% | 75% | ⚠️ 需补充 |\n\n   **第二层：风险提示能力**\n   - 测试：识别\"不对等条款\"（如单方解约权、无限责任）\n   - 结果：高风险条款识别率 82%，但部分隐蔽条款漏检\n   - 失败案例：隐含在\"其他\"条款中的风险未能识别\n\n   **第三层：成本压缩测试**\n   - GPT-4o-mini：准确率下降 8%，但成本降低 70%\n   - 结论：对于初筛场景，可使用低成本模型\n\n3. **产品实验（影子验证）**\n   - 法务专员审查合同，AI 并行分析\n   - 对比：专员实际标记 vs AI 标记\n   - 结果：\n     - AI 辅助发现额外风险点数量：平均 1.2 个/份合同\n     - 专员对 AI 建议采纳率：45%\n     - 审查时间：从 1.5小时 → 45分钟\n\n4. **失败分析**\n\n   | 失败类型 | 比例 | 原因 | 改进措施 |\n   |----------|------|------|----------|\n   | 隐含条款遗漏 | 15% | 风险不在标准条款中 | 建立隐含风险模式库 |\n   | 行业特殊条款 | 12% | 特定行业术语不理解 | 补充行业词典 |\n   | 上下文误判 | 8% | 条款组合效应未识别 | 增强上下文分析 |\n\n**输出结果**：\n\n```markdown\n# 实验结论报告：法律合同审查助手\n\n## 能力边界\n✅ 标准条款识别（NDA、服务协议）：88%+\n⚠️ 复杂合同（劳动、股权）：75-78%，需改进\n✅ 高风险条款标记：82%\n❌ 隐含风险识别：能力不足\n\n## 产品形态建议\n- Copilot 模式：并排显示原始合同 + AI 标记\n- 人机协作：AI 初筛 → 人工复核\n- 输出：checklist + 风险条款高亮 + 修改建议\n\n## 关键发现\n- 适合标准合同快速审查\n- 复杂交易合同仍需资深律师主导\n- AI 发现的问题平均 40% 被专员认可采纳\n\n## 进入系统构建条件\n⚠️ 补充200份劳动/股权合同样本\n✅ 法务团队认可边界设定\n✅ 影子验证通过\n```\n\n---\n\n### 示例4：HR 智能简历筛选助手\n\n**场景描述**：\n验证 AI 在简历解析、候选人匹配、初筛评估上的能力，需特别注意公平性和偏见问题。\n\n**用户输入**：\nDirection Brief：HR 智能简历筛选助手\n\n**Skill 执行流程**：\n\n1. **资料准备**\n   - 样本集：1000份历史简历（已脱敏去除姓名、性别、年龄）\n   - 岗位要求：5个标准岗位（Java开发、产品经理、销售等）\n   - 评估标准：匹配准确率、偏见检测\n\n2. **能力实验**\n\n   **技能点1：简历信息提取**\n   - 测试：从PDF/Word中提取结构化信息\n   - 结果：\n     - 教育背景：94% 准确率\n     - 工作经历：87% 准确率（部分非标准格式简历困难）\n     - 技能标签：79% 准确率（技能同义词识别不足）\n\n   **技能点2：岗位匹配评分**\n   - 测试：根据JD要求给候选人打分\n   - 结果：\n     - Top10 推荐命中率：68%\n     - 与 HR 专员评分相关性：0.72（中等相关）\n\n   **技能点3：偏见检测**\n   - 测试：匿名化简历 vs 完整简历的评分差异\n   - 关键发现：\n     - 去除性别信息后，技术岗男女得分无显著差异 ✅\n     - 但某些管理岗仍略有偏差 ⚠️（需持续监控）\n\n3. **产品实验**\n   - 在真实招聘流程中并行运行\n   - HR 先按原流程筛选，再看 AI 建议\n   - 结果：\n     - AI 发现\"遗漏候选人\"比例：12%\n     - 这些被遗漏候选人中，最终面试通过率：35%\n     - 说明 AI 发现了一些人类筛选中的盲点\n\n4. **公平性评估**\n\n   | 维度 | 测试结果 | 风险等级 |\n   |------|----------|----------|\n   | 性别偏见 | 无显著差异 | 🟢 低风险 |\n   | 学历偏好 | 存在过度偏好985/211 | 🟡 中风险 |\n   | 年龄相关 | 无明显年龄歧视 | 🟢 低风险 |\n   | 地域相关 | 部分地域词汇偏见 | 🟡 中风险 |\n\n**输出结果**：\n\n```markdown\n# 实验结论报告：HR 智能简历筛选助手\n\n## 能力边界\n✅ 简历信息提取：教育94%、经历87%\n⚠️ 岗位匹配：Top10命中率68%，有提升空间\n⚠️ 公平性：整体可控，但需监控学历/地域偏见\n\n## 重要发现：AI 发现人类盲点\n- AI 识别出 HR 遗漏的合格候选人 12%\n- 这些候选人面试通过率 35%\n- AI 在\"非标准背景但有潜力\"的识别上有优势\n\n## 产品形态建议\n- 初筛助手：辅助而非替代 HR 筛选\n- 盲筛模式：默认隐藏可能导致偏见的信息\n- 透明度：显示匹配依据（哪些JD要求被满足）\n- 反馈闭环：HR 驳回时标记原因，优化模型\n\n## 公平性保障措施\n- 定期偏见审计（A/B 测试）\n- 多样性指标监控\n- 申诉机制：候选人可请求人工复核\n\n## 进入系统构建条件\n⚠️ 建立偏见监控 dashboard\n✅ HR 团队培训完成（理解 AI 辅助边界）\n✅ 法务确认合规性\n```\n\n---\n\n### 示例5：内容创作智能助手（营销文案）\n\n**场景描述**：\n验证 AI 在营销文案创作上的能力，包括多风格适应、品牌一致性、合规风险检测。\n\n**用户输入**：\nDirection Brief：营销文案智能创作助手\n\n**Skill 执行流程**：\n\n1. **资料准备**\n   - 品牌资料：品牌调性指南、过往优质文案100篇\n   - 产品信息：功能清单、卖点、目标用户画像\n   - 合规资料：广告法禁用词、行业敏感词库\n\n2. **多维度能力实验**\n\n   **维度1：创作质量**\n   | 场景 | 人工评分 | 采纳率 |\n   |------|----------|--------|\n   | 社交媒体短文案（微博/小红书） | 4.2/5 | 68% |\n   | 电商详情页长文案 | 3.8/5 | 52% |\n   | 邮件营销标题 | 4.0/5 | 60% |\n   | 视频脚本 | 3.5/5 | 42% |\n\n   **维度2：品牌一致性**\n   - 测试：给定品牌调性，生成文案\n   - 评估：品牌团队判断是否符合调性\n   - 结果：符合率 73%，主要偏差在情感强度控制\n\n   **维度3：合规风险**\n   - 测试：100篇 AI 生成文案的合规检测\n   - 结果：\n     - 检出禁用词：准确率 95%\n     - 夸大宣传：检出率 60%（部分较为隐蔽）\n     - 竞品对比：合规性 100%（无不当对比）\n\n3. **风格适应实验**\n   - 同一产品，生成不同风格文案\n   - 结果：风格区分度明显，但在\"高级 but 接地气\"的平衡上仍有困难\n\n4. **A/B 测试（影子验证）**\n   - 选择 20% 流量，对比 AI 文案 vs 人工文案\n   - 结果：\n     - 点击率：AI 文案 3.2% vs 人工 3.5%（略低）\n     - 转化率：AI 文案 1.8% vs 人工 2.1%（略低）\n     - 但生成速度：AI 平均 2分钟 vs 人工平均 2小时\n\n5. **失败分析**\n\n   | 问题类型 | 描述 | 改进方向 |\n   |----------|------|----------|\n   | 同质化 | 多个产品文案风格过于相似 | 增强产品差异化输入 |\n   | 情感过度 | 有时过于夸张 | 细化情感强度控制 |\n   | 长尾场景 | 小众产品理解不足 | 补充小众样本 |\n\n**输出结果**：\n\n```markdown\n# 实验结论报告：内容创作智能助手\n\n## 能力边界\n✅ 短文案创作：质量4.2/5，可用\n⚠️ 长文案详情页：质量3.8/5，需改进\n⚠️ 品牌一致性：73%，需调优\n✅ 合规检测：禁用词检出率95%\n\n## 关键发现\n- 效率优势：2分钟 vs 2小时（60倍提升）\n- 质量差距：点击率和转化率略低（-10%）\n- 适用场景：更适合批量、快速、标准化文案\n- 不适合：品牌大推、需要深度创意的campaign\n\n## 产品形态建议\n- 初稿生成：AI 快速产出多版本草稿\n- 人工精修：创作者在 AI 基础上优化\n- 合规预检：发布前自动检测风险\n- 风格模板：提供多风格快速切换\n\n## 商业模式\n- 内部赋能：提升创作团队效率\n- 外部售卖：小型商家自助生成基础文案\n\n## 进入系统构建条件\n✅ 品牌团队认可质量标准\n⚠️ 建立质量反馈闭环机制\n✅ 法务确认合规流程\n```","tags":["native","experiment","engine","product","agent","skills","gmaxxxie","agent-skills","ai-agent","ai-native","ai-product","methodology"],"capabilities":["skill","source-gmaxxxie","skill-ai-native-experiment-engine","topic-agent-skills","topic-ai-agent","topic-ai-native","topic-ai-product","topic-methodology","topic-product-management","topic-product-methodology","topic-product-thinking","topic-skills"],"categories":["ai-native-product-agent-skills"],"synonyms":[],"warnings":[],"endpointUrl":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/ai-native-experiment-engine","protocol":"skill","transport":"skills-sh","auth":{"type":"none","details":{"cli":"npx skills add gmaxxxie/ai-native-product-agent-skills","source_repo":"https://github.com/gmaxxxie/ai-native-product-agent-skills","install_from":"skills.sh"}},"qualityScore":"0.478","qualityRationale":"deterministic score 0.48 from registry signals: · indexed on github topic:agent-skills · 56 github stars · SKILL.md body (9,533 chars)","verified":false,"liveness":"unknown","lastLivenessCheck":null,"agentReviews":{"count":0,"score_avg":null,"cost_usd_avg":null,"success_rate":null,"latency_p50_ms":null,"narrative_summary":null,"summary_updated_at":null},"enrichmentModel":"deterministic:skill-github:v1","enrichmentVersion":1,"enrichedAt":"2026-05-18T18:57:24.090Z","embedding":null,"createdAt":"2026-05-01T01:02:49.636Z","updatedAt":"2026-05-18T18:57:24.090Z","lastSeenAt":"2026-05-18T18:57:24.090Z","tsv":"'-10':1199 '-78':827 '/5':1071,1075,1079,1083 '/claude':237 '/word':897 '0.72':922 '1':53,202,231,314,340,380,542,702,876,1048 '1.2':784 '1.5':793 '1.8':1149 '100':1112 '1000份历史简历':879 '1000条':386 '100份标准合同':705 '100条典型日志':559 '100篇':1099 '10次真实故障的告警流':574 '10章':29 '12':464,807,948,995 '15':803 '1分钟':451 '2':63,207,240,318,342,397,554,714,891,1060 '2.1':1152 '20':553,1130 '200':456 '25分钟':615 '2分钟':1157,1193 '2周':683 '2小时':1160,1195 '2次错误归因建议':617 '3':67,213,243,325,345,432,594,769,935,1114 '3.2':1141 '3.5':420,567,724,1082,1144 '3.8':1074 '30份':727,737 '35':951,997 '4':71,219,328,348,444,611,796,955,1125 '4.0':1078 '4.2':1070 '40':852 '40份':732 '42':1084 '45':790 '45分钟':795 '4o':236,407,414,427,563,722,760 '5':75,331,351,457,468,621,1161 '500条':384 '50个历史故障':545 '50条边界案例':389 '52':1076 '5个标准岗位':884 '6':80,355 '60':1080,1108 '60倍提升':1196 '68':918,1072 '7':357 '70':765 '73':1094,1187 '75':591,650,739,826 '78':422,492,738 '79':908 '8':472,763,811 '80':551 '82':578,646,734,750,830 '85':416,488,568,733 '87':904 '88':430,565,643,729,822 '90':728 '92':409,484 '94':901 '95':1105 'a/b':1018,1126 'agent':123 'ai':2,6,24,30,50,175,247,361,370,375,478,531,692,773,778,781,788,837,840,850,864,941,944,953,989,991,998,1029,1037,1100,1133,1139,1147,1155,1209,1213 'ai-native-experiment-engin':1 'aiop':527,538,638 'ai输出':673 'brief':13,37,94,337,368,374,537,696,871,1044 'busi':182 'capabl':172 'checklist':844 'claud':419,566,723 'copilot':121,272,321,363,480,499,834 'dashboard':1025 'demo':256,262,268 'direct':12,36,93,336,367,373,536,695,870,1043 'engin':5 'evalu':186 'experi':4,173,179,183 'faq':383 'gpt':235,406,413,426,562,721,759 'gpt-4o':234,405,412,561,720 'gpt-4o-mini':425,758 'hr':860,872,920,938,975,993,1005,1013,1026 'human':135 'human-in-the-loop':134 'java开发':885 'loop':138,143 'markdown':476,636,815,973,1176 'mini':428,761 'nativ':3,7,25,31 'nda':706,820 'nda保密协议':726 'on-the-loop':140 'opus':238 'p2a':88,90 'p2b':110 'p2c':124 'p2d':146 'p2e':89,161 'product':178 'roi':455 'roi已验证正向':525 'rubric':62,102,221,300,353 'skill':10,15,33,41,378,540,700,874,1046 'skill-ai-native-experiment-engine' 'sop':209 'source-gmaxxxie' 'top10':916 'top10命中率68':982 'top3':589 'topic-agent-skills' 'topic-ai-agent' 'topic-ai-native' 'topic-ai-product' 'topic-methodology' 'topic-product-management' 'topic-product-methodology' 'topic-product-thinking' 'topic-skills' 'vs':139,601,777,928,1135,1142,1150,1158,1194 '一键采纳':505 '三层实验体系设计':97 '三层能力通过验证':681 '上下文丢失':463 '上下文误判':810 '不对等条款':745 '不提供操作建议':665 '不是命令':675 '不能做到自动化':251 '不适合':1204 '不适合ai独立完成':496 '与':919 '与人工流程并行运行':165 '与客服主管访谈':446 '与现有解决方案的成本对比':293 '专员实际标记':776 '专员对':787 '专员评分相关性':921 '专家经验':212 '个':785 '中提取结构化信息':898 '中等相关':923 '中风险':965,971 '为审计放行准备真实可量化证据':168 '主形态':657 '主要偏差在情感强度控制':1095 '也没有足够高的价值密度':253 '交互与流程验证':347 '交互原型设计':114 '产品':99 '产品信息':1053 '产品实验':19,68,177,193,281,433,595,770,936 '产品形态判断':116 '产品形态已验证':522 '产品形态建议':83,319,497,656,833,1002,1207 '产品形态探索':111 '产品形态确定后':126 '产品文档':206 '产品方法论':8,26 '产品经理':886 '人工':1143,1151 '人工修改率35':440 '人工复核':842 '人工平均':1159 '人工接管点':259 '人工文案':1136 '人工确认模式':500 '人工精修':1211 '人工评分':1065 '人机协作':839 '人机协作模式选择':128 '什么条件满足后可以进入系统构建':333 '什么算可接受':224,303 '什么算对':222 '什么算错':223,302 '仅辅助':699 '从':92,792 '从pdf':896 '价值':613 '价值密度':155 '价值密度验证':350 '价格相关':516 '任务完成率和满意度':286 '任务流程':257 '份合同':786 '优化模型':1015 '会话状态未保留':465 '但人工审核增加20':452 '但在':1120 '但成本降低':764 '但某些管理岗仍略有偏差':933 '但生成速度':1154 '但部分隐蔽条款漏检':751 '但需监控学历':986 '低风险':962,968 '使用场景':42 '使用方式':334 '依赖关系误判':629 '依赖分析弱':648 '侧边栏候选回复':502 '修改建议':846 '候选人匹配':866 '候选人可请求人工复核':1022 '值班工程师处理故障时':597 '值班面板辅助':658 '偏见检测':890,925 '做出继续':156 '停止的产品决策':159 '先强模型看上限':344 '先按原流程筛选':939 '先用最强模型':232 '先用最强模型测试能力天花板':65 '先用最强模型看天花板':192 '先看能力上限':229 '公平性':984 '公平性保障措施':1016 '公平性评估':956 '公开规则':205 '共300条':575 '关键交互':504 '关键发现':606,847,930,1191 '其他':754 '内容创作智能助手':1033,1178 '内部业务资料':56,208 '内部赋能':1220 '再压缩成本':230 '再用更便宜模型测试能否保住目标效果':242 '再看':940 '决定最终形态':119 '净效益正向':454 '准备外部资料':55 '准确性':394 '准确率':402,485,489,493,644,647,651,902,905,909,1104 '准确率下降':762 '出发':95 '分层能力实验':555,715 '分类':264 '创作者在':1212 '创作质量':1063 '初稿生成':1208 '初筛':841 '初筛助手':1003 '初筛评估上的能力':867 '到底能做到什么深度':248 '功能清单':1054 '功能类':261 '加入时间序列分析':634 '加入记忆系统':466 '助手':129 '劳动':824 '劳动合同':708,736 '包括多风格适应':1039 '匹配准确率':889 '匿名化简历':927 '协同':130 '单页界面':269 '卖点':1055 '历史工单':210 '原':87 '原则':228 '原因':461,624,800 '去除性别信息后':931 '反馈闭环':1012 '发布前自动检测风险':1216 '发现':945 '发现了一些人类筛选中的盲点':954 '发现人类盲点':990 '发现的问题平均':851 '发现问题':441 '只提供信息组织':666 '召回准确率':590 '召回率':550 '可使用低成本模型':768 '可压缩成本':431 '可放弃':47,108 '可比较':46,107 '可用':417,486,490,730,735,1182 '可用但需优化索引策略':593 '可继承':109 '可继承的实验体系':48 '可追溯':679 '合同类型':718 '合规性':1111 '合规检测':1189 '合规资料':1057 '合规预检':1215 '合规风险':1097 '合规风险检测':1041 '同一产品':1116 '同质化':1166 '含日志':546 '告警':547 '告警聚类':645 '告警聚类能力':572 '和评估标准':61 '品牌一致性':1040,1086,1186 '品牌团队判断是否符合调性':1091 '品牌团队认可质量标准':1225 '品牌大推':1205 '品牌调性指南':1051 '品牌资料':1050 '哪些jd要求被满足':1011 '哪些不能':307,317 '哪些动作必须人工接管':330 '哪些场景即使技术可行':252 '哪些场景只能做到辅助':250 '哪些场景能够稳定成立':249 '哪些场景能稳定成立':306,316 '哪些已经有机会进入产品化':310 '哪些能力只适合做建议':309 '哪些问题资料还不够':308 '哪种更适合':324 '售后政策':491 '售后政策咨询':421 '商业':100 '商业与风险评估':612 '商业实验':20,72,181,195,288,445 '商业模式':1219 '团队培训完成':1027 '在':999 '在告警聚类':532 '在法律合同条款识别和风险提示上的能力边界':693 '在真实会话中运行系统':435 '在真实招聘流程中并行运行':937 '在简历解析':865 '在能力实验结论基础上':112 '在营销文案创作上的能力':1038 '地域偏见':987 '地域相关':969 '场景':401,1064 '场景扩展可能性':292 '场景描述':365,529,689,862,1035 '培训时间':448 '基于方向定界':690 '基于方向定界输出的':366 '基本可用':582 '基础上优化':1214 '增加规则拦截':470 '增强上下文分析':813 '增强产品差异化输入':1168 '处理记录':548 '复杂交易合同仍需资深律师主导':849 '复杂合同':823 '外部售卖':1222 '外部资料':203 '多个产品文案风格过于相似':1167 '多样性指标监控':1020 '多维度能力实验':1061 '多轮上下文丢失':442 '多轮实验完成后':148 '多轮对话':391 '失败分析':458,797,1162 '失败分析是实验最重要的产物':305 '失败场景':623 '失败处理':279 '失败案例':579,752 '失败案例分析':622 '失败案例应该被沉淀为下一轮优化的输入':311 '失败类型':459,798 '夸大宣传':1106 '如':233 '如单方解约权':746 '如果最强模型也无法达到可接受水平':244 '存在过度偏好985/211':964 '学历偏好':963 '完整性':395 '完整简历的评分差异':929 '定期偏见审计':1017 '实验产物':254 '实验批次':399 '实验结论报告':313,477,637,816,974,1177 '实验节奏规划':104 '审批逻辑':260 '审查时间':791 '客户是否愿意付费试点':290 '客服':362,479 '客服候选回复生成的能力边界':371 '客服协同系统':376 '对于初筛场景':767 '对比':775,1132 '对比人工客服实际回复与系统建议':437 '对比结果':599 '对照和失败案例判断能力是否成立':78,188,298 '对话记录':211 '小众产品理解不足':1173 '小型商家自助生成基础文案':1223 '小时':794 '小红书':1069 '岗位匹配':981 '岗位匹配评分':912 '岗位要求':883 '工作台原型':270 '工作流':322 '工作流嵌入测试':115 '工作流设计':132 '工作流还是':122 '工作经历':903 '工单样本':385 '工程师实际判断':602 '已完成方向定界':377 '已脱敏去除姓名':880 '已验证':482 '常见风险条款模板':710 '平均':783,1156 '平均定位时间从45分钟':614 '年龄':882 '年龄相关':966 '并执行评估':354 '并排显示原始合同':836 '并行分析':774 '广告法禁用词':1058 '应该放弃或重新定义问题':245 '延后':157 '建立':103 '建立人工对比机制':166 '建立偏见监控':1024 '建立未知异常标记机制':628 '建立评估':299,352 '建立质量反馈闭环机制':1226 '建立隐含风险模式库':805 '建议':674,942 '建议先看':663 '建议采纳率':789 '异常情况处理不足':443 '弱于':609 '归因':265 '当用户提供':35,335 '影子验证':162,434,596,771,1128 '影子验证完成':685 '影子验证是离线评估与灰度上线之间的关键桥梁':169 '影子验证通过':858 '微博':1068 '必须人工确认':515 '必须引用最新数据源':517 '快速':1202 '快速产出多版本草稿':1210 '快速编辑':506 '怎么做':610 '性别':881 '性别偏见':960 '情感升级':518 '情感过度':1169 '情绪问题':392 '成本压缩测试':757 '或已通过方向定界的问题方向':38 '或问题方向':14 '或问题方向时':338 '所有ai建议需人工确认后执行':676 '执行任务拆解':127 '执行步骤':52 '执行流程':379,541,701,875,1047 '执行资料准备评估':96 '技术岗男女得分无显著差异':932 '技能同义词识别不足':910 '技能标签':907 '技能点1':893 '技能点2':911 '技能点3':924 '投诉处理':495 '接口草稿':277 '接地气':1123 '推荐命中率':917 '描述':1164 '提供多风格快速切换':1218 '提升创作团队效率':1221 '收敛信号识别':151 '收敛决策后':163 '收紧生成边界':474 '改进措施':801 '改进方向':625,1165 '故障分诊系统':639 '故障分诊能力验证':528 '故障分诊辅助系统':539 '故障摘要卡':661 '效率优势':1192 '敏感承诺':467 '教育94':979 '教育背景':900 '数量':460 '整体可控':985 '整合子方法':86 '整合能力边界':82 '整理实验记录':149 '文案':1134,1140,1148 '新型异常未识别':626 '新故障发生时召回历史相似案例':587 '方向定界已完成':43 '无不当对比':1113 '无明显年龄歧视':967 '无显著差异':961 '无限责任':747 '日志解释':533,642 '日志解释能力':557 '时序相关故障遗漏':632 '明确不做':654 '明确什么算对':301 '显示匹配依据':1010 '智能体':323 '智能简历筛选助手':861,873,976 '更适合批量':1201 '最终面试通过率':950 '有提升空间':983 '有时过于夸张':1170 '服务协议':707,731,821 '未关联时间窗口':633 '未识别价格承诺':469 '条款中的风险未能识别':755 '条款组合效应未识别':812 '条款识别准确率':712 '条款识别能力':717 '标准化文案':1203 '标准条款识别':819 '标记':779,838 '样本集':57,214,544,704,878 '核心概念':170 '根据jd要求给候选人打分':914 '案例召回':649 '案例召回上的能力边界':534 '案例召回能力':585 '检出率':1107 '检出禁用词':1103 '检查已有':382 '检查资料准备是否充分':341 '模块':276 '模型':400 '模式':835 '模糊问题':390 '正例':58,215 '每次实验都应有可量化的评估结果':304 '比例':799,947 '沉淀失败案例和人工修正':356 '沉淀失败模式':167 '沉淀失败模式为下一轮优化输入':79 '没有资料准备的实验会漂浮':225 '法务专员审查合同':772 '法务团队认可边界设定':857 '法务确认合规性':1031 '法务确认合规流程':1227 '法律合同审查助手':697,817 '法律合同审查助手能力验证':688 '法律条款库':709 '流程类':255 '流程重构与任务设计':125 '流量':1131 '测算':449 '测试':558,573,586,743,895,913,926,1019,1087,1098,1127 '测试数量':719 '测试结果':958 '测试能力天花板':239 '清晰边界':153 '点击率':1138 '点击率和转化率略低':1198 '物流异常解释':415 '物流规则':387 '物流解释':487 '特定行业术语不理解':808 '理解':1028 '生产操作权限永不开放给ai':677 '生成不同风格文案':1117 '生成建议':266 '生成文案':1089 '生成文案的合规检测':1101 '用实验驱动设计':117 '用户如何纠偏或确认':285 '用户如何表达目标':283 '用户接受度':154 '用户提供':11 '用户输入':372,535,694,869,1042 '用样本':77,187,297 '申诉机制':1021 '电商详情页长文案':1073 '界面':501 '界面类':267 '略低':1145,1153 '的平衡上仍有困难':1124 '的识别上有优势':1001 '目标收敛与产品决策':147 '目标用户画像':1056 '盲筛模式':1007 '相似案例':662 '相关告警聚类准确率':577 '看什么':608 '短文案创作':1180 '确保每轮实验可验证':106 '确定上限后用更便宜模型测试成本压缩空间':66 '确定能力上限足够高后':241 '示例':359 '示例1':360 '示例2':526 '示例3':687 '示例4':859 '示例5':1032 '社交媒体短文案':1067 '禁用词检出率95':1190 '稳定成功率':152 '竞品对比':1110 '符合率':1093 '第06':28 '第06-10章':27 '第1批':404 '第2批':411 '第3批':418 '第4批':424 '第一层':556,716 '第一步':199 '第三层':584,756 '第三步':280 '第二层':571,741 '第二步':226 '第五步':294 '第四步':287 '筛选':1006 '简历信息提取':894,978 '类型':498 '系统如何展示状态和建议':284 '系统并行输出分诊建议':598 '系统建议':600 '系统擅长':607 '系统说明文档':274 '细化情感强度控制':1171 '经历87':980 '结果':560,576,588,748,780,899,915,943,1092,1102,1118,1137 '结论':403,453,569,581,592,619,725,766 '给定品牌调性':1088 '续期意愿如何':291 '维度':957 '维度1':1062 '维度2':1085 '维度3':1096 '缺少服务拓扑数据':630 '而非拍脑袋':118 '股权':825 '股权合同样本':856 '能力':98 '能力不足':832 '能力在真实任务中是否成立':51,176 '能力实验':18,64,171,191,227,398,892 '能力实验要验证的问题':246 '能力强':410 '能力成立':570 '能力边界':315,481,640,818,977,1179 '能力边界已清晰':521 '能力验证':364 '自主':131 '自动修复':653 '自动执行':339 '自动执行试验展开流程':16 '自动转人工':519 '节点标注':133 '节点跳转':258 '营销文案':1034 '营销文案智能创作助手':1045 '行业敏感词库':1059 '行业特殊条款':806 '行业知识':204 '补充200份劳动':855 '补充cmdb集成':631 '补充小众样本':1174 '补充行业词典':809 '表单交互或':271 '被专员认可采纳':853 '被工程师识别后忽略':618 '覆盖':23 '视频脚本':1081 '解决方案':462 '解释准确':564 '触发条件':34 '触发此':40 '订单查询':408,429,483 '设计产品实验方案':346 '设计商业实验方案':349 '设计影子系统':164 '设计能力实验方案':343 '证据对比分析':150 '评估':101,185,438,603,1090 '评估不是看主观感觉':296 '评估与失败分析':21,76,197,295 '评估任务完成率和满意度':70 '评估方式':278 '评估标准':220,393,549,711,888 '评估续期意愿和场景扩展可能性':74 '识别':744 '识别出':992 '试验前必须准备':201 '试验展开':32 '试验展开概述':91 '试验展开流程':189 '试验展开阶段的实操':9 '误判路径100':678 '误报率':552 '说明':952 '负例':59,216 '质量3.8/5':1184 '质量4.2/5':1181 '质量差距':1197 '资料准备':17,54,190,200,543,703,877,1049 '资料准备验证':381 '资料缺口':84,326,508,667 '赔付相关':514 '超出历史案例库':627 '超出政策范围':473 '跨服务依赖关系未识别':580 '转化率':1146 '转向':158 '辅助参考率80':605 '辅助发现额外风险点数量':782 '辅助而非替代':1004 '辅助边界':1030 '输出':660,843 '输出候选回复但不发送':436 '输出实验结论报告':22,81,198,358 '输出收敛报告':160 '输出流程重构方案':145 '输出物':312 '输出结果':475,635,814,972,1175 '输出试验展开总体方案':105 '边界':275,664 '边界案例':60,217 '过度承诺':471 '过往优质文案100篇':1052 '还需要补充哪些材料才能进入系统构建':327 '这些候选人面试通过率':996 '这些被遗漏候选人中':949 '进入系统构建条件':520,680,854,1023,1224 '进入系统构建的条件':332 '退款':513 '适合标准合同快速审查':848 '适用场景':1200 '选择':1129 '透明度':1009 '通过能力边界分析':113 '遗漏候选人':946 '遗漏的合格候选人':994 '邮件营销标题':1077 '部分地域词汇偏见':970 '部分较为隐蔽':1109 '部分非标准格式简历困难':906 '采纳率':1066 '采纳率55':604,686 '采纳率65':439 '重要发现':988 '销售等':887 '长尾场景':1172 '长尾问题':218 '长文案详情页':1183 '问答':120,263,320 '问题类型':1163 '限定为非最终决策':698 '隐含在':753 '隐含条款遗漏':802 '隐含风险识别':831 '需cmdb数据接入':682 '需优化索引':652 '需持续监控':934 '需改进':828,1185 '需改进依赖分析':583 '需特别注意公平性和偏见问题':868 '需补充':740 '需补充售后政策资料':523 '需补充资料':494 '需要判断某个':49 '需要建立异常标记与升级规则':670 '需要建立敏感承诺规则库':510 '需要更多跨服务故障案例':669 '需要服务依赖拓扑数据':668 '需要测试集覆盖更多长尾问题':511 '需要深度创意的campaign':1206 '需要补充':388 '需要补充200条售后政策边界案例':509 '需要设计一组可验证':45 '需要进入实验验证阶段':44 '需要进入实验验证阶段时':39 '需调优':1188 '需资料补充':423 '非标准背景但有潜力':1000 '非自动执行':659 '面板':273 '预计1周':524 '预计节省30':447 '风格区分度明显':1119 '风格模板':1217 '风格适应实验':1115 '风险':616 '风险不在标准条款中':804 '风险判断准确率':713 '风险提示':507 '风险提示能力':742 '风险条款高亮':845 '风险标记':503 '风险等级':959 '风险识别率':396 '风险边界':329,512,671 '风险边界和进入系统构建的条件':85 '风险边界已明确':684 '首响时间从5分钟':450 '驳回时标记原因':1014 '验证':369,530,691,863,1036 '验证与迭代':144 '验证交互和流程':194 '验证价值密度':289 '验证价值密度和付费意愿':196 '验证客户是否愿意为这类能力投入预算或试点资源':184 '验证客户是否愿意付费试点':73 '验证某项':174 '验证用户是否愿意以某种交互或流程使用这项能力':69,180,282 '验证结果':641 '高约束设计':672 '高级':1121 '高风险':655 '高风险场景需强化边界控制':620 '高风险条款标记':829 '高风险条款识别率':749 '默认隐藏可能导致偏见的信息':1008","prices":[{"id":"f718130e-45f2-4953-983f-efd34a51aae7","listingId":"becea876-2b7a-4b15-be7b-f8692e2cc1bf","amountUsd":"0","unit":"free","nativeCurrency":null,"nativeAmount":null,"chain":null,"payTo":null,"paymentMethod":"skill-free","isPrimary":true,"details":{"org":"gmaxxxie","category":"ai-native-product-agent-skills","install_from":"skills.sh"},"createdAt":"2026-05-01T01:02:49.636Z"}],"sources":[{"listingId":"becea876-2b7a-4b15-be7b-f8692e2cc1bf","source":"github","sourceId":"gmaxxxie/ai-native-product-agent-skills/ai-native-experiment-engine","sourceUrl":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/ai-native-experiment-engine","isPrimary":false,"firstSeenAt":"2026-05-01T01:02:49.636Z","lastSeenAt":"2026-05-18T18:57:24.090Z"}],"details":{"listingId":"becea876-2b7a-4b15-be7b-f8692e2cc1bf","quickStartSnippet":null,"exampleRequest":null,"exampleResponse":null,"schema":null,"openapiUrl":null,"agentsTxtUrl":null,"citations":[],"useCases":[],"bestFor":[],"notFor":[],"kindDetails":{"org":"gmaxxxie","slug":"ai-native-experiment-engine","github":{"repo":"gmaxxxie/ai-native-product-agent-skills","stars":56,"topics":["agent-skills","ai-agent","ai-native","ai-product","methodology","product-management","product-methodology","product-thinking","skills"],"license":null,"html_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills","pushed_at":"2026-05-06T07:19:36Z","description":"AI Native Product Methodology — 80 executable skills across P0-P14 stages, covering needs discovery to aesthetic authority. From 8 books.","skill_md_sha":"d5a2a095219350cbda0d6ce039a35393e46a286f","skill_md_path":"skills/ai-native-experiment-engine/SKILL.md","default_branch":"main","skill_tree_url":"https://github.com/gmaxxxie/ai-native-product-agent-skills/tree/main/skills/ai-native-experiment-engine"},"layout":"multi","source":"github","category":"ai-native-product-agent-skills","frontmatter":{"name":"ai-native-experiment-engine","description":"AI Native 产品方法论——试验展开阶段的实操 Skill。\n用户提供 Direction Brief 或问题方向，Skill 自动执行试验展开流程：\n资料准备 → 能力实验 → 产品实验 → 商业实验 → 评估与失败分析 → 输出实验结论报告。\n覆盖《AI Native 产品方法论》第06-10章。"},"skills_sh_url":"https://skills.sh/gmaxxxie/ai-native-product-agent-skills/ai-native-experiment-engine"},"updatedAt":"2026-05-18T18:57:24.090Z"}}