ai-native-experiment-engine
'AI Native 产品方法论——试验展开阶段的实操 Skill。
What it does
AI Native 试验展开 Skill
使用场景
- 方向定界已完成,需要进入实验验证阶段
- 需要设计一组可验证、可比较、可放弃、可继承的实验体系
- 需要判断某个 AI 能力在真实任务中是否成立
核心概念
- 能力实验(Capability Experiment):验证某项 AI 能力在真实任务中是否成立
- 产品实验(Product Experiment):验证用户是否愿意以某种交互或流程使用这项能力
- 商业实验(Business Experiment):验证客户是否愿意为这类能力投入预算或试点资源
- 评估(Evaluation):用样本、对照和失败案例判断能力是否成立
试验展开流程
资料准备
→ 能力实验(先用最强模型看天花板)
→ 产品实验(验证交互和流程)
→ 商业实验(验证价值密度和付费意愿)
→ 评估与失败分析
→ 输出实验结论报告
第一步:资料准备
试验前必须准备:
- 外部资料:行业知识、公开规则、产品文档
- 内部业务资料:SOP、历史工单、对话记录、专家经验
- 样本集:正例、负例、边界案例、长尾问题
- 评估标准(Rubric):什么算对、什么算错、什么算可接受
没有资料准备的实验会漂浮。
第二步:能力实验
原则:先看能力上限,再压缩成本
- 先用最强模型(如 GPT-4o/Claude Opus)测试能力天花板
- 确定能力上限足够高后,再用更便宜模型测试能否保住目标效果
- 如果最强模型也无法达到可接受水平,应该放弃或重新定义问题
能力实验要验证的问题
- AI 到底能做到什么深度
- 哪些场景能够稳定成立
- 哪些场景只能做到辅助,不能做到自动化
- 哪些场景即使技术可行,也没有足够高的价值密度
实验产物
- 流程类 demo:任务流程、节点跳转、人工接管点、审批逻辑
- 功能类 demo:问答、分类、归因、生成建议
- 界面类 demo:单页界面、工作台原型、表单交互或 Copilot 面板
- 系统说明文档:边界、模块、接口草稿、评估方式、失败处理
第三步:产品实验
验证用户是否愿意以某种交互或流程使用这项能力:
- 用户如何表达目标
- 系统如何展示状态和建议
- 用户如何纠偏或确认
- 任务完成率和满意度
第四步:商业实验
验证价值密度:
- 客户是否愿意付费试点
- 续期意愿如何
- 场景扩展可能性
- 与现有解决方案的成本对比
第五步:评估与失败分析
评估不是看主观感觉
- 用样本、对照和失败案例判断能力是否成立
- 建立评估 Rubric:明确什么算对、什么算错、什么算可接受
- 每次实验都应有可量化的评估结果
失败分析是实验最重要的产物
- 哪些场景能稳定成立,哪些不能
- 哪些问题资料还不够
- 哪些能力只适合做建议,哪些已经有机会进入产品化
- 失败案例应该被沉淀为下一轮优化的输入
输出物:实验结论报告
- 能力边界:哪些场景能稳定成立,哪些不能
- 产品形态建议:问答、Copilot、工作流、智能体,哪种更适合
- 资料缺口:还需要补充哪些材料才能进入系统构建
- 风险边界:哪些动作必须人工接管
- 进入系统构建的条件:什么条件满足后可以进入系统构建
使用方式
当用户提供 Direction Brief 或问题方向时,自动执行:
- 检查资料准备是否充分
- 设计能力实验方案(先强模型看上限)
- 设计产品实验方案(交互与流程验证)
- 设计商业实验方案(价值密度验证)
- 建立评估 Rubric 并执行评估
- 沉淀失败案例和人工修正
- 输出实验结论报告
示例
示例1:AI 客服 Copilot 能力验证
场景描述: 基于方向定界输出的 Direction Brief,验证 AI 客服候选回复生成的能力边界。
用户输入: Direction Brief:AI 客服协同系统(已完成方向定界)
Skill 执行流程:
-
资料准备验证
- 检查已有:FAQ(500条)、工单样本(1000条)、物流规则
- 需要补充:50条边界案例(模糊问题、多轮对话、情绪问题)
- 评估标准:准确性、完整性、风险识别率
-
能力实验
实验批次 模型 场景 准确率 结论 第1批 GPT-4o 订单查询 92% ✅ 能力强 第2批 GPT-4o 物流异常解释 85% ✅ 可用 第3批 Claude 3.5 售后政策咨询 78% ⚠️ 需资料补充 第4批 GPT-4o-mini 订单查询 88% ✅ 可压缩成本 -
产品实验(影子验证)
- 在真实会话中运行系统,输出候选回复但不发送
- 对比人工客服实际回复与系统建议
- 评估:采纳率65%,人工修改率35%
- 发现问题:多轮上下文丢失、异常情况处理不足
-
商业实验
- 与客服主管访谈:预计节省30%培训时间
- 测算:首响时间从5分钟→1分钟,但人工审核增加20%
- 结论:净效益正向,ROI > 200%
-
失败分析
失败类型 数量 原因 解决方案 上下文丢失 12 会话状态未保留 加入记忆系统 敏感承诺 5 未识别价格承诺 增加规则拦截 过度承诺 8 超出政策范围 收紧生成边界
输出结果:
# 实验结论报告:AI 客服 Copilot
## 能力边界(已验证)
✅ 订单查询:92%准确率,可用
✅ 物流解释:85%准确率,可用
⚠️ 售后政策:78%准确率,需补充资料
❌ 投诉处理:不适合AI独立完成
## 产品形态建议
- 类型:Copilot(人工确认模式)
- 界面:侧边栏候选回复 + 风险标记
- 关键交互:一键采纳、快速编辑、风险提示
## 资料缺口
- 需要补充200条售后政策边界案例
- 需要建立敏感承诺规则库
- 需要测试集覆盖更多长尾问题
## 风险边界
- 退款、赔付相关:必须人工确认
- 价格相关:必须引用最新数据源
- 情感升级:自动转人工
## 进入系统构建条件
✅ 能力边界已清晰
✅ 产品形态已验证
⚠️ 需补充售后政策资料(预计1周)
✅ ROI已验证正向
示例2:AIOps 故障分诊能力验证
场景描述: 验证 AI 在告警聚类、日志解释、案例召回上的能力边界。
用户输入: Direction Brief:AIOps 故障分诊辅助系统
Skill 执行流程:
-
资料准备
- 样本集:50个历史故障(含日志、告警、处理记录)
- 评估标准:召回率 > 80%,误报率 < 20%
-
分层能力实验
第一层:日志解释能力
- 测试:100条典型日志
- 结果:GPT-4o 解释准确 88%,Claude 3.5 85%
- 结论:✅ 能力成立
第二层:告警聚类能力
- 测试:10次真实故障的告警流(共300条)
- 结果:相关告警聚类准确率 82%
- 失败案例:跨服务依赖关系未识别
- 结论:⚠️ 基本可用,需改进依赖分析
第三层:案例召回能力
- 测试:新故障发生时召回历史相似案例
- 结果:Top3 召回准确率 75%
- 结论:⚠️ 可用但需优化索引策略
-
产品实验(影子验证)
- 值班工程师处理故障时,系统并行输出分诊建议
- 对比结果:系统建议 vs 工程师实际判断
- 评估:采纳率55%,辅助参考率80%
- 关键发现:系统擅长"看什么",弱于"怎么做"
-
商业与风险评估
- 价值:平均定位时间从45分钟→25分钟
- 风险:2次错误归因建议(被工程师识别后忽略)
- 结论:高风险场景需强化边界控制
-
失败案例分析
失败场景 原因 改进方向 新型异常未识别 超出历史案例库 建立未知异常标记机制 依赖关系误判 缺少服务拓扑数据 补充CMDB集成 时序相关故障遗漏 未关联时间窗口 加入时间序列分析
输出结果:
# 实验结论报告:AIOps 故障分诊系统
## 能力边界(验证结果)
✅ 日志解释:88%准确率
⚠️ 告警聚类:82%准确率(依赖分析弱)
⚠️ 案例召回:75%准确率(需优化索引)
❌ 自动修复:明确不做(高风险)
## 产品形态建议
- 主形态:值班面板辅助(非自动执行)
- 输出:故障摘要卡 + 相似案例 + "建议先看"
- 边界:不提供操作建议,只提供信息组织
## 资料缺口
- 需要服务依赖拓扑数据
- 需要更多跨服务故障案例
- 需要建立异常标记与升级规则
## 风险边界(高约束设计)
- AI输出 = 建议,不是命令
- 所有AI建议需人工确认后执行
- 生产操作权限永不开放给AI
- 误判路径100%可追溯
## 进入系统构建条件
✅ 三层能力通过验证
⚠️ 需CMDB数据接入(2周)
✅ 风险边界已明确
✅ 影子验证完成(采纳率55%)
示例3:法律合同审查助手能力验证
场景描述: 基于方向定界,验证 AI 在法律合同条款识别和风险提示上的能力边界。
用户输入: Direction Brief:法律合同审查助手(限定为非最终决策,仅辅助)
Skill 执行流程:
-
资料准备
- 样本集:100份标准合同(NDA、服务协议、劳动合同)
- 法律条款库:常见风险条款模板
- 评估标准:条款识别准确率、风险判断准确率
-
分层能力实验
第一层:条款识别能力
合同类型 测试数量 GPT-4o Claude 3.5 结论 NDA保密协议 30份 90% 88% ✅ 可用 服务协议 40份 85% 82% ✅ 可用 劳动合同 30份 78% 75% ⚠️ 需补充 第二层:风险提示能力
- 测试:识别"不对等条款"(如单方解约权、无限责任)
- 结果:高风险条款识别率 82%,但部分隐蔽条款漏检
- 失败案例:隐含在"其他"条款中的风险未能识别
第三层:成本压缩测试
- GPT-4o-mini:准确率下降 8%,但成本降低 70%
- 结论:对于初筛场景,可使用低成本模型
-
产品实验(影子验证)
- 法务专员审查合同,AI 并行分析
- 对比:专员实际标记 vs AI 标记
- 结果:
- AI 辅助发现额外风险点数量:平均 1.2 个/份合同
- 专员对 AI 建议采纳率:45%
- 审查时间:从 1.5小时 → 45分钟
-
失败分析
失败类型 比例 原因 改进措施 隐含条款遗漏 15% 风险不在标准条款中 建立隐含风险模式库 行业特殊条款 12% 特定行业术语不理解 补充行业词典 上下文误判 8% 条款组合效应未识别 增强上下文分析
输出结果:
# 实验结论报告:法律合同审查助手
## 能力边界
✅ 标准条款识别(NDA、服务协议):88%+
⚠️ 复杂合同(劳动、股权):75-78%,需改进
✅ 高风险条款标记:82%
❌ 隐含风险识别:能力不足
## 产品形态建议
- Copilot 模式:并排显示原始合同 + AI 标记
- 人机协作:AI 初筛 → 人工复核
- 输出:checklist + 风险条款高亮 + 修改建议
## 关键发现
- 适合标准合同快速审查
- 复杂交易合同仍需资深律师主导
- AI 发现的问题平均 40% 被专员认可采纳
## 进入系统构建条件
⚠️ 补充200份劳动/股权合同样本
✅ 法务团队认可边界设定
✅ 影子验证通过
示例4:HR 智能简历筛选助手
场景描述: 验证 AI 在简历解析、候选人匹配、初筛评估上的能力,需特别注意公平性和偏见问题。
用户输入: Direction Brief:HR 智能简历筛选助手
Skill 执行流程:
-
资料准备
- 样本集:1000份历史简历(已脱敏去除姓名、性别、年龄)
- 岗位要求:5个标准岗位(Java开发、产品经理、销售等)
- 评估标准:匹配准确率、偏见检测
-
能力实验
技能点1:简历信息提取
- 测试:从PDF/Word中提取结构化信息
- 结果:
- 教育背景:94% 准确率
- 工作经历:87% 准确率(部分非标准格式简历困难)
- 技能标签:79% 准确率(技能同义词识别不足)
技能点2:岗位匹配评分
- 测试:根据JD要求给候选人打分
- 结果:
- Top10 推荐命中率:68%
- 与 HR 专员评分相关性:0.72(中等相关)
技能点3:偏见检测
- 测试:匿名化简历 vs 完整简历的评分差异
- 关键发现:
- 去除性别信息后,技术岗男女得分无显著差异 ✅
- 但某些管理岗仍略有偏差 ⚠️(需持续监控)
-
产品实验
- 在真实招聘流程中并行运行
- HR 先按原流程筛选,再看 AI 建议
- 结果:
- AI 发现"遗漏候选人"比例:12%
- 这些被遗漏候选人中,最终面试通过率:35%
- 说明 AI 发现了一些人类筛选中的盲点
-
公平性评估
维度 测试结果 风险等级 性别偏见 无显著差异 🟢 低风险 学历偏好 存在过度偏好985/211 🟡 中风险 年龄相关 无明显年龄歧视 🟢 低风险 地域相关 部分地域词汇偏见 🟡 中风险
输出结果:
# 实验结论报告:HR 智能简历筛选助手
## 能力边界
✅ 简历信息提取:教育94%、经历87%
⚠️ 岗位匹配:Top10命中率68%,有提升空间
⚠️ 公平性:整体可控,但需监控学历/地域偏见
## 重要发现:AI 发现人类盲点
- AI 识别出 HR 遗漏的合格候选人 12%
- 这些候选人面试通过率 35%
- AI 在"非标准背景但有潜力"的识别上有优势
## 产品形态建议
- 初筛助手:辅助而非替代 HR 筛选
- 盲筛模式:默认隐藏可能导致偏见的信息
- 透明度:显示匹配依据(哪些JD要求被满足)
- 反馈闭环:HR 驳回时标记原因,优化模型
## 公平性保障措施
- 定期偏见审计(A/B 测试)
- 多样性指标监控
- 申诉机制:候选人可请求人工复核
## 进入系统构建条件
⚠️ 建立偏见监控 dashboard
✅ HR 团队培训完成(理解 AI 辅助边界)
✅ 法务确认合规性
示例5:内容创作智能助手(营销文案)
场景描述: 验证 AI 在营销文案创作上的能力,包括多风格适应、品牌一致性、合规风险检测。
用户输入: Direction Brief:营销文案智能创作助手
Skill 执行流程:
-
资料准备
- 品牌资料:品牌调性指南、过往优质文案100篇
- 产品信息:功能清单、卖点、目标用户画像
- 合规资料:广告法禁用词、行业敏感词库
-
多维度能力实验
维度1:创作质量
场景 人工评分 采纳率 社交媒体短文案(微博/小红书) 4.2/5 68% 电商详情页长文案 3.8/5 52% 邮件营销标题 4.0/5 60% 视频脚本 3.5/5 42% 维度2:品牌一致性
- 测试:给定品牌调性,生成文案
- 评估:品牌团队判断是否符合调性
- 结果:符合率 73%,主要偏差在情感强度控制
维度3:合规风险
- 测试:100篇 AI 生成文案的合规检测
- 结果:
- 检出禁用词:准确率 95%
- 夸大宣传:检出率 60%(部分较为隐蔽)
- 竞品对比:合规性 100%(无不当对比)
-
风格适应实验
- 同一产品,生成不同风格文案
- 结果:风格区分度明显,但在"高级 but 接地气"的平衡上仍有困难
-
A/B 测试(影子验证)
- 选择 20% 流量,对比 AI 文案 vs 人工文案
- 结果:
- 点击率:AI 文案 3.2% vs 人工 3.5%(略低)
- 转化率:AI 文案 1.8% vs 人工 2.1%(略低)
- 但生成速度:AI 平均 2分钟 vs 人工平均 2小时
-
失败分析
问题类型 描述 改进方向 同质化 多个产品文案风格过于相似 增强产品差异化输入 情感过度 有时过于夸张 细化情感强度控制 长尾场景 小众产品理解不足 补充小众样本
输出结果:
# 实验结论报告:内容创作智能助手
## 能力边界
✅ 短文案创作:质量4.2/5,可用
⚠️ 长文案详情页:质量3.8/5,需改进
⚠️ 品牌一致性:73%,需调优
✅ 合规检测:禁用词检出率95%
## 关键发现
- 效率优势:2分钟 vs 2小时(60倍提升)
- 质量差距:点击率和转化率略低(-10%)
- 适用场景:更适合批量、快速、标准化文案
- 不适合:品牌大推、需要深度创意的campaign
## 产品形态建议
- 初稿生成:AI 快速产出多版本草稿
- 人工精修:创作者在 AI 基础上优化
- 合规预检:发布前自动检测风险
- 风格模板:提供多风格快速切换
## 商业模式
- 内部赋能:提升创作团队效率
- 外部售卖:小型商家自助生成基础文案
## 进入系统构建条件
✅ 品牌团队认可质量标准
⚠️ 建立质量反馈闭环机制
✅ 法务确认合规流程
Capabilities
Install
Quality
deterministic score 0.48 from registry signals: · indexed on github topic:agent-skills · 56 github stars · SKILL.md body (8,609 chars)