Skillquality 0.48

ai-native-experiment-engine

'AI Native 产品方法论——试验展开阶段的实操 Skill。

Price
free
Protocol
skill
Verified
no

What it does

AI Native 试验展开 Skill

使用场景

  • 方向定界已完成,需要进入实验验证阶段
  • 需要设计一组可验证、可比较、可放弃、可继承的实验体系
  • 需要判断某个 AI 能力在真实任务中是否成立

核心概念

  • 能力实验(Capability Experiment):验证某项 AI 能力在真实任务中是否成立
  • 产品实验(Product Experiment):验证用户是否愿意以某种交互或流程使用这项能力
  • 商业实验(Business Experiment):验证客户是否愿意为这类能力投入预算或试点资源
  • 评估(Evaluation):用样本、对照和失败案例判断能力是否成立

试验展开流程

资料准备
  → 能力实验(先用最强模型看天花板)
    → 产品实验(验证交互和流程)
      → 商业实验(验证价值密度和付费意愿)
        → 评估与失败分析
          → 输出实验结论报告

第一步:资料准备

试验前必须准备:

  1. 外部资料:行业知识、公开规则、产品文档
  2. 内部业务资料:SOP、历史工单、对话记录、专家经验
  3. 样本集:正例、负例、边界案例、长尾问题
  4. 评估标准(Rubric):什么算对、什么算错、什么算可接受

没有资料准备的实验会漂浮。

第二步:能力实验

原则:先看能力上限,再压缩成本

  1. 先用最强模型(如 GPT-4o/Claude Opus)测试能力天花板
  2. 确定能力上限足够高后,再用更便宜模型测试能否保住目标效果
  3. 如果最强模型也无法达到可接受水平,应该放弃或重新定义问题

能力实验要验证的问题

  • AI 到底能做到什么深度
  • 哪些场景能够稳定成立
  • 哪些场景只能做到辅助,不能做到自动化
  • 哪些场景即使技术可行,也没有足够高的价值密度

实验产物

  • 流程类 demo:任务流程、节点跳转、人工接管点、审批逻辑
  • 功能类 demo:问答、分类、归因、生成建议
  • 界面类 demo:单页界面、工作台原型、表单交互或 Copilot 面板
  • 系统说明文档:边界、模块、接口草稿、评估方式、失败处理

第三步:产品实验

验证用户是否愿意以某种交互或流程使用这项能力:

  • 用户如何表达目标
  • 系统如何展示状态和建议
  • 用户如何纠偏或确认
  • 任务完成率和满意度

第四步:商业实验

验证价值密度:

  • 客户是否愿意付费试点
  • 续期意愿如何
  • 场景扩展可能性
  • 与现有解决方案的成本对比

第五步:评估与失败分析

评估不是看主观感觉

  • 用样本、对照和失败案例判断能力是否成立
  • 建立评估 Rubric:明确什么算对、什么算错、什么算可接受
  • 每次实验都应有可量化的评估结果

失败分析是实验最重要的产物

  • 哪些场景能稳定成立,哪些不能
  • 哪些问题资料还不够
  • 哪些能力只适合做建议,哪些已经有机会进入产品化
  • 失败案例应该被沉淀为下一轮优化的输入

输出物:实验结论报告

  1. 能力边界:哪些场景能稳定成立,哪些不能
  2. 产品形态建议:问答、Copilot、工作流、智能体,哪种更适合
  3. 资料缺口:还需要补充哪些材料才能进入系统构建
  4. 风险边界:哪些动作必须人工接管
  5. 进入系统构建的条件:什么条件满足后可以进入系统构建

使用方式

当用户提供 Direction Brief 或问题方向时,自动执行:

  1. 检查资料准备是否充分
  2. 设计能力实验方案(先强模型看上限)
  3. 设计产品实验方案(交互与流程验证)
  4. 设计商业实验方案(价值密度验证)
  5. 建立评估 Rubric 并执行评估
  6. 沉淀失败案例和人工修正
  7. 输出实验结论报告

示例

示例1:AI 客服 Copilot 能力验证

场景描述: 基于方向定界输出的 Direction Brief,验证 AI 客服候选回复生成的能力边界。

用户输入: Direction Brief:AI 客服协同系统(已完成方向定界)

Skill 执行流程

  1. 资料准备验证

    • 检查已有:FAQ(500条)、工单样本(1000条)、物流规则
    • 需要补充:50条边界案例(模糊问题、多轮对话、情绪问题)
    • 评估标准:准确性、完整性、风险识别率
  2. 能力实验

    实验批次模型场景准确率结论
    第1批GPT-4o订单查询92%✅ 能力强
    第2批GPT-4o物流异常解释85%✅ 可用
    第3批Claude 3.5售后政策咨询78%⚠️ 需资料补充
    第4批GPT-4o-mini订单查询88%✅ 可压缩成本
  3. 产品实验(影子验证)

    • 在真实会话中运行系统,输出候选回复但不发送
    • 对比人工客服实际回复与系统建议
    • 评估:采纳率65%,人工修改率35%
    • 发现问题:多轮上下文丢失、异常情况处理不足
  4. 商业实验

    • 与客服主管访谈:预计节省30%培训时间
    • 测算:首响时间从5分钟→1分钟,但人工审核增加20%
    • 结论:净效益正向,ROI > 200%
  5. 失败分析

    失败类型数量原因解决方案
    上下文丢失12会话状态未保留加入记忆系统
    敏感承诺5未识别价格承诺增加规则拦截
    过度承诺8超出政策范围收紧生成边界

输出结果

# 实验结论报告:AI 客服 Copilot

## 能力边界(已验证)
✅ 订单查询:92%准确率,可用
✅ 物流解释:85%准确率,可用  
⚠️ 售后政策:78%准确率,需补充资料
❌ 投诉处理:不适合AI独立完成

## 产品形态建议
- 类型:Copilot(人工确认模式)
- 界面:侧边栏候选回复 + 风险标记
- 关键交互:一键采纳、快速编辑、风险提示

## 资料缺口
- 需要补充200条售后政策边界案例
- 需要建立敏感承诺规则库
- 需要测试集覆盖更多长尾问题

## 风险边界
- 退款、赔付相关:必须人工确认
- 价格相关:必须引用最新数据源
- 情感升级:自动转人工

## 进入系统构建条件
✅ 能力边界已清晰
✅ 产品形态已验证
⚠️ 需补充售后政策资料(预计1周)
✅ ROI已验证正向

示例2:AIOps 故障分诊能力验证

场景描述: 验证 AI 在告警聚类、日志解释、案例召回上的能力边界。

用户输入: Direction Brief:AIOps 故障分诊辅助系统

Skill 执行流程

  1. 资料准备

    • 样本集:50个历史故障(含日志、告警、处理记录)
    • 评估标准:召回率 > 80%,误报率 < 20%
  2. 分层能力实验

    第一层:日志解释能力

    • 测试:100条典型日志
    • 结果:GPT-4o 解释准确 88%,Claude 3.5 85%
    • 结论:✅ 能力成立

    第二层:告警聚类能力

    • 测试:10次真实故障的告警流(共300条)
    • 结果:相关告警聚类准确率 82%
    • 失败案例:跨服务依赖关系未识别
    • 结论:⚠️ 基本可用,需改进依赖分析

    第三层:案例召回能力

    • 测试:新故障发生时召回历史相似案例
    • 结果:Top3 召回准确率 75%
    • 结论:⚠️ 可用但需优化索引策略
  3. 产品实验(影子验证)

    • 值班工程师处理故障时,系统并行输出分诊建议
    • 对比结果:系统建议 vs 工程师实际判断
    • 评估:采纳率55%,辅助参考率80%
    • 关键发现:系统擅长"看什么",弱于"怎么做"
  4. 商业与风险评估

    • 价值:平均定位时间从45分钟→25分钟
    • 风险:2次错误归因建议(被工程师识别后忽略)
    • 结论:高风险场景需强化边界控制
  5. 失败案例分析

    失败场景原因改进方向
    新型异常未识别超出历史案例库建立未知异常标记机制
    依赖关系误判缺少服务拓扑数据补充CMDB集成
    时序相关故障遗漏未关联时间窗口加入时间序列分析

输出结果

# 实验结论报告:AIOps 故障分诊系统

## 能力边界(验证结果)
✅ 日志解释:88%准确率
⚠️ 告警聚类:82%准确率(依赖分析弱)
⚠️ 案例召回:75%准确率(需优化索引)
❌ 自动修复:明确不做(高风险)

## 产品形态建议
- 主形态:值班面板辅助(非自动执行)
- 输出:故障摘要卡 + 相似案例 + "建议先看"
- 边界:不提供操作建议,只提供信息组织

## 资料缺口
- 需要服务依赖拓扑数据
- 需要更多跨服务故障案例
- 需要建立异常标记与升级规则

## 风险边界(高约束设计)
- AI输出 = 建议,不是命令
- 所有AI建议需人工确认后执行
- 生产操作权限永不开放给AI
- 误判路径100%可追溯

## 进入系统构建条件
✅ 三层能力通过验证
⚠️ 需CMDB数据接入(2周)
✅ 风险边界已明确
✅ 影子验证完成(采纳率55%)

示例3:法律合同审查助手能力验证

场景描述: 基于方向定界,验证 AI 在法律合同条款识别和风险提示上的能力边界。

用户输入: Direction Brief:法律合同审查助手(限定为非最终决策,仅辅助)

Skill 执行流程

  1. 资料准备

    • 样本集:100份标准合同(NDA、服务协议、劳动合同)
    • 法律条款库:常见风险条款模板
    • 评估标准:条款识别准确率、风险判断准确率
  2. 分层能力实验

    第一层:条款识别能力

    合同类型测试数量GPT-4oClaude 3.5结论
    NDA保密协议30份90%88%✅ 可用
    服务协议40份85%82%✅ 可用
    劳动合同30份78%75%⚠️ 需补充

    第二层:风险提示能力

    • 测试:识别"不对等条款"(如单方解约权、无限责任)
    • 结果:高风险条款识别率 82%,但部分隐蔽条款漏检
    • 失败案例:隐含在"其他"条款中的风险未能识别

    第三层:成本压缩测试

    • GPT-4o-mini:准确率下降 8%,但成本降低 70%
    • 结论:对于初筛场景,可使用低成本模型
  3. 产品实验(影子验证)

    • 法务专员审查合同,AI 并行分析
    • 对比:专员实际标记 vs AI 标记
    • 结果:
      • AI 辅助发现额外风险点数量:平均 1.2 个/份合同
      • 专员对 AI 建议采纳率:45%
      • 审查时间:从 1.5小时 → 45分钟
  4. 失败分析

    失败类型比例原因改进措施
    隐含条款遗漏15%风险不在标准条款中建立隐含风险模式库
    行业特殊条款12%特定行业术语不理解补充行业词典
    上下文误判8%条款组合效应未识别增强上下文分析

输出结果

# 实验结论报告:法律合同审查助手

## 能力边界
✅ 标准条款识别(NDA、服务协议):88%+
⚠️ 复杂合同(劳动、股权):75-78%,需改进
✅ 高风险条款标记:82%
❌ 隐含风险识别:能力不足

## 产品形态建议
- Copilot 模式:并排显示原始合同 + AI 标记
- 人机协作:AI 初筛 → 人工复核
- 输出:checklist + 风险条款高亮 + 修改建议

## 关键发现
- 适合标准合同快速审查
- 复杂交易合同仍需资深律师主导
- AI 发现的问题平均 40% 被专员认可采纳

## 进入系统构建条件
⚠️ 补充200份劳动/股权合同样本
✅ 法务团队认可边界设定
✅ 影子验证通过

示例4:HR 智能简历筛选助手

场景描述: 验证 AI 在简历解析、候选人匹配、初筛评估上的能力,需特别注意公平性和偏见问题。

用户输入: Direction Brief:HR 智能简历筛选助手

Skill 执行流程

  1. 资料准备

    • 样本集:1000份历史简历(已脱敏去除姓名、性别、年龄)
    • 岗位要求:5个标准岗位(Java开发、产品经理、销售等)
    • 评估标准:匹配准确率、偏见检测
  2. 能力实验

    技能点1:简历信息提取

    • 测试:从PDF/Word中提取结构化信息
    • 结果:
      • 教育背景:94% 准确率
      • 工作经历:87% 准确率(部分非标准格式简历困难)
      • 技能标签:79% 准确率(技能同义词识别不足)

    技能点2:岗位匹配评分

    • 测试:根据JD要求给候选人打分
    • 结果:
      • Top10 推荐命中率:68%
      • 与 HR 专员评分相关性:0.72(中等相关)

    技能点3:偏见检测

    • 测试:匿名化简历 vs 完整简历的评分差异
    • 关键发现:
      • 去除性别信息后,技术岗男女得分无显著差异 ✅
      • 但某些管理岗仍略有偏差 ⚠️(需持续监控)
  3. 产品实验

    • 在真实招聘流程中并行运行
    • HR 先按原流程筛选,再看 AI 建议
    • 结果:
      • AI 发现"遗漏候选人"比例:12%
      • 这些被遗漏候选人中,最终面试通过率:35%
      • 说明 AI 发现了一些人类筛选中的盲点
  4. 公平性评估

    维度测试结果风险等级
    性别偏见无显著差异🟢 低风险
    学历偏好存在过度偏好985/211🟡 中风险
    年龄相关无明显年龄歧视🟢 低风险
    地域相关部分地域词汇偏见🟡 中风险

输出结果

# 实验结论报告:HR 智能简历筛选助手

## 能力边界
✅ 简历信息提取:教育94%、经历87%
⚠️ 岗位匹配:Top10命中率68%,有提升空间
⚠️ 公平性:整体可控,但需监控学历/地域偏见

## 重要发现:AI 发现人类盲点
- AI 识别出 HR 遗漏的合格候选人 12%
- 这些候选人面试通过率 35%
- AI 在"非标准背景但有潜力"的识别上有优势

## 产品形态建议
- 初筛助手:辅助而非替代 HR 筛选
- 盲筛模式:默认隐藏可能导致偏见的信息
- 透明度:显示匹配依据(哪些JD要求被满足)
- 反馈闭环:HR 驳回时标记原因,优化模型

## 公平性保障措施
- 定期偏见审计(A/B 测试)
- 多样性指标监控
- 申诉机制:候选人可请求人工复核

## 进入系统构建条件
⚠️ 建立偏见监控 dashboard
✅ HR 团队培训完成(理解 AI 辅助边界)
✅ 法务确认合规性

示例5:内容创作智能助手(营销文案)

场景描述: 验证 AI 在营销文案创作上的能力,包括多风格适应、品牌一致性、合规风险检测。

用户输入: Direction Brief:营销文案智能创作助手

Skill 执行流程

  1. 资料准备

    • 品牌资料:品牌调性指南、过往优质文案100篇
    • 产品信息:功能清单、卖点、目标用户画像
    • 合规资料:广告法禁用词、行业敏感词库
  2. 多维度能力实验

    维度1:创作质量

    场景人工评分采纳率
    社交媒体短文案(微博/小红书)4.2/568%
    电商详情页长文案3.8/552%
    邮件营销标题4.0/560%
    视频脚本3.5/542%

    维度2:品牌一致性

    • 测试:给定品牌调性,生成文案
    • 评估:品牌团队判断是否符合调性
    • 结果:符合率 73%,主要偏差在情感强度控制

    维度3:合规风险

    • 测试:100篇 AI 生成文案的合规检测
    • 结果:
      • 检出禁用词:准确率 95%
      • 夸大宣传:检出率 60%(部分较为隐蔽)
      • 竞品对比:合规性 100%(无不当对比)
  3. 风格适应实验

    • 同一产品,生成不同风格文案
    • 结果:风格区分度明显,但在"高级 but 接地气"的平衡上仍有困难
  4. A/B 测试(影子验证)

    • 选择 20% 流量,对比 AI 文案 vs 人工文案
    • 结果:
      • 点击率:AI 文案 3.2% vs 人工 3.5%(略低)
      • 转化率:AI 文案 1.8% vs 人工 2.1%(略低)
      • 但生成速度:AI 平均 2分钟 vs 人工平均 2小时
  5. 失败分析

    问题类型描述改进方向
    同质化多个产品文案风格过于相似增强产品差异化输入
    情感过度有时过于夸张细化情感强度控制
    长尾场景小众产品理解不足补充小众样本

输出结果

# 实验结论报告:内容创作智能助手

## 能力边界
✅ 短文案创作:质量4.2/5,可用
⚠️ 长文案详情页:质量3.8/5,需改进
⚠️ 品牌一致性:73%,需调优
✅ 合规检测:禁用词检出率95%

## 关键发现
- 效率优势:2分钟 vs 2小时(60倍提升)
- 质量差距:点击率和转化率略低(-10%)
- 适用场景:更适合批量、快速、标准化文案
- 不适合:品牌大推、需要深度创意的campaign

## 产品形态建议
- 初稿生成:AI 快速产出多版本草稿
- 人工精修:创作者在 AI 基础上优化
- 合规预检:发布前自动检测风险
- 风格模板:提供多风格快速切换

## 商业模式
- 内部赋能:提升创作团队效率
- 外部售卖:小型商家自助生成基础文案

## 进入系统构建条件
✅ 品牌团队认可质量标准
⚠️ 建立质量反馈闭环机制
✅ 法务确认合规流程

Capabilities

skillsource-gmaxxxieskill-p2-experiment-enginetopic-agent-skillstopic-ai-agenttopic-ai-nativetopic-ai-producttopic-methodologytopic-product-managementtopic-product-methodologytopic-product-thinkingtopic-skills

Install

Quality

0.48/ 1.00

deterministic score 0.48 from registry signals: · indexed on github topic:agent-skills · 56 github stars · SKILL.md body (8,609 chars)

Provenance

Indexed fromgithub
Enriched2026-05-18 18:57:31Z · deterministic:skill-github:v1 · v1
First seen2026-05-01
Last seen2026-05-18

Agent access