没有评测集的 AI 功能是现场表演
AI 功能可以在演示里完美,在真实分布里翻车。上线前评测集把「可接受行为」写成可重复测量的样本:正确、拒答、安全、格式、延迟与成本。可上线在 AI 交付中把评测接入 CI,提示词或模型一变就跑。下文给出最小可行评测体系,即使团队只有两名工程师也能启动。下文给出可落地的判断框架、分步清单与常见误区,便于上海及跨境团队在两到四周内推进,并把相关服务能力组合进同一交付节奏。
从真实失败收集种子
客服工单、销售异议、内部吐槽是最好来源。每条含输入、上下文、期望要点、不可接受行为。结合可上线探索→设计→开发→上线节奏,把该项写入验收与预发检查,避免口头对齐后遗漏。结合可上线(KSX Studio)探索→设计→开发→上线节奏,把该项写成可验收产物:负责人、完成定义、预发验证与回滚策略,避免口头对齐后再次发散。
维度而不是单一分数
正确性、完整性、引用、拒答、安全性、格式、毒性分别记。单一「好不好」无法回归。结合可上线探索→设计→开发→上线节奏,把该项写入验收与预发检查,避免口头对齐后遗漏。结合可上线(KSX Studio)探索→设计→开发→上线节奏,把该项写成可验收产物:负责人、完成定义、预发验证与回滚策略,避免口头对齐后再次发散。
金标与评审者一致性
双人抽检争议样例;写评分说明。歧义题标记而非硬判。结合可上线探索→设计→开发→上线节奏,把该项写入验收与预发检查,避免口头对齐后遗漏。结合可上线(KSX Studio)探索→设计→开发→上线节奏,把该项写成可验收产物:负责人、完成定义、预发验证与回滚策略,避免口头对齐后再次发散。
自动化能跑的先跑
格式、JSON schema、关键词/正则、检索命中可用自动;语义质量可模型辅助但需抽检。结合可上线探索→设计→开发→上线节奏,把该项写入验收与预发检查,避免口头对齐后遗漏。结合可上线(KSX Studio)探索→设计→开发→上线节奏,把该项写成可验收产物:负责人、完成定义、预发验证与回滚策略,避免口头对齐后再次发散。
门禁阈值与发布
核心集通过率不达标禁止发布。允许带已知失败列表但需负责人签字与到期日。结合可上线探索→设计→开发→上线节奏,把该项写入验收与预发检查,避免口头对齐后遗漏。结合可上线(KSX Studio)探索→设计→开发→上线节奏,把该项写成可验收产物:负责人、完成定义、预发验证与回滚策略,避免口头对齐后再次发散。
线上漂移回流
把生产坏例脱敏进评测集。提示词运维变更必须附评测 diff。结合可上线探索→设计→开发→上线节奏,把该项写入验收与预发检查,避免口头对齐后遗漏。结合可上线(KSX Studio)探索→设计→开发→上线节奏,把该项写成可验收产物:负责人、完成定义、预发验证与回滚策略,避免口头对齐后再次发散。
成本与延迟也是指标
评测记录 token 与耗时,防止「更准但贵十倍」无意识上线。结合可上线探索→设计→开发→上线节奏,把该项写入验收与预发检查,避免口头对齐后遗漏。结合可上线(KSX Studio)探索→设计→开发→上线节奏,把该项写成可验收产物:负责人、完成定义、预发验证与回滚策略,避免口头对齐后再次发散。
可执行清单
- 1≥50 条核心评测含安全/拒答
- 2评分说明文档化
- 3CI 跑自动部分
- 4发布门禁阈值写入 README
- 5生产坏例每周回流
核心要点
- 评测集是 AI 产品的回归测试。
- 多维度评分才能指导改提示与模型。
- 门禁与回流让质量不靠运气。
常见问题
- 多少条够?
- 先 50–100 高价值;随功能扩展。覆盖比盲目堆数量重要。
- 能全自动评分吗?
- 部分可以;关键安全与正确性需人类抽检,尤其早期。
- 开源基准能替代吗?
- 可作补充,不能替代你的业务分布与拒答策略。