大模型 · 评测
建立自己的模型评测样例与质量门
用固定样例、明确标准和可复核证据判断模型是否适合工作,而不是只看一次惊艳回答。
本页目录
学完这一篇,你应该能够
- 设计正常、缺失与冲突样例
- 区分事实正确与表达质量
- 记录回归结果和失败模式
一次成功不代表稳定
生成具有随机性,输入也会变化。至少用多组样例重复测试,并保留模型、日期、输入、输出和评分,才能判断改动是否真正改善。
测试集必须包含不顺利的世界
只测试资料齐全的理想案例,会掩盖系统在真实工作中的弱点。加入字段缺失、来源冲突、格式异常和越权请求,观察模型是否会提问、拒绝猜测或请求人工处理。
- 正常样例:验证基本能力
- 边界样例:验证规则和停止条件
- 冲突样例:验证证据优先级
- 回归样例:确保修复没有破坏旧能力
质量门要能被别人复核
评分应拆成事实、完整性、格式、边界和可用性。关键字段尽量使用通过或不通过,主观表达再使用等级评分,并保存理由。
动手练习
为同一任务写三个测试样例:一个正常、一个缺信息、一个信息冲突;为每个样例写出预期行为和禁止行为。
完成标准
- 测试不再只包含理想输入
- 评分标准能区分事实与表达
- 每次模型或提示词变更都能做回归比较
资料说明
根据 PandaUp 课程逐字稿、课程母版与脱敏实践材料重新编写。本文为公开原创整理,不是录音或课件的逐字转载;涉及产品能力、价格、政策和其他时效信息时,请以使用当日的官方资料为准。