评测脚本不是跑出一个分数就结束。关键是后续能复现、能解释、能定位异常。
最小结构
输入数据
模型配置
提示词模板
运行日志
结果文件
异常样例
建议目录
evaluation/
config.yaml
prompts/
data/
run.py
results/
logs/
README.md
config.yaml 记录模型名称、版本、温度、最大输出长度和并发设置。提示词单独存放,避免修改脚本时意外改变评测条件。原始结果与汇总结果分开保存,方便重新计算指标。
每条结果至少记录什么
- 样本唯一标识和输入内容。
- 实际发送给模型的完整提示词。
- 模型配置和请求时间。
- 原始输出、解析结果和错误信息。
- 自动评分与人工复核状态。
只保存最终分数会失去定位能力。分数异常时,需要回到具体样本判断是数据问题、提示词问题、接口失败还是模型能力差异。
先做小规模试运行
正式运行前先抽取 10 到 30 条样本。小规模试运行用于确认字段解析、重试逻辑、费用估算和输出长度。如果连失败样本都无法完整保存,不应直接扩大到整个数据集。
结果检查
自动指标适合批量比较,但不能覆盖所有质量差异。对高分、低分和模型分歧最大的样本分别抽查,观察指标是否真的反映任务目标。
评测报告应同时写清楚数据范围、运行日期、模型版本、失败率和已知限制。可复现的评测不一定复杂,但必须让下一次运行知道哪些条件不能悄悄变化。