评测脚本不是跑出一个分数就结束。关键是后续能复现、能解释、能定位异常。

最小结构

输入数据
模型配置
提示词模板
运行日志
结果文件
异常样例

建议目录

evaluation/
  config.yaml
  prompts/
  data/
  run.py
  results/
  logs/
  README.md

config.yaml 记录模型名称、版本、温度、最大输出长度和并发设置。提示词单独存放,避免修改脚本时意外改变评测条件。原始结果与汇总结果分开保存,方便重新计算指标。

每条结果至少记录什么

  • 样本唯一标识和输入内容。
  • 实际发送给模型的完整提示词。
  • 模型配置和请求时间。
  • 原始输出、解析结果和错误信息。
  • 自动评分与人工复核状态。

只保存最终分数会失去定位能力。分数异常时,需要回到具体样本判断是数据问题、提示词问题、接口失败还是模型能力差异。

先做小规模试运行

正式运行前先抽取 10 到 30 条样本。小规模试运行用于确认字段解析、重试逻辑、费用估算和输出长度。如果连失败样本都无法完整保存,不应直接扩大到整个数据集。

结果检查

自动指标适合批量比较,但不能覆盖所有质量差异。对高分、低分和模型分歧最大的样本分别抽查,观察指标是否真的反映任务目标。

评测报告应同时写清楚数据范围、运行日期、模型版本、失败率和已知限制。可复现的评测不一定复杂,但必须让下一次运行知道哪些条件不能悄悄变化。