# 依据证据选择模型

Taiga Learning · 工作表
https://taiga.training/zh-CN/lessons/evaluate-models/

使用虚构或获准信息。不要在工作表中写入秘密信息。

## 学习目标
- 根据实际任务类型建立小型评估集。
- 区分模型质量与工具、上下文带来的影响。
- 记录需要重新评估的条件。

## 练习
为三类任务制作评估表：已知缺陷、小功能和代码仓库说明。比较模型前先定义验收标准。每项任务纳入一个失败案例。记录模型版本、上下文、工具权限、尝试次数、成本和审查投入。

## 你的回答
- 场景与范围：
- 假设与未解决问题：
- 拟议答案或决定及其理由：

## 验证回答
| 说法或标准 | 证据或测试 | 结果或缺口 | 负责人 |
| --- | --- | --- | --- |
| | | | |
| | | | |
| | | | |

## 下一步行动
- 行动、负责人和日期：
- 何时复核这份回答？

## 应记住的原则
为明确的任务和环境选择模型。模型、工具或要求发生变化时，重新检查这个决定。

## 来源
- [NIST: Generative AI Profile](https://doi.org/10.6028/NIST.AI.600-1)
- [METR: Developer productivity study methodology](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)

本工作表辅助学习。完成工作表本身，不构成对生产变更的授权。
