# 根據證據選擇模型

Taiga Learning · 工作表
https://taiga.training/zh-TW/lessons/evaluate-models/

使用虛構或核准資訊。不要把機密值放入此工作表。

## 學習目標
- 從實際任務類型建立小型評估集。
- 區分模型品質與工具、上下文造成的影響。
- 記錄需要重新評估的條件。

## 練習
為三類任務建立評估表：已知缺陷、小功能，以及儲存庫解說。比較模型前，先定義驗收標準。每項任務納入一個失敗案例。記錄模型版本、上下文、工具權限、嘗試次數、成本和審查投入。

## 你的回答
- 情境與範圍：
- 假設與未解問題：
- 提出的答案或決定，以及理由：

## 驗證回答
| 陳述或條件 | 證據或測試 | 結果或缺口 | 負責人 |
| --- | --- | --- | --- |
| | | | |
| | | | |
| | | | |

## 下一步操作
- 操作、負責人與日期：
- 何時重新檢視此回答？

## 應保留的原則
為明確任務和環境選擇模型。模型、工具或需求變更時，重新檢查決定。

## 來源
- [NIST: Generative AI Profile](https://doi.org/10.6028/NIST.AI.600-1)
- [METR: Developer productivity study methodology](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)

此工作表協助學習。完成工作表本身，不授權修改正式環境。
