# 証拠に基づいてモデルを選ぶ

Taiga Learning・ワークシート
https://taiga.training/ja/lessons/evaluate-models/

架空の情報か、承認された情報を使ってください。このワークシートにシークレットを入れないでください。

## 学習目標
- 実際のタスクの種類から、小さな評価セットを作ります。
- モデルの品質と、ツールやコンテキストの効果を分けます。
- 再評価が必要になる条件を記録します。

## 演習
既知の不具合、小さな機能、リポジトリの説明という三種類のタスクの評価シートを作ってください。モデルを比較する前に受入基準を定めます。各タスクに失敗例を一つ含めます。モデルのバージョン、コンテキスト、ツールの権限、試行回数、費用、レビュー工数を記録します。

## あなたの回答
- シナリオと範囲：
- 前提条件と未解決の問い：
- 回答案または判断案と、その理由：

## 回答を検証する
| 主張または基準 | 証拠またはテスト | 結果または不足 | 担当者 |
| --- | --- | --- | --- |
| | | | |
| | | | |
| | | | |

## 次の対応
- 対応、担当者、日付：
- この回答をいつ見直しますか？

## 覚えておく原則
定義したタスクと環境に合うモデルを選びます。モデル、ツール、要件が変わったら判断を見直します。

## 出典
- [NIST: Generative AI Profile](https://doi.org/10.6028/NIST.AI.600-1)
- [METR: Developer productivity study methodology](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)

このワークシートは、学習を支援します。完了しても、それだけで本番の変更が許可されるわけではありません。
