路徑 01課程 6 / 6

根據證據選擇模型

以代表性任務、驗收標準、成本和團隊運作限制比較模型。

實務10 分鐘已審查

發布者 我們如何撰寫

檢查理解程度模型 A 通過更多公開基準測試;模型 B 在有代表性的儲存庫任務表現較好。應依據哪項結果決定?進行練習
模型 A 通過更多公開基準測試;模型 B 在有代表性的儲存庫任務表現較好。應依據哪項結果決定?

學習目標

  • 從實際任務類型建立小型評估集。
  • 區分模型品質與工具、上下文造成的影響。
  • 記錄需要重新評估的條件。

定義要作出的決定

模型比較需要具體用途。能清楚解釋小函式的模型,不一定同樣擅長大型儲存庫變更。成本較低的模型,可能足以滿足例行轉換的品質要求;困難調查則可能需要更強推理能力。

先寫出任務與限制,包括允許資料、必要工具、回應時間,以及最高可接受成本。有些限制是強制要求,不能因其他項目分數很高,就在總分中忽略資料處理限制。

使用有代表性的任務

從團隊實際工作建立小型評估集。除非評估環境已獲准處理敏感資料,否則先移除敏感資料。納入簡單任務、困難任務,以及正確回應應是要求補充資訊的任務。

對虛構報表服務,可以使用已知日期缺陷、小型篩選功能,以及授權規則解說。執行比較前先準備預期結果,並納入能拒絕已知缺陷的反向測試。

保留部分任務,不用於調整提示詞。如果反覆拿所有範例微調提示詞,最終分數可能高估一般表現。獨立任務集有助於判斷,改進後的提示詞是否也適用於開發時未用過的範例。

維持公平比較

記錄確切模型版本、提示詞、提供的上下文、工具與權限。使用相當的初始狀態。如果一個模型收到完整儲存庫,另一個只收到一個檔案,結果比較的就不只是模型,也包括工作流程。

比較工作流程可以很有用,但應正確標示。代理程式產品不只包含模型;上下文選取、工具、執行限制和復原行為,都可能影響結果。

輸出差異重要時,執行多次測試。記錄失敗嘗試,不要只回報最佳結果。主觀標準應使用書面評分準則,實際可行時安排多位審查者。

先評品質,再比較速度

先檢查強制驗收標準。變更滿足需求嗎?存取控制保留了嗎?相關測試通過嗎?審查者看得懂 diff 嗎?

再比較可接受結果的投入、經過時間和成本,納入重試與人工審查。便宜的單次回應,如果需要反覆修正,整項任務仍可能昂貴。

評估欄位應記錄內容
任務結果哪些驗收標準通過或失敗
範圍未要求的變更或遺漏需求
人力投入準備、審查和修正時間
執行成本模型與工具費用,包括重試
證據版本、輸入、輸出、檢查和審查註記

公開基準有助於找出候選模型,但使用的是特定任務集和評分方式。不要把基準分數當作團隊生產力的直接量測。

記錄決定與失效條件

結果可以是範圍有限的建議,例如:「在這個儲存庫中,依照既有審查要求,用此模型新增少量測試。」不必用同一個模型處理所有任務。

說明哪些情況需要重新評估,例如模型版本改變、工具設定不同、新增資料類別,或持續出現某種失敗模式。為超出所選模型能力的任務保留替代方式。

評估的目的,是減少真實決策的不確定性。避免無止境地比較模型,耗費的投入反而超過它要協助的工作。

進行練習

為三類任務建立評估表:已知缺陷、小功能,以及儲存庫解說。比較模型前,先定義驗收標準。每項任務納入一個失敗案例。記錄模型版本、上下文、工具權限、嘗試次數、成本和審查投入。

下載工作表(Markdown)
檢查理解程度 ↑

繼續學習

來源與延伸閱讀

Taiga 相關延伸閱讀

← 上一課: 衡量有用的進展