根據證據選擇模型
已完成以代表性任務、驗收標準、成本和團隊運作限制比較模型。
檢查理解程度模型 A 通過更多公開基準測試;模型 B 在有代表性的儲存庫任務表現較好。應依據哪項結果決定?進行練習
學習目標
- 從實際任務類型建立小型評估集。
- 區分模型品質與工具、上下文造成的影響。
- 記錄需要重新評估的條件。
定義要作出的決定
模型比較需要具體用途。能清楚解釋小函式的模型,不一定同樣擅長大型儲存庫變更。成本較低的模型,可能足以滿足例行轉換的品質要求;困難調查則可能需要更強推理能力。
先寫出任務與限制,包括允許資料、必要工具、回應時間,以及最高可接受成本。有些限制是強制要求,不能因其他項目分數很高,就在總分中忽略資料處理限制。
使用有代表性的任務
從團隊實際工作建立小型評估集。除非評估環境已獲准處理敏感資料,否則先移除敏感資料。納入簡單任務、困難任務,以及正確回應應是要求補充資訊的任務。
對虛構報表服務,可以使用已知日期缺陷、小型篩選功能,以及授權規則解說。執行比較前先準備預期結果,並納入能拒絕已知缺陷的反向測試。
保留部分任務,不用於調整提示詞。如果反覆拿所有範例微調提示詞,最終分數可能高估一般表現。獨立任務集有助於判斷,改進後的提示詞是否也適用於開發時未用過的範例。
維持公平比較
記錄確切模型版本、提示詞、提供的上下文、工具與權限。使用相當的初始狀態。如果一個模型收到完整儲存庫,另一個只收到一個檔案,結果比較的就不只是模型,也包括工作流程。
比較工作流程可以很有用,但應正確標示。代理程式產品不只包含模型;上下文選取、工具、執行限制和復原行為,都可能影響結果。
輸出差異重要時,執行多次測試。記錄失敗嘗試,不要只回報最佳結果。主觀標準應使用書面評分準則,實際可行時安排多位審查者。
先評品質,再比較速度
先檢查強制驗收標準。變更滿足需求嗎?存取控制保留了嗎?相關測試通過嗎?審查者看得懂 diff 嗎?
再比較可接受結果的投入、經過時間和成本,納入重試與人工審查。便宜的單次回應,如果需要反覆修正,整項任務仍可能昂貴。
| 評估欄位 | 應記錄內容 |
|---|---|
| 任務結果 | 哪些驗收標準通過或失敗 |
| 範圍 | 未要求的變更或遺漏需求 |
| 人力投入 | 準備、審查和修正時間 |
| 執行成本 | 模型與工具費用,包括重試 |
| 證據 | 版本、輸入、輸出、檢查和審查註記 |
公開基準有助於找出候選模型,但使用的是特定任務集和評分方式。不要把基準分數當作團隊生產力的直接量測。
記錄決定與失效條件
結果可以是範圍有限的建議,例如:「在這個儲存庫中,依照既有審查要求,用此模型新增少量測試。」不必用同一個模型處理所有任務。
說明哪些情況需要重新評估,例如模型版本改變、工具設定不同、新增資料類別,或持續出現某種失敗模式。為超出所選模型能力的任務保留替代方式。
評估的目的,是減少真實決策的不確定性。避免無止境地比較模型,耗費的投入反而超過它要協助的工作。
進行練習
為三類任務建立評估表:已知缺陷、小功能,以及儲存庫解說。比較模型前,先定義驗收標準。每項任務納入一個失敗案例。記錄模型版本、上下文、工具權限、嘗試次數、成本和審查投入。
下載工作表(Markdown)取消此選項,會刪除此瀏覽器儲存的所有進度。
進度只留在此瀏覽器。無須帳戶,沒有追蹤。