Wybierz model na podstawie dowodów
Porównuj modele na reprezentatywnych zadaniach, kryteriach akceptacji, kosztach i ograniczeniach pracy zespołu.
Wydawca TaigaJak piszemy
Czego się nauczysz
- Utwórz mały zestaw oceny z rzeczywistych rodzajów zadań.
- Oddziel jakość modelu od wpływu narzędzi i kontekstu.
- Zapisz warunki wymagające nowej oceny.
Określ decyzję
Porównanie modeli wymaga konkretnego zastosowania. Model dobrze wyjaśniający małą funkcję może gorzej radzić sobie z dużą zmianą repozytorium. Tańszy model może spełniać wymagania jakości rutynowych przekształceń. Trudna analiza może wymagać większych zdolności rozumowania.
Najpierw zapisz zadanie i ograniczenia. Uwzględnij dozwolone dane, wymagane narzędzia, czas odpowiedzi i maksymalny akceptowalny koszt. Niektóre ograniczenia są obowiązkowe. Nie uśredniaj ograniczenia przetwarzania danych z wysokim wynikiem innego kryterium.
Użyj reprezentatywnych zadań
Zbuduj mały zestaw oceny na podstawie rzeczywistej pracy zespołu. Usuń dane wrażliwe, chyba że środowisko oceny zostało dla nich zatwierdzone. Uwzględnij zadania proste, trudne oraz takie, w których poprawną odpowiedzią jest prośba o brakujące informacje.
Dla fikcyjnej usługi raportowania użyj znanego błędu daty, małej funkcji filtrowania i wyjaśnienia reguły autoryzacji. Przygotuj oczekiwany wynik przed porównaniem. Dodaj test negatywny odrzucający znany błąd.
Zachowaj część zadań poza pracą nad promptem. Jeśli wielokrotnie dostrajasz prompt na każdym przykładzie, końcowy wynik może zawyżać ogólną skuteczność. Osobny zestaw pomaga sprawdzić, czy poprawiony prompt działa poza przykładami użytymi do jego stworzenia.
Zapewnij uczciwe porównanie
Zapisz dokładną wersję modelu, prompt, dostarczony kontekst, narzędzia i uprawnienia. Użyj równoważnych stanów początkowych. Jeśli jeden model otrzyma całe repozytorium, a drugi jeden plik, wynik porównuje również procesy pracy.
Porównanie procesów może być przydatne. Nazwij je poprawnie. Produkt oparty na agentach obejmuje więcej niż model: wybór kontekstu, narzędzia, limity wykonania i zachowanie po błędzie mogą wpływać na wynik.
Powtarzaj wykonania, gdy zmienność odpowiedzi ma znaczenie. Zapisuj nieudane próby zamiast raportować tylko najlepszy wynik. Dla kryteriów subiektywnych stosuj pisemne zasady oceny i, gdy to praktyczne, więcej niż jednego recenzenta.
Oceń jakość przed szybkością
Najpierw sprawdź obowiązkowe kryteria akceptacji. Czy zmiana spełnia wymaganie? Czy zachowuje kontrolę dostępu? Czy odpowiednie testy przechodzą? Czy recenzent rozumie diff?
Następnie porównaj nakład pracy, czas i koszt akceptowalnych wyników. Uwzględnij ponowienia i review człowieka. Tania odpowiedź wymagająca wielu poprawek może być droga na poziomie zadania.
| Pole oceny | Co zapisać |
|---|---|
| Wynik zadania | Które kryteria akceptacji zostały spełnione lub niespełnione |
| Zakres | Niezamówione zmiany lub brakujące wymagania |
| Praca człowieka | Czas przygotowania, review i poprawek |
| Koszt wykonania | Koszty modelu i narzędzi, w tym ponowień |
| Dowody | Wersja, wejście, wyjście, kontrole i uwagi recenzenta |
Publiczne benchmarki pomagają wybrać kandydatów. Używają określonych zestawów zadań i metod punktacji. Nie traktuj wyniku benchmarku jako bezpośredniego pomiaru produktywności zespołu.
Zapisz decyzję i warunki jej wygaśnięcia
Wynikiem może być wąskie zalecenie. Na przykład: „Używaj tego modelu do dodawania małych testów w tym repozytorium, z obecnymi wymaganiami review”. Nie potrzebujesz jednego modelu do każdego zadania.
Określ, co wymaga ponownej oceny. Przykłady to zmiana wersji modelu, inna konfiguracja narzędzi, nowa kategoria danych lub powtarzalny wzorzec błędów. Zachowaj rozwiązanie zastępcze dla zadań przekraczających możliwości wybranego modelu.
Ocena ma ograniczyć niepewność rzeczywistej decyzji. Unikaj stałego konkursu modeli, który pochłania więcej wysiłku niż wspierana przez niego praca.
Wykonaj ćwiczenie
Utwórz arkusz oceny dla trzech typów zadań: znanego błędu, małej funkcji i wyjaśnienia repozytorium. Określ kryteria akceptacji przed porównaniem modeli. Dodaj po jednym przypadku błędu. Zapisz wersję modelu, kontekst, uprawnienia narzędzi, próby, koszt i nakład review.
Pobierz arkusz (Markdown)Sprawdź zrozumienie
Źródła i dalsza lektura
Powiązana lektura od Taiga
Odznaczenie tej opcji usuwa wszystkie postępy zapisane w tej przeglądarce.
Postępy pozostają w tej przeglądarce. Bez konta i śledzenia.