Ścieżka 01Lekcja 6 / 6

Wybierz model na podstawie dowodów

Porównuj modele na reprezentatywnych zadaniach, kryteriach akceptacji, kosztach i ograniczeniach pracy zespołu.

Praktyka10 minSprawdzono

Wydawca Jak piszemy

Czego się nauczysz

  • Utwórz mały zestaw oceny z rzeczywistych rodzajów zadań.
  • Oddziel jakość modelu od wpływu narzędzi i kontekstu.
  • Zapisz warunki wymagające nowej oceny.

Określ decyzję

Porównanie modeli wymaga konkretnego zastosowania. Model dobrze wyjaśniający małą funkcję może gorzej radzić sobie z dużą zmianą repozytorium. Tańszy model może spełniać wymagania jakości rutynowych przekształceń. Trudna analiza może wymagać większych zdolności rozumowania.

Najpierw zapisz zadanie i ograniczenia. Uwzględnij dozwolone dane, wymagane narzędzia, czas odpowiedzi i maksymalny akceptowalny koszt. Niektóre ograniczenia są obowiązkowe. Nie uśredniaj ograniczenia przetwarzania danych z wysokim wynikiem innego kryterium.

Użyj reprezentatywnych zadań

Zbuduj mały zestaw oceny na podstawie rzeczywistej pracy zespołu. Usuń dane wrażliwe, chyba że środowisko oceny zostało dla nich zatwierdzone. Uwzględnij zadania proste, trudne oraz takie, w których poprawną odpowiedzią jest prośba o brakujące informacje.

Dla fikcyjnej usługi raportowania użyj znanego błędu daty, małej funkcji filtrowania i wyjaśnienia reguły autoryzacji. Przygotuj oczekiwany wynik przed porównaniem. Dodaj test negatywny odrzucający znany błąd.

Zachowaj część zadań poza pracą nad promptem. Jeśli wielokrotnie dostrajasz prompt na każdym przykładzie, końcowy wynik może zawyżać ogólną skuteczność. Osobny zestaw pomaga sprawdzić, czy poprawiony prompt działa poza przykładami użytymi do jego stworzenia.

Zapewnij uczciwe porównanie

Zapisz dokładną wersję modelu, prompt, dostarczony kontekst, narzędzia i uprawnienia. Użyj równoważnych stanów początkowych. Jeśli jeden model otrzyma całe repozytorium, a drugi jeden plik, wynik porównuje również procesy pracy.

Porównanie procesów może być przydatne. Nazwij je poprawnie. Produkt oparty na agentach obejmuje więcej niż model: wybór kontekstu, narzędzia, limity wykonania i zachowanie po błędzie mogą wpływać na wynik.

Powtarzaj wykonania, gdy zmienność odpowiedzi ma znaczenie. Zapisuj nieudane próby zamiast raportować tylko najlepszy wynik. Dla kryteriów subiektywnych stosuj pisemne zasady oceny i, gdy to praktyczne, więcej niż jednego recenzenta.

Oceń jakość przed szybkością

Najpierw sprawdź obowiązkowe kryteria akceptacji. Czy zmiana spełnia wymaganie? Czy zachowuje kontrolę dostępu? Czy odpowiednie testy przechodzą? Czy recenzent rozumie diff?

Następnie porównaj nakład pracy, czas i koszt akceptowalnych wyników. Uwzględnij ponowienia i review człowieka. Tania odpowiedź wymagająca wielu poprawek może być droga na poziomie zadania.

Pole ocenyCo zapisać
Wynik zadaniaKtóre kryteria akceptacji zostały spełnione lub niespełnione
ZakresNiezamówione zmiany lub brakujące wymagania
Praca człowiekaCzas przygotowania, review i poprawek
Koszt wykonaniaKoszty modelu i narzędzi, w tym ponowień
DowodyWersja, wejście, wyjście, kontrole i uwagi recenzenta

Publiczne benchmarki pomagają wybrać kandydatów. Używają określonych zestawów zadań i metod punktacji. Nie traktuj wyniku benchmarku jako bezpośredniego pomiaru produktywności zespołu.

Zapisz decyzję i warunki jej wygaśnięcia

Wynikiem może być wąskie zalecenie. Na przykład: „Używaj tego modelu do dodawania małych testów w tym repozytorium, z obecnymi wymaganiami review”. Nie potrzebujesz jednego modelu do każdego zadania.

Określ, co wymaga ponownej oceny. Przykłady to zmiana wersji modelu, inna konfiguracja narzędzi, nowa kategoria danych lub powtarzalny wzorzec błędów. Zachowaj rozwiązanie zastępcze dla zadań przekraczających możliwości wybranego modelu.

Ocena ma ograniczyć niepewność rzeczywistej decyzji. Unikaj stałego konkursu modeli, który pochłania więcej wysiłku niż wspierana przez niego praca.

Wykonaj ćwiczenie

Utwórz arkusz oceny dla trzech typów zadań: znanego błędu, małej funkcji i wyjaśnienia repozytorium. Określ kryteria akceptacji przed porównaniem modeli. Dodaj po jednym przypadku błędu. Zapisz wersję modelu, kontekst, uprawnienia narzędzi, próby, koszt i nakład review.

Pobierz arkusz (Markdown)

Sprawdź zrozumienie

Model A rozwiązuje więcej zadań publicznego benchmarku. Model B lepiej wykonuje reprezentatywne zadania w Twoim repozytorium. Który wynik powinien kierować decyzją?

Źródła i dalsza lektura

Powiązana lektura od Taiga