Odaberite model na temelju dokaza
DovršenoUsporedite modele na reprezentativnim zadacima, kriterijima prihvaćanja, troškovima i operativnim ograničenjima tima.
Objavljuje TaigaKako pišemo
Provjerite razumijevanjeModel A prolazi više zadataka javnog benchmarka. Model B radi bolje na reprezentativnim zadacima vašeg repozitorija. Koji rezultat treba usmjeriti odluku?Napravite vježbu
Što ćete naučiti
- Sastaviti mali evaluacijski skup od stvarnih vrsta zadataka.
- Odvojiti kvalitetu modela od učinka alata i konteksta.
- Zabilježiti uvjete koji zahtijevaju novu evaluaciju.
Definirajte odluku
Usporedba modela treba konkretnu primjenu. Model koji dobro objašnjava malu funkciju možda ne obrađuje jednako dobro veliku promjenu repozitorija. Jeftiniji model može zadovoljiti zahtjev kvalitete za rutinske transformacije. Teško istraživanje može zahtijevati veću sposobnost zaključivanja.
Prvo napišite zadatak i ograničenja. Uključite dopuštene podatke, potrebne alate, vrijeme odgovora i najveći prihvatljiv trošak. Neka su ograničenja obvezna. Nemojte ograničenje obrade podataka poništiti prosječnom ocjenom zato što je drugi rezultat visok.
Upotrijebite reprezentativne zadatke
Sastavite mali evaluacijski skup iz rada koji tim stvarno obavlja. Uklonite osjetljive podatke ako evaluacijsko okruženje nije odobreno za njih. Uključite jednostavne i teške zadatke te zadatke u kojima je točan odgovor zatražiti informacije koje nedostaju.
Za izmišljenu uslugu izvještavanja upotrijebite poznatu pogrešku datuma, malu funkciju filtriranja i objašnjenje pravila autorizacije. Pripremite očekivani rezultat prije usporedbe. Uključite negativni test koji ne prolazi dok je poznata pogreška prisutna.
Neke zadatke držite odvojene od razvoja prompta. Ako prompt stalno podešavate na svakom primjeru, konačni rezultat može precijeniti opću uspješnost. Zaseban skup pomaže otkriti radi li poboljšani prompt i izvan primjera upotrijebljenih za njegovu izradu.
Uspoređujte pošteno
Zabilježite točnu verziju modela, prompt, dostavljeni kontekst, alate i ovlasti. Upotrijebite ekvivalentna početna stanja. Ako jedan model dobije cijeli repozitorij, a drugi jednu datoteku, rezultat uspoređuje radne procese i modele.
Usporedbe radnih procesa mogu biti korisne. Točno ih označite. Agentski proizvod uključuje više od modela: odabir konteksta, alati, ograničenja izvršavanja i ponašanje pri oporavku mogu utjecati na rezultat.
Kad je varijacija izlaza važna, ponovite izvođenja. Zabilježite neuspjele pokušaje umjesto da prijavite samo najbolji rezultat. Za subjektivne kriterije upotrijebite pisana pravila ocjenjivanja i, gdje je izvedivo, više pregledavatelja.
Ocijenite kvalitetu prije brzine
Najprije provjerite obvezne kriterije prihvaćanja. Zadovoljava li promjena zahtjev? Čuva li kontrole pristupa? Prolaze li relevantni testovi? Može li pregledavatelj razumjeti diff?
Zatim usporedite trud, proteklo vrijeme i trošak prihvatljivih rezultata. Uključite ponovljene pokušaje i ljudski pregled. Jeftin odgovor koji treba ponovljene ispravke može biti skup na razini zadatka.
| Polje evaluacije | Što zabilježiti |
|---|---|
| Rezultat zadatka | Koji su kriteriji prihvaćanja ispunjeni, a koji nisu |
| Opseg | Netražene promjene ili zahtjevi koji nedostaju |
| Ljudski trud | Vrijeme pripreme, pregleda i ispravaka |
| Trošak izvršavanja | Troškovi modela i alata, uključujući ponovljene pokušaje |
| Dokazi | Verzija, ulaz, izlaz, provjere i bilješke pregledavatelja |
Javni benchmarkovi mogu pomoći prepoznati kandidate. Upotrebljavaju konkretne skupove zadataka i metode bodovanja. Rezultat benchmarka nemojte tretirati kao izravno mjerenje produktivnosti tima.
Zabilježite odluku i uvjete prestanka njezine valjanosti
Rezultat može biti uska preporuka. Primjerice: „Upotrebljavajte ovaj model za male dodatke testovima u ovom repozitoriju uz postojeće zahtjeve pregleda.” Ne trebate jedan model za svaki zadatak.
Navedite što bi zahtijevalo novu evaluaciju. Primjeri uključuju promjenu verzije modela, drugačiju konfiguraciju alata, novu kategoriju podataka ili trajan obrazac neuspjeha. Zadržite rezervnu mogućnost za zadatke koji premašuju sposobnost odabranog modela.
Svrha evaluacije jest smanjiti nesigurnost stvarne odluke. Izbjegnite trajno natjecanje modela koje troši više truda od rada koji podupire.
Napravite vježbu
Napravite evaluacijski list za tri vrste zadataka: poznatu pogrešku, malu funkciju i objašnjenje repozitorija. Prije usporedbe modela definirajte kriterije prihvaćanja. Uključite jedan slučaj neuspjeha po zadatku. Zabilježite verziju modela, kontekst, ovlasti alata, pokušaje, trošak i trud za pregled.
Preuzmi radni list (Markdown)Uklanjanje ove oznake briše sav napredak spremljen u ovom pregledniku.
Napredak ostaje u ovom pregledniku. Bez računa i praćenja.