Parcurs 01Lecție 6 / 6

Alegeți un model pe baza dovezilor

Comparați modelele pe sarcini reprezentative, criterii de acceptare, costuri și constrângerile de lucru ale echipei.

Practică10 minVerificat

Publicat de Cum scriem

Verificați ce ați înțelesModelul A rezolvă mai multe sarcini din benchmarkuri publice. Modelul B are rezultate mai bune pe sarcinile reprezentative din depozitul dumneavoastră de cod. Ce rezultat ar trebui să ghideze decizia?Faceți exercițiul
Modelul A rezolvă mai multe sarcini din benchmarkuri publice. Modelul B are rezultate mai bune pe sarcinile reprezentative din depozitul dumneavoastră de cod. Ce rezultat ar trebui să ghideze decizia?

Ce veți învăța

  • Creați un set mic de evaluare din tipuri reale de sarcini.
  • Separați calitatea modelului de efectul instrumentelor și al contextului.
  • Notați condițiile care impun o nouă evaluare.

Definiți decizia

Compararea modelelor necesită o utilizare concretă. Un model care explică bine o funcție mică poate să nu gestioneze la fel de bine o modificare amplă într-un depozit de cod. Un model cu cost mai mic poate satisface cerința de calitate pentru transformări de rutină. O investigație dificilă poate necesita o capacitate de raționament mai mare.

Scrieți mai întâi sarcina și constrângerile. Includeți datele permise, instrumentele necesare, timpul de răspuns și costul maxim acceptabil. Unele constrângeri sunt obligatorii. Nu compensați o restricție de prelucrare a datelor prin media cu un alt scor ridicat.

Folosiți sarcini reprezentative

Construiți un set mic de evaluare din activitățile reale ale echipei. Eliminați datele sensibile, cu excepția cazului în care mediul de evaluare este aprobat pentru ele. Includeți sarcini simple, sarcini dificile și sarcini în care răspunsul corect este să se ceară informațiile lipsă.

Pentru un serviciu fictiv de raportare, folosiți un defect cunoscut privind datele calendaristice, o funcționalitate mică de filtrare și explicarea unei reguli de autorizare. Pregătiți rezultatul așteptat înainte de comparare. Includeți un test negativ care respinge defectul cunoscut.

Păstrați unele sarcini în afara procesului de dezvoltare a promptului. Dacă ajustați repetat promptul pe fiecare exemplu, scorul final poate exagera performanța generală. Un set separat ajută să vedeți dacă promptul îmbunătățit funcționează și în afara exemplelor folosite la crearea sa.

Păstrați comparația echitabilă

Notați versiunea exactă a modelului, promptul, contextul furnizat, instrumentele și permisiunile. Folosiți stări inițiale echivalente. Dacă un model primește un depozit de cod complet, iar altul un singur fișier, rezultatul compară atât fluxuri de lucru, cât și modele.

Compararea fluxurilor de lucru poate fi utilă. Etichetați-o corect. Un produs cu agenți include mai mult decât un model: selectarea contextului, instrumentele, limitele de execuție și comportamentul de recuperare pot afecta rezultatul.

Folosiți execuții repetate când variația rezultatelor contează. Notați încercările eșuate în loc să raportați doar cel mai bun rezultat. Pentru criteriile subiective, folosiți o grilă scrisă și mai mulți evaluatori când este posibil.

Evaluați calitatea înaintea vitezei

Mai întâi, verificați criteriile obligatorii de acceptare. Îndeplinește modificarea cerința? Păstrează controalele de acces? Trec testele relevante? Poate persoana care verifică să înțeleagă diff-ul?

Apoi comparați efortul, timpul scurs și costul pentru rezultatele acceptabile. Includeți reîncercările și verificarea umană. Un răspuns ieftin care necesită corecții repetate poate fi scump la nivelul sarcinii.

Câmp de evaluareCe se notează
Rezultatul sarciniiCriteriile de acceptare îndeplinite sau neîndeplinite
DomeniuModificări nesolicitate sau cerințe lipsă
Efort umanTimpul de pregătire, verificare și corectare
Costul execuțieiCosturile modelului și ale instrumentelor, inclusiv reîncercările
DoveziVersiunea, intrarea, rezultatul, verificările și notele evaluatorului

Benchmarkurile publice pot ajuta la identificarea candidaților. Folosesc seturi de sarcini și metode de notare specifice. Nu tratați scorul unui benchmark ca măsură directă a productivității echipei.

Notați decizia și condițiile care o invalidează

Rezultatul poate fi o recomandare restrânsă. De exemplu: „Folosiți acest model pentru adăugări mici de teste în acest depozit de cod, cu cerințele de verificare existente.” Nu aveți nevoie de un singur model pentru toate sarcinile.

Precizați ce ar impune o altă evaluare. Exemplele includ schimbarea versiunii modelului, altă configurație a instrumentelor, o categorie nouă de date sau un tipar persistent de eșec. Păstrați o alternativă pentru sarcinile care depășesc capacitatea modelului selectat.

Scopul evaluării este reducerea incertitudinii privind o decizie reală. Evitați o competiție permanentă între modele care consumă mai mult efort decât lucrul pe care îl sprijină.

Faceți exercițiul

Creați o fișă de evaluare pentru trei tipuri de sarcini: un defect cunoscut, o funcționalitate mică și explicarea unui depozit de cod. Definiți criteriile de acceptare înainte de compararea modelelor. Includeți un caz de eșec pentru fiecare sarcină. Notați versiunea modelului, contextul, permisiunile instrumentelor, încercările, costul și efortul de verificare.

Descărcați fișa de lucru (Markdown)
Verificați ce ați înțeles ↑

Continuați învățarea

Surse și lecturi suplimentare

Lecturi asociate de la Taiga

← Lecția anterioară: Măsurați progresul util