Itinerari 01Lliçó 6 / 6

Trieu un model amb evidències

Compareu els models amb tasques representatives, criteris d'acceptació, cost i restriccions de funcionament de l'equip.

Pràctic10 minRevisat

Publicat per Com escrivim

Comproveu què heu entèsEl model A supera més tasques de benchmarks públics. El model B obté millors resultats en les tasques representatives del vostre repositori. Quin resultat ha d'orientar la decisió?Feu l'exercici
El model A supera més tasques de benchmarks públics. El model B obté millors resultats en les tasques representatives del vostre repositori. Quin resultat ha d'orientar la decisió?

Què aprendreu

  • Crear un petit conjunt d'avaluació a partir de tipus de tasques reals.
  • Separar la qualitat del model de l'efecte de les eines i el context.
  • Registrar les condicions que requereixen una nova avaluació.

Definiu la decisió

Una comparació de models necessita un ús concret. Un model que explica bé una funció petita potser no gestiona igual de bé un canvi extens al repositori. Un model de cost més baix pot satisfer el requisit de qualitat de transformacions rutinàries. Una investigació difícil pot necessitar més capacitat de raonament.

Escriviu primer la tasca i les restriccions. Incloeu les dades permeses, les eines necessàries, el temps de resposta i el cost màxim acceptable. Algunes restriccions són obligatòries. No compenseu una restricció de tractament de dades fent una mitjana amb una altra puntuació alta.

Utilitzeu tasques representatives

Creeu un petit conjunt d’avaluació a partir de la feina que fa realment l’equip. Elimineu les dades sensibles, llevat que l’entorn d’avaluació estigui aprovat per tractar-les. Incloeu tasques senzilles, difícils i tasques en què la resposta correcta sigui demanar informació que falta.

Per a un servei fictici d’informes, utilitzeu un defecte de dates conegut, una petita funcionalitat de filtratge i l’explicació d’una regla d’autorització. Prepareu el resultat esperat abans d’executar la comparació. Incloeu una prova negativa que rebutgi el defecte conegut.

Reserveu algunes tasques fora del desenvolupament del prompt. Si ajusteu repetidament el prompt amb tots els exemples, la puntuació final pot exagerar el rendiment general. Un conjunt separat ajuda a descobrir si el prompt millorat funciona més enllà dels exemples utilitzats per crear-lo.

Manteniu una comparació equilibrada

Registreu la versió exacta del model, el prompt, el context proporcionat, les eines i els permisos. Utilitzeu estats inicials equivalents. Si un model rep un repositori complet i un altre rep un fitxer, el resultat compara fluxos de treball a més de models.

Les comparacions de fluxos de treball poden ser útils. Identifiqueu-les correctament. Un producte amb agents inclou més que el model: la selecció del context, les eines, els límits d’execució i el comportament de recuperació poden afectar el resultat.

Feu diverses execucions quan la variació de la sortida sigui rellevant. Registreu els intents fallits en lloc de mostrar només el millor resultat. Per a criteris subjectius, utilitzeu una rúbrica escrita i més d’una persona revisora quan sigui viable.

Avalueu la qualitat abans de la velocitat

Primer, comproveu els criteris d’acceptació obligatoris. El canvi compleix el requisit? Conserva els controls d’accés? Passen les proves pertinents? Qui el revisa pot entendre la comparació de canvis?

Després compareu l’esforç, el temps transcorregut i el cost dels resultats acceptables. Incloeu els reintents i la revisió humana. Una resposta barata que requereix correccions repetides pot sortir cara per al conjunt de la tasca.

Camp d’avaluacióQuè cal registrar
Resultat de la tascaQuins criteris d’acceptació s’han superat o han fallat
AbastCanvis no demanats o requisits que falten
Esforç humàTemps de preparació, revisió i correcció
Cost d’execucióCostos del model i de les eines, inclosos els reintents
EvidènciesVersió, entrada, sortida, comprovacions i notes de revisió

Els benchmarks públics poden ajudar a identificar candidats. Utilitzen conjunts de tasques i mètodes de puntuació concrets. No tracteu la puntuació d’un benchmark com una mesura directa de la productivitat de l’equip.

Registreu la decisió i les condicions de caducitat

El resultat pot ser una recomanació limitada. Per exemple: «Utilitzeu aquest model per afegir petites proves en aquest repositori, amb els requisits de revisió existents». No necessiteu un model únic per a totes les tasques.

Indiqueu què obligaria a repetir l’avaluació. Alguns exemples són un canvi de versió del model, una altra configuració d’eines, una categoria de dades nova o un patró de fallada persistent. Manteniu una alternativa per a les tasques que superin la capacitat del model triat.

La finalitat de l’avaluació és reduir la incertesa d’una decisió real. Eviteu una competició permanent entre models que consumeixi més esforç que la feina a la qual dona suport.

Feu l'exercici

Creeu un full d'avaluació per a tres tipus de tasca: un defecte conegut, una funcionalitat petita i una explicació del repositori. Definiu els criteris d'acceptació abans de comparar els models. Incloeu un cas de fallada per tasca. Registreu la versió del model, el context, els permisos de les eines, els intents, el cost i l'esforç de revisió.

Descarrega la fitxa (Markdown)
Comproveu què heu entès ↑

Continua aprenent

Fonts i lectures addicionals

Lectures relacionades de Taiga

Lliçó anterior: Mesureu el progrés útil