Trieu un model amb evidències
CompletadaCompareu els models amb tasques representatives, criteris d'acceptació, cost i restriccions de funcionament de l'equip.
Publicat per TaigaCom escrivim
Comproveu què heu entèsEl model A supera més tasques de benchmarks públics. El model B obté millors resultats en les tasques representatives del vostre repositori. Quin resultat ha d'orientar la decisió?Feu l'exercici
Què aprendreu
- Crear un petit conjunt d'avaluació a partir de tipus de tasques reals.
- Separar la qualitat del model de l'efecte de les eines i el context.
- Registrar les condicions que requereixen una nova avaluació.
Definiu la decisió
Una comparació de models necessita un ús concret. Un model que explica bé una funció petita potser no gestiona igual de bé un canvi extens al repositori. Un model de cost més baix pot satisfer el requisit de qualitat de transformacions rutinàries. Una investigació difícil pot necessitar més capacitat de raonament.
Escriviu primer la tasca i les restriccions. Incloeu les dades permeses, les eines necessàries, el temps de resposta i el cost màxim acceptable. Algunes restriccions són obligatòries. No compenseu una restricció de tractament de dades fent una mitjana amb una altra puntuació alta.
Utilitzeu tasques representatives
Creeu un petit conjunt d’avaluació a partir de la feina que fa realment l’equip. Elimineu les dades sensibles, llevat que l’entorn d’avaluació estigui aprovat per tractar-les. Incloeu tasques senzilles, difícils i tasques en què la resposta correcta sigui demanar informació que falta.
Per a un servei fictici d’informes, utilitzeu un defecte de dates conegut, una petita funcionalitat de filtratge i l’explicació d’una regla d’autorització. Prepareu el resultat esperat abans d’executar la comparació. Incloeu una prova negativa que rebutgi el defecte conegut.
Reserveu algunes tasques fora del desenvolupament del prompt. Si ajusteu repetidament el prompt amb tots els exemples, la puntuació final pot exagerar el rendiment general. Un conjunt separat ajuda a descobrir si el prompt millorat funciona més enllà dels exemples utilitzats per crear-lo.
Manteniu una comparació equilibrada
Registreu la versió exacta del model, el prompt, el context proporcionat, les eines i els permisos. Utilitzeu estats inicials equivalents. Si un model rep un repositori complet i un altre rep un fitxer, el resultat compara fluxos de treball a més de models.
Les comparacions de fluxos de treball poden ser útils. Identifiqueu-les correctament. Un producte amb agents inclou més que el model: la selecció del context, les eines, els límits d’execució i el comportament de recuperació poden afectar el resultat.
Feu diverses execucions quan la variació de la sortida sigui rellevant. Registreu els intents fallits en lloc de mostrar només el millor resultat. Per a criteris subjectius, utilitzeu una rúbrica escrita i més d’una persona revisora quan sigui viable.
Avalueu la qualitat abans de la velocitat
Primer, comproveu els criteris d’acceptació obligatoris. El canvi compleix el requisit? Conserva els controls d’accés? Passen les proves pertinents? Qui el revisa pot entendre la comparació de canvis?
Després compareu l’esforç, el temps transcorregut i el cost dels resultats acceptables. Incloeu els reintents i la revisió humana. Una resposta barata que requereix correccions repetides pot sortir cara per al conjunt de la tasca.
| Camp d’avaluació | Què cal registrar |
|---|---|
| Resultat de la tasca | Quins criteris d’acceptació s’han superat o han fallat |
| Abast | Canvis no demanats o requisits que falten |
| Esforç humà | Temps de preparació, revisió i correcció |
| Cost d’execució | Costos del model i de les eines, inclosos els reintents |
| Evidències | Versió, entrada, sortida, comprovacions i notes de revisió |
Els benchmarks públics poden ajudar a identificar candidats. Utilitzen conjunts de tasques i mètodes de puntuació concrets. No tracteu la puntuació d’un benchmark com una mesura directa de la productivitat de l’equip.
Registreu la decisió i les condicions de caducitat
El resultat pot ser una recomanació limitada. Per exemple: «Utilitzeu aquest model per afegir petites proves en aquest repositori, amb els requisits de revisió existents». No necessiteu un model únic per a totes les tasques.
Indiqueu què obligaria a repetir l’avaluació. Alguns exemples són un canvi de versió del model, una altra configuració d’eines, una categoria de dades nova o un patró de fallada persistent. Manteniu una alternativa per a les tasques que superin la capacitat del model triat.
La finalitat de l’avaluació és reduir la incertesa d’una decisió real. Eviteu una competició permanent entre models que consumeixi més esforç que la feina a la qual dona suport.
Feu l'exercici
Creeu un full d'avaluació per a tres tipus de tasca: un defecte conegut, una funcionalitat petita i una explicació del repositori. Definiu els criteris d'acceptació abans de comparar els models. Incloeu un cas de fallada per tasca. Registreu la versió del model, el context, els permisos de les eines, els intents, el cost i l'esforç de revisió.
Descarrega la fitxa (Markdown)Desmarcar aquesta opció elimina tot el progrés desat en aquest navegador.
El progrés es queda en aquest navegador. Sense compte ni seguiment.