Lärstig 01Lektion 6 / 6

Välj modell med hjälp av underlag

Jämför modeller på representativa uppgifter, acceptanskriterier, kostnad och teamets begränsningar i arbetet.

Praktisk nivå10 minGranskad

Publicerad av Så skriver vi

Det här lär du dig

  • Skapa en liten utvärderingsuppsättning från verkliga uppgiftstyper.
  • Skilj modellkvalitet från verktygens och kontextens påverkan.
  • Dokumentera förhållandena som kräver en ny utvärdering.

Definiera beslutet

En modelljämförelse behöver en specifik användning. En modell som förklarar en liten funktion väl kanske inte hanterar en stor repositoryändring lika bra. En billigare modell kan uppfylla kvalitetskravet för rutinmässiga omvandlingar. En svår utredning kan behöva större resonemangsförmåga.

Skriv uppgiften och begränsningarna först. Ta med tillåtna data, nödvändiga verktyg, svarstid och högsta acceptabla kostnad. Vissa begränsningar är obligatoriska. Låt inte ett högt resultat på ett annat område väga bort en begränsning för datahantering.

Använd representativa uppgifter

Bygg en liten utvärderingsuppsättning från arbete som teamet faktiskt utför. Ta bort känsliga data om utvärderingsmiljön inte är godkänd för dem. Ta med enkla uppgifter, svåra uppgifter och uppgifter där rätt svar är att be om saknad information.

Använd ett känt datumfel, en liten filterfunktion och en förklaring av en auktoriseringsregel för en fiktiv rapporttjänst. Förbered det förväntade resultatet innan jämförelsen körs. Ta med ett negativt test som underkänner det kända felet.

Håll vissa uppgifter åtskilda från utvecklingen av prompten. Om du upprepade gånger justerar prompten mot varje exempel kan slutpoängen överdriva den generella prestandan. En separat uppsättning hjälper till att visa om den förbättrade prompten fungerar utanför exemplen som användes för att skapa den.

Håll jämförelsen rättvis

Dokumentera exakt modellversion, prompt, tillförd kontext, verktyg och behörigheter. Använd likvärdiga startlägen. Om en modell får ett helt repository och en annan får en fil jämför resultatet både arbetsflöden och modeller.

Jämförelser av arbetsflöden kan vara användbara. Benämn dem korrekt. En agentprodukt omfattar mer än en modell: kontexturval, verktyg, körgränser och återställningsbeteende kan påverka resultatet.

Använd upprepade körningar när variation i utdata spelar roll. Dokumentera misslyckade försök i stället för att bara rapportera det bästa resultatet. Använd skriftliga bedömningskriterier och fler än en granskare för subjektiva kriterier där det är praktiskt möjligt.

Bedöm kvalitet före hastighet

Kontrollera först obligatoriska acceptanskriterier. Uppfyller ändringen kravet? Bevarar den åtkomstkontroller? Godkänns relevanta tester? Kan en granskare förstå diffen?

Jämför sedan arbete, förfluten tid och kostnad för godtagbara resultat. Ta med återförsök och mänsklig granskning. Ett billigt svar som behöver korrigeras upprepade gånger kan bli dyrt för uppgiften som helhet.

UtvärderingsfältVad som ska dokumenteras
UppgiftsresultatVilka acceptanskriterier som godkändes eller underkändes
OmfattningOombedda ändringar eller saknade krav
Mänskligt arbeteTid för förberedelser, granskning och korrigering
KörkostnadModell- och verktygskostnader, inklusive återförsök
UnderlagVersion, indata, utdata, kontroller och granskningsanteckningar

Offentliga benchmarktester kan hjälpa till att hitta kandidater. De använder specifika uppgiftsuppsättningar och poängmetoder. Behandla inte en benchmarkpoäng som en direkt mätning av teamets produktivitet.

Dokumentera beslutet och när det upphör att gälla

Resultatet kan vara en snäv rekommendation. Till exempel: ”Använd denna modell för små testtillägg i detta repository, med befintliga granskningskrav.” Du behöver inte en modell för varje uppgift.

Ange vad som skulle kräva en ny utvärdering. Exempel är en ny modellversion, en annan verktygskonfiguration, en ny datakategori eller ett ihållande felmönster. Ha ett reservalternativ för uppgifter som överskrider den valda modellens förmåga.

Syftet med utvärderingen är att minska osäkerheten i ett verkligt beslut. Undvik en ständig modelltävling som tar mer arbete än uppgifterna den stöder.

Gör övningen

Skapa ett utvärderingsblad för tre uppgiftstyper: ett känt fel, en liten funktion och en förklaring av ett repository. Definiera acceptanskriterier innan du jämför modeller. Ta med ett felfall per uppgift. Dokumentera modellversion, kontext, verktygsbehörigheter, försök, kostnad och granskningsarbete.

Ladda ned övningsblad (Markdown)

Kontrollera din förståelse

Modell A klarar fler uppgifter i offentliga benchmarktester. Modell B presterar bättre på dina representativa repositoryuppgifter. Vilket resultat ska vägleda beslutet?

Källor och vidare läsning

Relaterad läsning från Taiga