Välj modell med hjälp av underlag
Jämför modeller på representativa uppgifter, acceptanskriterier, kostnad och teamets begränsningar i arbetet.
Publicerad av TaigaSå skriver vi
Det här lär du dig
- Skapa en liten utvärderingsuppsättning från verkliga uppgiftstyper.
- Skilj modellkvalitet från verktygens och kontextens påverkan.
- Dokumentera förhållandena som kräver en ny utvärdering.
Definiera beslutet
En modelljämförelse behöver en specifik användning. En modell som förklarar en liten funktion väl kanske inte hanterar en stor repositoryändring lika bra. En billigare modell kan uppfylla kvalitetskravet för rutinmässiga omvandlingar. En svår utredning kan behöva större resonemangsförmåga.
Skriv uppgiften och begränsningarna först. Ta med tillåtna data, nödvändiga verktyg, svarstid och högsta acceptabla kostnad. Vissa begränsningar är obligatoriska. Låt inte ett högt resultat på ett annat område väga bort en begränsning för datahantering.
Använd representativa uppgifter
Bygg en liten utvärderingsuppsättning från arbete som teamet faktiskt utför. Ta bort känsliga data om utvärderingsmiljön inte är godkänd för dem. Ta med enkla uppgifter, svåra uppgifter och uppgifter där rätt svar är att be om saknad information.
Använd ett känt datumfel, en liten filterfunktion och en förklaring av en auktoriseringsregel för en fiktiv rapporttjänst. Förbered det förväntade resultatet innan jämförelsen körs. Ta med ett negativt test som underkänner det kända felet.
Håll vissa uppgifter åtskilda från utvecklingen av prompten. Om du upprepade gånger justerar prompten mot varje exempel kan slutpoängen överdriva den generella prestandan. En separat uppsättning hjälper till att visa om den förbättrade prompten fungerar utanför exemplen som användes för att skapa den.
Håll jämförelsen rättvis
Dokumentera exakt modellversion, prompt, tillförd kontext, verktyg och behörigheter. Använd likvärdiga startlägen. Om en modell får ett helt repository och en annan får en fil jämför resultatet både arbetsflöden och modeller.
Jämförelser av arbetsflöden kan vara användbara. Benämn dem korrekt. En agentprodukt omfattar mer än en modell: kontexturval, verktyg, körgränser och återställningsbeteende kan påverka resultatet.
Använd upprepade körningar när variation i utdata spelar roll. Dokumentera misslyckade försök i stället för att bara rapportera det bästa resultatet. Använd skriftliga bedömningskriterier och fler än en granskare för subjektiva kriterier där det är praktiskt möjligt.
Bedöm kvalitet före hastighet
Kontrollera först obligatoriska acceptanskriterier. Uppfyller ändringen kravet? Bevarar den åtkomstkontroller? Godkänns relevanta tester? Kan en granskare förstå diffen?
Jämför sedan arbete, förfluten tid och kostnad för godtagbara resultat. Ta med återförsök och mänsklig granskning. Ett billigt svar som behöver korrigeras upprepade gånger kan bli dyrt för uppgiften som helhet.
| Utvärderingsfält | Vad som ska dokumenteras |
|---|---|
| Uppgiftsresultat | Vilka acceptanskriterier som godkändes eller underkändes |
| Omfattning | Oombedda ändringar eller saknade krav |
| Mänskligt arbete | Tid för förberedelser, granskning och korrigering |
| Körkostnad | Modell- och verktygskostnader, inklusive återförsök |
| Underlag | Version, indata, utdata, kontroller och granskningsanteckningar |
Offentliga benchmarktester kan hjälpa till att hitta kandidater. De använder specifika uppgiftsuppsättningar och poängmetoder. Behandla inte en benchmarkpoäng som en direkt mätning av teamets produktivitet.
Dokumentera beslutet och när det upphör att gälla
Resultatet kan vara en snäv rekommendation. Till exempel: ”Använd denna modell för små testtillägg i detta repository, med befintliga granskningskrav.” Du behöver inte en modell för varje uppgift.
Ange vad som skulle kräva en ny utvärdering. Exempel är en ny modellversion, en annan verktygskonfiguration, en ny datakategori eller ett ihållande felmönster. Ha ett reservalternativ för uppgifter som överskrider den valda modellens förmåga.
Syftet med utvärderingen är att minska osäkerheten i ett verkligt beslut. Undvik en ständig modelltävling som tar mer arbete än uppgifterna den stöder.
Gör övningen
Skapa ett utvärderingsblad för tre uppgiftstyper: ett känt fel, en liten funktion och en förklaring av ett repository. Definiera acceptanskriterier innan du jämför modeller. Ta med ett felfall per uppgift. Dokumentera modellversion, kontext, verktygsbehörigheter, försök, kostnad och granskningsarbete.
Ladda ned övningsblad (Markdown)Kontrollera din förståelse
Källor och vidare läsning
Relaterad läsning från Taiga
Om du avmarkerar valet raderas alla framsteg som sparats i den här webbläsaren.
Framstegen stannar i webbläsaren. Inget konto, ingen spårning.