Vyberte model podle důkazů
DokončenoPorovnejte modely na reprezentativních úkolech podle akceptačních kritérií, nákladů a provozních omezení svého týmu.
Vydává TaigaJak píšeme
Ověřte si porozuměníModel A úspěšně vyřeší více úkolů veřejného benchmarku. Model B dosahuje lepších výsledků u reprezentativních úkolů vašeho repozitáře. Který výsledek má řídit rozhodnutí?Vypracovat cvičení
Co se naučíte
- Vytvořit malou hodnoticí sadu ze skutečných typů úkolů.
- Oddělit kvalitu modelu od vlivu nástrojů a kontextu.
- Zaznamenat podmínky, které vyžadují nové vyhodnocení.
Vymezte rozhodnutí
Porovnání modelů potřebuje konkrétní použití. Model, který dobře vysvětlí malou funkci, nemusí stejně dobře zvládnout velkou změnu repozitáře. Levnější model může splnit požadavky na kvalitu u rutinních transformací. Náročné šetření může potřebovat vyšší schopnost uvažování.
Nejdříve zapište úkol a omezení. Zahrňte povolená data, požadované nástroje, dobu odezvy a nejvyšší přijatelnou cenu. Některá omezení jsou povinná. Vysoké skóre jinde nemůže při výpočtu průměru vymazat omezení pro nakládání s daty.
Použijte reprezentativní úkoly
Sestavte malou hodnoticí sadu z práce, kterou váš tým skutečně dělá. Odstraňte citlivá data, pokud pro ně hodnoticí prostředí není schválené. Zahrňte jednoduché i obtížné úkoly a také ty, kde je správnou reakcí vyžádat si chybějící informace.
Pro fiktivní službu sestav použijte známou chybu kalendářního data, malou funkci filtru a vysvětlení autorizačního pravidla. Očekávaný výsledek připravte před spuštěním porovnání. Přidejte negativní test, který odhalí známou chybu.
Některé úkoly ponechte mimo ladění promptu. Pokud prompt opakovaně upravujete podle všech příkladů, konečné skóre může nadhodnotit obecnou výkonnost. Samostatná sada pomáhá zjistit, zda lepší prompt funguje i mimo příklady použité při jeho tvorbě.
Udržujte porovnání férové
Zaznamenejte přesnou verzi modelu, prompt, dodaný kontext, nástroje a oprávnění. Použijte rovnocenné výchozí stavy. Pokud jeden model dostane celý repozitář a druhý jeden soubor, výsledek porovnává pracovní postupy i modely.
Porovnání pracovních postupů může být užitečné. Správně je označte. Produkt s agentem zahrnuje více než model: výběr kontextu, nástroje, limity provádění a chování při obnově mohou výsledek ovlivnit.
Pokud záleží na proměnlivosti výstupu, opakujte běhy. Zaznamenávejte neúspěšné pokusy, místo abyste uváděli jen nejlepší výsledek. U subjektivních kritérií používejte písemná hodnoticí pravidla a podle možností více než jednoho hodnotitele.
Hodnoťte kvalitu před rychlostí
Nejdříve ověřte povinná akceptační kritéria. Splňuje změna požadavek? Zachovává řízení přístupu? Procházejí příslušné testy? Rozumí kontrolující diffu?
Potom u přijatelných výsledků porovnejte úsilí, uplynulý čas a náklady. Zahrňte opakované pokusy i lidskou kontrolu. Levná odpověď, kterou je nutné opakovaně opravovat, může být na úrovni úkolu drahá.
| Hodnoticí položka | Co zaznamenat |
|---|---|
| Výsledek úkolu | Která akceptační kritéria byla a nebyla splněna |
| Rozsah | Nevyžádané změny nebo chybějící požadavky |
| Lidské úsilí | Čas na přípravu, kontrolu a opravy |
| Náklady provedení | Náklady na model a nástroje včetně opakovaných pokusů |
| Důkazy | Verze, vstup, výstup, kontroly a poznámky hodnotitele |
Veřejné benchmarky mohou pomoci najít kandidáty. Používají konkrétní sady úkolů a způsoby hodnocení. Skóre benchmarku nepovažujte za přímé měření produktivity svého týmu.
Zaznamenejte rozhodnutí a podmínky jeho platnosti
Výsledkem může být úzké doporučení. Například: „Používejte tento model pro malá doplnění testů v tomto repozitáři se stávajícími požadavky na kontrolu.“ Nepotřebujete jeden model pro každý úkol.
Uveďte, co by vyžadovalo nové vyhodnocení. Příkladem je změna verze modelu, jiná konfigurace nástroje, nová kategorie dat nebo trvalý vzorec selhání. Zachovejte náhradní postup pro úkoly, které překračují schopnosti vybraného modelu.
Účelem vyhodnocení je snížit nejistotu při skutečném rozhodnutí. Vyhněte se trvalé soutěži modelů, která spotřebuje více úsilí než práce, jíž má sloužit.
Vypracovat cvičení
Vytvořte hodnoticí list pro tři typy úkolů: známou chybu, malou funkci a vysvětlení repozitáře. Před porovnáním modelů stanovte akceptační kritéria. Ke každému úkolu přidejte jeden případ selhání. Zaznamenejte verzi modelu, kontext, oprávnění nástrojů, pokusy, náklady a úsilí na kontrolu.
Stáhnout pracovní list (Markdown)Zrušení této volby smaže veškerý postup uložený v tomto prohlížeči.
Postup zůstává v tomto prohlížeči. Bez účtu a sledování.