Cesta 01Lekce 6 / 6

Vyberte model podle důkazů

Porovnejte modely na reprezentativních úkolech podle akceptačních kritérií, nákladů a provozních omezení svého týmu.

Praxe10 minZkontrolováno

Vydává Jak píšeme

Ověřte si porozuměníModel A úspěšně vyřeší více úkolů veřejného benchmarku. Model B dosahuje lepších výsledků u reprezentativních úkolů vašeho repozitáře. Který výsledek má řídit rozhodnutí?Vypracovat cvičení
Model A úspěšně vyřeší více úkolů veřejného benchmarku. Model B dosahuje lepších výsledků u reprezentativních úkolů vašeho repozitáře. Který výsledek má řídit rozhodnutí?

Co se naučíte

  • Vytvořit malou hodnoticí sadu ze skutečných typů úkolů.
  • Oddělit kvalitu modelu od vlivu nástrojů a kontextu.
  • Zaznamenat podmínky, které vyžadují nové vyhodnocení.

Vymezte rozhodnutí

Porovnání modelů potřebuje konkrétní použití. Model, který dobře vysvětlí malou funkci, nemusí stejně dobře zvládnout velkou změnu repozitáře. Levnější model může splnit požadavky na kvalitu u rutinních transformací. Náročné šetření může potřebovat vyšší schopnost uvažování.

Nejdříve zapište úkol a omezení. Zahrňte povolená data, požadované nástroje, dobu odezvy a nejvyšší přijatelnou cenu. Některá omezení jsou povinná. Vysoké skóre jinde nemůže při výpočtu průměru vymazat omezení pro nakládání s daty.

Použijte reprezentativní úkoly

Sestavte malou hodnoticí sadu z práce, kterou váš tým skutečně dělá. Odstraňte citlivá data, pokud pro ně hodnoticí prostředí není schválené. Zahrňte jednoduché i obtížné úkoly a také ty, kde je správnou reakcí vyžádat si chybějící informace.

Pro fiktivní službu sestav použijte známou chybu kalendářního data, malou funkci filtru a vysvětlení autorizačního pravidla. Očekávaný výsledek připravte před spuštěním porovnání. Přidejte negativní test, který odhalí známou chybu.

Některé úkoly ponechte mimo ladění promptu. Pokud prompt opakovaně upravujete podle všech příkladů, konečné skóre může nadhodnotit obecnou výkonnost. Samostatná sada pomáhá zjistit, zda lepší prompt funguje i mimo příklady použité při jeho tvorbě.

Udržujte porovnání férové

Zaznamenejte přesnou verzi modelu, prompt, dodaný kontext, nástroje a oprávnění. Použijte rovnocenné výchozí stavy. Pokud jeden model dostane celý repozitář a druhý jeden soubor, výsledek porovnává pracovní postupy i modely.

Porovnání pracovních postupů může být užitečné. Správně je označte. Produkt s agentem zahrnuje více než model: výběr kontextu, nástroje, limity provádění a chování při obnově mohou výsledek ovlivnit.

Pokud záleží na proměnlivosti výstupu, opakujte běhy. Zaznamenávejte neúspěšné pokusy, místo abyste uváděli jen nejlepší výsledek. U subjektivních kritérií používejte písemná hodnoticí pravidla a podle možností více než jednoho hodnotitele.

Hodnoťte kvalitu před rychlostí

Nejdříve ověřte povinná akceptační kritéria. Splňuje změna požadavek? Zachovává řízení přístupu? Procházejí příslušné testy? Rozumí kontrolující diffu?

Potom u přijatelných výsledků porovnejte úsilí, uplynulý čas a náklady. Zahrňte opakované pokusy i lidskou kontrolu. Levná odpověď, kterou je nutné opakovaně opravovat, může být na úrovni úkolu drahá.

Hodnoticí položkaCo zaznamenat
Výsledek úkoluKterá akceptační kritéria byla a nebyla splněna
RozsahNevyžádané změny nebo chybějící požadavky
Lidské úsilíČas na přípravu, kontrolu a opravy
Náklady provedeníNáklady na model a nástroje včetně opakovaných pokusů
DůkazyVerze, vstup, výstup, kontroly a poznámky hodnotitele

Veřejné benchmarky mohou pomoci najít kandidáty. Používají konkrétní sady úkolů a způsoby hodnocení. Skóre benchmarku nepovažujte za přímé měření produktivity svého týmu.

Zaznamenejte rozhodnutí a podmínky jeho platnosti

Výsledkem může být úzké doporučení. Například: „Používejte tento model pro malá doplnění testů v tomto repozitáři se stávajícími požadavky na kontrolu.“ Nepotřebujete jeden model pro každý úkol.

Uveďte, co by vyžadovalo nové vyhodnocení. Příkladem je změna verze modelu, jiná konfigurace nástroje, nová kategorie dat nebo trvalý vzorec selhání. Zachovejte náhradní postup pro úkoly, které překračují schopnosti vybraného modelu.

Účelem vyhodnocení je snížit nejistotu při skutečném rozhodnutí. Vyhněte se trvalé soutěži modelů, která spotřebuje více úsilí než práce, jíž má sloužit.

Vypracovat cvičení

Vytvořte hodnoticí list pro tři typy úkolů: známou chybu, malou funkci a vysvětlení repozitáře. Před porovnáním modelů stanovte akceptační kritéria. Ke každému úkolu přidejte jeden případ selhání. Zaznamenejte verzi modelu, kontext, oprávnění nástrojů, pokusy, náklady a úsilí na kontrolu.

Stáhnout pracovní list (Markdown)
Ověřte si porozumění ↑

Pokračovat v učení

Zdroje a další čtení

Související čtení od Taigy

← Předchozí lekce: Měřte užitečný pokrok