Lernpfad 01Lektion 6 / 6

Ein Modell anhand von Nachweisen wählen

Vergleichen Sie Modelle anhand repräsentativer Aufgaben, Abnahmekriterien, Kosten und der betrieblichen Vorgaben Ihres Teams.

Praxis10 minGeprüft

Veröffentlicht von Wie wir schreiben

Verständnis prüfenModell A besteht mehr öffentliche Benchmark-Aufgaben. Modell B schneidet bei Ihren repräsentativen Repository-Aufgaben besser ab. Welches Ergebnis sollte die Entscheidung leiten?Übung bearbeiten
Modell A besteht mehr öffentliche Benchmark-Aufgaben. Modell B schneidet bei Ihren repräsentativen Repository-Aufgaben besser ab. Welches Ergebnis sollte die Entscheidung leiten?

Das lernen Sie

  • Ein kleines Evaluationsset aus tatsächlichen Aufgabentypen erstellen.
  • Modellqualität von den Auswirkungen der Werkzeuge und des Kontexts trennen.
  • Bedingungen für eine erneute Evaluation festhalten.

Definieren Sie die Entscheidung

Ein Modellvergleich braucht einen konkreten Einsatzzweck. Ein Modell, das eine kleine Funktion gut erklärt, bewältigt eine große Repository-Änderung möglicherweise nicht ebenso gut. Ein günstigeres Modell kann die Qualitätsanforderungen für Routineumwandlungen erfüllen. Eine schwierige Untersuchung kann stärkere Schlussfolgerungsfähigkeiten erfordern.

Schreiben Sie zuerst Aufgabe und Vorgaben auf. Nennen Sie erlaubte Daten, benötigte Werkzeuge, Antwortzeit und maximal akzeptable Kosten. Manche Vorgaben sind verbindlich. Eine hohe Punktzahl in einer anderen Kategorie erlaubt nicht, eine Beschränkung der Datenverarbeitung zu übergehen.

Nutzen Sie repräsentative Aufgaben

Erstellen Sie ein kleines Evaluationsset aus der tatsächlichen Arbeit Ihres Teams. Entfernen Sie sensible Daten, sofern die Evaluationsumgebung nicht dafür freigegeben ist. Nehmen Sie einfache und schwierige Aufgaben auf. Ergänzen Sie Aufgaben, bei denen die richtige Antwort darin besteht, fehlende Informationen anzufordern.

Nutzen Sie für einen fiktiven Berichtsdienst einen bekannten Datumsfehler, eine kleine Filterfunktion und die Erklärung einer Autorisierungsregel. Bereiten Sie das erwartete Ergebnis vor dem Vergleich vor. Ergänzen Sie einen Negativtest, der den bekannten Fehler erkennt.

Halten Sie einige Aufgaben von der Prompt-Entwicklung getrennt. Wenn Sie den Prompt wiederholt an jedem Beispiel optimieren, kann das Endergebnis die allgemeine Leistung überzeichnen. Ein separates Set zeigt, ob der verbesserte Prompt auch außerhalb der Beispiele funktioniert, mit denen er entwickelt wurde.

Sorgen Sie für einen fairen Vergleich

Erfassen Sie genaue Modellversion, Prompt, bereitgestellten Kontext, Werkzeuge und Berechtigungen. Nutzen Sie gleichwertige Ausgangszustände. Erhält ein Modell das ganze Repository und ein anderes nur eine Datei, vergleicht das Ergebnis neben Modellen auch Arbeitsabläufe.

Vergleiche von Arbeitsabläufen können nützlich sein. Kennzeichnen Sie sie korrekt. Ein Agentenprodukt umfasst mehr als ein Modell: Kontextauswahl, Werkzeuge, Ausführungsgrenzen und Wiederherstellungsverhalten können das Ergebnis beeinflussen.

Führen Sie mehrere Durchläufe aus, wenn Schwankungen der Ausgabe relevant sind. Erfassen Sie fehlgeschlagene Versuche, statt nur das beste Ergebnis zu melden. Verwenden Sie für subjektive Kriterien einen schriftlichen Bewertungsmaßstab und, soweit praktikabel, mehrere Reviewer.

Bewerten Sie Qualität vor Geschwindigkeit

Prüfen Sie zuerst die verbindlichen Abnahmekriterien. Erfüllt die Änderung die Anforderung? Erhält sie die Zugriffskontrollen? Bestehen die relevanten Tests? Kann ein Reviewer den Diff verstehen?

Vergleichen Sie anschließend Aufwand, Durchlaufzeit und Kosten der akzeptablen Ergebnisse. Beziehen Sie erneute Versuche und menschliches Review ein. Eine günstige Antwort, die wiederholte Korrekturen braucht, kann auf Aufgabenebene teuer sein.

EvaluationsfeldWas zu erfassen ist
AufgabenergebnisWelche Abnahmekriterien erfüllt oder verfehlt wurden
UmfangNicht angeforderte Änderungen oder fehlende Anforderungen
Menschlicher AufwandZeit für Vorbereitung, Review und Korrektur
AusführungskostenModell- und Werkzeugkosten einschließlich erneuter Versuche
NachweiseVersion, Eingabe, Ausgabe, Prüfungen und Review-Notizen

Öffentliche Benchmarks können bei der Vorauswahl helfen. Sie verwenden bestimmte Aufgabensets und Bewertungsmethoden. Behandeln Sie einen Benchmark-Wert nicht als direkte Messung der Produktivität Ihres Teams.

Dokumentieren Sie Entscheidung und Gründe für eine Neubewertung

Das Ergebnis kann eine eng begrenzte Empfehlung sein. Zum Beispiel: „Verwenden Sie dieses Modell für kleine Testerweiterungen in diesem Repository, mit den vorhandenen Review-Anforderungen.“ Sie brauchen nicht ein Modell für alle Aufgaben.

Halten Sie fest, wann eine neue Evaluation nötig wird. Beispiele sind eine neue Modellversion, eine andere Werkzeugkonfiguration, eine neue Datenkategorie oder ein dauerhaftes Fehlermuster. Halten Sie eine Alternative für Aufgaben bereit, die die Fähigkeiten des gewählten Modells übersteigen.

Evaluation soll die Unsicherheit bei einer tatsächlichen Entscheidung verringern. Vermeiden Sie einen dauerhaften Modellwettbewerb, der mehr Aufwand verbraucht als die Arbeit, die er unterstützen soll.

Übung bearbeiten

Erstellen Sie ein Evaluationsblatt für drei Aufgabentypen: einen bekannten Fehler, eine kleine Funktion und eine Repository-Erklärung. Definieren Sie Abnahmekriterien vor dem Modellvergleich. Ergänzen Sie pro Aufgabe einen Fehlerfall. Erfassen Sie Modellversion, Kontext, Werkzeugberechtigungen, Versuche, Kosten und Review-Aufwand.

Arbeitsblatt herunterladen (Markdown)
Verständnis prüfen ↑

Weiterlernen

Quellen und weiterführende Lektüre

Passende Lektüre von Taiga

← Vorherige Lektion: Nützlichen Fortschritt messen