Ein Modell anhand von Nachweisen wählen
AbgeschlossenVergleichen Sie Modelle anhand repräsentativer Aufgaben, Abnahmekriterien, Kosten und der betrieblichen Vorgaben Ihres Teams.
Veröffentlicht von TaigaWie wir schreiben
Verständnis prüfenModell A besteht mehr öffentliche Benchmark-Aufgaben. Modell B schneidet bei Ihren repräsentativen Repository-Aufgaben besser ab. Welches Ergebnis sollte die Entscheidung leiten?Übung bearbeiten
Das lernen Sie
- Ein kleines Evaluationsset aus tatsächlichen Aufgabentypen erstellen.
- Modellqualität von den Auswirkungen der Werkzeuge und des Kontexts trennen.
- Bedingungen für eine erneute Evaluation festhalten.
Definieren Sie die Entscheidung
Ein Modellvergleich braucht einen konkreten Einsatzzweck. Ein Modell, das eine kleine Funktion gut erklärt, bewältigt eine große Repository-Änderung möglicherweise nicht ebenso gut. Ein günstigeres Modell kann die Qualitätsanforderungen für Routineumwandlungen erfüllen. Eine schwierige Untersuchung kann stärkere Schlussfolgerungsfähigkeiten erfordern.
Schreiben Sie zuerst Aufgabe und Vorgaben auf. Nennen Sie erlaubte Daten, benötigte Werkzeuge, Antwortzeit und maximal akzeptable Kosten. Manche Vorgaben sind verbindlich. Eine hohe Punktzahl in einer anderen Kategorie erlaubt nicht, eine Beschränkung der Datenverarbeitung zu übergehen.
Nutzen Sie repräsentative Aufgaben
Erstellen Sie ein kleines Evaluationsset aus der tatsächlichen Arbeit Ihres Teams. Entfernen Sie sensible Daten, sofern die Evaluationsumgebung nicht dafür freigegeben ist. Nehmen Sie einfache und schwierige Aufgaben auf. Ergänzen Sie Aufgaben, bei denen die richtige Antwort darin besteht, fehlende Informationen anzufordern.
Nutzen Sie für einen fiktiven Berichtsdienst einen bekannten Datumsfehler, eine kleine Filterfunktion und die Erklärung einer Autorisierungsregel. Bereiten Sie das erwartete Ergebnis vor dem Vergleich vor. Ergänzen Sie einen Negativtest, der den bekannten Fehler erkennt.
Halten Sie einige Aufgaben von der Prompt-Entwicklung getrennt. Wenn Sie den Prompt wiederholt an jedem Beispiel optimieren, kann das Endergebnis die allgemeine Leistung überzeichnen. Ein separates Set zeigt, ob der verbesserte Prompt auch außerhalb der Beispiele funktioniert, mit denen er entwickelt wurde.
Sorgen Sie für einen fairen Vergleich
Erfassen Sie genaue Modellversion, Prompt, bereitgestellten Kontext, Werkzeuge und Berechtigungen. Nutzen Sie gleichwertige Ausgangszustände. Erhält ein Modell das ganze Repository und ein anderes nur eine Datei, vergleicht das Ergebnis neben Modellen auch Arbeitsabläufe.
Vergleiche von Arbeitsabläufen können nützlich sein. Kennzeichnen Sie sie korrekt. Ein Agentenprodukt umfasst mehr als ein Modell: Kontextauswahl, Werkzeuge, Ausführungsgrenzen und Wiederherstellungsverhalten können das Ergebnis beeinflussen.
Führen Sie mehrere Durchläufe aus, wenn Schwankungen der Ausgabe relevant sind. Erfassen Sie fehlgeschlagene Versuche, statt nur das beste Ergebnis zu melden. Verwenden Sie für subjektive Kriterien einen schriftlichen Bewertungsmaßstab und, soweit praktikabel, mehrere Reviewer.
Bewerten Sie Qualität vor Geschwindigkeit
Prüfen Sie zuerst die verbindlichen Abnahmekriterien. Erfüllt die Änderung die Anforderung? Erhält sie die Zugriffskontrollen? Bestehen die relevanten Tests? Kann ein Reviewer den Diff verstehen?
Vergleichen Sie anschließend Aufwand, Durchlaufzeit und Kosten der akzeptablen Ergebnisse. Beziehen Sie erneute Versuche und menschliches Review ein. Eine günstige Antwort, die wiederholte Korrekturen braucht, kann auf Aufgabenebene teuer sein.
| Evaluationsfeld | Was zu erfassen ist |
|---|---|
| Aufgabenergebnis | Welche Abnahmekriterien erfüllt oder verfehlt wurden |
| Umfang | Nicht angeforderte Änderungen oder fehlende Anforderungen |
| Menschlicher Aufwand | Zeit für Vorbereitung, Review und Korrektur |
| Ausführungskosten | Modell- und Werkzeugkosten einschließlich erneuter Versuche |
| Nachweise | Version, Eingabe, Ausgabe, Prüfungen und Review-Notizen |
Öffentliche Benchmarks können bei der Vorauswahl helfen. Sie verwenden bestimmte Aufgabensets und Bewertungsmethoden. Behandeln Sie einen Benchmark-Wert nicht als direkte Messung der Produktivität Ihres Teams.
Dokumentieren Sie Entscheidung und Gründe für eine Neubewertung
Das Ergebnis kann eine eng begrenzte Empfehlung sein. Zum Beispiel: „Verwenden Sie dieses Modell für kleine Testerweiterungen in diesem Repository, mit den vorhandenen Review-Anforderungen.“ Sie brauchen nicht ein Modell für alle Aufgaben.
Halten Sie fest, wann eine neue Evaluation nötig wird. Beispiele sind eine neue Modellversion, eine andere Werkzeugkonfiguration, eine neue Datenkategorie oder ein dauerhaftes Fehlermuster. Halten Sie eine Alternative für Aufgaben bereit, die die Fähigkeiten des gewählten Modells übersteigen.
Evaluation soll die Unsicherheit bei einer tatsächlichen Entscheidung verringern. Vermeiden Sie einen dauerhaften Modellwettbewerb, der mehr Aufwand verbraucht als die Arbeit, die er unterstützen soll.
Übung bearbeiten
Erstellen Sie ein Evaluationsblatt für drei Aufgabentypen: einen bekannten Fehler, eine kleine Funktion und eine Repository-Erklärung. Definieren Sie Abnahmekriterien vor dem Modellvergleich. Ergänzen Sie pro Aufgabe einen Fehlerfall. Erfassen Sie Modellversion, Kontext, Werkzeugberechtigungen, Versuche, Kosten und Review-Aufwand.
Arbeitsblatt herunterladen (Markdown)Wenn Sie diese Auswahl aufheben, wird der gesamte in diesem Browser gespeicherte Fortschritt gelöscht.
Ihr Fortschritt bleibt in diesem Browser. Ohne Konto und Tracking.