Nützlichen Fortschritt messen
AbgeschlossenMessen Sie abgeschlossene Arbeit, Review-Aufwand und Nacharbeit. Nutzen Sie die Menge generierten Codes nicht als Wertmaßstab.
Veröffentlicht von TaigaWie wir schreiben
Das lernen Sie
- Tätigkeit und nützliches Ergebnis unterscheiden.
- Vorbereitung, Review und Korrektur in Zeitvergleiche einbeziehen.
- Die Grenzen einer Produktivitätsaussage erkennen.
Definieren Sie das Ergebnis vor der Kennzahl
Ein KI-Werkzeug kann schnell Code erzeugen. Das nützliche Ergebnis ist eine Änderung, die einen Nutzerbedarf in der erforderlichen Qualität erfüllt. Das sind unterschiedliche Messgrößen.
Generierte Zeilen, übernommene Vorschläge und Agentenläufe beschreiben Aktivitäten. Sie können helfen, die Werkzeugnutzung zu verstehen. Sie belegen nicht, dass ein Dienst besser wurde oder das Team nützliche Arbeit schneller geliefert hat.
Beginnen Sie mit einer Frage. Zum Beispiel: „Verringert dieser Ablauf den Gesamtaufwand für eine kleine Wartungsaufgabe?“ Definieren Sie den Abschluss, bevor Sie Ergebnisse erheben. Beziehen Sie die erforderlichen Tests, das Review und die Dokumentation ein.
Erfassen Sie die gesamte Aufgabe
Betrachten Sie eine fiktive Änderung an einem Berichtsfilter. Ohne KI dauert die Implementierung 60 Minuten und das Review 10 Minuten. Mit KI dauert die Implementierung 30 Minuten und das Review 45 Minuten.
Die Implementierung ist schneller. Der gemessene Aufwand für diese Phasen steigt von 70 auf 75 Minuten. Beide Ergebnisse schließen Vorbereitung, spätere Korrekturen und Fehler nach der Veröffentlichung aus. Machen Sie diese Grenzen sichtbar.
| Phase | Beispiel ohne KI | Beispiel mit KI |
|---|---|---|
| Implementierung | 60 Minuten | 30 Minuten |
| Review | 10 Minuten | 45 Minuten |
| Gemessene Summe | 70 Minuten | 75 Minuten |
Diese Zahlen veranschaulichen eine Rechnung. Sie sind weder Forschungsergebnisse noch eine Prognose für Ihr Team. Der höhere Review-Aufwand kann auf einen größeren Diff, unbekannten Code oder eine fehlende Anforderung zurückgehen. Untersuchen Sie die Ursache, bevor Sie die Werkzeugrichtlinie ändern.
Trennen Sie Aufwand und Durchlaufzeit
Aufwand misst die Zeit, die Menschen für Arbeit verwenden. Die Durchlaufzeit enthält auch Wartezeiten. Ein Agent kann Prüfungen ausführen, während ein Entwickler eine andere Aufgabe erledigt. Zählen Sie dieselbe menschliche Arbeitszeit nicht doppelt. Erfassen Sie auch, wie lange eine Änderung auf Review oder eine Umgebung wartet.
Ein Ablauf kann den Aufwand verringern, ohne die Lieferzeit zu verkürzen. Das kann passieren, wenn eine Freigabewarteschlange den Abschlusstermin bestimmt. Der eingesparte Aufwand kann dennoch wertvoll sein. Die Organisation muss aber gesondert entscheiden, wie sie ihn nutzt.
Fragen Sie Entwickler, ob der Ablauf ihnen hilft, das System zu verstehen und konzentriert zu bleiben. Behandeln Sie die Antworten als Erfahrungsdaten. Machen Sie aus einem Gefühl von Geschwindigkeit keine belegte prozentuale Verbesserung.
Lesen Sie Forschung unter Beachtung ihrer Grenzen
METR berichtete in einer bestimmten Studie von Anfang 2025 über eine Verlangsamung bei erfahrenen Open-Source-Entwicklern. Die Studie belegte keinen Effekt für alle Entwickler oder Aufgaben. Das Update vom Februar 2026 beschrieb Auswahleffekte und Messprobleme in einem späteren Experiment.
Die nützliche Erkenntnis betrifft die Messung. Werkzeugversionen, Aufgabenauswahl, Qualitätsanforderungen und das Verhalten der Teilnehmenden können das Ergebnis verändern. Nutzen Sie keinen einzelnen historischen Prozentwert als dauerhafte Regel für KI-Entwicklung.
Auch die DORA-Forschung von 2025 lenkt den Blick auf die Organisation rund um die Werkzeuge. Ein Team braucht wirksame Entwicklungspraktiken, damit Werkzeugfähigkeiten zu nützlichen Lieferergebnissen führen.
Führen Sie einen kleinen, wiederholbaren Vergleich durch
Nutzen Sie repräsentative Aufgaben und dieselben Abschlusskriterien. Erfassen Sie Modell- und Werkzeugversionen. Beziehen Sie erfolglose Versuche und Review-Aufwand ein. Vergleichen Sie mehrere Aufgaben, statt die beste Demo auszuwählen.
Berichten Sie die Spannweite und die wesentlichen Grenzen. Verringert eine Änderung den Aufwand, erhöht aber die Fehlerzahl, untersuchen Sie dies vor einer breiteren Nutzung. Sind die Ergebnisse gemischt, begrenzen Sie die Empfehlung auf Aufgabentypen mit aussagekräftigen Nachweisen.
Eine gute Messung unterstützt eine konkrete nächste Entscheidung. Sie muss nicht beweisen, dass KI grundsätzlich gut oder schlecht ist.
Übung bearbeiten
Wählen Sie fünf vergleichbare abgeschlossene Aufgaben. Erfassen Sie Zeiten für Vorbereitung, Implementierung, Review, Korrektur und Warten. Erfassen Sie Fehler getrennt. Vergleichen Sie Gesamtaufwand und Durchlaufzeit. Notieren Sie Unterschiede bei Schwierigkeit, beteiligten Personen und Werkzeugversionen, bevor Sie Schlüsse ziehen.
Arbeitsblatt herunterladen (Markdown)Verständnis prüfen
Quellen und weiterführende Lektüre
- METR: Early-2025 developer productivity study ↗
- METR: February 2026 study update and measurement limitations ↗
- DORA: 2025 research report ↗
Passende Lektüre von Taiga
Wenn Sie diese Auswahl aufheben, wird der gesamte in diesem Browser gespeicherte Fortschritt gelöscht.
Ihr Fortschritt bleibt in diesem Browser. Ohne Konto und Tracking.