Itinerario 04Lección 10 / 10

Mide el sistema de entrega

Combina el flujo de entrega, la inestabilidad, los resultados del servicio y el esfuerzo. Usa definiciones explícitas al evaluar el efecto de la IA.

Práctica profesional10 minRevisado

Publicado por Cómo escribimos

Qué aprenderás

  • Distinguir el rendimiento de entrega de la actividad de generación de código.
  • Interpretar una métrica según las definiciones de sus eventos y su alcance.
  • Usar mediciones para elegir una mejora, no para clasificar personas.

Empieza por la decisión que necesitas tomar

Un equipo quiere saber si la IA mejora la entrega. Contar líneas generadas responde a otra pregunta. Define el resultado útil y las condiciones de calidad antes de elegir una métrica.

Para un servicio ficticio de exportación, el resultado deseado es entregar cambios aceptados de forma fiable y con menos esfuerzo total. Registra preparación, implementación, revisión, corrección y espera. Incluye los cambios fallidos o abandonados.

Usa un servicio con un límite claro. Combinar un sitio web experimental con un servicio crítico de pagos puede producir una cifra que no explique ninguno de los dos. Describe el contexto antes de comparar periodos o equipos.

Usa definiciones actuales

El modelo actual de entrega de DORA contiene cinco métricas. Su alcance es el rendimiento de entrega, no el valor de cada función ni la contribución de una persona. Definiciones de las métricas DORA.

MétricaFoco de medición
Tiempo de entrega de cambiosDel commit a producción
Frecuencia de despliegueRitmo de despliegues en producción
Tiempo de recuperación de despliegues fallidosRecuperación después de un despliegue fallido
Tasa de fallo de cambiosDespliegues que necesitan intervención inmediata
Tasa de despliegues de reparaciónDespliegues no planificados causados por incidentes de producción

Un panel puede usar otra definición. Léela antes de interpretar el resultado. La documentación actual de despliegues de Taiga describe cuatro métricas derivadas de registros de despliegue de proveedores. Su medida de recuperación usa un despliegue satisfactorio posterior. No es un registro completo de todos los incidentes de producción. Definiciones de Taiga.

Inspecciona una secuencia ficticia de cambios

Supongamos que un servicio realiza doce despliegues en un mes. Ocho entregan cambios planificados. Cuatro reparan problemas de publicaciones anteriores. El total es doce, pero importa su composición.

El mes siguiente, el equipo realiza diez despliegues: nueve cambios planificados y una reparación. Menos despliegues pueden coexistir con más trabajo útil. Estas cifras ilustran la interpretación; no son una referencia de rendimiento.

Inspecciona también la distribución. Una espera larga de revisión puede desaparecer dentro de una media. Medir la recuperación de un único fallo aporta pocas pruebas sobre la fiabilidad futura. Indica el número de observaciones y las excepciones relevantes.

Relaciona el flujo con sus consecuencias

Usa señales del servicio para comprobar si los cambios de entrega afectan a los usuarios. Un pipeline más rápido no basta si las exportaciones fallan más. Usa un SLO adecuado u otra medida de resultado claramente definida. Guía sobre SLO.

El esfuerzo de revisión y el trabajo repetido ayudan a explicar el resultado. Si la IA acorta la implementación pero produce diffs grandes, la revisión puede convertirse en la restricción. Si obtener entornos tarda días, programar más rápido puede afectar poco al tiempo total de entrega.

Elige una mejora que aborde la restricción observada. Por ejemplo, ofrece un entorno de pruebas admitido o reduce el tamaño de los cambios. Define una métrica de calidad complementaria para detectar una aparente ganancia de velocidad causada por comprobaciones más débiles.

Mantén útil la medición

Evita clasificar personas por número de PR o código generado. Estas medidas pueden premiar dividir trabajo artificialmente, evitar mantenimiento difícil o trasladar el esfuerzo de revisión a compañeros.

Revisa el resultado con las personas responsables del servicio completo. Registra qué cambió en la herramienta, el tipo de trabajo, el equipo y el entorno. Trata una comparación antes-después como evidencia con limitaciones, no como prueba automática de causalidad.

El propósito es tomar mejor la siguiente decisión. Una medición pequeña y fiable que conduzca a una mejora verificada es más útil que un gran panel sin significado acordado.

Practica con diez cambios

Este conjunto ficticio e independiente registra diez cambios planificados. Todas las horas son UTC en la fecha indicada. Un campo de corrección vacío significa que no se registró ninguna corrección en este conjunto.

Cambio / fechaInicio del trabajoCódigo listoInicio de revisiónAceptadoPublicadoCorregido
C01 · 2026-09-1408:0008:4509:1509:3010:00—
C02 · 2026-09-1409:0009:3012:0012:2013:00—
C03 · 2026-09-1508:0009:0009:1509:4010:0015:00
C04 · 2026-09-1510:0010:3010:4511:0011:15—
C05 · 2026-09-1608:0009:0013:0013:3014:00—
C06 · 2026-09-1610:0011:0011:3012:0012:15—
C07 · 2026-09-1708:0008:3009:0009:2009:30—
C08 · 2026-09-1710:0010:4511:0011:3014:30—
C09 · 2026-09-1808:0008:3009:0009:3010:00—
C10 · 2026-09-1809:0009:3010:0010:3011:0014:00

Compara el tiempo desde que el código está listo hasta el inicio de la revisión y después desde la aceptación hasta la publicación. Identifica la espera visible más larga. Investiga su causa antes de considerarla evitable. Estas marcas temporales no miden esfuerzo activo ni indican cuándo empezó un incidente. Una publicación correctiva por sí sola no permite establecer el tiempo de recuperación de un despliegue fallido.

Descarga el conjunto de datos ficticio (CSV)

Comprueba los tiempos de espera

Comprueba tu interpretación: C05 espera cuatro horas a la revisión. C08 espera tres horas desde la aceptación hasta la publicación. El conjunto no explica esas esperas. Pregunta por capacidad, horarios de trabajo, política de publicación y dependencias.

Haz el ejercicio

Usa el conjunto de diez cambios de esta lección. Define un despliegue, un cambio fallido y un evento de recuperación. Encuentra la espera visible más larga e indica qué permitiría establecer su causa. Propón una mejora y una medida que revele un empeoramiento de la calidad.

Descargar hoja de ejercicios (Markdown)

Comprueba lo que has aprendido

La frecuencia de despliegue aumenta tras introducir IA, pero también aumentan los despliegues imprevistos de reparación. ¿Qué debes concluir?

Fuentes y lecturas adicionales

Lecturas relacionadas de Taiga