@cloudkinetix/bmad-enhanced
Version:
Cloud-Kinetix enhanced fork of BMAD-METHOD - Breakthrough Method of Agile AI-driven Development with robust versioning and unified validation.
334 lines (318 loc) • 12.7 kB
YAML
name: ci-health-monitoring
title: Continuous CI/CD Health Monitoring and Optimization
description: Proactive monitoring and optimization workflow for maintaining high-performance GitLab CI/CD pipelines with cross-pack integration intelligence
agents:
- glab
- dev
- pm
metadata:
estimated_duration: "Ongoing (30-60 minutes per review cycle)"
complexity: "low-medium"
frequency: "Daily monitoring, weekly deep analysis"
prerequisites:
- Functional GitLab CI/CD pipeline
- GitLab CLI authenticated
- Historical pipeline data available
success_metrics:
- Pipeline health score > 80%
- Mean time to detection < 15 minutes
- False positive rate < 5%
- Performance trend improvements
phases:
health_assessment:
title: "Pipeline Health Assessment"
description: "Comprehensive health check of CI/CD pipelines across all monitored branches"
estimated_duration: "15-30 minutes"
frequency: "Daily"
agents: ["glab"]
tasks:
- monitor-pipeline-status
- generate-ci-health-report
decision_points:
- health_threshold_evaluation:
question: "Is overall pipeline health above acceptable threshold (80%)?"
options:
healthy: "Continue with standard monitoring"
degraded: "Initiate performance investigation"
critical: "Trigger immediate remediation workflow"
success_criteria:
- Health metrics collected for all monitored branches
- Performance baselines established
- Health trends identified
- Alert thresholds evaluated
outputs:
- health_assessment_report
- performance_metrics
- trend_analysis
- alert_recommendations
integration_health_check:
title: "Cross-Pack Integration Health Check"
description: "Monitor and validate health of integrations with JIRA, parallel development, and other expansion packs"
estimated_duration: "10-20 minutes"
frequency: "Daily"
dependencies: ["health_assessment"]
agents: ["glab", "pm"]
tasks:
- coordinate-parallel-ci
- sync-ci-status-to-jira
decision_points:
- integration_status_review:
question: "Are all integration points functioning correctly?"
options:
all_healthy: "Continue monitoring"
partial_issues: "Schedule integration maintenance"
major_issues: "Initiate integration debugging workflow"
success_criteria:
- JIRA integration status validated
- Parallel development coordination confirmed
- Cross-pack communication verified
- Integration performance measured
outputs:
- integration_health_summary
- sync_status_report
- coordination_metrics
performance_analysis:
title: "Performance Trend Analysis"
description: "Deep analysis of pipeline performance trends and identification of optimization opportunities"
estimated_duration: "30-45 minutes"
frequency: "Weekly"
dependencies: ["health_assessment"]
agents: ["glab", "dev"]
tasks:
- generate-ci-health-report
- analyze-pipeline-failures
decision_points:
- performance_trend_evaluation:
question: "Are performance trends showing improvement, stability, or degradation?"
options:
improving: "Document successful optimizations"
stable: "Continue current monitoring approach"
degrading: "Initiate performance optimization workflow"
success_criteria:
- Performance trends analyzed
- Bottlenecks identified
- Optimization opportunities documented
- Historical comparison completed
outputs:
- performance_trend_report
- optimization_recommendations
- bottleneck_analysis
proactive_optimization:
title: "Proactive Performance Optimization"
description: "Implement identified optimizations and performance improvements before issues become critical"
estimated_duration: "1-3 hours"
frequency: "Bi-weekly or as needed"
dependencies: ["performance_analysis"]
agents: ["dev", "glab"]
tasks:
- debug-ci-configuration
- create-gitlab-workflow-plan
decision_points:
- optimization_priority:
question: "What is the priority level for identified optimizations?"
options:
high_impact: "Implement immediately"
medium_impact: "Schedule for next maintenance window"
low_impact: "Add to backlog for future consideration"
success_criteria:
- High-priority optimizations implemented
- Performance improvements measured
- Configuration changes validated
- No regressions introduced
outputs:
- optimization_implementation_results
- performance_improvement_metrics
- updated_configurations
stakeholder_reporting:
title: "Stakeholder Communication and Reporting"
description: "Generate and distribute health reports to stakeholders with actionable insights"
estimated_duration: "20-30 minutes"
frequency: "Weekly"
dependencies: ["performance_analysis", "integration_health_check"]
agents: ["pm", "glab"]
tasks:
- generate-ci-health-report
- sync-ci-status-to-jira
decision_points:
- reporting_detail_level:
question: "What level of detail is appropriate for stakeholder reports?"
options:
executive_summary: "High-level metrics and trends only"
detailed_analysis: "Comprehensive technical details"
custom_format: "Tailored report based on audience needs"
success_criteria:
- Stakeholder reports generated
- Key metrics communicated clearly
- Action items identified
- Feedback collection initiated
outputs:
- stakeholder_health_report
- executive_summary
- action_item_list
continuous_improvement:
title: "Continuous Improvement Planning"
description: "Analyze monitoring effectiveness and plan improvements to the monitoring process itself"
estimated_duration: "45-60 minutes"
frequency: "Monthly"
dependencies: ["stakeholder_reporting"]
agents: ["pm", "dev", "glab"]
tasks:
- create-gitlab-workflow-plan
- generate-ci-health-report
decision_points:
- improvement_focus_area:
question: "Which area of CI/CD monitoring needs the most improvement?"
options:
detection_speed: "Focus on faster issue detection"
accuracy: "Improve monitoring accuracy and reduce false positives"
integration: "Enhance cross-pack integration monitoring"
automation: "Increase automation of monitoring processes"
success_criteria:
- Monitoring effectiveness evaluated
- Improvement opportunities identified
- Enhancement plan created
- Success metrics updated
outputs:
- monitoring_improvement_plan
- enhanced_metrics_definition
- process_optimization_recommendations
checkpoints:
- phase: health_assessment
checkpoint: baseline_established
validation: "Current health baseline documented with key metrics"
frequency: "Daily"
- phase: integration_health_check
checkpoint: integration_status_confirmed
validation: "All integration points validated and functioning"
frequency: "Daily"
- phase: performance_analysis
checkpoint: trends_analyzed
validation: "Performance trends analyzed and documented"
frequency: "Weekly"
- phase: proactive_optimization
checkpoint: optimizations_applied
validation: "Identified optimizations successfully implemented"
frequency: "As needed"
- phase: stakeholder_reporting
checkpoint: reports_distributed
validation: "Health reports generated and distributed to stakeholders"
frequency: "Weekly"
- phase: continuous_improvement
checkpoint: improvements_planned
validation: "Monitoring improvement plan created and approved"
frequency: "Monthly"
monitoring_thresholds:
pipeline_success_rate:
healthy: "> 90%"
warning: "80-90%"
critical: "< 80%"
average_duration:
healthy: "< 15 minutes"
warning: "15-30 minutes"
critical: "> 30 minutes"
failure_recovery_time:
healthy: "< 2 hours"
warning: "2-8 hours"
critical: "> 8 hours"
integration_sync_rate:
healthy: "> 95%"
warning: "90-95%"
critical: "< 90%"
automated_actions:
health_degradation_detected:
trigger: "Pipeline health score drops below 80%"
action: "Automatically initiate gitlab-ci-debugging workflow"
notification: "Alert development team immediately"
performance_regression:
trigger: "Average pipeline duration increases by > 50%"
action: "Generate detailed performance analysis report"
notification: "Notify team lead and stakeholders"
integration_failure:
trigger: "Cross-pack integration sync failure rate > 10%"
action: "Validate integration configuration and connectivity"
notification: "Alert integration administrators"
critical_pipeline_failure:
trigger: "Pipeline failure on main/production branch"
action: "Initiate urgent debugging workflow with high priority"
notification: "Immediate alerts to all stakeholders"
quality_gates:
- gate: health_baseline_validation
criteria: "Health assessment data is complete and accurate"
phase: health_assessment
blocking: false
- gate: integration_connectivity
criteria: "All integration endpoints are reachable and functional"
phase: integration_health_check
blocking: true
- gate: trend_analysis_completeness
criteria: "Performance trend analysis covers minimum required time period"
phase: performance_analysis
blocking: false
- gate: optimization_impact_validation
criteria: "Performance optimizations show measurable improvement"
phase: proactive_optimization
blocking: true
escalation_procedures:
health_score_critical:
trigger: "Overall health score < 60%"
escalation: "Immediate senior team involvement"
timeline: "Within 30 minutes"
actions: ["Initiate emergency debugging session", "Notify all stakeholders"]
repeated_failures:
trigger: "Same failure pattern detected 3+ times in 24 hours"
escalation: "Architectural review required"
timeline: "Within 4 hours"
actions: ["Schedule architectural assessment", "Document failure pattern"]
integration_breakdown:
trigger: "Complete integration failure for > 2 hours"
escalation: "Cross-team collaboration session"
timeline: "Within 1 hour"
actions: ["Engage integration specialists", "Assess alternative workflows"]
success_patterns:
high_performing_pipeline:
characteristics:
- "Success rate > 95%"
- "Average duration < 10 minutes"
- "Failure recovery < 1 hour"
maintenance_approach: "Light monitoring with trend analysis"
stable_pipeline:
characteristics:
- "Success rate 85-95%"
- "Average duration 10-20 minutes"
- "Consistent performance trends"
maintenance_approach: "Standard monitoring with weekly optimization reviews"
improvement_needed:
characteristics:
- "Success rate < 85%"
- "Average duration > 20 minutes"
- "Declining performance trends"
maintenance_approach: "Intensive monitoring with bi-weekly optimization cycles"
integration_hooks:
jira_integration:
- phase: health_assessment
action: "Update JIRA dashboard with CI health metrics"
- phase: stakeholder_reporting
action: "Sync health report data to JIRA project tracking"
parallel_dev_integration:
- phase: integration_health_check
action: "Validate CI coordination across all parallel worktrees"
- phase: performance_analysis
action: "Analyze performance impact of parallel development"
core_bmad_integration:
- phase: continuous_improvement
action: "Update BMAD development workflows with monitoring insights"
- phase: stakeholder_reporting
action: "Integrate CI health into project status reporting"
reporting_templates:
daily_health_summary:
format: "Brief status with key metrics and alerts"
recipients: ["Development team", "DevOps team"]
distribution: "Automated via CI/CD status channels"
weekly_performance_report:
format: "Detailed analysis with trends and recommendations"
recipients: ["Team leads", "Project managers", "Stakeholders"]
distribution: "Email and JIRA dashboard"
monthly_improvement_review:
format: "Strategic analysis with improvement plans"
recipients: ["Senior management", "Architecture team"]
distribution: "Presentation and documentation"