UNPKG

@cloudkinetix/bmad-enhanced

Version:

Cloud-Kinetix enhanced fork of BMAD-METHOD - Breakthrough Method of Agile AI-driven Development with robust versioning and unified validation.

334 lines (318 loc) 12.7 kB
name: ci-health-monitoring title: Continuous CI/CD Health Monitoring and Optimization description: Proactive monitoring and optimization workflow for maintaining high-performance GitLab CI/CD pipelines with cross-pack integration intelligence agents: - glab - dev - pm metadata: estimated_duration: "Ongoing (30-60 minutes per review cycle)" complexity: "low-medium" frequency: "Daily monitoring, weekly deep analysis" prerequisites: - Functional GitLab CI/CD pipeline - GitLab CLI authenticated - Historical pipeline data available success_metrics: - Pipeline health score > 80% - Mean time to detection < 15 minutes - False positive rate < 5% - Performance trend improvements phases: health_assessment: title: "Pipeline Health Assessment" description: "Comprehensive health check of CI/CD pipelines across all monitored branches" estimated_duration: "15-30 minutes" frequency: "Daily" agents: ["glab"] tasks: - monitor-pipeline-status - generate-ci-health-report decision_points: - health_threshold_evaluation: question: "Is overall pipeline health above acceptable threshold (80%)?" options: healthy: "Continue with standard monitoring" degraded: "Initiate performance investigation" critical: "Trigger immediate remediation workflow" success_criteria: - Health metrics collected for all monitored branches - Performance baselines established - Health trends identified - Alert thresholds evaluated outputs: - health_assessment_report - performance_metrics - trend_analysis - alert_recommendations integration_health_check: title: "Cross-Pack Integration Health Check" description: "Monitor and validate health of integrations with JIRA, parallel development, and other expansion packs" estimated_duration: "10-20 minutes" frequency: "Daily" dependencies: ["health_assessment"] agents: ["glab", "pm"] tasks: - coordinate-parallel-ci - sync-ci-status-to-jira decision_points: - integration_status_review: question: "Are all integration points functioning correctly?" options: all_healthy: "Continue monitoring" partial_issues: "Schedule integration maintenance" major_issues: "Initiate integration debugging workflow" success_criteria: - JIRA integration status validated - Parallel development coordination confirmed - Cross-pack communication verified - Integration performance measured outputs: - integration_health_summary - sync_status_report - coordination_metrics performance_analysis: title: "Performance Trend Analysis" description: "Deep analysis of pipeline performance trends and identification of optimization opportunities" estimated_duration: "30-45 minutes" frequency: "Weekly" dependencies: ["health_assessment"] agents: ["glab", "dev"] tasks: - generate-ci-health-report - analyze-pipeline-failures decision_points: - performance_trend_evaluation: question: "Are performance trends showing improvement, stability, or degradation?" options: improving: "Document successful optimizations" stable: "Continue current monitoring approach" degrading: "Initiate performance optimization workflow" success_criteria: - Performance trends analyzed - Bottlenecks identified - Optimization opportunities documented - Historical comparison completed outputs: - performance_trend_report - optimization_recommendations - bottleneck_analysis proactive_optimization: title: "Proactive Performance Optimization" description: "Implement identified optimizations and performance improvements before issues become critical" estimated_duration: "1-3 hours" frequency: "Bi-weekly or as needed" dependencies: ["performance_analysis"] agents: ["dev", "glab"] tasks: - debug-ci-configuration - create-gitlab-workflow-plan decision_points: - optimization_priority: question: "What is the priority level for identified optimizations?" options: high_impact: "Implement immediately" medium_impact: "Schedule for next maintenance window" low_impact: "Add to backlog for future consideration" success_criteria: - High-priority optimizations implemented - Performance improvements measured - Configuration changes validated - No regressions introduced outputs: - optimization_implementation_results - performance_improvement_metrics - updated_configurations stakeholder_reporting: title: "Stakeholder Communication and Reporting" description: "Generate and distribute health reports to stakeholders with actionable insights" estimated_duration: "20-30 minutes" frequency: "Weekly" dependencies: ["performance_analysis", "integration_health_check"] agents: ["pm", "glab"] tasks: - generate-ci-health-report - sync-ci-status-to-jira decision_points: - reporting_detail_level: question: "What level of detail is appropriate for stakeholder reports?" options: executive_summary: "High-level metrics and trends only" detailed_analysis: "Comprehensive technical details" custom_format: "Tailored report based on audience needs" success_criteria: - Stakeholder reports generated - Key metrics communicated clearly - Action items identified - Feedback collection initiated outputs: - stakeholder_health_report - executive_summary - action_item_list continuous_improvement: title: "Continuous Improvement Planning" description: "Analyze monitoring effectiveness and plan improvements to the monitoring process itself" estimated_duration: "45-60 minutes" frequency: "Monthly" dependencies: ["stakeholder_reporting"] agents: ["pm", "dev", "glab"] tasks: - create-gitlab-workflow-plan - generate-ci-health-report decision_points: - improvement_focus_area: question: "Which area of CI/CD monitoring needs the most improvement?" options: detection_speed: "Focus on faster issue detection" accuracy: "Improve monitoring accuracy and reduce false positives" integration: "Enhance cross-pack integration monitoring" automation: "Increase automation of monitoring processes" success_criteria: - Monitoring effectiveness evaluated - Improvement opportunities identified - Enhancement plan created - Success metrics updated outputs: - monitoring_improvement_plan - enhanced_metrics_definition - process_optimization_recommendations checkpoints: - phase: health_assessment checkpoint: baseline_established validation: "Current health baseline documented with key metrics" frequency: "Daily" - phase: integration_health_check checkpoint: integration_status_confirmed validation: "All integration points validated and functioning" frequency: "Daily" - phase: performance_analysis checkpoint: trends_analyzed validation: "Performance trends analyzed and documented" frequency: "Weekly" - phase: proactive_optimization checkpoint: optimizations_applied validation: "Identified optimizations successfully implemented" frequency: "As needed" - phase: stakeholder_reporting checkpoint: reports_distributed validation: "Health reports generated and distributed to stakeholders" frequency: "Weekly" - phase: continuous_improvement checkpoint: improvements_planned validation: "Monitoring improvement plan created and approved" frequency: "Monthly" monitoring_thresholds: pipeline_success_rate: healthy: "> 90%" warning: "80-90%" critical: "< 80%" average_duration: healthy: "< 15 minutes" warning: "15-30 minutes" critical: "> 30 minutes" failure_recovery_time: healthy: "< 2 hours" warning: "2-8 hours" critical: "> 8 hours" integration_sync_rate: healthy: "> 95%" warning: "90-95%" critical: "< 90%" automated_actions: health_degradation_detected: trigger: "Pipeline health score drops below 80%" action: "Automatically initiate gitlab-ci-debugging workflow" notification: "Alert development team immediately" performance_regression: trigger: "Average pipeline duration increases by > 50%" action: "Generate detailed performance analysis report" notification: "Notify team lead and stakeholders" integration_failure: trigger: "Cross-pack integration sync failure rate > 10%" action: "Validate integration configuration and connectivity" notification: "Alert integration administrators" critical_pipeline_failure: trigger: "Pipeline failure on main/production branch" action: "Initiate urgent debugging workflow with high priority" notification: "Immediate alerts to all stakeholders" quality_gates: - gate: health_baseline_validation criteria: "Health assessment data is complete and accurate" phase: health_assessment blocking: false - gate: integration_connectivity criteria: "All integration endpoints are reachable and functional" phase: integration_health_check blocking: true - gate: trend_analysis_completeness criteria: "Performance trend analysis covers minimum required time period" phase: performance_analysis blocking: false - gate: optimization_impact_validation criteria: "Performance optimizations show measurable improvement" phase: proactive_optimization blocking: true escalation_procedures: health_score_critical: trigger: "Overall health score < 60%" escalation: "Immediate senior team involvement" timeline: "Within 30 minutes" actions: ["Initiate emergency debugging session", "Notify all stakeholders"] repeated_failures: trigger: "Same failure pattern detected 3+ times in 24 hours" escalation: "Architectural review required" timeline: "Within 4 hours" actions: ["Schedule architectural assessment", "Document failure pattern"] integration_breakdown: trigger: "Complete integration failure for > 2 hours" escalation: "Cross-team collaboration session" timeline: "Within 1 hour" actions: ["Engage integration specialists", "Assess alternative workflows"] success_patterns: high_performing_pipeline: characteristics: - "Success rate > 95%" - "Average duration < 10 minutes" - "Failure recovery < 1 hour" maintenance_approach: "Light monitoring with trend analysis" stable_pipeline: characteristics: - "Success rate 85-95%" - "Average duration 10-20 minutes" - "Consistent performance trends" maintenance_approach: "Standard monitoring with weekly optimization reviews" improvement_needed: characteristics: - "Success rate < 85%" - "Average duration > 20 minutes" - "Declining performance trends" maintenance_approach: "Intensive monitoring with bi-weekly optimization cycles" integration_hooks: jira_integration: - phase: health_assessment action: "Update JIRA dashboard with CI health metrics" - phase: stakeholder_reporting action: "Sync health report data to JIRA project tracking" parallel_dev_integration: - phase: integration_health_check action: "Validate CI coordination across all parallel worktrees" - phase: performance_analysis action: "Analyze performance impact of parallel development" core_bmad_integration: - phase: continuous_improvement action: "Update BMAD development workflows with monitoring insights" - phase: stakeholder_reporting action: "Integrate CI health into project status reporting" reporting_templates: daily_health_summary: format: "Brief status with key metrics and alerts" recipients: ["Development team", "DevOps team"] distribution: "Automated via CI/CD status channels" weekly_performance_report: format: "Detailed analysis with trends and recommendations" recipients: ["Team leads", "Project managers", "Stakeholders"] distribution: "Email and JIRA dashboard" monthly_improvement_review: format: "Strategic analysis with improvement plans" recipients: ["Senior management", "Architecture team"] distribution: "Presentation and documentation"