claude-flow-novice
Version:
Claude Flow Novice - Advanced orchestration platform for multi-agent AI workflows with CFN Loop architecture Includes Local RuVector Accelerator and all CFN skills for complete functionality.
202 lines (185 loc) • 6.8 kB
YAML
groups:
- name: integration_health_alerts
interval: 30s
rules:
- alert: DatabaseServiceDown
expr: |
up{job="database_service"} == 0
for: 2m
labels:
severity: critical
component: database_service
annotations:
summary: "Database service is down"
description: "Database service is not responding"
runbook_url: "docs/INCIDENT_RESPONSE.md"
- alert: CoordinationServiceDown
expr: |
up{job="coordination_service"} == 0
for: 2m
labels:
severity: critical
component: coordination_service
annotations:
summary: "Coordination service is down"
description: "Coordination service is not responding"
runbook_url: "docs/INCIDENT_RESPONSE.md"
- alert: ArtifactStorageDown
expr: |
up{job="artifact_storage"} == 0
for: 2m
labels:
severity: critical
component: artifact_storage
annotations:
summary: "Artifact storage service is down"
description: "Artifact storage service is not responding"
runbook_url: "docs/INCIDENT_RESPONSE.md"
- alert: MetricsCollectionDown
expr: |
up{job="metrics_collector"} == 0
for: 2m
labels:
severity: warning
component: metrics
annotations:
summary: "Metrics collection service down"
description: "Metrics collection service is not responding"
- alert: RedisDown
expr: |
redis_up == 0
for: 1m
labels:
severity: critical
component: redis
annotations:
summary: "Redis is down"
description: "Redis connection is down"
runbook_url: "docs/INCIDENT_RESPONSE.md"
- alert: DatabaseReplicationLag
expr: |
pg_replication_lag_seconds > 30
for: 5m
labels:
severity: warning
component: database
annotations:
summary: "Database replication lag high"
description: "Replication lag is {{ $value | humanize }}s"
impact: "Failover may take longer"
- alert: SkillDeploymentFailure
expr: |
increase(skill_deployment_failures_total[5m]) > 0
for: 2m
labels:
severity: high
component: skill_deployment
annotations:
summary: "Skill deployment failure detected"
description: "{{ $value }} skill deployment failures in last 5 minutes"
- alert: IntegrationPointUnavailable
expr: |
integration_point_available == 0
for: 5m
labels:
severity: critical
component: integration
annotations:
summary: "Integration point unavailable"
description: "Integration point {{ $labels.integration_point }} is unavailable"
runbook_url: "docs/INCIDENT_RESPONSE.md"
- alert: DataConsistencyIssues
expr: |
increase(data_consistency_violations_total[10m]) > 5
for: 5m
labels:
severity: critical
component: data_integrity
annotations:
summary: "Data consistency violations detected"
description: "{{ $value }} consistency violations in last 10 minutes"
runbook_url: "docs/INCIDENT_RESPONSE.md"
- alert: StaleDatabaseSnapshot
expr: |
(time() - last_database_snapshot_timestamp) > 3600
for: 10m
labels:
severity: warning
component: database
annotations:
summary: "Database snapshot stale"
description: "Last snapshot was {{ $value | humanize }}s ago"
- alert: CoordinationMessageQueueBacklog
expr: |
redis_queue_size > 5000
for: 10m
labels:
severity: high
component: coordination
annotations:
summary: "Coordination message backlog building"
description: "Queue depth: {{ $value }} messages"
impact: "Processing may be delayed"
- alert: HealthCheckFailures
expr: |
sum(rate(health_check_failures_total[5m])) > 5
for: 5m
labels:
severity: high
component: health_check
annotations:
summary: "Multiple health check failures"
description: "{{ $value }} health checks failed per second"
- alert: IntegrationPointLatencyDegradation
expr: |
(histogram_quantile(0.95, rate(integration_point_latency_seconds_bucket[5m])) / on(integration_point) histogram_quantile(0.95, rate(integration_point_latency_seconds_bucket[1h] offset 24h))) > 2
for: 10m
labels:
severity: high
component: integration
annotations:
summary: "Integration point latency degraded"
description: "{{ $labels.integration_point }} latency doubled"
- alert: ArtifactStorageBackendDown
expr: |
artifact_storage_backend_available == 0
for: 2m
labels:
severity: critical
component: artifact_storage
annotations:
summary: "Artifact storage backend unavailable"
description: "Backend {{ $labels.backend }} is down"
runbook_url: "docs/INCIDENT_RESPONSE.md"
- alert: LoggingServiceDown
expr: |
up{job="logging_service"} == 0
for: 2m
labels:
severity: warning
component: logging
annotations:
summary: "Logging service is down"
description: "Logging service is not responding"
impact: "Log collection is disabled"
- alert: SecurityValidationFailures
expr: |
sum(rate(security_validation_failures_total[5m])) > 10
for: 5m
labels:
severity: high
component: security
annotations:
summary: "Security validation failures"
description: "{{ $value }} validation failures per second"
- alert: IntegrationErrorBudgetExceeded
expr: |
(sum(rate(http_requests_total{status=~"5.."}[1h])) / sum(rate(http_requests_total[1h]))) > 0.001
for: 30m
labels:
severity: warning
component: integration
annotations:
summary: "Integration error budget consumed"
description: "Error rate over 1 hour: {{ $value | humanizePercentage }}"
impact: "Consider rollback if trend continues"