ASD

Grafana Dashboards

Crea y gestiona dashboards de Grafana listos para producción, para visualizar en tiempo real métricas de sistemas y aplicaciones.

Estrellas
38.8k

en todo el repo

Actividad
34

0–100, la ruta de este skill

Actualizado
hace 5 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
2k tok

56 tok en reposo

Paquete
1 archivo

8 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add wshobson/agents --skill grafana-dashboards --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Genera JSON de dashboards de Grafana con paneles (stat, time series, table, heatmap) y queries PromQL
  • Aplica principios de diseño RED (servicios) y USE (recursos) para organizar métricas
  • Define variables de plantillas, alertas embebidas y aprovisionamiento vía dashboards.yml, Terraform o Ansible

Úsalo cuando

  • Visualizar métricas de Prometheus
  • Crear dashboards personalizados
  • Implementar dashboards de SLO
  • Monitorizar infraestructura o rastrear KPIs de negocio

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Crea un dashboard de Grafana para monitorizar mi API en producción
    • Necesito un panel de latencia P95 con Prometheus
    • Diseña un dashboard de infraestructura con CPU, memoria y disco

    SKILL.md

    En inglés

    Grafana Dashboards

    Create and manage production-ready Grafana dashboards for comprehensive system observability.

    Purpose

    Design effective Grafana dashboards for monitoring applications, infrastructure, and business metrics.

    When to Use

    • Visualize Prometheus metrics
    • Create custom dashboards
    • Implement SLO dashboards
    • Monitor infrastructure
    • Track business KPIs

    Dashboard Design Principles

    1. Hierarchy of Information

    ┌─────────────────────────────────────┐
    │  Critical Metrics (Big Numbers)     │
    ├─────────────────────────────────────┤
    │  Key Trends (Time Series)           │
    ├─────────────────────────────────────┤
    │  Detailed Metrics (Tables/Heatmaps) │
    └─────────────────────────────────────┘
    

    2. RED Method (Services)

    • Rate - Requests per second
    • Errors - Error rate
    • Duration - Latency/response time

    3. USE Method (Resources)

    • Utilization - % time resource is busy
    • Saturation - Queue length/wait time
    • Errors - Error count

    Dashboard Structure

    API Monitoring Dashboard

    {
      "dashboard": {
        "title": "API Monitoring",
        "tags": ["api", "production"],
        "timezone": "browser",
        "refresh": "30s",
        "panels": [
          {
            "title": "Request Rate",
            "type": "graph",
            "targets": [
              {
                "expr": "sum(rate(http_requests_total[5m])) by (service)",
                "legendFormat": "{{service}}"
              }
            ],
            "gridPos": { "x": 0, "y": 0, "w": 12, "h": 8 }
          },
          {
            "title": "Error Rate %",
            "type": "graph",
            "targets": [
              {
                "expr": "(sum(rate(http_requests_total{status=~\"5..\"}[5m])) / sum(rate(http_requests_total[5m]))) * 100",
                "legendFormat": "Error Rate"
              }
            ],
            "alert": {
              "conditions": [
                {
                  "evaluator": { "params": [5], "type": "gt" },
                  "operator": { "type": "and" },
                  "query": { "params": ["A", "5m", "now"] },
                  "type": "query"
                }
              ]
            },
            "gridPos": { "x": 12, "y": 0, "w": 12, "h": 8 }
          },
          {
            "title": "P95 Latency",
            "type": "graph",
            "targets": [
              {
                "expr": "histogram_quantile(0.95, sum(rate(http_request_duration_seconds_bucket[5m])) by (le, service))",
                "legendFormat": "{{service}}"
              }
            ],
            "gridPos": { "x": 0, "y": 8, "w": 24, "h": 8 }
          }
        ]
      }
    }
    

    Reference: See assets/api-dashboard.json

    Panel Types

    1. Stat Panel (Single Value)

    {
      "type": "stat",
      "title": "Total Requests",
      "targets": [
        {
          "expr": "sum(http_requests_total)"
        }
      ],
      "options": {
        "reduceOptions": {
          "values": false,
          "calcs": ["lastNotNull"]
        },
        "orientation": "auto",
        "textMode": "auto",
        "colorMode": "value"
      },
      "fieldConfig": {
        "defaults": {
          "thresholds": {
            "mode": "absolute",
            "steps": [
              { "value": 0, "color": "green" },
              { "value": 80, "color": "yellow" },
              { "value": 90, "color": "red" }
            ]
          }
        }
      }
    }
    

    2. Time Series Graph

    {
      "type": "graph",
      "title": "CPU Usage",
      "targets": [
        {
          "expr": "100 - (avg by (instance) (rate(node_cpu_seconds_total{mode=\"idle\"}[5m])) * 100)"
        }
      ],
      "yaxes": [
        { "format": "percent", "max": 100, "min": 0 },
        { "format": "short" }
      ]
    }
    

    3. Table Panel

    {
      "type": "table",
      "title": "Service Status",
      "targets": [
        {
          "expr": "up",
          "format": "table",
          "instant": true
        }
      ],
      "transformations": [
        {
          "id": "organize",
          "options": {
            "excludeByName": { "Time": true },
            "indexByName": {},
            "renameByName": {
              "instance": "Instance",
              "job": "Service",
              "Value": "Status"
            }
          }
        }
      ]
    }
    

    4. Heatmap

    {
      "type": "heatmap",
      "title": "Latency Heatmap",
      "targets": [
        {
          "expr": "sum(rate(http_request_duration_seconds_bucket[5m])) by (le)",
          "format": "heatmap"
        }
      ],
      "dataFormat": "tsbuckets",
      "yAxis": {
        "format": "s"
      }
    }
    

    Variables

    Query Variables

    {
      "templating": {
        "list": [
          {
            "name": "namespace",
            "type": "query",
            "datasource": "Prometheus",
            "query": "label_values(kube_pod_info, namespace)",
            "refresh": 1,
            "multi": false
          },
          {
            "name": "service",
            "type": "query",
            "datasource": "Prometheus",
            "query": "label_values(kube_service_info{namespace=\"$namespace\"}, service)",
            "refresh": 1,
            "multi": true
          }
        ]
      }
    }
    

    Use Variables in Queries

    sum(rate(http_requests_total{namespace="$namespace", service=~"$service"}[5m]))
    

    Alerts in Dashboards

    {
      "alert": {
        "name": "High Error Rate",
        "conditions": [
          {
            "evaluator": {
              "params": [5],
              "type": "gt"
            },
            "operator": { "type": "and" },
            "query": {
              "params": ["A", "5m", "now"]
            },
            "reducer": { "type": "avg" },
            "type": "query"
          }
        ],
        "executionErrorState": "alerting",
        "for": "5m",
        "frequency": "1m",
        "message": "Error rate is above 5%",
        "noDataState": "no_data",
        "notifications": [{ "uid": "slack-channel" }]
      }
    }
    

    Dashboard Provisioning

    dashboards.yml:

    apiVersion: 1
    
    providers:
      - name: "default"
        orgId: 1
        folder: "General"
        type: file
        disableDeletion: false
        updateIntervalSeconds: 10
        allowUiUpdates: true
        options:
          path: /etc/grafana/dashboards
    

    Common Dashboard Patterns

    Infrastructure Dashboard

    Key Panels:

    • CPU utilization per node
    • Memory usage per node
    • Disk I/O
    • Network traffic
    • Pod count by namespace
    • Node status

    Reference: See assets/infrastructure-dashboard.json

    Database Dashboard

    Key Panels:

    • Queries per second
    • Connection pool usage
    • Query latency (P50, P95, P99)
    • Active connections
    • Database size
    • Replication lag
    • Slow queries

    Reference: See assets/database-dashboard.json

    Application Dashboard

    Key Panels:

    • Request rate
    • Error rate
    • Response time (percentiles)
    • Active users/sessions
    • Cache hit rate
    • Queue length

    Best Practices

    1. Start with templates (Grafana community dashboards)
    2. Use consistent naming for panels and variables
    3. Group related metrics in rows
    4. Set appropriate time ranges (default: Last 6 hours)
    5. Use variables for flexibility
    6. Add panel descriptions for context
    7. Configure units correctly
    8. Set meaningful thresholds for colors
    9. Use consistent colors across dashboards
    10. Test with different time ranges

    Dashboard as Code

    Terraform Provisioning

    resource "grafana_dashboard" "api_monitoring" {
      config_json = file("${path.module}/dashboards/api-monitoring.json")
      folder      = grafana_folder.monitoring.id
    }
    
    resource "grafana_folder" "monitoring" {
      title = "Production Monitoring"
    }
    

    Ansible Provisioning

    - name: Deploy Grafana dashboards
      copy:
        src: "{{ item }}"
        dest: /etc/grafana/dashboards/
      with_fileglob:
        - "dashboards/*.json"
      notify: restart grafana
    

    Related Skills

    • prometheus-configuration - For metric collection
    • slo-implementation - For SLO dashboards

    Reproducido de wshobson/agents bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere una instancia de Grafana con datasource de Prometheus configurado.

    Detalles

    Creador
    wshobson
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Repositorio
    wshobson/agents
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de wshobson/agents

    Este repo incluye 180 skills. Si instalas uno, normalmente ya tienes los demás.

    Úsalo al seleccionar y colocar iconos, imágenes, SVGs, diagramas o infografías de apoyo aprobados en un PPTX editable.

    Costo de contexto al activarse
    344 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo cuando pidan optimizar un prompt, mejorar su rendimiento, diseñar una plantilla, aplicar chain-of-thought, few-shot prompting o técnicas avanzadas de prompt engineering para producción.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    10 archivos
    Última actualización
    el mes pasado
    herramientas desarrollo

    Úsalo al redactar o reparar una especificación JSON con coordenadas explícitas para un PPTX editable.

    Costo de contexto al activarse
    489 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo para validar o reparar un PPTX editable en cuanto a geometría, accesibilidad, editabilidad nativa, linaje de fuente e integridad del paquete OOXML.

    Costo de contexto al activarse
    409 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo para analizar un PPTX de referencia en modo solo lectura: estructura, tema, tipografía, ritmo de layout, diagnósticos, catálogos de plantillas derivados o inspección segura del paquete OOXML.

    Costo de contexto al activarse
    689 tok
    Tamaño del paquete
    8 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo al preparar la narrativa, las fuentes y el contexto de diseño para un nuevo deck PPTX editable.

    Costo de contexto al activarse
    415 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Skills relacionados

    Configura Turborepo para builds de monorepo eficientes con caché local y remota. Útil al configurar Turborepo, optimizar pipelines de build o implementar caching distribuido.

    Costo de contexto al activarse
    2k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    devops infraestructura

    Implementa observabilidad integral para service meshes, incluyendo tracing distribuido, métricas y visualización. Útil para monitoreo de mesh, depuración de latencia y SLOs.

    Costo de contexto al activarse
    708 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 2 meses
    devops infraestructura

    Define e implementa Indicadores (SLI) y Objetivos (SLO) de nivel de servicio con error budgets y alertas, para establecer metas de fiabilidad y prácticas SRE.

    Costo de contexto al activarse
    1.8k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 2 meses
    devops infraestructura