Skills Agentes

Data Quality Frameworks

Implementa validación de calidad de datos con Great Expectations, pruebas dbt y contratos de datos para pipelines fiables.

Estrellas
39.8k

en todo el repo

Actividad
43

0–100, la ruta de este skill

Actualizado
hace 4 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
1.1k tok

49 tok en reposo

Paquete
2 archivos

16 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add wshobson/agents --skill data-quality-frameworks --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Configura validación de calidad de datos con Great Expectations, incluyendo suites de expectativas por columna
  • Define patrones de pruebas dbt y contratos de datos para pipelines
  • Genera reportes de validación con estado pass/fail por tabla y detalle de checks fallidos
  • Establece dimensiones de calidad de datos: completitud, unicidad, validez, precisión, consistencia y actualidad

Úsalo cuando

  • Implementar checks de calidad de datos en pipelines
  • Configurar validación con Great Expectations
  • Construir suites de pruebas dbt completas
  • Establecer contratos de datos entre equipos

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • “Configura Great Expectations para validar la tabla orders”
    • “Ayúdame a crear una suite de pruebas dbt para mis modelos”
    • “Necesito establecer un contrato de datos entre equipos”

    SKILL.md

    En inglés

    Data Quality Frameworks

    Production patterns for implementing data quality with Great Expectations, dbt tests, and data contracts to ensure reliable data pipelines.

    When to Use This Skill

    • Implementing data quality checks in pipelines
    • Setting up Great Expectations validation
    • Building comprehensive dbt test suites
    • Establishing data contracts between teams
    • Monitoring data quality metrics
    • Automating data validation in CI/CD

    Core Concepts

    1. Data Quality Dimensions

    Dimension Description Example Check
    Completeness No missing values expect_column_values_to_not_be_null
    Uniqueness No duplicates expect_column_values_to_be_unique
    Validity Values in expected range expect_column_values_to_be_in_set
    Accuracy Data matches reality Cross-reference validation
    Consistency No contradictions expect_column_pair_values_A_to_be_greater_than_B
    Timeliness Data is recent expect_column_max_to_be_between

    2. Testing Pyramid for Data

              /\
             /  \     Integration Tests (cross-table)
            /────\
           /      \   Unit Tests (single column)
          /────────\
         /          \ Schema Tests (structure)
        /────────────\
    

    Quick Start

    Great Expectations Setup

    # Install
    pip install great_expectations
    
    # Initialize project
    great_expectations init
    
    # Create datasource
    great_expectations datasource new
    
    # great_expectations/checkpoints/daily_validation.yml
    import great_expectations as gx
    
    # Create context
    context = gx.get_context()
    
    # Create expectation suite
    suite = context.add_expectation_suite("orders_suite")
    
    # Add expectations
    suite.add_expectation(
        gx.expectations.ExpectColumnValuesToNotBeNull(column="order_id")
    )
    suite.add_expectation(
        gx.expectations.ExpectColumnValuesToBeUnique(column="order_id")
    )
    
    # Validate
    results = context.run_checkpoint(checkpoint_name="daily_orders")
    

    Detailed patterns and worked examples

    Detailed pattern documentation lives in references/details.md. Read that file when the navigation tier above is insufficient.

    Summary: {total_passed}/{total_tables} tables passed")

        report.append("")
    
        for table, result in results.items():
            status = "✅" if result.passed else "❌"
            report.append(f"### {status} {table}")
            report.append(f"- Expectations: {result.total_expectations}")
            report.append(f"- Failed: {result.failed_expectations}")
    
            if not result.passed:
                report.append("- Failed checks:")
                for detail in result.details:
                    if not detail["success"]:
                        report.append(f"  - {detail['expectation']}: {detail['observed_value']}")
            report.append("")
    
        return "\n".join(report)
    

    Usage

    context = gx.get_context() pipeline = DataQualityPipeline(context)

    tables_to_validate = { "orders": "orders_suite", "customers": "customers_suite", "products": "products_suite", }

    results = pipeline.run_all(tables_to_validate) report = pipeline.generate_report(results)

    Fail pipeline if any table failed

    if not all(r.passed for r in results.values()): print(report) raise ValueError("Data quality checks failed!")

    
    ## Best Practices
    
    ### Do's
    
    - **Test early** - Validate source data before transformations
    - **Test incrementally** - Add tests as you find issues
    - **Document expectations** - Clear descriptions for each test
    - **Alert on failures** - Integrate with monitoring
    - **Version contracts** - Track schema changes
    
    ### Don'ts
    
    - **Don't test everything** - Focus on critical columns
    - **Don't ignore warnings** - They often precede failures
    - **Don't skip freshness** - Stale data is bad data
    - **Don't hardcode thresholds** - Use dynamic baselines
    - **Don't test in isolation** - Test relationships too
    

    Reproducido de wshobson/agents bajo licencia MIT. Leer esta página en markdown.

    Archivos

    2 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere instalar great_expectations vía pip y, opcionalmente, dbt configurado en el proyecto.

    Necesita en el PATH:pip

    Detalles

    Creador
    wshobson
    Licencia
    MIT
    Recursos incluidos
    referencias
    Repositorio
    wshobson/agents
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de wshobson/agents

    Este repo incluye 183 skills. Si instalas uno, normalmente ya tienes los demás. Ver el pack agents entero y su comando de instalación

    Instala y opera Hermes Tweet, un plugin de Hermes Agent para investigar X/Twitter, leer timelines, analizar tweets y ejecutar operaciones privadas o de cambio de estado con aprobación previa.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    3 archivos
    Última actualización
    el mes pasado
    redes sociales

    Úsalo para mantener un almacén Markdown de conocimiento donde cada afirmación compilada se rastrea hasta una fuente inmutable y el drift se detecta con git diff sin gastar tokens.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 24 días
    documentos

    Úsalo al diseñar o revisar un esquema específico de PostgreSQL: buenas prácticas, tipos de datos, indexación, restricciones, patrones de rendimiento y funciones avanzadas.

    Costo de contexto al activarse
    2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 24 días
    bases de datos

    Úsalo cuando un proyecto guarda su estado en Superself: lee `self context` al iniciar sesión, vincula el trabajo a una work unit, reporta con evidencia y registra decisiones confirmadas.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 24 días
    productividad

    Úsalo cuando pidan optimizar un prompt, mejorar su rendimiento, diseñar una plantilla, aplicar chain-of-thought, few-shot prompting o técnicas avanzadas de prompt engineering para producción.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    10 archivos
    Última actualización
    el mes pasado
    herramientas desarrollo

    Audita y reescribe prosa para que deje de sonar generada por máquina. Incluye modo solo-detección, modo reescritura y modo edición en el lugar, con perfiles opcionales de voz y contexto.”

    Costo de contexto al activarse
    1.9k tok
    Tamaño del paquete
    4 archivos
    Última actualización
    el mes pasado
    redaccion contenido

    Skills relacionados

    Construye sistemas de backtesting robustos para estrategias de trading, manejando correctamente look-ahead bias, survivorship bias y costes de transacción.

    Costo de contexto al activarse
    878 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 4 meses
    datos analitica

    Transforma datos en narrativas persuasivas usando visualización, contexto y estructura. Útil al presentar analíticas a stakeholders, crear reportes o presentaciones ejecutivas.

    Costo de contexto al activarse
    530 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 4 meses
    datos analitica

    Prepara, formatea y valida datasets para fine-tuning supervisado y entrenamiento de preferencias: formato, plantillas de chat, packing, datos sintéticos y dataset card.

    Costo de contexto al activarse
    2k tok
    Tamaño del paquete
    3 archivos
    Última actualización
    hace 2 meses
    datos analitica