ASD

Data Quality Frameworks

Implementa validación de calidad de datos con Great Expectations, pruebas dbt y contratos de datos para pipelines fiables.

Estrellas
38.8k

en todo el repo

Actividad
47

0–100, la ruta de este skill

Actualizado
hace 2 meses

último commit aquí

Commits
1

últimos 90 días

Contexto
1.1k tok

49 tok en reposo

Paquete
2 archivos

16 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add wshobson/agents --skill data-quality-frameworks --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Configura validación de calidad de datos con Great Expectations, incluyendo suites de expectativas por columna
  • Define patrones de pruebas dbt y contratos de datos para pipelines
  • Genera reportes de validación con estado pass/fail por tabla y detalle de checks fallidos
  • Establece dimensiones de calidad de datos: completitud, unicidad, validez, precisión, consistencia y actualidad

Úsalo cuando

  • Implementar checks de calidad de datos en pipelines
  • Configurar validación con Great Expectations
  • Construir suites de pruebas dbt completas
  • Establecer contratos de datos entre equipos

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Configura Great Expectations para validar la tabla orders
    • Ayúdame a crear una suite de pruebas dbt para mis modelos
    • Necesito establecer un contrato de datos entre equipos

    SKILL.md

    En inglés

    Data Quality Frameworks

    Production patterns for implementing data quality with Great Expectations, dbt tests, and data contracts to ensure reliable data pipelines.

    When to Use This Skill

    • Implementing data quality checks in pipelines
    • Setting up Great Expectations validation
    • Building comprehensive dbt test suites
    • Establishing data contracts between teams
    • Monitoring data quality metrics
    • Automating data validation in CI/CD

    Core Concepts

    1. Data Quality Dimensions

    Dimension Description Example Check
    Completeness No missing values expect_column_values_to_not_be_null
    Uniqueness No duplicates expect_column_values_to_be_unique
    Validity Values in expected range expect_column_values_to_be_in_set
    Accuracy Data matches reality Cross-reference validation
    Consistency No contradictions expect_column_pair_values_A_to_be_greater_than_B
    Timeliness Data is recent expect_column_max_to_be_between

    2. Testing Pyramid for Data

              /\
             /  \     Integration Tests (cross-table)
            /────\
           /      \   Unit Tests (single column)
          /────────\
         /          \ Schema Tests (structure)
        /────────────\
    

    Quick Start

    Great Expectations Setup

    # Install
    pip install great_expectations
    
    # Initialize project
    great_expectations init
    
    # Create datasource
    great_expectations datasource new
    
    # great_expectations/checkpoints/daily_validation.yml
    import great_expectations as gx
    
    # Create context
    context = gx.get_context()
    
    # Create expectation suite
    suite = context.add_expectation_suite("orders_suite")
    
    # Add expectations
    suite.add_expectation(
        gx.expectations.ExpectColumnValuesToNotBeNull(column="order_id")
    )
    suite.add_expectation(
        gx.expectations.ExpectColumnValuesToBeUnique(column="order_id")
    )
    
    # Validate
    results = context.run_checkpoint(checkpoint_name="daily_orders")
    

    Detailed patterns and worked examples

    Detailed pattern documentation lives in references/details.md. Read that file when the navigation tier above is insufficient.

    Summary: {total_passed}/{total_tables} tables passed")

        report.append("")
    
        for table, result in results.items():
            status = "✅" if result.passed else "❌"
            report.append(f"### {status} {table}")
            report.append(f"- Expectations: {result.total_expectations}")
            report.append(f"- Failed: {result.failed_expectations}")
    
            if not result.passed:
                report.append("- Failed checks:")
                for detail in result.details:
                    if not detail["success"]:
                        report.append(f"  - {detail['expectation']}: {detail['observed_value']}")
            report.append("")
    
        return "\n".join(report)
    

    Usage

    context = gx.get_context() pipeline = DataQualityPipeline(context)

    tables_to_validate = { "orders": "orders_suite", "customers": "customers_suite", "products": "products_suite", }

    results = pipeline.run_all(tables_to_validate) report = pipeline.generate_report(results)

    Fail pipeline if any table failed

    if not all(r.passed for r in results.values()): print(report) raise ValueError("Data quality checks failed!")

    
    ## Best Practices
    
    ### Do's
    
    - **Test early** - Validate source data before transformations
    - **Test incrementally** - Add tests as you find issues
    - **Document expectations** - Clear descriptions for each test
    - **Alert on failures** - Integrate with monitoring
    - **Version contracts** - Track schema changes
    
    ### Don'ts
    
    - **Don't test everything** - Focus on critical columns
    - **Don't ignore warnings** - They often precede failures
    - **Don't skip freshness** - Stale data is bad data
    - **Don't hardcode thresholds** - Use dynamic baselines
    - **Don't test in isolation** - Test relationships too
    

    Reproducido de wshobson/agents bajo licencia MIT. Leer esta página en markdown.

    Archivos

    2 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere instalar great_expectations vía pip y, opcionalmente, dbt configurado en el proyecto.

    Necesita en el PATH:pip

    Detalles

    Creador
    wshobson
    Licencia
    MIT
    Recursos incluidos
    referencias
    Repositorio
    wshobson/agents
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de wshobson/agents

    Este repo incluye 180 skills. Si instalas uno, normalmente ya tienes los demás.

    Úsalo al seleccionar y colocar iconos, imágenes, SVGs, diagramas o infografías de apoyo aprobados en un PPTX editable.

    Costo de contexto al activarse
    344 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo cuando pidan optimizar un prompt, mejorar su rendimiento, diseñar una plantilla, aplicar chain-of-thought, few-shot prompting o técnicas avanzadas de prompt engineering para producción.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    10 archivos
    Última actualización
    el mes pasado
    herramientas desarrollo

    Úsalo al redactar o reparar una especificación JSON con coordenadas explícitas para un PPTX editable.

    Costo de contexto al activarse
    489 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo para validar o reparar un PPTX editable en cuanto a geometría, accesibilidad, editabilidad nativa, linaje de fuente e integridad del paquete OOXML.

    Costo de contexto al activarse
    409 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo para analizar un PPTX de referencia en modo solo lectura: estructura, tema, tipografía, ritmo de layout, diagnósticos, catálogos de plantillas derivados o inspección segura del paquete OOXML.

    Costo de contexto al activarse
    689 tok
    Tamaño del paquete
    8 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo al preparar la narrativa, las fuentes y el contexto de diseño para un nuevo deck PPTX editable.

    Costo de contexto al activarse
    415 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Skills relacionados

    Construye pipelines MLOps de extremo a extremo: preparación de datos, entrenamiento, validación y despliegue en producción del modelo.

    Costo de contexto al activarse
    1.8k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    datos analitica

    Combina búsqueda vectorial y por palabras clave para mejorar la recuperación. Útil al implementar RAG, motores de búsqueda o cuando ningún enfoque solo basta.

    Costo de contexto al activarse
    508 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 2 meses
    datos analitica

    Transforma datos en narrativas persuasivas usando visualización, contexto y estructura. Útil al presentar analíticas a stakeholders, crear reportes o presentaciones ejecutivas.

    Costo de contexto al activarse
    530 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 2 meses
    datos analitica