Skills Agentes

Dummy Dataset

Genera datasets ficticios realistas para pruebas, con columnas y restricciones personalizables, en formato CSV, JSON, SQL o script de Python.

Estrellas
25.6k

en todo el repo

Actividad
31

0–100, la ruta de este skill

Actualizado
hace 5 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
983 tok

61 tok en reposo

Paquete
1 archivo

4 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add phuryn/pm-skills --skill dummy-dataset --agent claude-code

Se instala solo en este repositorio.

Este skill reads environment config.

Qué hace

  • Genera datasets de prueba realistas a partir del tipo de dato, columnas, número de filas y restricciones de negocio indicadas
  • Produce el resultado en CSV, JSON, sentencias SQL INSERT o un script de Python ejecutable
  • Aplica patrones de valores realistas y respeta reglas de negocio como distribuciones o relaciones entre campos
  • Valida la calidad y completitud de los datos generados antes de entregarlos

Úsalo cuando

  • Crear datos de prueba
  • Construir datasets ficticios para desarrollo
  • Generar datos de muestra para demos
  • Poblar entornos de test

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Genera 200 filas de datos ficticios de feedback de clientes en CSV
    • Crea un script en Python que genere datos de transacciones de prueba
    • Necesito un dataset JSON de perfiles de usuario con nombre, email y fecha de alta

    SKILL.md

    En inglés

    Dummy Dataset Generation

    Generate realistic dummy datasets for testing with customizable columns, constraints, and output formats (CSV, JSON, SQL, Python script). Creates executable scripts or direct data files for immediate use.

    Use when: Creating test data, generating sample datasets, building realistic mock data for development, or populating test environments.

    Arguments:

    • $PRODUCT: The product or system name
    • $DATASET_TYPE: Type of data (e.g., customer feedback, transactions, user profiles)
    • $ROWS: Number of rows to generate (default: 100)
    • $COLUMNS: Specific columns or fields to include
    • $FORMAT: Output format (CSV, JSON, SQL, Python script)
    • $CONSTRAINTS: Additional constraints or business rules

    Step-by-Step Process

    1. Identify dataset type - Understand the data domain
    2. Define column specifications - Names, data types, and value ranges
    3. Determine row count - How many sample records needed
    4. Select output format - CSV, JSON, SQL INSERT, or Python script
    5. Apply realistic patterns - Ensure data looks authentic and valid
    6. Add business constraints - Respect business logic and relationships
    7. Generate or script data - Create executable output
    8. Validate output - Ensure data quality and completeness

    Template: Python Script Output

    import csv
    import json
    from datetime import datetime, timedelta
    import random
    
    # Configuration
    ROWS = $ROWS
    FILENAME = "$DATASET_TYPE.csv"
    
    # Column definitions with realistic value generators
    columns = {
        "id": "auto-increment",
        "name": "first_last_name",
        "email": "email",
        "created_at": "timestamp",
        # Add more columns...
    }
    
    def generate_dataset():
        """Generate realistic dummy dataset"""
        data = []
        for i in range(1, ROWS + 1):
            record = {
                "id": f"U{i:06d}",
                # Generate values based on column definitions
            }
            data.append(record)
        return data
    
    def save_as_csv(data, filename):
        """Save dataset as CSV"""
        with open(filename, 'w', newline='') as f:
            writer = csv.DictWriter(f, fieldnames=data[0].keys())
            writer.writeheader()
            writer.writerows(data)
    
    if __name__ == "__main__":
        dataset = generate_dataset()
        save_as_csv(dataset, FILENAME)
        print(f"Generated {len(dataset)} records in {FILENAME}")
    

    Example Dataset Specification

    Dataset Type: Customer Feedback

    Columns:

    • feedback_id (auto-increment, U001, U002...)
    • customer_name (realistic names)
    • email (valid email format)
    • feedback_date (dates last 90 days)
    • rating (1-5 stars)
    • category (Bug, Feature Request, Complaint, Praise)
    • text (realistic feedback)
    • product (electronics, clothing, home)

    Constraints:

    • Ratings skewed: 40% 5-star, 30% 4-star, 20% 3-star, 10% 1-2 star
    • Bug category only with ratings 1-3
    • Feature requests only with ratings 3-5
    • Email domains realistic (gmail, yahoo, company.com)

    Output Deliverables

    • Ready-to-execute Python script OR direct data file
    • CSV file with proper headers and formatting
    • JSON file with valid structure and types
    • SQL INSERT statements for database population
    • Data validation and constraint compliance
    • Realistic, business-appropriate values
    • Documentation of data generation logic
    • Quick-start instructions for using the dataset

    Output Formats

    CSV: Flat tabular format, easy to import into spreadsheets and databases

    JSON: Nested structure, ideal for APIs and NoSQL databases

    SQL: INSERT statements, directly executable on relational databases

    Python Script: Executable generator for custom or large datasets

    Reproducido de phuryn/pm-skills bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Variables de entorno:DATASET_TYPEROWS

    Detalles

    Creador
    phuryn
    Categoría
    Testing y QA
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Repositorio
    phuryn/pm-skills
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de phuryn/pm-skills

    Este repo incluye 68 skills. Si instalas uno, normalmente ya tienes los demás.

    Método para encontrar la brecha entre lo que un sistema debería hacer y lo que el código realmente hace, el tipo de bug que los escáneres genéricos no ven por falta de un modelo de intención.

    Costo de contexto al activarse
    954 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    seguridad

    Conjunto de documentación que hace revisable una app construida con IA antes de lanzarla: arquitectura, flujos de usuario/permisos, permisos, variables/secretos y cobertura de tests, más docs condicionales.

    Costo de contexto al activarse
    2.2k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    documentos

    Hace de red-team de un PRD, roadmap o estrategia: ataca sus supuestos críticos antes de que lo haga la realidad. Defiende y ataca cada afirmación, prioriza por impacto x probabilidad x coste y da el test más barato.

    Costo de contexto al activarse
    1.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 2 meses
    productividad

    Analiza resultados de tests A/B con significancia estadística, validación del tamaño de muestra, intervalos de confianza y recomendaciones de ship/extend/stop al evaluar experimentos.

    Costo de contexto al activarse
    897 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    datos analitica

    Analiza y prioriza una lista de solicitudes de funcionalidades por tema, alineación estratégica, impacto, esfuerzo y riesgo. Se usa al revisar peticiones de clientes o priorizar el backlog.

    Costo de contexto al activarse
    569 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    productividad

    Genera un análisis de matriz de Ansoff que mapea estrategias de crecimiento entre penetración de mercado, desarrollo de mercado, desarrollo de producto y diversificación.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    marketing

    Skills relacionados

    Crea escenarios de prueba completos a partir de user stories, con objetivo de la prueba, condiciones iniciales, rol de usuario, pasos y resultados esperados.

    Costo de contexto al activarse
    868 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    testing qa

    Analiza resultados de tests A/B con significancia estadística, validación del tamaño de muestra, intervalos de confianza y recomendaciones de ship/extend/stop al evaluar experimentos.

    Costo de contexto al activarse
    897 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    datos analitica

    Analiza y prioriza una lista de solicitudes de funcionalidades por tema, alineación estratégica, impacto, esfuerzo y riesgo. Se usa al revisar peticiones de clientes o priorizar el backlog.

    Costo de contexto al activarse
    569 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    productividad