Skills Agentes

Ab Test Analysis

Analiza resultados de tests A/B con significancia estadística, validación del tamaño de muestra, intervalos de confianza y recomendaciones de ship/extend/stop al evaluar experimentos.

Estrellas
25.6k

en todo el repo

Actividad
31

0–100, la ruta de este skill

Actualizado
hace 5 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
897 tok

72 tok en reposo

Paquete
1 archivo

4 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add phuryn/pm-skills --skill ab-test-analysis --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Valida el tamaño de muestra, la duración y la randomización del test antes de analizarlo
  • Calcula tasa de conversión, lift relativo, p-value e intervalo de confianza al 95%
  • Revisa métricas guardrail para detectar si una mejora en la métrica principal esconde una regresión
  • Genera scripts de Python para los cálculos estadísticos si el usuario aporta datos en bruto
  • Da una recomendación final: Ship, Extend, Stop, Investigate o no lanzar

Úsalo cuando

  • Evaluar los resultados de un experimento A/B
  • Comprobar si un test alcanzó significancia estadística
  • Interpretar datos de un split test
  • Decidir si lanzar una variante al 100%

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Analiza los resultados de este test A/B
    • Este experimento ha alcanzado significancia estadística
    • Debería lanzar esta variante o extender el test
    • Interpreta estos datos del split test

    SKILL.md

    En inglés

    A/B Test Analysis

    Evaluate A/B test results with statistical rigor and translate findings into clear product decisions.

    Context

    You are analyzing A/B test results for $ARGUMENTS.

    If the user provides data files (CSV, Excel, or analytics exports), read and analyze them directly. Generate Python scripts for statistical calculations when needed.

    Instructions

    1. Understand the experiment:

      • What was the hypothesis?
      • What was changed (the variant)?
      • What is the primary metric? Any guardrail metrics?
      • How long did the test run?
      • What is the traffic split?
    2. Validate the test setup:

      • Sample size: Is the sample large enough for the expected effect size?
        • Use the formula: n = (Z²α/2 × 2 × p × (1-p)) / MDE²
        • Flag if the test is underpowered (<80% power)
      • Duration: Did the test run for at least 1-2 full business cycles?
      • Randomization: Any evidence of sample ratio mismatch (SRM)?
      • Novelty/primacy effects: Was there enough time to wash out initial behavior changes?
    3. Calculate statistical significance:

      • Conversion rate for control and variant
      • Relative lift: (variant - control) / control × 100
      • p-value: Using a two-tailed z-test or chi-squared test
      • Confidence interval: 95% CI for the difference
      • Statistical significance: Is p < 0.05?
      • Practical significance: Is the lift meaningful for the business?

      If the user provides raw data, generate and run a Python script to calculate these.

    4. Check guardrail metrics:

      • Did any guardrail metrics (revenue, engagement, page load time) degrade?
      • A winning primary metric with degraded guardrails may not be a true win
    5. Interpret results:

      Outcome Recommendation
      Significant positive lift, no guardrail issues Ship it — roll out to 100%
      Significant positive lift, guardrail concerns Investigate — understand trade-offs before shipping
      Not significant, positive trend Extend the test — need more data or larger effect
      Not significant, flat Stop the test — no meaningful difference detected
      Significant negative lift Don't ship — revert to control, analyze why
    6. Provide the analysis summary:

      ## A/B Test Results: [Test Name]
      
      **Hypothesis**: [What we expected]
      **Duration**: [X days] | **Sample**: [N control / M variant]
      
      | Metric | Control | Variant | Lift | p-value | Significant? |
      |---|---|---|---|---|---|
      | [Primary] | X% | Y% | +Z% | 0.0X | Yes/No |
      | [Guardrail] | ... | ... | ... | ... | ... |
      
      **Recommendation**: [Ship / Extend / Stop / Investigate]
      **Reasoning**: [Why]
      **Next steps**: [What to do]
      

    Think step by step. Save as markdown. Generate Python scripts for calculations if raw data is provided.


    Further Reading

    Reproducido de phuryn/pm-skills bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Detalles

    Creador
    phuryn
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Repositorio
    phuryn/pm-skills
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de phuryn/pm-skills

    Este repo incluye 68 skills. Si instalas uno, normalmente ya tienes los demás.

    Método para encontrar la brecha entre lo que un sistema debería hacer y lo que el código realmente hace, el tipo de bug que los escáneres genéricos no ven por falta de un modelo de intención.

    Costo de contexto al activarse
    954 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    seguridad

    Conjunto de documentación que hace revisable una app construida con IA antes de lanzarla: arquitectura, flujos de usuario/permisos, permisos, variables/secretos y cobertura de tests, más docs condicionales.

    Costo de contexto al activarse
    2.2k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    el mes pasado
    documentos

    Hace de red-team de un PRD, roadmap o estrategia: ataca sus supuestos críticos antes de que lo haga la realidad. Defiende y ataca cada afirmación, prioriza por impacto x probabilidad x coste y da el test más barato.

    Costo de contexto al activarse
    1.1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 2 meses
    productividad

    Analiza y prioriza una lista de solicitudes de funcionalidades por tema, alineación estratégica, impacto, esfuerzo y riesgo. Se usa al revisar peticiones de clientes o priorizar el backlog.

    Costo de contexto al activarse
    569 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    productividad

    Genera un análisis de matriz de Ansoff que mapea estrategias de crecimiento entre penetración de mercado, desarrollo de mercado, desarrollo de producto y diversificación.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    marketing

    Identifica el primer segmento de mercado beachhead para el lanzamiento de un producto. Evalúa segmentos por dolor urgente, disposición a pagar, cuota de mercado ganable y potencial de referidos.

    Costo de contexto al activarse
    1.5k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    marketing

    Skills relacionados

    Realiza análisis de cohortes sobre datos de engagement de usuarios: curvas de retención, tendencias de adopción de funcionalidades e insights a nivel de segmento.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    datos analitica

    Define y diseña un dashboard de métricas de producto con las métricas clave, fuentes de datos, tipos de visualización y umbrales de alerta. Úsalo para definir KPIs o montar un plan de monitoreo de datos.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    datos analitica

    Define una North Star Metric y de 3 a 5 métricas de entrada que forman una constelación de métricas. Clasifica el juego de negocio (Atención, Transacción, Productividad) y valida contra 7 criterios.

    Costo de contexto al activarse
    1k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    datos analitica