ASD

Llm Evaluation

Implementa estrategias de evaluación integrales para aplicaciones LLM usando métricas automatizadas, feedback humano y benchmarking, útil para medir la calidad de sistemas de IA.

Estrellas
38.8k

en todo el repo

Actividad
56

0–100, la ruta de este skill

Actualizado
el mes pasado

último commit aquí

Commits
2

últimos 90 días

Contexto
982 tok

58 tok en reposo

Paquete
2 archivos

18 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add wshobson/agents --skill llm-evaluation --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Proporciona marcos y código para evaluar aplicaciones LLM con métricas automatizadas, evaluación humana y LLM-as-judge
  • Incluye implementación en Python de una EvaluationSuite con métricas como accuracy, BLEU y BERTScore
  • Cubre métricas específicas para generación de texto, clasificación y sistemas de recuperación (RAG)

Úsalo cuando

  • Medir el rendimiento de una aplicación LLM de forma sistemática
  • Comparar distintos modelos o prompts
  • Detectar regresiones de rendimiento antes del despliegue
  • Establecer líneas base y hacer seguimiento del progreso en el tiempo

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Ayúdame a montar un framework de evaluación para mi aplicación LLM
    • Necesito comparar dos prompts distintos con métricas automatizadas
    • Quiero detectar regresiones antes de desplegar un cambio en el modelo

    SKILL.md

    En inglés

    LLM Evaluation

    Master comprehensive evaluation strategies for LLM applications, from automated metrics to human evaluation and A/B testing.

    When to Use This Skill

    • Measuring LLM application performance systematically
    • Comparing different models or prompts
    • Detecting performance regressions before deployment
    • Validating improvements from prompt changes
    • Building confidence in production systems
    • Establishing baselines and tracking progress over time
    • Debugging unexpected model behavior

    Core Evaluation Types

    1. Automated Metrics

    Fast, repeatable, scalable evaluation using computed scores.

    Text Generation:

    • BLEU: N-gram overlap (translation)
    • ROUGE: Recall-oriented (summarization)
    • METEOR: Semantic similarity
    • BERTScore: Embedding-based similarity
    • Perplexity: Language model confidence

    Classification:

    • Accuracy: Percentage correct
    • Precision/Recall/F1: Class-specific performance
    • Confusion Matrix: Error patterns
    • AUC-ROC: Ranking quality

    Retrieval (RAG):

    • MRR: Mean Reciprocal Rank
    • NDCG: Normalized Discounted Cumulative Gain
    • Precision@K: Relevant in top K
    • Recall@K: Coverage in top K

    2. Human Evaluation

    Manual assessment for quality aspects difficult to automate.

    Dimensions:

    • Accuracy: Factual correctness
    • Coherence: Logical flow
    • Relevance: Answers the question
    • Fluency: Natural language quality
    • Safety: No harmful content
    • Helpfulness: Useful to the user

    3. LLM-as-Judge

    Use stronger LLMs to evaluate weaker model outputs.

    Approaches:

    • Pointwise: Score individual responses
    • Pairwise: Compare two responses
    • Reference-based: Compare to gold standard
    • Reference-free: Judge without ground truth

    Quick Start

    from dataclasses import dataclass
    from typing import Callable
    import numpy as np
    
    @dataclass
    class Metric:
        name: str
        fn: Callable
    
        @staticmethod
        def accuracy():
            return Metric("accuracy", calculate_accuracy)
    
        @staticmethod
        def bleu():
            return Metric("bleu", calculate_bleu)
    
        @staticmethod
        def bertscore():
            return Metric("bertscore", calculate_bertscore)
    
        @staticmethod
        def custom(name: str, fn: Callable):
            return Metric(name, fn)
    
    class EvaluationSuite:
        def __init__(self, metrics: list[Metric]):
            self.metrics = metrics
    
        async def evaluate(self, model, test_cases: list[dict]) -> dict:
            results = {m.name: [] for m in self.metrics}
    
            for test in test_cases:
                prediction = await model.predict(test["input"])
    
                for metric in self.metrics:
                    score = metric.fn(
                        prediction=prediction,
                        reference=test.get("expected"),
                        context=test.get("context")
                    )
                    results[metric.name].append(score)
    
            return {
                "metrics": {k: np.mean(v) for k, v in results.items()},
                "raw_scores": results
            }
    
    # Usage
    suite = EvaluationSuite([
        Metric.accuracy(),
        Metric.bleu(),
        Metric.bertscore(),
        Metric.custom("groundedness", check_groundedness)
    ])
    
    test_cases = [
        {
            "input": "What is the capital of France?",
            "expected": "Paris",
            "context": "France is a country in Europe. Paris is its capital."
        },
    ]
    
    results = await suite.evaluate(model=your_model, test_cases=test_cases)
    

    Detailed patterns and worked examples

    Detailed pattern documentation lives in references/details.md. Read that file when the navigation tier above is insufficient.

    Reproducido de wshobson/agents bajo licencia MIT. Leer esta página en markdown.

    Archivos

    2 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Detalles

    Creador
    wshobson
    Categoría
    Testing y QA
    Licencia
    MIT
    Recursos incluidos
    referencias
    Repositorio
    wshobson/agents
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de wshobson/agents

    Este repo incluye 180 skills. Si instalas uno, normalmente ya tienes los demás.

    Úsalo al seleccionar y colocar iconos, imágenes, SVGs, diagramas o infografías de apoyo aprobados en un PPTX editable.

    Costo de contexto al activarse
    344 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo cuando pidan optimizar un prompt, mejorar su rendimiento, diseñar una plantilla, aplicar chain-of-thought, few-shot prompting o técnicas avanzadas de prompt engineering para producción.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    10 archivos
    Última actualización
    el mes pasado
    herramientas desarrollo

    Úsalo al redactar o reparar una especificación JSON con coordenadas explícitas para un PPTX editable.

    Costo de contexto al activarse
    489 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo para validar o reparar un PPTX editable en cuanto a geometría, accesibilidad, editabilidad nativa, linaje de fuente e integridad del paquete OOXML.

    Costo de contexto al activarse
    409 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo para analizar un PPTX de referencia en modo solo lectura: estructura, tema, tipografía, ritmo de layout, diagnósticos, catálogos de plantillas derivados o inspección segura del paquete OOXML.

    Costo de contexto al activarse
    689 tok
    Tamaño del paquete
    8 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo al preparar la narrativa, las fuentes y el contexto de diseño para un nuevo deck PPTX editable.

    Costo de contexto al activarse
    415 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Skills relacionados

    Testea contratos inteligentes de forma exhaustiva con Hardhat y Foundry: tests unitarios, de integración y forking de mainnet.

    Costo de contexto al activarse
    2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 2 meses
    testing qa

    Realiza auditorías de accesibilidad WCAG 2.2 con pruebas automatizadas, verificación manual y guía de remediación. Útil para auditar sitios, corregir violaciones y aplicar patrones de diseño accesible.

    Costo de contexto al activarse
    628 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 2 meses
    testing qa

    Prueba workflows de Temporal con pytest, time-skipping y estrategias de mocking: testing unitario, de integración, de replay y configuración de desarrollo local.

    Costo de contexto al activarse
    1.2k tok
    Tamaño del paquete
    5 archivos
    Última actualización
    hace 3 meses
    testing qa