Skills Agentes

Llm Evaluation

Implementa estrategias de evaluación integrales para aplicaciones LLM usando métricas automatizadas, feedback humano y benchmarking, útil para medir la calidad de sistemas de IA.

Estrellas
39.8k

en todo el repo

Actividad
51

0–100, la ruta de este skill

Actualizado
hace 2 meses

último commit aquí

Commits
1

últimos 90 días

Contexto
982 tok

58 tok en reposo

Paquete
2 archivos

18 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add wshobson/agents --skill llm-evaluation --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Proporciona marcos y código para evaluar aplicaciones LLM con métricas automatizadas, evaluación humana y LLM-as-judge
  • Incluye implementación en Python de una EvaluationSuite con métricas como accuracy, BLEU y BERTScore
  • Cubre métricas específicas para generación de texto, clasificación y sistemas de recuperación (RAG)

Úsalo cuando

  • Medir el rendimiento de una aplicación LLM de forma sistemática
  • Comparar distintos modelos o prompts
  • Detectar regresiones de rendimiento antes del despliegue
  • Establecer líneas base y hacer seguimiento del progreso en el tiempo

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • “Ayúdame a montar un framework de evaluación para mi aplicación LLM”
    • “Necesito comparar dos prompts distintos con métricas automatizadas”
    • “Quiero detectar regresiones antes de desplegar un cambio en el modelo”

    SKILL.md

    En inglés

    LLM Evaluation

    Master comprehensive evaluation strategies for LLM applications, from automated metrics to human evaluation and A/B testing.

    When to Use This Skill

    • Measuring LLM application performance systematically
    • Comparing different models or prompts
    • Detecting performance regressions before deployment
    • Validating improvements from prompt changes
    • Building confidence in production systems
    • Establishing baselines and tracking progress over time
    • Debugging unexpected model behavior

    Core Evaluation Types

    1. Automated Metrics

    Fast, repeatable, scalable evaluation using computed scores.

    Text Generation:

    • BLEU: N-gram overlap (translation)
    • ROUGE: Recall-oriented (summarization)
    • METEOR: Semantic similarity
    • BERTScore: Embedding-based similarity
    • Perplexity: Language model confidence

    Classification:

    • Accuracy: Percentage correct
    • Precision/Recall/F1: Class-specific performance
    • Confusion Matrix: Error patterns
    • AUC-ROC: Ranking quality

    Retrieval (RAG):

    • MRR: Mean Reciprocal Rank
    • NDCG: Normalized Discounted Cumulative Gain
    • Precision@K: Relevant in top K
    • Recall@K: Coverage in top K

    2. Human Evaluation

    Manual assessment for quality aspects difficult to automate.

    Dimensions:

    • Accuracy: Factual correctness
    • Coherence: Logical flow
    • Relevance: Answers the question
    • Fluency: Natural language quality
    • Safety: No harmful content
    • Helpfulness: Useful to the user

    3. LLM-as-Judge

    Use stronger LLMs to evaluate weaker model outputs.

    Approaches:

    • Pointwise: Score individual responses
    • Pairwise: Compare two responses
    • Reference-based: Compare to gold standard
    • Reference-free: Judge without ground truth

    Quick Start

    from dataclasses import dataclass
    from typing import Callable
    import numpy as np
    
    @dataclass
    class Metric:
        name: str
        fn: Callable
    
        @staticmethod
        def accuracy():
            return Metric("accuracy", calculate_accuracy)
    
        @staticmethod
        def bleu():
            return Metric("bleu", calculate_bleu)
    
        @staticmethod
        def bertscore():
            return Metric("bertscore", calculate_bertscore)
    
        @staticmethod
        def custom(name: str, fn: Callable):
            return Metric(name, fn)
    
    class EvaluationSuite:
        def __init__(self, metrics: list[Metric]):
            self.metrics = metrics
    
        async def evaluate(self, model, test_cases: list[dict]) -> dict:
            results = {m.name: [] for m in self.metrics}
    
            for test in test_cases:
                prediction = await model.predict(test["input"])
    
                for metric in self.metrics:
                    score = metric.fn(
                        prediction=prediction,
                        reference=test.get("expected"),
                        context=test.get("context")
                    )
                    results[metric.name].append(score)
    
            return {
                "metrics": {k: np.mean(v) for k, v in results.items()},
                "raw_scores": results
            }
    
    # Usage
    suite = EvaluationSuite([
        Metric.accuracy(),
        Metric.bleu(),
        Metric.bertscore(),
        Metric.custom("groundedness", check_groundedness)
    ])
    
    test_cases = [
        {
            "input": "What is the capital of France?",
            "expected": "Paris",
            "context": "France is a country in Europe. Paris is its capital."
        },
    ]
    
    results = await suite.evaluate(model=your_model, test_cases=test_cases)
    

    Detailed patterns and worked examples

    Detailed pattern documentation lives in references/details.md. Read that file when the navigation tier above is insufficient.

    Reproducido de wshobson/agents bajo licencia MIT. Leer esta página en markdown.

    Archivos

    2 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Detalles

    Creador
    wshobson
    Categoría
    Testing y QA
    Licencia
    MIT
    Recursos incluidos
    referencias
    Repositorio
    wshobson/agents
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de wshobson/agents

    Este repo incluye 183 skills. Si instalas uno, normalmente ya tienes los demás. Ver el pack agents entero y su comando de instalación

    Instala y opera Hermes Tweet, un plugin de Hermes Agent para investigar X/Twitter, leer timelines, analizar tweets y ejecutar operaciones privadas o de cambio de estado con aprobación previa.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    3 archivos
    Última actualización
    el mes pasado
    redes sociales

    Úsalo para mantener un almacén Markdown de conocimiento donde cada afirmación compilada se rastrea hasta una fuente inmutable y el drift se detecta con git diff sin gastar tokens.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 24 días
    documentos

    Úsalo al diseñar o revisar un esquema específico de PostgreSQL: buenas prácticas, tipos de datos, indexación, restricciones, patrones de rendimiento y funciones avanzadas.

    Costo de contexto al activarse
    2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 24 días
    bases de datos

    Úsalo cuando un proyecto guarda su estado en Superself: lee `self context` al iniciar sesión, vincula el trabajo a una work unit, reporta con evidencia y registra decisiones confirmadas.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 24 días
    productividad

    Úsalo cuando pidan optimizar un prompt, mejorar su rendimiento, diseñar una plantilla, aplicar chain-of-thought, few-shot prompting o técnicas avanzadas de prompt engineering para producción.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    10 archivos
    Última actualización
    el mes pasado
    herramientas desarrollo

    Audita y reescribe prosa para que deje de sonar generada por máquina. Incluye modo solo-detección, modo reescritura y modo edición en el lugar, con perfiles opcionales de voz y contexto.”

    Costo de contexto al activarse
    1.9k tok
    Tamaño del paquete
    4 archivos
    Última actualización
    el mes pasado
    redaccion contenido

    Skills relacionados

    Úsalo tras generar código con IA, aceptar sugerencias o revisar módulos escritos por IA, o cuando el código funcione pero parezca frágil o con deuda oculta.

    Costo de contexto al activarse
    850 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 2 meses
    testing qa

    Domina Bats (Bash Automated Testing System) para probar exhaustivamente scripts de shell, útil en TDD y pipelines CI/CD.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 4 meses
    testing qa

    Filtra checkpoints fine-tuneados con presupuestos de drift, comparación pareada y chequeos de olvido antes de promoverlos, tras un entrenamiento o al re-gatear un modelo ya promovido.

    Costo de contexto al activarse
    2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 2 meses
    testing qa