Skills Agentes

Worker Benchmarks

Ejecuta benchmarks completos de rendimiento del sistema de workers de agentic-flow y análisis de optimización.

Estrellas
69.4k

en todo el repo

Actividad
44

0–100, la ruta de este skill

Actualizado
hace 3 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
1.1k tok

17 tok en reposo

Paquete
1 archivo

4 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add ruvnet/ruflo --skill worker-benchmarks --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Ejecuta benchmarks del sistema de workers de agentic-flow: detección de triggers, registro, selección de agentes, caché de modelos y workers concurrentes.
  • Compara cada métrica contra un umbral objetivo (p95 en ms) y muestra throughput, memoria y aprobados/fallidos.
  • Expone los umbrales configurables en .claude/settings.json bajo performance.benchmarkThresholds.

Úsalo cuando

  • Quieres medir el rendimiento del sistema de workers de agentic-flow.
  • Necesitas verificar que las operaciones cumplen los umbrales de latencia definidos.

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Ejecuta el benchmark completo de workers de agentic-flow
    • Corre el benchmark de detección de triggers

    SKILL.md

    En inglés

    Worker Benchmarks Skill

    Run comprehensive performance benchmarks for the agentic-flow worker system.

    Quick Start

    # Run full benchmark suite
    npx agentic-flow workers benchmark
    
    # Run specific benchmark
    npx agentic-flow workers benchmark --type trigger-detection
    npx agentic-flow workers benchmark --type registry
    npx agentic-flow workers benchmark --type agent-selection
    npx agentic-flow workers benchmark --type concurrent
    

    Benchmark Types

    1. Trigger Detection (trigger-detection)

    Tests keyword detection speed across 12 worker triggers.

    • Target: p95 < 5ms
    • Iterations: 1000
    • Metrics: latency, throughput, histogram

    2. Worker Registry (registry)

    Tests CRUD operations on worker entries.

    • Target: p95 < 10ms
    • Iterations: 500 creates, gets, updates
    • Metrics: per-operation latency breakdown

    3. Agent Selection (agent-selection)

    Tests performance-based agent selection.

    • Target: p95 < 1ms
    • Iterations: 1000
    • Metrics: selection confidence, agent scores

    4. Model Cache (cache)

    Tests model caching performance.

    • Target: p95 < 0.5ms
    • Metrics: hit rate, cache size, eviction stats

    5. Concurrent Workers (concurrent)

    Tests parallel worker creation and updates.

    • Target: < 1000ms for 10 workers
    • Metrics: per-worker latency, memory usage

    6. Memory Key Generation (memory-keys)

    Tests memory pattern key generation.

    • Target: p95 < 0.1ms
    • Iterations: 5000
    • Metrics: unique patterns, throughput

    Output Format

    ═══════════════════════════════════════════════════════════
    📈 BENCHMARK RESULTS
    ═══════════════════════════════════════════════════════════
    
    ✅ Trigger Detection
       Operation: detect
       Count: 1,000
       Avg: 0.045ms | p95: 0.120ms (target: 5ms)
       Throughput: 22,222 ops$s
       Memory Δ: 0.12MB
    
    ✅ Worker Registry
       Operation: crud
       Count: 1,500
       Avg: 1.234ms | p95: 3.456ms (target: 10ms)
       Throughput: 810 ops$s
       Memory Δ: 2.34MB
    
    ───────────────────────────────────────────────────────────
    📊 SUMMARY
    ───────────────────────────────────────────────────────────
    Total Tests: 6
    Passed: 6 | Failed: 0
    Avg Latency: 0.567ms
    Total Duration: 2345ms
    Peak Memory: 8.90MB
    ═══════════════════════════════════════════════════════════
    

    Integration with Settings

    Benchmark thresholds are configured in .claude$settings.json:

    {
      "performance": {
        "benchmarkThresholds": {
          "triggerDetection": { "p95Ms": 5 },
          "workerRegistry": { "p95Ms": 10 },
          "agentSelection": { "p95Ms": 1 },
          "memoryKeyGeneration": { "p95Ms": 0.1 },
          "concurrentWorkers": { "totalMs": 1000 }
        }
      }
    }
    

    Programmatic Usage

    import { workerBenchmarks, runBenchmarks } from 'agentic-flow$workers$worker-benchmarks';
    
    // Run full suite
    const suite = await runBenchmarks();
    console.log(suite.summary);
    
    // Run individual benchmarks
    const triggerResult = await workerBenchmarks.benchmarkTriggerDetection(1000);
    const registryResult = await workerBenchmarks.benchmarkRegistryOperations(500);
    

    Performance Optimization Tips

    1. Model Cache: Enable with CLAUDE_FLOW_MODEL_CACHE_MB=512
    2. Parallel Workers: Enable with CLAUDE_FLOW_WORKER_PARALLEL=true
    3. Warning Suppression: Enable with CLAUDE_FLOW_SUPPRESS_WARNINGS=true
    4. SQLite WAL Mode: Automatic for better concurrent performance

    Reproducido de ruvnet/ruflo bajo licencia MIT. Leer esta página en markdown.

    Archivos

    1 archivo en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Requiere el CLI npx agentic-flow y opcionalmente variables de entorno como CLAUDE_FLOW_MODEL_CACHE_MB.

    Necesita en el PATH:npx

    Detalles

    Creador
    ruvnet
    Categoría
    Testing y QA
    Licencia
    MIT
    Recursos incluidos
    Solo SKILL.md
    Repositorio
    ruvnet/ruflo
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de ruvnet/ruflo

    Este repo incluye 275 skills. Si instalas uno, normalmente ya tienes los demás.

    Inspecciona y audita genomas GEPA: carga y valida un genoma, renderiza el system prompt que compila, o clasifica los modos de fallo de una transcripción de ejecución.

    Costo de contexto al activarse
    833 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    herramientas desarrollo

    Completion de un solo turno contra el modelo deepseek-chat de DeepSeek vía /v1/chat/completions. Lee DEEPSEEK_API_KEY y degrada con status:degraded si falta o la API no responde. Para tareas sin razonamiento.

    Costo de contexto al activarse
    566 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Completion en modo razonamiento contra deepseek-reasoner (R1) de DeepSeek. Devuelve el chain-of-thought por separado de la respuesta final. Lee DEEPSEEK_API_KEY y degrada si falta o la API no responde.

    Costo de contexto al activarse
    627 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 4 días
    Permisos
    automatizacion

    Construye o reconstruye el índice de ADRs y su grafo de dependencias ejecutando scripts/import.mjs, en vez de cientos de llamadas MCP.

    Costo de contexto al activarse
    866 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Crea un nuevo Architecture Decision Record con numeración secuencial y registro en AgentDB.

    Costo de contexto al activarse
    680 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 27 días
    herramientas desarrollo

    Muestra el estado de la integración AGNTCY/SLIM/CASA: si los paquetes están instalados, qué transporte está activo y si el enforcement de CASA está habilitado.

    Costo de contexto al activarse
    443 tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 26 días
    devops infraestructura

    Skills relacionados

    Agente de benchmarking de rendimiento exhaustivo: detección de regresiones y validación de rendimiento mediante pruebas automatizadas de carga, estrés y escalabilidad.

    Costo de contexto al activarse
    4.9k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa

    Agente avanzado de análisis de calidad de código para revisiones y mejoras exhaustivas del código.

    Costo de contexto al activarse
    1.5k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa

    Despliega agentes de IA especializados para realizar revisiones de código exhaustivas e inteligentes que van más allá del análisis estático tradicional.

    Costo de contexto al activarse
    3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 6 meses
    testing qa