ASD

Similarity Search Patterns

Implementa búsqueda por similitud eficiente con bases de datos vectoriales; útil para búsqueda semántica, consultas de vecinos más cercanos u optimización de retrieval.

Estrellas
38.8k

en todo el repo

Actividad
47

0–100, la ruta de este skill

Actualizado
hace 2 meses

último commit aquí

Commits
1

últimos 90 días

Contexto
694 tok

43 tok en reposo

Paquete
2 archivos

18 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add wshobson/agents --skill similarity-search-patterns --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Explica métricas de distancia (coseno, euclidiana, dot product, Manhattan) y cuándo usar cada una
  • Describe tipos de índice (Flat, HNSW, IVF+PQ) con sus tradeoffs de velocidad y recall
  • Da buenas prácticas para tuning, hybrid search, pre-filtrado y monitoreo de recall
  • Remite a references/details.md para templates y ejemplos detallados

Úsalo cuando

  • Construir sistemas de búsqueda semántica
  • Implementar retrieval para RAG
  • Crear motores de recomendación
  • Optimizar latencia de búsqueda o escalar a millones de vectores

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • Ayúdame a elegir un índice vectorial para mi búsqueda semántica
    • ¿Qué métrica de distancia debo usar para mis embeddings?
    • Necesito optimizar la latencia de mi RAG con millones de vectores
    • Cómo combinar búsqueda semántica y por palabras clave

    SKILL.md

    En inglés

    Similarity Search Patterns

    Patterns for implementing efficient similarity search in production systems.

    When to Use This Skill

    • Building semantic search systems
    • Implementing RAG retrieval
    • Creating recommendation engines
    • Optimizing search latency
    • Scaling to millions of vectors
    • Combining semantic and keyword search

    Core Concepts

    1. Distance Metrics

    | Metric | Formula | Best For | | ------------------ | ------------------ | --------------------- | --- | -------------- | | Cosine | 1 - (A·B)/(‖A‖‖B‖) | Normalized embeddings | | Euclidean (L2) | √Σ(a-b)² | Raw embeddings | | Dot Product | A·B | Magnitude matters | | Manhattan (L1) | Σ | a-b | | Sparse vectors |

    2. Index Types

    ┌─────────────────────────────────────────────────┐
    │                 Index Types                      │
    ├─────────────┬───────────────┬───────────────────┤
    │    Flat     │     HNSW      │    IVF+PQ         │
    │ (Exact)     │ (Graph-based) │ (Quantized)       │
    ├─────────────┼───────────────┼───────────────────┤
    │ O(n) search │ O(log n)      │ O(√n)             │
    │ 100% recall │ ~95-99%       │ ~90-95%           │
    │ Small data  │ Medium-Large  │ Very Large        │
    └─────────────┴───────────────┴───────────────────┘
    

    Templates and detailed worked examples

    Full template library and detailed worked examples live in references/details.md. Read that file when you need the concrete templates.

    Best Practices

    Do's

    • Use appropriate index - HNSW for most cases
    • Tune parameters - ef_search, nprobe for recall/speed
    • Implement hybrid search - Combine with keyword search
    • Monitor recall - Measure search quality
    • Pre-filter when possible - Reduce search space

    Don'ts

    • Don't skip evaluation - Measure before optimizing
    • Don't over-index - Start with flat, scale up
    • Don't ignore latency - P99 matters for UX
    • Don't forget costs - Vector storage adds up

    Reproducido de wshobson/agents bajo licencia MIT. Leer esta página en markdown.

    Archivos

    2 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Detalles

    Creador
    wshobson
    Licencia
    MIT
    Recursos incluidos
    referencias
    Repositorio
    wshobson/agents
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de wshobson/agents

    Este repo incluye 180 skills. Si instalas uno, normalmente ya tienes los demás.

    Úsalo al seleccionar y colocar iconos, imágenes, SVGs, diagramas o infografías de apoyo aprobados en un PPTX editable.

    Costo de contexto al activarse
    344 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo cuando pidan optimizar un prompt, mejorar su rendimiento, diseñar una plantilla, aplicar chain-of-thought, few-shot prompting o técnicas avanzadas de prompt engineering para producción.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    10 archivos
    Última actualización
    el mes pasado
    herramientas desarrollo

    Úsalo al redactar o reparar una especificación JSON con coordenadas explícitas para un PPTX editable.

    Costo de contexto al activarse
    489 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo para validar o reparar un PPTX editable en cuanto a geometría, accesibilidad, editabilidad nativa, linaje de fuente e integridad del paquete OOXML.

    Costo de contexto al activarse
    409 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo para analizar un PPTX de referencia en modo solo lectura: estructura, tema, tipografía, ritmo de layout, diagnósticos, catálogos de plantillas derivados o inspección segura del paquete OOXML.

    Costo de contexto al activarse
    689 tok
    Tamaño del paquete
    8 archivos
    Última actualización
    hace 26 días
    documentos

    Úsalo al preparar la narrativa, las fuentes y el contexto de diseño para un nuevo deck PPTX editable.

    Costo de contexto al activarse
    415 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 26 días
    documentos

    Skills relacionados

    Construye pipelines MLOps de extremo a extremo: preparación de datos, entrenamiento, validación y despliegue en producción del modelo.

    Costo de contexto al activarse
    1.8k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 5 meses
    datos analitica

    Combina búsqueda vectorial y por palabras clave para mejorar la recuperación. Útil al implementar RAG, motores de búsqueda o cuando ningún enfoque solo basta.

    Costo de contexto al activarse
    508 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 2 meses
    datos analitica

    Transforma datos en narrativas persuasivas usando visualización, contexto y estructura. Útil al presentar analíticas a stakeholders, crear reportes o presentaciones ejecutivas.

    Costo de contexto al activarse
    530 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 2 meses
    datos analitica