# Similarity Search Patterns > Implementa búsqueda por similitud eficiente con bases de datos vectoriales; útil para búsqueda semántica, consultas de vecinos más cercanos u optimización de retrieval. Fuente: https://skillsagentes.com/skills/wshobson/agents/similarity-search-patterns Markdown: https://skillsagentes.com/skills/wshobson/agents/similarity-search-patterns.md Repositorio: https://github.com/wshobson/agents Autor: wshobson Licencia: MIT Actualizado: hace 4 meses Coste de contexto: 43 tok instalada, 694 tok al activarse, 4.5k tok con todos los archivos del bundle Bundle: 2 archivos, 18 KB Permisos que pide: ninguno declarado ## Instalación Un skill son archivos markdown: los mismos archivos valen para cualquier agente y lo único que cambia es el directorio de destino, es decir la bandera `--agent`. Añade `-g` para instalarlo en todos los proyectos de la máquina. ```bash # Claude Code npx -y skills add wshobson/agents --skill similarity-search-patterns --agent claude-code # Cursor npx -y skills add wshobson/agents --skill similarity-search-patterns --agent cursor # Codex npx -y skills add wshobson/agents --skill similarity-search-patterns --agent codex # Gemini CLI npx -y skills add wshobson/agents --skill similarity-search-patterns --agent gemini # Windsurf npx -y skills add wshobson/agents --skill similarity-search-patterns --agent windsurf # Cline npx -y skills add wshobson/agents --skill similarity-search-patterns --agent cline ``` ## Qué hace - Explica métricas de distancia (coseno, euclidiana, dot product, Manhattan) y cuándo usar cada una - Describe tipos de índice (Flat, HNSW, IVF+PQ) con sus tradeoffs de velocidad y recall - Da buenas prácticas para tuning, hybrid search, pre-filtrado y monitoreo de recall - Remite a references/details.md para templates y ejemplos detallados ## Cuándo usarla - Construir sistemas de búsqueda semántica - Implementar retrieval para RAG - Crear motores de recomendación - Optimizar latencia de búsqueda o escalar a millones de vectores ## Qué la activa - "Ayúdame a elegir un índice vectorial para mi búsqueda semántica" - "¿Qué métrica de distancia debo usar para mis embeddings?" - "Necesito optimizar la latencia de mi RAG con millones de vectores" - "Cómo combinar búsqueda semántica y por palabras clave" ## Archivos - SKILL.md — 3 KB - references/details.md — 15 KB ## SKILL.md Reproducido tal cual desde wshobson/agents bajo MIT. Esta sección es el documento original y está en inglés. # Similarity Search Patterns Patterns for implementing efficient similarity search in production systems. ## When to Use This Skill - Building semantic search systems - Implementing RAG retrieval - Creating recommendation engines - Optimizing search latency - Scaling to millions of vectors - Combining semantic and keyword search ## Core Concepts ### 1. Distance Metrics | Metric | Formula | Best For | | ------------------ | ------------------ | --------------------- | --- | -------------- | | **Cosine** | 1 - (A·B)/(‖A‖‖B‖) | Normalized embeddings | | **Euclidean (L2)** | √Σ(a-b)² | Raw embeddings | | **Dot Product** | A·B | Magnitude matters | | **Manhattan (L1)** | Σ | a-b | | Sparse vectors | ### 2. Index Types ``` ┌─────────────────────────────────────────────────┐ │ Index Types │ ├─────────────┬───────────────┬───────────────────┤ │ Flat │ HNSW │ IVF+PQ │ │ (Exact) │ (Graph-based) │ (Quantized) │ ├─────────────┼───────────────┼───────────────────┤ │ O(n) search │ O(log n) │ O(√n) │ │ 100% recall │ ~95-99% │ ~90-95% │ │ Small data │ Medium-Large │ Very Large │ └─────────────┴───────────────┴───────────────────┘ ``` ## Templates and detailed worked examples Full template library and detailed worked examples live in `references/details.md`. Read that file when you need the concrete templates. ## Best Practices ### Do's - **Use appropriate index** - HNSW for most cases - **Tune parameters** - ef_search, nprobe for recall/speed - **Implement hybrid search** - Combine with keyword search - **Monitor recall** - Measure search quality - **Pre-filter when possible** - Reduce search space ### Don'ts - **Don't skip evaluation** - Measure before optimizing - **Don't over-index** - Start with flat, scale up - **Don't ignore latency** - P99 matters for UX - **Don't forget costs** - Vector storage adds up ## Dónde encaja - Categoría: [Datos y analítica](https://skillsagentes.com/categorias/datos-analitica.md) — Consulta, limpia y visualiza datos sin salir del agente. - Creador: [wshobson](https://skillsagentes.com/creators/wshobson.md) — 183 skills en el directorio - [Todas las skills](https://skillsagentes.com/skills.md) - [Ranking de instalaciones](https://skillsagentes.com/ranking.md) ## Otras skills del mismo repositorio - [Hermes Tweet](https://skillsagentes.com/skills/wshobson/agents/hermes-tweet.md): Instala y opera Hermes Tweet, un plugin de Hermes Agent para investigar X/Twitter, leer timelines, analizar tweets y ejecutar operaciones privadas o de cambio de estado con aprobación previa. - [Superself](https://skillsagentes.com/skills/wshobson/agents/superself.md): Úsalo cuando un proyecto guarda su estado en Superself: lee `self context` al iniciar sesión, vincula el trabajo a una work unit, reporta con evidencia y registra decisiones confirmadas. - [Grounded Vault](https://skillsagentes.com/skills/wshobson/agents/grounded-vault.md): Úsalo para mantener un almacén Markdown de conocimiento donde cada afirmación compilada se rastrea hasta una fuente inmutable y el drift se detecta con git diff sin gastar tokens. - [Postgresql Table Design](https://skillsagentes.com/skills/wshobson/agents/postgresql-table-design.md): Úsalo al diseñar o revisar un esquema específico de PostgreSQL: buenas prácticas, tipos de datos, indexación, restricciones, patrones de rendimiento y funciones avanzadas. - [Prompt Engineering Patterns](https://skillsagentes.com/skills/wshobson/agents/prompt-engineering-patterns.md): Úsalo cuando pidan optimizar un prompt, mejorar su rendimiento, diseñar una plantilla, aplicar chain-of-thought, few-shot prompting o técnicas avanzadas de prompt engineering para producción. ## Skills relacionadas - [Backtesting Frameworks](https://skillsagentes.com/skills/wshobson/agents/backtesting-frameworks.md): Construye sistemas de backtesting robustos para estrategias de trading, manejando correctamente look-ahead bias, survivorship bias y costes de transacción. - [Spark Optimization](https://skillsagentes.com/skills/wshobson/agents/spark-optimization.md): Optimiza jobs de Apache Spark con particionamiento, caching, optimización de shuffle y ajuste de memoria, para mejorar rendimiento y escalar pipelines. - [Ml Pipeline Workflow](https://skillsagentes.com/skills/wshobson/agents/ml-pipeline-workflow.md): Construye pipelines MLOps de extremo a extremo: preparación de datos, entrenamiento, validación y despliegue en producción del modelo. - [Embedding Strategies](https://skillsagentes.com/skills/wshobson/agents/embedding-strategies.md): Selecciona y optimiza modelos de embeddings para búsqueda semántica y aplicaciones RAG, incluyendo estrategias de chunking y ajuste por dominio. - [Dbt Transformation Patterns](https://skillsagentes.com/skills/wshobson/agents/dbt-transformation-patterns.md): Domina dbt para ingeniería analítica: organización de modelos, testing, documentación y estrategias incrementales para transformaciones de datos. --- Skills Agentes · [Índice de páginas en markdown](https://skillsagentes.com/sitemap.md) · [Inicio](https://skillsagentes.com/index.md)