# Embedding Strategies > Selecciona y optimiza modelos de embeddings para búsqueda semántica y aplicaciones RAG, incluyendo estrategias de chunking y ajuste por dominio. Fuente: https://skillsagentes.com/skills/wshobson/agents/embedding-strategies Markdown: https://skillsagentes.com/skills/wshobson/agents/embedding-strategies.md Repositorio: https://github.com/wshobson/agents Autor: wshobson Licencia: MIT Actualizado: hace 4 meses Coste de contexto: 51 tok instalada, 712 tok al activarse, 4.9k tok con todos los archivos del bundle Bundle: 2 archivos, 19 KB Permisos que pide: ninguno declarado ## Instalación Un skill son archivos markdown: los mismos archivos valen para cualquier agente y lo único que cambia es el directorio de destino, es decir la bandera `--agent`. Añade `-g` para instalarlo en todos los proyectos de la máquina. ```bash # Claude Code npx -y skills add wshobson/agents --skill embedding-strategies --agent claude-code # Cursor npx -y skills add wshobson/agents --skill embedding-strategies --agent cursor # Codex npx -y skills add wshobson/agents --skill embedding-strategies --agent codex # Gemini CLI npx -y skills add wshobson/agents --skill embedding-strategies --agent gemini # Windsurf npx -y skills add wshobson/agents --skill embedding-strategies --agent windsurf # Cline npx -y skills add wshobson/agents --skill embedding-strategies --agent cline ``` ## Qué hace - Compara modelos de embeddings (Voyage, OpenAI, BGE, MiniLM, multilingual-e5) por dimensiones, tokens máximos y caso de uso - Guía el diseño del pipeline de embeddings: chunking, preprocesamiento y elección de modelo - Da buenas prácticas sobre normalización, batching, caché y manejo de límites de tokens ## Cuándo usarla - Elegir modelos de embeddings para RAG - Optimizar estrategias de chunking - Ajustar embeddings para dominios específicos - Comparar rendimiento de modelos de embeddings o reducir dimensiones/manejar contenido multilingüe ## Qué la activa - "¿Qué modelo de embeddings me conviene para un buscador de código?" - "Ayúdame a diseñar la estrategia de chunking para mi RAG" - "Compárame voyage-3-large vs text-embedding-3-large" ## Antes de instalar - Para ejemplos y plantillas detalladas consulta references/details.md. ## Archivos - SKILL.md — 3 KB - references/details.md — 16 KB ## SKILL.md Reproducido tal cual desde wshobson/agents bajo MIT. Esta sección es el documento original y está en inglés. # Embedding Strategies Guide to selecting and optimizing embedding models for vector search applications. ## When to Use This Skill - Choosing embedding models for RAG - Optimizing chunking strategies - Fine-tuning embeddings for domains - Comparing embedding model performance - Reducing embedding dimensions - Handling multilingual content ## Core Concepts ### 1. Embedding Model Comparison (2026) | Model | Dimensions | Max Tokens | Best For | | -------------------------- | ---------- | ---------- | ----------------------------------- | | **voyage-3-large** | 1024 | 32000 | Claude apps (Anthropic recommended) | | **voyage-3** | 1024 | 32000 | Claude apps, cost-effective | | **voyage-code-3** | 1024 | 32000 | Code search | | **voyage-finance-2** | 1024 | 32000 | Financial documents | | **voyage-law-2** | 1024 | 32000 | Legal documents | | **text-embedding-3-large** | 3072 | 8191 | OpenAI apps, high accuracy | | **text-embedding-3-small** | 1536 | 8191 | OpenAI apps, cost-effective | | **bge-large-en-v1.5** | 1024 | 512 | Open source, local deployment | | **all-MiniLM-L6-v2** | 384 | 256 | Fast, lightweight | | **multilingual-e5-large** | 1024 | 512 | Multi-language | ### 2. Embedding Pipeline ``` Document → Chunking → Preprocessing → Embedding Model → Vector ↓ [Overlap, Size] [Clean, Normalize] [API/Local] ``` ## Templates and detailed worked examples Full template library and detailed worked examples live in `references/details.md`. Read that file when you need the concrete templates. ## Best Practices ### Do's - **Match model to use case**: Code vs prose vs multilingual - **Chunk thoughtfully**: Preserve semantic boundaries - **Normalize embeddings**: For cosine similarity search - **Batch requests**: More efficient than one-by-one - **Cache embeddings**: Avoid recomputing for static content - **Use Voyage AI for Claude apps**: Recommended by Anthropic ### Don'ts - **Don't ignore token limits**: Truncation loses information - **Don't mix embedding models**: Incompatible vector spaces - **Don't skip preprocessing**: Garbage in, garbage out - **Don't over-chunk**: Lose important context - **Don't forget metadata**: Essential for filtering and debugging ## Dónde encaja - Categoría: [Datos y analítica](https://skillsagentes.com/categorias/datos-analitica.md) — Consulta, limpia y visualiza datos sin salir del agente. - Creador: [wshobson](https://skillsagentes.com/creators/wshobson.md) — 183 skills en el directorio - [Todas las skills](https://skillsagentes.com/skills.md) - [Ranking de instalaciones](https://skillsagentes.com/ranking.md) ## Otras skills del mismo repositorio - [Hermes Tweet](https://skillsagentes.com/skills/wshobson/agents/hermes-tweet.md): Instala y opera Hermes Tweet, un plugin de Hermes Agent para investigar X/Twitter, leer timelines, analizar tweets y ejecutar operaciones privadas o de cambio de estado con aprobación previa. - [Superself](https://skillsagentes.com/skills/wshobson/agents/superself.md): Úsalo cuando un proyecto guarda su estado en Superself: lee `self context` al iniciar sesión, vincula el trabajo a una work unit, reporta con evidencia y registra decisiones confirmadas. - [Grounded Vault](https://skillsagentes.com/skills/wshobson/agents/grounded-vault.md): Úsalo para mantener un almacén Markdown de conocimiento donde cada afirmación compilada se rastrea hasta una fuente inmutable y el drift se detecta con git diff sin gastar tokens. - [Postgresql Table Design](https://skillsagentes.com/skills/wshobson/agents/postgresql-table-design.md): Úsalo al diseñar o revisar un esquema específico de PostgreSQL: buenas prácticas, tipos de datos, indexación, restricciones, patrones de rendimiento y funciones avanzadas. - [Prompt Engineering Patterns](https://skillsagentes.com/skills/wshobson/agents/prompt-engineering-patterns.md): Úsalo cuando pidan optimizar un prompt, mejorar su rendimiento, diseñar una plantilla, aplicar chain-of-thought, few-shot prompting o técnicas avanzadas de prompt engineering para producción. ## Skills relacionadas - [Backtesting Frameworks](https://skillsagentes.com/skills/wshobson/agents/backtesting-frameworks.md): Construye sistemas de backtesting robustos para estrategias de trading, manejando correctamente look-ahead bias, survivorship bias y costes de transacción. - [Spark Optimization](https://skillsagentes.com/skills/wshobson/agents/spark-optimization.md): Optimiza jobs de Apache Spark con particionamiento, caching, optimización de shuffle y ajuste de memoria, para mejorar rendimiento y escalar pipelines. - [Similarity Search Patterns](https://skillsagentes.com/skills/wshobson/agents/similarity-search-patterns.md): Implementa búsqueda por similitud eficiente con bases de datos vectoriales; útil para búsqueda semántica, consultas de vecinos más cercanos u optimización de retrieval. - [Ml Pipeline Workflow](https://skillsagentes.com/skills/wshobson/agents/ml-pipeline-workflow.md): Construye pipelines MLOps de extremo a extremo: preparación de datos, entrenamiento, validación y despliegue en producción del modelo. - [Dbt Transformation Patterns](https://skillsagentes.com/skills/wshobson/agents/dbt-transformation-patterns.md): Domina dbt para ingeniería analítica: organización de modelos, testing, documentación y estrategias incrementales para transformaciones de datos. --- Skills Agentes · [Índice de páginas en markdown](https://skillsagentes.com/sitemap.md) · [Inicio](https://skillsagentes.com/index.md)