Skills Agentes

Embedding Strategies

Selecciona y optimiza modelos de embeddings para búsqueda semántica y aplicaciones RAG, incluyendo estrategias de chunking y ajuste por dominio.

Estrellas
39.8k

en todo el repo

Actividad
43

0–100, la ruta de este skill

Actualizado
hace 4 meses

último commit aquí

Commits
0

últimos 90 días

Contexto
712 tok

51 tok en reposo

Paquete
2 archivos

19 KB

Instalar

Funciona con cualquier agente que lea SKILL.md

npx -y skills add wshobson/agents --skill embedding-strategies --agent claude-code

Se instala solo en este repositorio.

Qué hace

  • Compara modelos de embeddings (Voyage, OpenAI, BGE, MiniLM, multilingual-e5) por dimensiones, tokens máximos y caso de uso
  • Guía el diseño del pipeline de embeddings: chunking, preprocesamiento y elección de modelo
  • Da buenas prácticas sobre normalización, batching, caché y manejo de límites de tokens

Úsalo cuando

  • Elegir modelos de embeddings para RAG
  • Optimizar estrategias de chunking
  • Ajustar embeddings para dominios específicos
  • Comparar rendimiento de modelos de embeddings o reducir dimensiones/manejar contenido multilingüe

No lo uses cuando

    Qué lo activa

    Di cualquiera de estas frases y el agente debería cargar este skill.

    • “¿Qué modelo de embeddings me conviene para un buscador de código?”
    • “Ayúdame a diseñar la estrategia de chunking para mi RAG”
    • “Compárame voyage-3-large vs text-embedding-3-large”

    SKILL.md

    En inglés

    Embedding Strategies

    Guide to selecting and optimizing embedding models for vector search applications.

    When to Use This Skill

    • Choosing embedding models for RAG
    • Optimizing chunking strategies
    • Fine-tuning embeddings for domains
    • Comparing embedding model performance
    • Reducing embedding dimensions
    • Handling multilingual content

    Core Concepts

    1. Embedding Model Comparison (2026)

    Model Dimensions Max Tokens Best For
    voyage-3-large 1024 32000 Claude apps (Anthropic recommended)
    voyage-3 1024 32000 Claude apps, cost-effective
    voyage-code-3 1024 32000 Code search
    voyage-finance-2 1024 32000 Financial documents
    voyage-law-2 1024 32000 Legal documents
    text-embedding-3-large 3072 8191 OpenAI apps, high accuracy
    text-embedding-3-small 1536 8191 OpenAI apps, cost-effective
    bge-large-en-v1.5 1024 512 Open source, local deployment
    all-MiniLM-L6-v2 384 256 Fast, lightweight
    multilingual-e5-large 1024 512 Multi-language

    2. Embedding Pipeline

    Document → Chunking → Preprocessing → Embedding Model → Vector
                    ↓
            [Overlap, Size]  [Clean, Normalize]  [API/Local]
    

    Templates and detailed worked examples

    Full template library and detailed worked examples live in references/details.md. Read that file when you need the concrete templates.

    Best Practices

    Do's

    • Match model to use case: Code vs prose vs multilingual
    • Chunk thoughtfully: Preserve semantic boundaries
    • Normalize embeddings: For cosine similarity search
    • Batch requests: More efficient than one-by-one
    • Cache embeddings: Avoid recomputing for static content
    • Use Voyage AI for Claude apps: Recommended by Anthropic

    Don'ts

    • Don't ignore token limits: Truncation loses information
    • Don't mix embedding models: Incompatible vector spaces
    • Don't skip preprocessing: Garbage in, garbage out
    • Don't over-chunk: Lose important context
    • Don't forget metadata: Essential for filtering and debugging

    Reproducido de wshobson/agents bajo licencia MIT. Leer esta página en markdown.

    Archivos

    2 archivos en el paquete. Solo se lee SKILL.md al activarse — las referencias se cargan si el skill decide que las necesita.

    Antes de instalar

    Para ejemplos y plantillas detalladas consulta references/details.md.

    Detalles

    Creador
    wshobson
    Licencia
    MIT
    Recursos incluidos
    referencias
    Repositorio
    wshobson/agents
    Código fuente
    Ver SKILL.md

    Etiquetas

    Más de wshobson/agents

    Este repo incluye 183 skills. Si instalas uno, normalmente ya tienes los demás. Ver el pack agents entero y su comando de instalación

    Instala y opera Hermes Tweet, un plugin de Hermes Agent para investigar X/Twitter, leer timelines, analizar tweets y ejecutar operaciones privadas o de cambio de estado con aprobación previa.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    3 archivos
    Última actualización
    el mes pasado
    redes sociales

    Úsalo para mantener un almacén Markdown de conocimiento donde cada afirmación compilada se rastrea hasta una fuente inmutable y el drift se detecta con git diff sin gastar tokens.

    Costo de contexto al activarse
    1.4k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 24 días
    documentos

    Úsalo al diseñar o revisar un esquema específico de PostgreSQL: buenas prácticas, tipos de datos, indexación, restricciones, patrones de rendimiento y funciones avanzadas.

    Costo de contexto al activarse
    2k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 24 días
    bases de datos

    Úsalo cuando un proyecto guarda su estado en Superself: lee `self context` al iniciar sesión, vincula el trabajo a una work unit, reporta con evidencia y registra decisiones confirmadas.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    1 archivo
    Última actualización
    hace 24 días
    productividad

    Úsalo cuando pidan optimizar un prompt, mejorar su rendimiento, diseñar una plantilla, aplicar chain-of-thought, few-shot prompting o técnicas avanzadas de prompt engineering para producción.

    Costo de contexto al activarse
    1.3k tok
    Tamaño del paquete
    10 archivos
    Última actualización
    el mes pasado
    herramientas desarrollo

    Audita y reescribe prosa para que deje de sonar generada por máquina. Incluye modo solo-detección, modo reescritura y modo edición en el lugar, con perfiles opcionales de voz y contexto.”

    Costo de contexto al activarse
    1.9k tok
    Tamaño del paquete
    4 archivos
    Última actualización
    el mes pasado
    redaccion contenido

    Skills relacionados

    Construye sistemas de backtesting robustos para estrategias de trading, manejando correctamente look-ahead bias, survivorship bias y costes de transacción.

    Costo de contexto al activarse
    878 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 4 meses
    datos analitica

    Implementa validación de calidad de datos con Great Expectations, pruebas dbt y contratos de datos para pipelines fiables.

    Costo de contexto al activarse
    1.1k tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 4 meses
    datos analitica

    Transforma datos en narrativas persuasivas usando visualización, contexto y estructura. Útil al presentar analíticas a stakeholders, crear reportes o presentaciones ejecutivas.

    Costo de contexto al activarse
    530 tok
    Tamaño del paquete
    2 archivos
    Última actualización
    hace 4 meses
    datos analitica