# Lemonade SDK MCP Server > Conecta a Lemonade Server, un servidor local que expone modelos de lenguaje, voz e imagen a través de una API compatible con OpenAI para ejecutarlos en tu propia GPU o NPU. Fuente: https://skillsagentes.com/mcp/lemonade-sdk Markdown: https://skillsagentes.com/mcp/lemonade-sdk.md Repositorio: https://github.com/lemonade-sdk/lemonade Web: https://lemonade-server.ai/ Autor: lemonade-sdk Licencia: Apache-2.0 Estrellas: 5758 Última versión: v11.5.2 Último push: 21 sept 2026 ## Qué es Lemonade es un servidor de IA local que permite descargar y ejecutar modelos de chat, generación de código, voz e imagen directamente sobre el hardware del usuario (GPU o NPU), sin depender de servicios en la nube. El proyecto ofrece dos formas de uso: Lemonade Server, que instala un servicio al que te puedes conectar desde cientos de aplicaciones usando las APIs estándar de OpenAI, Anthropic y Ollama, y Embeddable Lemonade, un binario portable que se puede empaquetar dentro de una aplicación propia para darle capacidades de IA local multimodal que se auto-optimizan según el equipo del usuario. Desde la línea de comandos se pueden listar y descargar modelos (lemonade list, lemonade pull), ejecutarlos (lemonade run), definir alias con failover activo-pasivo entre modelos (lemonade alias), y consultar qué backends de inferencia están disponibles en la máquina (lemonade backends). El servidor soporta modelos GGUF, FLM y ONNX para texto, además de motores para transcripción de voz, texto a voz, generación de imagen y generación 3D, con distintos backends según el hardware (CPU, CUDA, ROCm, Vulkan, NPU XDNA2, Metal). Para integrarlo en una aplicación o agente basta con apuntar cualquier cliente compatible con OpenAI a http://localhost:13305/v1 (o /api/v1), usando el nombre del modelo descargado y una clave de API ficticia, ya que Lemonade no requiere autenticación real. También admite enrutar solicitudes híbridas hacia proveedores en la nube compatibles con OpenAI (Fireworks, OpenAI, OpenRouter, Together) de forma experimental. ## Qué hace - Sirve modelos de lenguaje, voz e imagen localmente sobre GPU o NPU con una API compatible con OpenAI, Anthropic y Ollama - Permite descargar, listar y ejecutar modelos desde la CLI o el Model Manager integrado - Soporta múltiples motores de inferencia (llamacpp, flm, ryzenai-llm, whispercpp, kokoro, sd-cpp, entre otros) según el hardware disponible - Ofrece un mecanismo de alias de modelos con failover activo-pasivo entre modelos de reemplazo - Puede enrutar solicitudes a proveedores en la nube compatibles con OpenAI para configuraciones híbridas ## Cuándo usarlo - Cuando quieres ejecutar modelos de chat, código, voz o imagen de forma local y privada, sin depender de una API en la nube - Cuando necesitas conectar una aplicación existente a un modelo local usando el mismo formato de API que ya usas con OpenAI, Anthropic u Ollama - Cuando quieres aprovechar la GPU o NPU de tu propio equipo para inferencia optimizada (Ryzen AI, Radeon, Strix Halo) - Cuando necesitas embeber una pila de IA local multimodal directamente dentro de tu propia aplicación ## Dónde encaja - Categoría: [Herramientas para desarrolladores](https://skillsagentes.com/mcp/categorias/herramientas-desarrollo.md) — Skills que cambian cómo tu agente escribe, revisa y despliega código. - [Todos los servidores MCP](https://skillsagentes.com/mcp.md) - [Agent Skills](https://skillsagentes.com/skills.md) ## Servidores relacionados - [Superpowers](https://skillsagentes.com/mcp/superpowers.md): Instala en tu agente de código un conjunto de skills y una metodología completa de desarrollo de software, desde el diseño hasta el TDD y las revisiones de código. - [Ruflo](https://skillsagentes.com/mcp/ruflo.md): Conecta Claude Code y Codex con una capa de orquestación que despliega swarms de agentes, memoria vectorial persistente y comunicación federada entre máquinas. - [OpenSpec](https://skillsagentes.com/mcp/openspec.md): Framework de desarrollo guiado por especificaciones que estructura el trabajo con asistentes de IA en propuestas, specs, diseño y tareas antes de escribir código. - [Context7](https://skillsagentes.com/mcp/context7.md): Conecta tu agente a Context7 para inyectar documentación de librerías actualizada y ejemplos de código específicos por versión directamente en el prompt. - [Codebase Memory](https://skillsagentes.com/mcp/codebase-memory.md): Indexa tu código fuente en un grafo de conocimiento persistente y deja que tu agente de IA consulte relaciones estructurales en milisegundos, sin grep. --- Skills Agentes · [Índice de páginas en markdown](https://skillsagentes.com/sitemap.md) · [Inicio](https://skillsagentes.com/index.md)