ASD

FunASR

modelscopeFunASR

Conecta agentes con FunASR, un kit de reconocimiento de voz que transcribe audio, detecta hablantes y sirve modelos ASR mediante un servidor MCP local.

Estrellas
19.8k

del repositorio

Actualizado
ayer

último commit

Herramientas

no documentadas

Transporte

sin documentar

Forks
2k
Issues
4

abiertos

Instalación

pip install funasr

Qué es FunASR

FunASR es un kit de herramientas de código abierto para reconocimiento de voz que incluye modelos de transcripción (Fun-ASR-Nano, SenseVoiceSmall, Paraformer), detección de actividad de voz (VAD), puntuación automática y diarización de hablantes con CAM++. No es un único modelo como Whisper, sino un conjunto de piezas que se combinan según la tarea: transcripción offline, streaming en tiempo real o despliegue en dispositivos sin GPU.

El repositorio expone un servidor MCP (en examples/mcp_server/) pensado para integrarse con agentes como Claude o Cursor, además de un servidor compatible con la API de OpenAI (funasr-server) que levanta un endpoint de transcripción en localhost:8000. También ofrece un runtime basado en llama.cpp/GGUF para correr los modelos como binario autocontenido en CPU o edge, sin necesidad de Python en tiempo de ejecución.

Para usarlo hace falta instalar torch y torchaudio, luego funasr vía pip; el servidor MCP y el servidor OpenAI-compatible se apoyan en esa misma instalación base. Los pipelines de AutoModel permiten encadenar ASR, VAD, puntuación y diarización de hablantes en una sola llamada, devolviendo texto con marcas de tiempo, etiquetas de hablante y puntuación.

Qué le permite hacer a tu agente

  • Transcribe audio con modelos como Fun-ASR-Nano, SenseVoiceSmall y Paraformer para chino, inglés, japonés y otros idiomas
  • Combina VAD, puntuación y diarización de hablantes (CAM++) en un único pipeline de AutoModel
  • Soporta transcripción en streaming vía WebSocket con Paraformer-zh-streaming
  • Detecta emociones y eventos de audio con SenseVoiceSmall y emotion2vec
  • Se puede desplegar como servidor compatible con la API de OpenAI o como binario CPU/edge vía llama.cpp

Úsalo cuando

  • Necesitas que un agente transcriba audio o video con detección de hablantes y puntuación
  • Quieres integrar reconocimiento de voz local en Claude, Cursor u otro cliente MCP
  • Buscas una alternativa autoalojada a Whisper con soporte de streaming en tiempo real
  • Necesitas correr ASR en CPU o dispositivos edge sin depender de una nube

Detalles

Publicado por
modelscope
Licencia
MIT
Versión
runtime-llamacpp-v0.2.0
Transporte
No documentado

Etiquetas

  • reconocimiento-de-voz
  • asr
  • transcripcion
  • diarizacion
  • streaming

¿Este servidor es tuyo? Reclama el listado para corregir cualquier dato, añadir un logo y enlazar tu documentación.

Más servidores de Herramientas para desarrolladores

Instala en tu agente de código un conjunto de skills y una metodología completa de desarrollo de software, desde el diseño hasta el TDD y las revisiones de código.

Último commit
ayer
Credenciales
herramientas desarrollo

Ruflo

67.8k

Conecta Claude Code y Codex con una capa de orquestación que despliega swarms de agentes, memoria vectorial persistente y comunicación federada entre máquinas.

Herramientas expuestas
8 herramientas
Transporte
stdio
Último commit
ayer
herramientas desarrollo

Framework de desarrollo guiado por especificaciones que estructura el trabajo con asistentes de IA en propuestas, specs, diseño y tareas antes de escribir código.

Último commit
anteayer
herramientas desarrollo

Ver toda la categoría →