Skills Agentes

Trafilatura

adbartrafilatura

Conecta `trafilatura` a Claude y extrae el texto principal, los metadatos y los comentarios de páginas web, limpiando el ruido de las plantillas HTML.

Estrellas
6.8k

del repositorio

Actualizado
hace 14 días

último commit

Herramientas
—

no documentadas

Transporte
—

sin documentar

Forks
432
Issues
61

abiertos

El README no documenta un comando de instalación. Sigue las instrucciones del repositorio.

Qué es Trafilatura

Trafilatura es una librería Python y herramienta de línea de comandos pensada para recolectar texto en la web y convertir HTML en bruto en datos estructurados. No es un simple scraper genérico: combina algoritmos propios con métodos conocidos como jusText y readability para separar el contenido relevante de cabeceras, menús y otros elementos repetitivos.

Lo que permite hacer es rastrear sitios a partir de sitemaps (TXT, XML) o feeds (ATOM, JSON, RSS), procesar URLs en vivo o archivos HTML ya descargados, y extraer el texto principal junto con metadatos como título, autor, fecha, nombre del sitio, categorías y etiquetas. También puede recuperar elementos opcionales como comentarios, enlaces, imágenes y tablas, conservando la estructura en párrafos, listas, citas o bloques de código.

Los resultados se pueden obtener en varios formatos: TXT, Markdown, CSV, JSON, HTML, XML y XML-TEI. Según el README, la herramienta destaca en comparativas de extracción de contenido web frente a otras librerías de código abierto, priorizando un equilibrio entre precisión y cobertura.

Qué le permite hacer a tu agente

  • Extrae el texto principal de páginas web eliminando ruido de plantillas y elementos recurrentes
  • Recupera metadatos como título, autor, fecha, sitio, categorías y etiquetas
  • Soporta rastreo mediante sitemaps y feeds (ATOM, JSON, RSS) con filtrado y deduplicación de URLs
  • Procesa tanto URLs en vivo como HTML ya descargado o árboles HTML parseados
  • Genera salida en TXT, Markdown, CSV, JSON, HTML, XML y XML-TEI

Úsalo cuando

  • Necesitas convertir páginas web en texto limpio y estructurado para análisis o entrenamiento de modelos
  • Quieres construir corpus de texto a partir de sitios web mediante sitemaps o feeds
  • Buscas extraer metadatos junto con el contenido de artículos u otras páginas

Detalles

Publicado por
adbar
Licencia
Apache-2.0
Versión
v2.2.0
Transporte
No documentado

Etiquetas

  • scraping
  • extraccion-texto
  • web-crawling
  • metadatos

¿Este servidor es tuyo? Reclama el listado para corregir cualquier dato, añadir un logo y enlazar tu documentación.

Más servidores de Datos y analítica

Conecta tu agente a Firecrawl para buscar en la web, convertir cualquier URL en markdown o JSON estructurado y automatizar la extracción de datos de sitios.

Último commit
hace 4 días
Credenciales
datos analitica

Conecta a TrendRadar, el agregador de tendencias multiplataforma, y permite consultar, buscar y analizar en lenguaje natural las noticias y RSS que recopila.

Herramientas expuestas
12 herramientas
Transporte
http
Último commit
hace 12 días
datos analitica

Cognee

30.9k

Da a agentes de IA memoria persistente a largo plazo mediante un grafo de conocimiento autoalojado que combina embeddings vectoriales y razonamiento sobre grafos.

Transporte
stdio · http · sse
Último commit
hace 4 días
Credenciales
datos analitica

Ver toda la categoría →