ASD

Trafilatura

adbartrafilatura

Extrae texto principal, metadatos y comentarios de páginas web, limpiando el ruido de plantillas HTML para entregar contenido listo para usar.

Estrellas
6.6k

del repositorio

Actualizado
hace 3 días

último commit

Herramientas

no documentadas

Transporte

sin documentar

Forks
412
Issues
67

abiertos

El README no documenta un comando de instalación. Sigue las instrucciones del repositorio.

Qué es Trafilatura

Trafilatura es una librería Python y herramienta de línea de comandos pensada para recolectar texto en la web y convertir HTML en bruto en datos estructurados. No es un simple scraper genérico: combina algoritmos propios con métodos conocidos como jusText y readability para separar el contenido relevante de cabeceras, menús y otros elementos repetitivos.

Lo que permite hacer es rastrear sitios a partir de sitemaps (TXT, XML) o feeds (ATOM, JSON, RSS), procesar URLs en vivo o archivos HTML ya descargados, y extraer el texto principal junto con metadatos como título, autor, fecha, nombre del sitio, categorías y etiquetas. También puede recuperar elementos opcionales como comentarios, enlaces, imágenes y tablas, conservando la estructura en párrafos, listas, citas o bloques de código.

Los resultados se pueden obtener en varios formatos: TXT, Markdown, CSV, JSON, HTML, XML y XML-TEI. Según el README, la herramienta destaca en comparativas de extracción de contenido web frente a otras librerías de código abierto, priorizando un equilibrio entre precisión y cobertura.

Qué le permite hacer a tu agente

  • Extrae el texto principal de páginas web eliminando ruido de plantillas y elementos recurrentes
  • Recupera metadatos como título, autor, fecha, sitio, categorías y etiquetas
  • Soporta rastreo mediante sitemaps y feeds (ATOM, JSON, RSS) con filtrado y deduplicación de URLs
  • Procesa tanto URLs en vivo como HTML ya descargado o árboles HTML parseados
  • Genera salida en TXT, Markdown, CSV, JSON, HTML, XML y XML-TEI

Úsalo cuando

  • Necesitas convertir páginas web en texto limpio y estructurado para análisis o entrenamiento de modelos
  • Quieres construir corpus de texto a partir de sitios web mediante sitemaps o feeds
  • Buscas extraer metadatos junto con el contenido de artículos u otras páginas

Detalles

Publicado por
adbar
Licencia
Apache-2.0
Versión
v2.2.0
Transporte
No documentado

Etiquetas

  • scraping
  • extraccion-texto
  • web-crawling
  • metadatos

¿Este servidor es tuyo? Reclama el listado para corregir cualquier dato, añadir un logo y enlazar tu documentación.

Más servidores de Datos y analítica

Conecta tu agente a Firecrawl para buscar en la web, convertir cualquier URL en markdown o JSON estructurado y automatizar la extracción de datos de sitios.

Último commit
ayer
Credenciales
datos analitica

Conecta a TrendRadar, el agregador de tendencias multiplataforma, y permite consultar, buscar y analizar en lenguaje natural las noticias y RSS que recopila.

Herramientas expuestas
12 herramientas
Transporte
http
Último commit
hace 28 días
datos analitica

Da a agentes de IA memoria persistente a largo plazo mediante un grafo de conocimiento autoalojado que combina embeddings vectoriales y razonamiento sobre grafos.

Transporte
stdio · http · sse
Último commit
ayer
Credenciales
datos analitica

Ver toda la categoría →