Herramientas de datos
Scraping, ETL y notebooks. Indicamos cuáles llevaríamos a producción y cuáles dejaríamos solo para desarrollo.
Scraping
Apify
freemiumInfraestructura de scraping gestionada y SDK de código abierto.
Alojado por ellos o en tu propia infraestructura. Solo su SDK ya merece un vistazo.
cheerio
OSSAnálisis de HTML en servidor al estilo jQuery.
La usamos en cada rastreo que no sea de una SPA en el pipeline de la base de conocimiento.
linkedom
OSSDOM conforme a la especificación para entornos worker/Node.
Para cuando necesitas un DOM de verdad y el estilo jQuery de cheerio no te basta.
Playwright
OSSNavegador headless para cuando descargar y analizar no basta.
Trae sus propios navegadores, sin líos de drivers. Nuestra opción por defecto para scraping de SPAs.
Puppeteer
OSSEl hermano mayor de Playwright. Sigue funcionando bien y sigue mantenido.
Recurre a él si el equipo ya lo conoce; a Playwright si empiezas de cero.
Scrapy
OSSFramework de rastreo nativo de Python, con cola y middlewares integrados.
La herramienta adecuada a partir de 10 000 páginas. Escala sin convertirse en tu proyecto.
ETL
Dagster
freemiumPipelines de datos tipados, con trazabilidad de assets.
Más opinable que Prefect. Elígelo cuando pensar en assets encaje con tus datos.
DuckDB
OSSSQL analítico en local sobre archivos.
Lo usamos para domar CSV en proyectos de consultoría. Un solo binario, sin servidor.
Prefect
freemiumOrquestación de flujos de trabajo en Python, con interfaz.
Así sería el orquestador de VORLUX si usáramos una planificación ya hecha.
Notebooks
marimo
OSSNotebooks de Python reactivos que no son un montón de estado.
Código abierto y moderno. Elígelo antes que Jupyter para cualquier cosa que vayas a compartir.
Polars
OSSDataFrames en Rust. Rápidos.
Reescribe tus celdas lentas de pandas y consigue 10 veces más velocidad, a menudo sin cambiar código.