Web Scraping y Automatización

Playwright, Scrapy, Selenium, RPA — extrae y automatiza todo

12 módulos Interactivo Proyecto final

Domina la extracción de datos y automatización web: HTTP avanzado, BeautifulSoup, Selenium, Playwright, Scrapy, anti-scraping, RPA, PyAutoGUI, PyMuPDF, email y crawling asíncrono. Proyecto final: monitor automatizado de precios con alertas.

Módulo 01

HTTP Avanzado

Headers, cookies, sesiones, proxies, retries.

Módulo 02

BeautifulSoup + lxml

Parser HTML. find, CSS selectors, extracción.

Módulo 03

Selenium Avanzado

Navegador simulado. WebDriverWait, stealth mode.

Módulo 04

Playwright

Scripts: navegar, screenshot, PDF, network intercept.

Módulo 05

Scrapy Framework

Constructor de spiders. Items, Pipeline, export.

Módulo 06

Anti-Scraping

CAPTCHA, rate limiting, IP blocking, bypass.

Módulo 07

RPA Básico

PDF → datos → formulario → email. RPA.

Módulo 08

PyAutoGUI

Control GUI: click, type, screenshot, locate.

Módulo 09

PyMuPDF

Extraer texto, imágenes, tablas. Combinar PDFs.

Módulo 10

Email y Calendarios

smtplib, imaplib. Enviar/leer. Google Calendar.

Módulo 11

Crawling Escalable

aiohttp + asyncio. Crawler concurrente.

Módulo 12

Proyecto: Monitor de Precios

Scraper + BD + alertas + dashboard.