Scraping web básico y monitorización

En esta clase aprendemos a extraer datos (precios, títulos, imágenes) de una página web que no tiene API, utilizando técnicas de Scraping visual y con IA.

🕸️ Método 1: HTTP Request + HTML Extract (Bajo coste)

  1. Usamos HTTP Request (GET) para descargar el código HTML de la web (ej: una tienda de juegos).
  2. Usamos una IA (Gemini/ChatGPT) externa para preguntarle: “Analiza este HTML y dame el CSS Selector del precio y el título”.
  3. Usamos el nodo HTML Extract pegando esos selectores para obtener los datos limpios.

🤖 Método 2: Information Extractor (IA Nativa)

La forma más sencilla pero con coste de tokens (créditos de IA).

  1. Conectamos el nodo Information Extractor.
  2. Le pasamos el HTML.
  3. Definimos los campos que queremos (ej: “Nombre del producto”, “Precio”, “URL Imagen”).
  4. Conectamos un modelo (OpenAI o Gemini).
  5. La IA analiza la web y nos devuelve un JSON perfectamente estructurado con todos los productos.

⚔️ Desafíos en Vivo

Durante la clase, vimos cómo algunas APIs de IA (Gemini) pueden dar errores de límite de uso (Rate Limit) y cómo cambiar rápidamente a otro proveedor (OpenAI) soluciona el problema gracias a la modularidad de N8N.

💡 Conclusión: Tienes dos caminos para el scraping: el camino técnico/barato (Selectores CSS) o el camino fácil/costoso (IA Extractor). Ambos son muy potentes para monitorizar precios o competidores.