Scraping web básico y monitorización
En esta clase aprendemos a extraer datos (precios, títulos, imágenes) de una página web que no tiene API, utilizando técnicas de Scraping visual y con IA.
🕸️ Método 1: HTTP Request + HTML Extract (Bajo coste)
- Usamos HTTP Request (GET) para descargar el código HTML de la web (ej: una tienda de juegos).
- Usamos una IA (Gemini/ChatGPT) externa para preguntarle: “Analiza este HTML y dame el CSS Selector del precio y el título”.
- Usamos el nodo HTML Extract pegando esos selectores para obtener los datos limpios.
🤖 Método 2: Information Extractor (IA Nativa)
La forma más sencilla pero con coste de tokens (créditos de IA).
- Conectamos el nodo Information Extractor.
- Le pasamos el HTML.
- Definimos los campos que queremos (ej: “Nombre del producto”, “Precio”, “URL Imagen”).
- Conectamos un modelo (OpenAI o Gemini).
- La IA analiza la web y nos devuelve un JSON perfectamente estructurado con todos los productos.
⚔️ Desafíos en Vivo
Durante la clase, vimos cómo algunas APIs de IA (Gemini) pueden dar errores de límite de uso (Rate Limit) y cómo cambiar rápidamente a otro proveedor (OpenAI) soluciona el problema gracias a la modularidad de N8N.
💡 Conclusión: Tienes dos caminos para el scraping: el camino técnico/barato (Selectores CSS) o el camino fácil/costoso (IA Extractor). Ambos son muy potentes para monitorizar precios o competidores.