Academia IA · ConectaNex

← Volver al catálogo

MCP avanzado gratis

Firecrawl (MCP)

Servidor MCP para que el agente lea, rastree y extraiga datos de la web de forma estructurada.

Qué es

Firecrawl le da a Claude la capacidad de navegar y extraer contenido de páginas web: buscar, rastrear sitios, scrapear y devolver datos limpios en formato estructurado. Útil para investigación, monitoreo y automatizaciones que dependen de información de la web.

Cómo conectar

Necesitás una API key de Firecrawl (se obtiene gratis en firecrawl.dev). Añades el MCP con el comando de Claude Code, pasando la clave como variable de entorno. NUNCA compartas tu clave real ni la subas a un repositorio.

Comandos

Agregar el MCP (reemplaza TU_API_KEY)

🪟🍎 Windows y macOS
claude mcp add firecrawl --env FIRECRAWL_API_KEY=TU_API_KEY -- npx -y firecrawl-mcp

Consigue tu clave gratis en firecrawl.dev. No la pegues en lugares públicos.

Firecrawl le da al agente la capacidad de salir a la web: buscar, rastrear sitios, scrapear páginas y devolver el contenido limpio en texto o markdown estructurado. Es uno de los MCP más usados cuando necesitas que el agente trabaje con información actual y real, no solo con lo que ya sabe. Sirve para investigación, monitoreo de páginas y automatizaciones que dependen de datos de la web.

La diferencia con un navegador o con una búsqueda normal está en el formato. Firecrawl no te devuelve HTML caótico ni una lista de enlaces: te entrega el contenido ya limpio, sin menús, sin banners, sin anuncios. Para una IA eso es oro, porque le permite leer cien páginas sin saturar el contexto con basura. Lo que pasaba antes (copiar la URL, abrir el navegador, seleccionar el texto, pegarlo en el chat) desaparece.

Que sea un MCP en vez de un script suelto también importa: el agente decide cuándo usarlo. Si le preguntas algo que requiere datos frescos, el modelo entiende que tiene una herramienta para ir a buscarlos y la usa. Tú no tienes que decirle “scrapea esta página”; basta con que tu pregunta lo justifique.

Qué te abre

El primer caso es la búsqueda web. Firecrawl puede actuar como buscador (devuelve resultados de un motor) y el agente puede combinarlos con el resto de capacidades. “Encuéntrame los tres artículos más recientes sobre X y resúmemelos” pasa a ser una orden directa, no un encargo de media tarde.

El segundo caso es el scraping puntual. Le das una URL concreta y el servidor te devuelve el contenido en markdown limpio. Útil para artículos largos, documentación oficial, fichas de producto o cualquier página de la que necesites el texto sin distracciones. El agente lo procesa como si lo hubieras pegado tú, pero con la limpieza ya hecha.

El tercero, y probablemente el más interesante, es el rastreo (crawl). Le pasas una URL y Firecrawl sigue los enlaces internos para reunir un sitio entero (o una sección). En cinco minutos tienes el contenido de un blog completo, una documentación o un catálogo, listo para que el agente lo procese. Para investigación competitiva, monitoreo de cambios o construir corpus de entrenamiento esto cambia las matemáticas.

También está la extracción estructurada: en vez de devolver texto plano, le pides al agente que saque campos concretos (precio, fecha, autor, descripción) de cada página y los organice en una tabla. El servidor y el modelo se reparten el trabajo y tú recibes datos limpios.

Y, por último, hay un beneficio menos vistoso pero real: el agente puede usar Firecrawl como su “ojo en la web” mientras trabaja en una tarea más larga. Por ejemplo, está redactando un informe y necesita una cifra concreta: la busca, la verifica y sigue, sin que tú tengas que abrir una pestaña.

Cómo conectarlo

El flujo concreto es corto. Primero necesitas Node.js instalado (el servidor corre con npx). Compruébalo con node --version. Después date de alta gratis en firecrawl.dev, entra al panel y copia tu API key. La cuenta gratuita trae créditos suficientes para probar y para muchos casos personales.

Con la clave en mano, abre un terminal y ejecuta el comando que aparece en el frontmatter, reemplazando TU_API_KEY por tu clave real:

claude mcp add firecrawl --env FIRECRAWL_API_KEY=TU_API_KEY -- npx -y firecrawl-mcp

Lo que hace ese comando es registrar el servidor en la configuración de Claude Code y guardarlo con la variable de entorno FIRECRAWL_API_KEY ya inyectada. La sintaxis es la misma en Mac y en Windows. Para confirmar que ha quedado, ejecuta:

claude mcp list

y comprueba que aparece firecrawl en la lista. La primera vez que el agente quiera usarlo te pedirá permiso, como con cualquier otro MCP.

Si trabajas en Claude Desktop en vez de Claude Code, el camino cambia: ahí editas claude_desktop_config.json a mano y añades el bloque del servidor dentro de mcpServers, pasando la clave en la sección env del bloque. El resultado es el mismo. La ficha ¿Qué es un MCP? explica ese flujo general si necesitas refrescarlo.

Un detalle importante: la API key vive en tu configuración local, no en el chat. El agente la usa indirectamente al invocar la herramienta, pero tú no la ves pasar por la conversación. Si quieres cambiarla (porque se filtró, porque migras a una cuenta de pago), basta con regenerarla en el panel y volver a registrar el MCP con la nueva.

Seguridad y permisos

Hay tres frentes que conviene tener en mente. El primero es la API key: trátala como una contraseña. Nunca la pegues en chats públicos, en capturas, ni en repositorios. En ejemplos y documentación usa siempre un placeholder (TU_API_KEY). Si la clave queda expuesta, regénerala desde el panel de Firecrawl y vuelve a configurar el MCP; mientras tanto, cualquiera con esa clave consume tus créditos.

El segundo es qué sitios visita el agente. Firecrawl te permite extraer de casi cualquier URL pública, pero “que se pueda” no es “que se deba”. Respeta los términos de uso de los sitios que rastreas: muchos blogs y APIs limitan el scraping y otros lo prohíben directamente. Para investigación personal o de bajo volumen rara vez es un problema; para automatizaciones que rastrean miles de páginas conviene leer las condiciones.

El tercero son los datos sensibles. Si el agente extrae información personal de páginas (perfiles, contactos, datos de empresa), aplican las normas de protección de datos del país en que operes. La herramienta es neutra; el uso, no tanto.

Casos de uso reales

Una analista monitoriza a tres competidores. Cada lunes le pide al agente “entra a estos tres blogs, sácame los títulos y resúmenes de los últimos posts y dime qué temas están tocando”. En quince minutos tiene un mapa que antes le llevaba la mañana.

Un consultor está preparando una propuesta y necesita citar fuentes recientes. Le dice al agente “busca los cinco artículos más recientes sobre regulación X en medios oficiales y devuélveme los fragmentos clave con la URL”. El agente busca, scrapea, recorta y le entrega el material listo para integrar.

Un equipo de producto quiere convertir la documentación de una API competidora en una tabla comparativa con la suya. Le pasan al agente la URL raíz y le piden “rastrea toda esta documentación y haz una tabla de qué endpoints expone, qué parámetros pide y qué devuelve”. Lo que era una semana sale en una tarde.

Errores comunes y cómo evitarlos

  • La clave queda en el comando del terminal y se va al historial. En Mac y Linux, ejecuta primero unset HISTFILE o pega la clave desde un gestor de contraseñas, no la dejes brillando en history.
  • Subir el JSON con la clave a un repo. Pasa más de lo que parece. Si te ocurre, regenera la clave inmediatamente y considera el commit como comprometido.
  • Quedarte sin créditos a mitad de un crawl. La cuenta gratuita tiene un tope; si lanzas un rastreo grande, comprueba antes el saldo o las extracciones empezarán a fallar a la mitad sin un mensaje claro.
  • Páginas que cargan con JavaScript “vacían” en la respuesta. Algunas webs renderizan todo en cliente. Si el resultado viene en blanco, suele ser eso, no un fallo de configuración. Prueba con el endpoint correcto o con otra URL del mismo sitio.
  • Sitios que bloquean scraping. Si una página devuelve siempre un 403 o un 429, está protegida contra rastreo automatizado. Respeta la negativa.
  • No verificar tras instalar. claude mcp list confirma que el servidor está registrado. Si no aparece, revisa que el comando se haya ejecutado sin errores y que tengas una versión reciente de Claude Code.

Combinarlo con otros MCPs y skills

Firecrawl encaja perfecto con el MCP de filesystem (extrae de la web, guarda el resultado limpio en una carpeta de tu disco) y con Obsidian (rastrea documentación y guarda resúmenes como notas en tu bóveda). También se complementa con skills de investigación: el agente busca con Firecrawl, sintetiza y entrega el documento final. Para flujos de monitoreo más complejos, puedes encadenarlo con n8n.

Mini-ejercicio

Date de alta gratis en firecrawl.dev, instala el MCP y prueba con una URL concreta. Pide al agente “extrae el contenido de esta página y resúmemelo en cinco viñetas”. Sabrás que está bien si el resumen menciona detalles reales de la página y no inventos: si la respuesta es vaga o genérica, el servidor no llegó a leerla y conviene revisar la configuración.

Funciones

Enlaces

#mcp#web#scraping#investigacion

Actualizado: 27 de mayo de 2026