Volver al blog

Cómo configurar un MCP Server para un entorno de navegador y resolver fallos

Guía práctica para conectar un MCP Server a un entorno de automatización del navegador: comprobación de versiones, gestión de credenciales, registro del servicio y verificación de conectividad, además del orden de diagnóstico para listas de herramientas vacías, fallos de autenticación y tiempos de espera agotados.

MCP (Model Context Protocol) permite que un asistente de AI maneje un navegador sin que tengas que programar a mano cada interacción. El propio asistente puede llamar a las herramientas en el orden necesario y completar la tarea.

En la práctica, los bloqueos suelen estar menos en el protocolo y más en qué instalar, a qué dirección conectarse, cómo entregar las credenciales y cómo comprobar que la conexión funciona. Si recorres esos cuatro puntos en orden, la mayoría de los problemas se hacen visibles durante la configuración.

MCP Server 接入浏览器环境的配置流程与排查顺序的关键步骤与判断维度示意图

Confirma primero tres cosas

Primero necesitas un cliente del entorno de automatización del navegador que ofrezca una interfaz local, y su versión debe admitir una API local. En versiones antiguas, esa interfaz puede no existir aunque el síntoma sea simplemente una lista de herramientas vacía. Segundo, necesitas Node.js 18 o posterior. La mayoría de los MCP Server están implementados en TypeScript y requieren un entorno de ejecución de Node. Tercero, necesitas una herramienta de AI compatible con MCP.

Conviene comprobar la versión del cliente antes que nada. Una parte importante de los errores de conexión o de las listas de herramientas vacías se debe únicamente a una versión antigua y no al servidor.

A dónde conectarse

Cuando arranca, el cliente levanta en el equipo un servicio de API local que escucha en una dirección de loopback. El puerto se puede ver y cambiar en la configuración de interfaz del cliente. Si ya está ocupado, elige otro y reinicia el cliente.

El MCP Server accede al entorno mediante esa dirección local, sin pasar por Internet pública. Por la misma razón, este servicio debe permanecer únicamente en el equipo local y no exponerse al exterior.

Cómo entregar las credenciales

Genera una API Key desde la configuración del cliente. Algunas implementaciones usan dos partes, ID y Key. Estas credenciales equivalen en la práctica al control de todos los entornos de tu cuenta; quien las obtenga podría iniciar, modificar o eliminar esos entornos.

No omitas las medidas básicas. No subas las credenciales a un repositorio de código. Usa variables de entorno o un archivo de configuración local y añade ese archivo a la lista de exclusión. Rota las credenciales inmediatamente cuando cambien los miembros del equipo. Si se pueden generar credenciales separadas por finalidad, hazlo: facilita localizar incidentes y revocar una credencial concreta. En la configuración de la herramienta de AI, pasa tanto el endpoint como las credenciales mediante variables de entorno, en lugar de dejarlos escritos directamente en la línea de comandos.

Registrar el servicio

El registro consiste normalmente en añadir una definición de servicio al archivo de configuración de la herramienta de AI. Tiene tres partes: el método de inicio, es decir, un comando o la ruta del archivo de entrada; variables de entorno con el endpoint local y las credenciales; y un identificador de servicio, que será el nombre visible en la lista de herramientas.

Después de registrarlo, reinicia la herramienta de AI. La mayoría de las herramientas leen la configuración una sola vez al arrancar; modificarla sin reiniciar equivale, en la práctica, a no haberla modificado.

Cómo comprobar que realmente funciona

Hazlo en dos pasos y no cambies el orden.

Primero revisa la lista de herramientas. Deberían aparecer herramientas relacionadas con el navegador, lo que confirma que el servicio ha sido reconocido. Después asígnale una tarea de solo lectura, por ejemplo listar todos los entornos actuales. Una operación de solo lectura no produce efectos secundarios, pero comprueba de una vez la autenticación, la red y el servicio. Si falla aquí, todavía no tiene sentido probar tareas posteriores.

Qué se puede hacer después de conectar

Cuando el servicio funciona, un asistente de AI suele poder consultar y buscar entornos, crear entornos y configurar parámetros básicos, iniciarlos y detenerlos, asociar una salida de red a un entorno y realizar acciones concretas en una página, como navegar, hacer clic, rellenar campos o tomar capturas de pantalla.

El uso se hace en lenguaje natural: describes el objetivo y el asistente decide qué herramientas llamar y en qué orden. Hay una distinción fácil de confundir: la AI decide qué hacer, mientras que la capa de entorno decide con qué identidad se hace. Separar ambas responsabilidades facilita saber dónde investigar cuando algo falla.

Orden de diagnóstico cuando no conecta

Si la lista de herramientas está vacía, comprueba primero que la ruta del archivo de configuración sea correcta, después confirma que reiniciaste la herramienta de AI y, por último, intenta iniciar el servicio manualmente para ver si puede arrancar por sí solo. Si cualquiera de esos tres pasos falla, aún no hay motivo para sospechar del protocolo.

Los fallos de autenticación suelen tener solo dos orígenes: al copiar la Key se incluyó un carácter adicional o un salto de línea, o la variable de entorno no se leyó correctamente. Volver a copiar la Key suele ser más rápido que modificar la configuración una y otra vez.

Los tiempos de espera agotados suelen apuntar al lado local. Comprueba si el cliente está en ejecución y si el puerto está ocupado o bloqueado por un firewall. La mayoría de los MCP Server necesitan que el cliente permanezca activo; al cerrarlo, las herramientas dejan de poder invocarse.

Si el servicio conecta pero las operaciones se ejecutan mal, el problema suele ser el momento de espera. Indica claramente en la instrucción qué estado debe alcanzarse antes de continuar, en vez de hacer que el asistente adivine si la página ya terminó de cargar.

Otro problema poco evidente al principio es que varias tareas compartan el mismo entorno. Las sesiones, Cookies y caché se pisan entre sí, las tareas empiezan a interferirse y el resultado parece un fallo aleatorio en lugar de un error claro. Es más seguro dar a cada tarea un entorno independiente y dejar que la capa de entorno se encargue de la creación y recuperación en lote. El aislamiento y la gestión centralizada de entornos de PurpleMark operan precisamente en esta capa; después de conectar MCP, la orquestación de tareas y la gestión de identidades siguen siendo dos asuntos separados.

Dos problemas adicionales

Cuando un framework de automatización toma el control del navegador, la versión del driver debe coincidir con la versión del motor usada por el cliente. El cliente suele devolver una ruta de driver utilizable, pero aun así puede haber incompatibilidades. Usar una herramienta de gestión de versiones para sincronizar el driver automáticamente suele ser más sencillo, mientras que el endpoint de la página puede seguir usando el valor devuelto por el cliente; ambas cosas son compatibles.

La concurrencia es el otro punto. Un solo proceso de navegador consume entre 300 y 500MB de memoria, y se recomienda no iniciar más de 5 entornos al mismo tiempo en una misma máquina. Superar ese número puede provocar fallos de inicio e incluso bloqueos de procesos. Para las operaciones de página, evita las esperas fijas: configura el tiempo máximo de carga en 30 segundos y usa esperas explícitas para los elementos, con un máximo de 20 segundos. Es más estable que sleep.

Un límite importante

MCP resuelve el problema técnico de cómo la AI opera un navegador; no cambia las reglas de ninguna plataforma. La tarea sigue teniendo que cumplir los términos de servicio de la plataforma objetivo. Que algo sea técnicamente posible y que esté permitido por las reglas son dos evaluaciones independientes.

Consulta la documentación oficial para los detalles del protocolo y de las interfaces, y antes de empezar confirma que la tarea que quieres ejecutar esté permitida en la plataforma objetivo.