Alguien está ejecutando exploraciones masivas de vulnerabilidades, suplantando bots de IA como ClaudeBot

Los escaneos masivos y automatizados de vulnerabilidades contra servidores web se están disfrazando cada vez más como rastreadores de IA legítimos como Claude o Googlebot, y algunos operadores al parecer aprovechan proveedores en la nube y los registros de Certificate Transparency para descubrir y sondear rápidamente nuevos sitios. Los comentaristas señalan que bloquear indiscriminadamente rangos de IP de VPS, ASNs o países enteros puede reducir mucho el tráfico hostil, pero también excluir a usuarios reales, empujando a los sitios hacia defensas más matizadas como honeypots, señales de comportamiento y esquemas de autenticación de bots como Web Bot Auth de Google. El intercambio subraya que el escaneo en segundo plano es una condición permanente de la internet, pero la escala, la sofisticación y el enfoque en IA de estas campañas están aumentando claramente.

Naturaleza de los escaneos

  • Muchos observan un reciente aumento estadísticamente significativo en solicitudes HTTP(S) que suplantan user-agents de bots de IA (Claude, Googlebot, etc.), a menudo fallando la verificación de IP o los nuevos esquemas de “Web Bot Auth”.
  • Las rutas solicitadas suelen apuntar a herramientas de codificación de IA y vulnerabilidades web comunes (p. ej., WordPress, .env, endpoints PHP genéricos).
  • Algunos sostienen que esto no es más que el mismo escaneo masivo de vulnerabilidades de siempre con nuevos disfraces; otros ven un patrón de campaña nuevo y distinto.

Fuentes de tráfico y patrones

  • Los orígenes reportados incluyen Google Cloud (ASNs específicos), IPs de Microsoft y Google, redes chinas y rusas, y diversos VPNs, VPSes y dispositivos residenciales/IoT comprometidos.
  • El tráfico a menudo sube y baja al unísono en miles de IPs, lo que sugiere control centralizado.
  • Se citan los registros de Certificate Transparency y la nueva emisión de certificados TLS como desencadenantes para que los bots encuentren rápidamente nuevos dominios.

Identificación y verificación de bots

  • Hay consenso en que las cadenas de user-agent no son fiables; la verificación debería usar:
    • Rangos de IP publicados por el proveedor o DNS inverso.
    • Nuevos mecanismos de Web Bot Auth cuando estén soportados.
  • Algunos ven a los falsos Googlebot/crawlers de IA como la categoría principal en los registros.

Estrategias de mitigación

  • Basadas en IP/ASN:
    • Bloquear ASNs de VPS/datacenter; usar inteligencia de IP gratuita o de pago (desde niveles baratos hasta niveles empresariales muy caros).
    • Algunos bloquean ASNs completos como los de grandes proveedores extranjeros; otros advierten sobre falsos positivos.
    • El bloqueo por país en routers/firewalls es común, a veces combinado con listas negras de ASNs.
  • Conductuales:
    • Honeypots que recopilan tráfico de escaneo y publican listas de bloqueo y clasificaciones de AS/ISP.
    • Sistemas dinámicos que ponen redes “arriesgadas” detrás de CAPTCHAs/Turnstile según indicadores (p. ej., muchos probes PHP, muchas cuentas vacías por /24).
    • Limitación de tasa, fail2ban y WAFs; los críticos dicen que fail2ban queda desbordado por millones de IPs y básicamente solo limpia los registros.
  • Arquitectónicas:
    • Pasar de WordPress/CMS a hosting estático (S3/Cloudflare Pages) para reducir la superficie de ataque.
    • Usar solo HTTP/2 o fingerprinting de cabeceras para filtrar algunos bots.
    • Depender de CGNAT o VPNs estilo WireGuard para reducir la exposición.

Compensaciones y daños colaterales

  • Bloquear VPS/datacenters/VPNs inevitablemente deja fuera a algunos usuarios reales; las anécdotas sugieren que el número absoluto es pequeño pero no cero.
  • Los proxies residenciales y CGNAT significan que una sola IP bloqueada o un NAT del tamaño de un pueblo puede afectar a muchos inocentes.
  • Algunos prefieren el endurecimiento pasivo y reaccionar solo ante los peores infractores en lugar de una lucha agresiva contra bots que podría bloquear rastreadores o usuarios legítimos.

Legalidad, normas y significado

  • El escaneo masivo no autorizado es ampliamente visto como ilegal o “legalmente dudoso”, pero se considera que la aplicación es mínima.
  • Hay desacuerdo sobre la novedad: algunos lo califican como lo de siempre desde los primeros gusanos; otros señalan el aumento del volumen y las rutas dirigidas a IA como evidencia de escalada.
  • Varios ven esto como parte de un cambio más amplio hacia un acceso a internet más autenticado y menos abierto (p. ej., modelos tipo KYC, estándares de autenticación de bots).