कोई बड़े पैमाने पर vulnerability scans चला रहा है, ClaudeBot जैसे AI bots की spoofing कर रहा है

वेब सर्वरों के खिलाफ बड़े पैमाने पर, स्वचालित vulnerability scans तेजी से Claude या Googlebot जैसे वैध AI crawlers का भेष धारण कर रहे हैं, और कुछ operators apparently cloud providers तथा certificate transparency logs का उपयोग नई sites को जल्दी खोजने और probe करने के लिए कर रहे हैं। टिप्पणीकार बताते हैं कि VPS IP ranges, ASNs, या पूरे देशों को बिना भेदभाव block करने से hostile traffic का बड़ा हिस्सा कट सकता है, लेकिन इससे वास्तविक उपयोगकर्ता भी बाहर हो जाते हैं, जिससे sites honeypots, behavioral signals, और Google के Web Bot Auth जैसे bot authentication schemes जैसी अधिक सूक्ष्म defenses की ओर बढ़ती हैं। यह चर्चा रेखांकित करती है कि background scanning इंटरनेट की एक स्थायी “water is wet” स्थिति है, लेकिन इन campaigns का scale, sophistication, और AI-related targeting स्पष्ट रूप से बढ़ रहा है।

स्कैन का स्वरूप

  • कई लोगों ने हाल ही में HTTP(S) requests में statistically significant उछाल देखा है, जो AI bot user-agents (Claude, Googlebot, आदि) की spoofing करते हैं; ये अक्सर IP verification या नए “Web Bot Auth” schemes में विफल हो जाते हैं।
  • अनुरोधित paths अक्सर AI coding tools और सामान्य web vulns को target करते हैं (जैसे WordPress, .env, generic PHP endpoints)।
  • कुछ लोगों का तर्क है कि यह बस पुराने mass vuln scanning का ही नया disguise है; दूसरों को इसमें एक अलग नया campaign pattern दिखता है।

Traffic sources और patterns

  • बताए गए origins में Google Cloud (specific ASNs), Microsoft और Google IPs, चीनी और रूसी networks, और विभिन्न VPNs, VPSes, तथा compromised residential/IoT devices शामिल हैं।
  • Traffic अक्सर हज़ारों IPs में एक साथ बढ़ता और घटता है, जिससे centralized control का संकेत मिलता है।
  • Certificate Transparency logs और नए TLS cert issuance को bots द्वारा नए domains को तेज़ी से ढूँढ़ने के trigger के रूप में उद्धृत किया गया है।

Bot identification और verification

  • सहमति है कि user-agent strings अविश्वसनीय हैं; verification के लिए उपयोग करें:
    • provider-published IP ranges या reverse DNS.
    • जहाँ समर्थित हों, नए Web Bot Auth mechanisms.
  • कुछ लोग fake Googlebot/AI crawlers को logs में शीर्ष category मानते हैं।

Mitigation strategies

  • IP/ASN-based:
    • VPS/datacenter ASNs को block करना; free या paid IP intelligence का उपयोग करना (सस्ते से लेकर बहुत महंगे enterprise tiers तक)।
    • कुछ लोग large foreign providers जैसे पूरे ASNs block करते हैं; अन्य false positives के बारे में सावधान करते हैं।
    • routers/firewalls पर country-level blocking आम है, कभी-कभी ASN blacklists के साथ।
  • Behavioral:
    • honeypots जो scan traffic एकत्र करते हैं और blocklists तथा AS/ISP leaderboards प्रकाशित करते हैं।
    • dynamic systems जो संकेतकों के आधार पर “risky” networks को CAPTCHAs/Turnstile के पीछे रखते हैं (जैसे बहुत सारे PHP probes, /24 प्रति बहुत सारे empty accounts)।
    • rate limiting, fail2ban, और WAFs; आलोचकों का कहना है कि fail2ban लाखों IPs के सामने overwhelmed हो जाता है और ज़्यादातर केवल logs साफ़ करता है।
  • Architectural:
    • attack surface घटाने के लिए WordPress/CMS से static hosting (S3/Cloudflare Pages) की ओर जाना।
    • कुछ bots को फ़िल्टर करने के लिए केवल HTTP/2 या header fingerprinting का उपयोग करना।
    • exposure कम करने के लिए CGNAT या WireGuard-style VPNs पर निर्भर रहना।

Tradeoffs और collateral damage

  • VPS/datacenters/VPNs को block करने से अनिवार्य रूप से कुछ वास्तविक उपयोगकर्ता बाहर हो जाते हैं; anecdotes के अनुसार यह absolute संख्या छोटी है लेकिन शून्य नहीं।
  • Residential proxies और CGNAT का मतलब है कि एक blocked IP या town-sized NAT बहुत सारे निर्दोष लोगों को प्रभावित कर सकता है।
  • कुछ लोग passive hardening और केवल सबसे खराब offenders पर प्रतिक्रिया देना पसंद करते हैं, बजाय aggressive bot fighting के, जो legitimate crawlers या users को block कर सकता है।

Legality, norms, और significance

  • बड़े पैमाने पर अनधिकृत scanning को व्यापक रूप से illegal या “legally dubious” माना जाता है, लेकिन enforcement को न्यूनतम माना जाता है।
  • नवीनता को लेकर असहमति है: कुछ इसे शुरुआती worms के समय से business-as-usual कहते हैं; अन्य बढ़ते volume और AI‑targeted paths को escalation का प्रमाण मानते हैं।
  • कई लोगों को यह broader shift का हिस्सा दिखता है, जिसमें अधिक authenticated, कम open internet access की ओर बढ़ना शामिल है (जैसे KYC-like models, bot auth standards)।