Codex ने ICM वेबसाइट स्क्रैप की और 2026 Fields Medal विजेताओं की सूची खोज ली
एक कथित 2026 Fields Medal विजेता-लीक तब सामने आया जब एक AI-सहायता प्राप्त code-scraping tool ने International Congress of Mathematicians वेबसाइट के सार्वजनिक HTML में “hidden” elements से नाम निकाल लिए। टिप्पणीकारों का तर्क है कि यह sophisticated hacking नहीं बल्कि एक बुनियादी web development failure था, जबकि वे यह भी नोट करते हैं कि AI ऐसी गलतियाँ खोजने की बाधा को कम करता है और यह सवाल उठाता है कि उन्हें उजागर करने वाले व्यक्तियों के साथ प्राधिकरण कैसे व्यवहार करते हैं। चर्चा आगे browser और AI सेवाओं द्वारा privacy तथा data collection की चिंताओं तक फैलती है, और Chinese name order को संभालने तथा विजेताओं को पहले सार्वजनिक करने की नैतिकता जैसे सांस्कृतिक मुद्दों को भी छूती है.
लीक कैसे हुआ
- Fields Medal विजेता सार्वजनिक ICM 2026 शेड्यूल HTML में एम्बेडेड थे, और उन्हें सर्वर-साइड पर सुरक्षित करने के बजाय फ्रंट-एंड में “hidden” के रूप में चिह्नित किया गया था।
- टिप्पणीकारों का कहना है कि यह एक बहुत ही बुनियादी वेब लीक है, जिसे LLM से पहले “view source” या साधारण scraping से भी पाया जा सकता था।
- कुछ लोग इसकी तुलना paywalled लेखों से करते हैं, जो टेक्स्ट को सर्वर पर न भेजकर केवल CSS से छिपाते हैं।
LLMs बनाम पारंपरिक scraping की भूमिका
- एक पक्ष का तर्क है कि “Codex ने इसे खोज लिया” वाला पहलू बढ़ा-चढ़ाकर बताया गया है; मूल कारण खराब web development और बुनियादी सुरक्षा गलतियाँ हैं।
- दूसरे लोग जवाब देते हैं कि भले ही मनुष्य यह कर सकते थे, LLMs पैमाना और पहुँच बदल देते हैं, जिससे ऐसी खोजें आसान और अधिक संभावित हो जाती हैं।
- इस पर बहस है कि यदि काम तुच्छ है, तो मॉडल को श्रेय देना कितना अर्थपूर्ण है।
कानूनी और नैतिक चिंताएँ
- कई टिप्पणियाँ उन पुराने मामलों को उजागर करती हैं जहाँ साधारण flaws को ज़िम्मेदारी से disclose करने वालों को prosecution की धमकी दी गई थी, खासकर व्यापक anti-hacking laws के तहत।
- अन्य लोग कहते हैं कि ऐसी चरम प्रतिक्रियाएँ सामान्य नहीं हैं, हालांकि security researchers फिर भी सावधान रहने की आवश्यकता महसूस करते हैं।
- कुछ लोगों को यह “tacky” लगता है कि खोजकर्ताओं ने विजेताओं के नाम पहले ही सार्वजनिक कर दिए।
गोपनीयता, Chrome, और छिपे हुए URLs
- एक लंबा साइड-ट्रैक इस पर चर्चा करता है कि कैसे “unguessable” URLs या draft pages Google द्वारा index हो जाते हैं, जबकि उन तक कोई public link नहीं होता।
- सिद्धांतों में Chrome द्वारा देखे गए URLs को Google को वापस भेजना, Cloudflare “crawler hints,” sitemaps/CMS behavior, analytics scripts, DNS logs, browser “safe browsing” checks, या यहाँ तक कि compromised extensions शामिल हैं।
- कुछ लोग ज़ोर देते हैं कि Chrome-आधारित URL data वास्तविक है और antitrust proceedings में दस्तावेज़ित किया गया था; अन्य लोग निहितार्थ से चिंतित हैं, लेकिन इसे big-tech surveillance patterns के अनुरूप मानते हैं।
नामकरण और transliteration पर बहस
- एक सहायक चर्चा Chinese name order (family name पहले बनाम Westernized order) पर है।
- कुछ लोग तर्क देते हैं कि मीडिया को व्यक्ति के अपने उपयोग का पालन करना चाहिए; अन्य कहते हैं कि transliteration और ordering स्वाभाविक रूप से जटिल और context-dependent हैं।
व्यापक AI/security प्रभाव
- कई टिप्पणियाँ इस बात पर ज़ोर देती हैं कि LLMs लंबे समय से मौजूद “obvious” bugs और leaks को तेज़ी से सामने ला सकते हैं, और novelty के बजाय scale के माध्यम से security landscape को बदल सकते हैं।
- अन्य लोग मीडिया की उस framing का विरोध करते हैं जो “AI” को दोष देती है, बजाय इसके कि मूल मानव-निर्मित vulnerabilities पर ध्यान दे।