Mechanizm udostępniania i błąd w zabezpieczeniach
Claude oferuje użytkownikom funkcję tworzenia tzw. snapshotów, czyli publicznych adresów URL prowadzących do konkretnych wątków rozmowy. Choć intencją twórców było umożliwienie dzielenia się wybranymi konwersacjami, doszło do nieoczekiwanego konfliktu między sposobem działania wyszukiwarek a zabezpieczeniami stosowanymi przez Anthropic, firmę stojącą za modelem Claude.
Standardową metodą informowania robotów indeksujących (crawlerów) o tym, jakich części strony nie powinny odwiedzać, jest plik robots.txt. Zgodnie z danymi archiwalnymi, Anthropic stosuje to rozwiązanie co najmniej od września 2025 roku, wyraźnie instruując wyszukiwarki, aby nie indeksowały udostępnionych czatów. Okazuje się jednak, że w świecie nowoczesnych technologii to zabezpieczenie jest niewystarczające.
Dlaczego wyszukiwarki zignorowały instrukcje?
Problem wynika z różnic w interpretacji technicznych wytycznych przez gigantów technologicznych. Bing oraz Google w swojej dokumentacji wskazują, że sam plik robots.txt nie daje pełnej gwarancji ochrony przed indeksowaniem. Jeśli strona jest podlinkowana w innym miejscu w sieci, wyszukiwarki mogą ją zaindeksować, chyba że właściciel witryny zastosuje dodatkowy znacznik noindex w kodzie HTML strony lub odpowiedni nagłówek w odpowiedzi serwera.
Analiza przeprowadzona przez dziennikarzy wykazała, że strony z udostępnionymi czatami Claude nie posiadały wymaganego znacznika noindex. W efekcie, mimo prób blokowania robotów przez plik robots.txt, wyszukiwarki uznały te treści za publicznie dostępne.
Neither Google nor any other search engine controls what pages are made public on the web, and these pages were indexed across many search engines. We give site owners clear controls to decide whether pages can be crawled or indexed, and we always respect those directives.
Rzecznik Google, Ned Adriance, podkreślił, że odpowiedzialność za odpowiednią konfigurację witryny spoczywa na jej właścicielu. Firma Anthropic nie udzieliła odpowiedzi na pytania dotyczące przyczyn braku zastosowania znacznika noindex, mimo że podobne problemy z prywatnością użytkowników zgłaszano już w przeszłości.
Paradoks zabezpieczeń w branży AI
Sytuacja ta obnaża szerszy problem w branży sztucznej inteligencji. Firmy takie jak Anthropic, Meta czy OpenAI powszechnie korzystają z plików robots.txt, aby blokować konkurencję przed pobieraniem danych z ich stron w celu trenowania własnych modeli AI. Jednocześnie, jak pokazuje przypadek Claude, te same mechanizmy okazują się zawodne w ochronie prywatności użytkowników przed publicznym indeksowaniem.
Choć w momencie publikacji większość czatów zniknęła już z wyników wyszukiwania Google, strony te nadal nie posiadają znacznika noindex, co oznacza, że w przyszłości mogą ponownie pojawić się w wyszukiwarkach. Użytkownicy, którzy chcą mieć pewność, że ich rozmowy pozostaną poufne, powinni regularnie sprawdzać ustawienia prywatności w sekcji Ustawienia > Prywatność > Udostępnione czaty, gdzie można zarządzać dostępem do swoich konwersacji.

