Cloudflare 18 listopada 2025 r., około godziny 11:20 UTC, nastąpiła rozległa przerwa w świadczeniu usług. Zakłócenie wpłynęło na znaczną część globalnego ruchu internetowego i spowodowało przerwy w świadczeniu usług na głównych platformach, w tym ChatGPT, Claude, Spotify, X i HostScore.net. Awaria spowodowała ciągłe błędy HTTP 5xx, przerwane przepływy uwierzytelniania i zwiększone opóźnienie w Cloudflaresieć.
Cloudflare Później potwierdził, że incydent nie był spowodowany cyberatakiem, pomimo wcześniejszych spekulacji dotyczących skali i objawów awarii. Niniejsze ogłoszenie stanowi oficjalną aktualizację dla naszych czytelników, partnerów i interesariuszy, ponieważ dokumentujemy, co się wydarzyło, jak doszło do rozprzestrzeniania się problemu i jak usługi ostatecznie przywróciły się do działania.
Zakres zakłóceń
Awaria spowodowana Cloudflare'wynik CDN i warstwy zabezpieczeń, aby zatrzymać normalne przetwarzanie ruchu, co doprowadziło do gwałtownego wzrostu liczby błędów HTTP 5xx w całej sieci. Odwiedzający dotknięte witryny napotykali strony błędów, zawieszały się ładowanie lub występowały długie opóźnienia, ponieważ CloudflareWarstwa proxy miała problemy z odpowiedzią. Kluczowe usługi, takie jak zarządzanie botami, bramka obrotowa, pracownicy KV i Cloudflare Jednocześnie pogorszył się dostęp. Wpływ ten pogłębił się w przypadku stron internetowych, które polegały na Cloudflare do buforowania, bezpieczeństwa i uwierzytelniania.
CloudflareDostęp do pulpitu nawigacyjnego firmy był również utrudniony, ponieważ Turnstile, warstwa weryfikacyjna na stronie logowania, nie załadowała się. Zewnętrznie hostowana strona statusu firmy również przestała działać, co wywołało zamieszanie w pierwszych minutach incydentu. CloudflareInfrastruktura poczty elektronicznej nadal działała, ale skuteczność wykrywania spamu na krótko spadła ze względu na utratę danych o reputacji adresów IP.
Przyczyna główna: Ukryty błąd
Cloudflare potwierdziła, że awaria została wywołana przez ukryty błąd w głównym komponencie systemu zarządzania botami.
O godzinie 11:05 UTC rutynowa aktualizacja uprawnień bazy danych nieumyślnie zmieniła sposób, w jaki usługa generowania cech odpytywała metadane. Zamiast pobierać dane z jednego schematu, usługa zaczęła odpytywać zarówno schemat domyślny, jak i schemat r0, generując duży zestaw zduplikowanych wierszy cech. Ten rozdęty plik konfiguracyjny został następnie rozpropagowany w całym systemie. Cloudflareglobalna sieć.
Główny silnik proxy wymusza sztywny limit 200 funkcji uczenia maszynowego w zakresie wydajności i alokacji pamięci. Zbyt duży plik przekroczył ten limit, powodując panikę serwera proxy FL2 i zwracanie błędów 5xx dla wszystkich żądań, których dotyczył problem. Klienci korzystający ze starszego silnika FL nie odczuli całkowitego błędu, ale ich wyniki Bot Management domyślnie wynosiły zero, co prowadziło do niespójnego zarządzania ruchem.
Harmonogram rozwiązania
Cloudflare wykryto pierwszą falę błędów w ruchu klientów o godzinie 11:28 UTC.
Inżynierowie początkowo skupili się na grupie Workers KV, która wykazała nienormalny spadek wskaźników odpowiedzi pomiędzy 11:32 a 13:05 UTC.
O godzinie 13:04 UTC, Cloudflare zastosowałem poprawkę awaryjną, aby ominąć główny serwer proxy dla Workers KV, a następnie podobne obejście dla Cloudflare Dostęp o 13:05 UTC.
O godzinie 13:37 UTC zespół inżynierów rozpoczął przywracanie konfiguracji Bot Management do znanej, dobrej wersji.
Cloudflare wstrzymano tworzenie nowych plików funkcji o 14:24 UTC i wdrożono globalnie poprawioną konfigurację o 14:30 UTC, co przywróciło normalny przepływ ruchu.
Problemy z logowaniem do panelu zostały później rozwiązane, a pełny dostęp do panelu sterowania został przywrócony około 15:30 UTC. Cloudflare oznaczono incydent jako w pełni rozwiązany o godzinie 17:06 UTC.
HostScore.net Oświadczenie dotyczące wpływu
HostScore.net była jedną z witryn dotkniętych awarią. Nasz zespół zaobserwował natychmiastowe wzrosty liczby odpowiedzi 5xx i tymczasową niedostępność, ponieważ Cloudflare'S CDN a warstwy zabezpieczeń nie były w stanie przetworzyć żądań. Odzyskiwanie witryny następowało stopniowo, Cloudflare wdrożono kroki wycofania i przywrócenia.
Nasze systemy monitorowania wykryły problem w ciągu kilku minut i kontynuowaliśmy monitorowanie działania sieci, aż do przywrócenia pełnej stabilności. Chociaż awaria miała swoje źródło w naszej infrastrukturze, nadal dbamy o transparentność i będziemy nadal ulepszać nasze procesy monitorowania i postępowania awaryjnego, aby wzmocnić ogólną odporność usług.
CloudflarePotwierdzenie i działania po incydencie
Cloudflare publicznie przyznał powagę incydentuDyrektor techniczny Dane Knecht przeprosił i stwierdził, że firma „zawiodła swoich klientów i cały internet”. Firma określiła to zdarzenie jako najpoważniejszą awarię od 2019 r., podkreślając, jak niewielki błąd konfiguracji może mieć skutki kaskadowe w rozproszonych systemach na dużą skalę.
Cloudflare Rozpoczęła prace nad kilkoma długoterminowymi usprawnieniami, w tym wzmocnieniem procesu pobierania wewnętrznie generowanych plików konfiguracyjnych, rozszerzeniem globalnych wyłączników awaryjnych w celu szybszego izolowania wadliwych komponentów oraz zapobieganiem gwałtownym wzrostom liczby raportów o błędach, które pochłaniają zasoby systemowe. Z infrastrukturą obejmującą 330 miast i zasilającą około 20% sieci, Cloudflare podkreśliła swoje zaangażowanie w zapobieganie podobnym błędom w przyszłości.
Owijanie w górę
Ten incydent pokazuje, jak bardzo dzisiejszy internet opiera się na niewielkiej liczbie podstawowych dostawców usług. Gdy jedna z tych sieci ulegnie awarii, skutki uboczne mogą dotrzeć do milionów użytkowników w ciągu kilku minut. Cloudflare pracuje nad swoim planem naprawczym, HostScore.net nadal angażuje się w działania na rzecz przejrzystości, stałego monitorowania i ciągłych udoskonaleń, które wzmacniają odporność naszej platformy i niezawodność usług, na których polegają nasi czytelnicy.