Google публикува „мини доклад за инцидент“ в своята платформа за облачни услуги, който вчера доведе до прекъсване на работата на няколко основни услуги, включително Spotify, Discord, Snapchat, OpenAI, както и на услуги на самия гигант за търсене.
„Дълбоко съжаляваме за въздействието, което този пробив/прекъсване на услугата причини на всички наши потребители и техните клиенти. Големи и малки компании се доверяват на Google Cloud за своите работни натоварвания и ние ще се справим по-добре. През следващите дни ще публикуваме пълен доклад за инцидента с причината, подробен график и надеждни коригиращи действия, които ще предприемем. Предвид мащаба и въздействието на този инцидент, бихме искали да предоставим известна информация по-долу.“
се казва в изявлението на компанията
Според официалните лица инцидентът е възникнал в 10:49 ч. тихоокеанско време (21:49 ч. българско време) на 12 юни, а работата на всички системи е възстановена точно три часа по-късно, в 13:39 ч. (на 13 юни 0:49 ч. българско време). Прекъсването е засегнало системите на Google по целия свят. Основният симптом на проблема беше рязкото увеличаване на отговора „грешка 503“ в няколко продукта на Google Cloud и Google Workspace за външни заявки към API.
„Според първоначалния ни анализ проблемът е причинен от невалидна актуализация на автоматичната квота в нашата система за управление на API, която се разпространи в световен мащаб и предизвика срив при изпълнение на външни API заявки. За да възстановим работата, активирахме заобикаляне на проверката на квотите, което възстанови работата в повечето региони в рамките на два часа. Базата данни на политиката за квотите в регион us-central1 обаче беше претоварена, което доведе до много по-дълго възстановяване в този регион. Няколко продукта имаха умерени остатъчни ефекти (напр. неизпълнени задачи) в продължение на един час след отстраняването на основния проблем и след това настъпи частично възстановяване.“
се казва в обобщения доклад
За да се предотвратят подобни повреди в бъдеще, компанията се ангажира да предприеме следните стъпки:
- да предотврати сривове на платформата за управление на API поради повредени данни;
- да предотврати глобалното разгръщане на метаданни без подходяща защита, тестване и мониторинг;
- да подобри обработката на системни грешки и цялостното тестване за управление на повредени данни.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!