「国家規模のサイバー攻撃か」「大規模なハッキングによるデータ流出か」と憶測が飛び交う中、Meta社(当時Facebook社)のインフラ部門責任者サントシュ・ジャナルダン副社長らは公式声明を発表。障害の根本原因は、データセンター間のネットワークを管理するバックボーンルーターの定期メンテナンス時における「設定変更ミス」であったと明らかにしました。
技術的に何が起きていたのか、その核心はBGP(ボーダー・ゲートウェイ・プロトコル)のルーティング情報消失と、それに連鎖したDNS(ドメイン・ネーム・システム)障害に集約されます。
BGPはインターネット上で「どのサーバーにどうやってデータを届けるか」を示す道路案内板のような役割を果たしています。定期メンテナンスの際、誤ったコマンドが実行されたことで、Metaのデータセンターへ向かうルート案内が一斉に世界中のインターネットから撤回(削除)されてしまいました。その結果、世界中の通信機器からMetaのDNSサーバーへアクセスする道筋が完全に消滅し、インターネットの世界からInstagramのドメインそのものが突如として「存在しない状態」になってしまったのです。
さらに事態を悪化させたのが、同社の徹底したセキュリティ設計でした。社内ネットワークと物理的な入館システムまでもがダウンしたネットワークに依存していたため、復旧作業にあたるエンジニアがデータセンターのサーバールームに物理的に入館できないという前代未聞のトラブルに直面。現地に急行した技術者が手作業でルーターを再設定し、安全にルーティングを再開させるまでに6時間以上の時間を要することとなりました。