【FB Down】专家:是DNS 出问题?!Facebook 团队:真正故障的原因才是这个!

10月4日晚上至5日凌晨,Facebook,Instagram及WhatsApp发生了全球大当机,无法刷新,登入,连接,中断时间长达6小时,直到早上5点多才恢复正常。

根据科技网站《DownDetector》表示,这种情况有可能跟DNS(网域名称系统)有关联,他们表示,除了Facebook旗下3平台之外,Google,Telegram和Zoom也可能面临类似中断情况,也似乎是很普遍的情况,但无法确定多少用户无法登陆程序。

Facebook在Twitter上贴文说明情况(图片来源:TechNews)

DNS故障导致服务中断

多名安全专家也认为是DNS出问题,思科旗下网络监控机构ThousandEyes认为是DNS故障导致服务中断。Cloudflare高级副总裁Dane Knecht表示,Facebook边界闸道器协定(BGP)突然从网络消失,而BGP功能是为了帮助网络选择最佳途经传输网络流量。

由于网络是由多种路径形成了“网”,跟BGP绑定运作,允许一种网络,比如Facebook向其他网络宣传它的存在,之后与其他ISP建立路由连接,但因为属于Facebook的BGP突然消失了,因此其他网络找不到它,才会无法登入。

(图片来源:TechNews)

通往Facebook“路径”消失

Cloudflare追踪了全球网络中所有BGP的更新和公告,发现Facebook在美国时间10月4日午夜3点40分,BGP更新突然迈向高峰,之后Facebook路径消失,DNS伺服器下陷,与网络断开联系。

经过6小时尝试后,根据DNSchecker测试ISP DNS伺服器显示,在美国时间下午5点30分终于找到了前往Facebook的路径,几分钟后,这些服务也就恢复了,但由于DNS修复需要时间,等待一段时间后才能送到所有人。

目前仍不知道大当机的原因,但有人猜测是骇客所谓,也有人认为可能是对前一晚举报人的内部抗议。Facebook之后也发布声明表示对庞大用户感到抱歉,并表示已经恢复正常。

Router 出现问题

无论如何,Facebook团队在经过抢修,证实了周一将导致社交媒体中断超过6小时的根本原因是其路由器上的错误配置更改(faulty configuration changes on its routers)。

“我们的工程团队已经了解到,协调我们数据中心之间网络流量的骨干路由器上的配置更改导致了中断这种通信的问题。”

Facebook 也在一篇博客文章中回应说,目前所有的服务已经恢复上线,并再次为全球用户带来的不便致歉!

文章资料来源:TechNewsReuters