Telstra 网络故障:网络误将年份设为2006的那一夜

Lobsters Hottest 新闻

摘要

由于GPS接收器将年份设置为2006年,导致Telstra网络出现故障,影响了语音通话、紧急服务和关键基础设施,突显了时间同步在现代网络中的关键作用。

<p><a href="https://lobste.rs/s/3qdik0/telstra_outage_night_network_decided">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/09/18 01:44

# Telstra故障:网络误以为2006年的那个夜晚 | Netnod 来源:https://www.netnod.se/blog/telstra-outage-night-network-decided-year-was-2006 事实恰恰相反。如果我们对“现在”没有共同认知,许多我们视为理所当然的功能都将失效。 今年夏天,澳大利亚用惨痛代价认识到了这一点。请允许我借此机会举例说明时间对现代社会为何重要、本次事件的具体经过,以及我们从中得出的关键教训。 2026年7月8日,澳大利亚最大移动运营商Telstra (https://www.telstra.com.au/) 运营的大范围移动网络停止服务,语音通话无法接通,短信无法送达。甚至有人拨打澳大利亚紧急电话号码时也无法接通。但故障影响范围更广,列车系统、支付终端、票务系统和电动汽车充电桩均出现服务中断。 没有任何网络遭受攻击,也没有人意外切断光纤,所有系统都保持供电。你可能会问,罪魁祸首是什么?是墨尔本某个机箱内的一台GPS接收器在计划维护后恢复运行时,误认为年份是2006年,而整个网络的其他部分都被它“说服”相信了这个错误。 Telstra委托Technology Audit Partners (TAP) (https://www.telstra.com.au/exchange/what-we-ve-learned-from-external-investigation-our-july-o) 进行了独立评估。这份报告极具研究价值,因为同类故障可能发生在许多关键服务中,包括那些我们赖以维系生命的服务。 要使许多系统正常运作,时间的准确性或至少全网一致性至关重要。业内人士都清楚,“准确”是个相对概念。不存在绝对精确的时间,只有保持在参考值一定误差范围内的时间。这个误差范围的宽窄完全取决于你的具体工作或业务领域。 像Telstra这样运营移动网络,其时间敏感性在商业领域中几乎达到极致。 ## 现代移动通信原理解释时间重要性 现代手机通信协议离不开精确时间。移动网络通过FDD(频分双工)或TDD(时分双工)技术分离上行与下行数据。 FDD为每个方向分配独立的频谱段,使双方向可同时连续传输而不冲突。 TDD则使用单一连续频谱段进行双向通信,通过极短时间间隔交替发射与接收。 由于下行数据量通常远大于上行,FDD固定比例会造成上行频谱大量闲置,而TDD能动态调整比例以适应实际流量。这就是为何大多数现代5G频谱(包括瑞典主要3.5GHz 5G频段)采用TDD技术。 这也正是TDD依赖精确时间的原因:同一频率上的所有基站必须严格同步切换方向。若某基站时钟漂移,其发射信号会干扰邻站的接收窗口,导致网络自我干扰。 业界选择不通过频谱分配来隔离双向信号,而是依赖时间精度,并接受了所有基站必须就“现在时刻”达成共识的刚性依赖。因此,对时间的依赖是刻意设计的选择。 然而,考虑到我们如此依赖系统对“现在时刻”的共识,时间却未获得应有的重视程度——这确实令人费解。而这份公开报告清晰揭示了这一教训。 那么,究竟发生了什么? ## 时间分配架构解析 首先要理解时间分配的架构原理。 所有时间分配协议都构建层级体系;根据报告,Telstra部署的NTP(网络时间协议)通过分层(stratum)来体现其层级结构。 - 第0层是参考源本身,例如GPS接收器或Netnod的原子钟。 - 第1层是直接同步于第0层参考源的设备,例如Netnod提供的NTP服务器。 - 第2层服务器同步于第1层,第3层同步于第2层,依此类推。 就Telstra而言,这个层级结构有特定形态,至少在初期如此。2010年的设计在顶层设置了第1层源,位于澳大利亚国家计量研究所 (NMI) (https://www.industry.gov.au/national-measurement-institute)——该机构负责维护国家时间标准,类似于瑞典研究所 (https://www.ri.se/) 在瑞典的职能。Telstra从这些外部参考源获取时间,传输至其悉尼和墨尔本的两个第2层服务器,再由这些服务器为悉尼、墨尔本和珀斯的三个第3层服务器提供服务。 更下层是客户端设备。在此语境下,“客户端”不是指笔记本电脑或手机,而是整个移动网络基础设施,例如处理基站切换的节点。整个地理区域分布着成千上万个节点,每个节点都需要在数百万分之一秒的精度内对“现在时刻”达成共识。 TAP报告将此架构描述为“功能完备”,并称其为Telstra提供了“来自NMI的高可靠性权威时间参考源”。 分层等级本身不表示时间是否准确,仅反映服务器与参考源之间的跳数。一个使用错误参考源的第1层服务器仍然是第1层服务器。 ## 防范错误时间源 NTP需要防御错误时间源。实际上,它具备两种不同的防护机制,且两者相互独立运作: 1. 在同等候选源中,层级越低权重越高。这是客户端选择参考源的机制。 2. NTP比较多个参考源,剔除与多数不符的源。单一源声明的异常时间会被否决并丢弃,无论其声称多权威。 这些防护措施并非针对特定故障类型;它们共同防御故障接收器、配置错误的服务器或外部攻击。但这些措施仅在客户端监听的时间源真正相互独立时才能生效。 ## NTP的两种部署方式 NTP可通过两种方式部署。在客户端/服务器模式中,关系明确且单向:节点仅从指定服务器获取时间。 2010年Telstra的部署实际就是这种客户端/服务器模型。允许同层对等互联,但TAP报告指出,这种设置是“功能完备”的。 另一种是对等(peering)模式,节点相互交换时间并根据算法当前偏好选择源。 对等模式灵活且能在源丢失时优雅恢复。但这意味着生产环境拓扑是动态生成而非预先设计的。文档记录的架构可能悄然重组为未经批准的形式。 ## Telstra的2020年升级 2020年,移动核心网时序系统完成升级,安装了新硬件,包括新的NTP时序机箱。这次安装引入了若干变化。 第一个变化是强制性的。新机箱无法让第2层服务器为同一机箱内的第3层服务器提供服务,因此两者必须跨机箱布线:悉尼第3层服务器从墨尔本第2层获取时间,墨尔本第3层服务器从悉尼第2层获取。 实际上,每个站点原本有两个第2层源,现在只剩一个。TAP报告指出,这种冗余降级已被知晓并接受。第二个变化是放弃客户端/服务器模式,改用对等模式。报告未说明动机,但合理推测是为了补偿冗余损失——每个站点仅有一个源,让服务器自主寻找替代源可增强弹性假象。 TAP报告明确指出冗余性损失已知,但未发现任何证据表明团队识别了由此产生的“时序环路”风险。 ## 什么是时序环路? 时序环路类似于通过询问三个互相传话的人来验证谣言的真实性。每个人都同意,因此必定属实。NTP的工作原理基本相同:比较多个源并剔除异见者。 如前所述,NTP具备两种防御机制。第二种用于防御时序环路,但仅当源真正独立时有效。在环路中,表面独立的源实际上直接或间接通过共享参考源相互获取时间。 一旦错误值开始传播,各源将相互印证,投票机制会倾向于多数派意见,即使该值是错误的。 ## 协议正常工作,架构失灵 NTP的两种防御机制在墨尔本先后失效,间隔五年。并非故意为之,而是源于两个各自合理的决策:一次是为了绕过硬件限制,另一次是为了消除反复出现的故障。每个决策都解决了眼前问题,但无人评估所有决策的累积效应。 第二种防御机制最先失效。2020年引入对等模式使时序环路成为可能,五年后这种环路果然出现。墨尔本某服务器开始从其下级节点获取时间。这本应触发警报,但由于准确时间仍通过其他路径到达网络,未造成实际损害。循环依赖的根本问题依然存在,但无人提交工单处理。 表面问题十分明显:墨尔本频繁与其唯一的悉尼第2层源失联。由于缺少备用配置,服务器通过对等机制寻找替代源,有时会选择层级低于自己的节点。 2025年10月,工程师启用了墨尔本机箱中自2020年起闲置的GPS接收器,将其连接到第3层服务器,作为不可靠悉尼源的替代。 从所有可观测指标看,此举似乎奏效:墨尔本获得了自主可靠源,警报停止。但这个修复仅治标不治本。无人查明墨尔本为何持续丢失悉尼源。到2026年7月,根本问题依然存在于网络中。 更糟的是,似乎无人意识到启用GPS卡对架构的影响。通过添加GPS卡,墨尔本服务器从第3层升至第1层。工程师并非在现有源旁添加新源,而是将服务器提升至与国家参考源同级,在体系顶端创建了新源。对NTP而言,它们具有同等权重。 突然之间,墨尔本机箱中这张未经评估、仅作为权宜之计安装的GPS卡,成为了澳大利亚最大移动网络时序体系中的最高权威源。 毋庸置疑,2010年的设计已荡然无存。 到2026年7月,网络中存在一个既是最高权威候选源又不受制衡的单一源——因为可能质疑它的源都处于其下游。 这种行为极难察觉:网络多年来每日提供精确时间。此类架构不会渐进退化,它们持续运行,直至突然崩溃。 ## GPS周数翻转特性 第二个关键因素是GPS的已知特性。 GPS通过周数加周内秒数广播时间,自1980年1月初的纪元开始计数。主要民用GPS信号中,周数字段为10位,即最大1023周。每1024周(约19.6年),计数器会重置。这已发生两次:1999年8月和2019年4月。 接收器需要计算当前属于哪个纪元周期,并添加正确的1024周倍数。此信息需固化在固件中。 澳大利亚发生的问题并非GPS周数翻转的延迟影响。墨尔本的接收器在2019年第二次重置时运行正常,因为持续运行的接收器会持续计数,只需将新周数累加,无需判断所属纪元。 但一旦关闭设备,此信息就会丢失。重新启动时,接收器必须重新推算纪元,而依据仅为固件假设。墨尔本设备的固件未更新,启动时沿用了早期纪元,将日期设置为1024周前的2006年。 随后发生的情况最好理解为:两大防御机制在最需要时同时失效。 第一种防御机制——低层级权重大——将墨尔本服务器评为最高权重,因为附带的GPS卡将其提升为第1层服务器。这符合NTP协议,引导客户端选择这个偏差1024周的源。 第二种防御机制——剔除异见者——从未启动,因为已无其他源可指认墨尔本为异类。NTP不判断日期合理性,仅比较源间是否一致。2010年架构有双第2层服务器,若其中一个广播2006年,另一个仍保持2026年,共识无法形成。虽然不理想,但至少错误日期不会传播。 但墨尔本的第2层备份已被同次硬件更换关闭,剩余源均处于墨尔本下游。当错误日期传播时,它们开始回传。共识逐渐形成,而算法追求的正是共识。 客户端于是按设计运行:当多数源达成2006年11月的共识后,客户端接受该日期,且日期传播越广,其“可信度”越高。 两种防御机制均未故障,只是被剥夺了运作前提:一个需要值得优先选择的源,另一个需要能提出异议的源。两个相隔五年的决策先后移除了它们。 ## 事件关键教训 ### **将时间和频率分配列为关键基础设施并优先管理** 记录所有可能导致全网瘫痪的功能,并将时序列入清单。分类不仅是文书工作,它决定变更风险等级、审查深度、人员配置、监控覆盖和预算优先级。Telstra报告本质上就是一个清单缺失条目及其连锁反应的故事。 ### **完整记录基础设施及所有变更** 没有集中的NTP配置库、黄金配置文件,除设备本身外无服务器文档记录。缺乏记录就无法进行有效预检,无法评估影响,事故中也无法判断“正确”状态应有的样子。 ### **构建能力冗余** 两名工程师执行了变更,

相似文章

全美GPS误差高达33英尺

Hacker News Top

科学家发现,2025年11月的一场太阳超级风暴导致美国全境GPS出现前所未有的广泛干扰,误差高达33英尺,可能影响精准农业和自动驾驶汽车。

NTP之前:Time与Daytime协议

Jeff Geerling

本文探讨了早期的网络时间协议,RFC 867(Daytime)和RFC 868(Time),它们在NTP之前提供了更简单的时间同步,讨论了它们的方法、局限性和历史意义。