这家云安全公司于 7 月 19 日宣布,美国、英国、澳大利亚、南非和其他国家的 Windows PC 遭遇重大中断,原因是 CrowdStrike Falcon 传感器更新中的错误。紧急服务、机场和执法部门报告称出现停机。关于850 万台 Windows 设备受到影响。
CrowdStrike 于 7 月 24 日表示,该问题源于 Falcon 传感器中的快速响应内容更新。此类更新旨在响应快速移动的威胁,并使用模板实例来定义特定行为。 7 月 19 日,CrowdStrike 在一篇文章中写道,“由于内容验证器中的错误,两个模板实例之一尽管包含有问题的内容数据,但仍通过了验证”初步事后审查。 CrowdStrike 写道,内容验证器是一个“在发布内容之前对其进行验证检查”的程序。模板实例通过了其他质量检查,但是由于存在错误,错误被允许传递到部署。
“当传感器接收并加载到内容解释器中时,通道文件 291 中的有问题的内容导致内存读取越界,从而触发异常,”CrowdStrike 写道。 “无法妥善处理此意外异常,导致 Windows 操作系统崩溃 (BSOD)。”
正如之前报道的那样,该问题并非源于内核驱动程序。
在本视频中,我们深入探讨了 CrowdStrike 是什么、其 Falcon 软件的工作原理以及最近影响数百万台 Windows 计算机的更新事件。
受影响的组织遇到了臭名昭著的蓝屏死机,即 Windows 系统崩溃警报。美国航空、联合航空和达美航空的航班由于影响航空公司 IT 系统的问题,航班于 7 月 19 日上午延误。英国媒体天空新闻报道了自己的电视中断周五早上。新罕布什尔州紧急服务部门据报道,周五早些时候 911 服务中断后已恢复上线。
CrowdStrike 周五表示:“该问题已被识别、隔离,并已部署修复程序。”然而,一些最初受到影响的机器仍然出现断电的情况。
Microsoft 365 报告服务降级警告周五早上,但这似乎是一个单独的事件。
根据 Gartner 通过电子邮件发送给 TechRepublic 的数据,到 2023 年,CrowdStrike 占安全软件细分市场和地区软件总收入的 14.74%。微软赚了40.16%。
参见:全球最大的公司因停机而付出代价据 Splunk 称。
如果企业受到 CrowdStrike 中断的影响,可以采取哪些措施?
第一步是确定哪些主机受到影响。从那里开始,遵循CloudStrike 的说明用于修复或恢复 Windows。
周六,微软发布了恢复工具使用 USB 或预启动执行环境。
周五,微软建议重新启动 Azure 虚拟机运行 CrowdStrike Falcon 代理。这可能需要多次重新启动,一些用户报告在多达 15 次后成功。其他选项包括从早于 7 月 18 日 04:09 UTC 的备份进行还原,或者尝试使用修复虚拟机修复操作系统磁盘。
Forrester 副总裁兼首席分析师 Andras Cser 在通过电子邮件发送给 TechRepublic 的一份准备好的声明中表示:“由于更新的部署方式,受影响机器的恢复选项是手动的,因此受到限制。” “管理员必须为每个受影响的系统连接一个物理键盘,启动到安全模式,删除受损的 CrowdStrike 更新,然后重新启动。一些管理员还表示,他们无法访问 BitLocker 硬盘驱动器加密密钥来执行修复步骤。”
CrowdStrike 建议其客户与 CrowdStrike 代表保持联系。组织,即使是那些没有直接受到影响的组织,也应该与他们的 SaaS 合作伙伴联系,看看他们是否可能遇到问题。
谨防错误信息
由于这一事件影响的主要组织范围如此广泛,因此出现错误信息的可能性很高。
美国国家安全局前网络安全专家埃文·多恩布什在给 TechRepublic 的电子邮件中表示:“关于如何重新配置计算机或删除哪些关键系统文件,将会有很多错误信息。” “不要成为下载虚假解决方案的受害者。”
周六,CrowdStrike 强调了一项针对讲西班牙语的 CrowdStrike 客户的恶意软件活动,该活动伪装成针对中断的修复程序。根据 CrowdStrike 的说法,该恶意软件是一个附加到虚假“自动恢复实用程序”的 ZIP 文件。博客文章。
“现在是反思密码管理的好时机,因为修复最终可能需要对相当长一段时间没有重新启动的系统进行管理访问,”多恩布什说。
评估您的恢复计划并支持您的团队
评估您的组织对某一提供商或服务的依赖程度,并确保您的组织拥有强大的恢复流程。
对于 IT 团队领导来说,这也是确保其员工获得所需支持的好时机。
Forrester 首席分析师艾莉·梅伦 (Allie Mellen) 在通过电子邮件发送给 TechRepublic 的一份准备好的声明中指出:“周五晚上,一些地区发生了这种中断,当时人们正在回家过周末。” “像这样的技术事件需要全员齐心协力,您的团队将在周末 24/7 全天候工作以进行恢复。通过确保您的团队获得足够的支持和休息时间来支持您的团队,以避免倦怠和错误。明确传达角色、责任和期望。”
当联系到 TechRepublic 寻求评论时,CrowdStrike 指示官方声明。
CrowdStrike 正在采取什么措施来应对?
在 7 月 24 日的初步事件后审查中,CrowdStrike 表示正在采取以下步骤来改进其部署流程:
“软件弹性和测试
- 通过使用以下测试类型来改进快速响应内容测试:
- 本地开发者测试
- 内容更新和回滚测试
- 压力测试、模糊测试和故障注入
- 稳定性测试
- 内容界面测试
- 向内容验证器添加额外的验证检查以实现快速响应内容。一项新的检查正在进行中,以防止将来部署此类有问题的内容。
- 增强内容解释器中现有的错误处理。
快速响应内容部署
- 为快速响应内容实施交错部署策略,从金丝雀部署开始,将更新逐渐部署到传感器基础的较大部分。
- 改进对传感器和系统性能的监控,在快速响应内容部署期间收集反馈以指导分阶段推出。
- 通过允许精细选择部署这些更新的时间和位置,为客户提供对快速响应内容更新的交付的更大控制。
- 通过发行说明提供内容更新详细信息,客户可以订阅这些内容。”
随着更多信息的出现,本文已进行更新。 TechRepublic 已联系微软征求意见。
