开发者生态
evening
人工智能处理事件,工程师与系统失去联系
2026-09-05
1 阅读
约5分钟阅读
sylvainkalache
字号:
2012 年,当我在 LinkedIn 担任 SRE 时,我设计了一个可以自我修复并从之前的事件中学习的系统。人工智能的能力远不及我们今天所拥有的,这仍然是一个原型,但现在已经成为现实。这些工具可以完成这一切:检查警报、形成假设、查询遥测、关联最近的部署,甚至自行实施修复。尽管我很喜欢看到它,但我有一个主要担忧:我们正在与我们的系统失去联系。这些工具在解决常规事件方面做得越好,人类响应人员获得的实践就越少。当发生自动化无法解决的模糊且严重的事件时,响应工程师就会遇到麻烦。这些人工智能辅助的事件响应工具,通常被称为“AI SRE”——我不太喜欢这个术语——在很多方面都非常棒。当他们在晚上处理例行事件时,你会感觉特别神奇,而你不必因为能力问题而醒来。问题在于,常规事件也是响应者如何“安全”地形成对其系统行为和故障的直觉的方式。当人工智能遇到无法解决的前所未见的困难事件时,工程师将不得不以比以前更少的练习来接手。人为因素研究员 Lisanne Bainbridge 在她 1983 年著名的论文《自动化的讽刺》中描述了这一悖论。她解释说,自动化减少了操作员练习日常工作的机会,同时让他们对新的和异常情况负责。因此,她认为操作员需要比自动化之前更加熟练并接受更多的培训。在未来的几年里,我预测大多数事件的平均 MTTR 将会下降——这要归功于人工智能辅助的事件响应——但复杂事件的解决时间将会急剧增加,因为事件响应者与他们的系统失去了联系并且正在努力调查。我们可以从航空业中寻找灵感。飞机自动化处理大部分飞行任务,但飞行员仍然要对自动化无法处理的情况负责:发动机故障、仪表不可靠、起飞失败、失速和其他异常情况。这些事件极为罕见。例如,现代涡轮发动机每 100,000 个发动机飞行小时中发生的飞行中停机次数少于一次。换句话说,这种情况非常罕见,以至于商业飞行员可以在没有经历过模拟器之外的情况下完成整个职业生涯。但当发生故障时,飞行员必须快速、正确地做出反应。例如,复兴航空 235 号航班起飞后不久,右侧发动机的螺旋桨自动羽化。虽然这架飞机被设计为继续使用左侧发动机飞行,但机组人员错误地识别了问题。第一次警告后仅 117 秒,飞机就失速并坠毁。航空公司飞行员定期返回模拟器,演练罕见的紧急情况。根据美国联邦航空局的规定,机长必须每六个月完成一次复训或一次能力检查,包括起飞期间发动机故障等情况。虽然大多数软件事件不会威胁生命,但这并不是我们不完善我们技术的理由。事实证明,造成问题的技术也可以帮助解决问题。在我工作的 Rootly,我们与 Uptime Labs 合作,通过真实的事件模拟应用这一想法。工程师在模拟电子商务中断期间担任事件指挥官,使用可观察性工具,同时与 Slack 中由法学硕士支持的利益相关者进行协调。结果感觉很真实。您必须调查出了什么问题,同时保持响应有序并与首席执行官和客户支持打交道。您可以练习在事件发生期间重要的技能:理解不完整的信息、清晰地沟通、协调人员以及实际执行响应。但是使用人工智能作为培训师怎么样呢?响应者可以要求代理解释其采取的步骤、检查的信号以及诊断背后的证据。但解释和观察并不能代替实践。您可能会从观看塞雷娜·威廉姆斯 (Serena Williams) 比赛中学到一些东西,但您只能通过上场来学习网球,事件响应也不例外。我花了五年多的职业生涯围绕渐进式教育建立了一所软件工程学校:边做边学。这是面对面的,但我们没有老师;学生们从事项目而不是听讲座。当 Dropbox 告诉我它雇用的毕业生在故障排除方面仍然缺乏经验时,我创建了一些项目,为学生提供损坏的基础设施,并要求他们诊断和修复它。对于大多数实践技能,我相信实践教育比被动教学要好很多。随着法学硕士承担更多的工作,工程团队面临着积累理解债的风险:他们的系统如何工作和响应者对它们的理解程度之间的差距越来越大。工程师应定期与系统互动
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱