AWS DevOps 代理客户
了解全球各地的组织如何利用 AWS DevOps 代理减少 MTTR,预防未来事件,并推动持续运营改进。
Audible
Audible 是领先的音频叙事内容制作商和提供商。我们的目录中拥有超过一百万种作品,与全球众多知名品牌以及新锐人才合作,为全球 180 多个国家/地区的听众提供独具特色的原创内容、有声书和播客,涵盖 50 种语言。
自部署 AWS DevOps 代理以来,Audible 的运营团队平均仅需 8.5 分钟即可完成事件处置:在 81% 的场景中,代理的处置效率完全优于纯人工操作模式,单起事件可节省超 100 分钟的耗时。
“AWS DevOps 代理已成为我们永远在线的第一响应者,与我们的运营团队并肩工作,让他们在每一起事件上都能立即抢占先机。最大的成果出现在夜间发生的高严重性事件中,代理能在几分钟内完成根本原因分析,每起事件最多节省 20 小时的时间,并帮助我们的工程师更快解决问题。准确率达到 84% 且逐月提升,且各团队的采用速度不断加快,我们正从被动应对故障转向主动的可靠性工程。”
- Sanjeev Kumar,Audible 软件开发总监
Banco Bmg
在拥有 94 年历史、客户超过 910 万的金融机构 Banco Bmg,我们相信数字运营的未来将由可观测性、自动化和人工智能的结合所驱动。我们部署了 AWS DevOps 代理,能够每天自主调查超过 350 起在运行于 Amazon EC2、Amazon EKS、Amazon MSK、Amazon ECS、Amazon RDS 及其他关键平台服务上的高度分布式环境中发生的生产事件。
AWS DevOps 代理将操作信号转换为实时可执行的情报。该解决方案已映射了超过 57000 项服务与实体之间的关系,自动关联部署、变更事件、代码优化举措以及业务影响,并持续分析超过 1TB 的应用程序日志。结合 Dynatrace 基于因果关系的可观测性以及自主调查能力,这一基于人工智能的方法帮助我们大规模提升了运营韧性,实现了移动应用程序登录时间减少 87%,API 响应时间低于 100 毫秒,并使平台每月可处理超过 20 亿个请求。我们不仅在实现运营自动化,更致力于构建以性能、可靠性和客户体验为核心的自主性人工智能驱动运营基础。
Banco Bmg 技术经理 Jadson dos Reis Vieira
Clariant
作为全球领先的特种化学品公司之一,Clariant 为来自多个行业的客户提供创新和可持续的解决方案,为创造价值做出贡献。我们的数字运营支持从供应链管理到客户门户的各个方面,而系统的可靠性对于高效服务客户至关重要。自从部署了与 Dynatrace 集成的 AWS DevOps 代理以来,我们亲身体验到了这种组合如何转变我们的云运营方式。Dynatrace 可全面监控我们的基础设施和应用程序性能,一旦出现问题,可立即识别受影响的系统,并量化其对业务的影响。然后,AWS DevOps 代理进一步通过自主调查我们的 AWS 环境,精准定位导致问题的特定基础设施变更和配置问题,并提供可执行的缓解方案。这种集成消除了我们的运营团队手动从多个 AWS 服务中收集数据,或花费宝贵时间在不同系统之间关联事件的必要性。
作为一家业务遍及多个大洲的特种化学品公司,缩短理解和解决云基础设施问题所需的时间,将直接影响我们为客户提供服务的能力。AWS DevOps 代理提供的自动调查能力,结合 Dynatrace 的深度可观测性洞察,显著提升了我们 IT 团队的工作效率,而每次调查的详细发现也持续丰富我们的运营知识库。这些高效的云运营工具直接支持我们在特种化学品行业推进数字化转型进程中的更广泛业务目标。”
- Daniel Galera,Clariant 云工程高级 IT 经理
澳大利亚联邦银行(CBA)
澳大利亚联邦银行是澳大利亚领先的综合金融服务提供商之一,为超过 1700 万客户提供服务。该银行的云基础小组管理着超过 1700 个 AWS 账户,并为数千名工程师提供集中式云操作服务。对下一代内部平台进行原型设计时,该团队复制复杂的网络和身份管理问题,以测试 AWS DevOps Agent。经验丰富的 DevOps 工程师可能需要数小时才能确定这些类型的问题,而代理 15 分钟内即可查找到根本原因。“AWS DevOps Agent 如同经验丰富的 DevOps 工程师般思考与行动,助力我们的工程师构建更快速、更具弹性的银行基础设施,旨在为客户提供更出色的体验。这不仅关乎缩短问题解决时间,还关系到维持客户对我们的信任。”
“AWS DevOps Agent 与现有的企业工具(包括 ServiceNow、Splunk 以及自定义 MCP 服务器)无缝集成,使其对我们的运营更具价值。对于 CBA 而言,这将带来重大机遇。我们正在探索如何将其扩展至所有平台团队,并帮助每位内部客户充分利用这些功能。通过 Grafana 和 Prometheus 与我们现有 SLO 进行集成的能力,使其对我们的运营更具价值。AWS DevOps Agent 正助力我们为数百万澳大利亚人构建更具弹性、更高效的银行基础设施。”
- Jason Sandery,澳大利亚联邦银行云服务主管
Deriv
Deriv 是全球最大的在线经纪商之一,为全球超过 300 万交易者提供服务。Deriv 在其屡获殊荣的直观交易平台上提供丰富的交易类型,涵盖热门市场上的 300 多种资产。在 Deriv,我们凭借技术创新铸就 25 年的辉煌历程,如今更在全公司范围内践行人工智能优先的战略方针。自部署 AWS DevOps 代理以来,该服务已成为我们的事件响应工作流的核心部分。当警报触发时,代理会立即开始关联指标、日志和基础设施依赖项,以找出根本原因,通常在首次警报发出后几分钟内提供根本原因分析。这项工作此前需要我们的工程师手动整合来自多个工具和系统的信息。通过与我们现有的 AWS 及第三方工具链无缝集成,我们的平均解决时间减少了超过 40%,工程师手动调查的时间也至少缩短了一半。AWS DevOps 代理实现了我们以人工智能为核心的愿景,为工程团队提供一个智能且全天候的运营合作伙伴,助力提升可靠性并带来卓越的客户体验。
- Najib Huq,Deriv 高级工程经理
作为全天候运行的受监管交易平台,Deriv 在代码进入生产环境之前,会严格遵循安全、加密和可靠性标准进行每项代码更改。AWS DevOps 代理的发布管理功能现在会自动对工程组织以及多个 GitHub 组织中的每个拉取请求进行审核,以自然语言规则执行我们的策略,并在几分钟内返回明确的 SAFE、CAUTION 或 BLOCK 判断,而这一审查通常需要数小时,有时甚至一整天。在最近的一次审核中,它捕捉到了一些我们本会忽略的关键问题,包括一个数据库权限漏洞,该漏洞在生产环境中会静默失败,以及一个长期运行服务中的内存泄漏问题。我们现在正在扩展该功能,通过代理的发布测试实现自动化 UI 和 API 测试,同时其跨存储库依赖项图使我们的 SRE 团队在事件发生时能够更快地了解影响范围。
— Ngeo Jia Jun 和 Nihal Faisal,Deriv 的高级工程师
Dhan.co
“Dhan 是领先的股票、期权、期货及大宗商品在线交易平台,为超过 120 万活跃客户提供服务,每日处理交易量逾 900 万笔。对于我们这样的受监管交易平台而言,保持高可用性至关重要。我们期待 AWS DevOps Agent 的自动化分析和上下文相关建议能帮助我们的团队确保服务交付的一致性。该代理在遵守合规标准的同时,能够从我们运营模式中学习的能力,将在我们延长交易时段(从市场开盘到深夜交易时段)展现出特别的价值。我们预计 AWS DevOps Agent 将增强我们维护可靠交易基础设施的能力,并满足严格的金融服务要求。AWS DevOps Agent 与我们现有的监控堆栈集成后,将帮助我们整合多个系统的警报并简化我们的运营流程。”
- Alok Pandey,Dhan (Raise Holdings) 的联合创始人兼首席技术官
Granola
Granola 是一款基于人工智能的笔记工具,能够高效完成转录和摘要工作,让客户可以全神贯注,不会被手动记笔记分散注意力。AWS DevOps 代理可无缝集成到 Granola 的人工智能驱动型事件管理工作流中,以加速根本原因分析,并缩短平均解决时间。Granola 的 Eddie Bruce 说:“我们已将 AWS DevOps 代理直接集成到我们的事件响应流程中,它会自动触发对高严重性 CloudWatch 警报的调查。”“DevOps 代理的数据库调查功能在我们评估过的其他工具中始终表现更优,尤其是在分析 PostgreSQL 日志和提取 RDS 性能洞察方面。随着我们扩展 SRE 能力,DevOps 代理已被证明是我们事件管理工具包中可靠的一部分。”
- Eddie Bruce,Granola 产品工程师
Infor
“AWS DevOps 代理正在帮助我们转变基础设施问题的调查与解决方式。该代理的预防性分析识别出各类事件中的共性模式,并在问题影响生产前提出改进建议。这使我们从被动应对转为主动优化。在测试环境中进行预览测试时,该代理仅需极少输入即可成功诊断出 VPN PSK 不匹配、路由配置错误、CloudFormation 失败以及性能问题。其深入的技术分析不仅关注症状,还涵盖网络、应用程序和基础设施层面的底层模式。与 CloudWatch 日志的集成、自动化技能创建以及学习型拓扑发现将显著加速我们的 DevOps 实践。”
- Jim Plourde,Infor 的云服务执行副总裁
皇家墨尔本理工大学
“事实证明,AWS DevOps Agent 会成为皇家墨尔本理工大学实现零接触工程的变革性工具。作为一所享誉全球的知名学府,我们为超过 105000 名学生及 12000 名教职员工与研究人员提供服务,不断拓展云创新的界限。AWS DevOps Agent 的卓越之处在于其能够对整个登录区拓扑进行推理,将工作负载、网络和管理账户之间的关系理解为紧密关联的生态系统。我们已通过测试和观察,该工具能在数分钟内剖析复杂的部署问题,识别出通常需要跨多个团队进行大量人工排查的网络通信问题和依赖冲突。这种级别的智能自动化将使我们的故障排除周期从 4-7 小时缩短至 30 分钟以内。我们正在此处构建主动、智能且日益自主的云运营未来。”
- Ken Mirvis,皇家墨尔本理工大学云工程高级经理
T-Mobile
“当 AWS 推出 DevOps 代理时,T-Mobile 从一开始就参与其中。作为设计合作伙伴,我们亲眼见证了 AWS DevOps 代理如何显著提升生产环境中的根本原因分析能力。来自用户的真实反馈直接影响了产品的演变方式。
我们的基础设施跨越多个云环境和本地环境,并将应用程序日志集中存储在本地的 Splunk 部署中。AWS DevOps 代理能够与 Splunk 无缝集成,并在这些不同环境中对日志进行分析,这一功能的实现对我们继续测试该解决方案起到了重要作用。”
- Aravind Manchireddy,T-Mobile 技术运营高级副总裁
TP ICAP Group
TP ICAP Group 是一家全球金融市场基础设施和数据提供商,在 28 个国家/地区开展业务,拥有 5200 多名员工。该公司已转向以云原生架构为主,其超过 80% 的技术资产运行在云平台上,并在开发和运营全生命周期中嵌入人工智能,以支持扩展性、韧性和运营效率。应用程序的正常运行时间对于维护客户信任至关重要。TP ICAP Group 的生产团队为所有业务线和支持职能提供支持,负责监督约 300 个客户账户和 500 多个应用程序,每个应用程序均按其业务重要性进行分类。
“我们的重点是从被动支持模式向更主动、以数据为导向的方式转变。我们正在使用自动化和基于人工智能的功能,包括 AWS DevOps 代理,来支持日常运营以及我们对变更的管理方式。
“这建立在已有的运营基础之上,尤其是在版本管理与生产就绪度相关的环节中——这类场景下,一致性与管控能力至关重要。
“发展的一个关键领域是我们如何评测变革风险。通过将更结构化、由数据驱动的洞察融入发布内容中,我们可以在生命周期的早期阶段识别潜在问题。我们目前正在试用 AWS DevOps 代理版本管理,以通过增强对代码变更的分析来帮助识别依赖项,突出潜在缺陷,并提高风险评测的一致性。
“早期结果表明,在复杂集成系统中,各类变更之间的相互影响关系已实现了更高的可视性。随着时间的推移,这有助于在构建、部署和运行过程中做出更明智的决策,帮助我们保持韧性与控制力,同时持续以稳定的速度交付。”
-Darren Bird,TP ICAP 集团生产负责人
United Airlines
United Airlines 每天运送超过 50 万名乘客。我们在混合云环境中部署了约 38000 个 Dynatrace OneAgents 监控,涵盖 500 多个 AWS 账户、20000 个 AWS Lambda 函数、Amazon ECS 微服务以及众多其他服务。在这种规模下,我们此前曾在不同领域使用多款功能相同的工具,这在故障排查过程中导致了信息断层和黑箱现象。配备 Dynatrace 的 AWS DevOps 代理彻底改变了这一现状。Dynatrace 能快速准确地检测问题,定位到相关应用程序层,随后代理会进行进一步调查,并提供精准的解决步骤——所有信息都会直接反馈至 Dynatrace。现在,我们无需在凌晨 3 点发起事件呼叫并来回切换工具,而是能通过单一管理平台直接获得答案。
- Jason Eckhart,United Airlines 可靠性和可观测性首席工程师
Verisk
“AWS DevOps 代理转变了我们的 DevOps 团队跨多个账户对复杂基础设施进行故障排除的方式。我们正在成功将它与 New Relic 一起用于事件管理,它在我们的调查中承担了大部分繁重的工作。最令我们印象深刻的是 DevOps 代理如何将我们的遥测数据与 New Relic 关联起来,以提供全面的事件调查。它能快速地将各个点连接起来,而这些在以往对我们的团队来说需要耗费大量时间,例如评测负载增长、配置变更、权限调整以及跨多个服务的问题。它常常会检查我们最初甚至未曾想到要查看的路径,从而为我们提供可操作见解,帮助我们立即解决问题。这在我们的业务中至关重要,因为数据的准确性与系统的可靠性直接影响客户的风险评测能力。
代理空间聊天功能在故障排查和对事件模式的元分析方面发挥了重要作用,有助于识别更广泛的改进机会。我们已将多个区域和账户(生产环境与非生产环境)进行连接,以便在调查期间实现跨环境对比,从而增强我们的运营韧性。效率的提升转化为每月节省的宝贵时间,我们现在将这些时间重新投入到战略性举措中,而不是用于救火。
减少故障排查时间意味着更少的上下文切换,使我们的团队能够保持专注,并借助新功能和举措,加快步伐。我们提供的 DevOps 代理集成越丰富,其性能就越好。因此,我们很高兴将技术堆栈的其他部分连接起来,并探索其主动检测功能,以便在问题影响客户之前及时发现。我们认为 DevOps 代理将成为我们卓越运营战略的核心部分。”
- Elliot Markowitz,Verisk 信息技术承包解决方案副总裁
西部州长大学(WGU)
西部州长大学(WGU)是一所领先的在线大学,服务于超过 19.1 万名学生,该校是首批将 Amazon DevOps 代理部署到生产环境的机构之一,其部署时间甚至早于 re:Invent 上的预览版发布。作为 Dynatrace 的大规模用户,WGU 利用 DevOps 代理原生的 Dynatrace 集成功能,使 Dynatrace Intelligence 能够自动将问题记录路由至代理进行调查,并将丰富的调查发现直接反馈回 Dynatrace。
在最近的一次生产调查中,WGU 的 SRE 团队利用 DevOps 代理分析了服务中断事件,将预计的总解决时间从两小时缩短至仅 28 分钟,MTTR 因此提升了 77%。该代理迅速锁定了 Lambda 函数配置中的根本原因,并揭示了此前仅存在于未被发现的内部文档中的关键运营知识。
“它提供了确凿证据,证实问题出在 Lambda 上。此次调查的指标几乎无可挑剔,与我们在前端观察到的情况完全吻合。” 他补充道:“昨天是一次巨大的胜利,如果我们能继续加快发现的步伐,我无法形容这对我们的组织来说会有多么大的成功。”WGU 技术运营总监 Angel Marchena 表示。凭借计划利用 DevOps 代理技能功能,WGU 有望进一步缩短调查时间。
-Angel Marchena,WGU 技术运营总监
Zenchef
Zenchef 是一个餐厅技术平台,通过单一的免佣金系统帮助餐厅管理预订、桌位运营、电子菜单、支付以及顾客营销。一支专注于 DevOps 的团队负责管理多个业务部门的多个生产环境。公司在举办黑客松期间,出现了影响下游合作伙伴的 API 集成问题时,他们面临了一场真正的考验:当时的工程师正忙于活动,而监控系统中又没有显示出任何有价值的线索来指引他们找到问题所在。
团队并未让工程师退出黑客松,而是将问题提交给了 DevOps 代理。该代理系统地排查了问题,排除了身份验证作为诱因的可能性,将调查重点转向了 ECS 部署,最终将根本原因追溯到代码回归问题——新版本无法处理数据库中未识别的枚举值。整个调查过程仅耗时 20 至 30 分钟,与手动操作所需的 1 至 2 小时相比,耗时缩短了约 75%,调查发现也直接分享给了负责的工程师。
“在黑客松期间,我们几乎没有可用的带宽来进行调查——而且我们也不需要。我们总是力求抢先一步,否则这种主动调查往往难以实现。DevOps 代理正在开辟新的途径,帮助我们理解平台的行为。”
- Theo Massard,Zenchef 平台工程经理
合作伙伴和云托管服务提供商
Axrail
在 200 多个 AWS 账户中运行 MSP 意味着我们的运营团队始终处于事件之中。每花一分钟诊断 Lambda 故障,就少了一分钟用于提升客户环境的可靠性状况。这就是我们向 AWS DevOps 代理提出的问题。
我们让它经受真实的调查,而非合成基准测试。五个生产 Lambda 错误案例,每个都伴随着杂乱的日志、零散的可观测性信号以及近期的部署变更,需要逐一排查。该代理在每一个案例中都准确找到了根本原因。我们的平均解决时间从每个事件 15 到 20 分钟降低到 7.6 分钟,MTTR 减少了 50%。我们每月处理 100 多起 Lambda 事件,平均每月可为团队节省 20 到 25 个工程师工时。现在用于架构审核、主动监控和面向客户的改进的时间,而不是重复的分类工作。
我们采用 AWS DevOps 代理并不是因为幻灯片上的数据看起来不错。我们采用它是因为我们的工程师不再想回到旧的工作方式。现在,它已嵌入我们面向所有托管客户环境开展的事件响应流程工作中。
- Kelvin Kok,Axrail 首席架构师
Bespin Global
Bespin Global 是 AWS 核心级服务合作伙伴、2023 年度 AWS MSP 合作伙伴,作为一家全球公认的云 MSP,其业务覆盖亚太、北美与东南亚地区,为来自各行各业的企业到初创企业的数千名客户提供支持。
“我们的运营团队每天处理大量来自 Lambda、EKS、IAM、S3 等平台的事件。我们在 2026 年 3 月的公开预览期间测试了 AWS DevOps 代理,结果立竿见影:调查时间显著缩短,根本原因定位的准确性也明显提升——尤其是在容器/EKS 和 Lambda 问题上,这是我们的最高发生量事件类型。
AWS DevOps 代理的运行方式就像一位经验丰富的 DevOps 工程师。它能精准识别 IAM 角色和 S3 存储桶的配置错误,并提供可立即执行的修复方案,由我们的工程师快速实施。对于我们在全球范围内的 MSP 而言,这意味着降低 SLA 违约风险、减少 FTE 运营成本,并加快在整个客户组合中实现主动服务优化的进程。”
- Sunny Kim,Bespin Global 首席执行官、AWS 核心级服务合作伙伴和 2023 年度 AWS MSP 合作伙伴
Blazeclan
自 2010 年起,Blazeclan 作为 AWS 核心级云合作伙伴,被 2023 年 Gartner 魔力象限评为公有云 IT 转型服务的细分领域领先企业。如今,Blazeclan 是 ITC Limited 支持的 ITC 信息技术品牌,每月负责处理来自制造业、BFSI 和 CPG 领域的 50 多个 AWS 账户的超过 10000 起事件。我们拥有 750 多名云专家、250 多家遍布 41 个国家/地区的全球客户,以及分布在 17 个交付地点的超过 13000 名 ITC 信息科技员工。为此,我们评估了 AWS DevOps 代理,以提升大规模托管服务运营能力。
在涵盖 Lambda 错误、API 延迟以及 EC2/计算问题的 5 项触发调查中,代理使平均故障修复时间从 45 至 60 分钟缩短至 25 至 30分钟,MTTR 提升 35.00%,且平均仅需 6 分钟即可完成根本原因识别。我们预计,这样每月可节省约 35 FTE 小时,相当于每月节省 4000 美元的运营成本,并使我们的工程师能够从被动的分类转向主动提供客户价值和深入分析。
与 CloudWatch 和 New Relic 的集成非常顺畅,整个端到端的设置在 40 分钟内完成,且未对现有的工作流造成任何干扰。AWS DevOps 代理每年合同价值达 15 万美元,可避免 2 万美元的 SLA 违约罚金,并在 3 至 5 个客户账户中实现高达 5 万美元的 ARR 增长潜力,直接支持我们 2026 财年的战略重点,扩展服务组合中代理式人工智能的广泛应用,加速云迁移,并推动差异化行业解决方案。随着我们推出 AWS 联合品牌人工智能高管简报中心,并计划在 2026 财年实现 420 万美元的启动收入,我们认为 AWS DevOps 代理能够显著提升大规模运营效率和服务质量。”
- Varoon D. Rajani,Blazeclan(ITC 信息技术品牌)云优先业务线高级副总裁
Classmethod
我们已在超过 35000 个 AWS 环境中为 5000 多家企业提供了超过 10 年的支持,因此评估了 AWS DevOps 代理以提升我们的托管服务运营。在 200 项调查中,我们预计该代理可将识别根本原因的时间从平均 45 分钟缩短至约 8 分钟,预计提升 82%,且在正确识别根本原因方面预计具有 89% 的准确率。我们估计,这每月可减少约 120 小时的调查工作,从而带来显著的运营成本节省。与 Slack 和 Datadog 的集成预计将在 15 分钟内完成,且无需对现有工作流进行任何更改。我们的运营团队期待将这一能力转向更深入的分析和主动创造客户价值,以提升生产效率和服务质量。
- Satoshi Yokota,Classmethod, Inc. 首席执行官
CloudThat
AWS DevOps 代理将我们的平均调查时间从每起事件 45 分钟缩短至 10 分钟,覆盖了 Lambda、EKS、RDS 和 VPC 工作负载的 50 次调查,平均节省了 77% 的时间。该代理的根本原因识别准确率达到 84 %,且无误报,使我们的 DevOps 工程师摆脱了手动日志关联的工作,从而能够专注于问题修复。该代理每月管理 20 多个客户账户中的 50 到 60 起事件,已成为我们团队的增力因素。
该代理能够对多个 AWS 服务进行自动化根本原因分析,无缝关联 EC2、VPC、S3、EKS 和 IAM 等基础设施组件,从而将多服务检查整合为单一调查工作流。CloudTrail 配置变更关联功能可在事件发生期间自动识别配置变更,并将网络和安全变更与连接问题相关联。对于我们的 MSP 运营而言,这一能力已彻底转变了我们在 APJ 地区提供托管服务的方式。AWS DevOps 代理帮助我们扩展运营规模,同时保持客户所期望的高质量服务。
- Bhavesh Goswami,CloudThat(APJ 核心级 MSP 合作伙伴)创始人兼首席执行官
Hitachi Systems India Pvt.Ltd.
AWS DevOps 代理在所有验证场景中均实现了显著的 MTTR 降低和生产力提升。在 EKS 附加组件故障调查中,该代理在约 5 分钟内完成了分析,准确识别了根本原因,并在单一响应中提出了可操作的缓解计划,无需后续提示。与我们估计的 25-30 分钟手动基准相比,MTTR 降低了 80-83%,速度提高了 5-6 倍。它能够自主调查并在一次操作中准确返回根本原因分析,对于那些对准确性要求极高的复杂基础设施问题而言,是一大优势。
最令我们印象深刻的是该代理的运营成熟度以及调查过程的透明度。在 EKS 容器组(pod)调查期间,该代理透明地传达了其权限范围,提供了 RBAC 角色绑定分步说明,并在获得访问权限后成功完成了调查。这种自我校正的工作流对于生产环境确实非常有用。该代理通过包含时间戳、调查发现和预防性建议的逐步推理,显著增强了用户对分析过程的信任。针对 Inspector 漏洞上报,该代理可一次性输出面向管理层的安全汇总报告,内容覆盖 CVE ID、严重等级、CVSS 评分、漏洞利用可行性以及修复指导方案——这恰恰是可靠性工程团队的核心刚需。对于我们在 APJ 管理客户环境的 MSP 业务而言,这种自主调查能力以及可衡量的 MTTR 改善,构成了具有变革性的运营优势。对于每年处理 100 起相似的 EKS 事件的 MSP 而言,MTTR 缩短了 80-83%,这意味着仅此类事件每年就可节省大约 40-42 个工程师工时。
- Vivek Anand,Hitachi Systems India Pvt. 助理副总裁兼人工智能与开发运营业务主管Ltd. 技术团队负责人
Infosys
使用我们的生成式和代理式人工智能套件 Infosys Topaz,我们正在大规模释放人工智能的价值。Infosys 与 AWS 合作测试了 AWS DevOps 代理,通过关联基础设施异常、近期代码和配置变更,识别出根本原因并提出预防措施建议,显著加快了事件诊断速度,增强了 DevOps 和 SRE 的韧性。
- Balakrishna D. R.(Bali),Infosys 执行副总裁兼人工智能和垂直行业全球服务主管
Lancom Technology
“在我们的测试中,AWS DevOps 代理显著减少了调查事件所需的时间,尤其是在包含微服务和无服务器工作负载的复杂环境中。对于典型的 EC2 性能问题,通常需要 1 到 2 小时的人工调查,现在通过为代理提供正确的数据和上下文,已缩短至大约 10 分钟。这代表着每起事件的平均解决时间减少了 83% 至 92%,相当于每次调查可获得 50 到 110 分钟的生产力提升。这使我们的工程师能够专注于更具价值的工作,而无需手动在多个工具之间关联数据。您向代理提供的上下文越多,其调查发现就越具有可操作性和准确性。我们认为,AWS DevOps 代理有很大的潜力,可以在我们的托管服务实践中推动可衡量的运营效率改进。”
- Gregor Blaj,Lancom Technology 技术总监
LG-CNS
AWS DevOps 代理帮助我们在高度复杂的 AWS 账户中快速隔离并仅分析与我们的服务相关的资源。在我们的评估中,该工具在 EKS 和基于无服务器的架构中均表现出强大的根本原因分析准确性,同时提供了清晰且可操作的修复指导。值得注意的是,对于不太熟悉该系统的工程师而言,调查时间减少了 90% 以上,从数天缩短至约 30 至 40 分钟。尽管偶尔仍需要人工验证,但该代理显著加快了故障排除并提高了整体运营效率。”
- YoungSeok SONG,LG CNS 云发布中心副总裁
Megazone Cloud
作为韩国最大的战略云 MSP,我们管理着覆盖广泛客户组合的数千个 AWS 环境。我们的运营团队每天处理大量来自 Lambda、EKS、IAM 和 S3 工作负载的事件。我们对 AWS DevOps 代理进行了 28 项调查测试,结果立竿见影:根本原因识别准确率高达 66% 至 72%,在容器/EKS 问题上准确率达到80%,在 Lambda 错误(我们最高量的事件类型)上准确率为 75%。调查时间从 25–35 分钟缩短到仅 3–3.5分钟,提升了 7–10 倍。AWS DevOps 代理像经验丰富的 DevOps 工程师一样思维与操作,精准定位导致 AccessDenied 错误的 IAM 角色和 S3 存储桶配置,并提供可立即应用的 JSON 策略片段,供我们的团队快速执行。这不仅仅关乎更快的解决速度。对于我们这样规模的 MSP 而言,这直接降低了整个客户组合中的 SLA 违约风险和 FTE 开销,使我们的团队能够专注于主动优化服务,并为客户提供更优质的结果。
- Doug Yeum,韩国 AWS 核心级合作伙伴 MegazoneCloud 总裁兼首席执行官
NCS Australia
NCS Australia 将 AWS DevOps 代理作为事件调查工作流的第一响应工具部署,实现了跨多个 AWS 服务的日志、指标和配置数据的自动关联,从而取代了此前每起事件需要 20 到 40 分钟的手动分类处理。
“AWS DevOps 代理转变了我们的事件响应业务。我们的平均解决时间缩短了 73%,使我们的平均调查时间从 25 分钟缩短到仅 5 分钟。事件解决速度快了 3 倍。该代理在所有调查中均实现了 100% 根本原因识别准确率,能在 14 到 18 分钟内发现诸如 NGINX 服务故障、安全组配置错误以及 SSH 访问问题等缺陷,且无误报情况。对于我们的 MSP 运营而言,全天候管理多个客户环境,这意味着每月节省约 23 小时的工程时间,相当于释放出一个 FTE 的大部分工作量。让我们的团队能够专注于主动优化和战略性举措,而不是被动地进行故障排查。与 Amazon CloudWatch 以及我们现有的运营工具链无缝集成,使其成为为本区域客户交付更快速、更可靠托管服务的宝贵资源。我们已将此项实施扩展至其他客户,直接集成到他们自己的自主管理环境中,作为 AWS 专业服务的一部分。通过采用经过验证的最佳实践,我们能够持续在多个环境中提供可扩展的 DevOps 代理所带来的相同优势。”
- David Rosengrave,NCS Australia AWS 国家销售领导者
Nomura Research Institute, Ltd.
我们的 QUMOA 平台为日本一些大型企业提供任务关键型云基础设施支持,因此任何对事件响应质量的提升都会直接影响客户的信任。在我们的评估中,AWS DevOps 代理以其能够区分症状与根本原因的能力脱颖而出——尤其是在复杂的 API Gateway 后端连接问题上,它能提供可操作的修复步骤,使我们的工程师可以立即采取行动。我们观测到的 MTTR 降幅达到 30%,意味着显著提升的能力:每 100 起月度故障,我们估计可节省 8 至 15 个工程师工时,这些工时可以重新用于主动监控和更深入的客户互动。我们将 AWS DevOps 代理视为 QUMOA 的一项战略赋能工具,这不仅加速了事件的解决,还增强了 NRI 帮助企业客户自信推进数字化转型的能力。
- Yuichi Yamamoto,Nomura Research Institute, Ltd. 多云集成部门的部门副经理(MSP 合作伙伴,APJ)
Presidio
Presidio 是一家领先的 IT 服务和解决方案提供商,帮助客户连接今天的 IT 和未来的 IT。“作为 AWS 核心级咨询合作伙伴,我们认为这是对客户云运营工具包的实际补充。AWS DevOps 代理是我们团队和客户实现云运营优化、加快事件调查的高效工具。整合组织知识和过往事件数据的能力,使我们的团队能够在不同客户环境中标准化经过验证的最佳实践。通过自动执行调查并与现有监控和票务工具集成,它可以帮助团队更快地采取行动,保持合规性并推动持续的卓越运营。”
- Ali Tehrani,Presidio 现代网络和平台副总裁
Rackspace
“更快的解决速度,不过是过去的行业基准。我们正在帮助客户彻底重新定义目标:不再是“我们能多快修复它?”而是“我们如何确保它永不发生故障?”
这正是 AWS DevOps 代理所实现的转变——而数据,就是最好的证明。我们的客户发现,MTTR 最多下降了 40% 到 60%,这并非因为他们更擅长救火,而是因为“火”开始自己熄灭了。事件数量已减少。故障之间的平均时间正在增加。
我们的客户不仅更快地解决了问题,还完全避免了这些问题的发生。借助 AWS DevOps 代理,我们正在帮助团队从被动应对转向主动可靠性工程。这正是我们引领并携手 AWS 客户共同驱动的转变。”
- Vikram Reddy Kosanam,Rackspace 数据、分析和人工智能/机器学习服务高级总监/副总裁
Rapyder Cloud Solutions
大规模运行托管服务意味着我们的运营团队是为每一位客户提供的第一道防线。面对超过 500 个 AWS 账户、每月 150 多起运营事件,且业务横跨 Lambda、EC2、EKS、RDS 以及人工智能/机器学习各种工作负载,快速诊断和解决问题的压力无处不在。在使用 AWS DevOps 代理之前,我们的工程师花了大量时间手动关联 CloudWatch 指标、跟踪服务依赖项,并从头开始构建调查时间表。
自从部署了与 Amazon CloudWatch 和 Slack 集成的 AWS DevOps 代理以来,我们看到每个事件的平均解决时间从 45 分钟缩短到 12 分钟,缩短了 73%。在我们评估期间进行的 50 项调查中,该代理的根本原因准确率为 92%,误报率为零,每次调查平均节省了 30 分钟。这意味着每周大约节省了 25 个工时的工程工作,相当于一名全职的现场可靠性工程师。
DevOps 代理之所以能为像 Rapyder 这样的 MSP 提供独特优势,在于它改变了事件响应的经济模式。我们不再依靠增加人手来应对不断扩大的客户环境,而是拥有了一款智能的第一响应者。它能处理绝大部分繁重的调查工作,并直接给出精准、可操作的修复方案。在一个示例中,由于缺少 Secrets Manager IAM 权限,Lambda 函数失败。该代理跟踪了故障链,准确识别出缺失的策略,并在三分钟内提出了修复方案。同样的诊断,我们的团队手动完成需要超过 40 分钟。
对于希望在不按比例扩大团队规模的情况下提升运营卓越水平的托管服务提供商而言,AWS DevOps 代理是一次重大变化。
- Athreya Ramadas,Rapyder Cloud Solutions 首席技术官
ServerWorks
传统上,工程师平均在每起事件上花费 30 到 60 分钟进行人工分类,重点集中在 CloudWatch Logs 关联分析以及部署历史记录的交叉比对。但是,在我们最近的验证项目中,针对五个不同场景进行了广泛调查——涉及超过 30 个 Lambda 函数和 300 个资源——DevOps 代理成功识别出了全部五种情况的根本原因,实现了 100% 的准确率。最值得注意的是,代理能够自主发现一些通常难以人工识别的复杂问题,例如 Lambda 运行时更新后引起的 PyO3 兼容性冲突,以及在 CDK 定义层面出现的 VPC 配置错误。
平均调查时间显著缩短至仅 11.5 分钟,最快工单解决时间在 6 分 5 秒内,有效证明了工程工时可减少约 75%。此外,通过与 GitHub 集成,代理能够直接将拉取请求的代码差异与指标波动进行关联,从而实现高级分析自动化,从而无需人工干预即可完成 100% 的调查工作。作为托管服务提供商,Serverworks 认为这款 DevOps 代理远不止于简单的日志分析;它是一项开创性的事件响应服务,能够使工程师的工作速度比以往快三到五倍。
- Yuji Tamaki,托管服务部门执行官、总经理
Tata Consultancy Services
“AWS DevOps 代理通过在复杂环境中执行多步骤操作,显著提升了平均解决时间(MTTR),其速度几乎是手动方法的三到四倍。这些生产力提升意味着 IT 运营团队可以从被动应对问题转向成为战略推动力。”
- Amit Kumar,TCS 的 AWS 企业架构师
Velocis
Velocis Systems 的托管服务业务建立在一条简单原则之上:您解决事件的速度越快、准确性越高,就越能赢得客户的信任。作为在印度中端市场及企业客户领域运营的 AWS 高级咨询合作伙伴和 MSP,Velocis 为客户全面管理云服务生命周期,其交付模式以 DevOps 自动化和全天候运营为核心。
当 Velocis 加入 AWS DevOps 代理预览版时,团队将其直接部署到实时托管环境中,而非沙盒测试账户,以衡量其对 MSP 日常运营节奏的实际影响。重点在于实际可行性:代理能否在不增加人员编制的情况下,有效改变精益运营团队每月处理 50 到 60 起事件的方式?
答案很明确。AWS DevOps 代理在部署的各类事件类型中,将平均解决时间缩短了 40% 至 50%,并减少了 25% 至 30% 的人工调查工作量。在该事件量下,Velocis 估计每 100 起月度事件可节省 10 至 18 个工程师工时,预计整个组合的年度节省时间为 60 至 130 小时。那些时间并非理论上的。他们得以腾出精力,转向主动监控、架构审核以及更深层的客户互动,而这些工作此前在沉重的运维压力下,往往被降级处理。
“对我们来说,改变的不仅仅是速度。这是第一回应的质量。在 AWS DevOps 代理出现之前,我们的工程师需要花费大量时间手动关联日志、指标和资源状态,以了解事件发生时实际发生了什么。该代理会提前进行相关性分析,找出可能的根本原因,并建议具体的修复措施。正是这种从被动调查向明智决策与行动的转变,驱动了我们所看到的 40% 到 50% 的 MTTR 提升。拓扑视图也改变了我们向新团队成员介绍客户账户的方式。工程师无需花费数天时间构建客户架构的思维模型,而是能立即看到资源之间的关系和依赖。对于在多个客户环境中运营的 MSP 来说,这种可见性会迅速累积。我们现在计划将 AWS DevOps 代理作为我们整个产品组合中事件响应工作流的标准组成部分。目标不仅仅是更快地解决问题。它正在为主动、最终实现自主的云运营奠定基础,使我们能够在不按相同比例增加人员的情况下提升服务质量。”
- Rajesh Singh,Velocis Systems Pvt. 云助理副总裁兼云技术和运营主管Ltd.(高级咨询合作伙伴,印度)
Xtremax
我们在代表性环境中评估了 AWS DevOps 代理的预览版,该环境旨在模拟我们的托管服务运营中的真实事件场景。这使我们能够评测其作为第一响应者的能力,自动进行根本原因分析并减少云工程团队的手动分诊工作。该代理关联多账户设置中的 CloudWatch 日志、指标和部署数据,无需在账户之间手动切换上下文即可提供全面的调查上下文。
在我们的评估中,该代理将平均解决时间从平均 60 分钟缩短到 15 分钟,缩短了 75%,且正确识别根本原因的准确率超过 80%。在一种模拟场景中,该代理仅用 16 分钟就识别出一个出站安全组配置错误,导致 ECS 服务运行状况检查失败,而手动操作则需要 66 分钟。它还发现了最初在人工调查中遗漏的根本原因。仅这一场景就节省了 50 分钟的时间,并在证据收集、推理逻辑、根本原因深度和建议可行性方面均获得了 5/5 的质量评分。
基于这些结果,我们看到了在整个运营中扩展 AWS DevOps 代理的巨大潜力。它可以起到倍增作用——提高效率,使团队能够以持续的高标准服务管理更多环境,而无需相应增加人员数量。”
- James Leong,Xtremax Pte. 创始人兼首席执行官Ltd. 技术团队负责人
找到今天要查找的内容了吗?
请提供您的意见,以便我们改进网页内容的质量