Skip to content
TopicTracker
来自 HackerNews查看原文
译文语言译文语言

Ask HN:你们公司的SRE都做些什么?

SRE(站点可靠性工程师)的角色在不同公司差异巨大。有人将其等同于高级运维,有人认为是带编码能力的运维,还有人视为专职的自动化与系统优化岗位。这篇文章汇集了Hacker News社区的真实案例,展现了SRE职责从日常值班、故障响应到平台工程、架构设计的广泛光谱。

背景速读

- SRE(Site Reliability Engineering,站点可靠性工程)是 Google 在 2000 年代提出的一种运维方法论,核心是将软件工程思维应用于基础设施管理,而非纯手工运维。 - 理论上 SRE 负责保障系统的高可用、低延迟、可扩展,并通过自动化、监控、容量规划等手段减少“琐碎运维工作”(toil)。 - 但在实际招聘中,“SRE”这个头衔被各公司高度稀释:有的公司把它等同于高级运维(DevOps)、有的视作底层基础设施开发、有的甚至只是换了个名字的 7×24 值班工程师。 - 这种定义混乱反映了整个行业对“可靠性”工作的认知分歧:SRE 究竟是一个开发岗位、一个运维岗位、还是两者皆是?本文(Hacker News 上的讨论帖)就是收集不同公司对这一角色的实际做法。正是这种模糊性,使得这个帖子在技术社区里引发广泛共鸣。

相关报道