如何成为AI基础设施工程师?
一位在本地大型工业企业从事GenAI平台开发的工程师,日常工作涉及基于48x H200 GPU、Kubernetes和vLLM搭建推理基础设施(80% SRE工作,20%软件工程)。尽管有后端工程背景,但缺乏ML研究或底层GPU编程经验,他希望了解如何从单纯的LLM部署与推理角色转型为真正的软件工程师。文章探讨了进入AI基础设施领域所需的关键技能(尤其是分布式系统)、常被低估的难点,以及在大公司之外难以获得的经验。
背景速读
- AI基础设施工程师负责构建和优化运行大规模AI模型所需的底层系统,包括GPU集群管理、推理服务部署、请求路由和资源调度,而非训练模型本身。
- vLLM是一个流行的开源推理引擎,专门优化大语言模型(LLM)的高效运行;NVIDIA H200是目前最先进的AI训练/推理GPU之一,48块H200构成一个相当大规模的生产集群。
- Kubernetes(K8s)是业界标准的容器编排平台,几乎所有AI基础设施团队都用它来管理GPU节点和部署推理服务。
- 提问者当前工作偏SRE(站点可靠性工程)——即确保系统稳定运行、监控告警、故障恢复——而非传统意义上的软件工程(设计高并发架构、分布式系统、底层优化)。
- 该帖反映了AI行业的一个典型职业困惑:随着"AI工程化"岗位激增,许多从业者担心自己只懂"部署和调用API",缺乏从零构建系统的深层能力,希望向真正的系统软件工程师转型。