Salary
超算集群SRE工程师致力于构建稳定、高效、可观测的AI基础设施运维体系,为量化研究及大模型业务保驾护航。你将负责大规模算力集群的生命周期管理与稳定性治理,通过自动化运维、性能调优及可观测性建设,解决复杂的分布式系统故障,持续提升GPU/CPU集群的资源利用率与运行效率,推动运维体系的标准化与智能化。
岗位职责
- 集群稳定性治理:负责大规模Kubernetes集群管理,提升容器服务整体的稳定性、安全性和高可用性,保障AI业务稳定。
- 平台运维工程化:参与AI基础设施的自动化体系建设,包括集群生命周期管理、智能监控告警、故障自愈及可观测性体系构建,实现运维流程的标准化。
- 故障排查与性能优化:负责线上故障响应、根因分析和复盘,协同研发及基础设施团队排查Linux、容器、网络(如 RDMA/NCCL)及存储I/O等相关问题,持续推动平台性能与可靠性优化。
任职要求
【校招】
- 本科及以上学历,计算机、软件工程、人工智能等相关专业;
- 熟悉Linux操作系统与容器化技术,了解Kubernetes基本原理与常见组件;
- 熟悉Python、Golang、Shell至少一种编程语言,具备基础工程开发能力;
- 了解计算机网络、操作系统、分布式系统等基础知识;
- 对云原生、容器化技术、大规模集群或机器学习系统等任一领域有一定了解或浓厚兴趣;
- 具备较强的学习能力与问题分析能力,具备良好的责任心、沟通能力与团队协作能力,能够适应快速发展的AI工程化场景。
加分项
- 有Kubernetes、Docker、Prometheus等相关项目实践经验;
- 有Linux性能分析、自动化运维或故障排查经验;
- 参与过相关开源项目,有技术博客等可展示;
- 具备良好的英文技术文档阅读能力,能够跟进前沿技术动态。
【社招】
- 本科及以上学历,计算机、软件工程、网络工程、信息安全等相关专业;
- 熟悉Python、Golang、Shell等至少一种语言,具备自动化运维与工具开发能力;
- 熟悉Linux操作系统、容器化技术,具备系统级问题分析与性能优化能力;
- 具备Kubernetes大规模生产集群运维经验,能够独立负责集群稳定性治理与故障处理;
- 具备良好的故障应急处理能力,能够在高要求且动态的环境中管理多项任务,有较强的沟通能力、跨团队协作能力与复杂问题推动能力。
加分项
- 具备超大规模计算集群管理经验,尤其是在大数据和AI大模型训练场景下的经验;
- 熟悉RDMA、InfiniBand、RoCE、NCCL等高性能网络与通信技术;
- 有开源项目贡献或云原生社区参与经历优先。
Application
Send your resume and transcript (Optional) to
hr@wizardquant.com with the subject line: Name + position applied for + year of graduation +your graduate school/major. You can also apply online below.