信息技术部
无境计划
超算集群SRE工程师
全职 | 上海/其他
Salary
面议

超算集群SRE工程师致力于构建稳定、高效、可观测的AI基础设施运维体系,为量化研究及大模型业务保驾护航。你将负责大规模算力集群的生命周期管理与稳定性治理,通过自动化运维、性能调优及可观测性建设,解决复杂的分布式系统故障,持续提升GPU/CPU集群的资源利用率与运行效率,推动运维体系的标准化与智能化。

岗位职责

  • 集群稳定性治理:负责大规模Kubernetes集群管理,提升容器服务整体的稳定性、安全性和高可用性,保障AI业务稳定。
  • 平台运维工程化:参与AI基础设施的自动化体系建设,包括集群生命周期管理、智能监控告警、故障自愈及可观测性体系构建,实现运维流程的标准化。
  • 故障排查与性能优化:负责线上故障响应、根因分析和复盘,协同研发及基础设施团队排查Linux、容器、网络(如 RDMA/NCCL)及存储I/O等相关问题,持续推动平台性能与可靠性优化。

任职要求

 

【校招】

  • 本科及以上学历,计算机、软件工程、人工智能等相关专业;
  • 熟悉Linux操作系统与容器化技术,了解Kubernetes基本原理与常见组件;
  • 熟悉Python、Golang、Shell至少一种编程语言,具备基础工程开发能力;
  • 了解计算机网络、操作系统、分布式系统等基础知识;
  • 对云原生、容器化技术、大规模集群或机器学习系统等任一领域有一定了解或浓厚兴趣;
  • 具备较强的学习能力与问题分析能力,具备良好的责任心、沟通能力与团队协作能力,能够适应快速发展的AI工程化场景。

 

     加分项

  • 有Kubernetes、Docker、Prometheus等相关项目实践经验;
  • 有Linux性能分析、自动化运维或故障排查经验;
  • 参与过相关开源项目,有技术博客等可展示;
  • 具备良好的英文技术文档阅读能力,能够跟进前沿技术动态。

 

 

【社招】

  • 本科及以上学历,计算机、软件工程、网络工程、信息安全等相关专业;
  • 熟悉Python、Golang、Shell等至少一种语言,具备自动化运维与工具开发能力;
  • 熟悉Linux操作系统、容器化技术,具备系统级问题分析与性能优化能力;
  • 具备Kubernetes大规模生产集群运维经验,能够独立负责集群稳定性治理与故障处理;
  • 具备良好的故障应急处理能力,能够在高要求且动态的环境中管理多项任务,有较强的沟通能力、跨团队协作能力与复杂问题推动能力。

 

     加分项

  • 具备超大规模计算集群管理经验,尤其是在大数据和AI大模型训练场景下的经验;
  • 熟悉RDMA、InfiniBand、RoCE、NCCL等高性能网络与通信技术;
  • 有开源项目贡献或云原生社区参与经历优先。
Application
Send your resume and transcript (Optional) to hr@wizardquant.com with the subject line: Name + position applied for + year of graduation +your graduate school/major. You can also apply online below.
Apply Now
About
信息技术部
从低延迟基建到AI集群定制,从硬件设计到自主编译优化,从高效AI训练到极速推断,宽德量化IT团队不断拓展技术边界,实现了跨平台、跨场景、软硬件一体化的计算生态。
信息技术部