Salary
机器学习平台工程师致力于打造面向量化研究与大模型训练/推理的一体化AI基础设施平台,支撑大规模GPU/CPU集群的高效管理、调度与资源运营。你将参与建设新一代AI计算平台,解决超大规模集群、多租户资源调度、分布式训练等核心问题,持续提升研发效率与算力利用率。
岗位职责
- 设计和研发面向量化研究与大模型场景的机器学习平台,包括资源管理、任务调度、模型发布等核心能力及配套工具链。
- 构建并优化大规模GPU/CPU集群调度系统,提升资源利用率、任务吞吐与系统稳定性。
- 配合业务团队针对平台功能需求和痛点,持续解决实际业务中的性能瓶颈与工程问题。
- 跟踪云原生及大模型基础设施方向的新技术,并推动在生产环境中的落地实践。
任职要求
【校招】
- 本科及以上学历,计算机、软件工程、人工智能等相关专业。
- 熟练掌握Golang,并熟悉Python/C++至少一种语言。
- 扎实掌握计算机基础,包括操作系统、网络、数据结构与算法、计算机体系结构等。
- 熟悉Kubernetes、容器化及云原生相关技术,有实际开发或项目经验。
- 了解分布式系统、高并发系统或多线程编程基础。
- 具备较强的问题分析与工程落地能力,对云原生平台或大模型基础设施方向有兴趣。
加分项
- 有GPU集群、RDMA、高性能网络或存储相关实践经验。
- 参与过开源项目或拥有技术社区贡献经历。
- 掌握Ray、Volcano、Agent Sandbox、vLLM、TensorRT-LLM等任一大模型基础设施与推理加速技术,并有相关实践经验。
【社招】
- 本科及以上学历,计算机、软件工程、人工智能等相关专业。
- 3年以上机器学习平台、云原生平台或分布式系统相关经验。
- 熟练使用Golang,并熟悉Python/C++至少一种语言。
- 深入理解Kubernetes体系与云原生架构,有实际平台研发经验。
- 具备大规模GPU/CPU集群管理与调度经验,熟悉AI训练与推理场景。
- 熟悉分布式系统架构设计、高并发服务治理及性能优化。
- 能够针对业务需求,独立完成技术方案设计、落地与持续优化。
- 具备良好的跨团队协作能力,能够推动复杂项目高效落地。
加分项
- 有大模型训推平台、算力运营或AI集群建设经验。
- 熟悉NCCL、RDMA(RoCEv2/InfiniBand协议栈)等AI基础设施技术。
- 有超大规模Kubernetes集群、异构算力调度或多租户资源治理经验。
- 参与过开源项目或拥有技术社区贡献经历。
- 熟悉主流大模型训练与推理框架,如SGLang、vLLM 等,具备模型部署、性能优化或工程落地经验。
Application
Send your resume and transcript (Optional) to
hr@wizardquant.com with the subject line: Name + position applied for + year of graduation +your graduate school/major. You can also apply online below.