信息技术部
无境计划
机器学习平台工程师
全职 | 上海/其他
Salary
面议

机器学习平台工程师致力于打造面向量化研究与大模型训练/推理的一体化AI基础设施平台,支撑大规模GPU/CPU集群的高效管理、调度与资源运营。你将参与建设新一代AI计算平台,解决超大规模集群、多租户资源调度、分布式训练等核心问题,持续提升研发效率与算力利用率。

岗位职责

  • 设计和研发面向量化研究与大模型场景的机器学习平台,包括资源管理、任务调度、模型发布等核心能力及配套工具链。
  • 构建并优化大规模GPU/CPU集群调度系统,提升资源利用率、任务吞吐与系统稳定性。
  • 配合业务团队针对平台功能需求和痛点,持续解决实际业务中的性能瓶颈与工程问题。
  • 跟踪云原生及大模型基础设施方向的新技术,并推动在生产环境中的落地实践。

任职要求

【校招】

  • 本科及以上学历,计算机、软件工程、人工智能等相关专业。
  • 熟练掌握Golang,并熟悉Python/C++至少一种语言。
  • 扎实掌握计算机基础,包括操作系统、网络、数据结构与算法、计算机体系结构等。
  • 熟悉Kubernetes、容器化及云原生相关技术,有实际开发或项目经验。
  • 了解分布式系统、高并发系统或多线程编程基础。
  • 具备较强的问题分析与工程落地能力,对云原生平台或大模型基础设施方向有兴趣。

     

     加分项

  • 有GPU集群、RDMA、高性能网络或存储相关实践经验。
  • 参与过开源项目或拥有技术社区贡献经历。
  • 掌握Ray、Volcano、Agent Sandbox、vLLM、TensorRT-LLM等任一大模型基础设施与推理加速技术,并有相关实践经验。

 

【社招】

  • 本科及以上学历,计算机、软件工程、人工智能等相关专业。
  • 3年以上机器学习平台、云原生平台或分布式系统相关经验。
  • 熟练使用Golang,并熟悉Python/C++至少一种语言。
  • 深入理解Kubernetes体系与云原生架构,有实际平台研发经验。
  • 具备大规模GPU/CPU集群管理与调度经验,熟悉AI训练与推理场景。
  • 熟悉分布式系统架构设计、高并发服务治理及性能优化。
  • 能够针对业务需求,独立完成技术方案设计、落地与持续优化。
  • 具备良好的跨团队协作能力,能够推动复杂项目高效落地。

     

     加分项

  • 有大模型训推平台、算力运营或AI集群建设经验。
  • 熟悉NCCL、RDMA(RoCEv2/InfiniBand协议栈)等AI基础设施技术。
  • 有超大规模Kubernetes集群、异构算力调度或多租户资源治理经验。
  • 参与过开源项目或拥有技术社区贡献经历。
  • 熟悉主流大模型训练与推理框架,如SGLang、vLLM 等,具备模型部署、性能优化或工程落地经验。
Application
Send your resume and transcript (Optional) to hr@wizardquant.com with the subject line: Name + position applied for + year of graduation +your graduate school/major. You can also apply online below.
Apply Now
About
信息技术部
从低延迟基建到AI集群定制,从硬件设计到自主编译优化,从高效AI训练到极速推断,宽德量化IT团队不断拓展技术边界,实现了跨平台、跨场景、软硬件一体化的计算生态。
信息技术部