返回列表 发布新帖

招聘|AI infra 工程师 |上海

24 0
本帖最后由 用户08ba7c83357c 于 2026-8-31 14:25 编辑

职位描述
  • 与视频领域 foundation model 算法团队 深度协同,共同设计 训练-推理高效的世界模型架构(如 Linear DiT、State-Space Mamba、Hybrid DiT-Transformer)。在 数据异构(多模态交互轨迹、长序列视频) 场景下,主导探索RLHF、MoE、超长上下文缓存(>1000帧)、FP8/BF16 混合精度训练、低比特推理(INT4/FP4/NF4) 等前沿技术。研发并维护 通用高性能视频生成训练框架(支持流式生成、帧级并行)与 实时推理引擎(<30ms/帧,端侧/云侧统一);
  • 深入剖析 AI 集群计算硬件(GPU/TPU/NPU) 与 高性能网络(InfiniBand/NVLink/RoCE) 特性,系统性解决超大规模训练(千卡级、PB级轨迹数据)与 实时交互部署(<16ms 延迟)中的工程瓶颈。通过端到端性能剖析(NSight、PyTorch Profiler) 定位软硬件协同瓶颈,实施 通信-计算重叠、KV Cache 分层、流水线帧生成、动态批处理、异构计算卸载 等极致优化,压榨集群每一分算力与带宽,建立工业级可落地的工程最佳实践。
职位要求
  • 扎实的深度学习理论基础,深入理解各类深度学习模型结构及其训练推理特性,对性能优化有敏锐直觉,对精度对齐有sense,具备大模型infra系统级优化能力;
  • 熟练Python/C++编程,既能够从微观层面编写高效kernel,又可从系统层面设计框架架构,具备出色的工程实践能力和代码质量把控能力;
  • 熟悉Triton, Tilelang, cutlass等GPU算子编程框架;
  • 熟悉模型 AWQ,GPTQ,KVCache量化,以及剪枝,蒸馏等算法,具备丰富的量化算法与精度评估的能力与经验。
加分项
  • 发表过模型量化,推理加速以及边缘计算相关topic顶会论文(如ML三大会,DAC,MLSys,OSDI / SOSP,ASPLOS等);
  • 具备 Graph 级别、算子级别的性能优化能力(尤其是),掌握 torch.compile、cudagraph、torchscript 等等优化方法; 具备算子优化能力及相关经验:包括算子去重,算子融合,高性能定制kernel等。

你将获得
  • 快速晋升通道与极具竞争力的薪酬包,以及丰厚期权
  • 与顶尖的算法专家和天才的工程师们一起学习和成长


联系方式

简历投递至:liumeilin@srealai.com 欢迎自荐,已读必回。



回复

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Copyright © 2026 OPENLOONG. All Rights Reserved. Powered by Discuz!
  • 关注B站
  • 关注视频号
  • 关注微信公众号
Copyright © 2026 开发者论坛 - OpenLoong 版权所有 All Rights Reserved.
关灯 在本版发帖
扫一扫添加微信客服
返回顶部
快速回复 返回顶部 返回列表