AI 推理平台——百炼模型服务运行时
职位描述
负责设计与构建下一代分布式 AI 推理 Runtime,让大模型服务启动更快、运行更稳、资源效率更高。你将参与解决大规模推理系统中的核心工程问题,包括:
- 推理实例极速弹性:通过容器镜像加速、模型与数据缓存、P2P 分发、预加载及 Checkpoint/Restore 等技术,持续降低模型加载与实例启动时间,提升大规模集群的弹性伸缩效率;
- 异构集群与分布式推理:支持不同模型和推理引擎运行在 GPU、NPU 等多种计算设备上,优化多节点之间的计算、通信与状态协同,探索更高效的并行与分布式推理架构;
- 模型 Day 0 上线:与模型、引擎及硬件团队紧密协作,理解新模型架构带来的系统需求,打通从 Runtime 适配、性能调优到规模化部署的完整链路,支持新模型快速稳定上线;
- 性能、稳定性与成本优化:通过系统架构优化、性能分析和工程创新,持续改善吞吐、延迟、可用性与资源利用率,支撑大规模 AI 应用稳定运行。
职位要求
- 计算机科学相关专业研究生及以上学历,具备扎实的计算机基础知识;
- 具备良好的系统设计与工程能力,熟悉至少一种主流编程语言(如 C++ / Go / Java / Python / Rust),能够完成复杂系统模块的设计与实现;
- 熟悉 Linux 系统开发环境,具备良好的工程实践能力,能够进行系统调优、性能分析与问题定位;
- 对常见推理引擎有一定理解,例如 vLLM、SGLang、llama.cpp 等;
- 对 AI 基础设施或大模型推理系统有强烈兴趣,具备良好的学习能力与技术探索精神;
- 系统领域顶会论文、ACM/ICPC 国际奖项、主流开源项目活跃贡献者,均为加分项。
联系我们
应届生校招(最高可申请阿里星)
社招