岗位
详情
Position Details
专业要求
专业不限
职位介绍
- 发布日期:2026-09-10
- 职位条件:1、熟悉大模型训练,有 Megatron、DeepSpeed、Swift、verl 等框架的深入使用或二次开发经验;
2、理解分布式并行、NCCL 通信、显存管理及 checkpoint 机制,有实际性能调优经验;
3、系统基础扎实,熟悉性能分析与分布式调试,能独立定位训练稳定性问题;
4、理解或有意深入 RL 后训练系统,关注 rollout、沙箱、训推一致性等问题;
加分项
5、有 RLHF / Agentic RL、数据管线或训练评测平台建设经验;
6、有千卡级集群稳定性、有效训练时间或成本优化成果;
7、有训练、推理框架的实质性开源贡献。 - 职位描述:岗位定位:建设后训练框架与平台,提升训练效率、稳定性和易用性,支撑算法迭代与 Agent 业务落地。
岗位职责:
1、平台建设:统一 SFT、DPO、GRPO 等训练流程,完善任务编排、资源调度、环境与产物管理、实验追踪和故障恢复;
2、Agent RL 基建:建设 rollout、沙箱及工具交互环境,支持多轮交互、异步采样与训推协同;
3、性能与稳定性:优化显存、通信、吞吐及资源利用率,解决 hang、OOM、训练异常等问题,提升有效训练时间占比与任务成功率;
4、数据与评测管线:集成数据处理、评测和回归能力,打通业务数据、训练、评测与问题反馈闭环。
若用人单位提供虚假招聘信息,以担保或其他任何名义收取财物,扣押或以保管为名索要证件,都属于违法行为,应当提高警惕。
收录时间:
截止时间:
审核人员: