研发

豆包大模型算法工程师-火山方舟

负责豆包大模型RL训练系统改进与优化

字节跳动北京薪资未标注
研发RLRaySFTPPOGRPODPOReward ModelingPyTorchFSDP2OpenRLHFVeRL
查看来源页最近更新:05/06 15:41

职位描述

1、负责改进RL训练系统,包括基于Ray的RL Trainer功能拓展、Rollout/采样策略探索、Reward系统集成、Agent Loop复杂任务下轨迹管理等;

2、负责大模型SFT/RL训练性能和稳定性优化,支持Reasoning,Agent,VLM等各类Post-Training任务;

3、探索前沿大模型算法和训练技术,包括Off-Policy RL训练效果和效率、SRFT、OnPolicy Distillation等。

职位要求

1、计算机相关专业本科及以上学历,具有一年及以上大模型算法工作经验,算法与工程能力兼备者优先;

2、熟悉大模型强化学习系统,有OpenRLHF、VeRL使用和开发经验者优先;

3、深入理解Post-Training全流程与核心算法,包括但不限于DPO,PPO,GRPO,Reward Modeling等;

4、熟悉大规模分布式训练框架和分布式并行概念,如PyTorch FSDP2的原理与应用、DeviceMesh抽象、DTensor语义等;

5、掌握高性能推理引擎(如vLLM,SGLang)的原理与优化方法(如Continuous Batching,PagedAttention,Prefix Caching)等;

6、熟练掌握Python,至少熟练使用一种编译型语言(C/C++/Rust/Golang/Java等),拥有扎实的数据结构与算法功底,代码风格规范且高效;出色的分析和解决问题的能力;具备良好的自驱力和沟通协作能力,能和团队一起探索新技术,推动技术进步。

岗位信息

经验要求1-3年
学历要求本科
岗位类型研发
来源企业官网
发布日期2025-12-08
链接状态检测有效性

相关岗位