豆包大模型安全策略专家-火山方舟MaaS
负责豆包大模型内容安全策略制定与运营
企业官网来源 →
负责豆包大模型RL训练系统改进与优化
1、负责改进RL训练系统,包括基于Ray的RL Trainer功能拓展、Rollout/采样策略探索、Reward系统集成、Agent Loop复杂任务下轨迹管理等;
2、负责大模型SFT/RL训练性能和稳定性优化,支持Reasoning,Agent,VLM等各类Post-Training任务;
3、探索前沿大模型算法和训练技术,包括Off-Policy RL训练效果和效率、SRFT、OnPolicy Distillation等。
1、计算机相关专业本科及以上学历,具有一年及以上大模型算法工作经验,算法与工程能力兼备者优先;
2、熟悉大模型强化学习系统,有OpenRLHF、VeRL使用和开发经验者优先;
3、深入理解Post-Training全流程与核心算法,包括但不限于DPO,PPO,GRPO,Reward Modeling等;
4、熟悉大规模分布式训练框架和分布式并行概念,如PyTorch FSDP2的原理与应用、DeviceMesh抽象、DTensor语义等;
5、掌握高性能推理引擎(如vLLM,SGLang)的原理与优化方法(如Continuous Batching,PagedAttention,Prefix Caching)等;
6、熟练掌握Python,至少熟练使用一种编译型语言(C/C++/Rust/Golang/Java等),拥有扎实的数据结构与算法功底,代码风格规范且高效;出色的分析和解决问题的能力;具备良好的自驱力和沟通协作能力,能和团队一起探索新技术,推动技术进步。
负责豆包大模型内容安全策略制定与运营
负责语音交互大模型产品需求、数据与评测设计
负责火山方舟MaaS平台业务运营,推动大模型服务落地