研发

大模型与Agent评估方法算法研究员-Commercial AI

负责大模型与Agent评估体系构建与算法研究

字节跳动北京薪资未标注
研发大模型Agent评估方法机器学习NLP强化学习实验设计统计分析因果推断
查看来源页最近更新:05/06 15:41

职位描述

1、我们正在围绕大模型与Agent构建新一代评估体系,关注如何在真实任务和复杂交互中,对模型能力、风险、稳定性与优化方向进行系统性推断;

2、算法研究员的核心职责是把评估问题变成可运行的研究对象,包括任务设计、数据构造、评分协议、比较方法和推断分析;

3、从真实任务和复杂Agent行为中抽象高价值评估问题,设计面向大模型/Agent的评估任务、样本集、Benchmark、Protocol与Scoring Policy;

4、研究并落地Rubric-based Eval、LLM-as-a-judge、Pairwise comparison、自动Red-teaming、多轮交互评估等方法;

5、运用统计推断、实验设计和归因分析方法,对不同模型、策略与环境配置进行严谨比较;

6、在日常工作中,写实验代码、清洗样本、分析Judge分歧、复盘模型失败模式,并据此重写任务和评分协议;

7、与科学家讨论能力定义合理性,将其落成为可执行的任务集、Rubric或比较实验;

8、持续面对Benchmark失效、模型利用规则漏洞、线上线下结论不一致等真实问题。

职位要求

1、计算机、机器学习、统计、数学、物理、语言学等相关专业,硕士学位及以上;

2、具备机器学习、NLP、LLM、Agent、推荐、广告、强化学习等方向研究或项目经验;

3、熟悉实验设计、统计分析、模型评测、因果推断中至少一类核心方法;

4、能将模糊问题拆解为清晰任务、方案、证据与评估体系,擅长研究抽象与技术表达;

5、关注智能系统评估、能力边界、失败模式与泛化问题,愿意落地真实业务场景;

6、具备跨团队协作能力,有评测相关、业务落地、开源或论文成果者优先。

岗位信息

经验要求不限
学历要求硕士
岗位类型研发
来源企业官网
发布日期2026-01-13
链接状态检测有效性

相关岗位