AI4Sci Scientific Data Researcher · Life Sciences
AI4Sci 科学数据研究员(生命科学方向)
从真实生命科学问题出发,建立可信、可追溯、可复现的科学数据结构与任务定义,为模型评测、科学数据生产和 AI4Sci 项目提供科学基础。
投递这个岗位 ↗岗位职责
- 从基因组学、生物信息学、计算生物学等工作流中识别可验证问题,明确假设、变量、证据标准与结论边界。
- 定义样本、实验条件、数据字段、元数据和版本,建立可追溯的数据规范、清洗与质量检查规则。
- 将科研工作拆解为可测试任务,设计参考答案、证据要求、边界案例和常见错误,明确自动验证与专家复核的适用范围。
- 使用 Python、R 或领域工具开展可复现分析,维护代码、环境、参数与运行记录,分析结果差异的原因。
- 与领域专家、评测研究员和工程人员协作,提供清晰的数据接口、判定逻辑、复现步骤与验收样例。
- 根据真实项目、模型失败与科学方法变化迭代任务和规范,将专家经验沉淀为他人能够采用的规则与方法。
任职要求
- 生物信息学、计算生物学、基因组学、系统生物学、生物统计或相邻领域博士;应届博士、博士后和具备成熟研究证据的高年级博士生均可评估。
- 至少完整处理过一类真实生命科学数据,能够说明研究问题、来源、处理方法、质量控制、统计假设和结论边界。
- 熟练使用 Python 或 R,能够提供可复现代码、Notebook、环境说明与运行记录。
- 理解实验设计、统计推断、不确定性、数据泄漏、批次效应等质量风险。
- 能阅读英文论文、数据库说明和技术文档,并核验来源。
- 能将科研问题转为结构化数据规范、任务样例和交接材料,愿意在项目现场及周期、成本约束下推进工作。
- 能够使用生成式 AI 提升研究效率,并独立核验关键结果。学校层次、论文数量和影响因子不作为单独录用依据。
加分项
- 有组学、变异、单细胞、蛋白质、药物发现、临床研究数据或生物医学知识图谱经验。
- 有数据集构建、科研 Benchmark、模型评测、竞赛题目或标准制定经验。
- 使用过容器、工作流引擎、版本化数据工具或云端计算环境。
- 有跨学科项目、企业合作、科研转化或面向非科研人员交付的经历。
- 有 LLM、Agent、工具调用、RAG 或 AI for Science 项目经验。以上均为加分项,不要求同时具备全部背景。
岗位分工
- 本岗位侧重科学判断与数据方法,与评测和工程团队协作,不要求独立建设完整评测平台或承担全部商业交付。