新浪财经

上海科理新序智能科技有限公司发布5个招聘岗位

滚动播报 09.30 17:01

(来源:上观新闻)

企业简介

科理新序是一家面向科学发现的AI4S公司,致力于构建“AI4S基模×物理AI”双引擎驱动的自进化科学智能系统,打通“认知—设计—实验—反馈—再学习”的干湿闭环。

大模型训练科学家 / 工程师(预训练方向)

(若干)

工作内容:

1、模型训练与架构:负责科学大模型预训练全链路研发;面向科学场景开展模型架构探索与验证,包括统一多模态架构等方向;完成训练任务搭建、稳定性排查与性能调优,持续提升基座模型能力;

2、数据与评测:负责科学领域高质量数据的合成、清洗与构建;搭建面向科学任务的多维度评测基准,以评测结果驱动模型迭代;

3、大规模训练:参与分布式训练系统搭建与优化,提升 GPU 利用率、训练吞吐、稳定性和实验迭代效率;

4、研究探索:持续跟进 Foundation Model、Multimodal Model、Unified Architecture 等前沿方向,并将研究进展快速转化为可验证的模型实验。

任职要求:

1、本科及以上学历,计算机、人工智能、数学或相关理工科专业;

2、具备扎实的深度学习与大模型基础,有 LLM / VLM / Diffusion 预训练项目落地经验,并能提供可验证的结果,如指标、报告、论文或开源项目;

3、熟悉 PyTorch,熟练使用 DeepSpeed、Megatron-LM 等大规模分布式训练框架;

4、了解统一多模态 / 统一架构,有 BAGEL 等相关模型的调研、复现或改造经验者优先;

5、对 AI for Science 有长期兴趣,能够独立推进训练任务和模型实验。

备注:该岗位将参与科学领域基础大模型的研究与工程开发,围绕模型架构探索、训练稳定性调优、大规模训练性能优化等问题开展工作。成果将融入 AI for Science 研发链路,完成数据—训练—评测的持续迭代,产出可落地的模型成果。

加分项:有模型架构创新或统一多模态架构方向的研究 / 工程实践;有大规模训练稳定性治理、吞吐优化、显存优化或故障定位经验;有科学任务评测基准建设经验;有高水平会议或期刊论文;有高质量开源贡献;有 AI 相关竞赛获奖经历。

薪资待遇:面议,核心岗位不受固定区间限制,核心成员拥有期权激励。

工作地区:徐汇区

工作班时:9:00至10:00~18:00至19:00,周末双休

工作性质:全日制

大模型后训练科学家 / 工程师

1、后训练与强化学习:负责科学大模型后训练全链路,包括 SFT / DPO / RLHF / RLVR 等,持续提升模型的科学推理、指令遵循、事实性和复杂任务解决能力;

2、Scientific Reasoning:探索适用于科学问题的长链推理、Verifier、Reward、Test-time Compute 等方法,让模型能够处理更复杂、可验证的科学任务;

3、训练基础设施:保障后训练效率、运行稳定性及训练—推理一致性,持续优化训练吞吐、资源利用率与实验效率;

4、数据与评测:负责高质量 reasoning / trajectory / preference / verifier data 的构建,搭建科学推理与后训练评测体系,以评测结果驱动模型迭代。

2、具备扎实的深度学习与大模型基础,有 LLM 后训练、强化学习或模型对齐项目经验,并能够提供可验证的结果;

3、熟悉 PyTorch,熟练使用 veRL、TRL、OpenRLHF、LLaMA-Factory 等后训练 / 对齐框架中的一种或多种;

4、理解 SFT、DPO、RLHF、RLVR 等方法及其适用场景;

5、对 reasoning model、RL、verifier、test-time scaling 等前沿方向保持持续关注;

6、对 AI for Science 有长期兴趣,能够独立推进后训练实验与模型迭代。

备注:该岗位将参与科学领域基础大模型的后训练与推理能力研发,围绕 SFT、RL、RLVR、模型对齐、科学推理和训练—推理一致性等方向开展工作,让模型能够在复杂科学问题上进行更可靠、更长程和更可验证的推理。

加分项:有 SFT / DPO / RLHF / RLVR 完整项目经验;有 Reasoning Model、Verifier、Reward Model 或 Test-time Compute 相关经验;有后训练性能优化、稳定性保障或训练—推理一致性实践;有高质量 reasoning / trajectory 数据构建经验;有高水平会议或期刊论文;有高质量开源贡献;有 AI 相关竞赛获奖经历。

Scientific Agent / Auto-Research

科学家 / 工程师

1、Scientific Agent:设计和研发 Scientific Agent / Auto-Research 系统,构建从科学问题理解、任务规划、信息检索、工具调用、代码执行到结果分析和自我修正的完整 research loop;

2、Long-horizon Research:探索长程任务规划、Agent Memory、Context Management、Reflection、Tool Discovery / Creation、Multi-Agent Collaboration 等关键问题,提高 Agent 在复杂科研任务中的自主性和稳定性;

3、Scientific Tool Use:将 Agent 接入真实科研工具与环境,包括科学数据库、Python / R、Bioinformatics、Molecular Modeling、Simulation、Scientific Software、Web / GUI 等,不断扩大 Agent 能够自主完成的科研任务边界;

4、Agent Evaluation:构建 Scientific Agent evaluation system,通过真实科研任务、trajectory quality、tool-use success、scientific correctness 和 end-to-end task completion 等指标驱动 Agent 迭代;

5、Self-improvement:与基础模型、后训练和科学数据团队协作,探索 Agent trajectory → training data → model improvement → better Agent 的持续学习闭环。

任职要求:

1、本科及以上学历,计算机、人工智能、数学或相关理工科背景;优秀的跨学科候选人不受专业限制;

2、有 LLM Agent、Auto-Research、Deep Research、Coding Agent、Computer Use 或其他 Autonomous Agent 系统的实际研发经验;

3、具备较强 Python 工程能力,能够独立完成从 prototype、deployment 到 evaluation 和 iteration 的完整研发流程;

4、熟悉 Tool Use、Function Calling、Agentic Workflow、Sandbox / Code Execution 等技术;

5、理解 Agent 的典型 failure modes,包括 hallucination、tool failure、long-context degradation、error propagation、trajectory quality 等问题;

6、能够展示真实的 Agent 项目、运行结果、Demo、Trajectory、论文或开源项目;

7、对 AI for Science 和 autonomous scientific discovery 有长期兴趣。

备注:该岗位将参与 Scinetics Scientific Agent 与 Auto-Research 系统的核心研发,让 AI 能够从开放式科学问题出发,自主完成问题拆解、文献与数据检索、工具选择与调用、代码执行、科学计算、结果分析、反思与迭代,并逐步探索能够进行长程科学研究与自主发现的 AI 系统。这不是一个简单的 RAG、Chatbot 或 Workflow Automation 岗位。我们更关注的是:如何让 Agent 在真实科学任务中持续工作,正确使用复杂科研工具,根据中间结果自主调整研究路径,并最终产出可验证的科学结果。

加分项:开发过能够自主运行较长时间的 Research / Coding Agent;有 Scientific Agent、AI4S Agent 或 Autonomous Research 项目经验;有 Agent Benchmark / Evaluation / Verifier / RL / RLVR 经验;有 Tool Creation、MCP、Sandbox Execution 等相关经验;有 GUI Agent / Computer Use 相关经验;有 Multi-Agent / Agent Memory / Long-context 相关研究或工程经验;有高水平会议或期刊论文;有高质量 Agent 开源项目或 GitHub contribution。

薪资待遇:面议,核心岗位不受固定区间限制,核心成员拥有期权激励

Scientific Data / Data Engine

1、Scientific Data Engine:设计和建设面向科学基础模型与 Scientific Agent 的数据生产系统,从公开科学资源、论文、数据库、科研工具、Agent trajectories 及其他科学环境中持续构建高质量训练数据;

2、科学数据抽取与结构化:处理论文文本、表格、图像、分子、序列、结构、实验记录等异构科学信息,探索自动化 scientific knowledge extraction、结构化和质量控制方法;

3、训练数据构建:围绕 Pre-training、Post-training 和 Agent 等不同训练阶段构建相应的数据集,包括 multimodal data、reasoning data、trajectory data、preference data、tool-use data 等;

4、数据质量与评测:建立数据质量评估体系,研究 filtering、deduplication、contamination detection、difficulty estimation、data mixture 等问题,并通过模型训练实验验证不同数据对模型能力的真实贡献;

5、数据闭环:与 Agent 和科学团队协作,将真实科研过程中的成功路径、失败案例、工具调用和实验反馈转化为新的训练数据,探索持续演化的 scientific data flywheel;

6、数据基础设施:建设可扩展的数据处理 pipeline,支持大规模科学数据的采集、清洗、转换、版本管理和训练调用。

任职要求:

1、本科及以上学历,计算机、人工智能、数据科学、数学、生物信息学、计算生物学或相关理工科专业;

2、有大模型训练数据、数据工程、数据挖掘、信息抽取、Synthetic Data 或相关项目经验;

3、熟悉 Python,具备较强的数据处理与工程能力;

4、熟悉大规模数据处理流程,对数据质量、数据分布和训练效果之间的关系有实际理解;

5、能够从模型训练结果反向分析数据问题,而不仅仅完成数据 ETL;

6、对 AI for Science 有长期兴趣,愿意处理复杂、异构且并不完美的真实科学数据。

备注:该岗位将参与Scinetics 科学数据基础设施与 Data Engine 的核心研发,面向 Foundation Model、Post-training 和 Scientific Agent 持续构建高质量、可训练、可验证的科学数据。我们关注的不只是“收集更多数据”,而是如何将分散在论文、数据库、科学软件、Agent trajectories 和实验过程中的科学信息,转化为能够真正提升模型能力的训练信号,并建立可以持续迭代的数据生产体系。你将与 Foundation Model、Post-training、Agent 及科学团队紧密合作,探索 Data → Model → Agent → Scientific Workflow / Experiment → New Data 的持续数据闭环。

加分项:有 LLM / VLM Pre-training 或 Post-training 数据构建经验;有 Synthetic Data、Reasoning Data、Agent Trajectory Data 构建经验;有 scientific literature mining、PDF / Table / Figure extraction、knowledge extraction 经验;有生物信息学、化学信息学、蛋白质 / 分子 / Omics 等科学数据处理经验;有多模态数据 alignment / representation 相关经验;有大规模数据 pipeline、Ray / Spark / distributed processing 等实践;有数据质量评测、Data Mixture、Data Ablation 或 Data Scaling 相关研究经验;有高水平论文、Technical Report 或高质量开源项目。

AI for Biology / Computational Biology

科学家

1、Biological Foundation Model:参与生命科学基础模型的研究,探索 DNA、RNA、Protein、Structure、Omics、Scientific Literature 和 Experimental Data 等不同科学模态的表示、建模和跨模态学习;

2、Scientific Problem Formulation:将真实生命科学问题转化为可以被模型学习、预测和验证的 computational task,与 AI 团队共同定义训练目标、数据形式和评测体系;

3、Biological Representation:探索 sequence、structure、function、interaction、cell state、phenotype 等不同尺度之间的关系,以及适用于生命科学的 representation 和 multimodal alignment 方法;

4、Generative Biology:参与 Protein / RNA / Molecular Design 等生成式生命科学任务,研究模型如何从 prediction 进一步走向 generation 和 design;

5、Biological Evaluation:设计具有科学意义的 benchmark 和 evaluation,判断模型提升是否真正对应 biological capability,而不仅仅是 benchmark number 的变化;

6、Scientific Discovery:与 Scientific Agent 和实验合作团队协作,将模型预测和生成结果连接到真实科研问题及实验验证,探索 Model → Hypothesis / Design → Experiment → Feedback 的闭环。

任职要求:

1、本科及以上学历,生物信息学、计算生物学、生物工程、生物学、化学、计算机、人工智能或相关交叉学科背景;

2、在至少一个生命科学方向具有扎实基础,例如 Protein、RNA、Genomics、Omics、Structural Biology、Molecular Biology、Drug Discovery 等;

3、具备良好的计算研究能力,熟悉 Python,并能够独立完成数据分析、模型实验或 computational biology workflow;

4、对现代机器学习 / Deep Learning 有基本理解,并有强烈意愿进一步深入 AI for Biology;

5、能够理解 biological question、data、model 和 experimental validation 之间的关系;

6、对 AI for Science 有长期兴趣,希望探索 AI 如何真正参与科学发现。

备注:加入成员将站在 AI 与生命科学的交叉位置,与 Foundation Model、Scientific Agent 和科学数据团队共同探索下一代 AI for Biology 系统。生命科学中的 DNA、RNA、蛋白质、三维结构、分子相互作用、Omics、细胞状态、实验扰动和表型并不是彼此独立的数据类型,而是同一个生命系统在不同尺度下的不同观测。我们希望探索如何让 AI 跨越这些尺度理解生命系统,并进一步从已有知识理解走向 biological prediction、generation、design 和 scientific discovery。这个岗位不要求你一定来自传统 AI / CS。我们同样欢迎具有扎实生命科学背景、计算能力强,并希望真正进入 AI for Science 的研究者。

加分项:有 Protein Language Model、RNA / DNA Foundation Model、Structure Prediction、Generative Biology 等研究经验;有 Protein Design、Molecular Design、Drug Discovery、Molecular Dynamics 等经验;有 Genomics / Transcriptomics / Single-cell / Spatial Omics 等数据分析经验;有 Multimodal Biology 或跨尺度 biological representation learning 经验;有 PyTorch / JAX 及深度学习模型训练经验;

有真实 wet-lab collaboration 或 computational → experimental validation 经验;有高水平会议 / 期刊论文;有高质量 scientific software、dataset 或开源项目。

邮箱:

career@scinetics.ai

(邮件标题格式:岗位+应聘者姓名)

备注:以上岗位有效期自发布起两周

加载中...