新浪科技

科学数据如何共享利用?上海上线管理与共享服务平台

滚动播报 09.14 23:03

科研活动每天产生大量数据,但如何让这些数据被找到、被理解,并进一步用于AI辅助科学研究,仍有不少环节需要打通。

9月14日,在2026浦江创新论坛科学数据专题论坛上,上海科学数据管理与共享服务平台正式发布上线,人工智能时代科学数据开放共享“上海宣言”同步发布。围绕科学数据的归集、治理与使用,与会专家讨论了一个共同的问题:如何将不断积累的数据资源,转化为支撑科学发现的能力。

“上海宣言”发布。本文图片均由澎湃新闻记者 秦盛 摄

截至2026年9月10日,平台已收集覆盖1550个科学项目、6255个科学数据集,累计数据量超32TB。覆盖生命科学、材料、新能源、信息技术等52个学科领域,数据格式种类702个。已初步构建起全市统一、全域覆盖的科学数据归集体系。

新上线的平台由上海市研发公共服务平台管理中心联合上海库帕思科技有限公司、上海科学智能研究院等合作伙伴共同打造,承担科学数据汇交与共享服务职能。平台汇聚多学科科研数据,利用人工智能技术开展自动化数据治理,并面向高校院所、科研团队及科技企业提供分层分类的数据服务。

数据规模之外,如何提高数据的可用性,是论坛讨论的重点。

“数据体量庞大不等于科研能力强大,拥有数据不等于数据可用。”中国科学院院士、同济大学校长杨金龙在论坛上表示,真正稀缺的是能够支撑科研发现、可以被机器直接使用的高质量科学数据,需要打通数据生产、治理、组织、使用和反馈的完整链条。

数据为何难以共享、复用?

在杨金龙看来,“数据孤岛”不只是数据分散存储在不同服务器,更涉及数据难以对齐、元数据缺失、标准不统一以及协同机制不足等问题。

例如,理论、实验和文献数据各有特点,却难以交融互补;已有的分子、材料结构数据数量庞大,与之对应的功能和性能标签却较为稀疏。大量失败实验、阴性实验结果没有被记录留存,也使数据难以完整反映科研过程。

即使数据已经保存下来,不同实验室、科研装置和数据库之间的格式、元数据与接口不统一,也会妨碍机器批量读取和后续使用。

共享意愿与机制同样影响数据流通。杨金龙将相关难题概括为“不愿共享、不敢共享、不易共享”:数据被视为核心科研成果,但现有评价体系对数据贡献的激励不足;知识产权、数据安全和科研伦理问题带来顾虑;标准化、可互操作的基础设施也有待完善。

这意味着数据汇集之后,还需要进一步清洗、标准化和结构化,并建立数据之间的关联。

杨金龙提出,将结构、性质、反应、文献、实验条件和证据来源等联系起来,构建知识网络,使数据库能够进一步支撑分析、推理与研究决策。他以材料研究为例介绍,同一配体在文献中可能有不同名称,合成条件的描述和结构表征格式也不统一,通过标识和信息抽取,可以将分散的信息关联起来,形成机器可处理的结构与性能知识。

数据质量也需要从产生源头得到保障。他介绍,团队正在通过科研自动化探索完整记录样品的表征信息、理化性质及实验全过程,让一份科学样品拥有更完整的数字档案,并将模型预测、实验验证与数据反馈连接起来。

让科学数据被AI使用,让共享有章可循

科学数据的作用,还涉及人工智能自身如何发展。

中国工程院院士、之江实验室主任王坚强调,处理科学论文中的文本,与处理原始科学数据需要加以区分。光谱、地震波、原始光电信号等科学观测数据,并不能由论文文本充分承载。科学基础模型的建设,需要进一步探索如何让不同类型的原始数据被模型使用。

在王坚看来,科学数据不仅能够用于人工智能辅助科研,科学问题和科学数据也在开辟人工智能的发展空间。借助AI重新理解已有数据、发现其中的问题,是值得重视的方向。

如何使数据更好地服务于这些研究需求,也是此次“上海宣言”的关注重点。

宣言提出八项行动方向,包括打造AI就绪科学数据资源、建立开放共享标准体系、完善科学数据全生命周期合规治理、实施分类分级共享应用、建设分布式互联数字基础设施、健全利益共享机制、协调跨境数据流动,以及保障科学数据公平普惠获取。宣言呼吁科研机构、资助方、企业及政策制定者共同参与,推动科学数据开放共享。

共享也需要适应不同数据的使用条件。针对受商业、产权等因素限制、不能直接公开的数据,杨金龙提出探索“数据不动,模型动”的协作方式。他介绍,团队让原始数据保留在本地,通过模型参数的传递开展多方协同学习。

“数据共享不等于交出原始数据,可以实现安全可控的数据价值流动。”杨金龙表示。

论坛还举行了国家级科学数据中心与境外科研机构合作签约。据活动材料,中方签约方包括国家空间科学数据中心、国家对地观测科学数据中心等6家国家级科学数据中心,国外科研机构签约主体包括来自英国、俄罗斯、加拿大等国家的14家高校、科研院所及国际组织,合作面向跨国联合研究和数据资源共建共享。

加载中...