STRATEGIC PLAN · 2026

AI Ready / Readable
数据基础设施

本规划以「五大数据产出计划 × All in AI」为战略主轴,明确数据基础设施团队围绕五大方向的建设任务与实施路径。核心任务是将持续产出的多模态数据治理为 AI Ready(可被 AI 工程化消费)、AI Readable(可被模型与智能体理解)的高质量资产,并通过 CNGBdb BioLens、领域模型与华大自研智能体转化为科研、医学、检测和诊断服务,形成「数据—模型—智能体—服务—反馈」增长闭环。

数据基础设施 2026.08 内部文件 内容来源:2026.08.07–08 济南 · 泰安 研究院研讨会
5 EB
五年总数据产出
5
国际大科学计划
4
专业基座模型
4D
AI 智能化
第一章

战略总纲:以专有资产 × 智能体服务构建增长飞轮

AI 时代,华大如何将差异化资产转化为持续生产力与收入?——六层价值链增长飞轮
01
资源层
海量样本
  • 员工队列
  • 自然人群
  • 百岁人群
  • 出生
  • 肿瘤
  • 传感染
  • 动物
  • 植物
  • 百万微生态
  • 四极
02
工具层
多组学工具
  • 长短读长基因组
  • 细胞组学
  • 时空组学
  • 蛋白组学
  • 代谢组学
  • 影像组学
  • 可穿戴
03
数据层
CNGBdb BioLens
  • 大人群 HGP2
  • 百亿细胞
  • 10BC
  • 时空联盟 STOC
  • 地球生物 EBP
  • 疾病防控
  • 主动健康
04
模型层
GENOS
  • 中心法则(核酸蛋白)
  • 时空法则(细胞·时空)
  • 健康多模态
  • 病理多模态(疾病)
05
智能体平台层
DCS Cloud · Cyto
  • Genpilot
  • Cyto Coscientist
  • BioLens
  • Skill / MCP
  • 受控工作空间
06
服务与应用层
科研 · 医学
  • 科研
  • 医学
  • 检测
  • 诊断
  • 药物研发
  • 育种
  • 健康管理
  • 生物制造
增长飞轮 · 反馈回流 服务证据与新增数据回流资产层,驱动下一轮复利增长 ↑

1.1 战略命题:将资产转化为可复制服务

华大的优势不是某一项孤立能力,而是能够持续将稀缺样本与多组学技术转化为专有数据集,训练领域模型,并通过华大自研智能体在受控工作流中完成交付。因此,战略单元不应是单独的数据集、模型或工具,而是“数据 + 模型 + 智能体 + 领域验证”组成的可复制服务包。

六层飞轮描述的是同一套运营系统:资源与工具生产差异化数据,CNGBdb BioLens 将数据治理为可服务资产,基座模型将数据沉淀为可复用智能,DCS Cloud(含 Genpilot)与 Cyto Coscientist 将智能转化为面向客户的服务,服务结果、专家复核和新增标注再回流资产层。规模由此转化为可持续积累的生产力。

核心竞争力 = 专有数据资产 × 领域模型 × 智能体化交付 × 工程效率。数据和模型构成壁垒,华大自研智能体让壁垒变得可用、可交付、可变现。检验标准不再是存了多少数据、建了多少工具,而是这些资产能否持续产生经验证的服务、收入与新增学习。

1.2 战略聚焦与边界

不作为主要增长模式
一次性项目交付、孤立数据文件、脱离华大资产的通用智能体,以及无法沉淀为可复用数据、模型或工作流的小样本单维分析。此类工作可以支撑科研,但不应定义平台的核心投入方向。
主要投入方向
大规模多模态数据生产、领域模型研发、受控智能体服务与规模化工程。在优先场景中,与医院、科研团队、检测诊断团队和产业伙伴共同定义服务,再以真实交付改进资产并扩展下一轮市场。
运营原则
数据始终受控、计算靠近数据、模型与 Skill 均可版本追溯、每次服务均有证据支撑。通用智能体生态可以扩展触达,但华大自研产品必须掌握关键数据、模型、工作流与客户交付。

1.3 数据基础设施定位:资产与服务的运营系统

数据基础设施不是后台资料库,而是将五大数据产出转化为受控资产,并让华大模型与智能体安全使用这些资产的运营系统。其职责覆盖身份与标准、数据产品与 release、受控计算、Skill/MCP、证据可追溯和服务反馈。BioLens 是统一的服务与编排层,连接资产底座、DCS Cloud、Cyto Coscientist 与经授权的外部智能体接口。

数据生产
五大数据计划
CNGBdb BioLens
受控数据产品
模型 + 华大智能体
DCS Cloud · Cyto Coscientist
服务、收入与反馈
证据驱动下一轮
第二章

五大数据产出计划:数据基础设施的核心工作领域

五大国际大科学合作项目,五年内系统性产出 5 EB 多模态数据,覆盖基因组、时空组、单细胞、病理影像等维度。数据基础设施围绕这五个方向,统一开展数据连接、治理、AI 可读与对外服务。Source: strategy.html

STOC时空组学国际联盟0.5 EB
纳米级分辨率空间转录组与空间多组学,绘制发育、疾病、脑科学全景观图谱。Cancer / Brain / Plant / Infection 四大旗舰方向。
空间转录组空间多组学Cancer / Brain / Plant / Infection
HGP2人类基因组计划二期1.5 EB
百万人级全基因组 + 多组学测序,覆盖全球人群多样性,构建精准医学遗传基线,联合全球顶级研究机构。
全基因组人群多样性精准医学遗传基线
EBP地球生物基因组计划1 EB
对地球已知真核生物进行全基因组测序,构建地球生命数字化蓝图。物种鉴定、进化生物学、生物多样性保护。
真核生物物种鉴定进化 / 多样性
10BC百亿级单细胞图谱1 EB
基于 DNBelab C 平台超高通量单细胞测序,覆盖主要组织器官与发育阶段,为虚拟细胞模型提供训练数据基础。
通量单细胞DNBelab C虚拟细胞训练
100KPM十万例癌症病理多组学1 EB
整合病理影像、基因组、转录组、蛋白质组,构建癌症分子分型与预后预测知识库。i3S 葡萄牙节点已启动。
病理影像多组学分子分型 / 预后

2.1 数据基础设施 × 五大方向

五个方向共 5 EB 数据,核心工作围绕分层标准体系展开。每个方向涉及多组学(基因组、转录组、蛋白组、代谢组、单细胞、时空等)、表型、图像与影像数据,每种数据类型均有其专业标准;这些标准进一步组装为方向级标准(如 STOC 空间组学标准体系、HGP2 人群遗传标准体系),形成「基础标准 → 方向标准」的分层架构。通过这套标准连接内部数据与外部数据源,编织跨方向数据网络。

数据流入遵循统一入口:经数据管理计划(DMP)入驻,按 AI Ready 六项标准(真实与完整、配对与对齐、标准与可复现、合规与受控、可训练与可评测、可服务与可运营)完成验收后进入管线。入库后,经标准化治理治理扩展(本体化、版本化、派生资产管理),形成可被 AI 消费的数据产品。最终封装为Skill,供 BioLens、Cyto Coscientist、DCS Cloud(含 Genpilot 智能体)等统一调用——实现「一次治理、多处应用」。

数据基础设施的底座逻辑
① 标准体系(连接数据网络) ② DMP 入口(AI Ready 验收) ③ 治理与扩展(标准化治理 + 派生资产管理) ④ Skill 化(数据产品封装) ⑤ 智能体调用(BioLens / Cyto Coscientist / DCS Cloud,含 Genpilot 等)
方向数据特征数据基建支撑重点对应基座模型
STOC高维空间转录组,图像 + 表达矩阵混合空间坐标标准化、切片对齐、海量 WSI 存储病理/虚拟细胞
HGP2百万人级 WGS,海量变异位点变异本体化、人群遗传基线、GENOS 压缩试验场Genos
EBP跨物种真核基因组,多样性极高物种标准化、泛基因组表征、分类学本体Genos(扩展)
10BC百亿级单细胞,基因表达矩阵超大细胞类型本体、批次校正、大规模矩阵存储虚拟细胞
100KPM十万例多组学 + 病理影像患者级多模态对齐、分子分型索引、Token 计量病理组织模型

2.2 AI Ready 高质量数据集与「一数多用」

数据基建产出不再以「维护了多少系统」衡量,而以「交付多少可被 AI 消费的数据产品」定义价值。据此确立两大核心标准:AI Ready 高质量数据集(数据产品形态)与「一数多用」(数据复用能力)。

AI Ready 高质量数据集:六个可验收条件

每一数据计划都须从「采得更多」升级为「交付更可用的数据产品」:

「一数多用」:让复用成为能力,而不是口号

同一份数据可服务不同场景,但须在主体授权、用途范围、最小必要、可追溯、可撤销框架内运行。以标准数据资产 + release manifest 为单一事实源,派生为四种可控数据产品:

科研与论文 → 标准数据集
可引用、可复现;接受许可、引用与署名管理;以外部复用率、可复现率验收。
模型训练 → 训练 release
固定 split 与数据卡;经用途确认、污染检查与派生资产治理;以泛化、校准、失败覆盖验收。
临床验证 / 报证 → 证据包
锁定版本与来源;伦理、质量、变更控制与审计;以独立验证、合规完备度验收。
医生与患者服务 → 场景数据服务
最小必要输出;知情范围、隐私保护与专业解释;以服务质量、反馈与安全事件验收。
关键要求:数据集、模型与 Benchmark 均采用语义化版本管理;访问、下载、计算与派生资产保留审计日志;对敏感数据优先采用「计算到数据」,而非「数据随人流转」。
第三章

数据枢纽:从数据生产到 AI 服务的受控通路

数据枢纽承接五大数据产出计划,将持续产生的数据转化为受控、可复用、可服务的资产。L0 治理与 L1 接入并行发生:GigaNorn 持续发布版本化的身份、元数据、本体、质量和模态规则;DMP / DM / DCS 在计划、准入、核验与受控处理中执行这些规则,接入数据暴露的问题再反馈推动标准迭代。数据通过二者联合门禁后进入 L2 DataBrick,再由 L3 BioLens 发布服务。应用和智能体不直接连接源系统或数仓存储;BioLens Brain 作为横向编排与策略控制面覆盖全链路。

GigaNorn ⇄ DMP · DM · DCS
标准治理与数据接入并行 · 联合门禁
DataBrick
D0–D4 数仓产品
CNGBdb BioLens
Search · API · MCP · Skill
应用与智能体
科研 · 医学 · 检测 · 诊断
BioLens Brain 控制面:覆盖治理、接入、DataBrick 数据产品与 BioLens 数据服务。在 L0 解析策略与上下文,在 L1 核验源 Release 和执行条件,在 L2 选择 DataBrick 产品 Release,在 L3 路由 BioLens 服务操作;应用端仅消费经授权后的服务。
运行原则:数据接入即治理,数据反馈促标准演进。数据枢纽登记权威资产而非再建数据孤岛,统一身份与契约而非强制一种物理格式;只有通过治理—接入联合门禁的 Release 才能进入 DataBrick,并进一步形成授权数据服务。

3.1 总体架构与职责边界

L0–L3 定义四类职责,而非严格串行的流水线。L0 与 L1 共同构成并行的“治理—接入域”:GigaNorn 对身份、元数据、本体、质量和模态 Profile 进行版本管理;DMP、DM 将标准落实到计划、准入、授权、权威位置与 Release,DCS 为数据画像、规范化修复和异常处理提供受控环境。接入过程中发现的 Schema 不匹配、元数据缺失、质量异常和新模态需求,反向进入 GigaNorn 的标准变更流程。只有通过身份、元数据、授权、完整性和模态 Profile 联合门禁的数据,才能进入 DataBrick。随后由 DataBrick 负责 D0–D4 产品,BioLens 负责服务契约与接口。

L0数据治理层 · GigaNorn 数据标准体系
版本化身份、元数据、本体、质量与模态 Profile Norn Registry · 数据身份与登记(进行中) Snotra · 元数据智能与本体(规划中) Bragi · AI 数据接口(未开始)
让数据有身份 · 有语义 · 可对话
标准下发
数据问题反馈
L1接入与汇聚层 · DMP / DM / DCS
DMP:计划、资产准入、用途与授权 DM:权威路径与可用性核验 DCS:受控工作空间与计算到数据 接入时执行标准,反馈异常与新需求
进入 DataBrick 联合门禁:稳定身份 · 必填元数据 · 本体映射 · 同意与用途 · Checksum 与权威位置 · 模态 QC · Release 完整性
L2受治理数据仓层 · DataBrick
DataBrick D0–D4 产品:受控源、标准对象、语义证据、训练物化、模型证据 数仓组织:序列变异、细胞矩阵、空间影像、表型与多模态关联 产品管理:Manifest、Schema、索引、分区、物化、血缘、生命周期与 Release 交付契约:对象、切片、队列、特征、训练批次与证据产品
L3数据服务层 · CNGBdb BioLens
BioLens Search交互检索与证据服务
API · MCP · Skill智能体数据服务契约
查询与工作空间切片、计算、训练与输出审查
APP应用端 · 智能体与模型消费方
DCS Cloud(Genpilot)科研与 AI 服务平台
Cyto Coscientist细胞与多组学科研
模型与授权合作方按策略使用 L3 接口
CTRL横向编排与策略控制面 · BioLens Brain
L0:解析实体、本体、用途、授权与质量规则 L1:核验计划、权威位置、Release 与执行环境 L2:选择 DataBrick Release、对象、切片、队列、物化与证据产品 L3:路由 BioLens Search、API、MCP、Skill 与工作空间,执行闸门、审计与结果回链
横向编排,不是第五个业务层;不持有源数据,不替代各层 Owner,不绕过策略控制。
术语边界:DataBrick 是受治理数据仓,负责 D0–D4 数据产品;CNGBdb BioLens 是数据服务平台,不重复建设数仓存储;BioLens Brain 是横向编排与策略控制组件;BioLens Search 是第一方交互式检索应用。DCS 受控计算是平台能力,DCS Cloud(含 Genpilot)、Cyto Coscientist 与获批准的外部科研智能体是下游产品,并行消费 BioLens 的授权服务。

3.1.1 分层交付物与控制点

层级责任组件核心交付物控制与验收
治理(并行)GigaNorn版本化实体标识、元数据规范、本体映射、模态 Profile、质量规则与标准变更记录Owner 审批、版本一致、映射有据、敏感身份隔离、接入异常反馈闭环
接入与汇聚(并行)DMP · DM · DCS符合标准的计划与登记、权威路径核验、授权决策、画像与规范化修复记录、受控工作空间及审计记录与 GigaNorn 联合门禁:身份、必填元数据、本体、用途与范围、完整性、模态 QC、Release 完整性及执行可恢复
受治理数据仓DataBrickD0–D4 产品清单、分模态标准对象、语义索引、队列与切片、训练物化、模型证据、产品版本与血缘源端对账、格式与 Schema 校验、发布评审、切分与泄漏检查、确定性重建、生命周期与成本控制
跨层编排控制BioLens Brain任务分解、L0–L3 能力路由、策略判定、执行闸门、调用链、证据组装、降级与人工接管不得绕过各层控制;最小权限、策略一致、调用链完整、有限重试、可回滚或接管、性能与成本 SLO
数据服务CNGBdb BioLens · BioLens Search · API · MCP · Skill · 工作空间面向场景的数据发现、查询、切片、队列、计算、训练批次、证据与工具服务产品 Release 解析、统一契约、身份、授权、限流、SLO、审计与输出审查
应用端DCS Cloud(Genpilot) · Cyto Coscientist · 模型与授权合作方科研、医学、检测与诊断场景结果通过 L3 接口使用能力,不得绕过源端控制;结果可归因、可复核,最终决策责任明确
责任原则:Data Owner 审批用途、范围、发布与复用,Data Steward 维护元数据与质量,平台责任人保障可用性、安全控制和成本,消费团队对科研或临床解释负责;上述责任不因使用智能体而转移。

3.2 治理层 · GigaNorn 与数据标准

五大方向包含序列变异、稀疏矩阵、空间坐标与影像、表型队列及多模态病例关联。治理标准因此采用统一实体与策略核心 + 分模态 Profile:核心层对齐项目、参与者/标本、样本、实验、文件、Release、同意、质量和来源;模态 Profile 定义权威格式、坐标体系、Schema、分区索引、QC 与允许访问粒度。在保留专业结构的同时支撑跨方向服务。

核心理念:一套标准入口,多个数据产品。统一实体标识、最小元数据、数据字典、质量规则与版本管理;标准发布入口:db.cngb.org/standards。

3.2.1 标准落地四要素

稳定实体身份
为项目、参与者、样本、实验、文件和 Release 分配治理域内稳定标识;跨系统关联使用受控映射键,敏感身份与科研标识分离并保持去标识化。
统一核心 + 模态 Profile
所有产品共享来源、实体、时间、模态、同意、质量、版本和血缘字段;序列、变异、矩阵、影像、表型与多模态 Profile 另行定义格式、坐标、Schema、分区索引、QC 和允许服务粒度。
字典、本体与版本
字段定义、枚举、单位和取值范围实行版本管理,并映射到经批准的本体;每个 Release 附带 manifest 与机器可读变更记录。
多维质量画像
分别记录完整性、有效性、一致性、来源、时效性及模态专项质控;按场景阈值判定可用性,不以单一通用 A/B/C 等级替代质量事实。

3.2.2 面向模型的验收结果

可学习
格式统一、标注完整、偏差可控,模型能提取稳定可泛化模式而非噪声。
可追溯
来源清晰、处理过程可追溯,模型输出可关联到数据 Release、代码、参数和执行记录,支撑审评与合规。
可合规复用
权限明确、用途可审计,在合规框架下支持多场景复用。
可评测
训练、验证与 Benchmark 资产具有明确划分,完成泄漏与污染检查,覆盖代表性失败样本,并对评测集独立版本管理。

3.2.3 GigaNorn 平台组件

GigaNorn Scientific Data Intelligence Platform(科学数据智能基础设施)通过三个协同模块落实「Identify · Understand · Converse」:Norn 负责身份与登记,Snotra 负责元数据与本体治理,Bragi 提供受控的自然语言接口。三者共享实体模型、策略和版本记录,而非建设三套独立系统:

Norn
Norn Registry · 数据身份与登记(进行中)
为样本、受试者、物种、实验与文件分配稳定标识,记录来源、关系、版本和状态变更。
Snotra
Snotra · 元数据智能与本体(规划中)
按受控词表和领域本体规范、校验元数据,保留映射依据、置信度、版本与人工复核记录。
Bragi
Bragi · AI 数据接口(未开始)
将自然语言请求转换为可校验的数据查询或登记操作;所有结果仍须通过模式、权限和质量规则。
标准与接入共同演进:GigaNorn 发布版本化标准,由 DMP / DM / DCS 在计划、登记、核验和受控处理中执行;接入也是标准的验证场,异常、缺失字段、质量分布和新模态需求形成变更申请、测试与新版标准。标准不是一次性前置并长期静止。

3.3 接入与汇聚层 · DMP / DM / DCS

接入与汇聚在数据到达过程中同步执行 GigaNorn 标准:DMP 校验计划、必填元数据、模态 Profile、用途、质量目标与授权;DM 核验权威位置、完整性、实体关系和 Release 归属;DCS 为数据画像、规范化、异常修复与计算到数据提供受控环境。不符合项不能静默放行或各自打补丁,而应进入拒绝、修复、例外审批或标准变更流程。所谓汇聚,是在权威位置之上建立符合标准的统一清单与关系图,而不是把全部源文件复制到新孤岛。

DMP
计划 · 登记 · 用途
DM
路径核验
策略决策
身份 · 用途 · 范围
DCS
受控工作空间
审计回流
版本 · 权限
DMP
数据管理计划
统一管理数据计划、数据集登记、质量状态、知情同意与用途限制、使用申请,输出机器可执行的准入与授权规则,不重复保存源文件。
DM
权威路径核验
对账生产记录与在线、对象存储、归档等权威路径,核验完整性、可用性和 Release 关联,确保数据使用前可定位、可验证。
DCS
受控计算工作空间
依据授权决策创建隔离工作空间,挂载获批数据与工具,记录执行过程和派生结果;优先采用「计算到数据」,降低复制与暴露风险。
当前痛点:项目组每周人工填报数据状态,沟通成本高、信息滞后;标准与接入异常缺少闭环。
目标状态:GigaNorn 与 DMP / DM / DCS 通过接口和事件同步标准、计划、权威位置、授权、质量结果与异常;通过联合门禁的数据进入 DataBrick,形成 D0–D4 产品 Release,再由 BioLens 发布服务。每次查询、训练或分析都能回答「使用哪个源 Release 与 DataBrick 产品版本、哪些实体与切片、何种用途、依据何种授权、采用何种物化、产生哪些派生结果」。

3.4 DataBrick · 受治理多模态数据仓

DataBrick 是位于 DMP、DM、DCS 与 CNGBdb BioLens 之间的受治理多模态数据仓,不替代权威源系统:DMP 管理计划、用途与授权,DM 核验权威位置与 Release,DCS 提供受控计算。DataBrick 将获批 Release 加工为版本化、可追溯的 D0–D4 数据产品;BioLens 再将其发布为面向检索、分析、训练和智能体的统一数据服务。

DMP · DM · DCS
计划 · 权威源 · 受控计算
DataBrick
D0–D4 产品 · 版本 · 血缘
CNGBdb BioLens
检索 · 查询 · 计算 · 训练
智能体与应用
Genpilot · Cyto · Partner Agents

3.4.1 DataBrick D0–D4 数据产品模型

D0–D4 定义 DataBrick 内部的数据产品演进,与 3.1 的 L0–L3 业务架构分层不同。不同模态、不同用途可按条件分别演进;高层产品由低层派生并保持反向链接,不覆盖权威源数据。BioLens 的每次服务调用均须解析到明确的 DataBrick 产品 Release。

级别产品内容服务能力发布控制
D0
原始受控
权威 FASTQ/BCL、BAM/CRAM、VCF/BCF、组装文件、原始矩阵、WSI/原生影像、空间坐标、表型/临床源表、仪器与实验日志目录发现、完整性核验、受控文件/范围读取、归档调取、计算到数据挂载不可变 manifest、checksum、来源与保管链、同意用途、留存和访问审计;不自动承诺可用于训练
D1
标准对象
经验证的模态 Profile:参考对齐序列与变异、组装注释对象、AnnData/Zarr 兼容稀疏矩阵、OME 兼容金字塔影像与掩膜、规范化表型及关联表对象查询、基因组区间、矩阵切片、影像瓦片/区域、Schema 感知读取、跨工具交换格式与 Schema 一致、坐标与参考版本一致、对象源端对账、模态 QC、版本兼容
D2
语义与证据
实体关系表、obs/var 元数据、annotation evidence、本体映射、质量画像、来源、许可与用途限制、队列定义、可检索索引实体与队列检索、多维筛选、跨版本比较、多模态关联、聚合统计、证据引用与发现 API语义映射有据、查询与对象一致、隐私及最小单元控制、更新责任、引用完整
D3
计算与训练物化
用途绑定快照、特征矩阵、pseudobulk/聚合表、影像 Patch、tokenization/词表版本、经批准的 embedding、split manifest、平衡采样器、Shard、Cache 与可复现环境可复现分析、本地或分布式高吞吐采样、训练/评测批次、特征读取与受控导出声明用途与模型版本、训练验证测试隔离、泄漏污染检查、偏差画像、确定性重建、性能成本、到期与撤销
D4
模型与决策证据
预测结果、扰动结果、空间邻域、检索索引、模型卡、评测报告、解释性产物、专家复核及实验/临床研究验证记录模型推理、证据比较、结果回溯、场景报告、复核工作台及获批决策支持输出绑定数据、模型、代码、参数、评测集与复核人;监测漂移和用途边界;临床/诊断用途另行通过质量及监管门禁

3.4.2 模态 Profile 与五大方向数据服务矩阵

平台统一的是契约,不是强迫所有数据转换为一种物理格式。每类数据保留权威社区格式,同时增加 BioLens Profile,明确标识、坐标、Schema、索引、分区、质量和访问模式。下表格式为目标 Profile,须经项目及领域 Owner 验证后发布。

方向主要数据与标准对象服务维度与粒度代表性产品
STOCFASTQ/比对数据、表达矩阵、物理与分子坐标、OME 兼容金字塔影像、分割掩膜、AnnData/Zarr 兼容空间对象,以及组织、器官、时期、物种元数据物种→器官→组织→切片→区域/细胞 Bin→基因/特征;提供瓦片/ROI、表达切片、空间邻域和跨切片比较空间图谱检索、切片/ROI 服务、基因空间表达、组织配准、空间训练 Patch
HGP2FASTQ、BAM/CRAM、gVCF/VCF/BCF、参考与注释版本、样本/家系表、表型/暴露表及汇总统计队列→参与者/家系→样本→实验→染色体/区间→变异→等位基因/基因型→表型;提供隐私保护队列计数与汇总查询变异/区间查询、等位基因频率、队列构建、表型关联证据、参考面板、Genos 训练/评测快照
EBP原始读段、FASTA 基因组组装、GFF3/GTF 注释、转录本与蛋白、适用时的组装图、QC 报告、标本/凭证元数据、分类学与采集地理信息分类单元→标本→组装→染色体/Contig→基因→转录本/蛋白→直系同源组;支持分类、地理、质量、共线性与比较筛选组装注释目录、分类覆盖、序列/基因检索、同源与共线、泛基因组/比较集合、跨物种模型输入
10BCFASTQ、计数矩阵、AnnData/H5AD 与 Zarr 兼容稀疏对象、obs/var 表、细胞与样本 QC、细胞类型本体,以及适用的 embedding、扰动和空间关联研究→供体→样本→实验→细胞→细胞类型/状态→基因/特征;提供队列筛选、矩阵切片、pseudobulk、采样、embedding 与扰动配对细胞图谱检索、细胞/基因矩阵服务、细胞类型统计、参考映射、平衡训练批次、扰动数据集、虚拟细胞评测集
100KPM病理 WSI 原生文件及 DICOM/OME 兼容派生物、金字塔瓦片、标注与掩膜;DNA/RNA 组学、空间组学、规范化表型/结局表,以及参与者—标本—蜡块—切片—区域—实验关联队列→参与者→事件/诊断→标本→蜡块→切片→ROI/瓦片→分子实验→特征;支持最小必要原则下的多模态筛选病例/队列构建、WSI 瓦片/ROI、多模态病例包、分子分型证据、病理 embedding、预后研究集合、模型评测工作台

3.4.3 DataBrick 六类交付产品

01
目录与发现
检索 Release、实体、模态、字段、质量、授权条件与 Owner,不暴露受限载荷。
02
对象与切片
读取区间、变异、序列、稀疏矩阵切片、影像瓦片/ROI、细胞、基因及关联多模态对象。
03
队列与语义查询
基于受治理实体、本体术语、表型、QC、版本及授权条件构建用途绑定队列。
04
受控计算
在敏感或大规模数据附近执行获批工具与工作流,留存环境、参数、日志、成本及派生血缘。
05
训练与评测交付
提供用途绑定快照、切分清单、采样器、Shard、Cache、特征服务及带泄漏控制的评测案例。
06
证据与结果
将来源、引用、质量、模型/工作流版本、复核、预测和验证记录封装为可追溯输出。

3.4.4 产品契约、物化与发布

产品契约
Owner · 用途 · 实体 · Schema
逻辑产品
源引用 · 查询模型
物化策略
按需 · Cache · 快照
发布与服务
版本 · SLO · 成本 · 证据

每个数据产品必须声明 Owner、允许/禁止用途、实体粒度、模态 Profile、源 Release、Schema、坐标与参考版本、质量阈值、授权策略、访问模式、更新频率、留存、SLO、单位成本及证据输出。逻辑产品引用权威源;只有当查询时延、训练吞吐、可复现或隔离需求足以证明存储及生命周期成本合理时,才创建物理物化。

3.5 CNGBdb BioLens · 统一数据服务层

BioLens 是位于 DataBrick 之上的服务层,不再建设另一套数据仓。它从获授权的 DataBrick 产品中组装面向场景的数据能力:BioLens Search 提供交互式发现与证据检索;API、MCP、Skill、查询端点与工作空间适配器提供稳定机器契约。Genpilot、Cyto Coscientist、获批准的 Claude Science 类智能体及合作方产品,均按授权范围消费同一套服务。DCS Cloud 提供面向客户的云端工作空间与执行环境,但不持有底层数据产品。每次请求必须解析到同一 DataBrick Release、策略决策和审计记录。

3.5.1 服务契约与智能体接口

能力类型主要数据层级典型操作发布要求
发现与数据集 SkillD1–D2实体解析、目录检索、字段解释、质量概览、队列筛选、对象与版本定位来源覆盖、查询准确、权限隔离、证据完整、时延与成本
分析与物化 SkillD2–D3矩阵/影像切片、统计聚合、特征构建、工作流执行、训练批次交付输入输出契约、测试数据、可复现、性能、泄漏检查、回滚与 Owner 评审
证据与模型 SkillD2–D4证据检索、模型推理、结果比较、解释、评测与验证打包模型与评测版本、用途边界、专家复核、漂移监测与追溯
治理与运营 SkillD0–D4授权、用途校验、发布核验、审计、成本估算、生命周期动作与使用报告默认拒绝、最小权限、高风险确认闸门、回滚与完整审计
DataBrick 与服务验收:方向完成文件登记不等于接入完成。至少应发布一个 D1 标准对象、一个 D2 可检索语义产品、一个用途绑定的 D3 分析或训练产品,以及一条可追溯产品、策略和证据的 BioLens 服务路径;只有存在经验证模型或决策支持场景时,才要求 D4。

3.6 智能体与应用消费

消费端通过 BioLens 服务使用同一条 DataBrick 产品链的不同视图:BioLens Search 主要提供 D1–D2 的交互式发现、对象定位、队列筛选与证据引用;DCS Cloud 按授权提供 D0–D3 的受控计算、分析及训练交付;Genpilot、Cyto Coscientist 与获批准的 Claude Science 类智能体通过受控 Skill、MCP 和 API 调用 D1–D4 服务;模型复核或临床研究工作台消费获批 D4 证据。任何消费端不得把索引可见等同于载荷可访问,不得绕过 BioLens 策略或直连源系统。

3.6.1 BioLens Search(原 OmicSeek)· 交互式数据服务

BioLens Search 是 D1–D2 产品的发现与查询入口:解析基因、变异、组装、物种、参与者、样本、实验、细胞类型、组织、影像区域、表型和队列等实体,选择兼容 Release 与授权视图,调用实体、队列、区间、矩阵或影像索引,并返回带来源、版本、质量和访问条件的结构化结果。它负责发现与证据准备,不替代 DCS 受控计算或治理决策。

01
功能一:数据检索
流程:
a. 解析意图、实体类型、粒度、模态与所需操作
b. 选择兼容产品 Release 与最小权限视图
c. 调用实体、队列、区间、矩阵、影像或证据索引并规范结果
d. 返回结构化结果及源对象、版本、质量、授权条件与引用

验收重点:实体与意图准确率、对象查询一致性、来源覆盖、权限隔离、时延与证据完整率。
02
功能二:数据更新
更新机制:
• 按数据源变更频率配置定时拉取、Webhook 或版本轮询
• 检测新增、修订与撤回,生成差异记录并触发索引更新
• 更新失败进入重试与告警,重要版本需通过完整性校验后发布

验收重点:更新时延、同步成功率、版本一致性和失败可恢复性。
03
功能三:对外 API 接口
统一接入点:
• 通过 BioLens 向 DCS Cloud(Genpilot)、Cyto Coscientist 及授权工具提供 REST/SSE、MCP、查询或 Skill 接口
• 支持实体、队列、基因组区间、稀疏矩阵切片、影像瓦片/ROI、证据及源数据查询,并统一身份认证、限流、版本与审计策略

验收重点:接口契约稳定性、对象与查询结果一致性、权限隔离、可观测性及兼容性测试覆盖。

3.7 BioLens Brain · 编排与控制面

BioLens Brain 是 CNGBdb BioLens 覆盖 L0–L3 的横向编排与策略控制组件:对每个请求,在 L0 解析实体、本体、用途、授权和质量规则;在 L1 核验计划、权威位置、源 Release 与受控执行环境;在 L2 选择具名的 DataBrick D0–D4 产品 Release、对象、切片、队列、物化和证据产品;在 L3 调用 BioLens Search、API、MCP、Skill、查询或工作空间服务。随后执行隐私、成本和确认闸门,记录数据、模型、工具、参数与结果的完整血缘。它不持有 DataBrick 产品或源数据,也不替代任何一层的控制与责任人。

下表是当前实现快照,不等同于目标架构契约。框架版本、模型名称、重试上限与 KPI 数量在文档发布时须从配置中心或 CMDB 同步;长期架构以接口、控制要求和服务目标定义,避免被具体技术版本锁定。

维度实现
前端Vue2 + Quasar + cngbdb-ui,自然语言对话
后端Django 3.2 + DRF,SSE 实时流式推送
编排引擎自研 Deep Flow,采用 Plan & Execute 四阶段流水线;错误分类后执行有限重试(最多 3 次)、降级或人工接管
模型路由规划与执行模型按任务复杂度、敏感度、时延、成本和可用性进行策略化选择,并在调用链中记录模型版本
安全机制工具白名单 + 执行闸门(Confirm Gate),「默认拒绝,按需授权」
可观测性Phoenix + OpenInference,统一 executor / call_skill 埋点,15 字段数据模型,8 类 KPI
对外出口Open API(REST/SSE)+ MCP Server,双出口共享同一后端能力层
演进定位当前以带确认闸门的辅助编排为主;目标是具备评测、人工检查点和回滚机制的有边界自动科研工作流
五大方向 × DataBrick × BioLens:每个方向进入 DataBrick 的不是单一数据集,而是一组数据产品:至少包含 D1 标准对象、D2 语义产品和用途绑定的 D3 分析/训练产品。BioLens 基于兼容的产品 Release 与稳定实体关系发布跨方向服务,关联序列、细胞、空间、影像、表型和证据产品,且不得绕过同意、质量、隐私或模态控制。

3.7.1 BioLens Brain 技术实现视图

该技术视图细化 3.1 的业务架构,不构成第二套串行模型。数据源、治理、DataBrick 数仓产品、BioLens 数据服务与应用表示能力路径;BioLens Brain 单独作为横向控制面,按任务调用各层已授权能力。

LYR-1数据源层
CNSA Project · Sample · Experiment · Assembly · Variation · Metabolism NCBI gene · pubmed · nucleotide · protein · assembly · sra NGDC GWH · GenBase · EWAS Atlas · ICG · Database common EBI ENA · UniProt · Ensembl REST · PRIDE · MGnify · PDBes · BioSamples · AlphaFold DB Mygene uniprot · uniprot_ipi · uniprot_pdb · uniprot_pr · cpdb · reactome · pharmgkb · ucsc Terms GO · KEGG · DOID · HPO · OMIM EBP 1KITE · 10KP · B10K · 1KP · FISH10K STomicDB Artista · Aerssta · CBMSTA · CIRSTA · Flysta3d · LISTA · MBA · MDESTA · MHAOD CDCP CIMA · Glioblastoma · HCL · HLMA · NHPCA · Scatlas
LYR-2标准层 · 数据统一治理
基因组与变异组装与注释单细胞与稀疏矩阵时空组与影像病理 WSI表型与人群队列多模态关联
持久标识 + 血缘溯源支撑来源追踪与引用;数据可信度仍需结合来源证据、质量控制、版本完整性与授权记录综合判断。
LYR-3DataBrick 数仓层 · D0–D4 数据产品
标准对象与切片:序列区间、变异、矩阵、影像瓦片与 ROI 语义产品:实体、本体、证据、质量、队列与多模态关联 训练产品:快照、切分、Shard、Cache、特征与评测集 产品控制:Release、血缘、可复现、生命周期、成本与撤销
LYR-4BioLens 数据服务层
BioLens Search · 交互检索与证据 API · MCP · Skill · 查询契约 对象、切片、队列、计算、训练批次与证据服务 统一身份、授权、版本、SLO、审计与输出审查
APP应用 / 需求端
DCS 云平台云端数据科学 · 内置智能体 Genpilot
Cyto Coscientist细胞与多组学科研
授权外部智能体通过 Skill / MCP / API 接入
CTRL横向控制面 · BioLens Brain
源与治理解析Release 与授权核验数据产品与工具路由执行与确认闸门证据组装与全链路追踪降级、回滚与人工接管
覆盖各层,不是数据路径中的串行层。
架构要求:标准先于服务;能力原子化并版本化;默认拒绝、按需授权;来源与血缘证据完备;端到端可观测;模型与工具可替换;Skill、MCP、API 三类接口执行一致的策略。
第四章

智能服务:将数据与模型转化为可验证的智能体服务

All in AI 不是把所有工作接入通用大模型,而是建立数据发布版与领域模型 → 标准能力接口 → 华大自研智能体产品 → 场景交付 → 证据反馈的运营闭环。DCS Cloud 是受控服务平台,Genpilot 与 Cyto Coscientist 是主要智能体产品;通用智能体仅通过授权接口接入。科研、医学支持、检测和诊断按照风险递增原则设置验证、审批与责任边界。

4.1 模型资产组合:分开管理现有能力与建设目标

5 EB 是五大数据产出计划的规划原始数据规模,不等同于可直接训练的语料。只有通过知情同意与授权核验、质量控制、去重去标识、训练测试隔离及血缘登记的数据发布版,方可进入模型研发。模型价值以经过验证的场景效果衡量,不以参数量或训练数据量单独衡量。

模型资产定位主要输入目标输出发布门槛
Genos现有基因组研究模型版本化基因组序列与功能数据序列表征与基因组预测固定 Benchmark、外部留出集、模型卡与指标复现
Orion Geno现有基因组注释服务与模型参考基因组与多源注释基因结构、功能元件与变异证据覆盖度、一致性、来源证据与版本差异验证
虚拟细胞重点建设方向10BC 治理后单细胞与多组学发布版扰动、响应、状态迁移与互作预测跨队列留出、扰动评测与湿实验验证
病理多模态模型重点建设方向100KPM 配对影像、空间组学与临床元数据分型、预后研究与靶点发现支持多中心外部验证、漂移评估、可解释性与临床边界审查
技术路线:不强求把不同领域模型物理融合成单一模型,而由通用推理模型编排领域模型、检索、工作流与工具;每项结论保留数据版本、模型版本、参数、引用与执行记录。所有能力口径和指标以模型注册中心及模型卡为准。

4.2 产品架构:平台、智能体与生态接口边界清晰

治理数据 + 模型 + 评测
版本化资产
BioLens Skill / MCP / API
统一能力层
DCS Cloud · Genpilot · Cyto
华大自研交付
服务 + 证据反馈
收入与迭代
01
DCS Cloud · 受控服务平台
提供身份、项目空间、数据授权、算力调度、工作流执行、证据打包、计量计费与审计,是科研计算服务的运行环境,不与智能体概念混用。
02
Genpilot · 通用科研智能体
内置于 DCS Cloud,将科研意图转化为授权数据发现、分析规划、工具执行与证据化报告;高影响操作必须显式审批。
03
Cyto Coscientist · 领域科研智能体
聚焦单细胞与多组学的假设生成、分析、解读和验证设计;差异化来自领域评测、专有数据与模型以及可复现工作流。
04
通用智能体 · 授权客户端
Claude Code、Codex、Kimi 等作为开发工具或生态客户端,通过限定范围的 Skill、MCP、API 契约调用华大能力,不得绕过源数据控制直接访问。
产品原则:BioLens 是受控能力层,DCS Cloud 是服务平台,Genpilot 与 Cyto Coscientist 是智能体产品。各产品共用身份、授权、计量、审计、评测与证据标准,避免重复建设数据接口和分析流程。

4.3 场景交付:证据与责任先于自动化

场景智能体交付必要控制责任边界
科研检索、分析方案、可复现工作流、证据报告与验证建议数据授权、引用可追溯、结果可复现、专家复核研究者对假设与结论负责
医学研究与临床支持队列分析、标志物证据与决策支持信息伦理与预期用途审查、外部验证、隐私保护、人工签署不得替代有资质专业人员判断
检测与诊断仅交付经验证产品边界内的获批功能质量体系、分析与临床验证、监管准入、监测与召回能力未经准入不得自主输出诊断结论
实验自动化方案生成、排程、设备调用与质控告警仿真或空跑、安全联锁、操作员批准与急停智能体不得独立执行高风险实验
内部效率研发、知识检索、文档与运营辅助企业身份、数据分级、输出复核与成本控制与对外产品收入及壁垒指标分开核算

4.4 AI 工程与治理:建立可追溯的发布闭环

场景准入
价值 · 风险 · 预期用途
资产冻结
数据 · 模型 · Prompt · 工具
评测与红队
质量 · 安全 · 边界
分级发布
试点 · 灰度 · 生产
监测与迭代
反馈 · 事件 · 回滚
数据与证据
每个任务绑定数据发布版、授权依据、血缘、切分策略、引用和生成物。
模型与智能体评测
区分离线模型指标与端到端任务成功率;按场景维护黄金集、对抗集、回归测试和专家评分。
安全与隐私
实施最小权限、计算到数据、输出审查、提示注入防护、密钥隔离及模型工具全链路审计。
运营与责任
明确产品、模型、数据责任人与风险批准人,并定义 SLO、成本预算、事件分级、回滚和客户支持流程。

4.5 运营指标与验收

维度核心指标验收原则
结果质量任务成功率、证据完备率、复现率、专家采纳率按场景设基准,并与人工或既有流程对照
安全合规越权事件、高风险门禁绕过、隐私事件、审计覆盖率重大边界突破零容忍,事件可追溯、可恢复
服务效率SLO 达成率、端到端时延、成功任务单位成本、节省人工时长不得以牺牲质量和安全换取降本提速
产品经营活跃机构、付费任务转化、续约、交付毛利、支持成本收入可归因到产品、场景与服务协议
反馈飞轮采纳标注、新增评测样本、复用工作流、模型可量化提升只有经授权和质量复核的反馈进入新数据与模型发布版
验收结论:只有当专有数据与模型被持续转化为安全、可复现、可计量且可商业化运营的服务,All in AI 才形成战略结果。工具数量、模型调用量和演示效果只能作为过程指标。
第五章

数智基建:数据枢纽与 All in AI 的运行底座

IT 基础设施是高质量数据「流转」与「转化」的关键管道和载体。当前资源形态为区域化本地 HPC、存储与云端/超算租赁 AI 算力的混合体。目标架构演进为云为主、本地为辅。弹性资源以工作负载吞吐、排队时延、单位成本和服务 SLO 验证,不公开名义峰值与资产规模。华大算力网连接获批片区和云地域,支撑策略受控、数据就近执行。

混合
存储架构
本地
通用算力基线
云端
弹性 AI 算力
分层
数据留存
统一
网络控制
跨域
互联
云优先决策规则:新增工作负载默认按云上部署设计与预算;只有因监管要求、数据敏感度、确定性低时延、采集近端、长期稳定利用率经济性(须提供 TCO 对比,利用率超过本地盈亏平衡阈值时方可例外)或韧性需要,才申请本地例外。例外依据、数据分级、恢复目标和退出路径须在发布前登记。
现状基线 → 目标演进:先完成资产、利用率、成本与数据位置对账;再将新增弹性与 AI 工作负载默认放置云上;最终形成依据吞吐、SLO、单位成本和韧性证据扩展的云为主运营模式。本地仅保留监管、采集侧与连续性关键例外。

5.1 云优先架构与工作负载放置

基础设施不是简单的云/本地二分,而是依据数据分级、服务目标、弹性需求、依赖位置、全生命周期成本与恢复要求放置工作负载。DCS Cloud 是主要云服务环境;数据枢纽提供受治理的 Release 与策略;算力网连接采集端和本地例外区与云服务,且不得绕过访问控制。注:下文 L0–L3 为 IT 底座视角(云基础→统一控制→平台→应用);第三章则是 L0 治理与 L1 接入并行协同,通过联合门禁后进入 DataBrick 数仓与 BioLens 服务。

L0云基础层 · 托管存 / 算 / 网 / 安
弹性 GPU/CPU 与托管数据服务 云原生身份、密钥、日志与备份 多地域部署与灾备 FinOps 与配额管理
L1统一控制层 · 云优先与本地例外区
DCS Cloud / 云上 Kubernetes 基于策略的工作负载放置 本地安全区 / 采集缓冲区 华大算力网与数据就近执行
一个控制面;云为默认;本地为例外
L2平台能力层 · 数据枢纽、DCS Cloud 与安全服务
DCS 云平台
CNGBdb / 数据枢纽
L3应用 / 需求端 · 五大方向与 All in AI
五大方向项目组数据枢纽消费方
All in AI · 基座模型与智能体Genos · 虚拟细胞 · 病理
工作负载默认放置本地例外条件必备控制
AI 训练、推理与智能体服务云上弹性 GPU / 托管推理受限数据不可出域、确定性低时延或经验证的长期稳定利用率优势获批数据 Release、配额与预算、模型版本、调用链与回滚
科研分析与协同DCS Cloud 受控工作空间仪器近端处理或敏感数据安全区用途绑定访问、可复现环境、输出审查与到期回收
数据接入与留存云对象存储与托管归档采集缓冲、法定留存或带宽限制清单、校验、分级、加密、副本与恢复演练
平台控制服务多地域云托管服务离线连续性要求身份联邦、审计日志、SLO、备份与故障切换演练

5.2 存 · 大规模容量工程与数据生命周期

五大方向长期数据产出应作为逻辑原始数据产出估算,不能直接等同于受治理资产、有效训练数据或物理容量需求。容量工程分别对账原始产出、压缩去重后的物理留存、AI Ready 发布与实际消费;记录数据量、样本或病例、Release、质量与授权状态,并追踪任务、有效样本、结果产物及证据完整度。

现有容量基线
现有资源由并行文件系统、商业存储、云对象存储与归档组成。裸容量、可用容量、保护后容量、已占用容量和待退役容量须在资产台账中分别对账;具体规模仅保留在受控运营报表中。
云上分层与留存
默认采用云对象存储、归档与生命周期策略;本地容量仅服务获批例外区。存储层级按访问 SLA、留存义务、副本要求、恢复目标与预期出云模式选择。
资产台账与生命周期
每个数据集须有 Owner、用途、分级、留存与删除规则、Release 状态、成本中心和恢复目标。无主或到期资产进入评审与处置工作流;删除以证据和审批为基础,不再依赖周期性人工清理。
台账 / 层级内容治理策略验收指标
原始产出与合规留存下机数据、源文件、合规副本清单、校验、分级、生命周期分层、副本与恢复逻辑/物理字节数、清单完整率、校验通过率、副本及恢复成功率
受治理标准 Release标准化且质控通过的数据、元数据与索引版本发布、语义映射、质量画像、权限与血缘验收样本/病例数、元数据完整率、质控通过率、可复现率、检索 SLA
AI Ready 训练与评测资产训练集、验证集、Benchmark、特征与任务缓存独立版本、泄漏与污染检查、缓存生命周期管理有效样本或 Token、污染检查通过率、覆盖度、训练吞吐、评测稳定性
服务消费与派生资产Skill、MCP、API 调用及结果、模型、报告关联请求、策略、输入 Release、调用链、成本和输出版本任务/调用量、消费数据或 Token、证据完整率、成功率、单位成本、复用率
计算到数据
分析在获批云区或本地例外区内就近执行;条件允许时仅传输获批的派生结果。
可复用特征与索引
特征、索引与模型输入须保留生成配方;无引用缓存与中间结果按策略到期清理。
FinOps 成本可观测
将存储、计算、网络与托管服务成本归集到数据集、项目、模型、任务及适用的客户服务。
存量压力:区域集群间存储利用率不均,部分存量系统饱和度较高、服役时间较长且故障风险上升。本地与云上数据资源需统一对账、生命周期清理与分层放置;具体利用率和容量仅保留在受控运营报表中。

GENOS 压缩(研发选项):「仅存模型预测偏差」的路线可能降低基因组存储量,但必须通过可复现实验验证无损性、解压一致性、吞吐、计算成本、格式长期可维护性与恢复风险,方可纳入容量假设。

大规模容量工程决策:云对象存储与归档是主留存面;本地存储用于采集缓冲、获批敏感区、高频本地处理和恢复副本。容量投入和扩展依据对账台账、生命周期策略、实测入库峰值、保护开销和服务 RTO/RPO,不将逻辑产出直接等同于应采购磁盘容量。

5.3 管 · 机房基建与全生命周期资产化管理

「管」维度覆盖区域化核心机房基建与数据/设备全生命周期资产管理。它是连接存、算、传、安的运营基座,确保物理资源有账可查、数据有主可认、闲置资源盘活利用。

核心机房基建
区域机房提供本地例外区算力、存储、采集缓冲与恢复能力,核心站点通过算力网互联;站点名称、容量、饱和度和吞吐仅保留在受控资产与容量报表中。
数据认领与全生命周期清理
本地与云上数据按 Owner 和项目统一对账;未认领在职数据进入归属流程,已结项与临时数据进入基于证据的留存、归档或处置流程。具体数据量与完成比例仅保留在受控报表中。
全生命周期资产化管理
对全部计算、存储、网络设备实施标准化资产登记——从采购部署、利用率复核到退役清理。利用 AI 持续迭代 DM(数据管理)系统,提升资产追踪精度。删除以证据和审批为基础,以可审计的生命周期治理替代周期性人工清理。
互联互通与标准化治理
云上互联骨干支撑受控跨区连接;各片区统一元数据、数据分级分类、版本管理与访问控制,为数据枢纽跨区调度提供物理与运营基础。
关键进展:区域数据认领与生命周期清理持续推进,云上互联骨干已投入运行并支撑跨区、数据就近调度;量化进展仅保留在受控运营报表中。

5.4 算 · 云优先弹性调度

云上 GPU/CPU 是训练、推理、批量分析和智能体服务的默认执行池。统一调度器依据获批数据位置、敏感度、工作负载 SLA、排队时延、资源供给、价格以及适用的碳/能耗约束,选择云地域、加速卡类型、执行队列或本地例外区。本地 HPC 用于获批的稳定基线和例外场景,不作为默认扩容路径。

弹性 AI 算力
AI 加速资源由获批云厂商与超算机构提供。采购与调度综合评估可得性、单位成本性能、模型/框架兼容性、数据地域支持与退出可行性,不以名义峰值作为唯一指标。供应商组合、卡型数量、容量与利用率仅保留在受控资源报表中。
本地基线与例外容量
区域本地集群为获批的敏感、仪器近端与连续性工作负载提供受控容量。优先实施生命周期退役和利用率复核,不以新增容量为先;节点数、性能与利用率仅保留在受控报表中。
FinOps 与承诺管理
按工作负载可预测性组合按量、预留、竞价和承诺资源;执行项目预算、配额、闲置回收、单位成本基线和周期性偏差复盘。云迁移已降低运营成本,本地利用率不均进一步支持云优先调度;具体节省金额与利用率仅保留在受控财务和资源报表中。
多云与加速卡可移植性
在获批云和加速卡选项间验证可移植容器、工作流定义、数据访问模式与基准套件;降低供给集中风险,但不强求所有工作负载在各环境完全同构运行。
调度原则:计算进入获批的数据所在区。当云上同时满足安全、时延和经济性要求时优先云上;本地容量仅在获批例外下使用。每次运行记录输入 Release、环境、加速卡、策略决策、成本与输出血缘。

5.5 传 · 数据流动与跨区连接

网络连接采集点、本地例外区、云地域与灾备位置。目标不是让所有数据无差别流动,而是通过计算到数据减少传输;对获批副本、Release 分发与恢复流量,明确带宽、加密、校验与成本策略。骨干规模仅保留在受控网络报表中;后续容量由实测峰值入库、副本窗口和恢复目标驱动。

连接基线
生产骨干覆盖获批区域与云互联位置,并通过专线优化持续扩展。服务规划跟踪链路可用性、丢包、时延、峰值利用率、传输成功率与单位传输成本;线路数量、汇聚带宽、增长幅度、位置及节省金额仅保留在受控网络和财务报表中。
数据流动策略
将传输分为接入、获批副本、Release 分发、受控分析与恢复五类;每类明确数据范围、目的地、加密、校验、带宽窗口、留存和出云预算。
网络与传输控制面
华大算力网管理平台负责连接管理、任务路由选择、容量遥测与事件响应,并与数据枢纽策略和审计面集成。AI 辅助工程提升平台建设效率,DCS 在多地域、多供应体系运行;代码量、节点数、任务量、供应商拓扑及扩展位置仅保留在受控工程报表中。
网络原则:让获批数据区可达,而非让数据无边界流动。调度先选择执行就近性;仅在策略批准确有必要时,网络才提供加密、可观测、可恢复的传输能力。

5.6 安 · 云安全、合规与韧性

云优先不等于责任外包。研究院仍对数据分级、同意与用途控制、身份治理、密钥归属、配置基线、访问复核、证据留存和事件响应负责;云厂商仅对共享责任模型中约定的服务范围负责。高风险服务须明确 RTO/RPO、备份恢复演练、事件预案,并定期复核访问权限和恢复能力。

身份、访问与密钥控制
云与本地统一身份联邦;对敏感资产执行最小权限、用途绑定访问、临时凭证、特权访问复核,以及客户自管密钥或等效的获批密钥控制。
合规与数据主权
将数据分级与同意约束映射到获批地域、服务和传输路径;保留等保、ISO-27001、合同义务及适用临床/科研控制的证据。合规状态应落实到具体 Release 与服务,而非仅停留在系统层面。
韧性与恢复
按服务等级定义 RTO/RPO、备份不可变性、恢复演练频率、故障切换流程、依赖清单和沟通预案。恢复成功率与恢复时间必须通过演练度量,不能假定云地域天然具备。
安全运营与自动化
对配置态势、异常研判、敏感内容分类和证据采集实施自动化;隔离或修复动作保留人工审批。自动化以检测质量、研判时长、误报率和恢复结果评估,不以单一效率数字宣称价值。
安全与运维智能组件
当前试点包括本地模型告警研判和非结构化数据敏感内容分类,可辅助诊断与证据采集;任何修复动作均受 5.7.1 自动化分级控制。效率提升只有在基线、误报率、审批通过率和恢复结果可量化后,才可作为运营 KPI。
安全运营:持续开展主机防护、办公网与 WEB 攻击拦截、检查整改、合规认证、等级保护与专项风险闭环。重大事件、控制覆盖、拦截量、问题数及闭环指标仅保留在受控安全报表中;已获得 SGS《信息安全卓越实践奖》等外部认可。

5.7 平台支撑、运营与验收

IT 设施以云原生、策略受控的方式支撑数据枢纽与 All in AI。运营单元是服务,而非设备:每项服务都有 Owner、数据分级、工作负载放置决策、SLO、成本中心、安全基线、恢复目标和证据链。基础设施以可信服务交付与单位经济性验收,而不以设备数量或名义容量单独验收。

能力对数据枢纽的支撑对 All in AI 的支撑运营验收
云对象存储、归档、Release 仓库、生命周期策略与受控本地例外存储训练/评测资产、特征库、模型产物与证据留存Release 可用性、恢复成功率、留存合规率与单位存储成本
DCS Cloud 受控工作空间与计算到数据执行弹性训练、评测、推理与智能体编排排队时延、作业成功率、可复现率、GPU/CPU 效率与单位任务成本
获批的接入、副本、Release 分发与恢复路径数据就近执行与受控结果交付链路可用性、传输成功率、完整性、恢复窗口达标率与出云成本
身份、用途控制、审计证据、加密与合规映射模型/数据访问控制、智能体工具闸门、调用链留存与事件响应访问复核完成率、配置合规率、事件响应、恢复演练结果与审计证据完整率

5.7.1 智能化运维:从监控到受控自动化

Linux 自动巡检机器人纳入云优先底座的运营能力。现有材料已展示多指标采集、动态基线研判、根因报告,以及跨监控系统汇总存储节点状态。它的战略价值是闭合「遥测 → 诊断 → 获批动作 → 验证 → 证据」的运营链路,而不是让大模型直接控制生产系统。

遥测与资产上下文
指标 · 日志 · 事件 · CMDB
规则与本地模型研判
动态基线 · 根因
Runbook 与审批闸门
风险 · 范围 · 变更窗口
受控执行
自动化 API · 脚本
验证与证据
恢复 · 工单 · 审计
级别允许动作示例控制要求
L0观察与摘要采集健康指标、归并告警、生成日报只读凭证、数据最小化、调用链留存
L1建议与创建工单根因假设、容量风险、处置建议引用原始信号与置信度;人工承担决策
L2执行预批准低风险 Runbook重试采集、轮转非关键日志、重启获批无状态任务白名单、变更窗口、范围限制、自动验证与回滚
L3人工批准的高风险变更存储迁移、网络策略变更、数据删除、权限提升双人审批、工单关联、备份/恢复检查、变更后复盘
本地模型使用边界
本地部署模型可在通过任务准确性与安全评测后,用于敏感日志、私有配置上下文、告警聚类和一线报告生成;模型不持有生产凭证,也不能绕过策略和审批闸门。
首批自动化试点
首批场景覆盖存储节点健康与容量异常研判、云 GPU 闲置与成本分析,以及跨区传输失败诊断和重试编排。每个试点从观察或建议模式起步,只有误报率、研判时长和回滚演练达标后才进入更高自动化级别。
运维数据产品
发布版本化、访问受控的运维数据产品:资产清单、服务拓扑、容量、性能、事件、变更记录和 Runbook 结果。它们既是基础设施规划的证据底座,也是运维智能体的安全上下文。

5.7.2 大规模基础设施交付路径

阶段核心交付物验收证据
基线与控制对账存、算、网、数据台账;定义数据分级、工作负载放置、RTO/RPO、云落地区基线和观察/建议模式运维试点关键服务 Owner 明确;成本与利用率基线;恢复演练;带来源链接的运维报告
云优先服务运行云对象/归档生命周期、DCS Cloud 调度策略、FinOps 配额与分摊、获批数据流动路径及低风险自动化试点台账周期性对账;Release 可用性与恢复 SLO 可量化;作业成功率和单位成本看板;获批 Runbook 验证通过
规模化与韧性规模化运行云优先留存与计算服务;多地域恢复演练;策略受控本地例外区;运维证据回流容量规划恢复目标经演练达成;本地例外定期复核;成本偏差受控;服务和智能体 SLO 达标;高风险变更全程可审计
本章验收原则:当云优先服务能够为数据枢纽与 All in AI 提供受治理数据、弹性算力、安全连接、经验证恢复能力和透明单位经济性时,IT 设施才算达成目标。本地资源是可审计的例外补充,而不是新增需求的默认去向。
第六章

组织与人才:40 人双团队能力配置

数据中心在统一 O3 责权下管理数据枢纽数智基建两个团队,各 20 人。人员不按小组平均分配,而按服务责任和工作负载配置;团队负责人和组长均计入 40 人编制,两名团队负责人由组长兼任。整体能力覆盖五大数据产出、BioLens 与智能体服务、云优先运营及 5 EB 存管算传安工程。

40
总编制
2
专业团队
6
交付小组
5
数据方向支撑

6.1 编制分配总盘

团队小组人数岗位构成核心责任
数据枢纽 · 20数据运营与商业化7负责人 1;数据产品与领域运营 3;市场生态 1;解决方案销售 1;客户成功 1方向接入、产品组合、对外市场、销售转化、交付运营与反馈回流
应用研发8架构负责人 1;后端与数据平台 3;AI/Skill/MCP 2;前端与检索 1;质量与发布工程 1GigaNorn、DMP/DM、BioLens、Skill/MCP/API、证据链与平台可靠性
数据管理5负责人 1;标准与本体 2;质量与血缘 1;授权与合规 1身份、元数据、本体、质量规则、血缘、发布、授权与治理验收
数智基建 · 20系统运维8负责人/SRE Owner 1;云平台与 SRE 3;存储/HPC 2;可观测与 AIOps 1;备份容灾 1DCS Cloud、本地例外区、存算平台、SLO、自动化与恢复
资源管理6负责人 1;存算容量工程 2;FinOps 1;CMDB 与资产生命周期 1;服务目录与供应商管理 15 EB 容量规划、配额成本、资产台账、采购、利用率、服务目录与供应商 SLA
网络安全6负责人 1;网络与云网络 2;安全工程与运营 2;IAM 与合规 1算力网、跨区传输、零信任、身份权限、数据安全、合规与事件响应
管理跨度:O3 负责人通过两名团队负责人统筹六条小组责任线。团队负责人仍承担交付责任,不设置纯协调岗位;产品、项目、事件、成本和风险统一进入组合看板,避免新增管理层级。

6.2 岗位能力与交付矩阵

岗位簇人数必备能力明确交付物主要衡量
数据运营管理、产品与领域运营4组合管理、生命科学领域理解、产品设计、DMP、Release 运营、需求管理、跨方向协同组合看板、数据产品路线图、发布计划、服务目录、使用报告组合交付、发布及时率、采用率、复用率、合作方满意度
市场与生态1市场研究、生命科学行业洞察、内容与活动策划、合作生态、线索运营市场地图、价值主张、市场材料、有效线索、合作管线有效线索、获客成本、商机贡献、伙伴激活
解决方案销售1顾问式销售、数据与 AI 方案设计、投标合同协同、定价、合规边界意识商机计划、解决方案、报价、合同输入、收入预测商机金额、赢单率、签约收入、毛利、销售周期
客户成功与交付运营1客户入驻、项目交付、服务采用、问题协调、续约、证据化反馈成功计划、验收包、使用复盘、续约计划、产品反馈激活率、交付验收率、续约率、服务健康度、客户满意度
应用与数据平台研发6架构、前后端工程、数据服务、检索、云原生、质量工程、CI/CD、可观测性GigaNorn、DMP/DM、BioLens 应用、API、自动化测试与发布产物路线图达成、可用性、缺陷逃逸率、发布频率、恢复时长
AI、Skill 与 MCP 工程2智能体编排、工具契约、检索、评测、提示注入防护、模型服务集成版本化 Skill、MCP 服务、评测集、调用链与安全闸门任务成功率、契约测试覆盖、复用率、时延、单位成本、安全事件
数据治理5元数据与本体、数据质量、血缘、隐私、授权、发布治理、领域标准标准、字典、映射、质量规则、血缘记录、发布与授权证据元数据完整率、规则通过率、血缘覆盖率、审核时长、审计发现
云平台、SRE、存储、HPC 与容灾7云架构、Kubernetes、Linux、存储、调度器、基础设施即代码、SLO、备份恢复DCS Cloud 运行环境、存算服务、Runbook、监控、备份与恢复证据SLO 达成率、作业成功率、MTTR、恢复成功率、容量效率、单位成本
可观测与 AIOps1指标、日志、调用链、事件关联、自动化、本地模型、Runbook 编排、安全回滚统一遥测、巡检智能体、获批自动化、事件与容量报告覆盖率、告警准确率、研判时长、自动化成功率、回滚成功率
容量、FinOps、资产与供应商6容量建模、云经济性、采购、CMDB、资产生命周期、合同、SLA、供应商管理5 EB 容量模型、预算预测、成本分摊、资产台账、服务目录、供应商评分预测准确率、预算偏差、利用率、台账准确率、采购周期、供应商 SLA
网络、安全、IAM 与合规6云与数据中心网络、零信任、IAM、安全工程、SOC、数据安全、事件响应、合规算力网服务、访问策略、安全基线、检测规则、响应预案、合规证据链路可用性、变更成功率、权限复核完成率、响应时长、漏洞与重大事件

6.3 跨团队责任矩阵

A · 最终负责R · 主责执行C · 必须协作I · 知会每项能力只设一个最终负责小组,可有多个执行小组,不设多个最终 Owner。

核心能力数据运营应用研发数据管理系统运维资源管理网络安全
五大方向产品组合与需求准入A/RCCIIC
对外市场、解决方案销售与客户成功A/RCCICC
数据标准、质量、血缘、授权与发布CRA/RCIC
BioLens、DMP/DM、Skill、MCP 与 APICA/RRCIC
DCS Cloud 运行环境与生产 SLOICIA/RCR
5 EB 存算传容量与单位经济性ICCRA/RR
AIOps、可观测、事件、备份与恢复ICIA/RCR
身份、网络、数据与智能体安全及合规CRRRIA/R

6.4 人员能力分布矩阵

L3 · 架构与牵引L2 · 独立交付L1 · 正确协作矩阵定义小组应达到的能力深度,不要求所有成员成为全栈专家。

小组领域理解数据产品治理软件平台AI/Skill/MCP云/SRE/自动化安全合规商业化
数据运营与商业化L3L3L1L2L1L2L3
应用研发L2L2L3L3L2L2L1
数据管理L2L3L2L2L1L3L1
系统运维L1L1L2L2L3L2L1
资源管理L1L2L1L1L2L2L2
网络安全L1L2L2L2L2L3L1

6.5 交叉领域能力要求

人员采用T 型能力标准:每人至少具备一个 L3/L2 主专业、一个不低于 L2 的相邻专业,并达到全链路协作所需的共同基础。目标不是人人精通所有领域,而是确保科研意图、数据语义、软件、AI、基础设施与合规在交接过程中不失真。

能力域全员共同底线数据枢纽进阶要求数智基建进阶要求能力验收证据
生命科学与生物信息理解参与者—样本—实验—文件关系,以及主要组学模态、参考组装、批次、对照和科研/临床边界至少能独立定义一种模态的元数据、QC 与数据产品要求能将测序与分析流程转化为存算传及恢复要求完成一个真实数据集全链路讲解并识别科研与工程失效点
统计与科研严谨性理解抽样、偏差、混杂、泄漏、训练测试隔离、不确定性与可复现与领域专家设计质量画像、Benchmark 数据集和验收标准理解基础设施故障、重试与非确定性对科研结果的影响用版本化数据、代码、参数和环境复现一个公开或内部基线
数据工程与治理正确使用标识、Schema、元数据、血缘、版本、校验和、授权范围、留存与 Release 概念设计数据契约、本体、质量规则、Release 及 Skill/API 产品实现生命周期、放置、副本、完整性与数据就近计算控制交付一个从源登记到授权消费全程可追溯的 Release
软件与平台工程掌握 Git、代码评审、测试、问题跟踪、文档、密钥和可复现环境构建版本化 API、工作流、检索、数据服务、契约测试与可观测性使用 IaC、GitOps、配置管理、自动化、SLO 与回滚通过代码评审、自动测试、部署、观测与回滚演练
AI 与智能体工程理解模型局限、事实依据、工具授权、评测、人工复核、成本与隐私风险设计检索、Skill、MCP 工具、智能体工作流、评测集与证据包运营训练推理负载、模型网关、遥测、配额、隔离与 AIOps 控制用固定评测数据演示任务成功、证据追溯、成本计量与失败处置
云计算、大数据与规模工程理解数据引力、对象/文件存储、分布式计算、队列、带宽、弹性、SLO、RTO/RPO 与单位成本设计云感知数据产品与计算到数据工作流设计并运营云优先混合放置、容量、韧性、FinOps 与跨地域传输完成容量成本测算、负载测试、故障演练与恢复验证
安全、隐私与合规掌握数据分级、最小权限、用途限制、去标识、审计、事件报告及禁止行为将同意、授权、输出审查和责任人边界嵌入产品实施 IAM、零信任、加密、网络隔离、检测响应、备份恢复控制通过场景化授权、数据导出、事件响应和恢复演练
产品、服务与经营理解用户、场景、服务 Owner、SLA、验收、成本与反馈闭环将数据与 AI 能力转化为服务目录、解决方案、采用与收入提供透明的容量、可靠性、安全、供应商与单位经济性证据完成一次覆盖价值、质量、风险、成本和迭代决策的服务复盘

6.5.1 团队级能力覆盖与单点风险控制

覆盖要求数据枢纽团队 · 20数智基建团队 · 20
领域覆盖五大方向均有明确主责;基因组、单细胞、时空组、病理、生物多样性各至少 2 人能够正确协作至少 4 人能将生信工作流转化为存算传需求;每个关键平台均有主备 Owner
工程覆盖至少 6 人能独立交付生产代码或数据管线;至少 2 人可承担 AI、Skill、MCP 与评测工程至少 6 人可独立承担云、SRE、存储、HPC 或容灾工作;至少 2 人可维护 IaC 与自动化框架
安全合规覆盖至少 2 人可设计数据授权、隐私与发布控制;每名产品 Owner 能定义预期用途与禁止用途至少 4 人可承担安全或韧性事件指挥;IAM、网络、SOC、恢复均有主备覆盖
商业与服务覆盖市场、销售、客户成功与数据产品 Owner、解决方案工程师组成客户小队;不得脱离技术验证对外承诺容量、成本、SLO、安全与供应商承诺有明确 Owner,在合同或上线前参与方案评审
连续性关键标准、代码库、数据产品与客户采用主备制,形成交接文档并按季度演练关键服务、凭证、Runbook、供应商和事件指挥均设主备,生产系统不得单人依赖

6.5.2 能力建设与上岗门槛

实操准入
生产权限和独立交付资格以实操证据为准,不以参加培训代替:需在评审下完成数据 Release、代码部署、模型评测、事件演练或客户验收包。
跨团队轮岗
骨干每年完成一次 4–8 周相邻领域任务:数据枢纽人员进入云运维或安全场景,数智基建人员进入真实组学数据产品交付。
开源与英文能力
关键技术岗位能够阅读英文一手文档,评估开源许可证与社区活跃度,复现上游示例,提交 Issue/Patch,并维护内部选型决策记录。
季度能力盘点
每季度复核 L1–L3 矩阵、主备覆盖、交付证据和下季度学习契约;缺口通过培养、轮岗、招聘或供应商支持解决,不在缺乏能力时继续叠加职责。
不可妥协的底线:科研结论必须经过领域复核;生产变更必须授权且可回滚;临床或诊断输出必须经过质量体系与监管门禁;敏感数据不得进入未经批准的模型或工具;AI 生成的代码、分析与结论仍须测试、追溯并由责任人批准。

6.6 作战单元与绩效机制

五大方向数据产品小队
每个方向设置 1 名数据产品 Owner,按需配置数据 Steward、研发及基础设施/安全接口人;共担一张路线图和一套验收包,不新增行政汇报线。
AI 服务工程小队
6 人虚拟小队:AI/Skill 工程 2、平台研发 2、SRE 1、安全工程 1,负责将 BioLens 能力生产化交付给 Genpilot、Cyto Coscientist 与授权客户端。
5 EB 工程小队
6 人虚拟小队:存储/HPC、云平台、容量/FinOps、网络、安全、数据管理各 1 人,负责容量模型、放置策略、恢复方案与单位经济性。
评价层级核心指标不作为结果的代理指标
数据枢纽团队Release 时效与质量、平台 SLO、能力复用、活跃用户/机构、付费转化、交付验收、客户续约页面数、数据库数、会议数、一次性接口数
数智基建团队服务 SLO、作业/传输成功率、恢复成功率、安全事件、容量利用率、自动化覆盖率、单位成本设备数量、名义容量、告警数量、人工工单量
个人责任交付物、质量安全、复用贡献、协作证据、AI 工具带来的可量化改进单独使用 Token 消耗量或模型调用量
编制边界:系统运维 8 人、安全 6 人无法同时依靠内部人员覆盖所有 7×24 小时轮班。内部团队应掌握架构、变更、自动化、事件指挥和关键控制;持续监控与一线研判采用自动化并结合云厂商、供应商或托管 SOC 支撑,高风险决策和生产变更责任不得外包。
第七章

工程路线图:从基线验证到规模化运营

这是一个采用滚动规划 + 阶段门的多年工程:五年定方向,滚动维护未来 12–18 个月基线,只对下一季度做详细计划。5 EB 是规划上限,不是一次性建设目标;投资根据需求、风险、服务水平、恢复能力和单位经济性分批批准。

7.1 五条工程主线

工程主线目标结果主责
数据产品与治理五大方向持续产出版本化、可追溯、可授权、可评测的数据 Release数据枢纽
BioLens 能力平台DMP、DM、BioLens、Skill、MCP、API 形成统一受控能力链数据枢纽
AI 与智能体服务以受控数据与模型支撑可追溯、可评测、责任明确的智能体服务智能体/模型产品 Owner,数据枢纽供给能力
云优先 5 EB 基础设施形成弹性、可恢复、安全、成本可观测的存算传服务数智基建
服务运营与验证每项服务具备 Owner、服务水平、成本模型、验收证据和用户反馈数据运营与商业化、服务 Owner

7.2 阶段推进与治理

阶段核心交付退出条件
P0
基线 · 0–3 个月
明确范围、架构、台账、产出预测、成本基线、责任人、风险与试点标准范围、预算包络、安全边界、依赖及量化验收标准联合获批
P1
参考实现 · 3–9 个月
一个方向完成从受治理 Release 到 BioLens/智能体消费的生产级纵向切片科研、数据、平台、SRE、安全 Owner 联合确认追溯、SLO、恢复、成本及支持就绪
P2
受控复制 · 9–24 个月
2–3 个方向复用统一标准和平台组件,容量、成本与服务运营实现可度量至少两类模态通过同一门禁,无重大安全或恢复遗留,接入周期和单位成本下降
P3
规模运营 · 24–60 个月
合格方向分批进入服务,容量与智能体服务按已验证需求扩展年度投资具备服务水平、恢复、安全、采用、价值和单位经济性证据
统一治理:O3 负责人维护一套范围、架构、预算、容量、风险与依赖基线,主持季度发布和阶段门评审。每项发布按需通过科研数据、架构复用、安全合规、服务就绪、容量经济性和价值验证;重大变化必须重定基线,未达标试点应整改、缩减或终止。进展以合格 Release、复用、SLO、恢复、安全、采用、价值和单位成本衡量,不以功能数、复制数据量、模型调用量或名义容量衡量。

7.3 数据枢纽季度发布列车

Y1Q1 指项目基线正式批准后的第一个完整季度。未来四个季度形成承诺发布基线,后续季度作为滚动目标,每半年重新校准。每季度只定义一个组织可识别的标志性发布,内部可包含多个迭代;只有通过适用阶段门,并具备发布说明、验收证据、Owner 和运营支持,才计为正式发布。

年度目标Q1Q2Q3Q4
Y1 · 建立参考架构项目基线发布
架构、标准核心、RACI、台账与试点标准获批
DMP / DM v1.0
计划准入、权威路径核验与授权记录生产运行
Norn Registry v1.0
项目、参与者、样本、实验、文件与 Release 统一身份
参考数据产品 v1.0
一个方向完成治理发布、BioLens 消费与证据回流
Y2 · 公共平台可复用BioLens Search v1.0
授权发现、检索、引用与来源追溯
Gigaskill / MCP Gateway v1.0
Skill 登记、契约测试、评测、授权与审计
第二模态数据产品 v1.0
差异模态通过同一发布与服务门
BioLens Platform v2.0
2–3 个方向共享身份、策略、证据与服务运营
Y3 · 形成五方向产品体系Snotra Semantics v1.0
本体映射、语义质检与版本差异服务
多模态关联服务 v1.0
参与者—样本—实验—文件关联支撑授权联合分析
评测与证据中心 v1.0
评测集、泄漏检查、模型/智能体证据与复现记录
五方向数据产品目录 v1.0
符合条件的方向发布有 Owner、有版本的数据产品及服务边界
Y4 · 规模化智能体与对外服务BioLens Brain v2.0
策略路由、执行闸门、证据编排与失败恢复
Bragi AI Interface v1.0
面向 Genpilot、Cyto 与授权客户端的稳定评测接口
合作服务门户 v1.0
租户接入、授权、计量、SLA、支持与交付证据
数据服务组合 v2.0
按采用、质量、风险、收入和单位经济性评审场景服务包
Y5 · 形成生态级数据服务联邦数据接入 v1.0
跨获批外部节点执行策略一致的发现与计算到数据
数据资产观测台 v1.0
按 Release 观测质量、使用、血缘、成本、风险与价值
跨方向科研数据发布 v1.0
可追溯、获授权的多模态 Release 支撑经验证跨方向问题
BioLens Major Release v3.0
五年架构、产品、运营、经济性与风险控制通过独立评审
发布纪律:季度发布不等于季度重造。治理、平台、数据产品与服务里程碑交替推进,共享组件保持一条版本主线;若阶段门未通过,当季发布整改版或可靠性版本,不把未完成事项换名包装成新产品。