FIVE DATA PROGRAMS × ALL IN AI

AI Ready / Readable
数据基础设施

围绕五大数据产出计划,建设统一的数据治理、数据产品、智能服务和云基础设施。目标是把持续产生的数据转为可管理、可计算、可训练、可服务的资产,并通过 BioLens、DCS Cloud(Genpilot)和 Cyto Coscientist 形成科研、医学、检测与诊断服务。

战略精简版2026.08内部文件范围:数据枢纽 + 智能服务 + 数智基建
5 EB五年规划数据产出
5数据产出方向
D0–D4数据产品等级
40 人双团队总编制
20 季度产品发布节奏
Chapter 01

战略目标:把数据和模型转为持续服务

华大的核心资产是稀缺样本、规模化多组学数据和领域模型。数据基础设施负责把这些资产转为标准化、受控、可复用的数据与模型服务;DCS Cloud、Genpilot 和 Cyto Coscientist 负责面向用户交付。

01 资源样本、队列、合作网络
02 工具测序、单细胞、时空、影像
03 数据CNGBdb BioLens 数据产品
04 模型Genos、虚拟细胞、病理模型
05 智能体Genpilot、Cyto Coscientist
06 服务科研、医学、检测、诊断
战略单元:数据产品 + 模型 + 智能体 + 领域验证。评价结果看服务质量、使用、收入和反馈,不看文件量、系统数或模型调用量。
投入重点

规模化多模态数据、领域模型、受控智能体服务和公共工程能力。

建设边界

不以一次性交付、孤立数据文件和脱离专有资产的通用智能体作为主要增长模式。

运行原则

数据受控、计算到数据、版本可追溯、结果有证据、高风险有人审。

Chapter 02

五大方向:统一治理,分模态交付

五大方向规划产出约 5 EB。统一身份、授权、版本、质量和血缘;针对序列、矩阵、空间影像、表型队列和病理病例分别建设数据产品。

五大方向的数据、基础设施重点与服务
方向规划量主要数据基础设施重点主要服务
STOC0.5 EB空间表达矩阵、坐标、组织影像、分割结果坐标体系、切片对齐、影像金字塔、跨物种本体图谱检索、ROI、空间表达、影像切片
HGP21.5 EBFASTQ、BAM/CRAM、VCF、表型与队列样本关联、参考版本、变异规范化、隐私计算区间/变异查询、频率统计、队列构建、关联证据
EBP1 EBFASTA、GFF/GTF、转录本、蛋白、标本信息物种身份、组装质量、注释版本、分类学对齐组装与注释目录、序列查询、直系同源、比较基因组
10BC1 EB稀疏矩阵、AnnData/Zarr、细胞注释与 QC供体—样本—细胞关联、细胞本体、批次与分层抽样细胞图谱、矩阵切片、参考映射、训练批次、扰动分析
100KPM1 EBWSI、ROI/Mask、DNA/RNA/空间组学、结局病例—标本—蜡块—切片—分子检测对齐病例队列、影像瓦片、跨模态病例、分型与预后研究

AI Ready 验收

真实完整

源数据、协议、仪器、批次和样本来源齐全。

配对对齐

参与者、样本、实验、文件、影像和结果关系稳定。

标准可复现

本体、参考版本、流程和 Release 固定。

合规受控

同意、用途、许可、跨境和访问策略机器可执行。

可训练评测

完成去重、污染检查、数据切分和独立评测。

可服务运营

形成数据集、查询、计算、API/Skill 和服务指标。

Chapter 03

数据枢纽:从源数据到数据服务

数据枢纽统一管理身份、标准、接入、质量、授权、版本和服务。L0–L3 构成数据产品主链;BioLens Brain 是覆盖四层的横向编排与策略控制面,不是主链中的串行节点。

L0 治理GigaNorn:身份、标准、本体、授权
L1 接入DMP / DM / DCS:计划、权威位置、Release、受控计算
L2 数据产品BioLens:对象、索引、切片、训练物化
L3 消费接口Search、API、MCP、Skill、工作空间
应用Genpilot、Cyto、模型与授权合作方
BioLens Brain · 横向编排与策略控制面覆盖 L0–L3,按任务调用各层能力
L0 · 治理解析解析实体、本体、用途、授权与质量规则
L1 · 接入编排核验计划、权威位置、Release 与执行环境
L2 · 产品选择选择对象、切片、队列、物化和证据产品
L3 · 消费控制路由接口与 Skill,执行闸门、审计和结果回链

D0–D4 数据产品

D0–D4 数据产品分级
等级产品内容服务方式关键控制
D0 受控源原始序列、比对、原生影像、矩阵、表型源表、日志目录、完整性核验、归档、计算到数据不可变清单、Checksum、来源、同意、留存、审计
D1 标准对象标准序列/变异、AnnData/Zarr、影像金字塔、规范表型区间、矩阵、Tile/ROI、Schema 感知访问格式、坐标、Schema、对象关系校验
D2 语义证据实体关系、本体映射、注释证据、QC、队列与索引实体、队列、跨版本、跨模态、聚合查询语义一致、查询权限、隐私与用途限制
D3 训练物化用途绑定快照、特征矩阵、Patch、Token、Split、Shard分析批次、训练流、特征服务、受控导出防泄漏、可重建、版本、成本、到期撤销
D4 模型证据预测、Embedding、模型卡、评测、解释、专家复核推理、证据回链、结果追踪、验证报告数据—模型—参数—结果闭环,漂移与用途审查

公共服务平面

目录与发现

数据集、实体、版本、质量、授权和可用服务。

对象与切片

文件、区间、矩阵、影像瓦片、ROI 和分页访问。

队列与语义

跨数据集筛选、聚合、关系查询和证据检索。

受控计算

计算到数据、沙箱工作空间、输出审查和审计。

训练与评测

版本化批次、采样、特征、Benchmark 与复现环境。

结果与证据

模型结果、来源引用、专家复核和验证记录。

产品规则:每项数据产品必须声明 Owner、用途、粒度、格式、来源 Release、质量、权限、刷新周期、留存、SLO、成本和证据。Skill、MCP、API 只是调用方式,不能替代数据产品。
Chapter 04

智能服务:平台统一,产品分工

All in AI 的重点不是增加通用工具,而是使用华大数据和模型交付可验证、可计量的智能体服务。

智能服务组件与职责
组件定位主要责任
CNGBdb BioLens受控数据与能力层数据发现、访问、计算、训练产品、证据和接口
DCS Cloud科研与 AI 服务平台身份、工作空间、算力、应用交付、计量和客户运营
Genpilot通用科研智能体检索、方案、分析、代码、工作流和报告
Cyto Coscientist生命科学专业智能体单细胞/空间组学分析、解释、证据与实验建议
Claude Code / Codex / Kimi授权外部工具研发和知识工作提效,不承载未经批准的敏感数据

场景与责任边界

场景责任边界
场景可交付能力必须控制责任人
科研检索、分析方案、可复现工作流、证据报告授权、引用、复现、专家复核研究者负责假设与结论
医学研究队列分析、标志物证据、决策支持信息伦理、预期用途、外部验证、隐私、人工签署专业人员负责判断
检测诊断仅限经验证和获批的产品功能质量体系、临床验证、监管、监测与召回未经准入不得输出诊断结论
内部研发代码、知识检索、文档、运维辅助企业身份、数据分级、输出复核和成本控制业务 Owner 对结果负责
发布流程:场景准入 → 数据/模型/Prompt/工具冻结 → 离线与端到端评测 → 安全测试 → 试点与灰度 → 生产监测 → 反馈进入下一 Release。
任务成功率证据完备率专家采纳率SLO成功任务单位成本付费转化续约安全事件
Chapter 05

数智基建:云为主,本地为辅

新增弹性计算、AI 训练推理和协同分析默认上云。本地保留采集近端、受限数据、确定性低时延、持续高利用率或连续性关键负载。所有例外必须记录依据、成本、恢复目标和退出路径。

425 PB本地存储裸容量
6,183 T本地通用算力
82,597 T云租 AI 算力
173.8 PB现有数据资源
963 G网络带宽
存算传安管建设与验收
领域建设任务验收指标
建立热、温、冷、归档层级;按 Release、访问和法规执行生命周期;维护原始、物理、AI Ready、消费四本台账。容量对账率、完整性、恢复成功率、PB 月成本
DCS Cloud 统一调度云 CPU/GPU;本地集群纳入例外管理;支持数据就近计算、配额和 FinOps。作业成功率、排队时延、GPU 利用率、成功任务成本
建设跨区域传输通道、断点续传、校验、带宽调度和审计;大规模迁移先做样板。传输成功率、端到端时延、校验通过率、单位传输成本
统一 IAM、最小权限、加密、网络隔离、数据分级、检测响应、备份和灾备。越权事件、审计覆盖、补丁时效、RTO/RPO 演练
统一 CMDB、服务目录、资产、容量、成本、供应商 SLA、变更和事件管理。台账准确率、SLO、MTTR、容量预测偏差、成本偏差

5 EB 容量原则

5 EB 是逻辑原始数据规划量,不等于一次性物理采购量。容量按数据保留策略、压缩去重、访问热度、副本、恢复、网络与年度产出滚动核算,分批批准。

运维自动化

L0 观察

采集指标、归并告警、生成日报;只读。

L1 建议

根因假设、容量风险、处置建议;人工决策。

L2 执行

执行预批准低风险 Runbook;白名单、验证、回滚。

L3 高风险

迁移、删数、网络与权限变更;双人审批、全程审计。

首批试点:存储容量异常研判、云 GPU 队列与成本异常分析、跨区传输失败诊断与重试。先做 L0/L1,达标后再开放 L2。
Chapter 06

组织能力:40 人双团队配置

数据中心在统一 O3 责权下管理数据枢纽和数智基建两个团队,各 20 人。编制按服务责任分配,不按小组平均分配。

40 人双团队配置
团队小组人数岗位构成主要责任
数据枢纽
20 人
数据运营与商业化7负责人 1;产品/领域运营 3;市场 1;销售 1;客户成功 1方向接入、产品组合、市场销售、交付和反馈
应用研发8架构 1;后端/平台 3;AI/Skill/MCP 2;前端/检索 1;质量发布 1GigaNorn、DMP/DM、BioLens、接口、评测和平台可靠性
数据管理5负责人 1;标准本体 2;质量血缘 1;授权合规 1身份、标准、本体、质量、血缘、Release 和授权
数智基建
20 人
系统运维8负责人/SRE 1;云平台/SRE 3;存储/HPC 2;AIOps 1;容灾 1DCS Cloud、本地例外区、存算平台、SLO、自动化和恢复
资源管理6负责人 1;容量工程 2;FinOps 1;CMDB 1;服务/供应商 15 EB 容量、配额成本、资产、采购、服务目录和 SLA
网络安全6负责人 1;网络/云网络 2;安全工程运营 2;IAM/合规 1算力网、跨区传输、身份、数据安全、合规和事件响应

团队级能力要求

领域能力

五大方向均有主责;关键领域至少两人可协作;至少四人能把生信工作流转为存算传需求。

工程能力

数据枢纽至少六人可独立交付生产代码或管线;数智基建至少六人可独立承担云、SRE、存储、HPC 或容灾。

AI 能力

至少两人负责 Skill、MCP、检索与评测工程;所有产品 Owner 掌握模型边界和证据要求。

安全能力

关键权限、平台、Runbook、客户和供应商均设主备;生产系统不得单人依赖。

商业能力

市场、销售、客户成功、产品和方案工程组成客户小队,技术验证先于对外承诺。

准入机制

生产权限以 Release、部署、评测、演练或客户验收等实操证据为准。

Chapter 07

工程路线:阶段门与季度发布

五年确定方向,滚动维护 12–18 个月基线,只对下一季度做详细计划。每项发布必须有 Owner、Release Note、验收证据和运营支持。

阶段门

P0
0–3 月
明确范围、架构、台账、成本、责任、风险与试点。范围、预算、安全边界和验收标准获批。
P1
3–9 月
一个方向完成从受治理 Release 到 BioLens/智能体消费的生产级纵向切片。追溯、SLO、恢复、成本、安全和支持联合验收。
P2
9–24 月
2–3 个方向复用统一标准和平台,容量、成本与服务可度量。至少两类模态通过同一门禁,接入周期和单位成本下降。
P3
24–60 月
五大方向分批运营,容量与智能体服务按真实需求扩展。年度投资具备服务、恢复、安全、采用、收入和单位经济性证据。

数据枢纽季度发布列车

五年季度发布列车
年度Q1Q2Q3Q4
Y1
参考架构
项目基线DMP / DM v1.0Norn Registry v1.0首个参考数据产品
Y2
平台复用
BioLens Search v1.0Skill / MCP Gateway v1.0第二模态数据产品BioLens Platform v2.0
Y3
五向产品
语义服务 v1.0多模态关联 v1.0评测与证据中心五方向产品目录
Y4
对外服务
BioLens Brain v2.0智能体数据接口合作服务门户数据服务组合 v2.0
Y5
生态运营
联邦数据接入数据资产观测台跨方向科研 ReleaseBioLens v3.0
统一验收:以合格 Release、平台复用、SLO、恢复、安全、采用、收入和单位成本衡量。阶段门未通过时,发布整改或可靠性版本,不包装未完成事项。