从一张研究协议到一条可信证据链:RareLink 的 DGX Spark 黑客松十日谈

发布时间:2026/7/22 21:30:37
从一张研究协议到一条可信证据链:RareLink 的 DGX Spark 黑客松十日谈 从一张研究协议到一条可信证据链RareLink 的 DGX Spark 黑客松十日谈作者丁毓黄宇豪陈禹墨“寻找新的大陆”团队本文为 DGX Spark Hackathon 参赛成果记录。RareLink稀联是面向罕见病及小样本多中心医学影像科研的工程原型它不提供诊断或治疗建议也不将单机逻辑站点包装为真实医院部署。关键词DGX Spark、NVIDIA FLARE、MONAI、联邦学习、医学影像、Agent、差分隐私、罕见病科研写在前面我们想解决的不是“再训练一个模型”参加本次 DGX Spark 黑客松赛事我们最初的构想十分宏大让每一台 DGX Spark 设备成为医院科室专属的联邦学习终端落地罕见病多中心协同科研。但落地开发后我们迅速发现罕见病医学影像科研的核心痛点从来不是“训练一个高精度模型”。罕见病病种繁杂、三维 MRI 训练算力开销大、多中心原始数据无法集中汇总、小样本数据分布不均且单纯的模型精度分数无法支撑科研可解释、可复核、可持续迭代的核心需求。基于真实场景约束我们收敛了项目目标正式打造RareLink稀联工程原型在医疗原始数据不离开科室本地的前提下将研究协议、站点可行性核验、实验合同、本地模型训练、跨站点参数聚合、隐私安全复核、Agent 智能解读与全流程审计串联成完整可信的科研证据链。本次十日开发我们未做浮夸的生产级包装交付了一套可在真实 NVIDIA DGX Spark 设备上稳定运行、可展示实验缺陷、支持一键证据核验、明确标注能力边界的标准化科研工程原型。项目开源地址github.com/dingyucanada/RareLinkDay 1收敛问题边界打造可验证的科研成果“覆盖全品类罕见病”具备传播价值但无落地验证标准无法形成可信科研成果。为此我们锁定儿童高级别胶质瘤多中心 MRI 分割作为核心应用场景该场景精准契合罕见病科研四大核心痛点单中心样本量稀缺、四模态三维 MRI 算力消耗高、多站点数据分布不均、原始影像与患者数据严禁跨院集中。我们确立核心技术分工与边界原则从源头规避技术越界与场景错位不让大模型直接读取、解析医疗 MRI 影像严格拆分算力与业务链路由 NVIDIA DGX Spark 承载科室本地 CUDA 加速与三维影像模型训练MONAI 负责 NIfTI 影像预处理、分割模型推理与医学指标评估NVIDIA FLARE 统筹多站点联邦学习任务调度与参数聚合Step 3.7 仅处理脱敏研究协议、锁定实验合同与聚合统计指标。AI Agent 仅作为科研协作工具辅助梳理流程、沉淀证据绝不替代医生诊疗与科研决策。Day 2以边界为核心搭建可控科研工作流医疗科研系统的核心是约束可控、全程可追溯因此我们将所有核心业务约束写入系统状态机而非仅作为文档说明从代码层面固化安全与科研规范赛事版本三站点为单台 DGX Spark 模拟的逻辑站点不等同于真实三甲医院多院区生产部署原始影像、标注标签、患者隐私字段、DICOM UID、设备密钥、站点明细数据全程留存在科室本地禁止外发实验设计 Agent 仅可生成科研方案与合同草案无法自主锁定生效必须由研究负责人人工审批确认隐私评审 Agent 拥有报告生成阻断权限但无权放宽数据外发、隐私脱敏的硬性策略系统仅用于科研辅助不输出任何诊疗建议不做临床有效性、临床落地能力的相关声明。RareLink 控制面基于 FastAPI Pydantic SQLModel 搭建为科研协议、可行性核验、实验合同、模型训练、结果复核、报告生成配置独立合法的状态流转逻辑。所有 Agent 输出结果均经过结构化校验后录入审计账本存档让最终交付成果不再是单一模型分数而是一套包含审批记录、策略规则、运行日志、模型路径、聚合指标的完整可追溯科研档案。Day 3精细化 Agent 分工杜绝模型单点依赖为解决通用大模型越权、输出不可追溯、科研流程混乱的问题我们拆解出五角色专属 Agent 团队各司其职、相互约束形成闭环协作机制研究主任 Agent将自然语言科研需求转化为标准化结构化研究协议实验设计 Agent生成多组对照实验方案、训练策略与站点分配规则统计评审 Agent兼顾全局平均指标与最弱站点指标客观呈现多站点训练差异与风险隐私评审 Agent全程校验数据输出边界、脱敏合规性阻断违规报告生成科研写作 Agent仅基于系统核验通过的真实实验证据生成标准化科研报告。同时我们设置严格的模型降级机制Step 3.7 仅接收脱敏文本与聚合指标不触碰原始医疗数据当网络异常、API 不可用时系统自动回退为确定性模板 Agent保障科研工作流持续运行避免依赖远程大模型导致流程中断。在科研基建场景中Agent 是可替换、可审计的协作组件而非不可控的核心单点。Day 4基于合成影像跑通全链路坚守工程真实性在接入公开医疗数据集前我们率先构建三逻辑站点四模态 NIfTI 合成影像数据集完整跑通全技术链路影像预处理、MONAI 三维 SegResNet 模型训练、Dice/HD95 医学指标计算、模型权重持久化、哈希校验全流程落地。初期极小样本单轮训练的模型精度表现较差但我们选择完整保留低分结果与实验日志。低精度指标无法证明临床模型性能但可以验证影像读取、GPU 正反传播、指标计算、模型存储全链路真实有效绝非前端虚构数据。这也成为项目核心底线工程流程跑通不代表临床效果有效所有能力边界公开透明。Day 5优化联邦评估逻辑拒绝单一平均分误导接入 NVIDIA FLARE 联邦学习框架后三逻辑站点可完成本地模型训练、参数上传、全局参数聚合全流程支持 Local、FedAvg、FedProx 多种训练策略灵活切换。初期我们沿用行业通用的平均 Dice 指标评估模型但很快发现核心缺陷平均指标会掩盖弱势站点的训练退化风险造成“整体效果优秀”的虚假结论。为此我们重构评估体系系统强制展示平均 Dice、最弱站点 Dice、站点指标标准差、HD95四项核心数据。在多中心罕见病科研中弱势站点的训练表现、站点间性能差异是评估实验可行性、判断研究价值的核心依据远比单一平均分更具科研意义。这一优化让项目从简单的模型训练 Demo升级为具备科研治理能力的可信实验平台。Day 6深挖 DGX Spark 算力价值适配原生硬件架构我们将项目完整迁移至真实NVIDIA DGX Spark GB10设备适配 ARM64 架构、CUDA 13、PyTorch 2.10.0cu130、MONAI 1.6.0、NVIDIA FLARE 2.7.2 全套软硬件栈。实现 CUDA 矩阵计算、三维医学影像训练、联邦任务调度、后端 API、Web 控制台、Agent 工作流在本地算力节点一体化运行。落地过程中我们攻克了多项硬件适配工程难题Docker 代理异常、普通账号 Socket 权限受限、GB10 算力架构兼容告警、统一内存资源压力过载等。我们不修改共享节点基础配置、不通过 SSH 传输大体积影像与模型文件而是通过复用官方 CUDA 容器、精细化权限管控、单设备多任务串行执行、完整记录兼容告警与资源约束的方式保障工程稳定性与规范性。DGX Spark 在本项目中的核心价值并非简单提供算力而是实现数据属地训练、算力本地调度、全流程闭环可控彻底摒弃集中式数据传输的传统模式贴合医疗数据隐私合规要求。Day 7多策略多种子对照构建稳健实验证据单次实验结果极易受随机种子、训练策略影响不具备科研说服力。为此我们设计5组随机种子 × 5种训练策略 × 3轮联邦迭代的对照实验方案覆盖 Local 本地训练、FedAvg 联邦平均、FedProx 联邦近端、严格 SVT 参数过滤、DP-SGD 差分隐私训练五种核心模式实现 25/25 实验组完整跑完无遗漏、无跳过。为保证对照公平性本地训练模式自动匹配与联邦训练同等的训练轮次与迭代次数。实验结果客观呈现优劣差异FedAvg 综合稳定性最优FedProx 可优化弱势站点性能但平均精度无优势严格 SVT 参数过滤策略在多次实验中完全失效。我们完整保留所有失败实验组与原始数据不刻意筛选最优结果真实还原隐私保护与模型效用的取舍关系。Day 8落地差分隐私细化隐私合规边界联邦学习仅能规避原始数据集中风险无法杜绝模型参数、聚合指标、运行日志的信息泄露风险。为补齐隐私安全短板我们基于 Opacus 实现样本级 DP-SGD 差分隐私保护通过逐样本梯度裁剪、高斯噪声注入、Poisson 采样与 RDP 跨轮隐私会计量化管控隐私风险。在 noise_multiplier1.2、max_grad_norm1.0、delta1e-5 的三轮训练配置下最终隐私会计结果稳定可控ε 6.076881δ 1e-5。同时我们解决了多项工程细节问题针对 Poisson 采样空批次导致三维卷积训练报错、空批次隐私预算失真、MONAI 字典样本 dtype 异常等问题完成专项修复。我们对隐私能力保持严谨表述当前差分隐私仅覆盖本地模型训练环节并非端到端、用户级、医院级的全域隐私保障不构成临床隐私合规认证。Day 9构建双向安全校验兼顾正向通过与反向拦截为验证跨站点通信安全性我们搭建跨设备加密通信链路DGX Spark 部署 FLARE 服务端Mac 设备模拟第三方站点完成 mTLS 证书注册、断线重连全流程演练通信链路稳定可靠。同时设计反向安全测试使用非法设备凭据发起连接请求系统成功识别异常身份并拒绝接入验证证书校验机制的有效性。针对 Agent 安全边界我们搭建双向网关防护体系输入网关自动拦截患者标识、DICOM UID、影像路径、密钥、隐私字段等敏感数据输出网关禁止生成诊疗建议、违规数据请求、夸大临床结论、私自修改实验合同。最终完成 12 条输入安全用例 14 条输出安全用例测试实现26/26 用例全通过完整验证策略网关的管控能力非完整渗透测试、非通用模型安全认证。Day 10落地证据驾驶舱实现实验结果可核验、可复现开发收尾阶段我们不再新增功能聚焦证据标准化、结果透明化、流程可复现打造专属证据驾驶舱与一键复现工具包。证据驾驶舱严格区分流程沙盘与实机核验收据沙盘用于演示科研协议、合同审批、Agent 协作全流程实机收据支持哈希校验、三站点指标查看、全局模型核验、实验边界查询确保所有成果可溯源、可复核。一键复现包无需下载影像、模型、密钥、证书默认核验四大核心工程证据25组多种子对照实验、DP-SGD 隐私会计结果、Spark-Mac 跨设备 mTLS 安全校验、26条 Agent 网关安全用例。本地无运行产物时仅生成标注明确的脱敏演示快照绝不伪造实验结果。同时我们在 DGX Spark 设备上完成MSD Task01_BrainTumour 公开脑肿瘤数据集真实工程验证校验数据集 MD5、SHA-256 哈希完整性对24例四模态 MRI 影像做几何校验与非IID 三站点均分每站8例完整跑通单站 CUDA 训练、三站点 FedAvg 联邦聚合全流程实测数据如下测试项目实测结果实验数据MSD Task01 公开数据集24例四模态三维MRI均分3个逻辑站点每站8例单站CUDA冒烟测试7例训练/1例验证1轮epoch耗时6.7476s峰值显存5240.349MiB三站点FedAvg联邦训练1轮联邦迭代、每站1轮本地训练3/3站点参数全部聚合并持久化全局模型端到端总耗时69.0084s全局聚合指标Dice0.041624HD95102.413666最弱站点指标Dice0.012345站点Dice标准差0.024265注以上数据仅用于工程链路验证不代表临床模型性能不用于诊疗效果评估与策略优劣对比。十日复盘已完成能力与明确边界本次黑客松开发周期内我们未追求噱头式功能堆叠聚焦可信、可控、可复现、可追溯四大核心目标完成阶段性成果落地✅ 实现医疗影像数据科室本地留存基于 MONAI 完成真实三维医学模型训练✅ 基于 NVIDIA FLARE 完成多站点联邦参数聚合规避原始数据泄露风险✅ 构建五角色受限 Agent 团队实现科研全流程标准化、可审计✅ 落地样本级差分隐私与 mTLS 加密通信量化隐私安全能力✅ 完整保留失败实验、缺陷数据与能力边界杜绝科研成果美化✅ 打造证据驾驶舱与一键复现工具实现全流程证据核验。同时我们清晰界定项目当前边界不夸大能力❌ 非医院生产级系统无临床诊断、治疗辅助能力❌ 仅为单设备多逻辑站点工程原型未完成真实多院跨网部署❌ 未对接医院 PACS/FHIR 临床系统无真实临床验证数据❌ 隐私与安全能力为工程验证级别未通过专业渗透测试与临床合规认证。未来展望打造数据不出院的多中心科研操作系统后续我们将循序渐进推进项目迭代首先遵循数据使用规范基于 BraTS-PEDs 儿童脑肿瘤公开数据集完成外部工程验证其次对接真实合作医院部署独立 DGX Spark 客户端搭建真实多院证书化联邦通信与本地审计体系。RareLink 的长期愿景始终清晰不替代医生诊疗只赋能科研可信构建一套真正适配罕见病小样本、多中心场景实现数据不出院、过程可审计、证据可回溯、结果可迭代的医疗科研操作系统。项目与权威参考链接项目开源仓库RareLink on GitHubNVIDIA DGX Spark 官方产品页NVIDIA DGX SparkNVIDIA FLARE 官方文档NVIDIA FLAREMONAI 医学AI开源框架Project MONAIMedical Segmentation Decathlon 数据集MSD 数据集入口BraTS-PEDs 儿童脑肿瘤数据集TCIA 数据集页面