拓冰建站拓冰建站
首页 / 资讯中心 / 正文

开放科学实践指南:从预印本到开放数据与代码

open-science这几年被讨论得很多但真要问它到底解决什么问题大多数人只能说出“免费看论文”这一个点。去年我帮一个师弟找文献正好被付费墙卡住——他在学校数据库里搜不到馆际互借要等一周最后在作者的主页上找到了手稿版本三分钟解决问题。这个小事把open-science的意义变得非常具体它不只是一个运动标签而是一整套能让知识更快、更完整地流动起来的工作方法。这篇东西我不想讲概念只想把open-science背后的痛点、四根核心支柱、普通研究者的上手顺序以及那些网站上没人写、只有真做了才会遇到的坑一次说清楚。1. 开放科学不是在喊口号它解决的是几个具体的痛点1.1 付费墙让知识流动断在半路先说最直观的痛点付费墙。学术出版被少数商业出版社垄断之后数据库订阅费年年涨涨幅长期跑赢通胀这已经是公开的事实。单个机构的经费再充足也买不全所有数据库更别说那些预算有限的高校、企业研发部门以及资源相对薄弱地区的研究者。我自己就有过一段特别狼狈的经历。课题组做一个交叉方向的综述需要同时在几个数据库里检索。检索本身没问题真正的噩梦发生在“拿到全文”这一步一篇文章在这家出版社的库里另一篇在那家出版社的库里中间还有个别文章只存在于某个机构内部库。有的文章我挨个给作者发邮件运气好两三天能收到PDF运气不好石沉大海。一篇两篇还好做综述时要处理几十上百篇文献时间成本高得吓人而这些时间本可以花在读文献和思考问题上。这里有个很多人没注意到的连带问题付费墙挡住的往往不只是论文正文。很多论文的补充材料、数据表格、附录代码都和正文一起锁在数据库里。论文写了一个结论你却在公开渠道看不到支撑这个结论的完整证据这才是最要命的。开放科学要打破的不只是“读一篇文章多少钱”而是这种让知识在传播链条上反复断裂的机制。1.2 可复现性危机结论“看上去对”是不够的比打不开论文更麻烦的是打不开结论背后的东西。心理学、医学、经济学这些实证领域这些年反复爆出大规模重复实验失败的消息。一个经常被提到的原因是“p-hacking”也就是反复变换数据处理方式直到凑出一个显著的p值还有一个词叫HARKing先看结果再倒推假设。但我不想把问题全部归到科研诚信上更多时候是正常流程本身就有漏洞论文正文只描述方法不公开原始数据和完整分析代码别人想复现根本无从下手。我参与过一次别人的复现工作记忆特别深。对方在论文里写了用某个统计软件跑混合线性模型但是没有写软件版本、没有写随机效应结构怎么设置、更没有提供原始数据文件。我们按最常见的一组参数跑了几个小时结果和原论文的差异相当大最后只能判断“无法完全复现”草草收场。那次经历让我彻底转变了认知分享数据不是科研之外的“额外负担”它本来就应该是科研交付物的一部分。如今越来越多期刊要求投稿时提交数据可得性声明说明整个学术共同体也在往这个方向走。1.3 出版周期太慢等不起的研究传统期刊从投稿到见刊一年到一年半是家常便饭。这个时间有很大一部分耗在了审稿流转上编辑部初审、找审稿人、审稿人返稿、作者修改、再送审、编辑决策、排版校对每一步都可能产生数周甚至数月的等待。对成熟的学科来说这个周期虽然让人烦躁至少还能接受但在突发公共卫生事件、紧急政策评估这类场景里慢一步就可能贻误决策甚至意味着研究成果失效。还有一层很多人没意识到学术界默认“谁先发表谁获得优先权”所以速度直接和学术回报挂钩。两个团队做同一个课题先发表的会拿到引用和认可后者即便独立完成也经常被看作跟风者。为了应对这种慢预印本服务器就成了关键解法——论文完成、通过基本格式检查后立刻挂到公共平台自带时间戳这个时间戳就是你关于“我先做到”的证据。后续再走正式期刊评审两者互不冲突。理解了这个背景你就能明白为什么那么多开放科学倡议把预印本当作第一块敲门砖。2. 开放科学不是“免费分享”四个字它由四根明确的柱子撑着2.1 开放获取论文从“藏在库里”到“被读到”很多人以为开放科学等于开放获取其实开放获取只是其中一根柱子。它解决的是“论文读不到”的问题主流的实现路径有两条金色OA和绿色OA。我自己在投稿时会专门列一张表来确认路线因为这两条路涉及的钱、权利和流程差别挺大。对比维度金色OA绿色OA出版方式直接发表在OA期刊或提供OA选项的期刊上发表在订阅制期刊论文存档到开放平台费用承担作者/机构支付文章处理费APC通常不用额外付费读者是否免费是是但可能有embargo期公开版本出版社最终版作者接受稿或作者自存档版时效性上线即免费可能延迟半年到一年预印本算是绿色路线的加速版不等同行评审先公开再评审。不同学科的主要阵地不一样物理、数学和计算机默认首选arXiv生命科学常用bioRxiv和medRxiv社会科学则常去SocArXiv和SSRN。这里有个新手很容易忽略的操作投稿之前先查目标期刊对预印本的态度。现在多数期刊允许但确实有一小部分不允许或者对版本有具体要求。与其事后被要求撤稿不如提前花五分钟在期刊官网或者Sherpa Romeo上把政策看清楚。2.2 开放数据让数据能被找到、看懂、再用开放数据不是把Excel随便丢到网上就算完事。学术数据的共享有一套社区公认的标准叫FAIR原则对应四个英文词可发现、可访问、可互操作、可重用。落到实际操作我理解的核心就三条。第一数据必须放在稳定平台并拥有唯一标识符DOI。只有DOI能保证别人引用你的数据时链接不会因为个人网页改版而失效。第二数据要有足够清晰的元数据也就是说明每个变量是什么意思、单位是什么、采集时间、处理流程缺了这些数据就是一堆无法解密的乱码。第三数据要带明确的许可协议告诉别人能不能用、怎么署名、能不能改。平台选择方面我最常推荐Zenodo。原因很实际免费、单文件上限50GB、和GitHub有官方集成而且不管论文是否中稿数据都能长期存放。Figshare也很常见操作更轻快。如果是某个领域特别规范的数据放在Dryad这类学科库里被发现的机会更大因为专业检索工具会重点收录。日常项目文件我习惯放Zenodo学科内正式数据集放Dryad两条腿走路。2.3 开放代码分析过程不再是黑箱论文方法部分写“我们用Python做了回归分析”这是没有意义的。代码开放的最低标准应该是别人克隆你的仓库之后按README能复现出一张和你论文里一样的结果表或结果图。很多研究者做到“把.py文件传到GitHub”那一步就觉得完成了其实远远不够。我自己的仓库至少包含四样东西README.md项目说明、带版本号的代码、环境配置文件、一份可供运行的示例数据。环境配置很关键Python项目建议用requirements.txt或者conda的environment.ymlR项目用renv管理包版本否则你用的pandas 2.0和别人的pandas 1.5行为可能有差异结果对不上还会互相怀疑。下面是一个简单的requirements.txt示例pandas2.0.3 numpy1.24.3 statsmodels0.14.0 scikit-learn1.3.0代码许可选MIT或Apache-2.0数据许可建议用CC-BY或CC0。很多初学者混淆法定许可代码和文本用CC协议并不合适数据同样不建议套MIT。规则很琐碎但一次设置好后续就不用操心。如果项目特别复杂还可以把整个运行环境打进Docker容器做到真正一键复现不过这属于进阶玩法普通项目没必要一上来就上容器。2.4 预注册和注册报告把“先上车后补票”变成“先买票”很多实证研究的分析过程其实是个“先打枪后画靶”的过程数据拿到手里之后反复试探哪种分析方式结果最好看再决定论文怎么写。倒不是大家故意作弊而是探索性的分析和验证性的分析在实践里很难分开。预注册就是为了在流程上把这两者切开——在实验开始之前把研究假设、样本量、分析计划写清楚登记到平台上去平台记录时间戳。之后做分析时哪些是事先计划的、哪些是临时补的一目了然。大多数预注册平台免费像OSF和AsPredicted都很常用。你只需要写清楚研究问题、主要变量、分析方法大概几页纸不需要长篇大论。比预注册更进一步的玩法叫注册报告期刊在你收集数据之前就审阅你的引言和方法通过以后等于“预接收”这篇文章接下来不管结果显著还是不显著期刊都会发表。这种方式直接对抗“只有显著结果才被发表”的出版偏见心理学和医学领域用得越来越多。你如果正在设计新实验可以考虑把注册报告纳入投稿选择。3. 一个普通研究者的open-science上手顺序3.1 第一步从“发预印本”开始我把开放科学的实践顺序想得很清楚不要一上来就想搞全套先把投入产出比最高的事情做了。哪件事性价比最高就是把手里那篇已近完成的论文挂到预印本平台上。不同学科的预印本阵地不一样对于新手我先给一张平台速查表平台主要覆盖领域是否收费首次使用注意arXiv物理、数学、计算机、定量生物免费新作者需要已有作者背书bioRxiv / medRxiv生命科学 / 医学免费有基础筛查流程SSRN经济、社科、法律免费注册即可上传OSF Preprints多学科聚合免费可同时推送到多个平台操作流程并不复杂定稿后上传PDF填写标题、摘要、学科分类选择许可协议发布。全程大约十几分钟。第一次在arXiv注册会遇到一个背书环节需要找一个有发文记录的合作者帮你确认这不是门槛只是平台的防垃圾机制。挂完预印本你马上能得到三个回报第一时间戳确定了优先权不必再焦虑“会不会被人抢先”第二同行能提前读到你并给反馈正式投稿前你可以把明显的问题改掉第三求职或申请基金时它多了一条公开可查的研究记录。这件事今天就能做不需要等“某天有空”。3.2 第二步给论文补一份“数据代码”配套包论文投出去之前我强烈建议做一件事把支撑核心结论的数据和代码整理成一个配套包。注意不是把研究过程所有中间产物全部公开那既不现实也没必要只公开“和论文结论直接相关”的部分就够了。数据上传我偏好Zenodo或Figshare。以Zenodo为例注册后新建upload填标题、作者、关键词、描述文件格式尽量用CSV、JSON这类通用开放格式别用某个统计软件私有的二进制格式因为你不知道别人用什么软件打开。上传后如果修改了数据记住一定不要新开一条记录而要在原记录上更新版本这样DOI保持连续性别人引用的旧版本数据也依然能追溯到历史。代码我建议用GitHub管理再打开Zenodo的GitHub集成。集成之后每次在GitHub上创建一个release版本Zenodo就会自动抓取源码并分配一个新DOI。实际操作就两条命令git tag v1.0.0 git push origin v1.0.0配套包里的README我有一套固定模板一句话说明项目、数据文件清单及格式、代码运行环境、从数据到结果的完整步骤、特殊情况说明。把缺失值怎么处理、异常值怎么剔除写清楚是最容易被忽略但最被使用者感谢的部分。3.3 第三步投稿前查三张表选期刊的时候大多数人都盯着影响因子和分区但做开放科学的人还会多查三张表每一张都可能影响你的稿子能不能按预期方式公开。第一张是期刊的预印本和自存档政策。Sherpa Romeo这个网站可以直接查输入期刊名就能看到“允许预印本”“允许作者接受稿”“有无embargo期”这些信息。查完这张表你就知道该不该在投稿前挂预印本能不能把接受稿传到机构库。第二张是期刊的合法身份。DOAJ开放获取期刊目录收录的都是经过审核的正规OA期刊一个声称开放获取的期刊如果不在DOAJ里同时官网又查不到清晰的APC费用公示就要打一个大大的问号。第三张是你自己的资助方政策。很多基金在合同里已经写明了成果开放要求比如结题后几个月内要把数据放进指定平台这些条款藏在合同附件里平时没人看真到验收时会被拿出来核对。3.4 第四步用OSF把整个项目串起来走到这一步你已经不是在“顺手分享”而是在用一个研究基础设施管理你的项目。这时候我会强烈推荐OSFOpen Science Framework因为它是少数能在一个项目页里同时放论文、数据、代码、预注册文件的平台生成一个专属链接和DOI之后可以直接发给合作者和审稿人。审稿人点开一个链接就能看到全部材料体验比“下载五个附件”好得多。在OSF上我会建几个组件一个放文档和预注册文本一个放数据文件一个关联GitHub仓库一个放审稿备用的说明材料。所有东西都在一处项目结束也能长期保留不会因为离职或换电脑而散落。如果时间有限我给一个优先级排序数据公开第一代码公开第二预印本第三预注册和注册报告第四。数据是一切下游工作的根先把根扎下去后面自然长得出东西。4. 真正实践之后才会踩到的坑4.1 版权转让协议不是签了就全完蛋第一次投稿OA期刊或者带OA选项的传统期刊时你会在系统里遇到版权转让协议。很多人一看到“转让版权”四个字就紧张觉得签完所有权利都没了连预印本都不能放。真实情况没那么绝对多数出版社允许作者在预印本服务器上发布稿件也允许在机构库保存接受稿只是禁止把出版社排版的最终版PDF挂到公开网络。所以不要凭印象判断签约前直接看协议原文里关于preprint、accepted manuscript、published version三类版本的措辞。还有一个经常被忽略的细节就算某个期刊默认不允许公开最终版你在论文接收时单独发邮件问编辑申请“开放共享”豁免编辑部很多时候也愿意同意。反正多问一句几乎零成本很多人直接放弃了这个机会。4.2 数据开放不是“全裸”伦理和隐私要做减法医学和社科问卷数据是隐私问题的高发区。一组问卷里可能包含年龄、健康状况、职业、甚至所在街道这样直接传上去等于是重大伦理事故。正确做法不是不做数据开放而是做减法。第一步去掉直接标识符姓名、证件号、精确门牌号全部删除第二步做泛化处理年龄变成年龄段地理位置保留到市级第三步设置访问条件某些敏感数据放在OSF或Zenodo的受限访问模式里想下载的人必须先申请、经过审核。不要觉得设了访问限制就不算开放科学合规的受控开放比直接裸奔更有价值。我还见过不少项目代码写得很规范打开数据文件却连变量名都是拼音缩写。这种开放其实等于没有开放因为代码根本对照不上数据含义。所以我总强调代码手册codebook要写而且要在数据公开的第一步就写这是整个数据开放环节里最容易被低估的一项交付物。4.3 担心被抢发现实反而相反“我把预印本放上去别人拿去改改投了怎么办”这个问题几乎每次讲开放科学都会有人问。我的回答往往让他们意外预印本的时间戳恰恰是在保护你的优先权而不是给你招来竞争者。学界一个不太成文的规矩是看到别人带着完整作者名单公布的预印本之后正常研究者更倾向于引用你而不是花力气绕过你重造一遍实验。重做实验的时间和成本远高于引用你的成本。当然极少数人会借鉴你的思路做出“变体”。应对这种情况能做的就是保留完整证据链预印本上写清全部作者和单位GitHub仓库保留每一次commit记录预注册文件写清楚核心方法这组证据在万一出现争议时足够说明问题。比起担心被抢发我更建议把精力放在尽快把成果变成正式论文上那才是真正稳固的学术资产。4.4 “伪开放”期刊开放获取不等于付费就能发开放获取和掠夺性期刊之间的关系是新手最容易踩的坑。判断一个开放获取期刊是否“伪开放”我有一套快速筛查标准。一看网站是否公开完整的编委会名单和实体办公地址二看APC费用是否在页面显著位置公示三看审稿承诺是否离谱比如“三天给结果”这种基本可以直接关掉页面四看是否被主流数据库收录Web of Science、Scopus、PubMed任选一个查就行。还有一个特别有效的办法直接发邮件给编辑部问清楚同行评审的流程细节。正规期刊通常会在邮件里详细回复如果对方含糊其辞只催着交版面费那基本可以判断为掠夺性期刊。需要提醒的是OA期刊影响因子低不代表它质量差有些新锐OA刊物在特定领域口碑很好反而一些传统大刊的OA选项APC贵得吓人。选期刊看的是方向匹配和口碑不是看“是不是OA”这一个维度。我自己这些年做下来的体会是开放科学不是一个“做完就结束”的任务而是一种持续的生产习惯。最开始我也不愿意多花时间整理数据和代码第一次挂预印本时README改了整整三版后来回头看那三版修改恰好是思考最深入的几天。坚持下来的收益是实打实的一篇论文因为数据全公开被另一个团队看中邀请我一起做后续分析一次基金评审评审人专门在意见里提到材料完整度高再后来做文献综述频繁用到别人的开放数据省下的时间难以估量。最后给你一个今天就能动手的建议挑你手头最接近完成的一篇文章今天下班前把预印本挂出去再把对应的数据传到Zenodo。剩下的事情边做边补不用等一个完美的时机。跑完一次完整流程之后你会明白为什么这个领域这么多人愿意多走一步。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门