在开放获取时代,学者无法免费使用期刊论文的参考文献,这令人难以置信。引用数据是学术研究的基础,但当前主要被商业数据库垄断,限制了其广泛利用。
去年5月,加拿大开放指标服务ImpactStory的共同创始人Heather Piwowar在调查公开研究数据是否能增加论文引用率时,遭遇了困难。作为美国北卡罗来纳州杜克大学的博士后,她因缺乏机构层面的爱思唯尔Scopus数据库访问权限,最终通过与加拿大国家科学图书馆的研究协议才获得使用权。这需要提取指纹以获取证明,过程繁琐。Piwowar需要分析1万篇文章的引用次数,但其他主要引文来源如汤森路透科学网不支持PubMed唯一标识符查询。她感叹:“要是有公开的引文数据,我就可以自己写文章了!”
类似地,哈佛大学医学院神经病学家Steven Greenberg在研究假说如何通过重复引用被转变为“事实”时,也面临同样困境。他构建了一个包含242篇论文、675份引文和553个引文路径的引文网络,如果引文数据能轻易在线获取,将节省大量时间。
《自然》杂志报道指出,引文数据应被视为公共资源,并存储在开放数据库中。自2010年起,David Shotton领导了一个由JISC资助的价值13.2万英镑的项目,建立了开放引文语料库(OCC)。OCC目前仍处于早期阶段,正在寻求可持续资金。
开放式获取
直接引用是衡量研究影响力的主要指标。学术交流包括引用网络中的信息和观点流动,分析网络变化可揭示学者沟通模式及学科发展。这种信息对制定研究投资和战略、促进创新至关重要。
最权威的引文数据来源是汤森路透科学网,源于1964年Eugene Garfield创建的科学文献索引;其主要竞争对手爱思唯尔Scopus数据库诞生于2004年。两者均不完整,互为补充。英国每所研究型大学每年需花费数万英镑订阅这些资源,高昂费用损害了非机构用户(包括企业和公众)的利益。其他免费引文来源如谷歌学术搜索和微软学术搜索,但存在许可限制,阻止数据重新发布。
更糟的是,引文数据不准确。Shotton的引用记录在四个平台上截然不同:例如,他2009年的一篇语义学论文在汤森路透科学网、Scopus、谷歌学术搜索和微软学术搜索上的引用次数分别为22、37、88和16。更令人担忧的是,一篇更早的蛋白质结晶学论文在汤森路透科学网上有三个条目,引用次数分别为59、19和0。Shotton据此怀疑汤森路透期刊影响因子的可信度。
渐成主流
理想情况下,出版商应分享书目和引用数据,如自然出版集团将数据发布在data.nature.com上,这是唯一一家这样做的公司。但整合数据能带来更大收益。OCC将为用户提供完整的引用数据访问权限,数据来源广泛,包括传统学术出版物和其他数据,并标明来源。OCC将清晰展示文章与文章、文章与数据库、数据库与文章之间的引用关系,并提供附加信息如作者、机构成员、共同资助人、语义关系及数据来源。
一旦引用数据开放,有益的分析服务将得以开展,包括面搜索与浏览工具、建议与趋势识别服务、时间表可视化服务等。OCC对统计引用指标的价值将随覆盖面延伸而增加。
此外,错误引用更正服务对作者和编辑尤其有益。目前,出版论文的引用中约1%存在错误,小到标题中“β淀粉酶”写成“β-淀粉酶”,大到年份、期刊号、页码或DOI错误。OCC已在内部使用引用更正方法处理多次引用问题,或通过外部资源获取权威书目记录。
未来展望
10年前,有一个类似项目——开放引文计划,由英国南安普顿大学、美国康奈尔大学和arXiv共同构建,从1999年维持到2002年。该项目开发了引用库软件,但如今其网址已无法访问。要使OCC避免重蹈覆辙,需要拥护者、管理者、开发者、监督者的共同努力,以及同道合作、充足资金、支持者以社会福利为导向的决心、出版界支持、重要机构或国际组织的认同。你能贡献一份力量吗?(段歆涔)