构建科研版GPT-3的技术路径
目录:是什么让科研数据充满挑战
是什么让科研数据充满挑战?如何为科学领域构建一个类似DALL-E或GPT-3的模型?当前进展如何?为何是现在?
想要创作一幅“1932年风格《摩天楼顶的午餐》、描绘速龙在摩天大楼上工作”的图像?使用DALL-E。想要生成一场由Peter Thiel、Elon Musk和Larry Page参加的虚构单口喜剧表演?使用GPT-3。想要深入理解新冠研究并基于证据回答你的问题?那你需要学习布尔搜索、阅读科学论文,甚至可能得拿个博士学位——因为目前还没有任何生成式AI模型是在庞大的科学研究文献库上训练出来的。如果存在这样的模型,那么获得基于证据、用通俗语言回答的科学问题将是最简单的益处之一。面向科学的生成式AI可以通过降低发现新想法的难度和成本,帮助扭转科学创新速度放缓的趋势。此类模型还可以针对注定失败的疗法假说提供基于数据的预警,从而抵消人类偏见,避免耗费数十亿美元、长达数十年之久的死胡同。最后,此类模型可以通过绘制、衡量和语境化研究结果,并提供可信度评分,来对抗可重复性危机。
那么,为什么我们还没有一个面向科学的DALL-E或GPT-3呢?原因在于,尽管科学研究是世界上最宝贵的内容,但它也是世界上最难获取和理解的内容。我将阐述大规模解锁科学数据以构建面向科学的生成式AI需要什么条件,以及它将如何改变我们参与研究的方式。
是什么让科研数据充满挑战
研究论文是人类有史以来最重要的内容和信息库之一。它们跨越时间和学科将想法和发现联系在一起,并由图书馆网络永久保存。它们有证据、分析、专家见解和统计关系作为支撑。它们极具价值,但很大程度上对网络隐藏,使用效率极低。网络上充斥着可爱、萌宠的猫视频,但尖端癌症研究却极其匮乏。例如,Web of Science是最全面的科学知识索引之一。它已经存在了几十年,但很可能大多数读者从未听说过,更不用说使用了。我们大多数人无法获取研究论文,即使能够获取,它们也是密集、难懂的PDF文件——这是一种为打印而非网络设计的格式。
由于科学论文不易获取,我们无法轻易地利用这些数据来训练像GPT-3或DALL-E这样的生成式模型。试想一下,如果研究人员提出一个实验,AI模型能立即告诉他们这个实验是否已被做过(甚至更好,直接给出结果),那会怎样?然后,一旦他们从新实验中获得了数据,AI可以根据结果建议后续实验。最后,想象一下,如果研究人员可以上传他们的结果,AI模型能自动为他们撰写论文手稿,那能节省多少时间。我们最接近“科学版DALL-E”的工具是Google Scholar,但它不是一个可持续或可扩展的解决方案。IBM Watson也曾试图实现我在此描述的许多目标,但其大部分工作是在大语言模型取得最新进展之前完成的,并且没有使用合适或足够的数据来匹配其营销宣传。
为了实现我所描述的价值释放,我们需要长期的投资、承诺和远见。正如近期在《Future》中所提议的,我们需要将科学出版物视为可以在大规模下进行组合和分析的基质。一旦我们消除了障碍,我们将能够利用科学来喂养对数据渴求的生成式AI模型。这些模型在加速科学进步和提高科学素养方面具有巨大潜力,例如通过训练它们生成新的科学想法、帮助科学家管理和导航浩瀚的科学文献、帮助识别有缺陷甚至伪造的研究,以及将复杂的研究结果综合并翻译成日常人类语言。
如何为科学领域构建一个类似DALL-E或GPT-3的模型?
如果你从事科技行业,向朋友展示DALL-E或GPT-3等生成式AI模型的输出就像展示魔法。这些工具代表了下一代网络。它们源于对海量信息的综合,超越了简单的链接,从而创造出具有生成能力的工具。那么,我们如何在科学领域创造类似的魔法体验?让任何人都可以用通俗语言向科学文献提问,并得到基于证据的可理解答案。我们如何帮助研究人员创造、发展、完善和检验他们的假说?我们如何避免在阿尔茨海默症研究中失败的假说以及遗传学与抑郁症之间的错误关联上浪费数十亿美元?
这些问题的解决方案听起来可能像科幻小说,但有证据表明,当科学工作被用于超越其各部分简单之和的用途时,我们可以做出令人惊叹和难以置信的事情。事实上,利用蛋白质数据银行中近20万个蛋白质结构,AlphaFold已经能够准确预测蛋白质结构——这是刚刚对所有记录在案的蛋白质(超过2亿个!)所完成的事情。以类似于蛋白质结构的方式利用研究论文将是顺理成章的下一步。
将论文分解为最小组件
研究论文包含大量有价值的信息,包括图表、统计关系以及对其他论文的引用。将它们分解成各种组件并大规模使用,可以帮助我们针对不同类型的科学相关工作、提示或查询来训练机器。简单的问题可能只需用单一组件类型训练就能回答,但更复杂的问题或提示则需要整合多种组件类型,并理解它们之间的相互关系。
一些复杂潜在提示的例子:
- “告诉我为什么这个假说是错误的”
- “告诉我为什么我的治疗方案行不通”
- “生成一个新的治疗方案”
- “有什么证据支持社会政策X?”
- “谁在这个领域发表了最可靠的研究?”
- “根据我的数据,为我写一篇科学论文”
一些团队正在朝着这个愿景取得进展。例如,Elicit将GPT-3应用于数百万篇论文的标题和摘要,以帮助回答研究人员的问题——有点像科学领域的Alexa。该系统提取实体之间的统计关系,展示不同概念和实体是如何关联的。Primer并不专门针对研究论文,但它确实处理arXiv上的论文,并提供一个信息仪表板,供企业和政府使用,以综合和理解来自多个来源的大量数据。
获取所有组件
不幸的是,这些团队主要依赖标题和摘要,而不是全文,因为大约六分之五的文章无法自由或轻松获取。对于像Web of Science和Google这样拥有数据或论文的机构来说,其许可和使用范围是有限或未定义的。以Google为例,目前尚不清楚为什么没有公开宣布在Google Scholar的全文科学研究上训练AI模型的努力。令人惊讶的是,即使在导致全球停滞的新冠疫情期间,这种情况也没有改变。Google AI团队加紧努力,原型化了一种让公众询问新冠问题的方法。但关键在于——他们只使用了PubMed中的开放获取论文,而不是Google Scholar。
获取论文并将其用于不仅仅是逐篇阅读的目的,这是各个团队几十年来一直倡导的问题。我个人也为此工作了近十年,在博士最后一年推出了一个名为The Winnower的开放获取出版平台,随后在另一家名为Authorea的初创公司致力于构建“未来的论文”。虽然这两项计划都没有完全按照我希望的方式成功,但它们引领了我目前在scite的工作,scite通过与出版商直接合作,至少在部分程度上解决了访问问题。
连接组件并定义关系
scite的目标是引入下一代引用——称为“智能引用”——它显示任何文章、研究人员、期刊或主题在文献中被如何、为何被引用以及更广泛地被讨论。通过与出版商合作,直接从全文文章中提取作者在文中引用参考文献的句子。这些句子提供了关于新研究如何引用旧论文的定性见解。这有点像科研界的“烂番茄”。
这需要访问全文文章,并与出版商合作,以便我们可以大规模地使用机器学习来提取和分析引用声明。因为有足够的开放获取文章可以起步,我们能够构建概念验证,并逐一地向出版商展示了我们系统中索引的文章可发现性提高,并为他们提供了一个系统,以展示更好的指标,用于更负责任的研究评估。我们认为那是专家陈述,而他们认为那是其文章的预览。现在,出版商已大量加入,我们已从所有已发表文章的一半以上索引了超过11亿条智能引用。
使用关系数据训练AI模型
从论文中提取的组件和关系可用于训练用于科研的新型大语言模型。GPT-3虽然非常强大,但并非为处理科学问题而构建,在回答SAT考试中的问题时表现不佳。当GPT-2(GPT-3的早期版本)通过在数百万篇研究论文上训练进行适配后,它在特定知识任务上的表现优于单独的GPT-2。这凸显了用于训练模型的数据极其重要。
最近,一些团队使用GPT-3来撰写学术论文,虽然这令人印象深刻,但它们可能展示的事实或论证可能完全错误。如果模型连简单的SAT风格问题都答不对,我们能信任它写出一篇完整的论文吗?比GPT-3早了近20年的SCIgen表明,生成看起来像真实论文的文章相对容易。他们的系统虽然简单得多,却生成了被各种会议接收的论文。我们需要一个不仅看起来科学、而且本身就是科学的模型,这需要一个能够为机器和人类验证声明的系统。Meta最近引入了一个用于验证维基百科引用的系统,一些出版商公开表示希望他们的学术出版物也能拥有这样的系统。
当前进展
同样,实现这个系统的关键障碍之一是缺乏对论文和创建所需资源的访问。当论文或信息可以大规模使用时,我们确实看到工具和新模型蓬勃发展。Google专利团队使用了1亿份专利来训练一个帮助进行专利分析的系统,实际上就是一个GooglePatentBERT。其他人推出了像BioBERT和SciBERT这样的模型,尽管它们仅在特定学科领域的大约1%的科学文本上进行了训练,但在学术任务(包括scite的引用分类系统)上表现令人印象深刻。
最近,一个名为ScholarBERT的模型已经发布,它确实使用了所有的科学文献来训练BERT。它们克服了访问问题,但对其具体方法保持沉默,只是强调其用途是“非消耗性的”。这种用例可能为其他人无需出版商明确许可即可使用文章打开了大门,并且可能是创建科学版DALL-E的重要一步。然而,令人惊讶的是,ScholarBERT在各种专门知识任务上的表现不如像SciBERT这样较小的科学语言模型。
重要的是,BERT风格的模型规模远小于GPT-3这样的大语言模型,它们不支持那种推动了GPT-3热潮的通用提示和上下文学习。问题依然存在:如果我们使用ScholarBERT的相同数据来训练一个像GPT-3那样的规模化生成模型,结果会怎样?如果我们能够以某种方式展示机器答案的来源,也许将它们直接与文献联系起来(如智能引用),那又会怎样?
为何是现在?
幸运的是,论文正变得更加开放,机器也变得更加强大。我们现在可以开始利用论文和连接的知识库中包含的数据,来训练机器回答问题并根据研究综合新想法。这可能对医疗、政策、技术以及我们周围的一切产生变革性影响。试想一下,如果我们不仅仅搜索文档标题,而是专门搜索答案,那将如何影响所有学科的研究和工作流程。
将世界上的科学知识从可访问性和可理解性这双重障碍中解放出来,将有助于推动网络从关注点击量、浏览量、点赞和注意力,转向关注证据、数据和真实性。制药公司显然有动力将其变为现实,因此越来越多的初创公司使用AI识别潜在的药物靶点——但我相信公众、政府以及任何使用某搜索引擎的人,为了节省时间和获得信任,可能愿意放弃免费搜索。世界迫切地需要这样一个系统,而且需要快速实现。FINISHED
更多精彩内容 请关注我的个人公众号 公众号(办公AI智能小助手)或者 我的个人博客 https://blog.qife122.com/
对网络安全、黑客技术感兴趣的朋友可以关注我的安全公众号(网络安全技术点滴分享)
更多推荐




所有评论(0)