Folia
← 返回头版

大模型要"读懂"科学需要怎样的科技语料?

中国科学院文献情报中心发起的语料创新生态联盟近日在北京启动1。该联盟发布了五类42项科技语料标准(采用三级架构)、敖仓·语料社区服务平台及英文期刊《Data Express in AI Corpus》等系列成果1。联盟首批吸纳了50家共建单位,覆盖国家实验室、科研院所和人工智能企业1。

中国工程院院士孙凝晖表示,大模型要"读懂"科学,靠的不是通用互联网数据,而是高质量科技语料1。该联盟致力于解决科技领域语料分散、专业语义复杂等问题,为人工智能发展提供基础性支撑1。敖仓·语料社区服务平台将打通正式语料与社区语料的双轨供给渠道1。联盟将重点聚焦联合共建高质量科技语料、推进智能就绪科技语料集成服务等五大任务1。


评论