科学研究工作流

科技人工智能

Terminal-Bench-Science 0.1 发布:评估 AI 代理在科研工作流中的表现

Terminal-Bench-Science 0.1 基准测试由斯坦福大学研究人员主导发布,由斯坦福大学与 Laude Institute 主持,并与斯坦福 AI 实验室(SAIL)、斯坦福 HAI、艾伦研究所及艾伦人工智能研究所(Ai2)等机构合作 。这是一个用于评估 AI 代理在科学研究工作流中能力的持续性基准测…