跳到正文
原文
Google Research·· 2026-03-17AI 评分55

Google 测试大语言模型在高温超导研究问题上的表现

Testing LLMs on superconductivity research questions

AI 导读

Google Research 与 Cornell 大学合作,评估了六款大语言模型在高温超导领域回答专家级问题的能力。测试问题由领域专家设计,涵盖67道深度专业问题。NotebookLM 和自定义 RAG 系统基于专家筛选的文献库表现最佳,而依赖开放网络的模型倾向于混淆已确立理论与高度推测性假说。模型在时序理解、上下文理解和图像推理方面存在明显弱点。

来源:Google Research · research.google