Google Research·· 2026-03-17AI 评分55
Google 测试大语言模型在高温超导研究问题上的表现
Testing LLMs on superconductivity research questions
AI 导读
Google Research 与 Cornell 大学合作,评估了六款大语言模型在高温超导领域回答专家级问题的能力。测试问题由领域专家设计,涵盖67道深度专业问题。NotebookLM 和自定义 RAG 系统基于专家筛选的文献库表现最佳,而依赖开放网络的模型倾向于混淆已确立理论与高度推测性假说。模型在时序理解、上下文理解和图像推理方面存在明显弱点。
来源:Google Research · research.google