Reddit · r/LocalLLaMA· /u/vox-deorum·· 2 天前AI 评分26
CivBench 评测大语言模型打《文明 5》游戏能力,GLM-5.3 领先 Opus-5.5
A benchmark for LLMs playing Civilization V. GLM-5.3 is ahead of Opus-5.5, and Qwen-3.8-27B holds up surprisingly well.
AI 导读
研究者发布更新版 CivBench 基准,测试大语言模型在《文明 5》中的长链策略能力。所有模型在三个相同固定开局下轮换对战,每局由两个被测 LLM 文明与六个 Vox Populi AI 对手组成。
来源:Reddit · r/LocalLLaMA · reddit.com