热点事件持续更新
BABA-is-You类规则操纵测试揭示多模态LLM短板
2 篇报道2 个报道来源1 小时前更新
先了解这件事
AI 综述
2024 年发表于 ICML 的一篇论文测试了 GPT-4o、Gemini-1.5-Pro 和 Gemini-1.5-Flash 三款多模态大语言模型在 BABA-is-You 类谜题上的表现。该类谜题要求模型操纵和组合游戏规则,难度较高。测试结果显示,这些当时处于领先水平的多模态大模型在该任务上表现急剧下滑。研究由 MIT 和 Virginia Tech 的作者完成。2026 年 10 月 9 日,Reddit r/artificial 社区发起讨论,探讨在 agentic swarm 时代,这一 2024 年提出的多模态 LLM 短板是否仍然成立,但相关讨论仅停留在社区提问层面,尚未公布新的实验或复现结果。同日,Reddit r/MachineLearning 社区发布了对该 2024 年 ICML 论文的复盘报道,重申 GPT-4o 与 Gemini 1.5 在规则操纵任务中的不佳表现。
AI 根据报道生成 · 59 分钟前更新
最新进展10月9日 04:02
两社区分别复盘论文并讨论该短板在 agentic swarm 时代是否仍成立,尚未有新实验或复现结果公布。报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- Reddit · r/artificialBABA-is-AI 测试:MIT 等团队 2024 年提出的多模态 LLM 短板在 agentic swarm 时代是否仍成立
2024 年发表于 ICML 的论文测试了 GPT-4o、Gemini-1.5-Pro 和 Gemini-1.5-Flash 三款多模态大语言模型,发现它们在需要操纵和组合游戏规则的 BABA-is-You 钥匙门谜题上表现糟糕,作者来自 MIT 和 Virginia Tech。
- Reddit · r/MachineLearning2024 年 ICML 论文复盘:GPT-4o 与 Gemini 1.5 在 BABA-is-You 类规则操纵任务中表现不佳
一篇 2024 年 ICML 论文测试了 GPT-4o、Gemini-1.5-Pro 和 Gemini-1.5-Flash,发现当任务需要操纵并组合游戏规则时,这三个多模态大语言模型表现急剧下滑。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。