跳到正文

#论文/研究

今日 4 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
4月22日周三
  1. Google DeepMind68

    Google DeepMind 发布 Decoupled DiLoCo:面向分布式 AI 训练的高弹性新架构

    Google DeepMind 发布 Decoupled DiLoCo(解耦分布式低通信)架构,通过将训练任务分散到相互独立的计算岛屿,实现跨数据中心的分布式大语言模型训练。

    推荐理由:这篇论文提出了一种新的分布式训练架构,能够在低带宽条件下跨数据中心训练大模型,同时保持较高的硬件容错性。

  2. Google Research64

    ReasoningBank:让智能体从经验中学习

    Google Research 发布 ReasoningBank 框架,使大语言模型能在测试时从成功和失败的经验中自我进化。该框架将推理模式提炼为高层记忆存储,在 WebArena 和 SWE-Bench Verified 上相比无记忆智能体分别提升 8.3% 和 4.6% 成功率,并结合 MaTTS 扩展方法进一步提升 3% 成功率。

    推荐理由:论文给出了在 WebArena 和 SWE-bench 上相对于 baseline 的具体提升幅度(8.3%、4.6%、3%),并开源了代码,读者可据此判断该方法对智能体记忆机制研究的参考价值。

4月20日周一
  1. Berkeley AI Research59

    GRASP:基于梯度的新型长视野世界模型规划器

    研究团队提出 GRASP,一种基于梯度的规划器,用于解决学习到的世界模型在长视野规划中的脆弱性问题。核心方法包括:将轨迹提升到虚拟状态以实现时间并行优化、向状态迭代添加随机性以实现探索、以及重塑梯度以保留动作梯度而阻断脆弱的状态输入梯度。在 Push-T 任务上,GRASP 在 H=40-80 的各视野下均取得最高成功率,且中位成功时间显著低于基线方法。

4月16日周四
4月9日周四
  1. Google Research40

    ConvApparel:衡量并缩小用户模拟器中的真实感差距

    Google Research推出ConvApparel数据集,包含超4000段人类-AI多轮对话(共近15000轮),在服装购物领域采用双智能体协议收集数据。该数据集通过人口级统计对齐、人类相似度评分、反事实验证三种评估维度,衡量当前LLM用户模拟器与真实人类行为的显著差距,为构建更可信的AI测试工具提供路径。

4月3日周五
  1. Google Research56

    Google 研究评估大语言模型行为倾向的对齐度

    Google 研究团队提出一个评估 LLM 行为倾向对齐度的框架,通过情境判断测试(SJT)评估 25 个模型在同理心、情绪调节等行为特质上与人类偏好的对齐程度。研究发现小型模型(<25B)对齐度接近随机水平,大型前沿模型(>120B)在人类共识度高时对齐度接近完美,但在低共识场景下存在系统性过度自信问题,且模型自我报告与其实际行为存在显著差异。

4月1日周三
3月31日周二
  1. Google Research74

    Google 发布白皮书:负责任披露量子漏洞更新加密货币安全风险评估

    Google 发布白皮书,更新了量子计算机破解 ECDLP-256 椭圆曲线密码学所需的资源估算。估算显示需不到 50 万物理量子比特在几分钟内即可破解,这比之前减少了约 20 倍。Google 建议加密货币社区转向后量子密码学以应对量子计算威胁,并采用零知识证明方式披露漏洞以避免被恶意利用。

    推荐理由:原文给出了量子计算机破解 ECDLP-256 的最新资源估算,读者可据此了解量子威胁的实际时间线并提前规划迁移。

3月25日周三
  1. Google Research63

    Google发布TurboQuant:面向极端压缩的向量量化新算法

    Google Research发布TurboQuant、QJL和PolarQuant三种向量量化压缩算法,可在Gemma和Mistral模型上将KV cache内存降低至少6倍,同时保持模型性能不变。

    推荐理由:原文给出了6x内存降低和8x性能提升的具体数据,以及TurboQuant、QJL、PolarQuant三种算法的技术原理,读者可以据此了解向量量化技术的最新进展。

3月18日周三
  1. Google Research66

    Google Research 发布乳腺癌筛查机器学习研究

    Google Research 与英国 NHS 合作开展 AIMS 研究,评估 AI 乳腺癌检测系统。研究一评估了 12.5 万名女性回溯数据和 12 个前瞻性站点,AI 敏感性高于首位人类读者,癌症检出率从 7.54 提升至 9.33/千人,检出 25% 间隔期癌症。

    推荐理由:原文给出了详细的 AI 乳腺癌筛查系统研究方法和结果,读者可以了解 AI 在医疗筛查中的实际性能表现以及人机协作的挑战。

3月17日周二
  1. Google Research55

    Google 测试大语言模型在高温超导研究问题上的表现

    Google Research 与 Cornell 大学合作,评估了六款大语言模型在高温超导领域回答专家级问题的能力。测试问题由领域专家设计,涵盖67道深度专业问题。NotebookLM 和自定义 RAG 系统基于专家筛选的文献库表现最佳,而依赖开放网络的模型倾向于混淆已确立理论与高度推测性假说。模型在时序理解、上下文理解和图像推理方面存在明显弱点。

3月13日周五
3月12日周四
  1. Google Research73

    Google Research 发布 Groundsource:用 Gemini 将新闻转化为灾害数据

    Google Research 发布了 Groundsource,这是一项利用 Gemini 将全球新闻报道转化为结构化灾害数据的新方法论。该方法已生成 260 万条城市突发洪水事件记录,覆盖 150 多个国家(2000 年至今),准确率在实用层面达 82%。Google 已将此数据用于改进 Flood Hub 的洪水预测能力,未来计划扩展到其他灾害类型。

    推荐理由:该方法通过 AI 从全球新闻中提取结构化灾害数据,填补了传统监测系统无法覆盖的小型和局部灾害的数据空白。

  2. Google Research71

    Google在真实临床研究中测试对话式诊断AI可行性

    Google Research与Beth Israel Deaconess Medical Center合作,对对话式诊断AI系统AMIE进行了前瞻性单中心可行性研究。

    推荐理由:原文给出了在真实临床环境中测试对话式诊断AI的详细数据,包括安全性、诊断准确率、用户接受度等,读者可以据此了解当前医疗AI从模拟场景走向真实诊疗的可行性。

3月7日周六
  1. Google Research53

    WAXAL:面向非洲语言语音技术的大规模开放资源

    Google Research 发布 WAXAL 数据集,涵盖 27 种非洲语言,包含约 1846 小时 ASR 转录语音和 565 小时 TTS 高保真录音,采用 CC-BY-4.0 许可证开放获取。该数据集通过图像提示的采集方法获取自然语音,并与 Makerere 大学、 Ghana 大学等非洲学术机构合作构建,旨在为非洲 AI 生态系统提供语音技术研究基础设施。

1月10日周六
  1. Berkeley AI Research43

    信息驱动的成像系统设计

    研究团队开发了一个基于互信息的成像系统直接评估与优化框架,可在不依赖具体任务解码器的情况下量化测量区分物体的信息量。该框架在彩色摄影、射电天文学、无透镜成像和显微镜四个领域验证,信息估计可准确预测下游任务性能。优化该信息指标可产生与端到端神经网络方法相当的设计结果,同时显著降低内存和计算需求。

11月1日周六
  1. Berkeley AI Research49

    强化学习新范式:分而治之算法如何突破长程任务扩展性难题

    本文提出一种基于“分而治之”的强化学习新算法,突破传统时序差分(TD)学习的扩展性瓶颈。该方法将轨迹划分为等长段落并组合其值来更新完整轨迹值,理论上可将Bellman递归次数从线性降至对数级别,且无需手动调优n步超参数。研究团队首次成功将分而治之值学习扩展至目标条件强化学习等复杂任务。

9月1日周一
7月23日周三