跳到正文

#论文/研究

今日 4 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
9月4日周五
  1. Google Research71

    Google Research 联合发布完整雄性果蝇大脑连接组图谱

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室等机构合作,在 Cell 期刊发表了完整的雄性果蝇大脑和中央神经系统连接图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今为止最大的大脑图谱。该图谱可帮助科学家研究果蝇的神经机制,并为理解更复杂的大脑(包括人类大脑)奠定基础。

    推荐理由:这是目前最大的大脑图谱,为研究大脑工作原理提供了基础资源,读者可了解连接组学的前沿进展及其对神经科学的意义。

9月2日周三
  1. Hugging Face Blog51

    BenchMIRT:LLM benchmark 实际在测量什么

    Allen AI 发布 BenchMIRT 方法,通过多维项目反应理论分析 benchmark 内部每个问题的真实测量维度。在 100 个开源模型和 16 个 benchmark(含 MMLU-Pro、GPQA、HarmBench 等)上的训练表明,模型能独立发现安全性和推理两个主导维度。

  2. Google Research62

    Google 与 NASA 合作利用深度学习从太空绘制全球甲烷排放图

    Google 与 NASA JPL 合作发布了 MAPL-EMIT 深度学习框架,可从 EMIT 卫星高光谱图像中自动检测、量化并定位甲烷排放源。该模型在专家标注的 plumes 上达到 84% 召回率,比现有方法多检测约 50% 的可信 plumes,并在全球 25 个最大排放填埋场中的 24 个成功绘制了羽流。

    推荐理由:原文给出了具体性能指标(84%召回率、比现有方法多检测50% plumes)和数据集规模(3.6万个合成 plumes),提供了可迁移的环境监测方法论。

9月1日周二
  1. Google Research78

    Google 发布 TimesFM-3 零样本多变量时间序列预测基础模型

    Google Research 发布 TimesFM-3,这是新一代零样本时间序列基础模型,专为多变量预测设计。模型拥有 3.3 亿参数,在超过 1 万亿时间点的真实和合成数据上预训练,支持多目标同时预测、过去协变量和过去-未来协变量。

    推荐理由:读者可通过本文了解时间序列预测的基础模型最新进展,以及多变量预测相比单变量预测的具体精度提升。

8月28日周五
8月26日周三
8月25日周二
  1. Hugging Face Blog66

    Quantization-Aware Healing:压缩到 4-bit 的模型如何超越其原始全精度版本

    提出 Quantization-Aware Healing(QAH)方法,针对经过结构压缩和量化后的 LLM 进行恢复训练。核心改变是直接从原始全精度模型蒸馏,而非从恢复后的 bf16 检查点蒸馏。

    推荐理由:原文给出具体实验数据:4-bit QAH 模型在 7/9 基准上超越 16-bit 源头模型,4 倍权重内存节省。这为压缩模型的恢复训练提供了可迁移的方法思路。

8月22日周六
8月21日周五
  1. Google Research48

    Google Research 如何用 ME-POIs 框架让语言模型更深入理解地点

    Google Research 推出 Mobility-Embedded POIs 框架,通过将聚合匿名移动模式(如到达时间、停留时长)融入地点的文本表征,解决传统语言模型仅依赖静态元数据的问题。该方法在意图预测、价格分类和繁忙度估计上分别实现 81.9%、75.1% 和 24.7% 的相对提升。框架采用访问对齐、空间多尺度传播和文本-移动协同三步流程,有效缓解了中小商户数据稀疏的"长尾"难题。

8月20日周四
8月19日周三
8月17日周一
8月13日周四
  1. Hugging Face Blog63

    我们从复现 ICML 2200 篇论文中学到了什么

    Hugging Face 于 2026 年 7 月组织 hackathon,1200 多名社区成员用编码智能体在 19 天内复现了 ICML 2026 会议 2226 篇论文(约占会议 34%),产生 6816 份复现日志。

    推荐理由:原文给出了大规模论文复现的方法论、发现和人类在智能体时代的角色思考,读者可以据此了解 AI 辅助科研验证的实践路径和潜在影响。

  2. Microsoft Research69

    MindTopo 揭示多模态大语言模型的拓扑推理能力

    Microsoft Research 发布 MindTopo 基准测试,用于评估多模态大语言模型对拓扑属性的理解能力,包括连通性、包围、顺序、分离和打结。测试分为静态推理和交互式规划两类任务。

    推荐理由:该研究提出了一个评估拓扑推理的新基准,揭示了当前多模态模型在静态识别和交互规划任务上的显著差距,为机器人学和交互式 AI 系统的发展提供了诊断工具。

8月12日周三
  1. Google DeepMind66

    Google DeepMind 发布 SL2T 手语转文本模型

    Google DeepMind 推出突破性的多语言手语转文本模型 SL2T,训练数据涵盖 50 多种手语超过 10 万小时。该模型首次将手语 AI 带入消费产品,已在 Gboard 和 Live Transcribe 的 Pixel 11 上线,支持美式手语转英语。

    推荐理由:首个将手语 AI 实际带入消费产品的突破,在 FLEURS-ASL 基准上实现了 70 BLEURT 的零样本成绩,可供读者了解当前手语 AI 的实际可用性。

  2. Google Research70

    空架子还是丢失的钥匙?召回成为大语言模型参数化事实性的瓶颈

    Google Research 发布新研究,引入知识分析框架区分编码失败和召回失败,分析了 Gemini-3、GPT-5 等前沿模型发现:编码率已达95-98%饱和,但直接召回仍失败26-34%的事实,即使启用思考仍失败11-12%。研究表明事实性错误主要源于知识可访问性问题而非知识缺失,思考能力可恢复约40-65%已编码但无法直接回忆的知识。

    推荐理由:原文给出了编码vs召回的新分析框架和量化数据,读者可以据此理解前沿模型的事实性瓶颈已从知识获取转向知识利用。

  3. Google Research68

    Google Research发布AMIE Video:迈向专家级视听临床咨询的AI系统

    Google Research发布AMIE (Video),基于Gemini和Project Astra构建,采用异步多智能体架构(Talker、Planner、Perception),能在实时视频咨询中感知非言语临床线索、指导虚拟体检并进行诊断推理。

    推荐理由:这是首个AI系统在实时视频临床咨询中达到专家级水平的演示,读者可以据此了解AI医疗助手的能力边界和当前局限。

  4. Microsoft Research67

    微软 CARE-X:结合辅助监督、对齐强化学习和工具增强测量的临床可用胸部 X 光视觉语言模型

    微软研究院发布 CARE-X,一个统一胸部 X 光 VLM,结合生成和判别能力,使用 DAPO 强化学习进行临床对齐优化,并配备辅助分类头和接地头提供校准概率和空间定位。

    推荐理由:强化学习与辅助监督的结合在医学影像 VLM 中展现了临床价值,工具增强测量在需要定量诊断的条件上提升了平均 F1 达 43.6 个百分点。

8月11日周二
8月10日周一
  1. Import AI21

    MIT 与哥伦比亚大学研究:信任与透明度如何影响 AI 公司的协调减速

    MIT 与哥伦比亚大学研究人员分析了 AI 竞争对手之间实现协调减速的可能性,发现信任和透明度是实现稳定结局的两个关键变量。研究表明,低信任度下所有均衡都会导向"竞相毁灭",中等信任度时立即停止和竞相毁灭同时为均衡,高信任度下两个理性公司永久竞赛的概率随理性先验概率的平方消失。要避免灾难性竞赛,需要建立技术发展的透明度机制和信任机制。

  2. Hugging Face Blog65

    如何让知识蒸馏便宜到足以大规模运行

    知识蒸馏需要同时加载教师和学生模型,显存需求极高。论文提出两种系统改进:缓存教师模型的 top-100 logits 避免其常驻内存,以及新的分块 KL 散度损失函数避免实例化完整的词汇表×序列长度矩阵。

    推荐理由:给出了具体的显存峰值对比数据,读者可以据此判断该方法对自己硬件条件下的可行性。

8月6日周四
  1. Google DeepMind68

    Google DeepMind 发布 WeatherNext:AI 模型实现气旋预报突破

    Google DeepMind 发布 WeatherNext AI 天气预测模型,在 Nature 期刊发表的论文显示该模型在预测气旋路径、强度和风结构方面达到最高精度,平均可提供额外一天的预警时间,相当于十年气象进步。

    推荐理由:原文给出了具体性能提升数据(一天额外预警时间)和实际应用案例(2025年飓风Melissa预报),读者可以据此判断该模型在天气预报领域的能力边界。

8月3日周一
  1. Import AI47

    Import AI 467: 自我复制AI病毒概念验证;AI进步将推高计算成本

    多伦多大学、Vector Institute、剑桥大学和ServiceNow研究人员构建了首个使用开源LLM的自我复制AI病毒,可在单张A100 GPU上运行,漏洞检测成功率约80%,漏洞利用约53%,自我复制约88%,整体攻击成功率约37%,证明自我驱动的网络威胁已不再是理论。研究人员警告需为自主生成式对抗 agent 做好准备。域名注册

7月31日周五
  1. Google Research67

    Google Research 发布 Science One Framework:通过 Chain-of-Evidence 实现可验证的自主研究

    Google Research 发布 Science One Framework 及其 Chain-of-Evidence 框架,旨在解决 AI 生成的科研论文缺乏可验证性的问题。

    推荐理由:该研究提出了一个可验证的 AI 科研框架,针对当前自主研究系统的引用幻觉和代码-文本不对齐问题给出了系统性的解决方案,并已在多个基准上验证有效。

  2. Microsoft Research74

    Echoverse:用于计算机使用智能体的深度演进环境

    Microsoft Research构建了12个训练世界用于计算机使用智能体,其中10个深度领域世界涵盖邮件、日历、银行、医疗等闭源系统,2个能力世界针对日期选择器和嵌套过滤器进行专项训练。

    推荐理由:原文给出了具体的训练数据和方法对比:深度环境使9B模型从36.5%提升到67.1%,而浅层环境反而导致性能下降。读者可以据此理解什么样的合成数据设计能真正提升计算机使用智能体的能力。

7月30日周四
7月29日周三
  1. Berkeley AI Research65

    K-Search:如何将数十年CUDA内核优化经验迁移到Apple Silicon

    Berkeley和IBM研究团队将K-Search进化内核优化框架扩展支持MLX后端,开发了结构化的CUDA到MLX翻译层,将NVIDIA生态积累的CUDA优化知识迁移到Apple Silicon。实验在M1 Max 64GB上,Attention核达到原生MLX的0.97倍性能,Mamba SSM核预填充吞吐量达6751 tok/s,比社区mlx-lm实现快约20倍。

    推荐理由:原文展示了K-Search如何将NVIDIA生态积累的CUDA内核优化知识迁移到Apple Silicon,在Attention和Mamba SSM两个核上分别达到接近专家水平和20倍加速,为非NVIDIA硬件的核优化提供了可参考的方法论。

7月28日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能控制

    Google DeepMind 发布 Gemini Robotics 2,推出了三个模型:高级 VLA 模型可控制完整人形机器人从脚到指尖的运动,实现灵巧操作如系扣子;ER 2 推理模型可处理多步骤任务并协调多机器人协作;On-Device 2 模型可在几小时内适应全新机器人形态。

    推荐理由:原文给出了三个模型的具体能力描述和可用入口,读者可以据此判断 Gemini Robotics 2 与前代及竞品的具体差异。

7月26日周日
  1. Berkeley AI Research60

    ABBEL:通过信念状态实现高效长程交互

    本文提出 ABBEL 框架,通过将交互历史压缩为自然语言信念状态来替代完整上下文,从而降低长程任务的计算成本。在协同编码任务 CollabBench 中,使用基于重建的信念评分(belief grading)可将性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 减少 57%。该方法在组合锁游戏和多目标问答任务中也展现了学习效率优势。

    推荐理由:给出了具体性能数据(性能差距缩小50%、训练步数减半、峰值token大幅降低),读者可以直接评估这个方法对长程交互任务的实际价值。

7月23日周四
  1. Google Research68

    Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体

    Google 研究团队推出 SymptomAI,对话式 AI 智能体用于日常症状评估。研究通过 13,917 名参与者的随机试验,使用 Gemini Flash 2.0 模型进行端到端症状访谈和鉴别诊断。

    推荐理由:研究通过 13,917 人的真实世界测试和可穿戴设备数据验证了 AI 症状评估的准确率,提供了与传统临床诊断的对照证据。

  2. Google Research63

    Google 展示强化学习框架实现量子计算持续校准

    Google 在 Nature 发表研究,展示了一个强化学习框架,让智能体通过量子误差检测事件持续调整数千个控制参数,从而在计算过程中稳定量子系统。实验在 Willow 超导处理器上验证,人工注入漂移后 RL steering 将逻辑稳定性提升 3.5 倍;在专家校准后 RL 微调仍额外降低 20% 逻辑错误率。

    推荐理由:给出了具体的性能提升数据(3.5 倍逻辑稳定性提升、20% 错误率下降)和两种量子码的错误率数字,读者可以直接判断该 RL 方法相比传统校准的改进幅度。

7月22日周三
7月16日周四
  1. Google Research24

    扩散模型的创造力从何而来:分数平滑的理论解释

    Google Research 在 ICLR 2026 发表的论文揭示,扩散模型的创造力源于神经网络训练中的"分数平滑"效应。由于权重衰减等正则化手段,模型学习到的分数函数呈近似而非精确状态,导致去噪过程生成的数据会在训练点之间插值,从而产生新的合理样本,而非简单复制训练数据。研究通过 1-D 实验结合函数空间理论验证了这一机制。

  2. Hugging Face Blog58

    IBM Research 分析模型路由的三大误区:成本、难度和延迟远比表面复杂

    IBM Research 基于 AppWorld 挑战赛和 CodeAct 智能体的实际测试,揭示了模型路由的三个反直觉发现:缓存使实际成本与定价脱钩;任务难度在路由时常不可见且只是多目标之一;模型速度不等于用户体验速度。他们将路由从分类问题重新建模为系统优化问题,实现了在 84% 准确率下 21% 成本降低和 9% 延迟降低。

7月15日周三
  1. Hugging Face Blog72

    Hugging Face 发布 Real World VoiceEQ:评估语音 AI 人类质量的新基准

    Hugging Face 发布 Real World VoiceEQ 基准,评估语音 AI 的人类交互质量。该基准基于超过 100 万个人类评分,涵盖 785,000 个 TTS 评分和 48,000 个 STS 评分,评估了 40+ 领先语音模型在 15+ 关键维度和 60+ 指标上的表现。

    推荐理由:原文给出了 40+ 模型在 15+ 维度和 60+ 指标上的具体评测发现,读者可据此了解当前语音 AI 的真实能力边界与主要短板。