跳到正文

#Google

今日 11 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
9月2日周三
  1. Google Research62

    Google 与 NASA 合作利用深度学习从太空绘制全球甲烷排放图

    Google 与 NASA JPL 合作发布了 MAPL-EMIT 深度学习框架,可从 EMIT 卫星高光谱图像中自动检测、量化并定位甲烷排放源。该模型在专家标注的 plumes 上达到 84% 召回率,比现有方法多检测约 50% 的可信 plumes,并在全球 25 个最大排放填埋场中的 24 个成功绘制了羽流。

    推荐理由:原文给出了具体性能指标(84%召回率、比现有方法多检测50% plumes)和数据集规模(3.6万个合成 plumes),提供了可迁移的环境监测方法论。

  2. Google DeepMind74

    Google DeepMind 推出 Gemini 智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解功能,该功能将模型核心推理与原生视频工具结合,动态搜索和检查目标视频片段,相比静态处理可降低最多 88% 的 token 消耗和 66% 的成本,同时提升最多 7% 的准确率。

    推荐理由:原文给出了 token 消耗降低 88%、成本降低 66%、质量提升 7% 的具体数据,读者可以据此评估该功能对自身工作流的效率提升。

9月1日周二
  1. Ben's Bites26

    Build your ideas

    Anthropic 宣布 Claude Code 使用限额将于 9 月 14 日从 150 units 降至 125 units(永久增加 25%),用户批评其"5x"和"20x"订阅计划的营销宣传与实际使用限制不符。

  2. Google Research78

    Google 发布 TimesFM-3 零样本多变量时间序列预测基础模型

    Google Research 发布 TimesFM-3,这是新一代零样本时间序列基础模型,专为多变量预测设计。模型拥有 3.3 亿参数,在超过 1 万亿时间点的真实和合成数据上预训练,支持多目标同时预测、过去协变量和过去-未来协变量。

    推荐理由:读者可通过本文了解时间序列预测的基础模型最新进展,以及多变量预测相比单变量预测的具体精度提升。

8月28日周五
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,带来场景扩展、首尾帧插值、360p 快速预览和 4K 超分辨率等创意控制功能。新模型支持最长 40 秒视频生成,可在 Google AI Studio 和 Agent Platform API 中使用,也可通过 Google AI Plus、Pro 和 Ultra 订阅在 Google Flow 中访问。

    推荐理由:提供了具体的性能提升数据和可用性信息,读者可以评估新模型对自己工作流的实际价值。

8月27日周四
8月26日周三
8月25日周二
8月24日周一
  1. The Rundown AI56

    匿名模型 Ox Alpha 现身 OpenRouter 前沿引发开发者猜测其来源

    匿名模型 Ox Alpha 近日在 OpenRouter 上免费上线,具有 100 万 token 上下文和多模态输入能力,专注于编码和智能体工作负载。该模型在编码测试中取得 63% 准确率,引发关注。由于其基于中国十二生肖的命名方式和测试表现,有分析认为其可能来自智谱 AI 的 GLM-5.3 Flash 或 GLM-6,也有人猜测是微软的 MAI 系列。

8月22日周六
8月21日周五
  1. Google Research48

    Google Research 如何用 ME-POIs 框架让语言模型更深入理解地点

    Google Research 推出 Mobility-Embedded POIs 框架,通过将聚合匿名移动模式(如到达时间、停留时长)融入地点的文本表征,解决传统语言模型仅依赖静态元数据的问题。该方法在意图预测、价格分类和繁忙度估计上分别实现 81.9%、75.1% 和 24.7% 的相对提升。框架采用访问对齐、空间多尺度传播和文本-移动协同三步流程,有效缓解了中小商户数据稀疏的"长尾"难题。

8月18日周二
  1. Ben's Bites17

    <think>让我仔细分析这个任务:

    1. **原始标题**: "Do you use a personal agent?" 2. **正文内容**: 这是一篇 Ben's Bites Newsletter 的编辑内容,包含了多个 AI 领域的新闻和更新 3. **时间锚点**: 原文发布日期:2026-08-18 **标题分析**: - 原标题 "Do you use a personal agent?

8月17日周一
8月14日周五
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 推出 Gemini 3.7 Flash,这是其面向编码和智能体任务的工作主力模型。该模型在软件工程任务中实现显著提升,FrontierCode 1.1 Main 得分从 34.4% 提升至 43.6%,DeepSWE v1.1 从 49.0% 提升至 65.3%。

    推荐理由:原文给出了性能基准提升和价格信息,读者可以据此判断新模型是否值得在生产环境中使用。

8月12日周三
  1. Google DeepMind66

    Google DeepMind 发布 SL2T 手语转文本模型

    Google DeepMind 推出突破性的多语言手语转文本模型 SL2T,训练数据涵盖 50 多种手语超过 10 万小时。该模型首次将手语 AI 带入消费产品,已在 Gboard 和 Live Transcribe 的 Pixel 11 上线,支持美式手语转英语。

    推荐理由:首个将手语 AI 实际带入消费产品的突破,在 FLEURS-ASL 基准上实现了 70 BLEURT 的零样本成绩,可供读者了解当前手语 AI 的实际可用性。

  2. Google Research70

    空架子还是丢失的钥匙?召回成为大语言模型参数化事实性的瓶颈

    Google Research 发布新研究,引入知识分析框架区分编码失败和召回失败,分析了 Gemini-3、GPT-5 等前沿模型发现:编码率已达95-98%饱和,但直接召回仍失败26-34%的事实,即使启用思考仍失败11-12%。研究表明事实性错误主要源于知识可访问性问题而非知识缺失,思考能力可恢复约40-65%已编码但无法直接回忆的知识。

    推荐理由:原文给出了编码vs召回的新分析框架和量化数据,读者可以据此理解前沿模型的事实性瓶颈已从知识获取转向知识利用。

  3. Google Research68

    Google Research发布AMIE Video:迈向专家级视听临床咨询的AI系统

    Google Research发布AMIE (Video),基于Gemini和Project Astra构建,采用异步多智能体架构(Talker、Planner、Perception),能在实时视频咨询中感知非言语临床线索、指导虚拟体检并进行诊断推理。

    推荐理由:这是首个AI系统在实时视频临床咨询中达到专家级水平的演示,读者可以据此了解AI医疗助手的能力边界和当前局限。

8月6日周四
  1. Google DeepMind68

    Google DeepMind 发布 WeatherNext:AI 模型实现气旋预报突破

    Google DeepMind 发布 WeatherNext AI 天气预测模型,在 Nature 期刊发表的论文显示该模型在预测气旋路径、强度和风结构方面达到最高精度,平均可提供额外一天的预警时间,相当于十年气象进步。

    推荐理由:原文给出了具体性能提升数据(一天额外预警时间)和实际应用案例(2025年飓风Melissa预报),读者可以据此判断该模型在天气预报领域的能力边界。

7月31日周五
  1. Google Research67

    Google Research 发布 Science One Framework:通过 Chain-of-Evidence 实现可验证的自主研究

    Google Research 发布 Science One Framework 及其 Chain-of-Evidence 框架,旨在解决 AI 生成的科研论文缺乏可验证性的问题。

    推荐理由:该研究提出了一个可验证的 AI 科研框架,针对当前自主研究系统的引用幻觉和代码-文本不对齐问题给出了系统性的解决方案,并已在多个基准上验证有效。

7月30日周四
  1. Google DeepMind67

    Google DeepMind 发布 Gemini Robotics ER 2,带来视频理解、任务编排和多机器人协作能力

    Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型。该模型可调用 Google Search 等工具,支持多步骤任务自纠错,并将执行交接给低层 VLA 模型。

    推荐理由:原文给出了视频理解、任务编排和多机器人协作的具体性能数据,读者可以据此了解具身智能的最新能力边界和可用入口。

  2. Google DeepMind67

    Google DeepMind 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布最新音乐生成模型 Lyria 3.5,现已在 Google Flow Music 上线。该模型在音乐性、歌词质量、声乐表达和创意控制四个方面实现升级,包括更自然的复杂旋律结构、更高的提示词遵循度、更具情感表现力的歌声,以及更便捷的 tempo 和时长控制功能。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有音乐创作工作流。

7月28日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能控制

    Google DeepMind 发布 Gemini Robotics 2,推出了三个模型:高级 VLA 模型可控制完整人形机器人从脚到指尖的运动,实现灵巧操作如系扣子;ER 2 推理模型可处理多步骤任务并协调多机器人协作;On-Device 2 模型可在几小时内适应全新机器人形态。

    推荐理由:原文给出了三个模型的具体能力描述和可用入口,读者可以据此判断 Gemini Robotics 2 与前代及竞品的具体差异。

7月23日周四
  1. Google Research68

    Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体

    Google 研究团队推出 SymptomAI,对话式 AI 智能体用于日常症状评估。研究通过 13,917 名参与者的随机试验,使用 Gemini Flash 2.0 模型进行端到端症状访谈和鉴别诊断。

    推荐理由:研究通过 13,917 人的真实世界测试和可穿戴设备数据验证了 AI 症状评估的准确率,提供了与传统临床诊断的对照证据。

  2. Google Research63

    Google 展示强化学习框架实现量子计算持续校准

    Google 在 Nature 发表研究,展示了一个强化学习框架,让智能体通过量子误差检测事件持续调整数千个控制参数,从而在计算过程中稳定量子系统。实验在 Willow 超导处理器上验证,人工注入漂移后 RL steering 将逻辑稳定性提升 3.5 倍;在专家校准后 RL 微调仍额外降低 20% 逻辑错误率。

    推荐理由:给出了具体的性能提升数据(3.5 倍逻辑稳定性提升、20% 错误率下降)和两种量子码的错误率数字,读者可以直接判断该 RL 方法相比传统校准的改进幅度。

7月22日周三
7月21日周二
7月20日周一
7月17日周五
  1. Google DeepMind64

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布基于 Gemini 3.5 Flash 的轻量级网络安全模型 3.5 Flash Cyber,通过 CodeMender 代理可多次调用以分析更多代码路径。

    推荐理由:原文给出了多个 benchmark 对比数据和 Google 内部实际应用案例,读者可以据此评估轻量级网络安全模型相对于大型模型的能力边界和实用价值。

7月16日周四
  1. Google Research24

    扩散模型的创造力从何而来:分数平滑的理论解释

    Google Research 在 ICLR 2026 发表的论文揭示,扩散模型的创造力源于神经网络训练中的"分数平滑"效应。由于权重衰减等正则化手段,模型学习到的分数函数呈近似而非精确状态,导致去噪过程生成的数据会在训练点之间插值,从而产生新的合理样本,而非简单复制训练数据。研究通过 1-D 实验结合函数空间理论验证了这一机制。

7月13日周一
7月9日周四
  1. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的大型传感器基础模型

    Google Research 发布 SensorFM,一个在 5 百万人、超过 1 万亿分钟多模态传感器数据上预训练的大型基础模型。该模型通过自监督重建学习通用生理表征,在 35 项健康任务中 33 项超越监督基线,且无需任何任务特定架构。最大版本相比最小版本重构损失降低 31%,分类任务平均 AUC 提升 9%,回归任务 Pearson 系数提升 21%。

    推荐理由:原文给出了从2M到2B传感器小时、100K到100M参数的 Scaling 实验数据,读者可以据此判断规模对模型能力的实际影响。

7月8日周三
  1. Google Research60

    Google Research 通过导航应用干预缓解城市交通拥堵

    Google Research 在10个美国城市进行了为期6个月的大规模真实世界对照实验,发现即使仅引导不到2%的车辆改道,也能在目标路段实现约2%的车速提升和0.5%-1%的燃油消耗降低。推算每年每个城市可减少数千吨CO2排放,证明协调少量车辆即可改善整体交通状况,且导航用户和非用户均能受益。

    推荐理由:原文给出了在10个城市进行6个月对照实验的具体数据和可验证的改善效果(车速提升2%、燃油降低0.5-1%、潜在数千吨CO2年减排),这是目前少有的大规模实证研究。