跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 41–60 条 · 共 68 条
6月25日周四
  1. Google DeepMind74

    Gemini 3.5 Flash 引入 computer use 功能

    Google DeepMind 将 computer use 功能集成到 Gemini 3.5 Flash,使开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能够看、推理并在浏览器、移动端和桌面环境采取行动的智能体,适用于持续软件测试和跨专业应用的知识工作等长期和企业自动化任务。

    推荐理由:computer use 从独立模型集成到 3.5 Flash,开发者可直接用 API 构建跨平台的智能体,并提供了企业级安全防护选项。

6月11日周四
  1. Google DeepMind80

    Google DeepMind 发布 DiffusionGemma:文本生成速度提升 4 倍

    Google DeepMind 发布 DiffusionGemma 实验模型,这是一款 26B MoE 开源模型(Apache 2.0 许可证),通过文本扩散技术实现并行生成而非传统自回归的逐 token 生成,在 NVIDIA H100 上可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,比标准 Gemma 4 快 4 倍。

    推荐理由:原文给出了性能对比数据和方法差异,读者可以据此判断 diffusion 文本生成是否适合自己的应用场景。

6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Live Translate,实现 70+ 语言实时语音翻译

    Gemini 3.5 Live Translate 是 Google DeepMind 发布的最新音频模型,可实现超过 70 种语言的近实时语音到语音翻译。该模型自动检测语言并生成流畅、自然的翻译语音,保留说话者的语调、节奏和音调。

    推荐理由:原文详细说明了模型的核心能力(70+语言、保留语调、延迟几秒)和三个明确的落地入口,读者可以对照自己的使用场景判断迁移成本。

  2. Google DeepMind75

    Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。

    推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。

6月5日周五
  1. Google Research67

    Google 发布 Gemini Enterprise Agent Platform 的 Agentic RAG 功能

    Google 推出 Gemini Enterprise Agent Platform 的 Agentic RAG 功能,采用多智能体架构(Orchestrator、Planner、Query Rewriter、Search Fanout)处理复杂多源查询。

    推荐理由:原文给出了具体准确率提升数据(最高34%)和新的 Sufficient Context Agent 机制,读者可以据此判断这个新产品在企业知识管理场景中的实际价值。

  2. Google Research71

    Google 发布 PHRM 系统:利用智能手机前置摄像头被动监测心率

    Google 在 Nature 发表研究,推出 PHRM 系统,利用前置摄像头在面部解锁后捕捉视频,通过深度学习估计心率,在 35 万视频片段、700 名参与者训练下,心率 MAPE<10%(所有肤色),静息心率 MAE<5bpm(对比 Fitbit),为首个在日常智能手机使用中实现被动心率监测的大规模研究。

    推荐理由:首次大规模验证了智能手机在日常使用中被动监测心率和静息心率的可行性,为无创心血管健康监测提供了可穿戴设备之外的普惠选择。

6月4日周四
  1. Google Research65

    Google 开源水文建模框架,助力各国气象水文部门提升洪水预报能力

    Google Research 开源了其水文建模框架,基于 LSTM 神经网络架构,使用气候、土壤、地形等地理特征和降雨、气温等气象预报数据来预测全球河流日流量。

    推荐理由:开源了完整的水文建模框架和预训练模型,研究人员和预报机构可直接下载使用或基于此进行本地化微调。

5月29日周五
  1. Google Research70

    Google Research 在 I/O 2026 展示多项研究进展:科学工具、医疗健康、边缘计算、天气预测等

    Google Research 在 I/O 2026 展示了多个研究进展。Gemini for Science 套件整合了 ERA(研究编码系统)和 Co-Scientist(多智能体系统),可辅助科学假设生成和计算实验。

    推荐理由:原文系统展示了Google在I/O 2026的多个研究进展,涵盖科学工具、医疗健康、边缘计算、天气预测等方向,读者可从中了解AI在科研和产业应用的前沿进展。

5月20日周三
  1. Google Research63

    Google 发布 Empirical Research Assistance (ERA),一款用于科学研究代码编写的 AI 工具

    Google 发布 Empirical Research Assistance (ERA),这是一款使用 Gemini 编写和优化科学代码的研究工具,可搜索科学文献、写代码、探索方案、组合技术并评估结果,在基因组学、公共卫生、卫星图像分析等多个基准上达到专家水平。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

5月18日周一
  1. Google DeepMind79

    Google DeepMind 发布 Gemini Omni 模型,可从任意输入创建视频

    Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,可接受图像、音频、视频和文本作为输入,结合 Gemini 的现实世界知识生成高质量视频,并通过自然语言对话编辑视频。

    推荐理由:原文给出了新模型的能力特点和可用入口,读者可以据此了解视频生成领域的新进展。

5月17日周日
5月16日周六
  1. Google DeepMind75

    Google 发布 Gemini 3.5:兼顾前沿智能与行动能力

    Google 正式发布 Gemini 3.5 系列首款模型 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等 agentic 和 coding 基准上达到前沿性能,输出速度是其他前沿模型的 4 倍。

    推荐理由:原文给出了 Terminal-Bench、GDPval-AA 等多个 agentic 和 coding 基准的具体分数,以及 4 倍速度提升的对比数据,读者可据此判断模型在复杂长程任务上的实际性能。

5月12日周二
  1. Google DeepMind68

    Google DeepMind 发布 Co-Scientist:基于 Gemini 的多智能体 AI 科研伙伴

    Google DeepMind 在 Nature 发布了 Co-Scientist 系统,这是一款基于 Gemini 模型的多智能体 AI 系统,用于生成和优化科学假设。该系统通过生成、辩论、进化三个阶段迭代产生新假设,已在肝纤维化治疗、ALS 研究、细胞衰老逆转等多个领域测试应用,并将通过 Hypothesis Generation 实验工具向个人研究者开放注册。

    推荐理由:原文给出了具体应用案例和能力变化,读者可以了解这个 AI 工具如何辅助科学研究以及它的实际效果。

5月6日周三
  1. Google DeepMind69

    Google DeepMind 展示 AlphaEvolve 一年成果:在基因组学、电网和量子计算等领域取得突破

    Google DeepMind 展示了 AlphaEvolve 这一 Gemini 驱动的 AI 编码智能体在过去一年取得的实际影响:在基因组学领域将 DNA 测序错误检测降低 30%。

    推荐理由:原文给出了 AlphaEvolve 在多个领域(基因组学、电网优化、量子计算等)的具体性能提升数据,读者可以据此评估这类 AI 编码智能体的实际效用。

4月27日周一
  1. Google DeepMind60

    Google DeepMind 与韩国达成 AI 合作伙伴关系

    Google DeepMind 与韩国科学技术信息通信部(MSIT)达成合作伙伴关系,将建立 AI Campus 支持韩国科研机构。合作将聚焦生命科学、天气与气候等领域,涉及 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist、WeatherNext 等模型。同时将提供实习机会,并与韩国 AI 安全研究所合作。

    推荐理由:这是 Google DeepMind 与韩国政府达成的国家级 AI 合作伙伴关系,展示了 AI 在科学研究中的具体应用方向,读者可据此了解 AI for Science 的实际落地场景。

4月23日周四
  1. Google Research72

    Google Photos Auto frame 推出视角重制功能,利用 3D 估计和生成式 AI 调整照片角度

    Google 宣布在 Google Photos 的 Auto frame 功能中推出新的视角重制技术。该方法先通过 3D 点云估计和人脸检测重建场景,再使用生成式潜扩散模型填补新视角下缺失的背景内容,从而在保持人物身份的同时自动调整拍摄角度。目前该功能已上线,可自动优化包含人物的肖像照片。

    推荐理由:原文介绍了 3D 场景估计+生成式修复的技术路径,读者可据此了解图像后期视角调整的新方法。

4月22日周三
  1. Google DeepMind68

    Google DeepMind 发布 Decoupled DiLoCo:面向分布式 AI 训练的高弹性新架构

    Google DeepMind 发布 Decoupled DiLoCo(解耦分布式低通信)架构,通过将训练任务分散到相互独立的计算岛屿,实现跨数据中心的分布式大语言模型训练。

    推荐理由:这篇论文提出了一种新的分布式训练架构,能够在低带宽条件下跨数据中心训练大模型,同时保持较高的硬件容错性。

  2. Google Research64

    ReasoningBank:让智能体从经验中学习

    Google Research 发布 ReasoningBank 框架,使大语言模型能在测试时从成功和失败的经验中自我进化。该框架将推理模式提炼为高层记忆存储,在 WebArena 和 SWE-Bench Verified 上相比无记忆智能体分别提升 8.3% 和 4.6% 成功率,并结合 MaTTS 扩展方法进一步提升 3% 成功率。

    推荐理由:论文给出了在 WebArena 和 SWE-bench 上相对于 baseline 的具体提升幅度(8.3%、4.6%、3%),并开源了代码,读者可据此判断该方法对智能体记忆机制研究的参考价值。

4月16日周四
4月3日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4:字面意义上最强大的开源模型

    Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。

    推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。