跳到正文

#Google

今日 11 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
7月3日周五
  1. Google DeepMind45

    Google DeepMind 与 A24 宣布史无前例的研究合作

    Google DeepMind 与独立电影工作室 A24 宣布一项史无前例的研究合作,旨在帮助艺术家开发新工作流程和技术,确保未来工具由创作者塑造。该合作创建深度研发协作,涵盖多个项目,Google 并对 A24 进行了投资。合作初期重点是弥合前沿技术与下一代娱乐之间的差距,具体目标和创意里程碑将随时间演进。

7月1日周三
  1. Hugging Face Blog62

    Hugging Face 和 Cerebras 合作展示 Gemma 4 实时语音 AI

    Hugging Face 与 Cerebras 合作展示了基于 Gemma 4 的实时语音转语音系统,采用模块化开源架构:Nvidia Parakeet 语音识别 + Cerebras 加速 Gemma 4 VLM 推理 + 阿里 Qwen3TTS 语音生成。该系统已在超过 9,000 台 Reachy Mini 机器人上部署,旨在解决语音 AI 的延迟问题,提供更稳定、可预测的低延迟体验。

    推荐理由:原文展示了实时语音 AI 的低延迟方案,读者可以了解这个技术演示的核心架构和性能改进。

  2. Google DeepMind81

    Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash

    Google DeepMind 正式发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)——公司最快、最省成本的图像生成模型,文生图延迟 4 秒,定价 $0.034/千张图;同时发布 Gemini Omni Flash(gemini-omni-flash-preview),支持高质量视频生成和对话式编辑,定价 $0.10/秒。

    推荐理由:原文给出了两个模型的具体性能数据和定价,读者可以据此判断相比竞品和前代产品的速度、成本和功能优势。

6月30日周二
  1. Google Research78

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google 发布 TabFM,一个面向表格数据分类和回归任务的基础模型。该模型将表格预测重新定义为上下文学习问题,通过混合注意力架构(交替行列注意力、行列压缩)在数百万人工合成数据集上训练,实现了真正的零样本预测——无需针对新数据集进行模型训练、超参数调优或特征工程。

    推荐理由:读者可通过本文了解 Google 如何将大语言模型的零样本能力迁移到结构化表格数据,理解其架构创新和实际可用性。

6月27日周六
  1. Google Research68

    Google 通过冻结多Token预测加速 Pixel 设备上的 Gemini Nano 模型

    Google 宣布将 Multi-Token Prediction (MTP) 架构应用于现有的冻结 Gemini Nano v3 模型,在 Pixel 9/10 系列上实现 50% 以上加速。

    推荐理由:原文给出了具体的技术架构细节、性能数据(50%+加速、130MB内存节省)和在 Pixel 设备上的实测效果,读者可以据此了解移动端推理优化的具体方法。

6月25日周四
  1. Google Research41

    Google 线性弹性缓存技术:将页面驱逐建模为滑雪租赁问题优化云成本

    Google 提出线性弹性缓存技术,将页面驱逐问题建模为滑雪租赁问题,使用浅层决策树预测页面 TTL 以动态调整缓存大小。在 Spanner 生产环境的测试中,内存使用减少 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法将内存视为随占用时间和大小线性计费的 utility,而非固定资源。

  2. Google Research49

    推理如何解锁大语言模型中的参数化知识

    Google Research在COLM 2026发表的研究发现,启用推理(CoT)能显著提升R-LLMs在简单一次性问题上的准确率,即使问题无需分步推理。通过Gemini-2.5(Flash和Pro)及Qwen3-32B在SimpleQA Verified和EntityQuestions上的实验,证明推理开启后模型能recall关闭时几乎无法获取的答案。

  3. Google DeepMind74

    Gemini 3.5 Flash 引入 computer use 功能

    Google DeepMind 将 computer use 功能集成到 Gemini 3.5 Flash,使开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能够看、推理并在浏览器、移动端和桌面环境采取行动的智能体,适用于持续软件测试和跨专业应用的知识工作等长期和企业自动化任务。

    推荐理由:computer use 从独立模型集成到 3.5 Flash,开发者可直接用 API 构建跨平台的智能体,并提供了企业级安全防护选项。

6月22日周一
6月17日周三
  1. Google DeepMind54

    Google DeepMind 与英国政府合作推出 AI 规划原型,目标将房屋规划审批时间缩短 50%

    Google DeepMind 与英国政府合作开发 AI 规划工具,基于 Gemini 模型,为规划官员提供数据提取、政策识别、摘要和评估草案等功能。该工具旨在将规划申请审批时间缩短 50%,目前正在 Barnet、Camden 和 Dorset 三个地区试点,计划 2027 年向全英议会推广,以支持英国到 2029 年建成 150 万套新住房的目标。

  2. Google Research43

    Google 发布高分辨率深度学习框架,将卫星像素转化为自然恢复规划

    Google 开发了高分辨率深度学习框架,通过 Vision-Transformer 在 3 亿张卫星图像上预训练,仅用约 247 km² 注释数据即可精准识别树篱、林分等精细生态特征。发布矢量化数据集,将英格兰超过 13 万 km² 的细微木本特征转换为可操作的生态清单,利用 Polsby-Popper 紧凑度评分(<0.5)区分线性树篱与林分,为碳汇核算和自然恢复提供新途径。

6月16日周二
  1. Google DeepMind64

    Google DeepMind 发布 AI Control Roadmap 应对 AI 智能体安全挑战

    Google DeepMind 发布 AI Control Roadmap 框架,为内部 AI 智能体提供传统模型对齐之外的额外安全层。该框架将不受信任的 AI 智能体视为潜在“内部威胁”,通过检测、预防和响应三层机制应对风险。研究团队已分析超过 100 万个编码智能体任务来验证框架,并同步发布面向政策制定者的《Three Layers of Agent Security》技术框架。

    推荐理由:原文给出了 AI 智能体安全的具体技术路径和实践数据,读者可据此理解如何为 AI 智能体构建超越传统对齐的系统级安全层。

6月13日周六
6月11日周四
  1. Google DeepMind80

    Google DeepMind 发布 DiffusionGemma:文本生成速度提升 4 倍

    Google DeepMind 发布 DiffusionGemma 实验模型,这是一款 26B MoE 开源模型(Apache 2.0 许可证),通过文本扩散技术实现并行生成而非传统自回归的逐 token 生成,在 NVIDIA H100 上可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,比标准 Gemma 4 快 4 倍。

    推荐理由:原文给出了性能对比数据和方法差异,读者可以据此判断 diffusion 文本生成是否适合自己的应用场景。

6月10日周三
  1. Google DeepMind69

    Google DeepMind 联合多方推出 1000 万美元资助计划,支持多智能体 AI 安全研究

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布提供最高 1000 万美元的研究资助,面向全球研究人员征集多智能体 AI 安全研究提案。

    推荐理由:原文给出了 $10M 资助金额、四个重点资助方向和截止日期,读者可以据此了解多智能体 AI 安全研究的前沿问题和参与机会。

6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Live Translate,实现 70+ 语言实时语音翻译

    Gemini 3.5 Live Translate 是 Google DeepMind 发布的最新音频模型,可实现超过 70 种语言的近实时语音到语音翻译。该模型自动检测语言并生成流畅、自然的翻译语音,保留说话者的语调、节奏和音调。

    推荐理由:原文详细说明了模型的核心能力(70+语言、保留语调、延迟几秒)和三个明确的落地入口,读者可以对照自己的使用场景判断迁移成本。

  2. Google DeepMind75

    Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。

    推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。

6月8日周一
  1. Google DeepMind54

    Google DeepMind 发布塞拉利昂AI教育工具RCT研究结果

    Google DeepMind在塞拉利昂进行了一项预注册RCT研究,评估Gemini的Guided Learning功能对学生数学成绩的影响。研究结果显示,使用Guided Learning的学生比对照组提高了0.258个标准差,相当于8周内实现约1.2至1.7年的学习进步;教师将Gemini融入约半数课程(12小时)的班级进步更为显著,达1.8至2.5年。

6月5日周五
  1. Google Research67

    Google 发布 Gemini Enterprise Agent Platform 的 Agentic RAG 功能

    Google 推出 Gemini Enterprise Agent Platform 的 Agentic RAG 功能,采用多智能体架构(Orchestrator、Planner、Query Rewriter、Search Fanout)处理复杂多源查询。

    推荐理由:原文给出了具体准确率提升数据(最高34%)和新的 Sufficient Context Agent 机制,读者可以据此判断这个新产品在企业知识管理场景中的实际价值。

  2. Google Research71

    Google 发布 PHRM 系统:利用智能手机前置摄像头被动监测心率

    Google 在 Nature 发表研究,推出 PHRM 系统,利用前置摄像头在面部解锁后捕捉视频,通过深度学习估计心率,在 35 万视频片段、700 名参与者训练下,心率 MAPE<10%(所有肤色),静息心率 MAE<5bpm(对比 Fitbit),为首个在日常智能手机使用中实现被动心率监测的大规模研究。

    推荐理由:首次大规模验证了智能手机在日常使用中被动监测心率和静息心率的可行性,为无创心血管健康监测提供了可穿戴设备之外的普惠选择。

6月4日周四
  1. Google Research65

    Google 开源水文建模框架,助力各国气象水文部门提升洪水预报能力

    Google Research 开源了其水文建模框架,基于 LSTM 神经网络架构,使用气候、土壤、地形等地理特征和降雨、气温等气象预报数据来预测全球河流日流量。

    推荐理由:开源了完整的水文建模框架和预训练模型,研究人员和预报机构可直接下载使用或基于此进行本地化微调。

5月29日周五
  1. Google Research70

    Google Research 在 I/O 2026 展示多项研究进展:科学工具、医疗健康、边缘计算、天气预测等

    Google Research 在 I/O 2026 展示了多个研究进展。Gemini for Science 套件整合了 ERA(研究编码系统)和 Co-Scientist(多智能体系统),可辅助科学假设生成和计算实验。

    推荐理由:原文系统展示了Google在I/O 2026的多个研究进展,涵盖科学工具、医疗健康、边缘计算、天气预测等方向,读者可从中了解AI在科研和产业应用的前沿进展。

5月28日周四
  1. Google Research49

    Google 零信任聚合的私有分析技术

    Google推出新的私有分析服务,结合新型加密聚合协议与可信执行环境(TEE),实现单次消息安全提交,无需设备长时间在线多轮交互。该方案通过加密层确保原始数据在任何服务器内存中都不被暴露或重建,仅在聚合匿名化后才处理明文数据,并利用TEE提供可验证的完整性证明。目前已应用于Pixel Recorder和Gboard等场景。

5月22日周五
  1. Google DeepMind51

    Google DeepMind 在亚太区启动 AI for the Planet 加速器项目

    Google DeepMind 在亚太区启动首个 AI for the Planet 加速器项目,为期三个月,面向该地区的初创公司、研究团队和非营利组织,帮助他们利用前沿 AI 解决自然、气候、农业、能源等环境问题。入选组织将获得 Google AI 专家的导师指导、定制支持以及前沿 AI 和科学 AI 模型的整合帮助。项目以新加坡线下训练营启动,现已开放注册。

5月20日周三
  1. Google Research63

    Google 发布 Empirical Research Assistance (ERA),一款用于科学研究代码编写的 AI 工具

    Google 发布 Empirical Research Assistance (ERA),这是一款使用 Gemini 编写和优化科学代码的研究工具,可搜索科学文献、写代码、探索方案、组合技术并评估结果,在基因组学、公共卫生、卫星图像分析等多个基准上达到专家水平。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

5月19日周二
5月18日周一
  1. Google DeepMind79

    Google DeepMind 发布 Gemini Omni 模型,可从任意输入创建视频

    Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,可接受图像、音频、视频和文本作为输入,结合 Gemini 的现实世界知识生成高质量视频,并通过自然语言对话编辑视频。

    推荐理由:原文给出了新模型的能力特点和可用入口,读者可以据此了解视频生成领域的新进展。

5月17日周日
5月16日周六
  1. Google DeepMind68

    Google DeepMind 与新加坡启动国家 AI 合作伙伴关系

    Google DeepMind 宣布与新加坡政府建立国家 AI 合作伙伴关系,通过多个项目推动医疗保健、生命科学、教育和可持续发展领域的 AI 应用。预计到 2040 年,AI 将在新加坡通过加速研发创造 33 亿新加坡元的经济价值。

    推荐理由:原文给出了合作的具体领域、经济价值预测和项目细节,读者可以据此了解 AI 在公共服务领域的应用方向和 Google DeepMind 的亚太布局。

  2. Google DeepMind39

    Calico Life Sciences 如何用 Co-Scientist 开辟衰老研究新路径

    Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé使用 Co-Scientist 连接分散的衰老生物学发现,将其转化为可检验的假设。Co-Scientist 帮助生成了关于整合应激反应(ISR)如何被代谢调控的假设,实验产生了对 ISR 在健康与疾病中作用具有重要意义的新发现,团队计划发表结果。

  3. Google DeepMind48

    Co-Scientist 如何加速发现 MASH 肝病机制

    Google DeepMind 的 Co-Scientist 工具帮助 Edinburgh 大学 Filippo Menolascina 团队研究代谢相关脂肪性肝炎(MASH)。该系统生成假设,识别出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,解释了为何获批药物 resmetirom 仅对部分患者有效。该假设已被后续实验验证,有望推动双靶点疗法开发。