Thinking Machines 发布 Inkling 大模型:1T 参数、1M 上下文、支持图像/音频/文本多模态输入
Thinking Machines 发布开源多模态大模型 Inkling,参数总量 975B、激活 41B,支持图像、音频、文本三种模态输入,拥有 1M 上下文窗口,训练数据达 45T token。
推荐理由:原文给出了完整的架构说明、基准测试对比和部署配置,读者可以据此判断该模型在多模态推理任务上的相对表现以及自身硬件能否部署。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Thinking Machines 发布开源多模态大模型 Inkling,参数总量 975B、激活 41B,支持图像、音频、文本三种模态输入,拥有 1M 上下文窗口,训练数据达 45T token。
推荐理由:原文给出了完整的架构说明、基准测试对比和部署配置,读者可以据此判断该模型在多模态推理任务上的相对表现以及自身硬件能否部署。
Google Research 发布 SensorFM,一个在 5 百万人、超过 1 万亿分钟多模态传感器数据上预训练的大型基础模型。该模型通过自监督重建学习通用生理表征,在 35 项健康任务中 33 项超越监督基线,且无需任何任务特定架构。最大版本相比最小版本重构损失降低 31%,分类任务平均 AUC 提升 9%,回归任务 Pearson 系数提升 21%。
推荐理由:原文给出了从2M到2B传感器小时、100K到100M参数的 Scaling 实验数据,读者可以据此判断规模对模型能力的实际影响。
Hugging Face 与 Cerebras 合作展示了基于 Gemma 4 的实时语音转语音系统,采用模块化开源架构:Nvidia Parakeet 语音识别 + Cerebras 加速 Gemma 4 VLM 推理 + 阿里 Qwen3TTS 语音生成。该系统已在超过 9,000 台 Reachy Mini 机器人上部署,旨在解决语音 AI 的延迟问题,提供更稳定、可预测的低延迟体验。
推荐理由:原文展示了实时语音 AI 的低延迟方案,读者可以了解这个技术演示的核心架构和性能改进。
Google DeepMind 正式发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)——公司最快、最省成本的图像生成模型,文生图延迟 4 秒,定价 $0.034/千张图;同时发布 Gemini Omni Flash(gemini-omni-flash-preview),支持高质量视频生成和对话式编辑,定价 $0.10/秒。
推荐理由:原文给出了两个模型的具体性能数据和定价,读者可以据此判断相比竞品和前代产品的速度、成本和功能优势。
Mistral 发布 OCR 4,这是一款文档解析产品,支持 170 种语言,提供边界框、块分类和内联置信度分数等结构化输出。该模型在人类评估和基准测试中均优于现有 OCR 系统,可通过 API、Document AI 或自托管部署使用。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Gemini 3.5 Live Translate 是 Google DeepMind 发布的最新音频模型,可实现超过 70 种语言的近实时语音到语音翻译。该模型自动检测语言并生成流畅、自然的翻译语音,保留说话者的语调、节奏和音调。
推荐理由:原文详细说明了模型的核心能力(70+语言、保留语调、延迟几秒)和三个明确的落地入口,读者可以对照自己的使用场景判断迁移成本。
Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。
推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。
Google Research 在 I/O 2026 展示了多个研究进展。Gemini for Science 套件整合了 ERA(研究编码系统)和 Co-Scientist(多智能体系统),可辅助科学假设生成和计算实验。
推荐理由:原文系统展示了Google在I/O 2026的多个研究进展,涵盖科学工具、医疗健康、边缘计算、天气预测等方向,读者可从中了解AI在科研和产业应用的前沿进展。
Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,可接受图像、音频、视频和文本作为输入,结合 Gemini 的现实世界知识生成高质量视频,并通过自然语言对话编辑视频。
推荐理由:原文给出了新模型的能力特点和可用入口,读者可以据此了解视频生成领域的新进展。
Google DeepMind 宣布与新加坡政府建立国家 AI 合作伙伴关系,通过多个项目推动医疗保健、生命科学、教育和可持续发展领域的 AI 应用。预计到 2040 年,AI 将在新加坡通过加速研发创造 33 亿新加坡元的经济价值。
推荐理由:原文给出了合作的具体领域、经济价值预测和项目细节,读者可以据此了解 AI 在公共服务领域的应用方向和 Google DeepMind 的亚太布局。
Google 正式发布 Gemini 3.5 系列首款模型 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等 agentic 和 coding 基准上达到前沿性能,输出速度是其他前沿模型的 4 倍。
推荐理由:原文给出了 Terminal-Bench、GDPval-AA 等多个 agentic 和 coding 基准的具体分数,以及 4 倍速度提升的对比数据,读者可据此判断模型在复杂长程任务上的实际性能。
Google DeepMind 发布 Gemini 3.1 Flash TTS,这是一款新的文本转语音模型,在 Artificial Analysis TTS 基准测试中获得 1211 的 Elo 评分。
推荐理由:原文展示了具体性能数据(Elo 1211)和可用入口,读者可据此评估该模型在实际业务中的适用性。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其首个推理优先模型的重大升级版。该模型增强了空间推理和多视角理解能力,专门用于视觉与空间理解、任务规划和成功检测,并能原生调用工具如 Google Search、视觉语言动作模型或第三方函数。
推荐理由:原文给出了具体性能对比和新增的仪表读取功能,读者可以据此判断该模型在机器人实体推理场景中的具体提升和可用性。
Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。
推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。
Google DeepMind 发布实验性的 AI 赋能光标,能够理解用户指向的内容及上下文。用户只需指向并用自然语言提问(如“显示方向”“对比这些产品”),AI 即可识别光标处的文字、图像、代码块等元素并提供相应帮助。该原型基于 Gemini 构建,计划集成到 Chrome 和新的 Googlebook 设备中。
推荐理由:Google DeepMind 展示了 AI 赋能光标的新交互范式,读者可以了解 AI 如何从理解'指向什么'升级到理解'为什么指向',以及这一变化对现有工作流的意义。
Google宣布推出Vibe Coding XR工作流,结合Gemini的长期上下文推理能力和专门的系统提示词与代码模板,将自然语言直接转换为可在Android XR设备上运行的功能性、物理感知的XR应用。
推荐理由:Google发布了一个完整的AI+XR原型开发工具链,展示了多个教育、娱乐和游戏场景的demo,读者可据此了解当前AI生成XR应用的能力边界。
Mistral AI 发布 Voxtral TTS,一个 40 亿参数的文本转语音模型,支持 9 种语言的情感化语音生成,具备低延迟和快速语音适配能力。该模型通过 API 和 Mistral Studio 提供,起步价每千字符 0.016 美元,支持仅 3 秒参考音频即可适配定制语音。
推荐理由:原文给出了与 ElevenLabs 的对比数据和具体价格,读者可以据此判断 Voxtral TTS 在语音生成领域的能力和成本。
Mistral 发布新模型 Mistral Small 4,这是首个统一推理(Magistral)、指令(Mistral Small)和多模态(Pixtral)能力的开源混合模型。
推荐理由:Mistral Small 4 首次将推理、指令、多模态能力统一在单一模型中,支持可配置的 reasoning_effort 参数,在基准测试中保持竞争力分数的同时输出更短,延迟降低 40%、吞吐量提升 3 倍。
Google 宣布在 Flood Hub 上推出 AI 城市突发洪水预报功能,可提前 24 小时预测城市突发洪水风险。该系统使用 Groundsource 方法论(由 Gemini 分析新闻报道生成历史洪水数据集)训练 LSTM 模型,仅依赖全球气象数据即可生成 20x20 公里分辨率的预报。
推荐理由:原文给出了AI驱动方法如何弥合全球预警差距的具体数据,读者可以据此评估它对发展中国家的实际价值。
Google Research 发布了 Groundsource,这是一项利用 Gemini 将全球新闻报道转化为结构化灾害数据的新方法论。该方法已生成 260 万条城市突发洪水事件记录,覆盖 150 多个国家(2000 年至今),准确率在实用层面达 82%。Google 已将此数据用于改进 Flood Hub 的洪水预测能力,未来计划扩展到其他灾害类型。
推荐理由:该方法通过 AI 从全球新闻中提取结构化灾害数据,填补了传统监测系统无法覆盖的小型和局部灾害的数据空白。