跳到正文
AI 工具导航

近 90 天 · AI 圈最值得看的 23 个AI 新工具

每条发布 = 一张工具卡 · 命中 "新工具 / 产品更新 / 模型发布 / 平台" 标签(itemType=tool_release)· 按时间排序

  1. Mistral AI85

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。

    推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。

  2. Hugging Face Blog70

    Hugging Face 发布 Open TTS Leaderboard:开源多语言 TTS 与语音克隆的可扩展评估

    Hugging Face 发布 Open TTS Leaderboard,使用客观指标(WER/CER 可理解性、RTFx 推理速度、TTFA 首音频延迟、SIM 说话人相似度)评估开源 TTS 模型,解决 arena 方式无法跟上模型发布速度的问题。

    推荐理由:给出了具体的评估指标和部分模型排名,读者可以直接查看 leaderboard 了解各开源 TTS 模型的可理解性和速度表现。

  3. Microsoft Research66

    微软发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。

    推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。

  4. Google DeepMind70

    Gemini 3.8 Live 推出 Live Avatar 功能,实现实时视觉呈现

    Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,实现近实时视频生成与语音同步,支持精确口型同步、自然表情和 97 种语言无缝切换。该功能现已在 Gemini Enterprise 可用,企业可定制头像(仅限白名单)。所有输出均带有 SynthID 水印以确保透明度。

    推荐理由:原文给出了具体的能力变化和可用范围,读者可以据此判断它对现有工作流的影响。

  5. AWS Machine Learning Blog68

    AWS 发布基于智能体的对话式视频智能解决方案

    AWS 发布了基于 Strands Agents SDK 的对话式视频智能解决方案,整合 Amazon Bedrock、Rekognition 和 Transcribe,允许用户用自然语言提问视频内容。该方案在运行时动态决定调用哪些服务,无需为每种查询类型预建管道。已有客户使用后手动审查时间减少约 80%。完整实现已开源。

    推荐理由:给出了基于 Strands Agents SDK 的视频智能架构完整实现方案,读者可据此复用到其他模态。

  6. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Text-to-Speech

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新的文本转语音模型,在 Hume AI Voice Design Benchmark 获得第一。

    推荐理由:原文给出了具体的能力变化和开放入口,读者可以据此判断它会怎样改变现有的语音生成工作流。

  7. Google DeepMind76

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking

    Google DeepMind 发布两款新的实时对话模型:Gemini 3.8 Live 注重规模化和成本效率,结合对话智能与流畅交互;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备增强智能和多步推理能力。

    推荐理由:原文给出了具体性能数据(82.6% Speech to Speech Quality Index、68.6% τ-Voice 等)和多个平台可用入口,读者可据此判断该模型相对现有产品的能力提升和适用场景。

  8. Google DeepMind78

    Google DeepMind 发布 WeatherNext 3:迄今最先进、最准确的全球天气 AI 模型

    Google DeepMind 发布 WeatherNext 3,这是迄今最先进、最准确的全球天气 AI 模型。新模型使用实时卫星数据训练,每小时更新一次,分辨率 5-25 公里,比上一代 WeatherNext 2 清晰约 5 倍。

    推荐理由:原文给出了具体的性能提升数据(CRPS 提升 60%/30%/10%),分辨率提升 5 倍,与上一代 WeatherNext 2 有明确对比,读者可以据此判断模型的实际进步幅度。

  9. Google DeepMind74

    Google DeepMind 推出 Gemini 智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解功能,该功能将模型核心推理与原生视频工具结合,动态搜索和检查目标视频片段,相比静态处理可降低最多 88% 的 token 消耗和 66% 的成本,同时提升最多 7% 的准确率。

    推荐理由:原文给出了 token 消耗降低 88%、成本降低 66%、质量提升 7% 的具体数据,读者可以据此评估该功能对自身工作流的效率提升。

  10. Mistral AI75

    Mistral 发布 Shieldstral:3B 参数开源多模态安全分类器

    Mistral 发布 Shieldstral,这是一款 3B 参数的开源多模态安全分类器,通过将内容审核重新定义为政策自适应的问答任务,在文本安全和多模态审核基准上超越了尺寸高达其 7 倍的模型。

    推荐理由:它把内容审核重新定义成政策自适应的问答任务,一个 3B 模型能达到 7 倍尺寸模型的水平,而且可以在推理时用自然语言直接改写政策,不需要重新训练。

  11. Hugging Face Blog70

    NVIDIA 发布 Cosmos-H-Dreams:面向手术机器人的实时生成式模拟器

    NVIDIA 发布 Cosmos-H-Dreams,一款实时的、动作条件的手术机器人生成式模拟器。该系统基于 Cosmos-H-Surgical-Simulator,通过师生蒸馏和自强制学习将模型精简为因果few-step模型,并在 FlashDreams 加速库支持下,在单张 RTX PRO 6000 GPU 上实现约 160 FPS 的交互式帧生成。

    推荐理由:原文给出了性能数据(160 FPS、单卡运行)和技术实现路径,读者可以据此评估它对手术机器人训练和模拟的实际价值。

  12. Hugging Face Blog62

    Hugging Face 和 Cerebras 合作展示 Gemma 4 实时语音 AI

    Hugging Face 与 Cerebras 合作展示了基于 Gemma 4 的实时语音转语音系统,采用模块化开源架构:Nvidia Parakeet 语音识别 + Cerebras 加速 Gemma 4 VLM 推理 + 阿里 Qwen3TTS 语音生成。该系统已在超过 9,000 台 Reachy Mini 机器人上部署,旨在解决语音 AI 的延迟问题,提供更稳定、可预测的低延迟体验。

    推荐理由:原文展示了实时语音 AI 的低延迟方案,读者可以了解这个技术演示的核心架构和性能改进。

  13. Google DeepMind81

    Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash

    Google DeepMind 正式发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)——公司最快、最省成本的图像生成模型,文生图延迟 4 秒,定价 $0.034/千张图;同时发布 Gemini Omni Flash(gemini-omni-flash-preview),支持高质量视频生成和对话式编辑,定价 $0.10/秒。

    推荐理由:原文给出了两个模型的具体性能数据和定价,读者可以据此判断相比竞品和前代产品的速度、成本和功能优势。

  14. Mistral AI78

    Mistral 推出 OCR 4:支持 170 种语言的文档解析模型

    Mistral 发布 OCR 4,这是一款文档解析产品,支持 170 种语言,提供边界框、块分类和内联置信度分数等结构化输出。该模型在人类评估和基准测试中均优于现有 OCR 系统,可通过 API、Document AI 或自托管部署使用。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  15. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Live Translate,实现 70+ 语言实时语音翻译

    Gemini 3.5 Live Translate 是 Google DeepMind 发布的最新音频模型,可实现超过 70 种语言的近实时语音到语音翻译。该模型自动检测语言并生成流畅、自然的翻译语音,保留说话者的语调、节奏和音调。

    推荐理由:原文详细说明了模型的核心能力(70+语言、保留语调、延迟几秒)和三个明确的落地入口,读者可以对照自己的使用场景判断迁移成本。

  16. Google Research70

    Google Research 在 I/O 2026 展示多项研究进展:科学工具、医疗健康、边缘计算、天气预测等

    Google Research 在 I/O 2026 展示了多个研究进展。Gemini for Science 套件整合了 ERA(研究编码系统)和 Co-Scientist(多智能体系统),可辅助科学假设生成和计算实验。

    推荐理由:原文系统展示了Google在I/O 2026的多个研究进展,涵盖科学工具、医疗健康、边缘计算、天气预测等方向,读者可从中了解AI在科研和产业应用的前沿进展。

  17. Google DeepMind72

    Google DeepMind 发布 AI 赋能光标原型

    Google DeepMind 发布实验性的 AI 赋能光标,能够理解用户指向的内容及上下文。用户只需指向并用自然语言提问(如“显示方向”“对比这些产品”),AI 即可识别光标处的文字、图像、代码块等元素并提供相应帮助。该原型基于 Gemini 构建,计划集成到 Chrome 和新的 Googlebook 设备中。

    推荐理由:Google DeepMind 展示了 AI 赋能光标的新交互范式,读者可以了解 AI 如何从理解'指向什么'升级到理解'为什么指向',以及这一变化对现有工作流的意义。

  18. Google Research75

    Google发布Vibe Coding XR:用XR Blocks和Gemini加速AI+XR原型开发

    Google宣布推出Vibe Coding XR工作流,结合Gemini的长期上下文推理能力和专门的系统提示词与代码模板,将自然语言直接转换为可在Android XR设备上运行的功能性、物理感知的XR应用。

    推荐理由:Google发布了一个完整的AI+XR原型开发工具链,展示了多个教育、娱乐和游戏场景的demo,读者可据此了解当前AI生成XR应用的能力边界。

  19. Mistral AI79

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布 Voxtral TTS,一个 40 亿参数的文本转语音模型,支持 9 种语言的情感化语音生成,具备低延迟和快速语音适配能力。该模型通过 API 和 Mistral Studio 提供,起步价每千字符 0.016 美元,支持仅 3 秒参考音频即可适配定制语音。

    推荐理由:原文给出了与 ElevenLabs 的对比数据和具体价格,读者可以据此判断 Voxtral TTS 在语音生成领域的能力和成本。

  20. Google Research75

    Google Flood Hub 推出 AI 城市突发洪水预报,可提前 24 小时预警

    Google 宣布在 Flood Hub 上推出 AI 城市突发洪水预报功能,可提前 24 小时预测城市突发洪水风险。该系统使用 Groundsource 方法论(由 Gemini 分析新闻报道生成历史洪水数据集)训练 LSTM 模型,仅依赖全球气象数据即可生成 20x20 公里分辨率的预报。

    推荐理由:原文给出了AI驱动方法如何弥合全球预警差距的具体数据,读者可以据此评估它对发展中国家的实际价值。

  21. Mistral AI75

    Mistral 推出 OCR API,基准测试超越 Google、Azure 和 GPT-4o

    Mistral 发布新的 OCR API Mistral OCR,可处理图像和 PDF 并提取交错文本和图像,在基准测试中超越 Google Document AI、Azure OCR、Gemini 和 GPT-4o。定价为每美元 1000 页,单节点处理速度最高达每分钟 2000 页,支持多语言文档理解,现已在 Le Chat 免费试用,API 已上线 la Plateforme。

    推荐理由:原文给出了具体定价、基准测试对比和可用入口,读者可以据此评估它与现有 OCR 方案的差异。

已经到底了