跳到正文
AI 工具导航

近 90 天 · AI 圈最值得看的 9 个AI 新工具

每条发布 = 一张工具卡 · 命中 "新工具 / 产品更新 / 模型发布 / 平台" 标签(itemType=tool_release)· 按时间排序

  1. Mistral AI85

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。

    推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。

  2. AWS Machine Learning Blog80

    Grok 4.7 在 Amazon Bedrock 上可用

    xAI 的 Grok 4.7 现已在 Amazon Bedrock 上线,支持 50 万 token 上下文窗口和低/中/高/xhigh 四档可配置推理 effort。该模型定位为 xAI 最强的编码和知识工作模型,强调在困难任务上工作更久并更仔细地自我验证,支持 Responses、Chat Completions 和 Converse API,可通过跨区域推理配置文件路由。

    推荐理由:提供了模型在 Bedrock 上的具体接入方式、API 接口和定价策略,读者可据此评估集成成本和工作流适配性。

  3. NVIDIA Blog67

    NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次亮相中实现领先性能

    NVIDIA Vera Rubin NVL72 系统首次提交 MLPerf Inference v6.1 预览测试,在 Qwen3-VL 基准上提供高达 3.7 倍于 GB300 NVL72 的吞吐量,在 DeepSeek-R1 上达到 2.5 倍。GB300 NVL72 在 288-GPU 四机架扩展测试中实现 99% 扩展效率,软件优化相比 v6.0 提升高达 1.6 倍性能。

    推荐理由:给出了具体的性能倍数和扩展效率数据,读者可以据此评估新硬件对推理工作负载的实际价值。

  4. Hugging Face Blog77

    如何使用 GRPO 微调 LFM2.5-350M 提升结构化输出能力

    本教程展示如何使用 TRL 库的 GRPO 方法微调 LFM2.5-350M 以提升结构化输出能力。实验使用约 500 个样本训练 100 步,在 IFStruct 基准上的准确率从 22.6% 提升至 29.7%(JSON 格式提升 13.9 个百分点),所需资源仅需免费层 Colab 或 Kaggle GPU。

    推荐理由:原文给出了具体的方法论(GRPO + 奖励函数设计)和可量化的性能提升,读者可以据此判断轻量微调是否适合自己的结构化输出场景。

  5. Google DeepMind77

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google DeepMind发布Gemini 3.8 Flash和3.8 Flash Cyber两款新模型。3.8 Flash在DeepSWE v1.1基准上超越多数更大规模的frontier模型,在HLE-Verified上达54.9%,价格为每百万输入token 0.75美元、输出token 3.75美元。

    推荐理由:原文给出了在软件工程、Agent任务和多步推理方面的具体性能提升数据和成本对比,读者可据此判断模型能力变化。

已经到底了