跳到正文

本月新模型

30 天内发布的新模型与新权重。

49条精选相关主题新模型本月新增

最新精选

第 1–20 条 · 共 49 条
10月2日周五
  1. Hacker News · 首页76

    Cloudflare 发布开源决策模型 Clef 和 Clef-flash,上线 RL 微调平台

    Cloudflare 发布两款决策模型 Clef 和 Clef-flash,均基于 Qwen 微调,支持文本和图像分类,在 Jev Decision Index 评估中领先。Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,均优于 Jev 的 524.1ms。两款模型已开源至 Hugging Face 并托管于 Workers AI,同时推出 RL 微调服务供客户定制。

    推荐理由:原文给出了与 Jev 的基准对比和延迟数据,读者可以判断决策模型在特定场景下是否比通用 LLM 更适合。

10月1日周四
  1. Hacker News · 最佳81

    Google 发布 Gemini 4 Argon 旗舰模型

    Google 正式发布 Gemini 4 Argon 旗舰模型,定价为输入每百万 token 2 美元、输出每百万 token 10 美元,上下文窗口扩展至 100 万 token。

    推荐理由:原文披露了定价、多个基准测试分数和内部应用案例,读者可以据此评估该模型相对于前代和其他竞品的实际能力提升幅度。

  2. The Verge · AI78

    Google 发布 Gemini 4 Argon,称能力太强仅限"可信网络防御者"使用

    Google发布新模型Gemini 4 Argon,定位为前沿性能模型,涵盖软件工程、企业知识工作和网络安全防御领域。该模型基准测试优于OpenAI和Anthropic的竞品,但初期仅向特定"可信网络防御者"开放,Google正与美国政府合作进行发布前审查。Gemini 4 Argon已用于Google内部工作流,如大规模代码库迁移。

    推荐理由:原文给出了模型的能力定位和基准对比,读者可以据此了解Google新模型在行业中的相对位置。

  3. Google DeepMind77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。

    推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。

9月30日周三
  1. Latent Space80

    OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol 等新品,ChatGPT 周活达 12 亿

    OpenAI 在 2026 DevDay 上发布语音智能体 Dots、GPT-6.1 Sol(定价为 Astra 的五分之一)、Ultrafast 加速模式(最高 8 倍提速)和 Decisions API,同时推出 ChatGPT Spaces 和企业市场。

    推荐理由:原文提供了 OpenAI DevDay 2026 的完整产品矩阵和行业关键事件(Anthropic IPO、NVIDIA 收购 Hugging Face),读者可据此了解当下 AI 竞争格局的全景。

  2. AWS Machine Learning Blog73

    GPT-6.1 Sol 在 Amazon Bedrock 全面可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 全面可用,将更强的推理能力带入编码、计算机使用和专业工作负载。根据 OpenAI 的数据,该模型在 DeepSWE v1.1 上与 GPT-6 Astra 性能相当,但任务成本降低约五分之一;相比 GPT-6 Sol 最高分提升 6.4 个百分点。用户可通过 Amazon Bedrock 控制台或 API 接入使用。

    推荐理由:原文给出了与前代版本的成本和性能对比数据,读者可以据此判断新模型是否值得在生产环境中切换。

  3. TechCrunch · AI81

    OpenAI 发布 GPT-6.1 Sol,性能接近 GPT-6 Astra 且价格更低

    OpenAI 在 DevDay 上发布了 GPT-6.1 Sol,仅在一周前推出了 GPT-6 Sol。该模型在编码、计算机使用和专业工作方面达到了 GPT-6 Astra 几乎相同的智能水平,但标准输入和输出 token 价格仅为五分之一。

    推荐理由:它以五分之一的价格提供了接近最高版本的能力,读者可据此评估是否值得升级。

  4. Product Hunt · AI 分类64

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二个模型。该模型面向日常工作场景(编码、修复 bug、文档、演示文稿和设计),运行速度比 Sonnet 5 快 30% 以上,任务成本降低高达 30%,编码和知识工作性能更强。

    推荐理由:给出了30%性能提升和成本降低的具体数据,读者可据此评估是否值得切换到新版本。

9月29日周二
  1. Hacker News · 最佳76

    Fireworks 发布 Ember-1:基于 Kimi K3 的高效推理模型

    Fireworks Research 发布 Ember-1 模型,基于 Kimi K3 通过训练减少不必要推理过程,实现相同质量下 token 消耗降低 40%。

    推荐理由:原文给出了 Ember-1 在多个 benchmark 上的具体 token 节省比例和分数对比,读者可以据此评估这个专门优化模型的实际效果。

  2. Hugging Face Blog76

    NVIDIA 发布 Kumo Tabular 表格预测基础模型

    NVIDIA 发布 Kumo Tabular,这是一个开源的表格预测基础模型,可对标注过的表格数据进行分类和回归预测,无需训练、调优或特征工程。

    推荐理由:该模型在四个表格预测基准测试中排名第一,性能优于调优后的梯度提升树和最新的表格基础模型,并提供三种参数规模供选择,可供读者判断其对现有机器学习工作流的潜在影响。

  3. Hacker News · 最佳80

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 系列的第二款模型。相比 Sonnet 5,性能提升超过 30%,成本降低最高达 30%。

    推荐理由:原文给出了性能提升、基准测试分数和价格信息,读者可以据此判断它与前代的实际差距以及是否值得切换。

9月23日周三
  1. AWS Machine Learning Blog72

    GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用。GPT-6 Sol 面向复杂推理和编码任务,GPT-6 Luna 面向大规模重复性任务如信息提取和分类。

    推荐理由:原文给出了 GPT-6 Sol 和 Luna 的定位差异、价格对比 GPT-5.6 更低、提示词缓存功能,读者可以据此规划自己的模型使用策略。

  2. AWS Machine Learning Blog72

    Claude Opus 5.5 现已在 AWS 上可用

    Anthropic 最强 Opus 模型 Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,这是 Claude 5.5 家族的首个模型。

    推荐理由:原文给出了相比 Opus 5 的 token 效率提升、价格下降和安全分类器改进,读者可以据此判断是否值得切换。

9月16日周三
  1. NVIDIA Blog63

    NVIDIA CEO 黄仁勋在 Dreamforce 大会上宣布 Salesforce 推出首个 CRM 推理模型 Koa

    Salesforce 推出首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 构建,使用近 30 年企业 CRM 部署的专有合成数据集进行后训练。

    推荐理由:Koa 是首个 CRM 推理模型,在 CRM 基准测试中错误率降低 3 倍,且完全在 Salesforce 基础设施内运行、不使用客户数据,这对企业 AI 应用有参考价值。

9月10日周四
9月3日周四
  1. Hugging Face Blog63

    NeoMME:高效的多模态原生多语言编码器

    Hugging Face发布NeoMME,一个包含260M和800M参数的多语言多模态编码器系列。该模型不使用独立的预训练视觉塔或因果语言模型,而是用单一双向Transformer处理文本token和原始图像patch,通过masked discrete-diffusion目标从头训练。

    推荐理由:该模型展示了单一Transformer处理多模态的架构创新,在ViDoRe v3基准测试中以更小参数达到接近最优的nDCG@10,读者可了解新的多模态编码器设计思路。

9月1日周二
  1. Google Research78

    Google 发布 TimesFM-3 零样本多变量时间序列预测基础模型

    Google Research 发布 TimesFM-3,这是新一代零样本时间序列基础模型,专为多变量预测设计。模型拥有 3.3 亿参数,在超过 1 万亿时间点的真实和合成数据上预训练,支持多目标同时预测、过去协变量和过去-未来协变量。

    推荐理由:读者可通过本文了解时间序列预测的基础模型最新进展,以及多变量预测相比单变量预测的具体精度提升。

8月28日周五
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,带来场景扩展、首尾帧插值、360p 快速预览和 4K 超分辨率等创意控制功能。新模型支持最长 40 秒视频生成,可在 Google AI Studio 和 Agent Platform API 中使用,也可通过 Google AI Plus、Pro 和 Ultra 订阅在 Google Flow 中访问。

    推荐理由:提供了具体的性能提升数据和可用性信息,读者可以评估新模型对自己工作流的实际价值。

8月27日周四