跳到正文

#新模型

今日 0 条

一手 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月1日周四
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。

    推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。

9月30日周三
  1. AWS Machine Learning Blog73

    GPT-6.1 Sol 在 Amazon Bedrock 全面可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 全面可用,将更强的推理能力带入编码、计算机使用和专业工作负载。根据 OpenAI 的数据,该模型在 DeepSWE v1.1 上与 GPT-6 Astra 性能相当,但任务成本降低约五分之一;相比 GPT-6 Sol 最高分提升 6.4 个百分点。用户可通过 Amazon Bedrock 控制台或 API 接入使用。

    推荐理由:原文给出了与前代版本的成本和性能对比数据,读者可以据此判断新模型是否值得在生产环境中切换。

9月29日周二
  1. Hugging Face Blog76

    NVIDIA 发布 Kumo Tabular 表格预测基础模型

    NVIDIA 发布 Kumo Tabular,这是一个开源的表格预测基础模型,可对标注过的表格数据进行分类和回归预测,无需训练、调优或特征工程。

    推荐理由:该模型在四个表格预测基准测试中排名第一,性能优于调优后的梯度提升树和最新的表格基础模型,并提供三种参数规模供选择,可供读者判断其对现有机器学习工作流的潜在影响。

9月23日周三
  1. AWS Machine Learning Blog72

    GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用。GPT-6 Sol 面向复杂推理和编码任务,GPT-6 Luna 面向大规模重复性任务如信息提取和分类。

    推荐理由:原文给出了 GPT-6 Sol 和 Luna 的定位差异、价格对比 GPT-5.6 更低、提示词缓存功能,读者可以据此规划自己的模型使用策略。

  2. OpenAI News36

    OpenAI 发布 GPT-6 Sol 和 Luna

    OpenAI 推出 GPT-6 Sol 和 Luna 两款模型,提供前沿智能与不同的能力/成本平衡,专为日常工作场景设计。两款型号分别针对不同用户需求进行优化。

  3. AWS Machine Learning Blog72

    Claude Opus 5.5 现已在 AWS 上可用

    Anthropic 最强 Opus 模型 Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,这是 Claude 5.5 家族的首个模型。

    推荐理由:原文给出了相比 Opus 5 的 token 效率提升、价格下降和安全分类器改进,读者可以据此判断是否值得切换。

9月22日周二
9月21日周一
9月16日周三
  1. NVIDIA Blog63

    NVIDIA CEO 黄仁勋在 Dreamforce 大会上宣布 Salesforce 推出首个 CRM 推理模型 Koa

    Salesforce 推出首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 构建,使用近 30 年企业 CRM 部署的专有合成数据集进行后训练。

    推荐理由:Koa 是首个 CRM 推理模型,在 CRM 基准测试中错误率降低 3 倍,且完全在 Salesforce 基础设施内运行、不使用客户数据,这对企业 AI 应用有参考价值。

9月10日周四
9月9日周三
9月3日周四
  1. Hugging Face Blog63

    NeoMME:高效的多模态原生多语言编码器

    Hugging Face发布NeoMME,一个包含260M和800M参数的多语言多模态编码器系列。该模型不使用独立的预训练视觉塔或因果语言模型,而是用单一双向Transformer处理文本token和原始图像patch,通过masked discrete-diffusion目标从头训练。

    推荐理由:该模型展示了单一Transformer处理多模态的架构创新,在ViDoRe v3基准测试中以更小参数达到接近最优的nDCG@10,读者可了解新的多模态编码器设计思路。

9月1日周二
  1. Google Research78

    Google 发布 TimesFM-3 零样本多变量时间序列预测基础模型

    Google Research 发布 TimesFM-3,这是新一代零样本时间序列基础模型,专为多变量预测设计。模型拥有 3.3 亿参数,在超过 1 万亿时间点的真实和合成数据上预训练,支持多目标同时预测、过去协变量和过去-未来协变量。

    推荐理由:读者可通过本文了解时间序列预测的基础模型最新进展,以及多变量预测相比单变量预测的具体精度提升。

8月28日周五
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,带来场景扩展、首尾帧插值、360p 快速预览和 4K 超分辨率等创意控制功能。新模型支持最长 40 秒视频生成,可在 Google AI Studio 和 Agent Platform API 中使用,也可通过 Google AI Plus、Pro 和 Ultra 订阅在 Google Flow 中访问。

    推荐理由:提供了具体的性能提升数据和可用性信息,读者可以评估新模型对自己工作流的实际价值。

8月27日周四
8月25日周二
8月14日周五
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 推出 Gemini 3.7 Flash,这是其面向编码和智能体任务的工作主力模型。该模型在软件工程任务中实现显著提升,FrontierCode 1.1 Main 得分从 34.4% 提升至 43.6%,DeepSWE v1.1 从 49.0% 提升至 65.3%。

    推荐理由:原文给出了性能基准提升和价格信息,读者可以据此判断新模型是否值得在生产环境中使用。

8月12日周三
  1. Google DeepMind66

    Google DeepMind 发布 SL2T 手语转文本模型

    Google DeepMind 推出突破性的多语言手语转文本模型 SL2T,训练数据涵盖 50 多种手语超过 10 万小时。该模型首次将手语 AI 带入消费产品,已在 Gboard 和 Live Transcribe 的 Pixel 11 上线,支持美式手语转英语。

    推荐理由:首个将手语 AI 实际带入消费产品的突破,在 FLEURS-ASL 基准上实现了 70 BLEURT 的零样本成绩,可供读者了解当前手语 AI 的实际可用性。

8月11日周二
8月10日周一
  1. Hugging Face Blog75

    Meta 发布 Muse Glimmer:30B 参数本地代理多模态模型

    Meta 发布 Muse Glimmer,这是一款 30B 参数的多模态模型,从 Muse 蒸馏而来,采用 Apache 2.0 许可证开源,专为本地代理场景设计,支持图像、视频和代码处理。

    推荐理由:原文给出了模型架构细节、benchmark 对比和工具链支持,读者可以了解这个 30B 参数的多模态模型在本地代理场景下的能力定位。

8月6日周四
  1. Google DeepMind68

    Google DeepMind 发布 WeatherNext:AI 模型实现气旋预报突破

    Google DeepMind 发布 WeatherNext AI 天气预测模型,在 Nature 期刊发表的论文显示该模型在预测气旋路径、强度和风结构方面达到最高精度,平均可提供额外一天的预警时间,相当于十年气象进步。

    推荐理由:原文给出了具体性能提升数据(一天额外预警时间)和实际应用案例(2025年飓风Melissa预报),读者可以据此判断该模型在天气预报领域的能力边界。

7月30日周四
  1. Google DeepMind67

    Google DeepMind 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布最新音乐生成模型 Lyria 3.5,现已在 Google Flow Music 上线。该模型在音乐性、歌词质量、声乐表达和创意控制四个方面实现升级,包括更自然的复杂旋律结构、更高的提示词遵循度、更具情感表现力的歌声,以及更便捷的 tempo 和时长控制功能。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有音乐创作工作流。

7月21日周二
7月17日周五
  1. Google DeepMind64

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布基于 Gemini 3.5 Flash 的轻量级网络安全模型 3.5 Flash Cyber,通过 CodeMender 代理可多次调用以分析更多代码路径。

    推荐理由:原文给出了多个 benchmark 对比数据和 Google 内部实际应用案例,读者可以据此评估轻量级网络安全模型相对于大型模型的能力边界和实用价值。

7月15日周三
  1. Hugging Face Blog80

    Thinking Machines 发布 Inkling 大模型:1T 参数、1M 上下文、支持图像/音频/文本多模态输入

    Thinking Machines 发布开源多模态大模型 Inkling,参数总量 975B、激活 41B,支持图像、音频、文本三种模态输入,拥有 1M 上下文窗口,训练数据达 45T token。

    推荐理由:原文给出了完整的架构说明、基准测试对比和部署配置,读者可以据此判断该模型在多模态推理任务上的相对表现以及自身硬件能否部署。

7月9日周四
  1. Google Research62

    Google 发布 SensorFM:面向可穿戴健康数据的大型传感器基础模型

    Google Research 发布 SensorFM,一个在 5 百万人、超过 1 万亿分钟多模态传感器数据上预训练的大型基础模型。该模型通过自监督重建学习通用生理表征,在 35 项健康任务中 33 项超越监督基线,且无需任何任务特定架构。最大版本相比最小版本重构损失降低 31%,分类任务平均 AUC 提升 9%,回归任务 Pearson 系数提升 21%。

    推荐理由:原文给出了从2M到2B传感器小时、100K到100M参数的 Scaling 实验数据,读者可以据此判断规模对模型能力的实际影响。

7月8日周三
  1. Mistral AI56

    Mistral 发布 Robostral Navigate:8B 机器人导航模型

    Mistral 发布 Robostral Navigate,这是一款 8B 参数的机器人导航模型,仅使用单目 RGB 相机即可在复杂环境中自主导航,在 R2R-CE 基准测试的未见环境上达到 76.6% 成功率,优于多传感器方案 4.5 个百分点。模型结合指向式导航和强化学习,使用前缀缓存技术将训练 token 减少 22 倍,可适配轮式、足式和飞行机器人。

7月2日周四
  1. Mistral AI65

    Mistral AI 发布 Leanstral 1.5:面向所有人的形式化验证模型

    Mistral AI 发布 Leanstral 1.5,一个拥有 6B 活跃参数的 Apache-2.0 开源形式化验证模型。该模型在 miniF2F 上达到 100%,在 PutnamBench 上解决 587/672 道题目,在 FATE-H 上达到 87%、FATE-X 上达到 34%,均为 SOTA。

    推荐理由:原文给出了具体 benchmark 数字和 bug 发现案例,读者可据此评估该模型在形式化验证领域的能力和实用价值。

6月30日周二
  1. Google Research78

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google 发布 TabFM,一个面向表格数据分类和回归任务的基础模型。该模型将表格预测重新定义为上下文学习问题,通过混合注意力架构(交替行列注意力、行列压缩)在数百万人工合成数据集上训练,实现了真正的零样本预测——无需针对新数据集进行模型训练、超参数调优或特征工程。

    推荐理由:读者可通过本文了解 Google 如何将大语言模型的零样本能力迁移到结构化表格数据,理解其架构创新和实际可用性。

6月11日周四
  1. Google DeepMind80

    Google DeepMind 发布 DiffusionGemma:文本生成速度提升 4 倍

    Google DeepMind 发布 DiffusionGemma 实验模型,这是一款 26B MoE 开源模型(Apache 2.0 许可证),通过文本扩散技术实现并行生成而非传统自回归的逐 token 生成,在 NVIDIA H100 上可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,比标准 Gemma 4 快 4 倍。

    推荐理由:原文给出了性能对比数据和方法差异,读者可以据此判断 diffusion 文本生成是否适合自己的应用场景。

6月9日周二
  1. Google DeepMind75

    Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。

    推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。

5月22日周五
5月18日周一
  1. Google DeepMind79

    Google DeepMind 发布 Gemini Omni 模型,可从任意输入创建视频

    Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,可接受图像、音频、视频和文本作为输入,结合 Gemini 的现实世界知识生成高质量视频,并通过自然语言对话编辑视频。

    推荐理由:原文给出了新模型的能力特点和可用入口,读者可以据此了解视频生成领域的新进展。

5月16日周六
  1. Google DeepMind75

    Google 发布 Gemini 3.5:兼顾前沿智能与行动能力

    Google 正式发布 Gemini 3.5 系列首款模型 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等 agentic 和 coding 基准上达到前沿性能,输出速度是其他前沿模型的 4 倍。

    推荐理由:原文给出了 Terminal-Bench、GDPval-AA 等多个 agentic 和 coding 基准的具体分数,以及 4 倍速度提升的对比数据,读者可据此判断模型在复杂长程任务上的实际性能。

4月16日周四