#新模型
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#新模型
今日 0 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Google DeepMind精选AI 评分7777 Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。
推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。
AWS Machine Learning Blog精选AI 评分7373 GPT-6.1 Sol 在 Amazon Bedrock 全面可用
GPT-6.1 Sol 现已在 Amazon Bedrock 全面可用,将更强的推理能力带入编码、计算机使用和专业工作负载。根据 OpenAI 的数据,该模型在 DeepSWE v1.1 上与 GPT-6 Astra 性能相当,但任务成本降低约五分之一;相比 GPT-6 Sol 最高分提升 6.4 个百分点。用户可通过 Amazon Bedrock 控制台或 API 接入使用。
推荐理由:原文给出了与前代版本的成本和性能对比数据,读者可以据此判断新模型是否值得在生产环境中切换。
Hugging Face Blog精选AI 评分7676 NVIDIA 发布 Kumo Tabular 表格预测基础模型
NVIDIA 发布 Kumo Tabular,这是一个开源的表格预测基础模型,可对标注过的表格数据进行分类和回归预测,无需训练、调优或特征工程。
推荐理由:该模型在四个表格预测基准测试中排名第一,性能优于调优后的梯度提升树和最新的表格基础模型,并提供三种参数规模供选择,可供读者判断其对现有机器学习工作流的潜在影响。
OpenAI NewsAI 评分4444 GPT-6 如何改进提示词缓存
GPT-6 改进了提示词缓存机制,提供更高的缓存命中率、新的诊断工具、显式断点和成本控制功能。这些改进可降低推理延迟和使用成本。
AWS Machine Learning Blog精选AI 评分7272 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用。GPT-6 Sol 面向复杂推理和编码任务,GPT-6 Luna 面向大规模重复性任务如信息提取和分类。
推荐理由:原文给出了 GPT-6 Sol 和 Luna 的定位差异、价格对比 GPT-5.6 更低、提示词缓存功能,读者可以据此规划自己的模型使用策略。
OpenAI NewsAI 评分3636 OpenAI 发布 GPT-6 Sol 和 Luna
OpenAI 推出 GPT-6 Sol 和 Luna 两款模型,提供前沿智能与不同的能力/成本平衡,专为日常工作场景设计。两款型号分别针对不同用户需求进行优化。
AWS Machine Learning Blog精选AI 评分7272 Claude Opus 5.5 现已在 AWS 上可用
Anthropic 最强 Opus 模型 Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,这是 Claude 5.5 家族的首个模型。
推荐理由:原文给出了相比 Opus 5 的 token 效率提升、价格下降和安全分类器改进,读者可以据此判断是否值得切换。
OpenAI NewsAI 评分1717 GPT‑6 Astra 将研究时间和成本减半
GPT‑6 Astra 帮助 Parallel 的 AI 智能体将劳动力市场数据的研究与合成时间缩短一半,成本降低一半。相比之前的模型,效率提升一倍。
OpenAI NewsAI 评分3939 V7 成本降低 78% 同时 GPT-5.6 Luna 准确率提升
V7 使用 GPT-5.6 Luna 将分散的公司文件转化为上下文,使智能体能够完成复杂的源链接工作。该版本成本降低 78% 同时准确率提升。
NVIDIA Blog精选AI 评分6363 NVIDIA CEO 黄仁勋在 Dreamforce 大会上宣布 Salesforce 推出首个 CRM 推理模型 Koa
Salesforce 推出首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 构建,使用近 30 年企业 CRM 部署的专有合成数据集进行后训练。
推荐理由:Koa 是首个 CRM 推理模型,在 CRM 基准测试中错误率降低 3 倍,且完全在 Salesforce 基础设施内运行、不使用客户数据,这对企业 AI 应用有参考价值。
OpenAI NewsAI 评分4040 OpenAI 发布 ChatGPT for Financial Services
OpenAI 推出 ChatGPT for Financial Services,内置金融数据并集成 GPT-6 Astra 模型。该产品支持金融研究、建模及客户材料生成。
OpenAI News精选AI 评分6767 OpenAI 在 API 中推出 GPT‑Live‑1,实现更自然的语音体验
GPT‑Live‑1 将自然全双工语音对话能力引入 API,具备更强的指令遵循、定制语音和电话支持功能。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
OpenAI NewsAI 评分4444 GPT-6 Astra 发布:面向工作场景的下一代智能模型
OpenAI 发布 GPT-6 Astra,这是其面向商业应用的最强模型,具备高级推理和计算机使用能力,同时在写作和设计判断力方面有显著提升。
Hugging Face Blog精选AI 评分6363 NeoMME:高效的多模态原生多语言编码器
Hugging Face发布NeoMME,一个包含260M和800M参数的多语言多模态编码器系列。该模型不使用独立的预训练视觉塔或因果语言模型,而是用单一双向Transformer处理文本token和原始图像patch,通过masked discrete-diffusion目标从头训练。
推荐理由:该模型展示了单一Transformer处理多模态的架构创新,在ViDoRe v3基准测试中以更小参数达到接近最优的nDCG@10,读者可了解新的多模态编码器设计思路。
OpenAI NewsAI 评分1616 Legora 借助 GPT-6 Astra 分钟级审查 41 份文档,发现全部 4 个植入错误
GPT-6 Astra 驱动的 Legora 在金融审查工作流中分钟级审查了 41 份文档,成功找出全部 4 个植入的错误,性能提升近 40%。这是 GPT-6 Astra 能力的具体应用展示。
OpenAI NewsAI 评分3030 Playco 用 GPT-6 Astra 原型设计游戏,手动修复减少 50%
Playco 使用 GPT-6 Astra 从同一灰盒基础构建了三个主题游戏原型,报告手动修复比之前的模型减少 50%。该测试展示了 GPT-6 Astra 在游戏原型设计场景中的效率提升。
Google Research精选AI 评分7878 Google 发布 TimesFM-3 零样本多变量时间序列预测基础模型
Google Research 发布 TimesFM-3,这是新一代零样本时间序列基础模型,专为多变量预测设计。模型拥有 3.3 亿参数,在超过 1 万亿时间点的真实和合成数据上预训练,支持多目标同时预测、过去协变量和过去-未来协变量。
推荐理由:读者可通过本文了解时间序列预测的基础模型最新进展,以及多变量预测相比单变量预测的具体精度提升。
Google DeepMind精选AI 评分7676 Google DeepMind 发布 Gemini Omni 1.1 Flash
Google DeepMind 发布 Gemini Omni 1.1 Flash,带来场景扩展、首尾帧插值、360p 快速预览和 4K 超分辨率等创意控制功能。新模型支持最长 40 秒视频生成,可在 Google AI Studio 和 Agent Platform API 中使用,也可通过 Google AI Plus、Pro 和 Ultra 订阅在 Google Flow 中访问。
推荐理由:提供了具体的性能提升数据和可用性信息,读者可以评估新模型对自己工作流的实际价值。
Google ResearchAI 评分4848 Google 发布 GlucoFM:用于连续血糖监测的基础模型
Google 推出 GlucoFM,一种自监督双流基础模型,可将缓慢血糖趋势与短期偏离分离,在 14 项队列-任务评估中平均 PR-AUC 较最佳 GluFormer 变体提升 5.8 个百分点。
Google DeepMind精选AI 评分7474 Google 发布 Gemini 3.5 Transcribe 语音转文字模型
Google 发布 Gemini 3.5 Transcribe语音转文字模型,支持实时流式和预录制音频两种模式,通过 Gemini API (Google AI Studio) 和 Enterprise Agent Platform 提供。
推荐理由:给出了具体的 WER 数值和延迟改善比例,读者可以直接对比评估它的实际性能。
Hugging Face BlogAI 评分5050 Granite 4.2 推理模型如何构建
IBM 发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个规模,从 Granite-4.1 基模型后训练而来。Granite-4.1 使用约 15T tokens 预训练,五阶段策略扩展至 512K 上下文。
Google DeepMind精选AI 评分7979 Google DeepMind 发布 Gemini 3.7 Flash
Google DeepMind 推出 Gemini 3.7 Flash,这是其面向编码和智能体任务的工作主力模型。该模型在软件工程任务中实现显著提升,FrontierCode 1.1 Main 得分从 34.4% 提升至 43.6%,DeepSWE v1.1 从 49.0% 提升至 65.3%。
推荐理由:原文给出了性能基准提升和价格信息,读者可以据此判断新模型是否值得在生产环境中使用。
Google DeepMind精选AI 评分6666 Google DeepMind 发布 SL2T 手语转文本模型
Google DeepMind 推出突破性的多语言手语转文本模型 SL2T,训练数据涵盖 50 多种手语超过 10 万小时。该模型首次将手语 AI 带入消费产品,已在 Gboard 和 Live Transcribe 的 Pixel 11 上线,支持美式手语转英语。
推荐理由:首个将手语 AI 实际带入消费产品的突破,在 FLEURS-ASL 基准上实现了 70 BLEURT 的零样本成绩,可供读者了解当前手语 AI 的实际可用性。
Hugging Face BlogAI 评分5757 NVIDIA Magpie TTS 多语言语音模型发布:支持 12 种语言、32ms 首次音频延迟
NVIDIA 发布 Magpie TTS 多语言语音合成模型,364M 参数支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言。
Hugging Face Blog精选AI 评分7575 Meta 发布 Muse Glimmer:30B 参数本地代理多模态模型
Meta 发布 Muse Glimmer,这是一款 30B 参数的多模态模型,从 Muse 蒸馏而来,采用 Apache 2.0 许可证开源,专为本地代理场景设计,支持图像、视频和代码处理。
推荐理由:原文给出了模型架构细节、benchmark 对比和工具链支持,读者可以了解这个 30B 参数的多模态模型在本地代理场景下的能力定位。
Google DeepMind精选AI 评分6868 Google DeepMind 发布 WeatherNext:AI 模型实现气旋预报突破
Google DeepMind 发布 WeatherNext AI 天气预测模型,在 Nature 期刊发表的论文显示该模型在预测气旋路径、强度和风结构方面达到最高精度,平均可提供额外一天的预警时间,相当于十年气象进步。
推荐理由:原文给出了具体性能提升数据(一天额外预警时间)和实际应用案例(2025年飓风Melissa预报),读者可以据此判断该模型在天气预报领域的能力边界。
Google DeepMind精选AI 评分6767 Google DeepMind 发布 Lyria 3.5 音乐生成模型
Google DeepMind 发布最新音乐生成模型 Lyria 3.5,现已在 Google Flow Music 上线。该模型在音乐性、歌词质量、声乐表达和创意控制四个方面实现升级,包括更自然的复杂旋律结构、更高的提示词遵循度、更具情感表现力的歌声,以及更便捷的 tempo 和时长控制功能。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有音乐创作工作流。
Google DeepMind精选AI 评分7979 Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash 为主打模型,输出 token 减少 17% 且成本更低,在编码、知识工作和多模态任务上性能提升。
推荐理由:提供了 3.6 Flash 相比 3.5 Flash 在编码任务上输出 token 减少 17% 的具体数据,读者可据此评估成本效益变化。
Google DeepMind精选AI 评分6464 Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型
Google DeepMind 发布基于 Gemini 3.5 Flash 的轻量级网络安全模型 3.5 Flash Cyber,通过 CodeMender 代理可多次调用以分析更多代码路径。
推荐理由:原文给出了多个 benchmark 对比数据和 Google 内部实际应用案例,读者可以据此评估轻量级网络安全模型相对于大型模型的能力边界和实用价值。
Hugging Face Blog精选AI 评分8080 Thinking Machines 发布 Inkling 大模型:1T 参数、1M 上下文、支持图像/音频/文本多模态输入
Thinking Machines 发布开源多模态大模型 Inkling,参数总量 975B、激活 41B,支持图像、音频、文本三种模态输入,拥有 1M 上下文窗口,训练数据达 45T token。
推荐理由:原文给出了完整的架构说明、基准测试对比和部署配置,读者可以据此判断该模型在多模态推理任务上的相对表现以及自身硬件能否部署。
Google Research精选AI 评分6262 Google 发布 SensorFM:面向可穿戴健康数据的大型传感器基础模型
Google Research 发布 SensorFM,一个在 5 百万人、超过 1 万亿分钟多模态传感器数据上预训练的大型基础模型。该模型通过自监督重建学习通用生理表征,在 35 项健康任务中 33 项超越监督基线,且无需任何任务特定架构。最大版本相比最小版本重构损失降低 31%,分类任务平均 AUC 提升 9%,回归任务 Pearson 系数提升 21%。
推荐理由:原文给出了从2M到2B传感器小时、100K到100M参数的 Scaling 实验数据,读者可以据此判断规模对模型能力的实际影响。
Mistral AIAI 评分5656 Mistral 发布 Robostral Navigate:8B 机器人导航模型
Mistral 发布 Robostral Navigate,这是一款 8B 参数的机器人导航模型,仅使用单目 RGB 相机即可在复杂环境中自主导航,在 R2R-CE 基准测试的未见环境上达到 76.6% 成功率,优于多传感器方案 4.5 个百分点。模型结合指向式导航和强化学习,使用前缀缓存技术将训练 token 减少 22 倍,可适配轮式、足式和飞行机器人。
Mistral AI精选AI 评分6565 Mistral AI 发布 Leanstral 1.5:面向所有人的形式化验证模型
Mistral AI 发布 Leanstral 1.5,一个拥有 6B 活跃参数的 Apache-2.0 开源形式化验证模型。该模型在 miniF2F 上达到 100%,在 PutnamBench 上解决 587/672 道题目,在 FATE-H 上达到 87%、FATE-X 上达到 34%,均为 SOTA。
推荐理由:原文给出了具体 benchmark 数字和 bug 发现案例,读者可据此评估该模型在形式化验证领域的能力和实用价值。
Google Research精选AI 评分7878 Google 发布 TabFM:面向表格数据的零样本基础模型
Google 发布 TabFM,一个面向表格数据分类和回归任务的基础模型。该模型将表格预测重新定义为上下文学习问题,通过混合注意力架构(交替行列注意力、行列压缩)在数百万人工合成数据集上训练,实现了真正的零样本预测——无需针对新数据集进行模型训练、超参数调优或特征工程。
推荐理由:读者可通过本文了解 Google 如何将大语言模型的零样本能力迁移到结构化表格数据,理解其架构创新和实际可用性。
Google DeepMind精选AI 评分8080 Google DeepMind 发布 DiffusionGemma:文本生成速度提升 4 倍
Google DeepMind 发布 DiffusionGemma 实验模型,这是一款 26B MoE 开源模型(Apache 2.0 许可证),通过文本扩散技术实现并行生成而非传统自回归的逐 token 生成,在 NVIDIA H100 上可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,比标准 Gemma 4 快 4 倍。
推荐理由:原文给出了性能对比数据和方法差异,读者可以据此判断 diffusion 文本生成是否适合自己的应用场景。
Google DeepMind精选AI 评分7575 Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型
Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。
推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。
Mistral AI精选AI 评分7272 Mistral 发布 Mistral Medium 3.5:128B 开源模型,支持云端远程编码代理
Mistral 发布新模型 Mistral Medium 3.5,这是一款 128B dense 模型,支持 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:原文给出了模型性能数据(77.6% on SWE-Bench Verified)和价格($1.5/$7.5 per million tokens),读者可以据此判断新模型在编码任务上的能力水平和成本效益。
Google DeepMind精选AI 评分7979 Google DeepMind 发布 Gemini Omni 模型,可从任意输入创建视频
Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,可接受图像、音频、视频和文本作为输入,结合 Gemini 的现实世界知识生成高质量视频,并通过自然语言对话编辑视频。
推荐理由:原文给出了新模型的能力特点和可用入口,读者可以据此了解视频生成领域的新进展。
Google DeepMind精选AI 评分7575 Google 发布 Gemini 3.5:兼顾前沿智能与行动能力
Google 正式发布 Gemini 3.5 系列首款模型 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等 agentic 和 coding 基准上达到前沿性能,输出速度是其他前沿模型的 4 倍。
推荐理由:原文给出了 Terminal-Bench、GDPval-AA 等多个 agentic 和 coding 基准的具体分数,以及 4 倍速度提升的对比数据,读者可据此判断模型在复杂长程任务上的实际性能。
Google DeepMind精选AI 评分7070 Google DeepMind 发布 Gemini 3.1 Flash TTS,带来更具表现力的 AI 语音生成能力
Google DeepMind 发布 Gemini 3.1 Flash TTS,这是一款新的文本转语音模型,在 Artificial Analysis TTS 基准测试中获得 1211 的 Elo 评分。
推荐理由:原文展示了具体性能数据(Elo 1211)和可用入口,读者可据此评估该模型在实际业务中的适用性。