#新模型
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#新模型
今日 0 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Google DeepMind精选AI 评分7979 Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
Google DeepMind 发布三款新 Gemini 模型:3.6 Flash 为主打模型,输出 token 减少 17% 且成本更低,在编码、知识工作和多模态任务上性能提升。
推荐理由:提供了 3.6 Flash 相比 3.5 Flash 在编码任务上输出 token 减少 17% 的具体数据,读者可据此评估成本效益变化。
Google DeepMind精选AI 评分6464 Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型
Google DeepMind 发布基于 Gemini 3.5 Flash 的轻量级网络安全模型 3.5 Flash Cyber,通过 CodeMender 代理可多次调用以分析更多代码路径。
推荐理由:原文给出了多个 benchmark 对比数据和 Google 内部实际应用案例,读者可以据此评估轻量级网络安全模型相对于大型模型的能力边界和实用价值。
Hugging Face Blog精选AI 评分8080 Thinking Machines 发布 Inkling 大模型:1T 参数、1M 上下文、支持图像/音频/文本多模态输入
Thinking Machines 发布开源多模态大模型 Inkling,参数总量 975B、激活 41B,支持图像、音频、文本三种模态输入,拥有 1M 上下文窗口,训练数据达 45T token。
推荐理由:原文给出了完整的架构说明、基准测试对比和部署配置,读者可以据此判断该模型在多模态推理任务上的相对表现以及自身硬件能否部署。
Google Research精选AI 评分6262 Google 发布 SensorFM:面向可穿戴健康数据的大型传感器基础模型
Google Research 发布 SensorFM,一个在 5 百万人、超过 1 万亿分钟多模态传感器数据上预训练的大型基础模型。该模型通过自监督重建学习通用生理表征,在 35 项健康任务中 33 项超越监督基线,且无需任何任务特定架构。最大版本相比最小版本重构损失降低 31%,分类任务平均 AUC 提升 9%,回归任务 Pearson 系数提升 21%。
推荐理由:原文给出了从2M到2B传感器小时、100K到100M参数的 Scaling 实验数据,读者可以据此判断规模对模型能力的实际影响。
Mistral AIAI 评分5656 Mistral 发布 Robostral Navigate:8B 机器人导航模型
Mistral 发布 Robostral Navigate,这是一款 8B 参数的机器人导航模型,仅使用单目 RGB 相机即可在复杂环境中自主导航,在 R2R-CE 基准测试的未见环境上达到 76.6% 成功率,优于多传感器方案 4.5 个百分点。模型结合指向式导航和强化学习,使用前缀缓存技术将训练 token 减少 22 倍,可适配轮式、足式和飞行机器人。
Mistral AI精选AI 评分6565 Mistral AI 发布 Leanstral 1.5:面向所有人的形式化验证模型
Mistral AI 发布 Leanstral 1.5,一个拥有 6B 活跃参数的 Apache-2.0 开源形式化验证模型。该模型在 miniF2F 上达到 100%,在 PutnamBench 上解决 587/672 道题目,在 FATE-H 上达到 87%、FATE-X 上达到 34%,均为 SOTA。
推荐理由:原文给出了具体 benchmark 数字和 bug 发现案例,读者可据此评估该模型在形式化验证领域的能力和实用价值。
Google Research精选AI 评分7878 Google 发布 TabFM:面向表格数据的零样本基础模型
Google 发布 TabFM,一个面向表格数据分类和回归任务的基础模型。该模型将表格预测重新定义为上下文学习问题,通过混合注意力架构(交替行列注意力、行列压缩)在数百万人工合成数据集上训练,实现了真正的零样本预测——无需针对新数据集进行模型训练、超参数调优或特征工程。
推荐理由:读者可通过本文了解 Google 如何将大语言模型的零样本能力迁移到结构化表格数据,理解其架构创新和实际可用性。
Google DeepMind精选AI 评分8080 Google DeepMind 发布 DiffusionGemma:文本生成速度提升 4 倍
Google DeepMind 发布 DiffusionGemma 实验模型,这是一款 26B MoE 开源模型(Apache 2.0 许可证),通过文本扩散技术实现并行生成而非传统自回归的逐 token 生成,在 NVIDIA H100 上可达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,比标准 Gemma 4 快 4 倍。
推荐理由:原文给出了性能对比数据和方法差异,读者可以据此判断 diffusion 文本生成是否适合自己的应用场景。
Google DeepMind精选AI 评分7575 Google DeepMind 发布 Gemma 4 12B:统一 encoder-free 多模态模型
Google DeepMind 发布 Gemma 4 12B,采用无编码器架构将视觉和音频输入直接整合到 LLM 主干,支持原生音频输入。性能接近更大的 26B MoE 模型,可在 16GB VRAM 的笔记本电脑上本地运行,已获 150 万次下载,发布于 Apache 2.0 许可证。
推荐理由:原文给出了架构变化(encoder-free)、性能对比(接近 26B MoE)、内存要求(16GB VRAM)和原生音频输入等具体信息,读者可以据此评估它与其他 Gemma 模型的定位差异。
Mistral AI精选AI 评分7272 Mistral 发布 Mistral Medium 3.5:128B 开源模型,支持云端远程编码代理
Mistral 发布新模型 Mistral Medium 3.5,这是一款 128B dense 模型,支持 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:原文给出了模型性能数据(77.6% on SWE-Bench Verified)和价格($1.5/$7.5 per million tokens),读者可以据此判断新模型在编码任务上的能力水平和成本效益。
Google DeepMind精选AI 评分7979 Google DeepMind 发布 Gemini Omni 模型,可从任意输入创建视频
Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,可接受图像、音频、视频和文本作为输入,结合 Gemini 的现实世界知识生成高质量视频,并通过自然语言对话编辑视频。
推荐理由:原文给出了新模型的能力特点和可用入口,读者可以据此了解视频生成领域的新进展。
Google DeepMind精选AI 评分7575 Google 发布 Gemini 3.5:兼顾前沿智能与行动能力
Google 正式发布 Gemini 3.5 系列首款模型 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等 agentic 和 coding 基准上达到前沿性能,输出速度是其他前沿模型的 4 倍。
推荐理由:原文给出了 Terminal-Bench、GDPval-AA 等多个 agentic 和 coding 基准的具体分数,以及 4 倍速度提升的对比数据,读者可据此判断模型在复杂长程任务上的实际性能。
Google DeepMind精选AI 评分7070 Google DeepMind 发布 Gemini 3.1 Flash TTS,带来更具表现力的 AI 语音生成能力
Google DeepMind 发布 Gemini 3.1 Flash TTS,这是一款新的文本转语音模型,在 Artificial Analysis TTS 基准测试中获得 1211 的 Elo 评分。
推荐理由:原文展示了具体性能数据(Elo 1211)和可用入口,读者可据此评估该模型在实际业务中的适用性。
Google DeepMind精选AI 评分7070 Google DeepMind 发布 Gemini Robotics-ER 1.6:增强实体推理赋能机器人任务
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其首个推理优先模型的重大升级版。该模型增强了空间推理和多视角理解能力,专门用于视觉与空间理解、任务规划和成功检测,并能原生调用工具如 Google Search、视觉语言动作模型或第三方函数。
推荐理由:原文给出了具体性能对比和新增的仪表读取功能,读者可以据此判断该模型在机器人实体推理场景中的具体提升和可用性。
Google DeepMind精选AI 评分7878 Google DeepMind 发布 Gemma 4:字面意义上最强大的开源模型
Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。
推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。
Mistral AI精选AI 评分7878 Mistral Small 4 发布:首个统一推理、指令和多模态能力的开源混合模型
Mistral 发布新模型 Mistral Small 4,这是首个统一推理(Magistral)、指令(Mistral Small)和多模态(Pixtral)能力的开源混合模型。
推荐理由:Mistral Small 4 首次将推理、指令、多模态能力统一在单一模型中,支持可配置的 reasoning_effort 参数,在基准测试中保持竞争力分数的同时输出更短,延迟降低 40%、吞吐量提升 3 倍。
Mistral AI精选AI 评分7272 Mistral AI 加入 NVIDIA Nemotron Coalition 并发布 Mistral Small 4
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,与 NVIDIA 合作共同开发开源前沿 AI 模型。同时发布 Mistral Small 4,供全球开发者、研究者和组织构建和定制 AI 应用。合作将结合 Mistral AI 的模型架构和 NVIDIA 的计算资源,目标是建立透明、可访问的全球 AI 基础。
推荐理由:给出了新模型的具体名称和开放入口,读者可以据此判断它对现有模型生态的补充价值。
Mistral AI精选AI 评分7474 Mistral 推出 Mistral OCR 3
Mistral 发布新的 OCR 模型 Mistral OCR 3,在表单、手写、复杂表格等文档上比 Mistral OCR 2 提升 74% 整体胜率,定价 $2/千页,Batch API 半价 $1/千页,可通过 API 或 Document AI Playground 使用。
推荐理由:原文给出了 74% 胜率提升和具体定价,读者可以据此判断新版 OCR 在性能和成本上的竞争力。
Mistral AI精选AI 评分8080 Mistral 发布 Mistral 3 系列模型,包含 Large 3 和 Ministral 3
Mistral 发布 Mistral 3 系列模型,包括三个小型密集模型(14B、8B、3B)和 Mistral Large 3。Mistral Large 3 采用稀疏混合专家架构,拥有 41B 活跃参数和 675B 总参数,在 LMArena 排行榜开源非推理模型中排名第二。
推荐理由:原文给出了新模型的能力变化、性能数据和合作信息,读者可以据此判断这个模型在开源生态中的位置以及对自己场景的适用性。
Mistral AI精选AI 评分7676 Mistral 发布 Voxtral 语音理解模型
Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,在基准测试中优于 Whisper large-v3、GPT-4o mini Transcribe 和 ElevenLabs Scribe,定价仅为 $0.001/分钟,不到竞品一半。模型支持 32k token 上下文,可处理最长 40 分钟音频,具备内置问答、摘要、多语言和函数调用能力。
推荐理由:原文给出了 Voxtral 在多个基准测试上的性能对比和定价信息,读者可以据此判断它在语音理解领域的能力位置和成本优势。
Mistral AI精选AI 评分7272 Mistral AI 发布首款推理模型 Magistral
Mistral AI 发布首款推理模型 Magistral,提供开源版 Small(24B 参数)和企业版 Medium 两个版本。Magistral Medium 在 AIME2024 得分 73.6%( majority voting @64 达 90%),Small 版本得分 70.7%。
推荐理由:给出了 AIME2024 基准测试的具体分数(73.6%/70.7%)和速度对比(10x),读者可据此评估该推理模型在同类中的相对性能。
Mistral AI精选AI 评分7777 Mistral AI 发布 Codestral Embed 首款代码专用嵌入模型
Mistral AI 发布首款代码专用嵌入模型 Codestral Embed,在 SWE-Bench、CodeSearchNet、Text2Code 等基准上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大 embedding 模型。
推荐理由:原文给出了与竞品的性能对比数据,读者可以据此判断该模型在代码检索场景中的实际适用性。
Mistral AI精选AI 评分7777 Mistral AI 与 All Hands AI 合作发布 Devstral
Mistral AI 推出 Devstral,这是一款用于软件工程任务的智能体大语言模型,在 SWE-Bench Verified 基准上达到 46.8%,超越此前开源 SOTA 模型超过 6 个百分点,并超过 GPT-4.1-mini 约 20%。
推荐理由:原文给出了 Devstral 在 SWE-Bench Verified 上的具体得分(46.8%)、可在单张 RTX 4090 上运行的信息以及 API 价格,读者可据此评估该模型的能力和部署门槛。
Mistral AI精选AI 评分7373 Mistral 发布 Medium 3 模型,主打高效能与低成本的 frontier 级别模型
Mistral AI 发布 Medium 3 模型,定位为兼顾 SOTA 性能与低成本的企业级模型。定价为每百万 token 输入 0.4 美元、输出 2 美元,约为 Claude Sonnet 3.7 成本的十分之一,在编码和多模态理解等专业场景表现接近更大更慢的模型,超越 Llama 4 Maverick 和 DeepSeek v3。
推荐理由:原文给出了具体定价($0.4/$2 per M token)和性能对比数据(90% Claude Sonnet 3.7、超越 Llama 4 Maverick),读者可以据此判断该模型在性能和成本上的具体表现。
Mistral AI精选AI 评分7777 Mistral Small 3.1 发布
Mistral AI 发布 Mistral Small 3.1,号称同类最佳模型。新模型在文本性能和多模态理解上有所提升,上下文窗口扩展至 128k token,推理速度达 150 tokens/s,优于 Gemma 3 和 GPT-4o Mini。模型基于 Apache 2.0 许可证开源,可在单张 RTX 4090 或 32GB RAM Mac 上运行。
推荐理由:原文给出了性能对比和推理速度数据,读者可以据此判断它在同类模型中的竞争力。