#新模型
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#新模型
今日 0 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分4040 qwen3.8-flash-next 在 4x R9700 上的初步测试
在4x R9700显卡上测试qwen3.8-flash-next模型用于AI智能体编码用例,单流推理速度达150+t/s,并发3-5流时保持约100t/s,预填充速度超过10k+t/s。用户表示速度和生成质量均超出预期。
Reddit · r/LocalLLaMA精选AI 评分7676 NVIDIA 发布 Nemotron-Labs-3-Competitive-Coding:在 IOI 2026 超越人类最高分
NVIDIA 发布 Nemotron-Labs-3-Competitive-Coding,这是一款竞赛编程专用模型,基于 Nemotron-3-Ultra-550B 微调。
推荐理由:原文给出了模型在 IOI 2026 的具体得分和排名,读者可以据此了解当前 AI 编程能力的边界。
Hacker News · 最佳精选AI 评分8080 Anthropic 发布 Claude Sonnet 5.5
Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 系列的第二款模型。相比 Sonnet 5,性能提升超过 30%,成本降低最高达 30%。
推荐理由:原文给出了性能提升、基准测试分数和价格信息,读者可以据此判断它与前代的实际差距以及是否值得切换。
Reddit · r/MachineLearningAI 评分5959 InternLM 团队发布 Intern-Decision 多模态模型系列
发布了 Intern-Decision 多模态模型系列(0.8B、2B、4B),其中 4B 模型在性能上优于 Jev 1.13.0。在 RTX 4090 上实测本地部署可达到约 30 FPS 的决策调用速度。团队还建立了基准测试来评估校准性能,在掷骰子和蒙特霍尔问题等经典概率场景中,该模型的预测分布比 Jev 更接近黄金分布。
Ben's BitesAI 评分5454 AI 周报:Claude Opus 5.5 发布,GPT-6 Luna/Sol 降价 50%
Claude 发布 Opus 5.5,被称为「统一模型」,Codee 5小时限制提升20%。OpenAI 推出 GPT-6 Luna 和 Sol,价格较前代降低50%(Luna $0.10/$0.50,Sol $2/$10 per M tokens),但智能提升幅度较小。
The Rundown AIAI 评分1818 AI 行业 pacing 时代首个发布日:Anthropic 与 OpenAI 90分钟内相继发布新模型
Anthropic 发布 Claude Opus 5.5,在 AA Intelligence Index 达到 58 分超越前代及 GPT-6 Astra,价格降低 40%;OpenAI 同步推出 GPT-6 Sol 和 Luna,价格仅为前代一半(Luna $0.10/$0.50 per M,Sol $2/$10),两家公司发布间隔仅 90 分钟。
Latent SpaceAI 评分7575 Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 Luna
Anthropic 发布 Claude Opus 5.5,这是新 Claude 5.5 家族的首款模型,性能达到 Fable 5.1 水平但运行成本降低 40%、速度提升 30%。
Simon WillisonAI 评分7373 Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna 发布,新一轮价格战开启
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna。GPT-6 Luna 定价仅为 $0.10/M 输入、$0.50/M 输出,较 GPT-5.6 Luna 降价 50%;GPT-6 Sol 同样较前代降价 50%。
OpenAI NewsAI 评分4444 GPT-6 如何改进提示词缓存
GPT-6 改进了提示词缓存机制,提供更高的缓存命中率、新的诊断工具、显式断点和成本控制功能。这些改进可降低推理延迟和使用成本。
AWS Machine Learning Blog精选AI 评分7272 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用。GPT-6 Sol 面向复杂推理和编码任务,GPT-6 Luna 面向大规模重复性任务如信息提取和分类。
推荐理由:原文给出了 GPT-6 Sol 和 Luna 的定位差异、价格对比 GPT-5.6 更低、提示词缓存功能,读者可以据此规划自己的模型使用策略。
OpenAI NewsAI 评分3636 OpenAI 发布 GPT-6 Sol 和 Luna
OpenAI 推出 GPT-6 Sol 和 Luna 两款模型,提供前沿智能与不同的能力/成本平衡,专为日常工作场景设计。两款型号分别针对不同用户需求进行优化。
AWS Machine Learning Blog精选AI 评分7272 Claude Opus 5.5 现已在 AWS 上可用
Anthropic 最强 Opus 模型 Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,这是 Claude 5.5 家族的首个模型。
推荐理由:原文给出了相比 Opus 5 的 token 效率提升、价格下降和安全分类器改进,读者可以据此判断是否值得切换。
OpenAI NewsAI 评分1717 GPT‑6 Astra 将研究时间和成本减半
GPT‑6 Astra 帮助 Parallel 的 AI 智能体将劳动力市场数据的研究与合成时间缩短一半,成本降低一半。相比之前的模型,效率提升一倍。
Latent SpaceAI 评分7575 小米发布 MiMo-V2.6-Pro:1T 参数开源多模态模型,训练成本约 300 万美元
小米发布 MiMo-V2.6-Pro 开源多模态模型,总参数 1.02T、活跃参数 42B,训练成本约 300 万美元。该模型在 Artificial Analysis 智能指数上以 46 分位居开源模型榜首。
Simon WillisonAI 评分6262 TypeSafe AI 发布 Jev:新型决策模型,输出为数值而非文本
TypeSafe AI 发布 Jev 决策模型,接受文本输入但输出浮点数而非文本,支持三类问题(是/否、选择、评分)。定价为输入 $0.042/million tokens,输出免费,比 GPT-5 Nano 更便宜。作者指出其适合分类任务如垃圾检测、搜索重排序,但缺乏可解释性可能导致偏见问题,社区已出现开源复现和创意用例。
Latent SpaceAI 评分5757 Jev:面向生产环境的 System One 模型 — TypeSafe AI CEO 访谈
TypeSafe AI CEO Diogo Almeida 在访谈中阐述了他对当前 AI 发展路径的批判,认为 RLHF 导致了模型幻觉、谄媚和對人类的永久依赖。
OpenAI NewsAI 评分3939 V7 成本降低 78% 同时 GPT-5.6 Luna 准确率提升
V7 使用 GPT-5.6 Luna 将分散的公司文件转化为上下文,使智能体能够完成复杂的源链接工作。该版本成本降低 78% 同时准确率提升。
Latent SpaceAI 评分5151 TypeSafe 发布 Jev:专注决策/分类/路由的 System One Model,速度提升超 100 倍
TypeSafe 发布新模型 Jev,定位为“System One Model”,专注于决策、分类、路由和评分而非文本生成。Jev 速度比小型前沿 LLM 快 100 倍以上,成本低 200 倍以上,采用 RLCD(校准决策强化学习)训练,输出 token 免费。多家媒体认为该模型适合替代生产系统中作为结构化分类器、评判器或路由策略的 LLM,以降低不必要的自回归生成开销。
NVIDIA Blog精选AI 评分6363 NVIDIA CEO 黄仁勋在 Dreamforce 大会上宣布 Salesforce 推出首个 CRM 推理模型 Koa
Salesforce 推出首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 构建,使用近 30 年企业 CRM 部署的专有合成数据集进行后训练。
推荐理由:Koa 是首个 CRM 推理模型,在 CRM 基准测试中错误率降低 3 倍,且完全在 Salesforce 基础设施内运行、不使用客户数据,这对企业 AI 应用有参考价值。
OpenAI NewsAI 评分4040 OpenAI 发布 ChatGPT for Financial Services
OpenAI 推出 ChatGPT for Financial Services,内置金融数据并集成 GPT-6 Astra 模型。该产品支持金融研究、建模及客户材料生成。
OpenAI News精选AI 评分6767 OpenAI 在 API 中推出 GPT‑Live‑1,实现更自然的语音体验
GPT‑Live‑1 将自然全双工语音对话能力引入 API,具备更强的指令遵循、定制语音和电话支持功能。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
OpenAI NewsAI 评分4444 GPT-6 Astra 发布:面向工作场景的下一代智能模型
OpenAI 发布 GPT-6 Astra,这是其面向商业应用的最强模型,具备高级推理和计算机使用能力,同时在写作和设计判断力方面有显著提升。
Ben's BitesAI 评分5353 GPT-6 家族首个模型 Astra 发布
OpenAI 发布 GPT-6 家族首个模型 Astra,在 ARC-AGI-3 和 Zapier AutomationBench 取得最高分,但作者体验认为它是"展示马"而非"工作马",不稳定。
The Rundown AIAI 评分7070 OpenAI 发布 GPT-6 Astra,Greg Brockman 称"欢迎来到 AGI 时代"
OpenAI 发布新模型 GPT-6 Astra,称之为"世界上最具智能和对齐的模型"。该模型在 ARC-AGI-3 基准上达到 99.9%(此前 GPT-5.6 Sol 为 7.8%),FrontierMath T4 达 98%,ExploitBench 网络安全测试达 100%。
Hugging Face Blog精选AI 评分6363 NeoMME:高效的多模态原生多语言编码器
Hugging Face发布NeoMME,一个包含260M和800M参数的多语言多模态编码器系列。该模型不使用独立的预训练视觉塔或因果语言模型,而是用单一双向Transformer处理文本token和原始图像patch,通过masked discrete-diffusion目标从头训练。
推荐理由:该模型展示了单一Transformer处理多模态的架构创新,在ViDoRe v3基准测试中以更小参数达到接近最优的nDCG@10,读者可了解新的多模态编码器设计思路。
OpenAI NewsAI 评分1616 Legora 借助 GPT-6 Astra 分钟级审查 41 份文档,发现全部 4 个植入错误
GPT-6 Astra 驱动的 Legora 在金融审查工作流中分钟级审查了 41 份文档,成功找出全部 4 个植入的错误,性能提升近 40%。这是 GPT-6 Astra 能力的具体应用展示。
OpenAI NewsAI 评分3030 Playco 用 GPT-6 Astra 原型设计游戏,手动修复减少 50%
Playco 使用 GPT-6 Astra 从同一灰盒基础构建了三个主题游戏原型,报告手动修复比之前的模型减少 50%。该测试展示了 GPT-6 Astra 在游戏原型设计场景中的效率提升。
The Rundown AIAI 评分6565 Meta 与 Google 相继发布新模型,加入九月 AI 发布潮
Meta 发布 Muse Spark 1.3,在人工智能指数得分 62,Zuckerberg 称其“便宜到几乎无法计量”,并预告更大模型代号“Watermelon”。Google 发布 Gemini 3.8 Flash,得分 59,延续 3.7 的定价,DeepMind 承认 Gemini 仍“略低于前沿”。
The Rundown AIAI 评分6969 Anthropic 发布 Claude Fable 5.1,结束前沿模型安静期
Anthropic 发布 Claude Fable 5.1,在 AA Intelligence Index 创下 66 分纪录,科学研究测试得分是 Fable 5 的两倍以上。安全过滤器在网络安全工作中减少 60% 干预,基础医学和生物学问题中减少 85%。Anthropic 同时发布限制更少的 Mythos 5.1,仅向通过审查的美国网络安全和生物学研究人员开放。
Google Research精选AI 评分7878 Google 发布 TimesFM-3 零样本多变量时间序列预测基础模型
Google Research 发布 TimesFM-3,这是新一代零样本时间序列基础模型,专为多变量预测设计。模型拥有 3.3 亿参数,在超过 1 万亿时间点的真实和合成数据上预训练,支持多目标同时预测、过去协变量和过去-未来协变量。
推荐理由:读者可通过本文了解时间序列预测的基础模型最新进展,以及多变量预测相比单变量预测的具体精度提升。
Google DeepMind精选AI 评分7676 Google DeepMind 发布 Gemini Omni 1.1 Flash
Google DeepMind 发布 Gemini Omni 1.1 Flash,带来场景扩展、首尾帧插值、360p 快速预览和 4K 超分辨率等创意控制功能。新模型支持最长 40 秒视频生成,可在 Google AI Studio 和 Agent Platform API 中使用,也可通过 Google AI Plus、Pro 和 Ultra 订阅在 Google Flow 中访问。
推荐理由:提供了具体的性能提升数据和可用性信息,读者可以评估新模型对自己工作流的实际价值。
Google ResearchAI 评分4848 Google 发布 GlucoFM:用于连续血糖监测的基础模型
Google 推出 GlucoFM,一种自监督双流基础模型,可将缓慢血糖趋势与短期偏离分离,在 14 项队列-任务评估中平均 PR-AUC 较最佳 GluFormer 变体提升 5.8 个百分点。
Google DeepMind精选AI 评分7474 Google 发布 Gemini 3.5 Transcribe 语音转文字模型
Google 发布 Gemini 3.5 Transcribe语音转文字模型,支持实时流式和预录制音频两种模式,通过 Gemini API (Google AI Studio) 和 Enterprise Agent Platform 提供。
推荐理由:给出了具体的 WER 数值和延迟改善比例,读者可以直接对比评估它的实际性能。
Hugging Face BlogAI 评分5050 Granite 4.2 推理模型如何构建
IBM 发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个规模,从 Granite-4.1 基模型后训练而来。Granite-4.1 使用约 15T tokens 预训练,五阶段策略扩展至 512K 上下文。
Google DeepMind精选AI 评分7979 Google DeepMind 发布 Gemini 3.7 Flash
Google DeepMind 推出 Gemini 3.7 Flash,这是其面向编码和智能体任务的工作主力模型。该模型在软件工程任务中实现显著提升,FrontierCode 1.1 Main 得分从 34.4% 提升至 43.6%,DeepSWE v1.1 从 49.0% 提升至 65.3%。
推荐理由:原文给出了性能基准提升和价格信息,读者可以据此判断新模型是否值得在生产环境中使用。
Google DeepMind精选AI 评分6666 Google DeepMind 发布 SL2T 手语转文本模型
Google DeepMind 推出突破性的多语言手语转文本模型 SL2T,训练数据涵盖 50 多种手语超过 10 万小时。该模型首次将手语 AI 带入消费产品,已在 Gboard 和 Live Transcribe 的 Pixel 11 上线,支持美式手语转英语。
推荐理由:首个将手语 AI 实际带入消费产品的突破,在 FLEURS-ASL 基准上实现了 70 BLEURT 的零样本成绩,可供读者了解当前手语 AI 的实际可用性。
Hugging Face BlogAI 评分5757 NVIDIA Magpie TTS 多语言语音模型发布:支持 12 种语言、32ms 首次音频延迟
NVIDIA 发布 Magpie TTS 多语言语音合成模型,364M 参数支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言。
Hugging Face Blog精选AI 评分7575 Meta 发布 Muse Glimmer:30B 参数本地代理多模态模型
Meta 发布 Muse Glimmer,这是一款 30B 参数的多模态模型,从 Muse 蒸馏而来,采用 Apache 2.0 许可证开源,专为本地代理场景设计,支持图像、视频和代码处理。
推荐理由:原文给出了模型架构细节、benchmark 对比和工具链支持,读者可以了解这个 30B 参数的多模态模型在本地代理场景下的能力定位。
Google DeepMind精选AI 评分6868 Google DeepMind 发布 WeatherNext:AI 模型实现气旋预报突破
Google DeepMind 发布 WeatherNext AI 天气预测模型,在 Nature 期刊发表的论文显示该模型在预测气旋路径、强度和风结构方面达到最高精度,平均可提供额外一天的预警时间,相当于十年气象进步。
推荐理由:原文给出了具体性能提升数据(一天额外预警时间)和实际应用案例(2025年飓风Melissa预报),读者可以据此判断该模型在天气预报领域的能力边界。
Google DeepMind精选AI 评分6767 Google DeepMind 发布 Lyria 3.5 音乐生成模型
Google DeepMind 发布最新音乐生成模型 Lyria 3.5,现已在 Google Flow Music 上线。该模型在音乐性、歌词质量、声乐表达和创意控制四个方面实现升级,包括更自然的复杂旋律结构、更高的提示词遵循度、更具情感表现力的歌声,以及更便捷的 tempo 和时长控制功能。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有音乐创作工作流。