#新模型
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#新模型
今日 0 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Latent SpaceAI 评分1919 Latent Space AINews 2026年10月1-2日:AI领域动态汇总
OpenAI发布GPT-6.1 Sol,定价每百万token输入2美元、输出10美元,比Astra便宜81%,在DeepSWE v1.1上比GPT-6 Sol高6.4分。Sonnet 5.5首次亮相即进入Agent Arena前三,在Chat类别排名第一。Anthropic模型目前占据Agent Arena前三名。
Reddit · r/LocalLLaMAAI 评分5959 LiquidAI 发布 LFM2.5-Encoder 250M/350M 多语言双向编码器
LiquidAI 发布 LFM2.5-Encoder 350M 多语言双向编码器,基于 LFM2 架构,支持 15 种语言,可用于分类、标记、检索、重排序和语义相似度任务。上下文窗口 8k,支持 CPU 长上下文和 WebGPU 浏览器运行。在 NLI、释义、情感和多语言任务上表现强劲,推理速度与 ModernBERT 相当或更快。
Reddit · r/LocalLLaMAAI 评分5959 Unitree 发布 UnifoLM-WLA-1.0:6B 参数人形机器人模型支持 64 项任务
Unitree 发布 UnifoLM-WLA-1.0,6B 参数,在约 2500 小时真实机器人数据上训练,可完成 64 项任务(10 项全身 + 54 项桌面)。支持并行夹爪和两种灵巧手,空间推理能力优于多数开源模型。架构基于 Qwen3-VL 的 UnifoLM-ER-1,结合光流、VQ-VAE 和 MMDiT,在 Unitree G1 机器人上演示了整理床铺、洗衣服、折叠衣物等任务。
Reddit · r/LocalLLaMAAI 评分6464 开发者开源专注二战信息的小语言模型 Peacebell
作者在过去 11 个月里从零构建了一个专注于二战信息的领域专用小语言模型,提供 291M 和 148M 参数两个版本,使用自定义训练流程和基于维基百科的合成数据。模型已开源,可在 HuggingFace Spaces 体验 demo,并配有专用的二战主题基准测试。下一版本预计 2027 年发布。
Reddit · r/LocalLLaMAAI 评分6868 Microsoft 发布 FrogNano-4B-2609:面向低配置 GPU 的智能体模型
Microsoft 发布 FrogNano-4B-2609智能体模型,定位为「GPU poor」用户可用的代码模型。该模型基于 Qwen3.5-4B,经过针对仓库级软件工程的额外后训练,采用强化学习在约 1500 个合成 SWE 任务环境中训练,使用 Leaf 框架和可执行测试奖励。
The DecoderAI 评分6666 Cloudflare 发布 Clef 和 Clef-flash 决策模型,可替代人工处理 AI 智能体决策
Cloudflare 发布 Clef 和 Clef-flash 两款决策模型,专为 AI 智能体设计,用于自动化决策场景如客户支持工单分类和路由。Clef-flash 延迟 39ms,Clef 延迟 209ms,均显著快于竞品 Jev 的 524ms;Clef 在 43 项基准测试中准确率也最高。
Reddit · r/ChatGPTAI 评分2929 GPT-6.1 Sol 评测:改进超出预期
GPT-6.1 Sol 相比一周前发布的 GPT-6 有了显著改进,作者原本预期是小补丁,但几小时体验后认为对本地工作流已足够好。目前已支持 Work、Codex 和 API,Chat 模式即将推出。
Reddit · r/LocalLLaMAAI 评分4141 CalDec v1 发布:完全开源的个人助手决策模型
个人开发者发布 CalDec v1,一款完全开源权重的决策模型,专注于本地化、隐私保护的个人助手场景。该模型通过小规模数据集微调开发,尽管作者无专业 ML 背景,但实验结果超出预期,已在特定任务中证明可用性。模型、数据集和训练配方均已开源发布。
Reddit · r/ChatGPTAI 评分2323 GPT-6.1 Sol 配额使用令人惊喜
用户在"very high"模式下连续2天每小时启动项目,仅消耗18%的周配额,配额使用极低。对比此前 Astra 版本配额消耗极快,新版 Astra 已变得可用且成本可控。发帖者希望 AI 价格不要涨得太快,让普通用户能继续使用。
Reddit · r/LocalLLaMAAI 评分4444 K2 Horizon 模型与 IFM 团队 AMA 问答预告
IFM(Institute of Foundation Models)发布 K2 Horizon 模型组,包含 6 个完全开源模型,参数规模覆盖 0.9B 至 375B。除模型权重外,团队还开源了训练数据、训练代码、中间检查点、训练日志和评估结果。AMA 活动将于 10 月 5 日周一举行,话题涵盖预训练、后训练、设备端小模型、MoVA 与稀疏注意力、部署策略等。
Hacker News · 首页精选AI 评分7676 Cloudflare 发布开源决策模型 Clef 和 Clef-flash,上线 RL 微调平台
Cloudflare 发布两款决策模型 Clef 和 Clef-flash,均基于 Qwen 微调,支持文本和图像分类,在 Jev Decision Index 评估中领先。Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,均优于 Jev 的 524.1ms。两款模型已开源至 Hugging Face 并托管于 Workers AI,同时推出 RL 微调服务供客户定制。
推荐理由:原文给出了与 Jev 的基准对比和延迟数据,读者可以判断决策模型在特定场景下是否比通用 LLM 更适合。
Reddit · r/LocalLLaMAAI 评分4343 Yandex AliceAI-80B-A3B 指令微调版本训练进展更新 #2
作者对 Yandex AliceAI-80B-A3B 基础模型进行指令微调,使用合成蒸馏数据集训练约 48 小时,平均损失稳步下降。计划发布 gguf quants 版本和 llama.cpp 本地运行补丁,并将开源蒸馏引擎 SFTMill,后续继续用强化学习扩展训练。
TechCrunch · AIAI 评分6868 AWS 发布开源决策模型 Strands Decider 2B
AWS 基于千问(Qwen3.5-2B)发布了开源决策模型 Strands Decider 2B,可本地运行、主打低成本低延迟。该模型原型由工程师 Marc Brooker 在看到 TypeSafe 的 Jev 后开发,曾在 Jevbench 同规模模型中排名第一,后被 AWS 收编为 Strands Labs 产品。
Reddit · r/ChatGPTAI 评分1717 ChatGPT Plus 用户无法使用 GPT-6.1-sol 模型
有用户反映今早还能正常使用 Sol 6.1,但随后收到"unable to load messages"错误,重载后提示 GPT-6.1-sol 模型在使用 Codex 的 ChatGPT 账户上不被支持。每月$20的 ChatGPT Plus 订阅计划用户似乎已被排除在 Sol 6.1 之外。
The Rundown AIAI 评分6565 Gemini 4 Argon 发布,目标重返前沿
Google 发布新前沿模型 Gemini 4 Argon,在 Google 测试的 19 个基准中于 13 个超越 GPT-6 Astra 和 Claude Opus 5.5,暂仅向特定网络安全团队开放。API 定价为每百万 token 2/10 美元,促销期后涨至 4/20 美元,具体推出时间未定。
Reddit · r/MachineLearningAI 评分5757 Gemini 4 Argon 100万 token 输出窗口:是范式转变还是营销噱头
Gemini 4 Argon 突破性地将输出上限提升至 100万 token(约1400页),对比 Opus 5.5 和 Astra 的 12.8-30万 token。作者认为这能解决“context glue”导致的智能体工作流断裂问题,对大规模代码迁移、安全补丁和深度推理是重大解锁。但作者也指出,95% 日常场景并不需要这么大的输出窗口,并邀请专家讨论这个输出量级是否会导致逻辑崩坏。
Hacker News · 首页AI 评分6767 OpenAI 与 Synopsys 合作推出 GPT-Synopsys,专门用于芯片设计
OpenAI 与 Synopsys 宣布战略合作,共同开发 GPT-Synopsys 专用模型,将 OpenAI 前沿模型与 Synopsys EDA 工具结合,使模型能够直接操作芯片设计工具、解释输出并迭代优化设计。该模型将运行在 OpenAI 基础设施上,与 Synopsys.ai 和 Autopilot 平台深度集成,早期技术合作已与多家领先半导体客户启动。
Latent SpaceAI 评分7474 Google DeepMind 发布 Gemini 4 Argon:对标 Astra/Fable,首支持 1M token 输出
Google DeepMind 发布 Gemini 4 Argon,在 19 个基准测试中取得 13 个第一,首创 1M token 输出限制(通过 Long Decode Continuation 技术实现)。
Reddit · r/ChatGPTAI 评分1010 如何让 Sol 5.6 停止用列表格式写小说
Sol 5.6 写小说时总是使用列表格式,即使提示使用段落也只能维持一小段时间。用户反映这种作答方式不仅冗长,质量也随之下降。该问题仅影响 Plus 订阅用户,且 5.5 版本即将被移除。
TechCrunch · AIAI 评分5454 Google 发布 Gemini 4 Argon,称其为最强模型
Google 母公司 Alphabet 推出 Gemini 4 Argon,专为网络安全防御任务训练,能够自主发现、验证和修补关键软件漏洞,目前仅通过 Fairwind Program 向特定网络安全合作伙伴开放。Google 声称该模型在多项基准测试中显著超越 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Fable 与 Opus 模型,并已用于公司内部日常工作。
Ars Technica · AIAI 评分4949 Google 宣布 Gemini 4 Argon AI 模型,但尚不可用
Google 发布新一代前沿模型 Gemini 4 Argon,专注于 coding、knowledge work 和 cybersecurity。Argon 在 DeepSWE v1.1 基准测试中达 77.9%,超越 GPT-6 Astra、Fable 5.1 和 Opus 5.5,并支持 100 万 token 输出限制。由于模型仍在限量测试阶段,Google 未公布 API 价格。
Hacker News · 最佳精选AI 评分8181 Google 发布 Gemini 4 Argon 旗舰模型
Google 正式发布 Gemini 4 Argon 旗舰模型,定价为输入每百万 token 2 美元、输出每百万 token 10 美元,上下文窗口扩展至 100 万 token。
推荐理由:原文披露了定价、多个基准测试分数和内部应用案例,读者可以据此评估该模型相对于前代和其他竞品的实际能力提升幅度。
The Verge · AI精选AI 评分7878 Google 发布 Gemini 4 Argon,称能力太强仅限"可信网络防御者"使用
Google发布新模型Gemini 4 Argon,定位为前沿性能模型,涵盖软件工程、企业知识工作和网络安全防御领域。该模型基准测试优于OpenAI和Anthropic的竞品,但初期仅向特定"可信网络防御者"开放,Google正与美国政府合作进行发布前审查。Gemini 4 Argon已用于Google内部工作流,如大规模代码库迁移。
推荐理由:原文给出了模型的能力定位和基准对比,读者可以据此了解Google新模型在行业中的相对位置。
Google DeepMind精选AI 评分7777 Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。
推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。
Reddit · r/LocalLLaMAAI 评分5959 北京人工智能研究院发布 AREX-2:基于 Qwen3.8 的 27B 参数长程 Agent 模型
北京人工智能研究院(BAAI)发布 AREX-2,这是一款 27B 参数的长程 Agent 模型,基于 Qwen3.8 架构。该模型通过多轮测试时间推理实现自我改进:提议、测量、反思和修订。
Latent Space精选AI 评分8080 OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol 等新品,ChatGPT 周活达 12 亿
OpenAI 在 2026 DevDay 上发布语音智能体 Dots、GPT-6.1 Sol(定价为 Astra 的五分之一)、Ultrafast 加速模式(最高 8 倍提速)和 Decisions API,同时推出 ChatGPT Spaces 和企业市场。
推荐理由:原文提供了 OpenAI DevDay 2026 的完整产品矩阵和行业关键事件(Anthropic IPO、NVIDIA 收购 Hugging Face),读者可据此了解当下 AI 竞争格局的全景。
Hacker News · 首页AI 评分7575 PSSA:从零编写的非 Transformer 语言模型
PSSA 是一种使用塑料状态空间架构的语言模型,不是 Transformer。它通过递归状态空间层逐 token 阅读文本,维护一个情景记忆库,并在运行中重写部分权重。
Reddit · r/artificialAI 评分6565 PSSA:一种新型状态空间模型在参数匹配条件下超越 Transformer
研究者从头构建了 PSSA(Plastic State Space Architecture)架构,并在相同语料、相同 12.7M tokens、相同分词器和训练计划下与参数匹配的 Transformer 基线对比。
Reddit · r/ChatGPTAI 评分4141 ChatGPT Plus 与 Claude Pro 20美元订阅对比:GPT-6.1 Sol 能否改变游戏规则?
一项针对 GPT-6.1 Sol XHigh 与 Claude Opus 5.5 Medium 的对比评测显示,前者每任务消耗配额比后者高约 40%,速度却慢 2.5-6 倍(中位延迟 157s vs 21s)。虽然两者 AA 智能评级相同,但 10% Codex 5 小时配额仅对应约 7.3% Claude 配额。作者最终决定保留 Claude Pro,考虑取消 ChatGPT Plus。
AWS Machine Learning Blog精选AI 评分7373 GPT-6.1 Sol 在 Amazon Bedrock 全面可用
GPT-6.1 Sol 现已在 Amazon Bedrock 全面可用,将更强的推理能力带入编码、计算机使用和专业工作负载。根据 OpenAI 的数据,该模型在 DeepSWE v1.1 上与 GPT-6 Astra 性能相当,但任务成本降低约五分之一;相比 GPT-6 Sol 最高分提升 6.4 个百分点。用户可通过 Amazon Bedrock 控制台或 API 接入使用。
推荐理由:原文给出了与前代版本的成本和性能对比数据,读者可以据此判断新模型是否值得在生产环境中切换。
The DecoderAI 评分7272 OpenAI 发布 GPT-6.1 Sol:价格仅 Astra 五分之一,性能接近
OpenAI 发布新模型 GPT-6.1 Sol,作为因安全问题推迟发布的旗舰模型 Astra 的低成本替代品。API 定价为输入 token 每百万 2 美元、输出 token 每百万 10 美元,约为 Astra 成本的五分之一。
TechCrunch · AI精选AI 评分8181 OpenAI 发布 GPT-6.1 Sol,性能接近 GPT-6 Astra 且价格更低
OpenAI 在 DevDay 上发布了 GPT-6.1 Sol,仅在一周前推出了 GPT-6 Sol。该模型在编码、计算机使用和专业工作方面达到了 GPT-6 Astra 几乎相同的智能水平,但标准输入和输出 token 价格仅为五分之一。
推荐理由:它以五分之一的价格提供了接近最高版本的能力,读者可据此评估是否值得升级。
Hacker News · 首页AI 评分5656 OpenAI 发布 GPT 6.1 Sol:以五分之一价格实现接近 Astra 的智能
OpenAI 发布新模型 GPT 6.1 Sol,定位为接近 Astra 级别的智能,但价格仅为原来的五分之一。
Product Hunt · AI 分类精选AI 评分6464 Anthropic 发布 Claude Sonnet 5.5
Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二个模型。该模型面向日常工作场景(编码、修复 bug、文档、演示文稿和设计),运行速度比 Sonnet 5 快 30% 以上,任务成本降低高达 30%,编码和知识工作性能更强。
推荐理由:给出了30%性能提升和成本降低的具体数据,读者可据此评估是否值得切换到新版本。
Hacker News · 首页AI 评分5555 Jeeves:基于 Qwen3.5-9B 的推理决策模型
Jeeves 是基于 Qwen3.5-9B 的决策模型,使用 SFT 和 CISPO 训练,配备块-4 扩散起草器。在 MMLU 上达到 0.793,MMLU-Pro 达到 0.739。通过扩散起草器实现 1.6-1.76 倍推理加速,批处理时可达约 960 链 token/秒。模型现已开源,提供完整的训练和推理代码。
Hacker News · 最佳精选AI 评分7676 Fireworks 发布 Ember-1:基于 Kimi K3 的高效推理模型
Fireworks Research 发布 Ember-1 模型,基于 Kimi K3 通过训练减少不必要推理过程,实现相同质量下 token 消耗降低 40%。
推荐理由:原文给出了 Ember-1 在多个 benchmark 上的具体 token 节省比例和分数对比,读者可以据此评估这个专门优化模型的实际效果。
Hugging Face Blog精选AI 评分7676 NVIDIA 发布 Kumo Tabular 表格预测基础模型
NVIDIA 发布 Kumo Tabular,这是一个开源的表格预测基础模型,可对标注过的表格数据进行分类和回归预测,无需训练、调优或特征工程。
推荐理由:该模型在四个表格预测基准测试中排名第一,性能优于调优后的梯度提升树和最新的表格基础模型,并提供三种参数规模供选择,可供读者判断其对现有机器学习工作流的潜在影响。
Ben's BitesAI 评分3636 Claude Sonnet 5.5 值得一试
Anthropic 发布 Claude Sonnet 5.5,基于基准测试表现接近 Opus 5.5,编程能力与 Opus 5.5 相当,图像和图表理解能力有大幅提升。$20 计划用户可尝试在高思考模式下用 Sonnet 5.5 替换部分 Opus 任务。Anthropic 有将 .5 版本 Sonnet 模型打磨良好的传统。
The Rundown AIAI 评分7070 Anthropic 发布中端模型 Claude Sonnet 5.5,性能接近 Opus 价格减半
Anthropic 发布 Claude Sonnet 5.5,这是其新的 5.5 家族中的中端模型,比 Opus 快 30%,在知识工作和编码方面比上一代有重大提升,在某些测试中以一半的价格接近 Opus 性能。
Reddit · r/LocalLLaMAAI 评分3838 Ornith-1.5 DFlash
Ornith-1.5 系列推出三款 DFlash 变体,均采用 DFlash draft model 进行投机解码优化。Ornith-1.5-9B-DFlash 为轻量版本,Ornith-1.5-397B-DFlash 为超大参数版本,Ornith-1.5-35B-A3B-DFlash 采用 35B 参数配合 3B 辅助模型。