跳到正文

#新模型

今日 0 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月3日周六
  1. Reddit · r/LocalLLaMA59

    LiquidAI 发布 LFM2.5-Encoder 250M/350M 多语言双向编码器

    LiquidAI 发布 LFM2.5-Encoder 350M 多语言双向编码器,基于 LFM2 架构,支持 15 种语言,可用于分类、标记、检索、重排序和语义相似度任务。上下文窗口 8k,支持 CPU 长上下文和 WebGPU 浏览器运行。在 NLI、释义、情感和多语言任务上表现强劲,推理速度与 ModernBERT 相当或更快。

  2. Reddit · r/LocalLLaMA59

    Unitree 发布 UnifoLM-WLA-1.0:6B 参数人形机器人模型支持 64 项任务

    Unitree 发布 UnifoLM-WLA-1.0,6B 参数,在约 2500 小时真实机器人数据上训练,可完成 64 项任务(10 项全身 + 54 项桌面)。支持并行夹爪和两种灵巧手,空间推理能力优于多数开源模型。架构基于 Qwen3-VL 的 UnifoLM-ER-1,结合光流、VQ-VAE 和 MMDiT,在 Unitree G1 机器人上演示了整理床铺、洗衣服、折叠衣物等任务。

10月2日周五
  1. Reddit · r/ChatGPT29

    GPT-6.1 Sol 评测:改进超出预期

    GPT-6.1 Sol 相比一周前发布的 GPT-6 有了显著改进,作者原本预期是小补丁,但几小时体验后认为对本地工作流已足够好。目前已支持 Work、Codex 和 API,Chat 模式即将推出。

  2. Reddit · r/LocalLLaMA41

    CalDec v1 发布:完全开源的个人助手决策模型

    个人开发者发布 CalDec v1,一款完全开源权重的决策模型,专注于本地化、隐私保护的个人助手场景。该模型通过小规模数据集微调开发,尽管作者无专业 ML 背景,但实验结果超出预期,已在特定任务中证明可用性。模型、数据集和训练配方均已开源发布。

  3. Reddit · r/ChatGPT23

    GPT-6.1 Sol 配额使用令人惊喜

    用户在"very high"模式下连续2天每小时启动项目,仅消耗18%的周配额,配额使用极低。对比此前 Astra 版本配额消耗极快,新版 Astra 已变得可用且成本可控。发帖者希望 AI 价格不要涨得太快,让普通用户能继续使用。

  4. Reddit · r/LocalLLaMA44

    K2 Horizon 模型与 IFM 团队 AMA 问答预告

    IFM(Institute of Foundation Models)发布 K2 Horizon 模型组,包含 6 个完全开源模型,参数规模覆盖 0.9B 至 375B。除模型权重外,团队还开源了训练数据、训练代码、中间检查点、训练日志和评估结果。AMA 活动将于 10 月 5 日周一举行,话题涵盖预训练、后训练、设备端小模型、MoVA 与稀疏注意力、部署策略等。

  5. Hacker News · 首页76

    Cloudflare 发布开源决策模型 Clef 和 Clef-flash,上线 RL 微调平台

    Cloudflare 发布两款决策模型 Clef 和 Clef-flash,均基于 Qwen 微调,支持文本和图像分类,在 Jev Decision Index 评估中领先。Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,均优于 Jev 的 524.1ms。两款模型已开源至 Hugging Face 并托管于 Workers AI,同时推出 RL 微调服务供客户定制。

    推荐理由:原文给出了与 Jev 的基准对比和延迟数据,读者可以判断决策模型在特定场景下是否比通用 LLM 更适合。

  6. TechCrunch · AI68

    AWS 发布开源决策模型 Strands Decider 2B

    AWS 基于千问(Qwen3.5-2B)发布了开源决策模型 Strands Decider 2B,可本地运行、主打低成本低延迟。该模型原型由工程师 Marc Brooker 在看到 TypeSafe 的 Jev 后开发,曾在 Jevbench 同规模模型中排名第一,后被 AWS 收编为 Strands Labs 产品。

10月1日周四
  1. Reddit · r/ChatGPT17

    ChatGPT Plus 用户无法使用 GPT-6.1-sol 模型

    有用户反映今早还能正常使用 Sol 6.1,但随后收到"unable to load messages"错误,重载后提示 GPT-6.1-sol 模型在使用 Codex 的 ChatGPT 账户上不被支持。每月$20的 ChatGPT Plus 订阅计划用户似乎已被排除在 Sol 6.1 之外。

  2. The Rundown AI65

    Gemini 4 Argon 发布,目标重返前沿

    Google 发布新前沿模型 Gemini 4 Argon,在 Google 测试的 19 个基准中于 13 个超越 GPT-6 Astra 和 Claude Opus 5.5,暂仅向特定网络安全团队开放。API 定价为每百万 token 2/10 美元,促销期后涨至 4/20 美元,具体推出时间未定。

  3. Reddit · r/MachineLearning57

    Gemini 4 Argon 100万 token 输出窗口:是范式转变还是营销噱头

    Gemini 4 Argon 突破性地将输出上限提升至 100万 token(约1400页),对比 Opus 5.5 和 Astra 的 12.8-30万 token。作者认为这能解决“context glue”导致的智能体工作流断裂问题,对大规模代码迁移、安全补丁和深度推理是重大解锁。但作者也指出,95% 日常场景并不需要这么大的输出窗口,并邀请专家讨论这个输出量级是否会导致逻辑崩坏。

  4. Hacker News · 首页67

    OpenAI 与 Synopsys 合作推出 GPT-Synopsys,专门用于芯片设计

    OpenAI 与 Synopsys 宣布战略合作,共同开发 GPT-Synopsys 专用模型,将 OpenAI 前沿模型与 Synopsys EDA 工具结合,使模型能够直接操作芯片设计工具、解释输出并迭代优化设计。该模型将运行在 OpenAI 基础设施上,与 Synopsys.ai 和 Autopilot 平台深度集成,早期技术合作已与多家领先半导体客户启动。

  5. TechCrunch · AI54

    Google 发布 Gemini 4 Argon,称其为最强模型

    Google 母公司 Alphabet 推出 Gemini 4 Argon,专为网络安全防御任务训练,能够自主发现、验证和修补关键软件漏洞,目前仅通过 Fairwind Program 向特定网络安全合作伙伴开放。Google 声称该模型在多项基准测试中显著超越 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Fable 与 Opus 模型,并已用于公司内部日常工作。

  6. Ars Technica · AI49

    Google 宣布 Gemini 4 Argon AI 模型,但尚不可用

    Google 发布新一代前沿模型 Gemini 4 Argon,专注于 coding、knowledge work 和 cybersecurity。Argon 在 DeepSWE v1.1 基准测试中达 77.9%,超越 GPT-6 Astra、Fable 5.1 和 Opus 5.5,并支持 100 万 token 输出限制。由于模型仍在限量测试阶段,Google 未公布 API 价格。

  7. Hacker News · 最佳81

    Google 发布 Gemini 4 Argon 旗舰模型

    Google 正式发布 Gemini 4 Argon 旗舰模型,定价为输入每百万 token 2 美元、输出每百万 token 10 美元,上下文窗口扩展至 100 万 token。

    推荐理由:原文披露了定价、多个基准测试分数和内部应用案例,读者可以据此评估该模型相对于前代和其他竞品的实际能力提升幅度。

  8. The Verge · AI78

    Google 发布 Gemini 4 Argon,称能力太强仅限"可信网络防御者"使用

    Google发布新模型Gemini 4 Argon,定位为前沿性能模型,涵盖软件工程、企业知识工作和网络安全防御领域。该模型基准测试优于OpenAI和Anthropic的竞品,但初期仅向特定"可信网络防御者"开放,Google正与美国政府合作进行发布前审查。Gemini 4 Argon已用于Google内部工作流,如大规模代码库迁移。

    推荐理由:原文给出了模型的能力定位和基准对比,读者可以据此了解Google新模型在行业中的相对位置。

  9. Google DeepMind77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。

    推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。

9月30日周三
  1. Latent Space80

    OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol 等新品,ChatGPT 周活达 12 亿

    OpenAI 在 2026 DevDay 上发布语音智能体 Dots、GPT-6.1 Sol(定价为 Astra 的五分之一)、Ultrafast 加速模式(最高 8 倍提速)和 Decisions API,同时推出 ChatGPT Spaces 和企业市场。

    推荐理由:原文提供了 OpenAI DevDay 2026 的完整产品矩阵和行业关键事件(Anthropic IPO、NVIDIA 收购 Hugging Face),读者可据此了解当下 AI 竞争格局的全景。

  2. Reddit · r/ChatGPT41

    ChatGPT Plus 与 Claude Pro 20美元订阅对比:GPT-6.1 Sol 能否改变游戏规则?

    一项针对 GPT-6.1 Sol XHigh 与 Claude Opus 5.5 Medium 的对比评测显示,前者每任务消耗配额比后者高约 40%,速度却慢 2.5-6 倍(中位延迟 157s vs 21s)。虽然两者 AA 智能评级相同,但 10% Codex 5 小时配额仅对应约 7.3% Claude 配额。作者最终决定保留 Claude Pro,考虑取消 ChatGPT Plus。

  3. AWS Machine Learning Blog73

    GPT-6.1 Sol 在 Amazon Bedrock 全面可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 全面可用,将更强的推理能力带入编码、计算机使用和专业工作负载。根据 OpenAI 的数据,该模型在 DeepSWE v1.1 上与 GPT-6 Astra 性能相当,但任务成本降低约五分之一;相比 GPT-6 Sol 最高分提升 6.4 个百分点。用户可通过 Amazon Bedrock 控制台或 API 接入使用。

    推荐理由:原文给出了与前代版本的成本和性能对比数据,读者可以据此判断新模型是否值得在生产环境中切换。

  4. TechCrunch · AI81

    OpenAI 发布 GPT-6.1 Sol,性能接近 GPT-6 Astra 且价格更低

    OpenAI 在 DevDay 上发布了 GPT-6.1 Sol,仅在一周前推出了 GPT-6 Sol。该模型在编码、计算机使用和专业工作方面达到了 GPT-6 Astra 几乎相同的智能水平,但标准输入和输出 token 价格仅为五分之一。

    推荐理由:它以五分之一的价格提供了接近最高版本的能力,读者可据此评估是否值得升级。

  5. Product Hunt · AI 分类64

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二个模型。该模型面向日常工作场景(编码、修复 bug、文档、演示文稿和设计),运行速度比 Sonnet 5 快 30% 以上,任务成本降低高达 30%,编码和知识工作性能更强。

    推荐理由:给出了30%性能提升和成本降低的具体数据,读者可据此评估是否值得切换到新版本。

9月29日周二
  1. Hacker News · 首页55

    Jeeves:基于 Qwen3.5-9B 的推理决策模型

    Jeeves 是基于 Qwen3.5-9B 的决策模型,使用 SFT 和 CISPO 训练,配备块-4 扩散起草器。在 MMLU 上达到 0.793,MMLU-Pro 达到 0.739。通过扩散起草器实现 1.6-1.76 倍推理加速,批处理时可达约 960 链 token/秒。模型现已开源,提供完整的训练和推理代码。

  2. Hacker News · 最佳76

    Fireworks 发布 Ember-1:基于 Kimi K3 的高效推理模型

    Fireworks Research 发布 Ember-1 模型,基于 Kimi K3 通过训练减少不必要推理过程,实现相同质量下 token 消耗降低 40%。

    推荐理由:原文给出了 Ember-1 在多个 benchmark 上的具体 token 节省比例和分数对比,读者可以据此评估这个专门优化模型的实际效果。

  3. Hugging Face Blog76

    NVIDIA 发布 Kumo Tabular 表格预测基础模型

    NVIDIA 发布 Kumo Tabular,这是一个开源的表格预测基础模型,可对标注过的表格数据进行分类和回归预测,无需训练、调优或特征工程。

    推荐理由:该模型在四个表格预测基准测试中排名第一,性能优于调优后的梯度提升树和最新的表格基础模型,并提供三种参数规模供选择,可供读者判断其对现有机器学习工作流的潜在影响。

  4. Ben's Bites36

    Claude Sonnet 5.5 值得一试

    Anthropic 发布 Claude Sonnet 5.5,基于基准测试表现接近 Opus 5.5,编程能力与 Opus 5.5 相当,图像和图表理解能力有大幅提升。$20 计划用户可尝试在高思考模式下用 Sonnet 5.5 替换部分 Opus 任务。Anthropic 有将 .5 版本 Sonnet 模型打磨良好的传统。

  5. Reddit · r/LocalLLaMA38

    Ornith-1.5 DFlash

    Ornith-1.5 系列推出三款 DFlash 变体,均采用 DFlash draft model 进行投机解码优化。Ornith-1.5-9B-DFlash 为轻量版本,Ornith-1.5-397B-DFlash 为超大参数版本,Ornith-1.5-35B-A3B-DFlash 采用 35B 参数配合 3B 辅助模型。