OpenAI 向 ChatGPT 免费和 Go 用户推送 GPT-6 Luna,付费用户切换至 GPT-6 Sol
OpenAI 宣布 GPT-6 开始向 ChatGPT 推送,Plus、Pro 等付费用户使用 GPT-6 Sol,免费和 Go 用户使用 GPT-6 Luna,分别替换此前的 GPT-5.6 版本。
推荐理由:报告给出了青少年安全评测里的具体回退项,用户可以据此判断免费版在敏感话题上的实际表现。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 宣布 GPT-6 开始向 ChatGPT 推送,Plus、Pro 等付费用户使用 GPT-6 Sol,免费和 Go 用户使用 GPT-6 Luna,分别替换此前的 GPT-5.6 版本。
推荐理由:报告给出了青少年安全评测里的具体回退项,用户可以据此判断免费版在敏感话题上的实际表现。
据 Scott Aaronson 整理,OpenAI 在顾问组推荐下一次性公开 372 项数学突破结果,其中包括 Subhash Khot 的唯一游戏猜想(UGC)证明、L=BPL、Fourier 变换整数乘法低于 O(n log n) 的新上界、Unitary Synthesis 问题的正面解答、Parity 不在 QAC0 等,部分配有 Lean 证书。
推荐理由:原文列出 372 项数学突破与所用算力、问题类型,可帮助读者判断新模型在深度推理上的实际边界。
GPT-6 在 ChatGPT 全球上线,并随附 Intelligent UI,提供更快响应以及可直接探索和使用的可视化与交互体验。
推荐理由:原文给出 GPT-6 在 ChatGPT 中全球上线并附带 Intelligent UI 的关键事实,读者可据此了解新模型与交互形态的落地范围。
Anthropic 发布 Claude Haiku 5.5,主打高吞吐、成本敏感型任务,是其迄今最便宜、最快、能力最强的小模型。
推荐理由:原文把新模型的价格、速度、子智能体定位和基准成绩一次性给出,方便对比 Haiku 4.5 与同级模型的取舍。
Mistral 发布 Mistral Large 4(ML4)公开预览,称其为 1 万亿参数、49B 激活参数的多模态模型,在 Mistral 自己的欧洲数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 从头训练,preview API 即日在 Mistral Studio 开放,权重计划于本月底发布。
推荐理由:原文给出 1T 总参数 / 49B 激活参数、训练规模与多项基准结果,可作为评估开源权重前沿模型多模态与智能体能力的参考。
Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。
推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。
Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数量 501B、激活 23B,面向编码、推理与智能体场景。模型在 23.8T token 上完成预训练,并在 10.5K 块 NVIDIA GB300 GPU 上用 4 周生成超 1 亿次 rollout 进行高算力强化学习。
推荐理由:原文给出模型规模、训练规模与推理效率数据,并承诺本月开源权重与技术报告,可作为西方开源前沿模型的参照基线。
德国 AI 公司 Aleph Alpha 发布开放权重大语言模型 Kolibri,总参数 78B、激活参数约 3.5B,采用混合专家架构,基于 Apache 2.0 许可证开源。
推荐理由:提供了模型的技术架构、性能数据、对比基准和可用入口,读者可以据此判断这个模型在德语场景和本地部署需求下的适用性。
Anthropic 发布 Claude Sonnet 5.5,输出速度快 30% 以上,单任务成本降低达 30%。在 Terminal-Bench 4.0 上从 10.3% 跃升至 70.6%,CursorBench 4.0 达 55.5%,仅比 Opus 5.5 低 2 分。
推荐理由:原文给出了 Claude Sonnet 5.5 在多项基准上的具体分数和与 Opus 5.5、GPT-6 Sol 的对比,以及成本和速度数据,读者可据此判断是否值得切换模型。
Microsoft Research 发布 RetroChimera,一种新的逆合成预测模型,已发表在 Nature 期刊上。该模型结合了 Transformer 架构的 R-SMILES 2 和图神经网络的 NeuralLoc 两个互补子模型,通过学习排序策略集成预测。
推荐理由:模型在盲测中获得了博士级化学家的偏好,且已开源并提供访问入口,读者可以亲自试用验证。
Google DeepMind 发布 WeatherNext 3,这是迄今最先进、最准确的全球天气 AI 模型。新模型使用实时卫星数据训练,每小时更新一次,分辨率 5-25 公里,比上一代 WeatherNext 2 清晰约 5 倍。
推荐理由:原文给出了具体的性能提升数据(CRPS 提升 60%/30%/10%),分辨率提升 5 倍,与上一代 WeatherNext 2 有明确对比,读者可以据此判断模型的实际进步幅度。
Google DeepMind发布Gemini 3.8 Flash和3.8 Flash Cyber两款新模型。3.8 Flash在DeepSWE v1.1基准上超越多数更大规模的frontier模型,在HLE-Verified上达54.9%,价格为每百万输入token 0.75美元、输出token 3.75美元。
推荐理由:原文给出了在软件工程、Agent任务和多步推理方面的具体性能提升数据和成本对比,读者可据此判断模型能力变化。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型。
推荐理由:通过知识蒸馏实现约 50 倍计算量降低,保持 97% 预测性能,为大规模病理研究提供更实用的工具。
Mistral 发布 Mistral Small 3,一款面向低延迟推理的 24B 参数模型,采用 Apache 2.0 协议开源,权重和指令调优版本同步开放下载。
推荐理由:Mistral 以 Apache 2.0 开源 24B 模型并对标更大模型,可作为本地部署与开源替代方案的参考。