#模型发布
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#模型发布
今日 12 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条量子位 QbitAIAI 评分7575 Claude Haiku 5.5发布:跑分与价格对标GPT-6 Luna,支持五档effort调节
Anthropic发布Claude Haiku 5.5,官方跑分逐项超过GPT-6 Luna,并超越DeepSeek-V4.1 Flash和GLM-5.3-Flash。
量子位 QbitAI精选AI 评分8282 OpenAI 向 ChatGPT 免费和 Go 用户推送 GPT-6 Luna,付费用户切换至 GPT-6 Sol
OpenAI 宣布 GPT-6 开始向 ChatGPT 推送,Plus、Pro 等付费用户使用 GPT-6 Sol,免费和 Go 用户使用 GPT-6 Luna,分别替换此前的 GPT-5.6 版本。
推荐理由:报告给出了青少年安全评测里的具体回退项,用户可以据此判断免费版在敏感话题上的实际表现。
Reddit · r/artificialAI 评分1818 AI 应用是否会开始为日常工作训练专用模型?
随着近期模型发布,面向特定工作的专用模型训练受到关注,Genspark 曾通过 Fireworks 对 MiniMax M3 后训练以推出 Gen-1 Slides。作者认为,更多成熟 AI 应用可能为高频、重复收费的任务训练模型,但需要足够使用量、效果评估方法和持续维护能力,并不意味着每个应用都需要训练团队。
Simon WillisonAI 评分6262 Anthropic 发布 Claude Haiku 5.5 快速低成本模型
Anthropic 发布快速低成本模型 Claude Haiku 5.5,定价与 OpenAI GPT-6 Luna 相同,为 0.10 美元/百万 token 输入和 0.50 美元/百万 token 输出,超过 100k token 后升至 0.50 美元和 2.50 美元。
Hacker News · 首页精选AI 评分8383 OpenAI 一次发布 372 项数学证明,包括唯一游戏猜想
据 Scott Aaronson 整理,OpenAI 在顾问组推荐下一次性公开 372 项数学突破结果,其中包括 Subhash Khot 的唯一游戏猜想(UGC)证明、L=BPL、Fourier 变换整数乘法低于 O(n log n) 的新上界、Unitary Synthesis 问题的正面解答、Parity 不在 QAC0 等,部分配有 Lean 证书。
推荐理由:原文列出 372 项数学突破与所用算力、问题类型,可帮助读者判断新模型在深度推理上的实际边界。
The DecoderAI 评分6262 OpenAI 推出 GPT-6,ChatGPT 改为图表按钮和迷你应用等交互界面输出
OpenAI 向所有 ChatGPT 用户推出 GPT-6,并新增 Intelligent UI 功能,让回答以图形、按钮、图表和表单等交互界面形式呈现,根据问题自动调整布局,例如对比类问题并排展示、解释类问题转为可交互图表,聊天中还可直接内嵌小型工具。
The DecoderAI 评分7575 Anthropic 发布 Claude Haiku 5.5:比上代便宜最多 90%,知识与计算机使用基准大幅提升
Anthropic 发布 Claude Haiku 5.5,定位高速低成本小模型,面向摘要、数据库查询、分类和实时客服等高吞吐任务。
OpenAI News精选AI 评分7979 OpenAI 在 ChatGPT 全球推出 GPT-6 与 Intelligent UI
GPT-6 在 ChatGPT 全球上线,并随附 Intelligent UI,提供更快响应以及可直接探索和使用的可视化与交互体验。
推荐理由:原文给出 GPT-6 在 ChatGPT 中全球上线并附带 Intelligent UI 的关键事实,读者可据此了解新模型与交互形态的落地范围。
TechCrunch · AIAI 评分6969 OpenAI 随 GPT-6 推出 Intelligent UI,ChatGPT 对话加入大量可交互视觉组件
OpenAI 周三随 GPT-6 发布新功能 Intelligent UI,让 ChatGPT 对话中加入可交互按钮、定制计算器、交互图表、可编辑图形等视觉组件。
Reddit · r/LocalLLaMAAI 评分3737 Liquid AI 发布 Open d1:面向决策任务的开源权重多模态模型
Liquid AI 发布开源权重决策模型 Open d1,包含 3B 参数的 d1-3B(文本+视觉)和实验性的 600M 参数 d1-omni-600M(文本+图像/音频)。
Hacker News · 首页精选AI 评分8080 Anthropic 发布 Claude Haiku 5.5,主打高吞吐低成本任务
Anthropic 发布 Claude Haiku 5.5,主打高吞吐、成本敏感型任务,是其迄今最便宜、最快、能力最强的小模型。
推荐理由:原文把新模型的价格、速度、子智能体定位和基准成绩一次性给出,方便对比 Haiku 4.5 与同级模型的取舍。
Reddit · r/LocalLLaMAAI 评分3232 LiquidAI 发布 d1-3B 与 d1-omni 决策模型
LiquidAI 发布两款基于 LFM2.5 架构的零输出 token 决策模型 d1-3B 和 d1-omni。d1-3B(30 亿参数)在 Decision Index 0.2.1 上以 48.57 分位列 10B 以下决策模型榜首,超过 35B-A3B 的 Decider(47.11),单次决策在 NVIDIA RTX 4090 上耗时 8 ms。
Ars Technica · AIAI 评分7474 Mistral 发布 1 万亿参数开放权重模型 Large 4,强调对标中美头部模型
法国 Mistral 发布 1 万亿参数的开放权重模型 Mistral Large 4(昵称 Le Chonk),目前以预览版开放使用,正式版将在当月底推出。
Hugging Face BlogAI 评分3333 Hugging Face 发布 Falcon-ASR:1.6B 参数的阿拉伯语语音识别模型
Hugging Face 发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点支持阿拉伯语及阿联酋方言,由阿布扎比 Technology Innovation Institute(TII)开发,同一权重也支持英语、法语、西班牙语和葡萄牙语。
The DecoderAI 评分7575 OpenAI 在 GitHub 发布 372 条 AI 数学证明,绕过传统期刊流程
OpenAI 在 GitHub 上发布 372 条由其内部前沿模型生成的数学结果,称每条都解决了一个开放问题或在关键方向取得实质进展,其中包含对若干主流计算机算法的改进以及与黎曼猜想相关的进展。
Latent SpaceAI 评分5858 AI 周报:OpenAI 发布 722 篇数学论文,Mistral Large 4 与多项开源模型同步亮相
OpenAI 在 GitHub 公开一个未发布的内部模型产出的 722 份数学手稿,涵盖 372 个结果族,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力,被多位评论者称为数学史上“最重要的时刻”,其中 Quasi-Riemann Hypothesis 等结果据称涉及 Riemann、Hodge、BSD 等长期未解问题。
Hacker News · 首页AI 评分5757 Strands 团队开源 Strands Decider 2B 决策模型
Strands 团队发布开源决策模型 Strands Decider 2B,以 Qwen3.5-2B 为躯干并替换为 pointer head,使用 rank-16 LoRA 微调,参数约 20 亿,可本地 CPU/GPU 推理,单次决策中位延迟在 RTX 3090 上约 115ms、M3 MacBook 上约 153ms。
量子位 QbitAIAI 评分4242 OpenAI 一夜公开 722 篇数学手稿,覆盖黎曼、霍奇、BSD 等猜想
OpenAI 一次性公开了 722 篇数学手稿,全部由一个尚未发布的内部模型生成,共归为 372 组结果,涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等 17 个方向,平均每项结果消耗的算力约相当于 ChatGPT Pro 思考 3 小时。
Hacker News · 首页AI 评分5858 OpenAI 在官网分享 AI 数学进展,公开数学与预印本仓库
OpenAI 在官网发布 “Sharing AI progress in mathematics” 页面,并给出 GitHub 仓库 openai/math 及其中的 preprints 目录,公开其数学方向的研究资料。该帖在 Hacker News 首页获得 1263 分、1453 条评论,引发社区围绕 OpenAI 数学能力与公开材料的讨论。
Hacker News · 首页AI 评分3333 Google EmbeddingGemma 2 发布
Google 推出 EmbeddingGemma 2 嵌入向量模型。由于原文未提供具体细节,无法进一步展开参数规模、上下文长度或基准测试分数等信息。
TechCrunch · AIAI 评分3838 Musubi 如何用决策模型改造内容审核
Musubi 发布开源轻量级决策模型 PolicyLM-1.7B,专门用于实时内容审核,可在 50 毫秒内将英文政策套用到消息内容,输出是否符合的二分类判断。该模型成本和速度与现有 AI 分类器相当,但具备现代 LLM 的灵活性,可在政策变更时无需重新训练即可迭代。
Google DeepMindAI 评分5555 Google DeepMind 发布端侧多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 推出 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议开源,参数量为 740M,可将文本、图像、音频和视频映射到统一嵌入空间。
Simon WillisonAI 评分6262 Mistral 发布 Mistral Large 4 预览版,参数 1 trillion 激活 49B
Mistral 发布 Mistral Large 4 预览版,是一款 1 trillion 参数、激活 49B 的模型,训练于自建的 3,800 块 NVIDIA Grace Blackwell GPU 集群,已通过 Mistral API 提供预览,并承诺在“本月底”发布开源权重版本。
Hacker News · 首页AI 评分5252 Google DeepMind 发布开源端侧多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议,参数 740M,面向文本、图像、音频、视频的统一多模态嵌入。
The DecoderAI 评分6060 Google 发布图像模型 Nano Banana 2.1,画质提升且价格近乎减半
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代今年 2 月发布的 Nano Banana 2,基于 Gemini 3.6 Flash,主打 Pro 模型的更高效版本。
The DecoderAI 评分5151 Google 发布开源多模态嵌入模型 EmbeddingGemma 2,主打端侧运行
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量为 740M,可将文本、图像、视频、音频和代码转为向量。Google 称在多模态嵌入基准上它优于尺寸达其两倍的竞品,是同档中最紧凑的模型;在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代提升近 10 分。
Reddit · r/LocalLLaMAAI 评分4040 EmpirioLabs 开源 Aplomb 1 决策模型:5.3B 参数、1M 上下文、4B 级 Decision Index 第一
EmpirioLabs 发布 Aplomb 1,一款 5.3B 参数、开放权重的决策模型,单次请求可处理 1M token 的文本、JSON、图片和音视频,在 Decision Index 0.2.1 上得 44.86,居 4B 模型榜首,并在 38 项基准中的 8 项(含 MMLU-Pro、GPQA Diamond、BBH)拿下 5.3B 及以下模型的最高分。
Hacker News · 首页精选AI 评分7878 Mistral 发布 Mistral Large 4 公开预览,权重将于月底开源
Mistral 发布 Mistral Large 4(ML4)公开预览,称其为 1 万亿参数、49B 激活参数的多模态模型,在 Mistral 自己的欧洲数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 从头训练,preview API 即日在 Mistral Studio 开放,权重计划于本月底发布。
推荐理由:原文给出 1T 总参数 / 49B 激活参数、训练规模与多项基准结果,可作为评估开源权重前沿模型多模态与智能体能力的参考。
Reddit · r/LocalLLaMAAI 评分4545 Google DeepMind 开源多模态嵌入模型 EmbeddingGemma 2,可在消费级硬件端侧运行
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本(含代码)、图像、视频和音频输入统一映射到 768 维向量空间。模型共 740M 参数,由 270M 文本模型与 170M 视觉、300M 音频编码器组合而成,专为手机、笔记本等消费级硬件上的低延迟语义表示设计,支持搜索、RAG、分类与聚类等端侧应用。
Reddit · r/LocalLLaMAAI 评分5050 EmbeddingGemma 2:Google DeepMind 开源多模态嵌入模型
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,总参数量 740M,可将文本(含代码)、图像、视频和音频统一映射到 768 维向量空间,支持 RAG、检索、分类与聚类等本地应用。
The DecoderAI 评分6262 Mistral 发布 1 万亿参数模型 Large 4,主打欧洲主权与网络安全任务
Mistral 发布 Mistral Large 4(ML4)公开预览版,昵称 le Chonk,总参数量 1 万亿、激活参数 49B,采用 fine-grained MoE 架构。
TechCrunch · AIAI 评分7070 Mistral AI 发布多模态大模型 Mistral Large 4,参数约为四千亿只到一万亿
Mistral AI 发布多模态大模型 Mistral Large 4(昵称 Le Chonk),参数量约 1 万亿,目前只能通过带安全护栏的公共端点访问,公司计划在安全测试完成后约三周释出权重。
Hacker News · 首页AI 评分1818 Mistral Large 4
正文信息不足以撰写摘要,仅可确认原始标题为 "Mistral Large 4",来源为 Hacker News 首页,文章获得 66 点、4 条评论,无法核验更多内容细节。
Hacker News · 首页AI 评分7070 Mistral 发布 Mistral Large 4:490 亿激活参数的开源多模态 MoE 模型
Mistral 发布 Mistral Large 4,定位为开放权重的通用多模态模型,采用细粒度 Mixture-of-Experts 架构,拥有 49B 激活参数与 1.05T 总参数,并配备 1.6B 视觉编码器。文档地址:https://docs.mistral.ai/models/mistral-large-4-0
Mistral AI精选AI 评分8585 Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型
Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。
推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。
NVIDIA BlogAI 评分2525 电信运营商为何以开源模型为基础构建 AI 战略
电信运营商正以开源模型为基础构建 AI 战略,看重的不仅是成本,更在于可信、可控与可定制。NVIDIA 最新《State of AI in Telecommunications》报告显示 89% 受访者认为开源模型与软件对其公司 AI 战略重要。
The Rundown AIAI 评分4040 Reflection AI 发布首款开源模型 Beam,主打低算力与效率
Reflection AI 推出首款开源模型 Beam,面向编码和智能体场景,号称以更低算力和成本对标中国开源模型。官方称其推理与编码表现接近 Z.ai 的 GLM-5.2,权重将于本月以 Apache 2.0 许可证发布,允许企业自托管定制。
Reddit · r/LocalLLaMAAI 评分4747 微软公开页面证实 GPT-6 系列采用 Looped Transformers
微软在公开页面上确认 OpenAI 在 GPT-6 系列中使用了 Looped Transformers,印证了 The Information 此前的报道。其中 GPT-6.1 Sol 采用 2 次推理(而非 3 次),与同系列其他模型共享同一预训练基座,仅在后训练方式与循环次数上有所不同。
Reddit · r/LocalLLaMAAI 评分1313 德国 Aleph Alpha Kolibri 模型通过 Tesseracted 托管生成 Nim 代码
德国 Aleph Alpha 的小模型 Kolibri 由 Tesseracted 提供托管,在 3code 上用完整小众语言 Nim 写出了一段可运行的小型命令行工具。模型、托管方、运行环境和编程语言均产自德国,体现了德国本土 AI 栈的端到端能力。鉴于模型体量较小,能在 Nim 这类冷门语言上跑通代码被认为颇为难得。
Reddit · r/LocalLLaMAAI 评分3434 DynamicTune 用闭式权重手术让 Qwen3.5-0.8B 在 ARC-Challenge 上超越 2B 模型
DynamicTune 提出一种无需反向传播的闭式权重手术方法,仅用约 12 分钟在消费级硬件上把 4B 模型的轨迹动力学迁移进 Qwen3.5-0.8B 学生模型。