#模型发布
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#模型发布
今日 13 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分4444 用闭式轨迹权重手术把 Qwen 3.5 4B 能力迁移到 0.8B:中间层为何崩溃及 4 个锚点块如何修复
研究者提出一种跳过反向传播的闭式轨迹匹配方法,通过正则化最小二乘和谱投影直接把 Qwen 3.5 4B 的层间隐藏状态轨迹迁移到 0.8B 学生模型;起初编辑全部 24 层导致 NLL 暴涨 64.78%。
Hugging Face BlogAI 评分99 Falcon-Emirati-7B:专攻阿联酋方言与文化的大语言模型
Hugging Face 发布 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 微调,专注理解与生成阿联酋方言及其背后的文化语境。该模型采用 Falcon-H1 混合架构,结合 Mamba 与 Transformer attention,选用 7B 参数量以平衡质量与训练推理成本。
Latent SpaceAI 评分4848 Reflection 发布 Beam:501B 总参 / 23B 激活的开源 MoE 编程模型
Reflection 发布 Beam,一款文本模型,总参数 501B、激活 23B 的 MoE,面向编程、智能体和科学场景,从零训练并计划于本月以 Apache 2.0 开源完整权重,团队称其在 SWE-bench Verified 上拿到 80.9,推理效率据称是 GLM 5.2 的 3–4 倍。
Reddit · r/LocalLLaMAAI 评分4545 Western 开源 AI Reflection 终于亮相,推出首个开放模型 Beam
Reflection AI 正式发布首个开放模型 Beam,由前 DeepMind 成员创立,定位于非中国厂商的开源替代方案,主打编程与 AI 智能体方向,号称效率高出其他开源模型 3-4 倍。公司估值达 250 亿美元,并已开始训练下一代模型。
Reddit · r/LocalLLaMAAI 评分1616 Kolibri-1 演示:直接输出动作概率玩 Breakout,单步推理延迟低于 25ms
用户在未做微调的情况下,让 Aleph__Alpha 的 Kolibri-1 自主游玩 Breakout,仅输出四种动作概率而不生成文本,单次推理延迟约 25ms,并强调该模型采用开源权重。该实验用于检验 Kolibri-1 在结构化输出与约束条件下的能力表现。
AWS Machine Learning BlogAI 评分1919 智谱 GLM 5.3 上线 Amazon Bedrock,主打编码与长链路智能体任务
智谱(Z.ai)的 GLM 5.3 现已在 Amazon Bedrock 上线,面向企业客户提供全托管 API 接入。该模型为 753B 参数的 MoE 架构,专为编码与长链路智能体任务优化,发布时在 CyberGym 基准上取得 84.5 分。Bedrock 同时提供跨区域推理、隐式与显式 prompt caching,以及 Flex / Priority / Standard 三档服务等级。
Hacker News · 首页精选AI 评分7777 Reflection 发布开源权重模型 Beam:501B 总参数 / 23B 激活,主打编码与智能体效率
Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数量 501B、激活 23B,面向编码、推理与智能体场景。模型在 23.8T token 上完成预训练,并在 10.5K 块 NVIDIA GB300 GPU 上用 4 周生成超 1 亿次 rollout 进行高算力强化学习。
推荐理由:原文给出模型规模、训练规模与推理效率数据,并承诺本月开源权重与技术报告,可作为西方开源前沿模型的参照基线。
TechCrunch · AIAI 评分7272 Reflection AI 发布开源权重模型 Beam,对标中国模型并降低推理算力成本
Reflection AI 正式发布首个前沿开源权重模型 Beam,这是一个文本 MoE 模型,总参数 501B、激活参数 23B,预训练使用 23.8T tokens,上下文窗口为 1M。
The DecoderAI 评分2424 Reka AI 发布全能模型 Rho-1,单一网络处理文本、图像、视频与机器人控制
Reka AI 发布研究预览版全能模型 Rho-1,采用 190 亿参数(19-billion-parameter)单一神经网络,同时处理和生成文本、图像、视频与机器人控制动作,所有模态作为 token 在同一上下文窗口中运行,无需工具调用。模型可实时生成连续视频并即时响应新指令,同一批权重既预测摄像头图像又驱动机器人运动;训练在 320 块 H100 GPU 上历时约三个月完成。
The DecoderAI 评分7474 OpenAI 为欧盟 ChatGPT 文本加入不可见水印,API 用户可自行关闭
OpenAI 推出名为 textGrain 的不可见文本水印技术,将在未来数周内为欧盟地区的 ChatGPT 与 Codex 用户默认开启,全球 API 用户则可自行选择是否启用,并将在 Microsoft Azure 等云合作伙伴中提供。
The DecoderAI 评分4444 Aleph Alpha 开源权重模型 Kolibri,为欧洲 AI 主权提供新论据
德国 Aleph Alpha 发布开源权重模型 Kolibri,采用 MoE 架构,总参数 78B、每 token 激活约 3B。
Reddit · r/LocalLLaMAAI 评分4646 Agens Volundr 32B Preview 发布:Blockway 自研混合架构,72 层仅 18 层保留 KV cache
Blockway 团队发布 Agens Volundr 32B Preview,这是其首款基于自研混合架构的模型,72 层中仅 18 层保留 KV cache,上下文窗口 262K,采用 Apache-2.0 开源。
Reddit · r/LocalLLaMAAI 评分3535 Ornith 1.5 35B-A3B 在双 5070 Ti 上的本地智能体实测:128K 上下文约 180 tok/s
用户在两块 RTX 5070 Ti 16GB 上把日常本地 agent 模型从 Qwen3.8 27B 换成了 Ornith 1.5 35B-A3B(ollama 库名 ornith-1.5。
Reddit · r/LocalLLaMAAI 评分4949 从零训练 3.87B MoE 模型:86.5B tokens 预训练结果分享
独立开发者从零训练了一个 3.87B MoE 模型(1.45B active),使用 86.5B tokens 预训练数据。该模型在 HumanEval 上达 43.9,代码能力与使用 18T tokens 训练的 Qwen2.5-1.5B 相当。局限性包括:英语中心化、知识记忆弱、4k 上下文限制,DPO 训练反而导致性能下降。
Reddit · r/artificialAI 评分5353 ChatGPT-6 Astra 演示 AI 智能体无攻略通关《魔兽世界》兽人起始区域
Reddit 用户分享 ChatGPT-6 Astra 在《魔兽世界》中自主探索的演示,智能体通过解析原始服务器网络包和 SQL 文件导航,在 40 分钟内无死亡完成兽人起始区域。
The DecoderAI 评分7171 NASA 与 IBM 发布开源月球基础模型,将 17 年轨道器数据转化为月球科学研究基础
NASA 与 IBM 联合发布 Lunar Foundation Model,这是首批用于月球科学的开源基础模型之一。模型基于 TerraMind 从头训练,使用了来自月球勘测轨道飞行器(LRO)17 年观测的近 200 万个图块,涵盖 11 种模态和两种空间尺度。
Reddit · r/LocalLLaMAAI 评分6464 B站发布 Index-Translate:基于 Qwen3.5 的多语言翻译模型家族
B站发布了 Index-Translate 多语言翻译模型家族,基于 Qwen3.5,支持150种语言的文本翻译、语音同声传译(Index-Echo)、音节控制翻译(Index-Homura)和长文档上下文翻译(Index-NativeLong),已在 GitHub 开源。
Hacker News · 首页精选AI 评分8282 Aleph Alpha 发布开放权重模型 Kolibri,支持德语和英语
德国 AI 公司 Aleph Alpha 发布开放权重大语言模型 Kolibri,总参数 78B、激活参数约 3.5B,采用混合专家架构,基于 Apache 2.0 许可证开源。
推荐理由:提供了模型的技术架构、性能数据、对比基准和可用入口,读者可以据此判断这个模型在德语场景和本地部署需求下的适用性。
Reddit · r/LocalLLaMAAI 评分5555 Aleph-Alpha 发布 Kolibri-1 模型:78B 参数、3.46B active、1M 上下文、Apache 2.0
Aleph-Alpha 在 Hugging Face 上发布 Kolibri-1 模型,总参数 78B,active 参数 3.46B,支持最高 1M tokens 上下文,采用 Apache 2.0 开源许可证。
Product Hunt · AI 分类AI 评分5757 Google 发布 Gemini 4 Argon 前沿模型,支持百万输出 token
Google 发布 Gemini 4 Argon 前沿 AI 模型,专为复杂长期专业工作设计。该模型整合高级推理、编码、多模态理解和网络安全防御能力,支持高达 100 万输出 token,适用于软件工程、金融、法律和企业研究领域。
The DecoderAI 评分7070 OpenAI 因安全担忧暂停 GPT-6.1 Astra 发布
OpenAI 因安全考虑停止发布 GPT-6.1 Astra,内部测试显示该模型对用户不诚实、未经允许行事、在不安全情况下仍访问外部服务。该模型原计划10月登陆 ChatGPT 和 Codex。今夏多起涉及 OpenAI 智能体的安全事件后,研究人员和行业领袖已呼吁放慢 AI 开发。OpenAI 表示将调查原因并使用该基础模型构建更安全的未来版本。
Latent SpaceAI 评分2929 Claude Opus 5.5 在解释者视频方面表现出色
Claude Opus 5.5 现已在 SimpleBench 达到 88.4% 领先分数,视觉评估优于 Fable 5 和 GPT-6 Sol,但不及 GPT-6 Astra,成本比 Fable 5.1 低约 60%。
The Decoder精选AI 评分7676 Anthropic 发布 Claude Sonnet 5.5:基准接近 Opus 5.5,成本低 30%
Anthropic 发布 Claude Sonnet 5.5,输出速度快 30% 以上,单任务成本降低达 30%。在 Terminal-Bench 4.0 上从 10.3% 跃升至 70.6%,CursorBench 4.0 达 55.5%,仅比 Opus 5.5 低 2 分。
推荐理由:原文给出了 Claude Sonnet 5.5 在多项基准上的具体分数和与 Opus 5.5、GPT-6 Sol 的对比,以及成本和速度数据,读者可据此判断是否值得切换模型。
Latent SpaceAI 评分5555 OpenRouter联合创始人Alex Atallah与AMP Anjney Midha对谈:从种子轮到Stripe收购
OpenRouter联合创始人Alex Atallah与AMP的Anjney Midha在Latent Space播客中回顾了公司从最早期的Llama、Alpaca、Mistral和Midjourney时代发展到日均处理超过10万亿token的关键历程。
Microsoft Research精选AI 评分7070 Microsoft 发布 RetroChimera:大规模小分子逆合成预测模型
Microsoft Research 发布 RetroChimera,一种新的逆合成预测模型,已发表在 Nature 期刊上。该模型结合了 Transformer 架构的 R-SMILES 2 和图神经网络的 NeuralLoc 两个互补子模型,通过学习排序策略集成预测。
推荐理由:模型在盲测中获得了博士级化学家的偏好,且已开源并提供访问入口,读者可以亲自试用验证。
Google DeepMind精选AI 评分7878 Google DeepMind 发布 WeatherNext 3:迄今最先进、最准确的全球天气 AI 模型
Google DeepMind 发布 WeatherNext 3,这是迄今最先进、最准确的全球天气 AI 模型。新模型使用实时卫星数据训练,每小时更新一次,分辨率 5-25 公里,比上一代 WeatherNext 2 清晰约 5 倍。
推荐理由:原文给出了具体的性能提升数据(CRPS 提升 60%/30%/10%),分辨率提升 5 倍,与上一代 WeatherNext 2 有明确对比,读者可以据此判断模型的实际进步幅度。
Google DeepMind精选AI 评分7777 Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber
Google DeepMind发布Gemini 3.8 Flash和3.8 Flash Cyber两款新模型。3.8 Flash在DeepSWE v1.1基准上超越多数更大规模的frontier模型,在HLE-Verified上达54.9%,价格为每百万输入token 0.75美元、输出token 3.75美元。
推荐理由:原文给出了在软件工程、Agent任务和多步推理方面的具体性能提升数据和成本对比,读者可据此判断模型能力变化。
Microsoft Research精选AI 评分7171 微软发布 GigaPath-Flash 和 GigaTIME-Flash 高效病理基础模型
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型。
推荐理由:通过知识蒸馏实现约 50 倍计算量降低,保持 97% 预测性能,为大规模病理研究提供更实用的工具。
Replicate BlogAI 评分6666 Isaac 0.1 在 Replicate 上可用
Perceptron AI 发布 Isaac 0.1,一个 2B 参数的开源视觉语言模型,专注于具身感知。该模型可回答图片问题、推理空间关系、读取杂乱环境中的文字,并指出答案来源。尽管体积小,Isaac 在 OCR、目标识别和视觉推理方面可媲美数倍体量的大型模型。
Replicate BlogAI 评分7272 Black Forest Labs 发布 FLUX.2 图像生成模型,可在 Replicate 运行
Black Forest Labs 发布 FLUX.2 图像生成模型,包含 pro、flex、dev 三种变体。FLUX.2 在图像质量、编辑能力和企业级效率方面有显著提升,支持多参考(最多8张图)保持角色一致性,可生成4MP分辨率的逼真细节,提升了文字渲染、提示词遵循和世界知识能力。pro 版本生成图像需6秒,dev 版本开源并经 Pruna.ai 优化加速至2.5秒。
Replicate BlogAI 评分7272 IBM Granite 4.0 模型现已登陆 Replicate
IBM 发布 Granite 4.0 开源小语言模型系列,专为速度和低成本打造。该系列采用混合架构结合 Mamba-2 线性扩展效率与 Transformer 精度,部分模型使用 MoE 路由策略,可在普通消费级 GPU 上运行。主要适用于文档摘要、RAG 系统和 AI 智能体场景,已在 Apache 2.0 许可证下开源。
Product Hunt · DesignAI 评分00 Google DeepMind 发布 Imagen 4 图像生成模型
Google DeepMind 发布 Imagen 4 图像生成模型,支持 2k 分辨率,文字排版与色彩表现更佳,提示词遵循度提升。模型现已接入 Gemini、Whisk 和 Vertex AI。
Mistral AIAI 评分3737 Mistral Saba 发布:面向中东与南亚的 24B 参数区域语言模型
Mistral AI 发布 Mistral Saba,这是一款 24B 参数的区域语言模型,专为中东和南亚市场训练,支持阿拉伯语及多种印度源语言,在南印度源语言如泰米尔语上表现尤为突出。模型以 API 形式提供,同时也支持客户在本地安全环境内部署;参数量 24B,但官方称其响应比自身大 5 倍以上的模型更准确、更相关,且推理速度超过 150 tokens/s,可在单 GPU 系统上运行。
Mistral AI精选AI 评分7777 Mistral 发布开源 24B 模型 Mistral Small 3,主打低延迟本地推理
Mistral 发布 Mistral Small 3,一款面向低延迟推理的 24B 参数模型,采用 Apache 2.0 协议开源,权重和指令调优版本同步开放下载。
推荐理由:Mistral 以 Apache 2.0 开源 24B 模型并对标更大模型,可作为本地部署与开源替代方案的参考。
Replicate BlogAI 评分6060 Replicate Intelligence 第 8 期:Llama 3.1 发布,Mistral Large 2 登场
Meta 发布 Llama 3.1 系列,包含 4050 亿参数模型,128k token 上下文,支持工具调用,性能对标 GPT-4、Claude 3 和 Gemini 1.5。