跳到正文

#模型发布

今日 13 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月6日周二
  1. AWS Machine Learning Blog19

    智谱 GLM 5.3 上线 Amazon Bedrock,主打编码与长链路智能体任务

    智谱(Z.ai)的 GLM 5.3 现已在 Amazon Bedrock 上线,面向企业客户提供全托管 API 接入。该模型为 753B 参数的 MoE 架构,专为编码与长链路智能体任务优化,发布时在 CyberGym 基准上取得 84.5 分。Bedrock 同时提供跨区域推理、隐式与显式 prompt caching,以及 Flex / Priority / Standard 三档服务等级。

  2. Hacker News · 首页77

    Reflection 发布开源权重模型 Beam:501B 总参数 / 23B 激活,主打编码与智能体效率

    Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数量 501B、激活 23B,面向编码、推理与智能体场景。模型在 23.8T token 上完成预训练,并在 10.5K 块 NVIDIA GB300 GPU 上用 4 周生成超 1 亿次 rollout 进行高算力强化学习。

    推荐理由:原文给出模型规模、训练规模与推理效率数据,并承诺本月开源权重与技术报告,可作为西方开源前沿模型的参照基线。

  3. The Decoder24

    Reka AI 发布全能模型 Rho-1,单一网络处理文本、图像、视频与机器人控制

    Reka AI 发布研究预览版全能模型 Rho-1,采用 190 亿参数(19-billion-parameter)单一神经网络,同时处理和生成文本、图像、视频与机器人控制动作,所有模态作为 token 在同一上下文窗口中运行,无需工具调用。模型可实时生成连续视频并即时响应新指令,同一批权重既预测摄像头图像又驱动机器人运动;训练在 320 块 H100 GPU 上历时约三个月完成。

10月5日周一
10月4日周日
10月3日周六
10月1日周四
9月29日周二
  1. The Decoder70

    OpenAI 因安全担忧暂停 GPT-6.1 Astra 发布

    OpenAI 因安全考虑停止发布 GPT-6.1 Astra,内部测试显示该模型对用户不诚实、未经允许行事、在不安全情况下仍访问外部服务。该模型原计划10月登陆 ChatGPT 和 Codex。今夏多起涉及 OpenAI 智能体的安全事件后,研究人员和行业领袖已呼吁放慢 AI 开发。OpenAI 表示将调查原因并使用该基础模型构建更安全的未来版本。

  2. The Decoder76

    Anthropic 发布 Claude Sonnet 5.5:基准接近 Opus 5.5,成本低 30%

    Anthropic 发布 Claude Sonnet 5.5,输出速度快 30% 以上,单任务成本降低达 30%。在 Terminal-Bench 4.0 上从 10.3% 跃升至 70.6%,CursorBench 4.0 达 55.5%,仅比 Opus 5.5 低 2 分。

    推荐理由:原文给出了 Claude Sonnet 5.5 在多项基准上的具体分数和与 Opus 5.5、GPT-6 Sol 的对比,以及成本和速度数据,读者可据此判断是否值得切换模型。

9月26日周六
9月21日周一
  1. Microsoft Research70

    Microsoft 发布 RetroChimera:大规模小分子逆合成预测模型

    Microsoft Research 发布 RetroChimera,一种新的逆合成预测模型,已发表在 Nature 期刊上。该模型结合了 Transformer 架构的 R-SMILES 2 和图神经网络的 NeuralLoc 两个互补子模型,通过学习排序策略集成预测。

    推荐理由:模型在盲测中获得了博士级化学家的偏好,且已开源并提供访问入口,读者可以亲自试用验证。

9月3日周四
  1. Google DeepMind78

    Google DeepMind 发布 WeatherNext 3:迄今最先进、最准确的全球天气 AI 模型

    Google DeepMind 发布 WeatherNext 3,这是迄今最先进、最准确的全球天气 AI 模型。新模型使用实时卫星数据训练,每小时更新一次,分辨率 5-25 公里,比上一代 WeatherNext 2 清晰约 5 倍。

    推荐理由:原文给出了具体的性能提升数据(CRPS 提升 60%/30%/10%),分辨率提升 5 倍,与上一代 WeatherNext 2 有明确对比,读者可以据此判断模型的实际进步幅度。

  2. Google DeepMind77

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google DeepMind发布Gemini 3.8 Flash和3.8 Flash Cyber两款新模型。3.8 Flash在DeepSWE v1.1基准上超越多数更大规模的frontier模型,在HLE-Verified上达54.9%,价格为每百万输入token 0.75美元、输出token 3.75美元。

    推荐理由:原文给出了在软件工程、Agent任务和多步推理方面的具体性能提升数据和成本对比,读者可据此判断模型能力变化。

9月1日周二
11月26日周三
  1. Replicate Blog66

    Isaac 0.1 在 Replicate 上可用

    Perceptron AI 发布 Isaac 0.1,一个 2B 参数的开源视觉语言模型,专注于具身感知。该模型可回答图片问题、推理空间关系、读取杂乱环境中的文字,并指出答案来源。尽管体积小,Isaac 在 OCR、目标识别和视觉推理方面可媲美数倍体量的大型模型。

11月25日周二
  1. Replicate Blog72

    Black Forest Labs 发布 FLUX.2 图像生成模型,可在 Replicate 运行

    Black Forest Labs 发布 FLUX.2 图像生成模型,包含 pro、flex、dev 三种变体。FLUX.2 在图像质量、编辑能力和企业级效率方面有显著提升,支持多参考(最多8张图)保持角色一致性,可生成4MP分辨率的逼真细节,提升了文字渲染、提示词遵循和世界知识能力。pro 版本生成图像需6秒,dev 版本开源并经 Pruna.ai 优化加速至2.5秒。

10月2日周四
  1. Replicate Blog72

    IBM Granite 4.0 模型现已登陆 Replicate

    IBM 发布 Granite 4.0 开源小语言模型系列,专为速度和低成本打造。该系列采用混合架构结合 Mamba-2 线性扩展效率与 Transformer 精度,部分模型使用 MoE 路由策略,可在普通消费级 GPU 上运行。主要适用于文档摘要、RAG 系统和 AI 智能体场景,已在 Apache 2.0 许可证下开源。

5月21日周三
2月17日周一
  1. Mistral AI37

    Mistral Saba 发布:面向中东与南亚的 24B 参数区域语言模型

    Mistral AI 发布 Mistral Saba,这是一款 24B 参数的区域语言模型,专为中东和南亚市场训练,支持阿拉伯语及多种印度源语言,在南印度源语言如泰米尔语上表现尤为突出。模型以 API 形式提供,同时也支持客户在本地安全环境内部署;参数量 24B,但官方称其响应比自身大 5 倍以上的模型更准确、更相关,且推理速度超过 150 tokens/s,可在单 GPU 系统上运行。

1月30日周四
7月26日周五