跳到正文

#模型发布

今日 12 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
  1. Reddit · r/artificial18

    AI 应用是否会开始为日常工作训练专用模型?

    随着近期模型发布,面向特定工作的专用模型训练受到关注,Genspark 曾通过 Fireworks 对 MiniMax M3 后训练以推出 Gen-1 Slides。作者认为,更多成熟 AI 应用可能为高频、重复收费的任务训练模型,但需要足够使用量、效果评估方法和持续维护能力,并不意味着每个应用都需要训练团队。

  2. Hacker News · 首页83

    OpenAI 一次发布 372 项数学证明,包括唯一游戏猜想

    据 Scott Aaronson 整理,OpenAI 在顾问组推荐下一次性公开 372 项数学突破结果,其中包括 Subhash Khot 的唯一游戏猜想(UGC)证明、L=BPL、Fourier 变换整数乘法低于 O(n log n) 的新上界、Unitary Synthesis 问题的正面解答、Parity 不在 QAC0 等,部分配有 Lean 证书。

    推荐理由:原文列出 372 项数学突破与所用算力、问题类型,可帮助读者判断新模型在深度推理上的实际边界。

10月7日周三
  1. TechCrunch · AI38

    Musubi 如何用决策模型改造内容审核

    Musubi 发布开源轻量级决策模型 PolicyLM-1.7B,专门用于实时内容审核,可在 50 毫秒内将英文政策套用到消息内容,输出是否符合的二分类判断。该模型成本和速度与现有 AI 分类器相当,但具备现代 LLM 的灵活性,可在政策变更时无需重新训练即可迭代。

  2. Hacker News · 首页78

    Mistral 发布 Mistral Large 4 公开预览,权重将于月底开源

    Mistral 发布 Mistral Large 4(ML4)公开预览,称其为 1 万亿参数、49B 激活参数的多模态模型,在 Mistral 自己的欧洲数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 从头训练,preview API 即日在 Mistral Studio 开放,权重计划于本月底发布。

    推荐理由:原文给出 1T 总参数 / 49B 激活参数、训练规模与多项基准结果,可作为评估开源权重前沿模型多模态与智能体能力的参考。

  3. Reddit · r/LocalLLaMA45

    Google DeepMind 开源多模态嵌入模型 EmbeddingGemma 2,可在消费级硬件端侧运行

    Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本(含代码)、图像、视频和音频输入统一映射到 768 维向量空间。模型共 740M 参数,由 270M 文本模型与 170M 视觉、300M 音频编码器组合而成,专为手机、笔记本等消费级硬件上的低延迟语义表示设计,支持搜索、RAG、分类与聚类等端侧应用。

10月6日周二
  1. Hacker News · 首页18

    Mistral Large 4

    正文信息不足以撰写摘要,仅可确认原始标题为 "Mistral Large 4",来源为 Hacker News 首页,文章获得 66 点、4 条评论,无法核验更多内容细节。

  2. Mistral AI85

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。

    推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。

  3. Reddit · r/LocalLLaMA13

    德国 Aleph Alpha Kolibri 模型通过 Tesseracted 托管生成 Nim 代码

    德国 Aleph Alpha 的小模型 Kolibri 由 Tesseracted 提供托管,在 3code 上用完整小众语言 Nim 写出了一段可运行的小型命令行工具。模型、托管方、运行环境和编程语言均产自德国,体现了德国本土 AI 栈的端到端能力。鉴于模型体量较小,能在 Nim 这类冷门语言上跑通代码被认为颇为难得。