跳到正文

#新模型

今日 0 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
9月29日周二
  1. Hacker News · 最佳80

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,这是 Claude 5.5 系列的第二款模型。相比 Sonnet 5,性能提升超过 30%,成本降低最高达 30%。

    推荐理由:原文给出了性能提升、基准测试分数和价格信息,读者可以据此判断它与前代的实际差距以及是否值得切换。

9月27日周日
  1. Reddit · r/MachineLearning59

    InternLM 团队发布 Intern-Decision 多模态模型系列

    发布了 Intern-Decision 多模态模型系列(0.8B、2B、4B),其中 4B 模型在性能上优于 Jev 1.13.0。在 RTX 4090 上实测本地部署可达到约 30 FPS 的决策调用速度。团队还建立了基准测试来评估校准性能,在掷骰子和蒙特霍尔问题等经典概率场景中,该模型的预测分布比 Jev 更接近黄金分布。

9月24日周四
9月23日周三
  1. AWS Machine Learning Blog72

    GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用。GPT-6 Sol 面向复杂推理和编码任务,GPT-6 Luna 面向大规模重复性任务如信息提取和分类。

    推荐理由:原文给出了 GPT-6 Sol 和 Luna 的定位差异、价格对比 GPT-5.6 更低、提示词缓存功能,读者可以据此规划自己的模型使用策略。

  2. OpenAI News36

    OpenAI 发布 GPT-6 Sol 和 Luna

    OpenAI 推出 GPT-6 Sol 和 Luna 两款模型,提供前沿智能与不同的能力/成本平衡,专为日常工作场景设计。两款型号分别针对不同用户需求进行优化。

  3. AWS Machine Learning Blog72

    Claude Opus 5.5 现已在 AWS 上可用

    Anthropic 最强 Opus 模型 Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用,这是 Claude 5.5 家族的首个模型。

    推荐理由:原文给出了相比 Opus 5 的 token 效率提升、价格下降和安全分类器改进,读者可以据此判断是否值得切换。

9月22日周二
  1. Simon Willison62

    TypeSafe AI 发布 Jev:新型决策模型,输出为数值而非文本

    TypeSafe AI 发布 Jev 决策模型,接受文本输入但输出浮点数而非文本,支持三类问题(是/否、选择、评分)。定价为输入 $0.042/million tokens,输出免费,比 GPT-5 Nano 更便宜。作者指出其适合分类任务如垃圾检测、搜索重排序,但缺乏可解释性可能导致偏见问题,社区已出现开源复现和创意用例。

9月21日周一
9月16日周三
  1. Latent Space51

    TypeSafe 发布 Jev:专注决策/分类/路由的 System One Model,速度提升超 100 倍

    TypeSafe 发布新模型 Jev,定位为“System One Model”,专注于决策、分类、路由和评分而非文本生成。Jev 速度比小型前沿 LLM 快 100 倍以上,成本低 200 倍以上,采用 RLCD(校准决策强化学习)训练,输出 token 免费。多家媒体认为该模型适合替代生产系统中作为结构化分类器、评判器或路由策略的 LLM,以降低不必要的自回归生成开销。

  2. NVIDIA Blog63

    NVIDIA CEO 黄仁勋在 Dreamforce 大会上宣布 Salesforce 推出首个 CRM 推理模型 Koa

    Salesforce 推出首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 构建,使用近 30 年企业 CRM 部署的专有合成数据集进行后训练。

    推荐理由:Koa 是首个 CRM 推理模型,在 CRM 基准测试中错误率降低 3 倍,且完全在 Salesforce 基础设施内运行、不使用客户数据,这对企业 AI 应用有参考价值。

9月10日周四
9月9日周三
9月8日周二
9月4日周五
9月3日周四
  1. Hugging Face Blog63

    NeoMME:高效的多模态原生多语言编码器

    Hugging Face发布NeoMME,一个包含260M和800M参数的多语言多模态编码器系列。该模型不使用独立的预训练视觉塔或因果语言模型,而是用单一双向Transformer处理文本token和原始图像patch,通过masked discrete-diffusion目标从头训练。

    推荐理由:该模型展示了单一Transformer处理多模态的架构创新,在ViDoRe v3基准测试中以更小参数达到接近最优的nDCG@10,读者可了解新的多模态编码器设计思路。

9月2日周三
  1. The Rundown AI69

    Anthropic 发布 Claude Fable 5.1,结束前沿模型安静期

    Anthropic 发布 Claude Fable 5.1,在 AA Intelligence Index 创下 66 分纪录,科学研究测试得分是 Fable 5 的两倍以上。安全过滤器在网络安全工作中减少 60% 干预,基础医学和生物学问题中减少 85%。Anthropic 同时发布限制更少的 Mythos 5.1,仅向通过审查的美国网络安全和生物学研究人员开放。

9月1日周二
  1. Google Research78

    Google 发布 TimesFM-3 零样本多变量时间序列预测基础模型

    Google Research 发布 TimesFM-3,这是新一代零样本时间序列基础模型,专为多变量预测设计。模型拥有 3.3 亿参数,在超过 1 万亿时间点的真实和合成数据上预训练,支持多目标同时预测、过去协变量和过去-未来协变量。

    推荐理由:读者可通过本文了解时间序列预测的基础模型最新进展,以及多变量预测相比单变量预测的具体精度提升。

8月28日周五
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,带来场景扩展、首尾帧插值、360p 快速预览和 4K 超分辨率等创意控制功能。新模型支持最长 40 秒视频生成,可在 Google AI Studio 和 Agent Platform API 中使用,也可通过 Google AI Plus、Pro 和 Ultra 订阅在 Google Flow 中访问。

    推荐理由:提供了具体的性能提升数据和可用性信息,读者可以评估新模型对自己工作流的实际价值。

8月27日周四
8月25日周二
8月14日周五
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 推出 Gemini 3.7 Flash,这是其面向编码和智能体任务的工作主力模型。该模型在软件工程任务中实现显著提升,FrontierCode 1.1 Main 得分从 34.4% 提升至 43.6%,DeepSWE v1.1 从 49.0% 提升至 65.3%。

    推荐理由:原文给出了性能基准提升和价格信息,读者可以据此判断新模型是否值得在生产环境中使用。

8月12日周三
  1. Google DeepMind66

    Google DeepMind 发布 SL2T 手语转文本模型

    Google DeepMind 推出突破性的多语言手语转文本模型 SL2T,训练数据涵盖 50 多种手语超过 10 万小时。该模型首次将手语 AI 带入消费产品,已在 Gboard 和 Live Transcribe 的 Pixel 11 上线,支持美式手语转英语。

    推荐理由:首个将手语 AI 实际带入消费产品的突破,在 FLEURS-ASL 基准上实现了 70 BLEURT 的零样本成绩,可供读者了解当前手语 AI 的实际可用性。

8月11日周二
8月10日周一
  1. Hugging Face Blog75

    Meta 发布 Muse Glimmer:30B 参数本地代理多模态模型

    Meta 发布 Muse Glimmer,这是一款 30B 参数的多模态模型,从 Muse 蒸馏而来,采用 Apache 2.0 许可证开源,专为本地代理场景设计,支持图像、视频和代码处理。

    推荐理由:原文给出了模型架构细节、benchmark 对比和工具链支持,读者可以了解这个 30B 参数的多模态模型在本地代理场景下的能力定位。

8月6日周四
  1. Google DeepMind68

    Google DeepMind 发布 WeatherNext:AI 模型实现气旋预报突破

    Google DeepMind 发布 WeatherNext AI 天气预测模型,在 Nature 期刊发表的论文显示该模型在预测气旋路径、强度和风结构方面达到最高精度,平均可提供额外一天的预警时间,相当于十年气象进步。

    推荐理由:原文给出了具体性能提升数据(一天额外预警时间)和实际应用案例(2025年飓风Melissa预报),读者可以据此判断该模型在天气预报领域的能力边界。

7月30日周四
  1. Google DeepMind67

    Google DeepMind 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布最新音乐生成模型 Lyria 3.5,现已在 Google Flow Music 上线。该模型在音乐性、歌词质量、声乐表达和创意控制四个方面实现升级,包括更自然的复杂旋律结构、更高的提示词遵循度、更具情感表现力的歌声,以及更便捷的 tempo 和时长控制功能。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有音乐创作工作流。