跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 1–20 条 · 共 69 条
今天10月8日周四
10月7日周三
  1. Hacker News · 首页78

    Mistral 发布 Mistral Large 4 公开预览,权重将于月底开源

    Mistral 发布 Mistral Large 4(ML4)公开预览,称其为 1 万亿参数、49B 激活参数的多模态模型,在 Mistral 自己的欧洲数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 从头训练,preview API 即日在 Mistral Studio 开放,权重计划于本月底发布。

    推荐理由:原文给出 1T 总参数 / 49B 激活参数、训练规模与多项基准结果,可作为评估开源权重前沿模型多模态与智能体能力的参考。

10月6日周二
  1. Mistral AI85

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。

    推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。

10月4日周日
  1. 量子位 QbitAI80

    GPT-6 Astra掀起3D风暴:这家公司不到2年ARR破1亿美元

    专业AI 3D模型公司Meshy的ARR从100万美元增长至1亿美元,用时不到两年,速度超过ElevenLabs和HeyGen。GPT-6 Astra展示了通用模型操作Blender进行3D建模的能力,但在角色、道具等复杂资产上与专业模型仍有明显差距。

    推荐理由:提供了AI 3D垂直领域从B端生产到C端创作的增长路径,读者可从中理解专业模型如何在通用模型压力下找到自己的市场位置。

10月3日周六
  1. Hacker News · 首页76

    Aleph Alpha 发布 Kolibri 主权开放权重模型

    Aleph Alpha 发布 Kolibri,这是一款英德双语混合专家 Transformer 模型,总参数 78B、活跃参数 3B,支持最长 100 万 token 上下文。模型已在 Hugging Face 开源,可下载权重使用。该模型专为德国公共管理、工业和航空航天等受监管行业的主权任务构建,在数学、代码、Agent 能力等方面可匹配参数多至 4 倍的竞品。

    推荐理由:原文给出了模型的关键参数、性能基准和与竞品的对比数据,读者可以据此评估其在特定行业的适用性。

10月2日周五
  1. Hacker News · 首页76

    Cloudflare 发布开源决策模型 Clef 和 Clef-flash,上线 RL 微调平台

    Cloudflare 发布两款决策模型 Clef 和 Clef-flash,均基于 Qwen 微调,支持文本和图像分类,在 Jev Decision Index 评估中领先。Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,均优于 Jev 的 524.1ms。两款模型已开源至 Hugging Face 并托管于 Workers AI,同时推出 RL 微调服务供客户定制。

    推荐理由:原文给出了与 Jev 的基准对比和延迟数据,读者可以判断决策模型在特定场景下是否比通用 LLM 更适合。

10月1日周四
  1. Reddit · r/LocalLLaMA76

    BiliBili Index-Translate 发布:支持150种语言,含文档翻译和多语言字幕配音功能

    BiliBili Index LLM 团队发布 Index-Translate 翻译工具,支持150种语言,提供2B、9B和35B-A3B(预览版)三个版本。支持自定义术语、写作风格和输出格式。

    推荐理由:原文给出了支持的语言数量、模型规格和具体功能,读者可以判断它与传统翻译工具的差异以及适用场景。

  2. Hacker News · 最佳81

    Google 发布 Gemini 4 Argon 旗舰模型

    Google 正式发布 Gemini 4 Argon 旗舰模型,定价为输入每百万 token 2 美元、输出每百万 token 10 美元,上下文窗口扩展至 100 万 token。

    推荐理由:原文披露了定价、多个基准测试分数和内部应用案例,读者可以据此评估该模型相对于前代和其他竞品的实际能力提升幅度。

  3. Google DeepMind77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。

    推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。

9月30日周三
  1. Hugging Face Blog70

    Hugging Face 发布 Open TTS Leaderboard:开源多语言 TTS 与语音克隆的可扩展评估

    Hugging Face 发布 Open TTS Leaderboard,使用客观指标(WER/CER 可理解性、RTFx 推理速度、TTFA 首音频延迟、SIM 说话人相似度)评估开源 TTS 模型,解决 arena 方式无法跟上模型发布速度的问题。

    推荐理由:给出了具体的评估指标和部分模型排名,读者可以直接查看 leaderboard 了解各开源 TTS 模型的可理解性和速度表现。

  2. The Decoder76

    AMD 82亿美元收购 AI 世界模型创业公司 World Labs

    AMD 以约 82 亿美元全股票交易收购 AI 创业公司 World Labs,AI 先锋李飞飞将加入 AMD 担任执行副总裁兼首席科学家。该交易预计 2026 年底完成。

    推荐理由:AMD 通过收购获取 world model 团队及其技术理念,反映了 AI 芯片竞争正从硬件向软硬件协同演进,读者可据此理解未来 AI 硬件路线的新变量。

9月29日周二
  1. Microsoft Research66

    微软发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。

    推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。

  2. TechCrunch · AI77

    AMD 82亿美元收购李飞飞World Labs

    AMD宣布以82亿美元收购李飞飞创办的World Labs,李飞飞将加入AMD担任执行副总裁兼首席科学家。World Labs开发用于理解物理现实的世界模型,其产品Marble可用于娱乐体验和机器人训练模拟。该交易预计年底前完成,将帮助AMD与Nvidia在AI专用芯片生态领域竞争。

    推荐理由:原文给出了收购金额、李飞飞的新职位、以及AMD与Nvidia的竞争态势,读者可据此了解AI芯片格局的变化。

9月26日周六
  1. AWS Machine Learning Blog60

    在 AWS SageMaker HyperPod 上使用 SkyRL 加速多模态 RL 训练

    本文详细介绍了在 Amazon SageMaker HyperPod 上使用开源 SkyRL 框架训练多模态强化学习模型的全流程,包括构建容器镜像、从 SageMaker Studio 启动 Ray 集群、提交训练任务、监控进度以及托管推理服务。

    推荐理由:给出了完整的操作流程和实验数据,读者可以据此在 SageMaker HyperPod 上复现多模态 RL 训练。

  2. AWS Machine Learning Blog70

    在 Amazon SageMaker AI 上部署 Qwen3-TTS 实现实时个性化语音

    本文介绍如何在 Amazon SageMaker AI 上部署 Qwen3-TTS-12Hz-1.7B-Base 模型进行实时语音克隆。该模型支持 10 种语言,可从几秒参考音频中提取说话者的音色、音调和节奏特征,生成新文本的语音,无需重新训练。

    推荐理由:原文给出了完整的部署步骤、GPU配置、代码示例和监控方法,读者可以照着在 AWS SageMaker 上搭建自己的语音克隆服务。

9月25日周五
  1. Google Research64

    Google Research 提出多智能体框架实现连贯长视频生成

    Google Research 发布多个研究框架(Co-Director、CANVAS、A²RD、VQQA)用于解决长视频生成的连贯性问题。AI video co-director 将视频叙事建模为全局优化问题,通过多智能体分层架构协调创意策略;CANVAS 维护视觉记忆确保角色和场景一致性;A²RD 支持分钟级视频的自主生成;VQQA 通过视觉问答实现闭环优化。

    推荐理由:原文提出了多个解决长视频一致性问题的框架,读者可以了解如何通过多智能体协作和世界状态跟踪来改善视频生成的连贯性。

  2. Google DeepMind70

    Gemini 3.8 Live 推出 Live Avatar 功能,实现实时视觉呈现

    Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,实现近实时视频生成与语音同步,支持精确口型同步、自然表情和 97 种语言无缝切换。该功能现已在 Gemini Enterprise 可用,企业可定制头像(仅限白名单)。所有输出均带有 SynthID 水印以确保透明度。

    推荐理由:原文给出了具体的能力变化和可用范围,读者可以据此判断它对现有工作流的影响。

9月24日周四
  1. AWS Machine Learning Blog68

    AWS 发布基于智能体的对话式视频智能解决方案

    AWS 发布了基于 Strands Agents SDK 的对话式视频智能解决方案,整合 Amazon Bedrock、Rekognition 和 Transcribe,允许用户用自然语言提问视频内容。该方案在运行时动态决定调用哪些服务,无需为每种查询类型预建管道。已有客户使用后手动审查时间减少约 80%。完整实现已开源。

    推荐理由:给出了基于 Strands Agents SDK 的视频智能架构完整实现方案,读者可据此复用到其他模态。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Text-to-Speech

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新的文本转语音模型,在 Hume AI Voice Design Benchmark 获得第一。

    推荐理由:原文给出了具体的能力变化和开放入口,读者可以据此判断它会怎样改变现有的语音生成工作流。

9月18日周五