跳到正文

#多模态

今日 1 条

一手 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
10月7日周三
10月6日周二
  1. Mistral AI85

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。

    推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。

10月1日周四
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。

    推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。

9月30日周三
  1. Hugging Face Blog70

    Hugging Face 发布 Open TTS Leaderboard:开源多语言 TTS 与语音克隆的可扩展评估

    Hugging Face 发布 Open TTS Leaderboard,使用客观指标(WER/CER 可理解性、RTFx 推理速度、TTFA 首音频延迟、SIM 说话人相似度)评估开源 TTS 模型,解决 arena 方式无法跟上模型发布速度的问题。

    推荐理由:给出了具体的评估指标和部分模型排名,读者可以直接查看 leaderboard 了解各开源 TTS 模型的可理解性和速度表现。

  2. Google Research59

    Google发布Diffusion Controller:统一并简化AI图像生成控制

    Google Research提出Diffusion Controller框架,将图像生成的去噪过程重新定义为连续控制问题。该框架通过轻量级的“转向阻尼器”网络实现对生成轨迹的动态调整,可在不修改基础模型的情况下控制生成结果。在Stable Diffusion v1.4上的实验显示,灰盒版本在HPS-v2胜率上优于LoRA,白盒版本相较基线模型达到90%胜率。

9月29日周二
  1. Microsoft Research66

    微软发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。

    推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。

  2. AWS Machine Learning Blog48

    如何在 SageMaker AI 上用 vLLM-Omni 生成图像和视频(下篇)

    在 Amazon SageMaker AI 上使用 vLLM-Omni 容器部署两个端点,通过文本提示词生成静态图像(FLUX.2-klein-4B 实时端点),再将该图像作为条件输入生成视频(Wan2.1-VACE-1.3B 异步端点)。图像直接返回,视频生成完成后从 Amazon S3 检索 MP4 文件,示例包含命令行工作流和 Streamlit 界面。

9月26日周六
  1. AWS Machine Learning Blog60

    在 AWS SageMaker HyperPod 上使用 SkyRL 加速多模态 RL 训练

    本文详细介绍了在 Amazon SageMaker HyperPod 上使用开源 SkyRL 框架训练多模态强化学习模型的全流程,包括构建容器镜像、从 SageMaker Studio 启动 Ray 集群、提交训练任务、监控进度以及托管推理服务。

    推荐理由:给出了完整的操作流程和实验数据,读者可以据此在 SageMaker HyperPod 上复现多模态 RL 训练。

  2. AWS Machine Learning Blog70

    在 Amazon SageMaker AI 上部署 Qwen3-TTS 实现实时个性化语音

    本文介绍如何在 Amazon SageMaker AI 上部署 Qwen3-TTS-12Hz-1.7B-Base 模型进行实时语音克隆。该模型支持 10 种语言,可从几秒参考音频中提取说话者的音色、音调和节奏特征,生成新文本的语音,无需重新训练。

    推荐理由:原文给出了完整的部署步骤、GPU配置、代码示例和监控方法,读者可以照着在 AWS SageMaker 上搭建自己的语音克隆服务。

9月25日周五
  1. AWS Machine Learning Blog33

    Datacor 如何用 Amazon QuickSight 为气体分销商构建自助式租赁分析

    Datacor 将 Amazon QuickSight 集成到其 TrackAbout 解决方案中,为气体和焊接分销商提供自助式租赁分析,业务用户可通过自然语言提问实时获取数据洞察。TrackAbout 客户共管理 2750 万个资产,每月处理 72.5 万张账单。该方案采用跨云数据管道定期刷新 QuickSight SPICE 数据集,确保仪表板反映最新运营数据。

  2. Google Research64

    Google Research 提出多智能体框架实现连贯长视频生成

    Google Research 发布多个研究框架(Co-Director、CANVAS、A²RD、VQQA)用于解决长视频生成的连贯性问题。AI video co-director 将视频叙事建模为全局优化问题,通过多智能体分层架构协调创意策略;CANVAS 维护视觉记忆确保角色和场景一致性;A²RD 支持分钟级视频的自主生成;VQQA 通过视觉问答实现闭环优化。

    推荐理由:原文提出了多个解决长视频一致性问题的框架,读者可以了解如何通过多智能体协作和世界状态跟踪来改善视频生成的连贯性。

  3. Google DeepMind70

    Gemini 3.8 Live 推出 Live Avatar 功能,实现实时视觉呈现

    Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,实现近实时视频生成与语音同步,支持精确口型同步、自然表情和 97 种语言无缝切换。该功能现已在 Gemini Enterprise 可用,企业可定制头像(仅限白名单)。所有输出均带有 SynthID 水印以确保透明度。

    推荐理由:原文给出了具体的能力变化和可用范围,读者可以据此判断它对现有工作流的影响。

9月24日周四
  1. AWS Machine Learning Blog68

    AWS 发布基于智能体的对话式视频智能解决方案

    AWS 发布了基于 Strands Agents SDK 的对话式视频智能解决方案,整合 Amazon Bedrock、Rekognition 和 Transcribe,允许用户用自然语言提问视频内容。该方案在运行时动态决定调用哪些服务,无需为每种查询类型预建管道。已有客户使用后手动审查时间减少约 80%。完整实现已开源。

    推荐理由:给出了基于 Strands Agents SDK 的视频智能架构完整实现方案,读者可据此复用到其他模态。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Text-to-Speech

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新的文本转语音模型,在 Hume AI Voice Design Benchmark 获得第一。

    推荐理由:原文给出了具体的能力变化和开放入口,读者可以据此判断它会怎样改变现有的语音生成工作流。

9月21日周一
9月18日周五
9月16日周三
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking

    Google DeepMind 发布两款新的实时对话模型:Gemini 3.8 Live 注重规模化和成本效率,结合对话智能与流畅交互;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备增强智能和多步推理能力。

    推荐理由:原文给出了具体性能数据(82.6% Speech to Speech Quality Index、68.6% τ-Voice 等)和多个平台可用入口,读者可据此判断该模型相对现有产品的能力提升和适用场景。

9月15日周二
  1. NVIDIA Blog31

    费城儿童医院如何用开源NVIDIA AI为先天性心脏病儿童建模心脏

    费城儿童医院(CHOP)基于NVIDIA开源医学影像框架MONAI,将过去需要4小时的心脏建模工作缩短至几秒。美国20多家儿童医院已开展心脏建模项目,波士顿儿童医院约50%的心脏手术(约每年500例)获建模支持。CHOP正结合NVIDIA Warp和Newton物理引擎,目标将模拟仿真引入临床工作流程,实现同日决策。

9月10日周四
9月9日周三
9月8日周二
9月3日周四
  1. Google DeepMind78

    Google DeepMind 发布 WeatherNext 3:迄今最先进、最准确的全球天气 AI 模型

    Google DeepMind 发布 WeatherNext 3,这是迄今最先进、最准确的全球天气 AI 模型。新模型使用实时卫星数据训练,每小时更新一次,分辨率 5-25 公里,比上一代 WeatherNext 2 清晰约 5 倍。

    推荐理由:原文给出了具体的性能提升数据(CRPS 提升 60%/30%/10%),分辨率提升 5 倍,与上一代 WeatherNext 2 有明确对比,读者可以据此判断模型的实际进步幅度。

  2. Hugging Face Blog63

    NeoMME:高效的多模态原生多语言编码器

    Hugging Face发布NeoMME,一个包含260M和800M参数的多语言多模态编码器系列。该模型不使用独立的预训练视觉塔或因果语言模型,而是用单一双向Transformer处理文本token和原始图像patch,通过masked discrete-diffusion目标从头训练。

    推荐理由:该模型展示了单一Transformer处理多模态的架构创新,在ViDoRe v3基准测试中以更小参数达到接近最优的nDCG@10,读者可了解新的多模态编码器设计思路。

9月2日周三
  1. Google Research62

    Google 与 NASA 合作利用深度学习从太空绘制全球甲烷排放图

    Google 与 NASA JPL 合作发布了 MAPL-EMIT 深度学习框架,可从 EMIT 卫星高光谱图像中自动检测、量化并定位甲烷排放源。该模型在专家标注的 plumes 上达到 84% 召回率,比现有方法多检测约 50% 的可信 plumes,并在全球 25 个最大排放填埋场中的 24 个成功绘制了羽流。

    推荐理由:原文给出了具体性能指标(84%召回率、比现有方法多检测50% plumes)和数据集规模(3.6万个合成 plumes),提供了可迁移的环境监测方法论。

  2. Google DeepMind74

    Google DeepMind 推出 Gemini 智能体视频理解功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解功能,该功能将模型核心推理与原生视频工具结合,动态搜索和检查目标视频片段,相比静态处理可降低最多 88% 的 token 消耗和 66% 的成本,同时提升最多 7% 的准确率。

    推荐理由:原文给出了 token 消耗降低 88%、成本降低 66%、质量提升 7% 的具体数据,读者可以据此评估该功能对自身工作流的效率提升。

8月28日周五
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,带来场景扩展、首尾帧插值、360p 快速预览和 4K 超分辨率等创意控制功能。新模型支持最长 40 秒视频生成,可在 Google AI Studio 和 Agent Platform API 中使用,也可通过 Google AI Plus、Pro 和 Ultra 订阅在 Google Flow 中访问。

    推荐理由:提供了具体的性能提升数据和可用性信息,读者可以评估新模型对自己工作流的实际价值。

8月27日周四
8月26日周三
8月25日周二
  1. Mistral AI65

    Mistral 与 HUMAIN 达成战略合作,推动沙特及中东地区主权 AI 发展

    Mistral 与 HUMAIN 宣布战略合作,合作金额达数亿欧元。双方将在 AI 基础设施、先进模型开发和 AI 解决方案部署方面合作,初始重点领域包括网络安全和语音,并计划开发在阿拉伯语方面表现优异的前沿模型。合作旨在满足主权 AI 需求,确保数据、推理和运营在客户控制范围内,主要面向金融、制造、电信、网络安全和公共部门等受监管行业。

    推荐理由:这是 AI 基础设施和主权 AI 领域的跨国合作案例,读者可以据此了解欧洲 AI 公司在中东的布局策略和主权 AI 的具体落地模式。

8月21日周五
  1. Google Research48

    Google Research 如何用 ME-POIs 框架让语言模型更深入理解地点

    Google Research 推出 Mobility-Embedded POIs 框架,通过将聚合匿名移动模式(如到达时间、停留时长)融入地点的文本表征,解决传统语言模型仅依赖静态元数据的问题。该方法在意图预测、价格分类和繁忙度估计上分别实现 81.9%、75.1% 和 24.7% 的相对提升。框架采用访问对齐、空间多尺度传播和文本-移动协同三步流程,有效缓解了中小商户数据稀疏的"长尾"难题。

8月13日周四
  1. Microsoft Research69

    MindTopo 揭示多模态大语言模型的拓扑推理能力

    Microsoft Research 发布 MindTopo 基准测试,用于评估多模态大语言模型对拓扑属性的理解能力,包括连通性、包围、顺序、分离和打结。测试分为静态推理和交互式规划两类任务。

    推荐理由:该研究提出了一个评估拓扑推理的新基准,揭示了当前多模态模型在静态识别和交互规划任务上的显著差距,为机器人学和交互式 AI 系统的发展提供了诊断工具。

8月12日周三
  1. Google DeepMind66

    Google DeepMind 发布 SL2T 手语转文本模型

    Google DeepMind 推出突破性的多语言手语转文本模型 SL2T,训练数据涵盖 50 多种手语超过 10 万小时。该模型首次将手语 AI 带入消费产品,已在 Gboard 和 Live Transcribe 的 Pixel 11 上线,支持美式手语转英语。

    推荐理由:首个将手语 AI 实际带入消费产品的突破,在 FLEURS-ASL 基准上实现了 70 BLEURT 的零样本成绩,可供读者了解当前手语 AI 的实际可用性。