跳到正文

#多模态

今日 6 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
9月30日周三
  1. Google Research59

    Google发布Diffusion Controller:统一并简化AI图像生成控制

    Google Research提出Diffusion Controller框架,将图像生成的去噪过程重新定义为连续控制问题。该框架通过轻量级的“转向阻尼器”网络实现对生成轨迹的动态调整,可在不修改基础模型的情况下控制生成结果。在Stable Diffusion v1.4上的实验显示,灰盒版本在HPS-v2胜率上优于LoRA,白盒版本相较基线模型达到90%胜率。

  2. TechCrunch · AI58

    OpenAI 在 Dev Day 发布 ChatGPT 办公套件功能,挑战 Microsoft

    OpenAI 在旧金山 Dev Day 开发者大会上发布面向办公场景的新功能:Space(共享工作空间,支持用户与 AI 智能体 Dots 协作)、Pages(协作文档处理工具,对标 Google Docs 和 Word)以及 collaborative slides(语音生成演示文稿,对标 PowerPoint)。这些功能标志着 OpenAI 正式进入 Microsoft 的办公软件领地。

  3. The Decoder76

    AMD 82亿美元收购 AI 世界模型创业公司 World Labs

    AMD 以约 82 亿美元全股票交易收购 AI 创业公司 World Labs,AI 先锋李飞飞将加入 AMD 担任执行副总裁兼首席科学家。该交易预计 2026 年底完成。

    推荐理由:AMD 通过收购获取 world model 团队及其技术理念,反映了 AI 芯片竞争正从硬件向软硬件协同演进,读者可据此理解未来 AI 硬件路线的新变量。

9月29日周二
  1. Hacker News · 最佳48

    Google搜索什么时候变得这么"奇怪"了?

    用户在Google搜索"hes never coming over dario"查找关于NBA球员Dario Saric的老推文时,AI Overview没有提供相关链接,而是假设用户被名为Dario的人拒绝,主动提供情感安慰。用户认为这违反了Google"组织世界信息并使其普遍可访问和有用"的使命,质疑搜索引擎何时变成了需要情感对话的工具。

  2. Microsoft Research66

    微软发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。

    推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。

  3. Product Hunt · AI 分类28

    Gauth 推出 Unlimited Digital Canvas

    Gauth 是一个全能 AI 学习平台,自 2020 年起累计下载量超过 2 亿。该平台结合分步解题、交互式 AI 辅导和个性化学习工具,帮助学生理解概念并更有效地备考。

  4. TechCrunch · AI77

    AMD 82亿美元收购李飞飞World Labs

    AMD宣布以82亿美元收购李飞飞创办的World Labs,李飞飞将加入AMD担任执行副总裁兼首席科学家。World Labs开发用于理解物理现实的世界模型,其产品Marble可用于娱乐体验和机器人训练模拟。该交易预计年底前完成,将帮助AMD与Nvidia在AI专用芯片生态领域竞争。

    推荐理由:原文给出了收购金额、李飞飞的新职位、以及AMD与Nvidia的竞争态势,读者可据此了解AI芯片格局的变化。

  5. AWS Machine Learning Blog48

    如何在 SageMaker AI 上用 vLLM-Omni 生成图像和视频(下篇)

    在 Amazon SageMaker AI 上使用 vLLM-Omni 容器部署两个端点,通过文本提示词生成静态图像(FLUX.2-klein-4B 实时端点),再将该图像作为条件输入生成视频(Wan2.1-VACE-1.3B 异步端点)。图像直接返回,视频生成完成后从 Amazon S3 检索 MP4 文件,示例包含命令行工作流和 Streamlit 界面。

9月27日周日
  1. Hacker News · 最佳40

    什么是 Slop UI:AI 生成界面的典型特征分析

    Slop UI 是指 AI 生成的外观不协调、缺乏目的性或过于通用的用户界面。主要特征包括:滥用渐变色和彩虹配色、无意义的脉冲徽章、过度使用的"指甲"卡片元素、表情符号泛滥、界面元素错位、依赖 Inter 或 JetBrains Mono 等通用字体、以及玻璃拟态和"提升""无缝"等空洞的营销标语。作者认为 vibecoding 本身没问题,但开发者需要投入更多精力进行设计优化。

  2. Reddit · r/MachineLearning59

    InternLM 团队发布 Intern-Decision 多模态模型系列

    发布了 Intern-Decision 多模态模型系列(0.8B、2B、4B),其中 4B 模型在性能上优于 Jev 1.13.0。在 RTX 4090 上实测本地部署可达到约 30 FPS 的决策调用速度。团队还建立了基准测试来评估校准性能,在掷骰子和蒙特霍尔问题等经典概率场景中,该模型的预测分布比 Jev 更接近黄金分布。

  3. Reddit · r/MachineLearning62

    开发者训练500M参数VLM用于图像问题回答,400ms内在Mac上输出校准概率

    开发者训练了一个500M参数的视觉语言模型peekaboolean,可回答选择题、评分题和判断题,输出校准概率。模型基于SmolVLM-500M-Instruct,使用Qwen3-VL-30B-A3B作为教师模型生成约175k个问题进行蒸馏。在M1 Pro上延迟约400ms,在桌面GPU上约60ms。公开了代码和权重,采用CC BY-NC 4.0和Apache-2.0许可。

9月26日周六
  1. AWS Machine Learning Blog60

    在 AWS SageMaker HyperPod 上使用 SkyRL 加速多模态 RL 训练

    本文详细介绍了在 Amazon SageMaker HyperPod 上使用开源 SkyRL 框架训练多模态强化学习模型的全流程,包括构建容器镜像、从 SageMaker Studio 启动 Ray 集群、提交训练任务、监控进度以及托管推理服务。

    推荐理由:给出了完整的操作流程和实验数据,读者可以据此在 SageMaker HyperPod 上复现多模态 RL 训练。

  2. AWS Machine Learning Blog70

    在 Amazon SageMaker AI 上部署 Qwen3-TTS 实现实时个性化语音

    本文介绍如何在 Amazon SageMaker AI 上部署 Qwen3-TTS-12Hz-1.7B-Base 模型进行实时语音克隆。该模型支持 10 种语言,可从几秒参考音频中提取说话者的音色、音调和节奏特征,生成新文本的语音,无需重新训练。

    推荐理由:原文给出了完整的部署步骤、GPU配置、代码示例和监控方法,读者可以照着在 AWS SageMaker 上搭建自己的语音克隆服务。

9月25日周五
  1. AWS Machine Learning Blog33

    Datacor 如何用 Amazon QuickSight 为气体分销商构建自助式租赁分析

    Datacor 将 Amazon QuickSight 集成到其 TrackAbout 解决方案中,为气体和焊接分销商提供自助式租赁分析,业务用户可通过自然语言提问实时获取数据洞察。TrackAbout 客户共管理 2750 万个资产,每月处理 72.5 万张账单。该方案采用跨云数据管道定期刷新 QuickSight SPICE 数据集,确保仪表板反映最新运营数据。

  2. Google Research64

    Google Research 提出多智能体框架实现连贯长视频生成

    Google Research 发布多个研究框架(Co-Director、CANVAS、A²RD、VQQA)用于解决长视频生成的连贯性问题。AI video co-director 将视频叙事建模为全局优化问题,通过多智能体分层架构协调创意策略;CANVAS 维护视觉记忆确保角色和场景一致性;A²RD 支持分钟级视频的自主生成;VQQA 通过视觉问答实现闭环优化。

    推荐理由:原文提出了多个解决长视频一致性问题的框架,读者可以了解如何通过多智能体协作和世界状态跟踪来改善视频生成的连贯性。

  3. Google DeepMind70

    Gemini 3.8 Live 推出 Live Avatar 功能,实现实时视觉呈现

    Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,实现近实时视频生成与语音同步,支持精确口型同步、自然表情和 97 种语言无缝切换。该功能现已在 Gemini Enterprise 可用,企业可定制头像(仅限白名单)。所有输出均带有 SynthID 水印以确保透明度。

    推荐理由:原文给出了具体的能力变化和可用范围,读者可以据此判断它对现有工作流的影响。

9月24日周四
  1. Ars Technica · AI56

    Meta 将 AI 助手整合到智能眼镜和钥匙扣设备

    Meta 发布新一代 Ray-Ban 智能眼镜和无摄像头的音频交互版本,并宣布将 AI 助手 Muse 整合到智能眼镜中。用户可佩戴眼镜使用全息数字Avatar进行视频通话。Meta 是目前唯一推出消费级 AI 智能体的大厂,Muse 可访问用户社交平台数据实现高度个性化,但需说服用户开放个人数据权限。

  2. AWS Machine Learning Blog68

    AWS 发布基于智能体的对话式视频智能解决方案

    AWS 发布了基于 Strands Agents SDK 的对话式视频智能解决方案,整合 Amazon Bedrock、Rekognition 和 Transcribe,允许用户用自然语言提问视频内容。该方案在运行时动态决定调用哪些服务,无需为每种查询类型预建管道。已有客户使用后手动审查时间减少约 80%。完整实现已开源。

    推荐理由:给出了基于 Strands Agents SDK 的视频智能架构完整实现方案,读者可据此复用到其他模态。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Text-to-Speech

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新的文本转语音模型,在 Hume AI Voice Design Benchmark 获得第一。

    推荐理由:原文给出了具体的能力变化和开放入口,读者可以据此判断它会怎样改变现有的语音生成工作流。

  2. Latent Space31

    Radical Numerics CEO Eric Nguyen:生物安全是 AI 军备竞赛

    Radical Numerics 联合创始人 Eric Nguyen 解释为何用于增强生物学能力的基因组语言模型(GLM)也可用于防御。文章讨论了 Evo 和 Evo 2 等模型如何从零开始构建基因组,以及当模型"用 DNA 语言思考"时是否能像大语言模型一样实现链式推理。Radical Numerics 认为生物安全是一场军备竞赛,防御方必须紧跟前沿模型的攻击能力。

9月22日周二
  1. Ben's Bites21

    Jev 能做什么:面向构建者的文本处理工具

    Jev 现已向所有人开放,它不同于传统 LLM,专为构建者设计,可嵌入工具内部使用,用户只需输入文本并提出具体问题如"这是广告吗"、"归入哪个文件夹"或"相关性评分"。社区已开发出 YouTube 跳过赞助片段、Gmail 按意图搜索、实时过滤负面评论、Mac 语音控制等多种用例。

9月21日周一
9月18日周五
  1. The Rundown AI42

    Meta 推出无摄像头智能眼镜 Luna,侧重音频 AI 助手功能

    Meta 计划推出代号为 Luna 的新款智能眼镜,移除摄像头改为配备 6 个麦克风,支持与 Meta AI 和 Muse 助手语音交互。该产品预计在 9 月 23-24 日的 Connect 大会上发布,10 月发货,提供 Clubmaster 和 Burbank 两种经典款式。Luna 将测试仅通过语音助手是否足以让用户全天佩戴智能眼镜,从而开拓不想在脸上装摄像头的用户市场。

9月17日周四
  1. Ben's Bites20

    Claude Cowork 与 Claude Chat 合并

    Claude Cowork 不再是独立标签页,所有关联应用、技能和上下文现在整合到普通 Claude.ai 聊天中,并支持后台持续运行。Claude Artifacts 推出 Docs 和 Slides 专用产品,Claude Code 实验版更名为 Claude Mods,可自定义应用外观与行为。

  2. Product Hunt · AI 分类35

    Syllaby AI 数字人 2.0 发布

    Syllaby 推出 AI 数字人 2.0,可将脚本或简单想法转化为由逼真 AI 数字人主持的视频,包含自然语音、B-roll 素材和字幕,无需雇佣演员。该工具支持快速创建主持人视频,当前在 Product Hunt 发布。

9月16日周三
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking

    Google DeepMind 发布两款新的实时对话模型:Gemini 3.8 Live 注重规模化和成本效率,结合对话智能与流畅交互;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备增强智能和多步推理能力。

    推荐理由:原文给出了具体性能数据(82.6% Speech to Speech Quality Index、68.6% τ-Voice 等)和多个平台可用入口,读者可据此判断该模型相对现有产品的能力提升和适用场景。

9月15日周二
  1. NVIDIA Blog31

    费城儿童医院如何用开源NVIDIA AI为先天性心脏病儿童建模心脏

    费城儿童医院(CHOP)基于NVIDIA开源医学影像框架MONAI,将过去需要4小时的心脏建模工作缩短至几秒。美国20多家儿童医院已开展心脏建模项目,波士顿儿童医院约50%的心脏手术(约每年500例)获建模支持。CHOP正结合NVIDIA Warp和Newton物理引擎,目标将模拟仿真引入临床工作流程,实现同日决策。