#多模态
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#多模态
今日 6 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/MachineLearningAI 评分1313 医学影像元学习:当前有哪些热门研究方向?
一位医学影像元学习方向的新博士生在寻求研究方向建议,已了解少样本学习、组织病理学数据集、基础模型适应和领域泛化。提问者对MICCAI挑战赛较感兴趣,希望寻找与解决数据有限问题相关的前沿课题。
Google ResearchAI 评分5959 Google发布Diffusion Controller:统一并简化AI图像生成控制
Google Research提出Diffusion Controller框架,将图像生成的去噪过程重新定义为连续控制问题。该框架通过轻量级的“转向阻尼器”网络实现对生成轨迹的动态调整,可在不修改基础模型的情况下控制生成结果。在Stable Diffusion v1.4上的实验显示,灰盒版本在HPS-v2胜率上优于LoRA,白盒版本相较基线模型达到90%胜率。
TechCrunch · AIAI 评分5858 OpenAI 在 Dev Day 发布 ChatGPT 办公套件功能,挑战 Microsoft
OpenAI 在旧金山 Dev Day 开发者大会上发布面向办公场景的新功能:Space(共享工作空间,支持用户与 AI 智能体 Dots 协作)、Pages(协作文档处理工具,对标 Google Docs 和 Word)以及 collaborative slides(语音生成演示文稿,对标 PowerPoint)。这些功能标志着 OpenAI 正式进入 Microsoft 的办公软件领地。
The Decoder精选AI 评分7676 AMD 82亿美元收购 AI 世界模型创业公司 World Labs
AMD 以约 82 亿美元全股票交易收购 AI 创业公司 World Labs,AI 先锋李飞飞将加入 AMD 担任执行副总裁兼首席科学家。该交易预计 2026 年底完成。
推荐理由:AMD 通过收购获取 world model 团队及其技术理念,反映了 AI 芯片竞争正从硬件向软硬件协同演进,读者可据此理解未来 AI 硬件路线的新变量。
AWS Machine Learning BlogAI 评分3434 Condé Nast 如何用 Amazon Bedrock 构建多模态视频发现系统
Condé Nast 联合 AWS Generative AI Innovation Center 基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型实现跨视频文字记录、视觉元素和音频的语义搜索。
Reddit · r/LocalLLaMAAI 评分6969 我花15天微调了一个4B模型用于商业决策,在JevBench排名超越GPT-5.6 Luna
作者基于Qwen3.5-4B用LoRA微调了一个专注商业决策的模型ImaJev-4b,可处理文本和图片输入,在JevBench(91个模型)排名第一,得分67.37超越Jev(63.29),在DecisionBench(56个模型)排名第三,超越GPT-5.6 Luna和DeepSeek V4.1。
Hacker News · 最佳AI 评分4848 Google搜索什么时候变得这么"奇怪"了?
用户在Google搜索"hes never coming over dario"查找关于NBA球员Dario Saric的老推文时,AI Overview没有提供相关链接,而是假设用户被名为Dario的人拒绝,主动提供情感安慰。用户认为这违反了Google"组织世界信息并使其普遍可访问和有用"的使命,质疑搜索引擎何时变成了需要情感对话的工具。
Microsoft Research精选AI 评分6666 微软发布 Quine:面向生物学复杂性的 AI 研究系统
微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。
推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。
TechCrunch · AIAI 评分4343 Marissa Mayer 推出 Dazzle:基于相机胶卷构建个人画像的 AI 助手
前 Yahoo CEO Marissa Mayer 推出个人 AI 助手 Dazzle,通过分析用户手机相册而非邮件、日历来构建用户画像,了解用户爱好、旅行、饮食等偏好。
Product Hunt · AI 分类AI 评分2828 Gauth 推出 Unlimited Digital Canvas
Gauth 是一个全能 AI 学习平台,自 2020 年起累计下载量超过 2 亿。该平台结合分步解题、交互式 AI 辅导和个性化学习工具,帮助学生理解概念并更有效地备考。
Latent SpaceAI 评分7272 AMD 以 82 亿美元收购 World Labs,Atlas 模型解决空间智能稀疏重建难题
AMD 以 82 亿美元收购 World Labs。World Labs 近期发布了 Atlas,这是首个全能模型架构,能够从 2D 图像预测新视角,解决了计算机视觉中长期存在的稀疏重建问题,将生成模型与多视角几何相结合,其性能超越现有专业模型。
Latent SpaceAI 评分2929 Claude Opus 5.5 在解释者视频方面表现出色
Claude Opus 5.5 现已在 SimpleBench 达到 88.4% 领先分数,视觉评估优于 Fable 5 和 GPT-6 Sol,但不及 GPT-6 Astra,成本比 Fable 5.1 低约 60%。
Product Hunt · AI 分类AI 评分5959 Elevenlabs 发布 Eleven v4 和 v4 Turbo 语音模型
Elevenlabs 发布了最新语音模型 Eleven v4 和 v4 Turbo,号称公司最快、最有表现力的模型。v4 Turbo 版本专为实时应用设计,可在应用、API 和智能体中使用。
TechCrunch · AI精选AI 评分7777 AMD 82亿美元收购李飞飞World Labs
AMD宣布以82亿美元收购李飞飞创办的World Labs,李飞飞将加入AMD担任执行副总裁兼首席科学家。World Labs开发用于理解物理现实的世界模型,其产品Marble可用于娱乐体验和机器人训练模拟。该交易预计年底前完成,将帮助AMD与Nvidia在AI专用芯片生态领域竞争。
推荐理由:原文给出了收购金额、李飞飞的新职位、以及AMD与Nvidia的竞争态势,读者可据此了解AI芯片格局的变化。
AWS Machine Learning BlogAI 评分4848 如何在 SageMaker AI 上用 vLLM-Omni 生成图像和视频(下篇)
在 Amazon SageMaker AI 上使用 vLLM-Omni 容器部署两个端点,通过文本提示词生成静态图像(FLUX.2-klein-4B 实时端点),再将该图像作为条件输入生成视频(Wan2.1-VACE-1.3B 异步端点)。图像直接返回,视频生成完成后从 Amazon S3 检索 MP4 文件,示例包含命令行工作流和 Streamlit 界面。
Hacker News · 最佳AI 评分4040 什么是 Slop UI:AI 生成界面的典型特征分析
Slop UI 是指 AI 生成的外观不协调、缺乏目的性或过于通用的用户界面。主要特征包括:滥用渐变色和彩虹配色、无意义的脉冲徽章、过度使用的"指甲"卡片元素、表情符号泛滥、界面元素错位、依赖 Inter 或 JetBrains Mono 等通用字体、以及玻璃拟态和"提升""无缝"等空洞的营销标语。作者认为 vibecoding 本身没问题,但开发者需要投入更多精力进行设计优化。
Reddit · r/MachineLearningAI 评分5959 InternLM 团队发布 Intern-Decision 多模态模型系列
发布了 Intern-Decision 多模态模型系列(0.8B、2B、4B),其中 4B 模型在性能上优于 Jev 1.13.0。在 RTX 4090 上实测本地部署可达到约 30 FPS 的决策调用速度。团队还建立了基准测试来评估校准性能,在掷骰子和蒙特霍尔问题等经典概率场景中,该模型的预测分布比 Jev 更接近黄金分布。
Reddit · r/MachineLearningAI 评分6262 开发者训练500M参数VLM用于图像问题回答,400ms内在Mac上输出校准概率
开发者训练了一个500M参数的视觉语言模型peekaboolean,可回答选择题、评分题和判断题,输出校准概率。模型基于SmolVLM-500M-Instruct,使用Qwen3-VL-30B-A3B作为教师模型生成约175k个问题进行蒸馏。在M1 Pro上延迟约400ms,在桌面GPU上约60ms。公开了代码和权重,采用CC BY-NC 4.0和Apache-2.0许可。
AWS Machine Learning Blog精选AI 评分6060 在 AWS SageMaker HyperPod 上使用 SkyRL 加速多模态 RL 训练
本文详细介绍了在 Amazon SageMaker HyperPod 上使用开源 SkyRL 框架训练多模态强化学习模型的全流程,包括构建容器镜像、从 SageMaker Studio 启动 Ray 集群、提交训练任务、监控进度以及托管推理服务。
推荐理由:给出了完整的操作流程和实验数据,读者可以据此在 SageMaker HyperPod 上复现多模态 RL 训练。
AWS Machine Learning Blog精选AI 评分7070 在 Amazon SageMaker AI 上部署 Qwen3-TTS 实现实时个性化语音
本文介绍如何在 Amazon SageMaker AI 上部署 Qwen3-TTS-12Hz-1.7B-Base 模型进行实时语音克隆。该模型支持 10 种语言,可从几秒参考音频中提取说话者的音色、音调和节奏特征,生成新文本的语音,无需重新训练。
推荐理由:原文给出了完整的部署步骤、GPU配置、代码示例和监控方法,读者可以照着在 AWS SageMaker 上搭建自己的语音克隆服务。
AWS Machine Learning BlogAI 评分3333 Datacor 如何用 Amazon QuickSight 为气体分销商构建自助式租赁分析
Datacor 将 Amazon QuickSight 集成到其 TrackAbout 解决方案中,为气体和焊接分销商提供自助式租赁分析,业务用户可通过自然语言提问实时获取数据洞察。TrackAbout 客户共管理 2750 万个资产,每月处理 72.5 万张账单。该方案采用跨云数据管道定期刷新 QuickSight SPICE 数据集,确保仪表板反映最新运营数据。
Latent SpaceAI 评分6565 Runway 发布 GWM Worlds 2 及 WorldPrompt:实时交互式世界模型的工程实现
Runway 推出 GWM Worlds 2 研究预览版,支持 720p 24fps 视频和 48kHz 音频的实时流式生成。其核心功能 WorldPrompt 允许用户通过提示词控制角色、相机和环境,区别于 Minecraft 等可脚本化的虚拟世界,它不提供状态控制能力但支持更灵活的按需生成。
Google Research精选AI 评分6464 Google Research 提出多智能体框架实现连贯长视频生成
Google Research 发布多个研究框架(Co-Director、CANVAS、A²RD、VQQA)用于解决长视频生成的连贯性问题。AI video co-director 将视频叙事建模为全局优化问题,通过多智能体分层架构协调创意策略;CANVAS 维护视觉记忆确保角色和场景一致性;A²RD 支持分钟级视频的自主生成;VQQA 通过视觉问答实现闭环优化。
推荐理由:原文提出了多个解决长视频一致性问题的框架,读者可以了解如何通过多智能体协作和世界状态跟踪来改善视频生成的连贯性。
Google DeepMind精选AI 评分7070 Gemini 3.8 Live 推出 Live Avatar 功能,实现实时视觉呈现
Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,实现近实时视频生成与语音同步,支持精确口型同步、自然表情和 97 种语言无缝切换。该功能现已在 Gemini Enterprise 可用,企业可定制头像(仅限白名单)。所有输出均带有 SynthID 水印以确保透明度。
推荐理由:原文给出了具体的能力变化和可用范围,读者可以据此判断它对现有工作流的影响。
Ars Technica · AIAI 评分5656 Meta 将 AI 助手整合到智能眼镜和钥匙扣设备
Meta 发布新一代 Ray-Ban 智能眼镜和无摄像头的音频交互版本,并宣布将 AI 助手 Muse 整合到智能眼镜中。用户可佩戴眼镜使用全息数字Avatar进行视频通话。Meta 是目前唯一推出消费级 AI 智能体的大厂,Muse 可访问用户社交平台数据实现高度个性化,但需说服用户开放个人数据权限。
Latent SpaceAI 评分6262 Meta Connect 2026 发布 Muse 智能体、VR 眼镜和 Muse Charm 设备
Meta 在 Connect 2026 大会上发布 Muse 个人 AI 智能体,新增语音和实时视频功能,支持 Mac 电脑使用和邮件处理,提供 1500+ 应用连接器。
AWS Machine Learning Blog精选AI 评分6868 AWS 发布基于智能体的对话式视频智能解决方案
AWS 发布了基于 Strands Agents SDK 的对话式视频智能解决方案,整合 Amazon Bedrock、Rekognition 和 Transcribe,允许用户用自然语言提问视频内容。该方案在运行时动态决定调用哪些服务,无需为每种查询类型预建管道。已有客户使用后手动审查时间减少约 80%。完整实现已开源。
推荐理由:给出了基于 Strands Agents SDK 的视频智能架构完整实现方案,读者可据此复用到其他模态。
Google DeepMind精选AI 评分7878 Google DeepMind 发布 Gemini 3.8 Text-to-Speech
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新的文本转语音模型,在 Hume AI Voice Design Benchmark 获得第一。
推荐理由:原文给出了具体的能力变化和开放入口,读者可以据此判断它会怎样改变现有的语音生成工作流。
Latent SpaceAI 评分3131 Radical Numerics CEO Eric Nguyen:生物安全是 AI 军备竞赛
Radical Numerics 联合创始人 Eric Nguyen 解释为何用于增强生物学能力的基因组语言模型(GLM)也可用于防御。文章讨论了 Evo 和 Evo 2 等模型如何从零开始构建基因组,以及当模型"用 DNA 语言思考"时是否能像大语言模型一样实现链式推理。Radical Numerics 认为生物安全是一场军备竞赛,防御方必须紧跟前沿模型的攻击能力。
OpenAI NewsAI 评分2222 invideo 如何用 GPT‑6 Astra 实现颜色分级提升 3 倍
GPT‑6 Astra 帮助 invideo 实现颜色校正和分级效率提升 3 倍,编辑规划精度显著提高。invideo 现在可在一日内生成 50 个自定义效果。
Ben's BitesAI 评分2121 Jev 能做什么:面向构建者的文本处理工具
Jev 现已向所有人开放,它不同于传统 LLM,专为构建者设计,可嵌入工具内部使用,用户只需输入文本并提出具体问题如"这是广告吗"、"归入哪个文件夹"或"相关性评分"。社区已开发出 YouTube 跳过赞助片段、Gmail 按意图搜索、实时过滤负面评论、Mac 语音控制等多种用例。
NVIDIA BlogAI 评分2929 5家 NVIDIA Inception 成员公司如何用 AI 推动清洁能源
ThinkLabs AI 利用 CUDA 平台构建数字孪生和 AI 智能体,将电网互连申请评估时间从 30-45 天缩短至 2 分钟。Redwood Materials 基于 NVIDIA Blackwell 平台,用 100% 回收电动车电池为 AI 工厂提供离网 power solutions,建设周期从数年缩短至数月。
The Rundown AIAI 评分4242 Meta 推出无摄像头智能眼镜 Luna,侧重音频 AI 助手功能
Meta 计划推出代号为 Luna 的新款智能眼镜,移除摄像头改为配备 6 个麦克风,支持与 Meta AI 和 Muse 助手语音交互。该产品预计在 9 月 23-24 日的 Connect 大会上发布,10 月发货,提供 Clubmaster 和 Burbank 两种经典款式。Luna 将测试仅通过语音助手是否足以让用户全天佩戴智能眼镜,从而开拓不想在脸上装摄像头的用户市场。
Google Research精选AI 评分6262 Google Research 发布利用生成式 UI 帮助教师创建互动学习工具的研究
Google Research 发布新研究实验,利用生成式用户界面(GenUI)技术帮助教育者创建定制的互动学习模拟工具。
推荐理由:这是 Google 将生成式 UI 技术应用于教育场景的研究实验,给出了具体的技术实现路径和教师反馈数据。
Ben's BitesAI 评分2020 Claude Cowork 与 Claude Chat 合并
Claude Cowork 不再是独立标签页,所有关联应用、技能和上下文现在整合到普通 Claude.ai 聊天中,并支持后台持续运行。Claude Artifacts 推出 Docs 和 Slides 专用产品,Claude Code 实验版更名为 Claude Mods,可自定义应用外观与行为。
Product Hunt · AI 分类AI 评分3535 Syllaby AI 数字人 2.0 发布
Syllaby 推出 AI 数字人 2.0,可将脚本或简单想法转化为由逼真 AI 数字人主持的视频,包含自然语音、B-roll 素材和字幕,无需雇佣演员。该工具支持快速创建主持人视频,当前在 Product Hunt 发布。
OpenAI NewsAI 评分3131 Hex 用 GPT-6 Astra 将复杂分析转化为可交互可视化报告
GPT-6 Astra 帮助 Hex 的数据智能体将分析答案转换为可交互的可视化报告,员工乐于分享这些报告。该功能由 OpenAI 发布。
Google DeepMind精选AI 评分7676 Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking
Google DeepMind 发布两款新的实时对话模型:Gemini 3.8 Live 注重规模化和成本效率,结合对话智能与流畅交互;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备增强智能和多步推理能力。
推荐理由:原文给出了具体性能数据(82.6% Speech to Speech Quality Index、68.6% τ-Voice 等)和多个平台可用入口,读者可据此判断该模型相对现有产品的能力提升和适用场景。
The Rundown AIAI 评分3333 Trump 和中国均否决 AI 放缓建议
Trump 和中国政府均拒绝了 Anthropic CEO Dario Amodei 提出的放缓前沿 AI 开发建议,Trump 在 Truth Social 上称 AI 威胁论是"hoax",北京则批评该提议是针对中国的"fear-mongering"。
NVIDIA BlogAI 评分3131 费城儿童医院如何用开源NVIDIA AI为先天性心脏病儿童建模心脏
费城儿童医院(CHOP)基于NVIDIA开源医学影像框架MONAI,将过去需要4小时的心脏建模工作缩短至几秒。美国20多家儿童医院已开展心脏建模项目,波士顿儿童医院约50%的心脏手术(约每年500例)获建模支持。CHOP正结合NVIDIA Warp和Newton物理引擎,目标将模拟仿真引入临床工作流程,实现同日决策。