#视频
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#视频
今日 1 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条The DecoderAI 评分5858 Google 向公众开放 SynthID 检测器,称已有 1800 亿张图片和视频被打水印
Google 将 SynthID 检测器面向公众开放,任何人都可以上传 JPG、PNG、MP4 或 MP3 文件,识别这些内容是否带有 SynthID 隐式水印,覆盖 Gemini、Veo、Lyria 等模型生成的素材。
量子位 QbitAIAI 评分2121 AI影视公司Utopai Studios视频模型Utopai X登顶Artificial Analysis榜单第二
独立影视公司Utopai Studios推出的文生视频模型Utopai X,在Artificial Analysis(AA)盲测榜单中以1150分位列第二,仅比阿里的Wan 3.0低7分。
TechCrunch · AIAI 评分2222 三名前 Ramp 工程师创办 Melius,融资 2500 万美元打造 AI 广告创意生成平台
由三名 Ramp 前工程师创办的 AI 创意平台 Melius 宣布完成总额 2500 万美元融资,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。团队在首款 AI 营销产品上线六个月后因效果不佳废弃全部代码,转向做生成广告素材与活动的"创意工作智能体实验室",自 7 月走出隐身模式后两个月内年化营收已突破 100 万美元。
Reddit · r/LocalLLaMAAI 评分2020 开发者展示 ~960M 参数本地 AI 世界模型,可在消费级显卡上实时将图像转为可操控角色
独立开发者 lucidml_lover 发布其本地 AI 世界模型第二版,参数约 960M,采用纯 Transformer 架构配合扩散强制(diffusion forcing)训练,推理时每帧进行 2-5 步扩散并加入 KV cache,配合滑动窗口保留最近 80 帧上下文。
Product Hunt · AI 分类AI 评分3434 EasyCut:把 Claude 生成的动态视频变成多轨时间线,支持逐元素编辑
EasyCut 是一款浏览器端的视频编辑工具,可将 Claude 生成的动态视频拆分为标题、场景、图像、声音等独立轨道,允许用户选中任一元素让 Claude 仅修改该部分而无需重建全片,并提供配乐适配、慢动作、多平台尺寸调整与导出功能。该工具免费使用,所有文件均在本地设备处理。
Hacker News · 首页AI 评分4545 Gitframes:面向 AI 编码智能体的代码优先视频生成 npm 包
Gitframes 是一个 npm 包,将 Photoshop 级合成、After Effects 级动效和 Blender 级 3D 场景整合在一起,供智能体通过 TypeScript 直接驱动并渲染 MP4,绕开无头浏览器和 DOM 重排。
Reddit · r/artificialAI 评分4141 30 年来我们教计算机拍电影——现在它学会了,我们却愤怒了
从 1993 年《侏罗纪公园》的数字恐龙获奥斯卡视觉效果奖,到《终结者 2》《泰坦尼克号》《黑客帝国》不断突破边界,电影制作技术逐步实现了用计算机生成逼真的人物、环境、声音和表演。
Hacker News · 首页AI 评分1010 无法生成具体模型标题的 AI 意图、质量与艺术性扩展视频指南
无法生成摘要:正文仅提供 Hacker News 的链接与互动数据(86 积分、34 条评论),未包含任何实际文章内容,无法提取核心主体、关键观点或可验证的事实细节。
Reddit · r/LocalLLaMAAI 评分1313 有什么免费、本地的带旁白解释视频制作工具?
explainroo 是一款完全本地运行的带旁白解释视频制作工具,整合了 Kokoro 语音合成、Whisper 单词计时、headless Chrome 画帧和 ffmpeg 视频合成,无需 API 密钥。该用户认为功能较为简单,生成的视频风格缺乏变化,正在 Reddit 社区寻求其他免费本地替代方案。
Product Hunt · AI 分类AI 评分3333 LaunchReel:Claude Code 产品视频制作插件
LaunchReel 是 Claude Code 的插件,可从代码仓库自动生成产品发布视频和演示视频,并支持真人出镜素材剪辑。插件内置导演手册、原创音乐和配音功能,支持 16:9 或 9:16 比例导出,最高可达 4K 分辨率,用户可自行编辑。
Product Hunt · AI 分类AI 评分4545 FlexChords:将 YouTube 视频或音频转换为同步吉他和弦的 AI 工具
FlexChords 利用深度学习结合音乐理论平滑技术,可在数秒内将任何 YouTube 视频或音频文件转换为准确、同步的吉他和弦,消除故障并提供干净的旋律进行。该工具支持 YouTube 和音频和弦检测、同步播放、实时和弦显示、交互式时间线编辑以及关键调性和节奏估计。提供无限目录歌曲即时访问,每月可免费自定义扫描 5 次。
Reddit · r/ChatGPTAI 评分2323 为什么我用 ChatGPT 生成的视频质量这么差?
Reddit 用户在 ChatGPT 上生成视频时效果不佳,浪费积分却得到平庸结果,但看到其他高质量视频(如 Sailor Momoa)却能达到电影级质量。用户使用 ChatGPT 优化提示词仍无法解决这一差异困惑。
Reddit · r/ChatGPTAI 评分2121 我讨厌"听起来像AI"的脚本如何毁掉视频体验
一位YouTube长期用户抱怨平台视频中AI生成脚本的模板化表达严重影响观看体验,指出"And what matters most is..."、"It's not just X, but Y"、"Here's where you have to pay attention"等短语即便内容有价值也会让其放弃观看;作者建议未来能有个了解个人偏好的AI工具直接为自己生成定制内容。
Reddit · r/ChatGPTAI 评分3333 Oscilloscope Diffusion 发布:用扩散模型重新诠释视频纹理与视觉语言
Oscilloscope Diffusion 是一种通过扩散模型干预现有视频的新方法,可将抽象几何结构转化为折纸、建筑、文艺复兴绘画等不同风格。项目基于 TouchDesigner 音频响应几何系统开发,已更新至 v1.2 版本。用户可选择视频来源、描述处理方式并通过提示词、LoRAs 和可编辑时间线控制结果。目前在 Uisato Studio 可用,即将开源。
Reddit · r/artificialAI 评分4646 Oscilloscope Diffusion 发布:基于扩散模型的音频响应几何视频编辑工具
Oscilloscope Diffusion 是一种通过扩散模型干预现有视频的新方法,以音频响应几何体的运动和形式为起点,重新诠释纹理、材质和视觉语言。用户可选择视频源、描述处理方式,并通过提示词、LoRAs 和可编辑时间轴控制结果与原始素材的接近程度。该工具已上线 Uisato Studio,即将开源。
Reddit · r/artificialAI 评分1414 求:8GB VRAM 本地 AI 视频生成工具推荐
用户寻求在 8GB VRAM 限制下运行的本地 AI 视频生成工具,要求支持文本和图片生成最长 10 秒视频,优先 2D 动画兼顾 3D。这是用户首次使用本地大语言模型,希望找容易上手且免费的解决方案。
The Rundown AIAI 评分6969 Tavus 发布 Griffin 模型:在实时视频通话中通过图灵测试
AI 初创公司 Tavus 发布 Griffin 人机交互模型,能在实时视频通话中看、听、说和反应。测试中 48% 的参与者认为对方是人类,而此前模型仅有 2.4%。
Reddit · r/LocalLLaMAAI 评分2727 你试过用 Muse Spark 1.3 在 Opencode 上免费生成视频吗?
用户在 Opencode 平台使用免费模型 Muse Spark 1.3 成功生成了视频。生成效果不如 Opus 5.5,但表现不错,且目前免费可用。该模型为视频生成提供了免费替代方案。
The DecoderAI 评分7171 Tavus 发布 Griffin:首个面向实时视频对话的 Human Interaction Model
Tavus 发布 Griffin,号称首个 Human Interaction Model(HIM),能实时处理语音、面部表情、语气、手势和停顿。在 Tavus 研究中,48% 的参与者在 1 分钟视频通话后认为 Griffin 是真人,之前系统最高仅 2%。
Reddit · r/artificialAI 评分2727 Sonnet 5.5 用单个提示词生成了这个运动图形视频,花费 $0
用户用 Sonnet 5.5 从单个提示词生成了运动图形视频,成本为 $0。视频现已发布在 Reddit 上,作者正在询问社区对质量的评价及发布前是否需要修改。
Reddit · r/artificialAI 评分1515 AI 视频编辑与创意工作流探讨
用户在 Reddit 探讨 AI 视频创作工作流,当前采用“研究→大纲→分镜→脚本”流程;认为 AI 适合辅助前三个环节,但脚本仍需手动完成。还测试了 HyperFrames、AG 和 Codex 等工具,期望 AI 能按叙事自动整理素材文件夹并对齐时间线,以便创作者专注转场、特效等精细编辑。
Product Hunt · AI 分类AI 评分5050 RxFilm Studio 发布 AI 视频创作工具
用户通过描述需求即可创作和编辑视频。RxFilm Studio 可将想法、网站、截图、视频素材转换成成片,支持用自然语言精调每个场景的时间、布局、动画、转场、配音、音乐和字幕,无需重新生成整个视频。还可录制带有智能光标跟踪和自动点击缩放的产品演示。
Product Hunt · AI 分类AI 评分1919 Viibeo:用提示词或脚本一键生成可发布的短视频,并支持自动批量产出与广告创意
Viibeo 可将提示词、网页链接或脚本转化为可发布的去人像短视频,自动生成钩子式脚本、配音、B-roll 和定时字幕,支持导出 9:16 MP4,或通过 Autopilot 在支持社交渠道上定时批量发布。Inspiration Feed 用于发现可复刻的热门格式,Ad Factory 可将产品静图转为短视频广告创意;首支视频免费但带水印,付费套餐起步价为每月 19 美元。
Product Hunt · AI 分类AI 评分3333 Dina 4.5 发布:macOS 全流程视频工作流工具
Dina 4.5 是一款 macOS 全流程视频工作流应用,整合录屏、剪辑、AI 音频清理、配音、转录驱动编辑、AI 字幕生成、文本转语音及最高 8K 导出等功能。应用面向追求专业效果但不愿在多个工具间切换的创作者,提供键盘快捷键和注释等生产力特性。
Product Hunt · AI 分类精选AI 评分6363 Arsaze 发布 AI 视频编辑器,支持 AI 智能体与人类协同编辑
Arsaze 推出 AI 视频编辑器,定位为视频编辑领域的 Cursor。该产品提供真正的多轨时间线,AI 智能体和人类都能通过 MCP 或语音驱动进行编辑,整合 AI 视频编辑、生成和智能体驱动编辑功能于同一时间线。
推荐理由:原文给出了产品定位和核心能力,读者可以据此判断它与传统视频编辑器的差异。
Product HuntAI 评分1111 TwelveLabs 发布 Pegasus 1.6:可将第一人称视频转为机器人训练数据
TwelveLabs 发布 Pegasus 1.6 模型,专为从第一人称视角理解画面,可将 egocentric 及远程操作视频直接转化为带标签和时间戳、可用于机器人训练的标注数据,无需人工标注。模型对实体识别更精确,并能跨分段生成持续一致的元数据。
Latent SpaceAI 评分7272 AMD 以 82 亿美元收购 World Labs,Atlas 模型解决空间智能稀疏重建难题
AMD 以 82 亿美元收购 World Labs。World Labs 近期发布了 Atlas,这是首个全能模型架构,能够从 2D 图像预测新视角,解决了计算机视觉中长期存在的稀疏重建问题,将生成模型与多视角几何相结合,其性能超越现有专业模型。
AWS Machine Learning BlogAI 评分4848 如何在 SageMaker AI 上用 vLLM-Omni 生成图像和视频(下篇)
在 Amazon SageMaker AI 上使用 vLLM-Omni 容器部署两个端点,通过文本提示词生成静态图像(FLUX.2-klein-4B 实时端点),再将该图像作为条件输入生成视频(Wan2.1-VACE-1.3B 异步端点)。图像直接返回,视频生成完成后从 Amazon S3 检索 MP4 文件,示例包含命令行工作流和 Streamlit 界面。
Latent SpaceAI 评分6565 Runway 发布 GWM Worlds 2 及 WorldPrompt:实时交互式世界模型的工程实现
Runway 推出 GWM Worlds 2 研究预览版,支持 720p 24fps 视频和 48kHz 音频的实时流式生成。其核心功能 WorldPrompt 允许用户通过提示词控制角色、相机和环境,区别于 Minecraft 等可脚本化的虚拟世界,它不提供状态控制能力但支持更灵活的按需生成。
Google Research精选AI 评分6464 Google Research 提出多智能体框架实现连贯长视频生成
Google Research 发布多个研究框架(Co-Director、CANVAS、A²RD、VQQA)用于解决长视频生成的连贯性问题。AI video co-director 将视频叙事建模为全局优化问题,通过多智能体分层架构协调创意策略;CANVAS 维护视觉记忆确保角色和场景一致性;A²RD 支持分钟级视频的自主生成;VQQA 通过视觉问答实现闭环优化。
推荐理由:原文提出了多个解决长视频一致性问题的框架,读者可以了解如何通过多智能体协作和世界状态跟踪来改善视频生成的连贯性。
Google DeepMind精选AI 评分7070 Gemini 3.8 Live 推出 Live Avatar 功能,实现实时视觉呈现
Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,实现近实时视频生成与语音同步,支持精确口型同步、自然表情和 97 种语言无缝切换。该功能现已在 Gemini Enterprise 可用,企业可定制头像(仅限白名单)。所有输出均带有 SynthID 水印以确保透明度。
推荐理由:原文给出了具体的能力变化和可用范围,读者可以据此判断它对现有工作流的影响。
Ars Technica · AIAI 评分6060 YouTube 承诺今年推出自定义订阅源和更多功能
YouTube 在年度 Made on YouTube 活动上宣布将推出多项新功能:Custom Feeds(自定义订阅源)允许用户通过描述创建个性化内容标签页,可保存多个订阅源,即将首先向美国用户开放网页、移动和电视端。此外还将支持在评论中搜索并发布 GIF,并推出群组消息功能,但该功能初期仅在美国、英国、新加坡、巴西及部分欧洲国家可用。
OpenAI NewsAI 评分2222 invideo 如何用 GPT‑6 Astra 实现颜色分级提升 3 倍
GPT‑6 Astra 帮助 invideo 实现颜色校正和分级效率提升 3 倍,编辑规划精度显著提高。invideo 现在可在一日内生成 50 个自定义效果。
Product Hunt · AI 分类AI 评分1313 Ari Helper 7 上线,新增 Photo Studio、Film Studio 与 OpenAI 兼容私有服务器
Ari Helper 7 是面向 iPhone、iPad、Mac 和 Apple Watch 的私有 AI 助手,本次更新新增 Photo Studio(修复、降噪、上色、4x 放大,支持端侧及相册内运行)、Film Studio(逐镜头影片与视频修复)、可提问的实时摄像头、端侧图像生成,以及用户自建的 OpenAI 兼容服务器。
OpenAI NewsAI 评分2121 Higgsfield AI 用 GPT-6 Astra 一天内推出新视频功能
Higgsfield AI 基于 GPT-6 Astra 在一天内完成新视频功能开发,使小企业视频广告创作更加便捷。GPT-6 Astra 赋能 Higgsfield AI 加速将新创意工具推向市场。
Product Hunt · AI 分类AI 评分4242 Pexo:对话式AI产品发布视频生成工具
Pexo是一款对话式AI视频生成工具,用户只需分享产品、网站或素材,它会自动规划故事情节、为每个任务选择合适的AI模型、生成场景并处理配音、音乐、字幕、动态图形和编辑。用户可通过评论或圈选进行修改指示,从概念到成品品牌视频全程由一个AI智能体完成。
Product Hunt · AI 分类AI 评分3535 Syllaby AI 数字人 2.0 发布
Syllaby 推出 AI 数字人 2.0,可将脚本或简单想法转化为由逼真 AI 数字人主持的视频,包含自然语音、B-roll 素材和字幕,无需雇佣演员。该工具支持快速创建主持人视频,当前在 Product Hunt 发布。
Google DeepMind精选AI 评分7676 Google DeepMind 发布 Gemini Omni 1.1 Flash
Google DeepMind 发布 Gemini Omni 1.1 Flash,带来场景扩展、首尾帧插值、360p 快速预览和 4K 超分辨率等创意控制功能。新模型支持最长 40 秒视频生成,可在 Google AI Studio 和 Agent Platform API 中使用,也可通过 Google AI Plus、Pro 和 Ultra 订阅在 Google Flow 中访问。
推荐理由:提供了具体的性能提升数据和可用性信息,读者可以评估新模型对自己工作流的实际价值。
Google DeepMind精选AI 评分7979 Google DeepMind 发布 Gemini Omni 模型,可从任意输入创建视频
Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,可接受图像、音频、视频和文本作为输入,结合 Gemini 的现实世界知识生成高质量视频,并通过自然语言对话编辑视频。
推荐理由:原文给出了新模型的能力特点和可用入口,读者可以据此了解视频生成领域的新进展。
Replicate BlogAI 评分7171 Seedance 2.0 教程:如何制作高质量 AI 视频
Seedance 2.0 是快手发布的 AI 视频生成模型,支持输入最多 9 张图像、3 个视频片段、3 个音频文件和文本提示词,可从图像提取构图、从视频提取运动模式、从音频提取节奏,实现音视频毫秒级同步。该模型还能处理复杂物理效果(如车辆颠簸、水流Fluid dynamics),并支持 15 秒多镜头规划和时间码提示功能。