跳到正文

#视频

今日 0 条

一手 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
9月29日周二
  1. AWS Machine Learning Blog48

    如何在 SageMaker AI 上用 vLLM-Omni 生成图像和视频(下篇)

    在 Amazon SageMaker AI 上使用 vLLM-Omni 容器部署两个端点,通过文本提示词生成静态图像(FLUX.2-klein-4B 实时端点),再将该图像作为条件输入生成视频(Wan2.1-VACE-1.3B 异步端点)。图像直接返回,视频生成完成后从 Amazon S3 检索 MP4 文件,示例包含命令行工作流和 Streamlit 界面。

9月25日周五
  1. Google Research64

    Google Research 提出多智能体框架实现连贯长视频生成

    Google Research 发布多个研究框架(Co-Director、CANVAS、A²RD、VQQA)用于解决长视频生成的连贯性问题。AI video co-director 将视频叙事建模为全局优化问题,通过多智能体分层架构协调创意策略;CANVAS 维护视觉记忆确保角色和场景一致性;A²RD 支持分钟级视频的自主生成;VQQA 通过视觉问答实现闭环优化。

    推荐理由:原文提出了多个解决长视频一致性问题的框架,读者可以了解如何通过多智能体协作和世界状态跟踪来改善视频生成的连贯性。

  2. Google DeepMind70

    Gemini 3.8 Live 推出 Live Avatar 功能,实现实时视觉呈现

    Google DeepMind 推出 Gemini 3.8 Live 的 Live Avatar 功能,实现近实时视频生成与语音同步,支持精确口型同步、自然表情和 97 种语言无缝切换。该功能现已在 Gemini Enterprise 可用,企业可定制头像(仅限白名单)。所有输出均带有 SynthID 水印以确保透明度。

    推荐理由:原文给出了具体的能力变化和可用范围,读者可以据此判断它对现有工作流的影响。

9月23日周三
9月21日周一
8月28日周五
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,带来场景扩展、首尾帧插值、360p 快速预览和 4K 超分辨率等创意控制功能。新模型支持最长 40 秒视频生成,可在 Google AI Studio 和 Agent Platform API 中使用,也可通过 Google AI Plus、Pro 和 Ultra 订阅在 Google Flow 中访问。

    推荐理由:提供了具体的性能提升数据和可用性信息,读者可以评估新模型对自己工作流的实际价值。

5月18日周一
  1. Google DeepMind79

    Google DeepMind 发布 Gemini Omni 模型,可从任意输入创建视频

    Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,可接受图像、音频、视频和文本作为输入,结合 Gemini 的现实世界知识生成高质量视频,并通过自然语言对话编辑视频。

    推荐理由:原文给出了新模型的能力特点和可用入口,读者可以据此了解视频生成领域的新进展。

4月15日周三
  1. Replicate Blog71

    Seedance 2.0 教程:如何制作高质量 AI 视频

    Seedance 2.0 是快手发布的 AI 视频生成模型,支持输入最多 9 张图像、3 个视频片段、3 个音频文件和文本提示词,可从图像提取构图、从视频提取运动模式、从音频提取节奏,实现音视频毫秒级同步。该模型还能处理复杂物理效果(如车辆颠簸、水流Fluid dynamics),并支持 15 秒多镜头规划和时间码提示功能。

10月16日周四
  1. Replicate Blog64

    Veo 3.1 提示词指南

    Google 发布了 Veo 3.1,Replicate 官方博客提供了提示词教程。新增三大功能:参考图像生成视频(最多3张图合成连贯场景)、首尾帧插帧(指定起止帧让模型生成过渡动画)、增强的图像转视频(模型能理解图像内容并生成自然motion)。除参考图像功能外,其他功能提供快速生成选项,约60秒完成,价格减半。教程包含代码示例和 API 调用方式。

7月31日周四
  1. Replicate Blog70

    Wan 2.2 发布:开源视频生成模型更新

    Wan 2.2 是开源视频生成模型的重大更新,物理模拟更精确、生成速度更快、控制能力更强。Replicate 与 Pruna AI 合作推出优化版本,文本生成视频 480p 仅需 $0.05/视频,720p 为 $0.10/视频,推理时间约 30 秒。未优化版本 480p 为 $0.40/视频,720p 为 $1.00/视频。

7月7日周一
  1. Replicate Blog47

    AI 视频模型对比指南

    Replicate 平台对比了 24 款 AI 视频生成模型的价格、分辨率、时长和功能。Alibaba Wan 2.2 5b fast 价格最低 $0.01 起、生成速度最快 6-16 秒,Google Veo 3 价格最高 $6、支持原生音频。所有模型均支持商业使用,价格和速度数据截至 2025年7月。

6月6日周五
3月28日周五
3月5日周三
  1. Replicate Blog66

    Wan2.1: 通过 API 生成视频

    Wan2.1 是最新最强的开源视频模型,已上线 Replicate 平台,提供 14B 和 1.3B 参数两种规模,支持 480p 和 720p 分辨率的文本生成视频和图像生成视频。性能方面,5秒 480p 视频生成需 39秒,720p 需 150秒。该模型在手部细节、物理准确性和物体交互等方面表现突出,可通过 Replicate JavaScript 客户端调用 API。

  2. Replicate Blog50

    Wan2.1 参数调节实战教程

    Replicate 测试了阿里 Wan2.1 14b 文本到视频模型的参数调优效果,使用固定提示词和种子进行系统性参数扫描。实验发现 guidance scale 为 3-7 时效果最佳(0 为创意模式,8+ 会出现 AI 痕迹),shift 控制运动流畅度,1 产生推拉效果,7-9 倾向于相似的画面构图。

1月24日周五
  1. Replicate Blog79

    Replicate 平台现已支持微调开源视频模型

    Replicate 推出基于腾讯 HunyuanVideo 的微调功能,用户可通过平台工具收集训练数据、训练自定义视频模型并生成视频。HunyuanVideo 擅长捕捉训练数据的视觉风格和运动模式,包括角色动作和镜头运动,这种动态风格迁移是其独特优势。训练通常需要 5-10 分钟,支持通过 API 自动化。

    推荐理由:原文给出了在 Replicate 上微调视频模型的完整步骤和入口,读者可以据此实践自定义视频生成。

1月17日周五
  1. Replicate Blog37

    使用 Replicate playground 生成短视频

    Replicate 发布 playground 实验性网页界面,提供类似剪贴簿的 UI 用于测试和比较不同图像/视频模型,并保留实验记录。工作流程分为三步:首先使用 flux-aesthetic-anime 等图像模型生成起始图片,然后通过 minimax/video-01-live 将图片转换为视频,最后利用 zsxkib/mmaudio 模型为视频添加匹配的音乐音效。

12月16日周一
8月23日周五
  1. Replicate Blog26

    Replicate Intelligence #12:FLUX.1 图像生成工具与大脑自我训练研究

    FLUX.1 图像生成模型推出两个新工具:ReFlux 支持多模型无限画布创作,Multi-LoRA Explorer 可单图叠加多个 LoRA 实现复杂风格组合。开源项目 Deep-Live-Cam 实现照片实时换脸到视频。此外,有研究揭示大脑在 REM 睡眠期间会模拟动作与后果,生成合成数据进行自我训练,与 AI 模型训练方式存在相似性。

8月16日周五
8月2日周五
  1. Replicate Blog24

    Replicate Intelligence #9:本周开源AI模型动态

    Black Forest Labs发布FLUX.1图像生成模型套件,采用"flow matching"技术,支持高达2百万像素分辨率,分为pro、dev、schnell三个版本。Meta推出SAM 2图像和视频分割模型,零样本能力扩展至视频领域,性能提升3倍。Google发布Gemma 2 2B紧凑语言模型,仅20亿参数但在LMSYS Chatbot Arena超越所有GPT-3.5模型。