跳到正文

#多模态

今日 0 条

视频 · 工具·提示词·论文 三栏速览

每栏 1 / 6 · 直达分类页

提示词

6 条
查看全部

论文

6 条
查看全部
10月2日周五
  1. Product Hunt19

    Tavus 发布 Griffin:面向实时面对面对话的 Human Interaction Model

    Tavus 推出 Griffin——一款可同时"看、听、说"的实时面对面对话 Human Interaction 模型,能根据停顿、表情、手势和摄像头画面进行响应。在一分钟实时视频通话测试中,48% 的参与者误以为对方是真人。其轻量版 Griffin-Lite 以研究预览形式向部分早期测试者开放,支持全双工视频到视频交互与 720p 视频生成。

9月23日周三
9月17日周四
  1. Product Hunt · AI 分类35

    Syllaby AI 数字人 2.0 发布

    Syllaby 推出 AI 数字人 2.0,可将脚本或简单想法转化为由逼真 AI 数字人主持的视频,包含自然语音、B-roll 素材和字幕,无需雇佣演员。该工具支持快速创建主持人视频,当前在 Product Hunt 发布。

9月1日周二
  1. The Rundown AI61

    Runway 推出 Solaris 预览版:用视频实时渲染替代传统网页

    Runway 发布 Solaris(界面世界模型),将网站和应用实时渲染为视频,结合 Gen-4.5 视频模型与 LLM 根据用户点击逐帧生成内容,演示包括虚拟试衣、食材组合和交互式燃烧实验。在 Runway 测试中,测试者在 71% 场景行为判断和 61% 指令遵循上更倾向于 Solaris 而非 Claude Opus 5 编写的页面,当前仍存在文本清晰度、长时间会话漂移等问题。

5月18日周一
  1. Google DeepMind79

    Google DeepMind 发布 Gemini Omni 模型,可从任意输入创建视频

    Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,可接受图像、音频、视频和文本作为输入,结合 Gemini 的现实世界知识生成高质量视频,并通过自然语言对话编辑视频。

    推荐理由:原文给出了新模型的能力特点和可用入口,读者可以据此了解视频生成领域的新进展。