跳到正文

#多模态

今日 0 条

音频 · 工具·提示词·论文 三栏速览

每栏 5 / 6 · 直达分类页

提示词

6 条
查看全部

论文

6 条
查看全部
10月1日周四
  1. Reddit · r/artificial66

    Historai:把任意历史时刻变成可中断的双人播客

    用户输入任意历史主题约两分钟后,系统生成一期双主持人播客,配有史料和艺术品。核心亮点是播放中可随时按麦克风提问,主持人会即时回答并融入叙事。作者对比了 GPT、Claude 和 Gemini 在研究规划、脚本撰写、艺术品选择和语音合成四个环节的表现,为每个环节选定了最优模型。

9月29日周二
8月27日周四
8月11日周二
7月1日周三
  1. Hugging Face Blog62

    Hugging Face 和 Cerebras 合作展示 Gemma 4 实时语音 AI

    Hugging Face 与 Cerebras 合作展示了基于 Gemma 4 的实时语音转语音系统,采用模块化开源架构:Nvidia Parakeet 语音识别 + Cerebras 加速 Gemma 4 VLM 推理 + 阿里 Qwen3TTS 语音生成。该系统已在超过 9,000 台 Reachy Mini 机器人上部署,旨在解决语音 AI 的延迟问题,提供更稳定、可预测的低延迟体验。

    推荐理由:原文展示了实时语音 AI 的低延迟方案,读者可以了解这个技术演示的核心架构和性能改进。

4月16日周四
3月24日周二
  1. Mistral AI79

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布 Voxtral TTS,一个 40 亿参数的文本转语音模型,支持 9 种语言的情感化语音生成,具备低延迟和快速语音适配能力。该模型通过 API 和 Mistral Studio 提供,起步价每千字符 0.016 美元,支持仅 3 秒参考音频即可适配定制语音。

    推荐理由:原文给出了与 ElevenLabs 的对比数据和具体价格,读者可以据此判断 Voxtral TTS 在语音生成领域的能力和成本。