跳到正文

#语音

今日 0 条

一手 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月7日周三
9月26日周六
  1. AWS Machine Learning Blog70

    在 Amazon SageMaker AI 上部署 Qwen3-TTS 实现实时个性化语音

    本文介绍如何在 Amazon SageMaker AI 上部署 Qwen3-TTS-12Hz-1.7B-Base 模型进行实时语音克隆。该模型支持 10 种语言,可从几秒参考音频中提取说话者的音色、音调和节奏特征,生成新文本的语音,无需重新训练。

    推荐理由:原文给出了完整的部署步骤、GPU配置、代码示例和监控方法,读者可以照着在 AWS SageMaker 上搭建自己的语音克隆服务。

9月25日周五
  1. AWS Machine Learning Blog62

    在 Amazon SageMaker 上部署 WhisperX 实现说话人标注转录

    AWS 发布了 WhisperX 深度学习容器,可在 Amazon SageMaker 上部署为实时或异步端点,实现带说话人标注和词级时间戳的转录。实时端点适用于 60 秒内的短音频,异步端点通过 S3 处理长音频。教程详细介绍了两种端点的部署步骤、请求格式、GPU 实例选择和成本优化策略,并提供了生产环境的最佳实践。

    推荐理由:原文提供了在 AWS SageMaker 上部署 WhisperX 的完整教程,包含实时和异步两种端点的具体配置、代码示例和生产注意事项。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Text-to-Speech

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新的文本转语音模型,在 Hume AI Voice Design Benchmark 获得第一。

    推荐理由:原文给出了具体的能力变化和开放入口,读者可以据此判断它会怎样改变现有的语音生成工作流。

9月16日周三
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking

    Google DeepMind 发布两款新的实时对话模型:Gemini 3.8 Live 注重规模化和成本效率,结合对话智能与流畅交互;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备增强智能和多步推理能力。

    推荐理由:原文给出了具体性能数据(82.6% Speech to Speech Quality Index、68.6% τ-Voice 等)和多个平台可用入口,读者可据此判断该模型相对现有产品的能力提升和适用场景。

9月10日周四
8月11日周二
7月1日周三
  1. Hugging Face Blog62

    Hugging Face 和 Cerebras 合作展示 Gemma 4 实时语音 AI

    Hugging Face 与 Cerebras 合作展示了基于 Gemma 4 的实时语音转语音系统,采用模块化开源架构:Nvidia Parakeet 语音识别 + Cerebras 加速 Gemma 4 VLM 推理 + 阿里 Qwen3TTS 语音生成。该系统已在超过 9,000 台 Reachy Mini 机器人上部署,旨在解决语音 AI 的延迟问题,提供更稳定、可预测的低延迟体验。

    推荐理由:原文展示了实时语音 AI 的低延迟方案,读者可以了解这个技术演示的核心架构和性能改进。

4月16日周四
3月24日周二
  1. Mistral AI79

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布 Voxtral TTS,一个 40 亿参数的文本转语音模型,支持 9 种语言的情感化语音生成,具备低延迟和快速语音适配能力。该模型通过 API 和 Mistral Studio 提供,起步价每千字符 0.016 美元,支持仅 3 秒参考音频即可适配定制语音。

    推荐理由:原文给出了与 ElevenLabs 的对比数据和具体价格,读者可以据此判断 Voxtral TTS 在语音生成领域的能力和成本。

7月15日周二
  1. Mistral AI76

    Mistral 发布 Voxtral 语音理解模型

    Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,在基准测试中优于 Whisper large-v3、GPT-4o mini Transcribe 和 ElevenLabs Scribe,定价仅为 $0.001/分钟,不到竞品一半。模型支持 32k token 上下文,可处理最长 40 分钟音频,具备内置问答、摘要、多语言和函数调用能力。

    推荐理由:原文给出了 Voxtral 在多个基准测试上的性能对比和定价信息,读者可以据此判断它在语音理解领域的能力位置和成本优势。