跳到正文

#语音

今日 1 条

音频 · 工具·提示词·论文 三栏速览

每栏 5 / 6 · 直达分类页

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
10月7日周三
10月6日周二
  1. Reddit · r/LocalLLaMA45

    Speakrail:单张 RTX 4090 即可运行的全本地低延迟语音助手

    开发者发布开源全本地全双工语音助手 Speakrail,在单张 RTX 4090 上运行,组件包括 Voxtral Realtime 语音识别、Gemma 4 12B 微调大语言模型和 Breeze TTS 2 语音合成。该项目在部分基准测试中可比肩 GPT-Live,并支持插话、静默与打断等全双工交互模式。作者表示后续将发布完整技术报告。

10月5日周一
  1. Reddit · r/artificial25

    开发者用 GPT、Claude 与 Gemini 各取所长打造可对话的历史播客应用 historai.ca

    开发者结合软件经验与大语言模型,推出 historai.ca:用户输入任意历史主题、时刻或人物,约 1 分钟后由一到两位主持人以播客形式讲述,配有同步插图,并支持随时打断提问。该应用在动笔前会联网核查日期、人名与数字,资料存疑时会直接告知分歧并附上来源链接。研究、撰稿、配图、配音、出题等环节分别由 GPT、Claude、Gemini 中表现最优的模型负责,目前支持 6 种语言。

10月3日周六
  1. Reddit · r/LocalLLaMA53

    mlsubgen:本地运行的45语言视频字幕工具

    mlsubgen 是一款本地运行的字幕生成工具,支持45种语言。其技术特点包括:按语音段检测语言以支持混合语言内容;运行两个语音识别器并用本地大语言模型融合结果;优先使用已有的嵌入式字幕轨道(包括 Blu-ray PGS 轨的 OCR),无字幕时才分析音频。在 24GB RTX A5000 上处理速度约等于目标语言的实时时长,需要 16-32 GB 系统内存和 30-65 GB 模型存储。

10月2日周五
  1. The Decoder77

    Microsoft AI 发布用于语音智能体的转录和文本转语音模型

    Microsoft AI 发布 MAI-Transcribe-2-Streaming 实时转录模型,支持 60 种语言,首个部分结果交付时间约 100 毫秒,在 Artificial Analysis 准确率排名第一,年内定价 $0.54/小时。

    推荐理由:原文给出了具体的性能指标(100ms 延迟、60 种语言、$0.54/小时)和对比数据,读者可以据此评估新产品相对于现有方案的性价比。

10月1日周四
  1. Product Hunt · AI 分类67

    Clarity: 实时 TTS 工具发布,支持语音克隆与亚 60ms 延迟

    Clarity 是一款柏林团队开发的实时文字转语音产品,具备语音克隆能力,延迟低于 60ms,支持本地部署或 API 调用。其语法感知规范化功能可自然朗读 25+ 语言的电话号码、IBAN、地址和药物名称,并提供词级时间戳和 IPA 标注。适配 LiveKit、Pipecat 和 Vapi 平台。

    推荐理由:原文给出了核心能力(实时 TTS、语音克隆、低延迟、语法感知规范化、多语言适配)和可用方式(本地部署或 API),读者可以判断它与其他 TTS 产品的差异。

9月30日周三
  1. Product Hunt · AI 分类50

    Zumbo:Mac 本地离线语音转文字工具

    Zumbo 是一款 Mac 端本地 AI 语音转文字工具,延迟约五分之一秒,支持 21 种词汇包(开发者工具、法律、医疗、设计等),能从用户修正中学习。具备笔记提醒、会议说话人标签等功能,离线可用,无需账户,一次性付费开源。

9月29日周二
9月24日周四
8月11日周二
7月1日周三
  1. Hugging Face Blog62

    Hugging Face 和 Cerebras 合作展示 Gemma 4 实时语音 AI

    Hugging Face 与 Cerebras 合作展示了基于 Gemma 4 的实时语音转语音系统,采用模块化开源架构:Nvidia Parakeet 语音识别 + Cerebras 加速 Gemma 4 VLM 推理 + 阿里 Qwen3TTS 语音生成。该系统已在超过 9,000 台 Reachy Mini 机器人上部署,旨在解决语音 AI 的延迟问题,提供更稳定、可预测的低延迟体验。

    推荐理由:原文展示了实时语音 AI 的低延迟方案,读者可以了解这个技术演示的核心架构和性能改进。

4月16日周四
3月24日周二
  1. Mistral AI79

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布 Voxtral TTS,一个 40 亿参数的文本转语音模型,支持 9 种语言的情感化语音生成,具备低延迟和快速语音适配能力。该模型通过 API 和 Mistral Studio 提供,起步价每千字符 0.016 美元,支持仅 3 秒参考音频即可适配定制语音。

    推荐理由:原文给出了与 ElevenLabs 的对比数据和具体价格,读者可以据此判断 Voxtral TTS 在语音生成领域的能力和成本。