跳到正文
AI 工具导航

近 30 天 · AI 圈最值得看的 7 个AI 新工具

每条发布 = 一张工具卡 · 命中 "新工具 / 产品更新 / 模型发布 / 平台" 标签(itemType=tool_release)· 按时间排序

  1. The Decoder77

    Microsoft AI 发布用于语音智能体的转录和文本转语音模型

    Microsoft AI 发布 MAI-Transcribe-2-Streaming 实时转录模型,支持 60 种语言,首个部分结果交付时间约 100 毫秒,在 Artificial Analysis 准确率排名第一,年内定价 $0.54/小时。

    推荐理由:原文给出了具体的性能指标(100ms 延迟、60 种语言、$0.54/小时)和对比数据,读者可以据此评估新产品相对于现有方案的性价比。

  2. Product Hunt · AI 分类67

    Clarity: 实时 TTS 工具发布,支持语音克隆与亚 60ms 延迟

    Clarity 是一款柏林团队开发的实时文字转语音产品,具备语音克隆能力,延迟低于 60ms,支持本地部署或 API 调用。其语法感知规范化功能可自然朗读 25+ 语言的电话号码、IBAN、地址和药物名称,并提供词级时间戳和 IPA 标注。适配 LiveKit、Pipecat 和 Vapi 平台。

    推荐理由:原文给出了核心能力(实时 TTS、语音克隆、低延迟、语法感知规范化、多语言适配)和可用方式(本地部署或 API),读者可以判断它与其他 TTS 产品的差异。

  3. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Text-to-Speech

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新的文本转语音模型,在 Hume AI Voice Design Benchmark 获得第一。

    推荐理由:原文给出了具体的能力变化和开放入口,读者可以据此判断它会怎样改变现有的语音生成工作流。

  4. Google DeepMind76

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking

    Google DeepMind 发布两款新的实时对话模型:Gemini 3.8 Live 注重规模化和成本效率,结合对话智能与流畅交互;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备增强智能和多步推理能力。

    推荐理由:原文给出了具体性能数据(82.6% Speech to Speech Quality Index、68.6% τ-Voice 等)和多个平台可用入口,读者可据此判断该模型相对现有产品的能力提升和适用场景。

  5. Hugging Face Blog62

    Hugging Face 和 Cerebras 合作展示 Gemma 4 实时语音 AI

    Hugging Face 与 Cerebras 合作展示了基于 Gemma 4 的实时语音转语音系统,采用模块化开源架构:Nvidia Parakeet 语音识别 + Cerebras 加速 Gemma 4 VLM 推理 + 阿里 Qwen3TTS 语音生成。该系统已在超过 9,000 台 Reachy Mini 机器人上部署,旨在解决语音 AI 的延迟问题,提供更稳定、可预测的低延迟体验。

    推荐理由:原文展示了实时语音 AI 的低延迟方案,读者可以了解这个技术演示的核心架构和性能改进。

  6. Mistral AI79

    Mistral AI 发布 Voxtral TTS 文本转语音模型

    Mistral AI 发布 Voxtral TTS,一个 40 亿参数的文本转语音模型,支持 9 种语言的情感化语音生成,具备低延迟和快速语音适配能力。该模型通过 API 和 Mistral Studio 提供,起步价每千字符 0.016 美元,支持仅 3 秒参考音频即可适配定制语音。

    推荐理由:原文给出了与 ElevenLabs 的对比数据和具体价格,读者可以据此判断 Voxtral TTS 在语音生成领域的能力和成本。

已经到底了