#语音
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#语音
今日 0 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Hugging Face BlogAI 评分3333 Hugging Face 发布 Falcon-ASR:1.6B 参数的阿拉伯语语音识别模型
Hugging Face 发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点支持阿拉伯语及阿联酋方言,由阿布扎比 Technology Innovation Institute(TII)开发,同一权重也支持英语、法语、西班牙语和葡萄牙语。
AWS Machine Learning BlogAI 评分1616 在 Amazon Bedrock AgentCore、Managed Knowledge Base 与 Nova Sonic 上构建语音旅行管家
AWS 博客演示如何在 Amazon Bedrock AgentCore 上构建面向航空公司的语音旅行管家,核心由 Amazon Nova 2.5 Sonic 实时语音模型、Strands Agents 框架与 Amazon Bedrock Knowledge Bases 组成。
AWS Machine Learning Blog精选AI 评分7070 在 Amazon SageMaker AI 上部署 Qwen3-TTS 实现实时个性化语音
本文介绍如何在 Amazon SageMaker AI 上部署 Qwen3-TTS-12Hz-1.7B-Base 模型进行实时语音克隆。该模型支持 10 种语言,可从几秒参考音频中提取说话者的音色、音调和节奏特征,生成新文本的语音,无需重新训练。
推荐理由:原文给出了完整的部署步骤、GPU配置、代码示例和监控方法,读者可以照着在 AWS SageMaker 上搭建自己的语音克隆服务。
AWS Machine Learning Blog精选AI 评分6262 在 Amazon SageMaker 上部署 WhisperX 实现说话人标注转录
AWS 发布了 WhisperX 深度学习容器,可在 Amazon SageMaker 上部署为实时或异步端点,实现带说话人标注和词级时间戳的转录。实时端点适用于 60 秒内的短音频,异步端点通过 S3 处理长音频。教程详细介绍了两种端点的部署步骤、请求格式、GPU 实例选择和成本优化策略,并提供了生产环境的最佳实践。
推荐理由:原文提供了在 AWS SageMaker 上部署 WhisperX 的完整教程,包含实时和异步两种端点的具体配置、代码示例和生产注意事项。
Google DeepMind精选AI 评分7878 Google DeepMind 发布 Gemini 3.8 Text-to-Speech
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款新的文本转语音模型,在 Hume AI Voice Design Benchmark 获得第一。
推荐理由:原文给出了具体的能力变化和开放入口,读者可以据此判断它会怎样改变现有的语音生成工作流。
Google DeepMind精选AI 评分7676 Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking
Google DeepMind 发布两款新的实时对话模型:Gemini 3.8 Live 注重规模化和成本效率,结合对话智能与流畅交互;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备增强智能和多步推理能力。
推荐理由:原文给出了具体性能数据(82.6% Speech to Speech Quality Index、68.6% τ-Voice 等)和多个平台可用入口,读者可据此判断该模型相对现有产品的能力提升和适用场景。
OpenAI News精选AI 评分6767 OpenAI 在 API 中推出 GPT‑Live‑1,实现更自然的语音体验
GPT‑Live‑1 将自然全双工语音对话能力引入 API,具备更强的指令遵循、定制语音和电话支持功能。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Hugging Face BlogAI 评分5757 NVIDIA Magpie TTS 多语言语音模型发布:支持 12 种语言、32ms 首次音频延迟
NVIDIA 发布 Magpie TTS 多语言语音合成模型,364M 参数支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言。
Berkeley AI ResearchAI 评分2828 2026 BAIR 毕业生展示:Berkeley AI Research 实验室迎来新一届博士毕业生
Berkeley AI Research (BAIR) Lab 2026 届博士毕业生已开启职业新篇章,研究方向涵盖机器人与具身智能、大语言模型推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for Science 等领域。
Hugging Face Blog精选AI 评分6262 Hugging Face 和 Cerebras 合作展示 Gemma 4 实时语音 AI
Hugging Face 与 Cerebras 合作展示了基于 Gemma 4 的实时语音转语音系统,采用模块化开源架构:Nvidia Parakeet 语音识别 + Cerebras 加速 Gemma 4 VLM 推理 + 阿里 Qwen3TTS 语音生成。该系统已在超过 9,000 台 Reachy Mini 机器人上部署,旨在解决语音 AI 的延迟问题,提供更稳定、可预测的低延迟体验。
推荐理由:原文展示了实时语音 AI 的低延迟方案,读者可以了解这个技术演示的核心架构和性能改进。
Google DeepMind精选AI 评分7070 Google DeepMind 发布 Gemini 3.1 Flash TTS,带来更具表现力的 AI 语音生成能力
Google DeepMind 发布 Gemini 3.1 Flash TTS,这是一款新的文本转语音模型,在 Artificial Analysis TTS 基准测试中获得 1211 的 Elo 评分。
推荐理由:原文展示了具体性能数据(Elo 1211)和可用入口,读者可据此评估该模型在实际业务中的适用性。
Mistral AI精选AI 评分7979 Mistral AI 发布 Voxtral TTS 文本转语音模型
Mistral AI 发布 Voxtral TTS,一个 40 亿参数的文本转语音模型,支持 9 种语言的情感化语音生成,具备低延迟和快速语音适配能力。该模型通过 API 和 Mistral Studio 提供,起步价每千字符 0.016 美元,支持仅 3 秒参考音频即可适配定制语音。
推荐理由:原文给出了与 ElevenLabs 的对比数据和具体价格,读者可以据此判断 Voxtral TTS 在语音生成领域的能力和成本。
Mistral AI精选AI 评分7676 Mistral 发布 Voxtral 语音理解模型
Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,在基准测试中优于 Whisper large-v3、GPT-4o mini Transcribe 和 ElevenLabs Scribe,定价仅为 $0.001/分钟,不到竞品一半。模型支持 32k token 上下文,可处理最长 40 分钟音频,具备内置问答、摘要、多语言和函数调用能力。
推荐理由:原文给出了 Voxtral 在多个基准测试上的性能对比和定价信息,读者可以据此判断它在语音理解领域的能力位置和成本优势。