#多模态
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#多模态
今日 0 条音频 · 工具·提示词·论文 三栏速览
每栏 5 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/artificialAI 评分6666 Historai:把任意历史时刻变成可中断的双人播客
用户输入任意历史主题约两分钟后,系统生成一期双主持人播客,配有史料和艺术品。核心亮点是播放中可随时按麦克风提问,主持人会即时回答并融入叙事。作者对比了 GPT、Claude 和 Gemini 在研究规划、脚本撰写、艺术品选择和语音合成四个环节的表现,为每个环节选定了最优模型。
Product Hunt · AI 分类AI 评分5959 Elevenlabs 发布 Eleven v4 和 v4 Turbo 语音模型
Elevenlabs 发布了最新语音模型 Eleven v4 和 v4 Turbo,号称公司最快、最有表现力的模型。v4 Turbo 版本专为实时应用设计,可在应用、API 和智能体中使用。
Google DeepMind精选AI 评分7474 Google 发布 Gemini 3.5 Transcribe 语音转文字模型
Google 发布 Gemini 3.5 Transcribe语音转文字模型,支持实时流式和预录制音频两种模式,通过 Gemini API (Google AI Studio) 和 Enterprise Agent Platform 提供。
推荐理由:给出了具体的 WER 数值和延迟改善比例,读者可以直接对比评估它的实际性能。
Hugging Face BlogAI 评分5757 NVIDIA Magpie TTS 多语言语音模型发布:支持 12 种语言、32ms 首次音频延迟
NVIDIA 发布 Magpie TTS 多语言语音合成模型,364M 参数支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言。
Hugging Face Blog精选AI 评分6262 Hugging Face 和 Cerebras 合作展示 Gemma 4 实时语音 AI
Hugging Face 与 Cerebras 合作展示了基于 Gemma 4 的实时语音转语音系统,采用模块化开源架构:Nvidia Parakeet 语音识别 + Cerebras 加速 Gemma 4 VLM 推理 + 阿里 Qwen3TTS 语音生成。该系统已在超过 9,000 台 Reachy Mini 机器人上部署,旨在解决语音 AI 的延迟问题,提供更稳定、可预测的低延迟体验。
推荐理由:原文展示了实时语音 AI 的低延迟方案,读者可以了解这个技术演示的核心架构和性能改进。
Google DeepMind精选AI 评分7070 Google DeepMind 发布 Gemini 3.1 Flash TTS,带来更具表现力的 AI 语音生成能力
Google DeepMind 发布 Gemini 3.1 Flash TTS,这是一款新的文本转语音模型,在 Artificial Analysis TTS 基准测试中获得 1211 的 Elo 评分。
推荐理由:原文展示了具体性能数据(Elo 1211)和可用入口,读者可据此评估该模型在实际业务中的适用性。
Mistral AI精选AI 评分7979 Mistral AI 发布 Voxtral TTS 文本转语音模型
Mistral AI 发布 Voxtral TTS,一个 40 亿参数的文本转语音模型,支持 9 种语言的情感化语音生成,具备低延迟和快速语音适配能力。该模型通过 API 和 Mistral Studio 提供,起步价每千字符 0.016 美元,支持仅 3 秒参考音频即可适配定制语音。
推荐理由:原文给出了与 ElevenLabs 的对比数据和具体价格,读者可以据此判断 Voxtral TTS 在语音生成领域的能力和成本。