#新工具
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#新工具
今日 0 条音频 · 工具·提示词·论文 三栏速览
每栏 5 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分5353 mlsubgen:本地运行的45语言视频字幕工具
mlsubgen 是一款本地运行的字幕生成工具,支持45种语言。其技术特点包括:按语音段检测语言以支持混合语言内容;运行两个语音识别器并用本地大语言模型融合结果;优先使用已有的嵌入式字幕轨道(包括 Blu-ray PGS 轨的 OCR),无字幕时才分析音频。在 24GB RTX A5000 上处理速度约等于目标语言的实时时长,需要 16-32 GB 系统内存和 30-65 GB 模型存储。
Hacker News · 首页精选AI 评分7777 Audionaut 发布:开源多轨音频编辑器,支持 MCP 可被 AI 代理驱动
Audionaut 是一款免费开源的跨平台多轨音频编辑器,可通过 MCP 协议被 Claude 等 AI 代理驱动进行编辑。应用基于 JUCE 框架用现代 C++ 编写,支持 Windows、macOS 和 Linux;提供精确剪辑、每轨播放列表、灵活多声道支持和干净的导出功能。
推荐理由:原文给出了通过 MCP 让 AI 代理驱动音频编辑的能力,读者可以据此判断它会怎样改变现有音频工作流。
The Decoder精选AI 评分7777 Microsoft AI 发布用于语音智能体的转录和文本转语音模型
Microsoft AI 发布 MAI-Transcribe-2-Streaming 实时转录模型,支持 60 种语言,首个部分结果交付时间约 100 毫秒,在 Artificial Analysis 准确率排名第一,年内定价 $0.54/小时。
推荐理由:原文给出了具体的性能指标(100ms 延迟、60 种语言、$0.54/小时)和对比数据,读者可以据此评估新产品相对于现有方案的性价比。
Product Hunt · AI 分类精选AI 评分6767 Clarity: 实时 TTS 工具发布,支持语音克隆与亚 60ms 延迟
Clarity 是一款柏林团队开发的实时文字转语音产品,具备语音克隆能力,延迟低于 60ms,支持本地部署或 API 调用。其语法感知规范化功能可自然朗读 25+ 语言的电话号码、IBAN、地址和药物名称,并提供词级时间戳和 IPA 标注。适配 LiveKit、Pipecat 和 Vapi 平台。
推荐理由:原文给出了核心能力(实时 TTS、语音克隆、低延迟、语法感知规范化、多语言适配)和可用方式(本地部署或 API),读者可以判断它与其他 TTS 产品的差异。
Hacker News · 首页AI 评分6969 Parrot 发布:开源智能会议记录器,Mac 端实时 Copilot
Parrot 0.24.2 发布,这是一款开源的 Mac 智能会议记录器,内置实时 Copilot。它能自动检测通话开始、实时提供文档答案、记录所有会议供后续查询。
Reddit · r/artificialAI 评分6666 Historai:把任意历史时刻变成可中断的双人播客
用户输入任意历史主题约两分钟后,系统生成一期双主持人播客,配有史料和艺术品。核心亮点是播放中可随时按麦克风提问,主持人会即时回答并融入叙事。作者对比了 GPT、Claude 和 Gemini 在研究规划、脚本撰写、艺术品选择和语音合成四个环节的表现,为每个环节选定了最优模型。
Product Hunt · AI 分类AI 评分5050 Zumbo:Mac 本地离线语音转文字工具
Zumbo 是一款 Mac 端本地 AI 语音转文字工具,延迟约五分之一秒,支持 21 种词汇包(开发者工具、法律、医疗、设计等),能从用户修正中学习。具备笔记提醒、会议说话人标签等功能,离线可用,无需账户,一次性付费开源。
Simon WillisonAI 评分6666 Google 发布 Gemini 3.8 TTS 模型,Simon Willison 推出交互式 playground
Google 发布了两个新的 Gemini TTS 模型(gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts),提供超过 2000 个声音库,并支持用 30 秒音频样本创建自定义声音。
Hugging Face Blog精选AI 评分6262 Hugging Face 和 Cerebras 合作展示 Gemma 4 实时语音 AI
Hugging Face 与 Cerebras 合作展示了基于 Gemma 4 的实时语音转语音系统,采用模块化开源架构:Nvidia Parakeet 语音识别 + Cerebras 加速 Gemma 4 VLM 推理 + 阿里 Qwen3TTS 语音生成。该系统已在超过 9,000 台 Reachy Mini 机器人上部署,旨在解决语音 AI 的延迟问题,提供更稳定、可预测的低延迟体验。
推荐理由:原文展示了实时语音 AI 的低延迟方案,读者可以了解这个技术演示的核心架构和性能改进。
Mistral AI精选AI 评分7979 Mistral AI 发布 Voxtral TTS 文本转语音模型
Mistral AI 发布 Voxtral TTS,一个 40 亿参数的文本转语音模型,支持 9 种语言的情感化语音生成,具备低延迟和快速语音适配能力。该模型通过 API 和 Mistral Studio 提供,起步价每千字符 0.016 美元,支持仅 3 秒参考音频即可适配定制语音。
推荐理由:原文给出了与 ElevenLabs 的对比数据和具体价格,读者可以据此判断 Voxtral TTS 在语音生成领域的能力和成本。