#开源生态
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#开源生态
今日 0 条音频 · 工具·提示词·论文 三栏速览
每栏 5 / 6 · 直达分类页查看全部
提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分5353 mlsubgen:本地运行的45语言视频字幕工具
mlsubgen 是一款本地运行的字幕生成工具,支持45种语言。其技术特点包括:按语音段检测语言以支持混合语言内容;运行两个语音识别器并用本地大语言模型融合结果;优先使用已有的嵌入式字幕轨道(包括 Blu-ray PGS 轨的 OCR),无字幕时才分析音频。在 24GB RTX A5000 上处理速度约等于目标语言的实时时长,需要 16-32 GB 系统内存和 30-65 GB 模型存储。
Reddit · r/LocalLLaMA精选AI 评分7676 Oído:可在 5 美元微控制器上运行的语音识别模型,击败 Whisper-tiny
Lokutor 团队发布 Oído 语音识别模型,基于 NVIDIA Conformer-CTC Small(1300 万参数,int8),可在 ESP32-S3(8 MB PSRAM)上运行,无需 GPU 或 NPU。
推荐理由:原文给出了在 ESP32-S3 微控制器上的 WER 对比数据,读者可以据此判断它是否能替代 Whisper-tiny 满足端侧需求。
Hugging Face BlogAI 评分5757 NVIDIA Magpie TTS 多语言语音模型发布:支持 12 种语言、32ms 首次音频延迟
NVIDIA 发布 Magpie TTS 多语言语音合成模型,364M 参数支持英语、西班牙语、法语、德语、意大利语、越南语、普通话、印地语、日语、现代标准阿拉伯语、韩语和巴西葡萄牙语共 12 种语言。