#多模态
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#多模态
今日 6 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Mistral AI精选AI 评分6868 Le Chat 深度更新:新增深度研究、语音模式、项目管理等功能
Mistral AI 为 Le Chat 推出多项新功能:Deep Research(预览版)可生成结构化研究报告;Voice mode 由新的 Voxtral 语音输入模型驱动。
推荐理由:原文给出了 Le Chat 的具体功能变化和入口,读者可据此判断它会怎样改变现有工作流。
Mistral AI精选AI 评分7676 Mistral 发布 Voxtral 语音理解模型
Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,在基准测试中优于 Whisper large-v3、GPT-4o mini Transcribe 和 ElevenLabs Scribe,定价仅为 $0.001/分钟,不到竞品一半。模型支持 32k token 上下文,可处理最长 40 分钟音频,具备内置问答、摘要、多语言和函数调用能力。
推荐理由:原文给出了 Voxtral 在多个基准测试上的性能对比和定价信息,读者可以据此判断它在语音理解领域的能力位置和成本优势。
Replicate BlogAI 评分6969 Replicate 支持调用 MiniMax Speech-02 文本转语音模型
Replicate 现已支持通过 API 调用 MiniMax 的 Speech-02 系列文本转语音模型。该系列包括 Speech-02-HD(高质量语音旁白和有声书,$50/百万字符)和 Speech-02-Turbo(实时应用,$30/百万字符)两个版本,支持 30 多种语言和语音克隆功能(需 10 秒以上音频样本,训练约 30 秒,$3/声音)。
Mistral AI精选AI 评分7777 Mistral Small 3.1 发布
Mistral AI 发布 Mistral Small 3.1,号称同类最佳模型。新模型在文本性能和多模态理解上有所提升,上下文窗口扩展至 128k token,推理速度达 150 tokens/s,优于 Gemma 3 和 GPT-4o Mini。模型基于 Apache 2.0 许可证开源,可在单张 RTX 4090 或 32GB RAM Mac 上运行。
推荐理由:原文给出了性能对比和推理速度数据,读者可以据此判断它在同类模型中的竞争力。
Mistral AI精选AI 评分7575 Mistral 推出 OCR API,基准测试超越 Google、Azure 和 GPT-4o
Mistral 发布新的 OCR API Mistral OCR,可处理图像和 PDF 并提取交错文本和图像,在基准测试中超越 Google Document AI、Azure OCR、Gemini 和 GPT-4o。定价为每美元 1000 页,单节点处理速度最高达每分钟 2000 页,支持多语言文档理解,现已在 Le Chat 免费试用,API 已上线 la Plateforme。
推荐理由:原文给出了具体定价、基准测试对比和可用入口,读者可以据此评估它与现有 OCR 方案的差异。
Replicate BlogAI 评分2121 Replicate Intelligence #11:FLUX.1 微调上线,Tavus 推出数字双胞胎视频对话 API
Replicate 现已支持 FLUX.1 微调,上传 12-20 张图片并选择触发词,约 30 分钟即可生成定制模型。Tavus 发布 Conversational Video Interface,可构建低延迟(<1 秒)的数字双胞胎进行实时视频对话,适用于客户支持和销售场景。
Replicate BlogAI 评分2424 Replicate Intelligence #9:本周开源AI模型动态
Black Forest Labs发布FLUX.1图像生成模型套件,采用"flow matching"技术,支持高达2百万像素分辨率,分为pro、dev、schnell三个版本。Meta推出SAM 2图像和视频分割模型,零样本能力扩展至视频领域,性能提升3倍。Google发布Gemma 2 2B紧凑语言模型,仅20亿参数但在LMSYS Chatbot Arena超越所有GPT-3.5模型。