跳到正文

#多模态

今日 6 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
7月17日周四
7月15日周二
  1. Mistral AI76

    Mistral 发布 Voxtral 语音理解模型

    Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,在基准测试中优于 Whisper large-v3、GPT-4o mini Transcribe 和 ElevenLabs Scribe,定价仅为 $0.001/分钟,不到竞品一半。模型支持 32k token 上下文,可处理最长 40 分钟音频,具备内置问答、摘要、多语言和函数调用能力。

    推荐理由:原文给出了 Voxtral 在多个基准测试上的性能对比和定价信息,读者可以据此判断它在语音理解领域的能力位置和成本优势。

5月6日周二
3月17日周一
  1. Mistral AI77

    Mistral Small 3.1 发布

    Mistral AI 发布 Mistral Small 3.1,号称同类最佳模型。新模型在文本性能和多模态理解上有所提升,上下文窗口扩展至 128k token,推理速度达 150 tokens/s,优于 Gemma 3 和 GPT-4o Mini。模型基于 Apache 2.0 许可证开源,可在单张 RTX 4090 或 32GB RAM Mac 上运行。

    推荐理由:原文给出了性能对比和推理速度数据,读者可以据此判断它在同类模型中的竞争力。

3月7日周五
  1. Mistral AI75

    Mistral 推出 OCR API,基准测试超越 Google、Azure 和 GPT-4o

    Mistral 发布新的 OCR API Mistral OCR,可处理图像和 PDF 并提取交错文本和图像,在基准测试中超越 Google Document AI、Azure OCR、Gemini 和 GPT-4o。定价为每美元 1000 页,单节点处理速度最高达每分钟 2000 页,支持多语言文档理解,现已在 Le Chat 免费试用,API 已上线 la Plateforme。

    推荐理由:原文给出了具体定价、基准测试对比和可用入口,读者可以据此评估它与现有 OCR 方案的差异。

8月16日周五
8月2日周五
  1. Replicate Blog24

    Replicate Intelligence #9:本周开源AI模型动态

    Black Forest Labs发布FLUX.1图像生成模型套件,采用"flow matching"技术,支持高达2百万像素分辨率,分为pro、dev、schnell三个版本。Meta推出SAM 2图像和视频分割模型,零样本能力扩展至视频领域,性能提升3倍。Google发布Gemma 2 2B紧凑语言模型,仅20亿参数但在LMSYS Chatbot Arena超越所有GPT-3.5模型。