跳到正文

#Mistral

今日 0 条

一手 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
6月11日周三
6月10日周二
  1. Mistral AI72

    Mistral AI 发布首款推理模型 Magistral

    Mistral AI 发布首款推理模型 Magistral,提供开源版 Small(24B 参数)和企业版 Medium 两个版本。Magistral Medium 在 AIME2024 得分 73.6%( majority voting @64 达 90%),Small 版本得分 70.7%。

    推荐理由:给出了 AIME2024 基准测试的具体分数(73.6%/70.7%)和速度对比(10x),读者可据此评估该推理模型在同类中的相对性能。

6月4日周三
  1. Mistral AI72

    Mistral 推出企业级 AI 编程助手 Mistral Code

    Mistral 发布 Mistral Code,这是一款面向企业的 AI 编程助手,整合了 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、本地或空气隙部署,可对底层模型进行微调或蒸馏。私有测试版已开放,支持 JetBrains IDEs 和 VSCode,Abanca、SNCF 和 Capgemini 等企业已开始采用。

    推荐理由:原文给出了 Mistral Code 的核心能力(四个模型、企业级安全控制、可本地部署)和解决的四个企业痛点,读者可以据此判断它与企业现有工作流的适配度。

5月28日周三
  1. Mistral AI77

    Mistral AI 发布 Codestral Embed 首款代码专用嵌入模型

    Mistral AI 发布首款代码专用嵌入模型 Codestral Embed,在 SWE-Bench、CodeSearchNet、Text2Code 等基准上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大 embedding 模型。

    推荐理由:原文给出了与竞品的性能对比数据,读者可以据此判断该模型在代码检索场景中的实际适用性。

5月27日周二
  1. Mistral AI71

    Mistral 发布 Agents API

    Mistral 推出新的 Agents API,将 Mistral 强大的语言模型与内置连接器(代码执行、网络搜索、图像生成、文档库)、MCP 工具支持、持久记忆和智能体编排能力相结合。SimpleQA 基准测试显示,加入 web search 后,Mistral Large 和 Mistral Medium 的得分分别从 23% 和 22.08% 提升至 75% 和 82.32%。

    推荐理由:原文给出了 SimpleQA 基准测试的具体分数对比(有无 web search),读者可以据此评估搜索增强对模型实际能力的提升幅度。

5月21日周三
  1. Mistral AI77

    Mistral AI 与 All Hands AI 合作发布 Devstral

    Mistral AI 推出 Devstral,这是一款用于软件工程任务的智能体大语言模型,在 SWE-Bench Verified 基准上达到 46.8%,超越此前开源 SOTA 模型超过 6 个百分点,并超过 GPT-4.1-mini 约 20%。

    推荐理由:原文给出了 Devstral 在 SWE-Bench Verified 上的具体得分(46.8%)、可在单张 RTX 4090 上运行的信息以及 API 价格,读者可据此评估该模型的能力和部署门槛。

5月7日周三
  1. Mistral AI73

    Mistral 发布 Medium 3 模型,主打高效能与低成本的 frontier 级别模型

    Mistral AI 发布 Medium 3 模型,定位为兼顾 SOTA 性能与低成本的企业级模型。定价为每百万 token 输入 0.4 美元、输出 2 美元,约为 Claude Sonnet 3.7 成本的十分之一,在编码和多模态理解等专业场景表现接近更大更慢的模型,超越 Llama 4 Maverick 和 DeepSeek v3。

    推荐理由:原文给出了具体定价($0.4/$2 per M token)和性能对比数据(90% Claude Sonnet 3.7、超越 Llama 4 Maverick),读者可以据此判断该模型在性能和成本上的具体表现。

4月9日周三
  1. Mistral AI60

    Mistral 发布基于 LLM as a Judge 的 RAG 评估方法

    本文介绍了使用 LLM 作为评判者来评估 RAG 系统的完整方法,重点讲解了 RAG Triad 框架的三个核心指标:上下文相关性(Context Relevance)、事实一致性(Groundedness)和答案相关性(Answer Relevance),并提供了使用 Mistral 结构化输出实现评估的代码示例。

    推荐理由:原文给出了 RAG 评估的完整方法论和代码实现,读者可以据此构建自己的 RAG 系统评估流程。

3月17日周一
  1. Mistral AI77

    Mistral Small 3.1 发布

    Mistral AI 发布 Mistral Small 3.1,号称同类最佳模型。新模型在文本性能和多模态理解上有所提升,上下文窗口扩展至 128k token,推理速度达 150 tokens/s,优于 Gemma 3 和 GPT-4o Mini。模型基于 Apache 2.0 许可证开源,可在单张 RTX 4090 或 32GB RAM Mac 上运行。

    推荐理由:原文给出了性能对比和推理速度数据,读者可以据此判断它在同类模型中的竞争力。

3月7日周五
  1. Mistral AI75

    Mistral 推出 OCR API,基准测试超越 Google、Azure 和 GPT-4o

    Mistral 发布新的 OCR API Mistral OCR,可处理图像和 PDF 并提取交错文本和图像,在基准测试中超越 Google Document AI、Azure OCR、Gemini 和 GPT-4o。定价为每美元 1000 页,单节点处理速度最高达每分钟 2000 页,支持多语言文档理解,现已在 Le Chat 免费试用,API 已上线 la Plateforme。

    推荐理由:原文给出了具体定价、基准测试对比和可用入口,读者可以据此评估它与现有 OCR 方案的差异。

3月4日周二