跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 101–120 条 · 共 122 条
5月12日周二
  1. Google DeepMind68

    Google DeepMind 发布 Co-Scientist:基于 Gemini 的多智能体 AI 科研伙伴

    Google DeepMind 在 Nature 发布了 Co-Scientist 系统,这是一款基于 Gemini 模型的多智能体 AI 系统,用于生成和优化科学假设。该系统通过生成、辩论、进化三个阶段迭代产生新假设,已在肝纤维化治疗、ALS 研究、细胞衰老逆转等多个领域测试应用,并将通过 Hypothesis Generation 实验工具向个人研究者开放注册。

    推荐理由:原文给出了具体应用案例和能力变化,读者可以了解这个 AI 工具如何辅助科学研究以及它的实际效果。

5月6日周三
  1. Google DeepMind69

    Google DeepMind 展示 AlphaEvolve 一年成果:在基因组学、电网和量子计算等领域取得突破

    Google DeepMind 展示了 AlphaEvolve 这一 Gemini 驱动的 AI 编码智能体在过去一年取得的实际影响:在基因组学领域将 DNA 测序错误检测降低 30%。

    推荐理由:原文给出了 AlphaEvolve 在多个领域(基因组学、电网优化、量子计算等)的具体性能提升数据,读者可以据此评估这类 AI 编码智能体的实际效用。

4月27日周一
  1. Mistral AI73

    Mistral AI 发布企业级 AI 编排工具 Workflows

    Mistral AI 发布企业级 AI 编排工具 Workflows,提供持久执行、可观察性和人工审核介入能力,解决企业将 AI 从概念验证推向生产环境时的可靠性问题。用户用 Python 编写工作流后可发布到 Le Chat 供组织内任何人触发,基于 Temporal 引擎构建,数据和业务逻辑保留在用户环境中。ASML、ABANCA、France Travail 等企业已在生产环境中使用。

    推荐理由:原文给出了 Workflows 的核心能力——持久执行、可观察性和人工审核介入——以及基于 Temporal 引擎的技术架构,读者可以据此判断它会如何改变企业 AI 生产部署的工作流。

4月22日周三
  1. Google Research64

    ReasoningBank:让智能体从经验中学习

    Google Research 发布 ReasoningBank 框架,使大语言模型能在测试时从成功和失败的经验中自我进化。该框架将推理模式提炼为高层记忆存储,在 WebArena 和 SWE-Bench Verified 上相比无记忆智能体分别提升 8.3% 和 4.6% 成功率,并结合 MaTTS 扩展方法进一步提升 3% 成功率。

    推荐理由:论文给出了在 WebArena 和 SWE-bench 上相对于 baseline 的具体提升幅度(8.3%、4.6%、3%),并开源了代码,读者可据此判断该方法对智能体记忆机制研究的参考价值。

4月13日周一
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics-ER 1.6:增强实体推理赋能机器人任务

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其首个推理优先模型的重大升级版。该模型增强了空间推理和多视角理解能力,专门用于视觉与空间理解、任务规划和成功检测,并能原生调用工具如 Google Search、视觉语言动作模型或第三方函数。

    推荐理由:原文给出了具体性能对比和新增的仪表读取功能,读者可以据此判断该模型在机器人实体推理场景中的具体提升和可用性。

4月3日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4:字面意义上最强大的开源模型

    Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。

    推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。

3月29日周日
  1. Google DeepMind72

    Google DeepMind 发布 AI 赋能光标原型

    Google DeepMind 发布实验性的 AI 赋能光标,能够理解用户指向的内容及上下文。用户只需指向并用自然语言提问(如“显示方向”“对比这些产品”),AI 即可识别光标处的文字、图像、代码块等元素并提供相应帮助。该原型基于 Gemini 构建,计划集成到 Chrome 和新的 Googlebook 设备中。

    推荐理由:Google DeepMind 展示了 AI 赋能光标的新交互范式,读者可以了解 AI 如何从理解'指向什么'升级到理解'为什么指向',以及这一变化对现有工作流的意义。

3月25日周三
  1. Google Research75

    Google发布Vibe Coding XR:用XR Blocks和Gemini加速AI+XR原型开发

    Google宣布推出Vibe Coding XR工作流,结合Gemini的长期上下文推理能力和专门的系统提示词与代码模板,将自然语言直接转换为可在Android XR设备上运行的功能性、物理感知的XR应用。

    推荐理由:Google发布了一个完整的AI+XR原型开发工具链,展示了多个教育、娱乐和游戏场景的demo,读者可据此了解当前AI生成XR应用的能力边界。

3月17日周二
  1. Mistral AI72

    Mistral AI 加入 NVIDIA Nemotron Coalition 并发布 Mistral Small 4

    Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,与 NVIDIA 合作共同开发开源前沿 AI 模型。同时发布 Mistral Small 4,供全球开发者、研究者和组织构建和定制 AI 应用。合作将结合 Mistral AI 的模型架构和 NVIDIA 的计算资源,目标是建立透明、可访问的全球 AI 基础。

    推荐理由:给出了新模型的具体名称和开放入口,读者可以据此判断它对现有模型生态的补充价值。

  2. Mistral AI66

    Mistral AI 发布 Leanstral:面向 Lean 4 的开源代码智能体

    Mistral AI 发布 Leanstral,首个专为 Lean 4 证明助手设计的开源代码智能体,采用 6B 活跃参数的稀疏架构,支持 MCP,可通过 Mistral Vibe 或免费 API 使用,权重采用 Apache 2.0 许可证。

    推荐理由:原文给出了能力变化和基准测试对比,读者可以据此判断它如何改变形式化证明的工作流。

3月12日周四
  1. Google Research71

    Google在真实临床研究中测试对话式诊断AI可行性

    Google Research与Beth Israel Deaconess Medical Center合作,对对话式诊断AI系统AMIE进行了前瞻性单中心可行性研究。

    推荐理由:原文给出了在真实临床环境中测试对话式诊断AI的详细数据,包括安全性、诊断准确率、用户接受度等,读者可以据此了解当前医疗AI从模拟场景走向真实诊疗的可行性。

1月28日周三
  1. Mistral AI77

    Mistral Vibe 2.0 发布

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式等功能。Vibe 现已在 Le Chat Pro 和 Team 计划中可用,Devstral 2 转为付费 API 访问,同时提供企业级微调、强化学习和代码现代化服务。

    推荐理由:原文详细列出了 2.0 版本的具体新功能(子智能体、澄清机制、技能系统)和定价信息,读者可据此评估是否值得从旧版本迁移。

12月9日周二
10月24日周五
  1. Mistral AI68

    Mistral AI Studio 发布:企业级 AI 生产平台

    Mistral AI 发布全新企业级 AI 生产平台 AI Studio,提供可观测性(Observability)、智能体运行时(Agent Runtime)和 AI 注册表(AI Registry)三大核心功能。该平台旨在帮助企业解决从原型到生产的关键挑战,包括版本追踪、结果复现、实时监控、评估执行和合规部署。

    推荐理由:原文给出了三个核心功能模块和解决的企业级痛点,读者可以据此判断它会怎样改变现有 AI 部署工作流。

9月2日周二
  1. Mistral AI67

    Mistral AI 为 Le Chat 推出 Memory 记忆功能 beta 版

    Le Chat 推出 Memory 记忆功能 beta 版,基于用户调研总结的透明性、控制力和专注三大需求,设计了三个核心原则:透明性(明确展示记忆调用来源)、主动性(可随时关闭或编辑记忆)和主权性(支持导出导入)。底层采用图架构提升性能与上下文感知,并推出 Memory Insights 功能帮助用户探索和管理记忆。

    推荐理由:原文给出了 Memory 功能的设计理念和三个核心原则,读者可以了解 AI 记忆功能的设计思路,以及与现有产品的差异。

  2. Mistral AI70

    Mistral AI 为 Le Chat 推出 MCP 连接器和记忆功能

    Mistral AI 为 Le Chat 发布两项重大更新:一是推出 20+ 企业级 MCP 连接器,支持 Databricks、Snowflake、GitHub、Jira、Stripe 等工具的搜索、摘要和操作;二是推出 Memories 功能,可记忆用户偏好和事实并在对话中调用,同时支持从 ChatGPT 导入记忆。所有功能免费开放。

    推荐理由:原文详细给出了 MCP connectors 目录涵盖的 20+ 工具和 Memories 功能的核心能力,读者可以据此评估这些更新对自己工作流的具体影响。

7月30日周三
  1. Mistral AI68

    Mistral 发布 Codestral 25.08 及完整企业编码工具栈

    Mistral 发布 Codestral 25.08 代码补全模型,在 SWE-bench Verified 上 Devstral Medium 达 61.6%,Codestral 25.08 相比前代提升 30% 接受率和 10% 代码留存率。

    推荐理由:给出了具体性能提升数据(SWE-bench 61.6%、+30% accepted completions)和部署选项,读者可据此评估该版本相比前代及竞品的实际差距。

7月17日周四
6月4日周三
  1. Mistral AI72

    Mistral 推出企业级 AI 编程助手 Mistral Code

    Mistral 发布 Mistral Code,这是一款面向企业的 AI 编程助手,整合了 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、本地或空气隙部署,可对底层模型进行微调或蒸馏。私有测试版已开放,支持 JetBrains IDEs 和 VSCode,Abanca、SNCF 和 Capgemini 等企业已开始采用。

    推荐理由:原文给出了 Mistral Code 的核心能力(四个模型、企业级安全控制、可本地部署)和解决的四个企业痛点,读者可以据此判断它与企业现有工作流的适配度。

5月27日周二
  1. Mistral AI71

    Mistral 发布 Agents API

    Mistral 推出新的 Agents API,将 Mistral 强大的语言模型与内置连接器(代码执行、网络搜索、图像生成、文档库)、MCP 工具支持、持久记忆和智能体编排能力相结合。SimpleQA 基准测试显示,加入 web search 后,Mistral Large 和 Mistral Medium 的得分分别从 23% 和 22.08% 提升至 75% 和 82.32%。

    推荐理由:原文给出了 SimpleQA 基准测试的具体分数对比(有无 web search),读者可以据此评估搜索增强对模型实际能力的提升幅度。