跳到正文

#Agent

今日 7 条

一手 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
5月22日周五
  1. Mistral AI72

    Mistral Studio 发布 Connectors 功能:内置和自定义 MCP 连接器现已可通过 API 使用

    Mistral 发布 Studio 中的 Connectors 功能,所有内置连接器和自定义 MCP 现可通过 API/SDK 用于模型和智能体调用。同时推出直接工具调用和人工介入审批流程,可在 LeChat 和 AI Studio 中使用,支持与企业系统如 CRM、知识库和生产力工具的复杂工作流集成。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

5月20日周三
  1. Google Research63

    Google 发布 Empirical Research Assistance (ERA),一款用于科学研究代码编写的 AI 工具

    Google 发布 Empirical Research Assistance (ERA),这是一款使用 Gemini 编写和优化科学代码的研究工具,可搜索科学文献、写代码、探索方案、组合技术并评估结果,在基因组学、公共卫生、卫星图像分析等多个基准上达到专家水平。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

5月19日周二
5月18日周一
5月17日周日
5月16日周六
  1. Google DeepMind68

    Google DeepMind 与新加坡启动国家 AI 合作伙伴关系

    Google DeepMind 宣布与新加坡政府建立国家 AI 合作伙伴关系,通过多个项目推动医疗保健、生命科学、教育和可持续发展领域的 AI 应用。预计到 2040 年,AI 将在新加坡通过加速研发创造 33 亿新加坡元的经济价值。

    推荐理由:原文给出了合作的具体领域、经济价值预测和项目细节,读者可以据此了解 AI 在公共服务领域的应用方向和 Google DeepMind 的亚太布局。

  2. Google DeepMind75

    Google 发布 Gemini 3.5:兼顾前沿智能与行动能力

    Google 正式发布 Gemini 3.5 系列首款模型 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等 agentic 和 coding 基准上达到前沿性能,输出速度是其他前沿模型的 4 倍。

    推荐理由:原文给出了 Terminal-Bench、GDPval-AA 等多个 agentic 和 coding 基准的具体分数,以及 4 倍速度提升的对比数据,读者可据此判断模型在复杂长程任务上的实际性能。

5月12日周二
  1. Google DeepMind68

    Google DeepMind 发布 Co-Scientist:基于 Gemini 的多智能体 AI 科研伙伴

    Google DeepMind 在 Nature 发布了 Co-Scientist 系统,这是一款基于 Gemini 模型的多智能体 AI 系统,用于生成和优化科学假设。该系统通过生成、辩论、进化三个阶段迭代产生新假设,已在肝纤维化治疗、ALS 研究、细胞衰老逆转等多个领域测试应用,并将通过 Hypothesis Generation 实验工具向个人研究者开放注册。

    推荐理由:原文给出了具体应用案例和能力变化,读者可以了解这个 AI 工具如何辅助科学研究以及它的实际效果。

5月8日周五
  1. Berkeley AI Research32

    自适应并行推理:高效推理扩展的新范式

    大语言模型推理过程中,顺序推理面临上下文膨胀、延迟增加和context-rot等问题,自适应并行推理允许模型自主决定何时分解任务、生成多少并发线程及如何协调。基于对现有并行推理方法的分析,文章指出固定并行结构的局限性,并探讨模型自适应控制的发展方向。

5月6日周三
  1. Google DeepMind69

    Google DeepMind 展示 AlphaEvolve 一年成果:在基因组学、电网和量子计算等领域取得突破

    Google DeepMind 展示了 AlphaEvolve 这一 Gemini 驱动的 AI 编码智能体在过去一年取得的实际影响:在基因组学领域将 DNA 测序错误检测降低 30%。

    推荐理由:原文给出了 AlphaEvolve 在多个领域(基因组学、电网优化、量子计算等)的具体性能提升数据,读者可以据此评估这类 AI 编码智能体的实际效用。

4月30日周四
  1. Google DeepMind53

    Google DeepMind发布AI co-clinician研究计划,探索AI辅助医疗新模式

    Google DeepMind宣布推出AI co-clinician研究计划,探索AI作为护理团队协作成员在临床监督下与患者互动。在98个真实初级保健查询的盲评中,AI co-clinician在97个案例中实现零关键错误,优于两款广泛使用的AI系统。在140个咨询技能维度的评估中,AI在68个领域达到或超过初级保健医生水平。团队还在模拟远程医疗环境中测试了实时多模态AI能力。

4月27日周一
  1. Mistral AI73

    Mistral AI 发布企业级 AI 编排工具 Workflows

    Mistral AI 发布企业级 AI 编排工具 Workflows,提供持久执行、可观察性和人工审核介入能力,解决企业将 AI 从概念验证推向生产环境时的可靠性问题。用户用 Python 编写工作流后可发布到 Le Chat 供组织内任何人触发,基于 Temporal 引擎构建,数据和业务逻辑保留在用户环境中。ASML、ABANCA、France Travail 等企业已在生产环境中使用。

    推荐理由:原文给出了 Workflows 的核心能力——持久执行、可观察性和人工审核介入——以及基于 Temporal 引擎的技术架构,读者可以据此判断它会如何改变企业 AI 生产部署的工作流。

4月22日周三
  1. Google Research64

    ReasoningBank:让智能体从经验中学习

    Google Research 发布 ReasoningBank 框架,使大语言模型能在测试时从成功和失败的经验中自我进化。该框架将推理模式提炼为高层记忆存储,在 WebArena 和 SWE-Bench Verified 上相比无记忆智能体分别提升 8.3% 和 4.6% 成功率,并结合 MaTTS 扩展方法进一步提升 3% 成功率。

    推荐理由:论文给出了在 WebArena 和 SWE-bench 上相对于 baseline 的具体提升幅度(8.3%、4.6%、3%),并开源了代码,读者可据此判断该方法对智能体记忆机制研究的参考价值。

4月21日周二
  1. Google DeepMind45

    Google DeepMind 携手五大咨询公司加速企业 AI 转型

    Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 五大咨询公司合作,帮助企业大规模采用前沿 AI 技术。目前仅 25% 的组织成功将 AI 投入生产,AI 预计到 2030 年贡献全球 15.7 万亿美元经济价值。合作将提供 Gemini 系列前沿模型的优先访问权限,聚焦金融、制造、零售、媒体娱乐等行业的企业需求。

4月20日周一
  1. Berkeley AI Research59

    GRASP:基于梯度的新型长视野世界模型规划器

    研究团队提出 GRASP,一种基于梯度的规划器,用于解决学习到的世界模型在长视野规划中的脆弱性问题。核心方法包括:将轨迹提升到虚拟状态以实现时间并行优化、向状态迭代添加随机性以实现探索、以及重塑梯度以保留动作梯度而阻断脆弱的状态输入梯度。在 Push-T 任务上,GRASP 在 H=40-80 的各视野下均取得最高成功率,且中位成功时间显著低于基线方法。

4月14日周二
  1. Google Research59

    Google 发布 Vantage:用生成式 AI 评估未来必备技能的研究实验

    Google Research 联合纽约大学发布 Vantage,一个利用生成式 AI 在模拟环境中创建对话来评估学生未来必备技能(如批判性思维、协作、创造性思维)的研究实验。该工具有 Executive LLM 引导对话进行自适应评估,AI Evaluator 与人类专家评分一致性相当。Vantage 现已在 Google Labs 开放英语注册,旨在为教育者提供可扩展的技能评估方法。

4月13日周一
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics-ER 1.6:增强实体推理赋能机器人任务

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其首个推理优先模型的重大升级版。该模型增强了空间推理和多视角理解能力,专门用于视觉与空间理解、任务规划和成功检测,并能原生调用工具如 Google Search、视觉语言动作模型或第三方函数。

    推荐理由:原文给出了具体性能对比和新增的仪表读取功能,读者可以据此判断该模型在机器人实体推理场景中的具体提升和可用性。

4月9日周四
4月3日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4:字面意义上最强大的开源模型

    Google DeepMind 正式发布 Gemma 4 系列开源模型,提供 E2B、E4B、26B MoE 和 31B Dense 四种规格。31B 版本在 Arena AI 文本排行榜位列第三,26B 排名第六,均超越参数量 20 倍于自身的模型。

    推荐理由:原文给出了四个版本的具体定位和性能数据,读者可以据此判断 Gemma 4 是否适合自己的硬件条件和使用场景。

3月29日周日
  1. Google DeepMind72

    Google DeepMind 发布 AI 赋能光标原型

    Google DeepMind 发布实验性的 AI 赋能光标,能够理解用户指向的内容及上下文。用户只需指向并用自然语言提问(如“显示方向”“对比这些产品”),AI 即可识别光标处的文字、图像、代码块等元素并提供相应帮助。该原型基于 Gemini 构建,计划集成到 Chrome 和新的 Googlebook 设备中。

    推荐理由:Google DeepMind 展示了 AI 赋能光标的新交互范式,读者可以了解 AI 如何从理解'指向什么'升级到理解'为什么指向',以及这一变化对现有工作流的意义。

3月25日周三
  1. Google Research75

    Google发布Vibe Coding XR:用XR Blocks和Gemini加速AI+XR原型开发

    Google宣布推出Vibe Coding XR工作流,结合Gemini的长期上下文推理能力和专门的系统提示词与代码模板,将自然语言直接转换为可在Android XR设备上运行的功能性、物理感知的XR应用。

    推荐理由:Google发布了一个完整的AI+XR原型开发工具链,展示了多个教育、娱乐和游戏场景的demo,读者可据此了解当前AI生成XR应用的能力边界。

3月18日周三
3月17日周二
  1. Mistral AI72

    Mistral AI 加入 NVIDIA Nemotron Coalition 并发布 Mistral Small 4

    Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,与 NVIDIA 合作共同开发开源前沿 AI 模型。同时发布 Mistral Small 4,供全球开发者、研究者和组织构建和定制 AI 应用。合作将结合 Mistral AI 的模型架构和 NVIDIA 的计算资源,目标是建立透明、可访问的全球 AI 基础。

    推荐理由:给出了新模型的具体名称和开放入口,读者可以据此判断它对现有模型生态的补充价值。

  2. Mistral AI66

    Mistral AI 发布 Leanstral:面向 Lean 4 的开源代码智能体

    Mistral AI 发布 Leanstral,首个专为 Lean 4 证明助手设计的开源代码智能体,采用 6B 活跃参数的稀疏架构,支持 MCP,可通过 Mistral Vibe 或免费 API 使用,权重采用 Apache 2.0 许可证。

    推荐理由:原文给出了能力变化和基准测试对比,读者可以据此判断它如何改变形式化证明的工作流。

3月12日周四
  1. Google Research71

    Google在真实临床研究中测试对话式诊断AI可行性

    Google Research与Beth Israel Deaconess Medical Center合作,对对话式诊断AI系统AMIE进行了前瞻性单中心可行性研究。

    推荐理由:原文给出了在真实临床环境中测试对话式诊断AI的详细数据,包括安全性、诊断准确率、用户接受度等,读者可以据此了解当前医疗AI从模拟场景走向真实诊疗的可行性。

3月11日周三
1月28日周三
  1. Mistral AI77

    Mistral Vibe 2.0 发布

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式等功能。Vibe 现已在 Le Chat Pro 和 Team 计划中可用,Devstral 2 转为付费 API 访问,同时提供企业级微调、强化学习和代码现代化服务。

    推荐理由:原文详细列出了 2.0 版本的具体新功能(子智能体、澄清机制、技能系统)和定价信息,读者可据此评估是否值得从旧版本迁移。

12月9日周二
10月24日周五
  1. Mistral AI68

    Mistral AI Studio 发布:企业级 AI 生产平台

    Mistral AI 发布全新企业级 AI 生产平台 AI Studio,提供可观测性(Observability)、智能体运行时(Agent Runtime)和 AI 注册表(AI Registry)三大核心功能。该平台旨在帮助企业解决从原型到生产的关键挑战,包括版本追踪、结果复现、实时监控、评估执行和合规部署。

    推荐理由:原文给出了三个核心功能模块和解决的企业级痛点,读者可以据此判断它会怎样改变现有 AI 部署工作流。

10月2日周四
  1. Replicate Blog72

    IBM Granite 4.0 模型现已登陆 Replicate

    IBM 发布 Granite 4.0 开源小语言模型系列,专为速度和低成本打造。该系列采用混合架构结合 Mamba-2 线性扩展效率与 Transformer 精度,部分模型使用 MoE 路由策略,可在普通消费级 GPU 上运行。主要适用于文档摘要、RAG 系统和 AI 智能体场景,已在 Apache 2.0 许可证下开源。

9月2日周二
  1. Mistral AI67

    Mistral AI 为 Le Chat 推出 Memory 记忆功能 beta 版

    Le Chat 推出 Memory 记忆功能 beta 版,基于用户调研总结的透明性、控制力和专注三大需求,设计了三个核心原则:透明性(明确展示记忆调用来源)、主动性(可随时关闭或编辑记忆)和主权性(支持导出导入)。底层采用图架构提升性能与上下文感知,并推出 Memory Insights 功能帮助用户探索和管理记忆。

    推荐理由:原文给出了 Memory 功能的设计理念和三个核心原则,读者可以了解 AI 记忆功能的设计思路,以及与现有产品的差异。

  2. Mistral AI70

    Mistral AI 为 Le Chat 推出 MCP 连接器和记忆功能

    Mistral AI 为 Le Chat 发布两项重大更新:一是推出 20+ 企业级 MCP 连接器,支持 Databricks、Snowflake、GitHub、Jira、Stripe 等工具的搜索、摘要和操作;二是推出 Memories 功能,可记忆用户偏好和事实并在对话中调用,同时支持从 ChatGPT 导入记忆。所有功能免费开放。

    推荐理由:原文详细给出了 MCP connectors 目录涵盖的 20+ 工具和 Memories 功能的核心能力,读者可以据此评估这些更新对自己工作流的具体影响。

7月30日周三
  1. Mistral AI68

    Mistral 发布 Codestral 25.08 及完整企业编码工具栈

    Mistral 发布 Codestral 25.08 代码补全模型,在 SWE-bench Verified 上 Devstral Medium 达 61.6%,Codestral 25.08 相比前代提升 30% 接受率和 10% 代码留存率。

    推荐理由:给出了具体性能提升数据(SWE-bench 61.6%、+30% accepted completions)和部署选项,读者可据此评估该版本相比前代及竞品的实际差距。

7月17日周四
6月4日周三
  1. Mistral AI72

    Mistral 推出企业级 AI 编程助手 Mistral Code

    Mistral 发布 Mistral Code,这是一款面向企业的 AI 编程助手,整合了 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、本地或空气隙部署,可对底层模型进行微调或蒸馏。私有测试版已开放,支持 JetBrains IDEs 和 VSCode,Abanca、SNCF 和 Capgemini 等企业已开始采用。

    推荐理由:原文给出了 Mistral Code 的核心能力(四个模型、企业级安全控制、可本地部署)和解决的四个企业痛点,读者可以据此判断它与企业现有工作流的适配度。

5月27日周二
  1. Mistral AI71

    Mistral 发布 Agents API

    Mistral 推出新的 Agents API,将 Mistral 强大的语言模型与内置连接器(代码执行、网络搜索、图像生成、文档库)、MCP 工具支持、持久记忆和智能体编排能力相结合。SimpleQA 基准测试显示,加入 web search 后,Mistral Large 和 Mistral Medium 的得分分别从 23% 和 22.08% 提升至 75% 和 82.32%。

    推荐理由:原文给出了 SimpleQA 基准测试的具体分数对比(有无 web search),读者可以据此评估搜索增强对模型实际能力的提升幅度。

5月21日周三
  1. Mistral AI77

    Mistral AI 与 All Hands AI 合作发布 Devstral

    Mistral AI 推出 Devstral,这是一款用于软件工程任务的智能体大语言模型,在 SWE-Bench Verified 基准上达到 46.8%,超越此前开源 SOTA 模型超过 6 个百分点,并超过 GPT-4.1-mini 约 20%。

    推荐理由:原文给出了 Devstral 在 SWE-Bench Verified 上的具体得分(46.8%)、可在单张 RTX 4090 上运行的信息以及 API 价格,读者可据此评估该模型的能力和部署门槛。