Anthropic 发布 Claude Haiku 5.5,主打高吞吐低成本任务
Anthropic 发布 Claude Haiku 5.5,主打高吞吐、成本敏感型任务,是其迄今最便宜、最快、能力最强的小模型。
推荐理由:原文把新模型的价格、速度、子智能体定位和基准成绩一次性给出,方便对比 Haiku 4.5 与同级模型的取舍。
每条发布 = 一张工具卡 · 命中 "新工具 / 产品更新 / 模型发布 / 平台" 标签(itemType=tool_release)· 按时间排序
Anthropic 发布 Claude Haiku 5.5,主打高吞吐、成本敏感型任务,是其迄今最便宜、最快、能力最强的小模型。
推荐理由:原文把新模型的价格、速度、子智能体定位和基准成绩一次性给出,方便对比 Haiku 4.5 与同级模型的取舍。
GitHub 与 Microsoft Applied Sciences 构建了微调的 ModernBERT 分类器,可在不到 2 milliseconds 内评估一组候选密钥,并让可阻止的密钥数量增加一倍以上。
推荐理由:GitHub 用九个季度的数据说明密钥泄露风险未随代码量明显上升,并公开了保护机制扩展到非结构化密钥的方法。
Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。
推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。
Reflection 发布首个开源权重模型 Beam,采用稀疏 MoE 架构,总参数量 501B、激活 23B,面向编码、推理与智能体场景。模型在 23.8T token 上完成预训练,并在 10.5K 块 NVIDIA GB300 GPU 上用 4 周生成超 1 亿次 rollout 进行高算力强化学习。
推荐理由:原文给出模型规模、训练规模与推理效率数据,并承诺本月开源权重与技术报告,可作为西方开源前沿模型的参照基线。
Singularity 是一款新的 AI 编码工具,用原子化 ticket 替代聊天,每个 ticket 对应一个独立 Git worktree 和最小上下文。支持跨仓库并行运行多个 agent,审查 diff 后合并。免费、本地优先、需要用户自备 API key。
推荐理由:它用 atomic tickets 和隔离的 Git worktree 提供了一种新的 AI 编码工作流,读者可以直接尝试这种替代聊天的方案。
OpenCompanion 是管理 Claude Code、Codex CLI、OpenCode 多会话的工具。当这些 AI 编码助手在多个文件夹同时运行时,OpenCompanion 能在同一界面列出所有会话、提示授权需求,支持在桌面或同一 Wi-Fi 下的手机端回复。无账户、无云服务器、无遥测,开源(MIT),支持 Windows、Linux 和 macOS。
推荐理由:原文给出了具体问题和解决方案,读者可以判断它能否解决自己在多项目同时开发时的授权管理痛点。
xAI 的 Grok 4.7 现已在 Amazon Bedrock 上线,支持 50 万 token 上下文窗口和低/中/高/xhigh 四档可配置推理 effort。该模型定位为 xAI 最强的编码和知识工作模型,强调在困难任务上工作更久并更仔细地自我验证,支持 Responses、Chat Completions 和 Converse API,可通过跨区域推理配置文件路由。
推荐理由:提供了模型在 Bedrock 上的具体接入方式、API 接口和定价策略,读者可据此评估集成成本和工作流适配性。
Anthropic 的 Claude Sonnet 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用。该模型更适合聚焦的编码和知识工作,相较 Opus 5.5 以更低的每任务成本和更快的速度完成范围明确的工作。文章提供了在 Amazon Bedrock 控制台测试和通过 AWS SDK 编程调用的具体步骤,并列出了必要的 IAM 权限要求。
推荐理由:原文给出了 Claude Sonnet 5.5 的能力定位(更适合聚焦编码和知识工作)和成本/速度优势,读者可以据此判断它是否适合替换当前的模型方案。
Anthropic 发布 Claude Sonnet 5.5,输出速度快 30% 以上,单任务成本降低达 30%。在 Terminal-Bench 4.0 上从 10.3% 跃升至 70.6%,CursorBench 4.0 达 55.5%,仅比 Opus 5.5 低 2 分。
推荐理由:原文给出了 Claude Sonnet 5.5 在多项基准上的具体分数和与 Opus 5.5、GPT-6 Sol 的对比,以及成本和速度数据,读者可据此判断是否值得切换模型。
Firetower 是一款开源、可自托管的编码智能体运行工具,支持 Claude Code 和 Codex,可在其控制的基础设施上运行并从桌面或移动设备管理。该工具用 Rust 构建。
推荐理由:它提供了开源、可自托管的编码智能体部署方案,读者可据此判断是否适合自己的基础设施。
H company 发布新的智能体模型系列 Holo4,包含 27B dense 和 35B-A3B MoE 两个版本,可通过 GUIs、代码、MCP 和 APIs 与软件交互。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google DeepMind发布Gemini 3.8 Flash和3.8 Flash Cyber两款新模型。3.8 Flash在DeepSWE v1.1基准上超越多数更大规模的frontier模型,在HLE-Verified上达54.9%,价格为每百万输入token 0.75美元、输出token 3.75美元。
推荐理由:原文给出了在软件工程、Agent任务和多步推理方面的具体性能提升数据和成本对比,读者可据此判断模型能力变化。
微软发布 Orchard 开源框架,包含 Orchard Env 运行环境服务和三个领域训练工作流(Orchard-SWE、Orchard-GUI、Orchard-Claw)。
推荐理由:原文给出了具体性能数据(69.7% on SWE-bench Verified)和三个可复用的训练工作流,读者可以据此判断这个开源框架对自己研究或项目的实用价值。
Mistral 发布 Mistral Code,这是一款面向企业的 AI 编程助手,整合了 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、本地或空气隙部署,可对底层模型进行微调或蒸馏。私有测试版已开放,支持 JetBrains IDEs 和 VSCode,Abanca、SNCF 和 Capgemini 等企业已开始采用。
推荐理由:原文给出了 Mistral Code 的核心能力(四个模型、企业级安全控制、可本地部署)和解决的四个企业痛点,读者可以据此判断它与企业现有工作流的适配度。
已经到底了