#编码
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#编码
今日 1 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条GitHub Blog · AI & ML精选AI 评分6262 GitHub 推出 ModernBERT 密钥分类器扩展 Push Protection
GitHub 与 Microsoft Applied Sciences 构建了微调的 ModernBERT 分类器,可在不到 2 milliseconds 内评估一组候选密钥,并让可阻止的密钥数量增加一倍以上。
推荐理由:GitHub 用九个季度的数据说明密钥泄露风险未随代码量明显上升,并公开了保护机制扩展到非结构化密钥的方法。
Mistral AI精选AI 评分8585 Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型
Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。
推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。
AWS Machine Learning BlogAI 评分1919 智谱 GLM 5.3 上线 Amazon Bedrock,主打编码与长链路智能体任务
智谱(Z.ai)的 GLM 5.3 现已在 Amazon Bedrock 上线,面向企业客户提供全托管 API 接入。该模型为 753B 参数的 MoE 架构,专为编码与长链路智能体任务优化,发布时在 CyberGym 基准上取得 84.5 分。Bedrock 同时提供跨区域推理、隐式与显式 prompt caching,以及 Flex / Priority / Standard 三档服务等级。
AWS Machine Learning BlogAI 评分3030 Amazon SageMaker AI 推出 aws-ai-ml 技能,为编码 Agent 提供推理优化能力
Amazon SageMaker AI 发布 aws-ai-ml 技能,可接入 Kiro、Claude Code、Codex 等支持 MCP 的编码 Agent,让其具备推理端点基准测试、部署配置推荐和 SageMaker Python SDK v3 代码生成能力。
AWS Machine Learning BlogAI 评分3030 在 AWS GovCloud (US) 中用 Claude Code 与 Amazon Bedrock 加速受监管工作负载
Anthropic Claude Opus 5.5 与 Claude Sonnet 5.5 已在 AWS GovCloud (US) 区域 Amazon Bedrock 上可用。
GitHub Blog · AI & MLAI 评分3636 GitHub 推出 ReviewBench:面向 AI 代码评审智能体的开源基准
GitHub 发布开源代码评审基准 ReviewBench,涵盖 19 种语言的 219 个公开 pull request,其语言与仓库规模分布基于对 103.9M 个 GitHub pull request 的分析建模而成。
GitHub Blog · AI & MLAI 评分3939 AI 正在改变开发者工作:加强这3项技能
GitHub 指出 AI 时代开发者需掌握三项核心技能:学会引导 AI 智能体而非仅使用 AI 工具;不轻信 AI 首个答案,用第二个模型审查首个模型的输出;利用 AI 节省的时间解决更广泛的工程问题,如理解客户需求和评估技术权衡。随着 AI 承担更多实现工作,技术判断力将成为区分优秀工程师的关键能力。
NVIDIA Blog精选AI 评分7171 NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast
GPT-6 Astra Ultrafast 基于 NVIDIA Blackwell GPU 提供推理加速,最高可达标准模式的 8 倍 token 生成速度。该模式已在 OpenAI API 和符合条件的 ChatGPT Work、Codex 用户中开放,可缩短编码 Agent 的编辑-测试-调试周期。
推荐理由:原文给出了能力提升数据和开放入口,读者可以判断 Ultrafast 模式如何改变编码 Agent 的工作流。
Google DeepMind精选AI 评分7777 Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。
推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。
AWS Machine Learning Blog精选AI 评分7373 GPT-6.1 Sol 在 Amazon Bedrock 全面可用
GPT-6.1 Sol 现已在 Amazon Bedrock 全面可用,将更强的推理能力带入编码、计算机使用和专业工作负载。根据 OpenAI 的数据,该模型在 DeepSWE v1.1 上与 GPT-6 Astra 性能相当,但任务成本降低约五分之一;相比 GPT-6 Sol 最高分提升 6.4 个百分点。用户可通过 Amazon Bedrock 控制台或 API 接入使用。
推荐理由:原文给出了与前代版本的成本和性能对比数据,读者可以据此判断新模型是否值得在生产环境中切换。
AWS Machine Learning Blog精选AI 评分8080 Grok 4.7 在 Amazon Bedrock 上可用
xAI 的 Grok 4.7 现已在 Amazon Bedrock 上线,支持 50 万 token 上下文窗口和低/中/高/xhigh 四档可配置推理 effort。该模型定位为 xAI 最强的编码和知识工作模型,强调在困难任务上工作更久并更仔细地自我验证,支持 Responses、Chat Completions 和 Converse API,可通过跨区域推理配置文件路由。
推荐理由:提供了模型在 Bedrock 上的具体接入方式、API 接口和定价策略,读者可据此评估集成成本和工作流适配性。
AWS Machine Learning Blog精选AI 评分7070 在 AWS 上推出 Claude Sonnet 5.5
Anthropic 的 Claude Sonnet 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 可用。该模型更适合聚焦的编码和知识工作,相较 Opus 5.5 以更低的每任务成本和更快的速度完成范围明确的工作。文章提供了在 Amazon Bedrock 控制台测试和通过 AWS SDK 编程调用的具体步骤,并列出了必要的 IAM 权限要求。
推荐理由:原文给出了 Claude Sonnet 5.5 的能力定位(更适合聚焦编码和知识工作)和成本/速度优势,读者可以据此判断它是否适合替换当前的模型方案。
Hugging Face Blog精选AI 评分7878 H company 发布 Holo4:通用计算机使用智能体模型系列
H company 发布新的智能体模型系列 Holo4,包含 27B dense 和 35B-A3B MoE 两个版本,可通过 GUIs、代码、MCP 和 APIs 与软件交互。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
OpenAI NewsAI 评分2222 你是 Codex Original 吗?
OpenAI 正在征集使用 Codex 的开发者、研究者和创作者的故事,招募对象包括 builders、tinkerers、researchers 和 creators。这些真实案例将用于 Codex Originals 项目的下一章。
GitHub Blog · AI & ML精选AI 评分6767 GitHub Security Lab 发布 Taskflow Agent:实现 AI 驱动的自动化模糊测试
GitHub Security Lab 发布 Fuzzing Taskflow,这是一个基于 LLM Agent 的 C/C++ 项目自动化模糊测试管道。只需指定一个 GitHub 仓库,Agent 会自动完成入口点识别、构建系统分析、模糊测试用例生成、AFL++ 运行、覆盖率分析、用例优化和漏洞报告编写。
推荐理由:原文详细给出了自动化模糊测试的完整工作流程,包括覆盖率反馈循环、结构感知变异和语料库演进等具体机制,读者可据此迁移到自己的安全测试中。
AWS Machine Learning Blog精选AI 评分7272 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用。GPT-6 Sol 面向复杂推理和编码任务,GPT-6 Luna 面向大规模重复性任务如信息提取和分类。
推荐理由:原文给出了 GPT-6 Sol 和 Luna 的定位差异、价格对比 GPT-5.6 更低、提示词缓存功能,读者可以据此规划自己的模型使用策略。
GitHub Blog · AI & MLAI 评分4343 代码要读吗?RAG死了吗?Skills取代MCP了吗?——GitHub Podcast深度解析五大AI热点观点
GitHub Podcast最新一期对五个常见AI热点观点进行深度解析,探讨是否需要阅读AI生成的代码、公司招聘是否强制AI技能、Skills是否取代MCP、RAG是否已过时、以及是否需要为代码库微调模型。主持人认为热点观点的价值不在于对错,而在于引发深入思考和问题,从而找到真正有用的 ideas。
GitHub Blog · AI & ML精选AI 评分7272 GitHub Copilot 运行时如何迁移到 Rust
GitHub Copilot 团队用 AI 智能体将 Copilot 运行时从约 43 万行 TypeScript 原地迁移为约 83 万行 Rust,历时数月完成 128 个 PR 的渐进式迁移。运行时性能提升数个量级,prompt cache 命中率高达 96.22%,单开发者完成了原本需要整个团队一到两年才能完成的工作。
推荐理由:原文给出了 96% 的 prompt cache 命中率数据和具体的 AI 辅助迁移工作流,读者可以据此评估这种规模化 AI 协作模式的实际效果和可迁移性。
GitHub Blog · AI & MLAI 评分4040 GitHub 营销运营自动化实战:用 Copilot 和 Actions 实现活动管理全流程
GitHub 日本/韩国营销团队利用 GitHub Copilot 和 GitHub Actions 将活动管理全流程自动化,原本需耗时数天的活动筹备、参会者筛选、会后数据整理等工作现可从一个 GitHub Issue 自动完成。
Mistral AI精选AI 评分7171 Mistral AI 用 AI 智能体将 4 万行 Fortran 77 迁移到 C++
Mistral 帮助欧洲能源运营商将 4 万行 Fortran 77 迁移到 C++,这是一个物理密集型油藏模拟器。文章介绍了三个核心实践:迁移前先构建 parity harness 验证数值一致性;用调用方-被调用方树梳理代码结构并生成文档;采用结构化智能体工作流(规划→编码→测试→审查),在关键节点加入人工审核。最终证明结构化工作流比完全自主和纯手动都更有效。
推荐理由:原文给出了具体的代码迁移方法论和工作流设计,读者可以参考这个案例来设计自己的遗留代码现代化方案。
OpenAI NewsAI 评分2525 1Password 使用 Codex 提升工程生产力 21%
1Password 工程师使用 Codex 提升工程生产力 21%,实现新功能和内部工具的快速开发,达到生产就绪状态,同时保持严格的安全策略。
OpenAI NewsAI 评分2525 OpenAI 内部研究加速:编码智能体如何重塑 AI 研究
OpenAI 内部数据显示,编码智能体正在重塑 AI 研究方式,涉及 agent 使用情况、实验速度、任务复杂性和研究加速等维度的早期数据。
Hugging Face BlogAI 评分4848 如何用 TRL 和 OpenEnv 训练编程模型画水彩画
作者开源复现了 Surya Narreddi 的水彩画 AI 项目,使用 Qwen3.5-35B-A3B 模型通过 TRL 和 OpenEnv 在 Hugging Face 上进行强化学习训练。
Google DeepMind精选AI 评分7777 Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber
Google DeepMind发布Gemini 3.8 Flash和3.8 Flash Cyber两款新模型。3.8 Flash在DeepSWE v1.1基准上超越多数更大规模的frontier模型,在HLE-Verified上达54.9%,价格为每百万输入token 0.75美元、输出token 3.75美元。
推荐理由:原文给出了在软件工程、Agent任务和多步推理方面的具体性能提升数据和成本对比,读者可据此判断模型能力变化。
Hugging Face Blog精选AI 评分7070 使用 Sentence Transformers 训练和微调多向量嵌入模型
Sentence Transformers v6.0 引入 MultiVectorEncoder 以支持 ColBERT 风格的延迟交互检索,并提供完整训练流程。作者用 100 万条医学问答对在单张 RTX 3090 上训练 14.5 小时后,微调模型在医学检索任务上 NDCG@10 达到 0.9139,比最强的零样本模型高出 0.062,验证了领域微调对多向量模型的显著提升效果。
推荐理由:原文给出了完整的训练脚本和消融实验数据,读者可以直接复用这个recipe来训练自己的多向量检索模型。
Google DeepMind精选AI 评分7979 Google DeepMind 发布 Gemini 3.7 Flash
Google DeepMind 推出 Gemini 3.7 Flash,这是其面向编码和智能体任务的工作主力模型。该模型在软件工程任务中实现显著提升,FrontierCode 1.1 Main 得分从 34.4% 提升至 43.6%,DeepSWE v1.1 从 49.0% 提升至 65.3%。
推荐理由:原文给出了性能基准提升和价格信息,读者可以据此判断新模型是否值得在生产环境中使用。
Microsoft Research精选AI 评分7373 微软发布 Orchard:可扩展智能体 AI 的开源框架
微软发布 Orchard 开源框架,包含 Orchard Env 运行环境服务和三个领域训练工作流(Orchard-SWE、Orchard-GUI、Orchard-Claw)。
推荐理由:原文给出了具体性能数据(69.7% on SWE-bench Verified)和三个可复用的训练工作流,读者可以据此判断这个开源框架对自己研究或项目的实用价值。
Berkeley AI Research精选AI 评分6565 K-Search:如何将数十年CUDA内核优化经验迁移到Apple Silicon
Berkeley和IBM研究团队将K-Search进化内核优化框架扩展支持MLX后端,开发了结构化的CUDA到MLX翻译层,将NVIDIA生态积累的CUDA优化知识迁移到Apple Silicon。实验在M1 Max 64GB上,Attention核达到原生MLX的0.97倍性能,Mamba SSM核预填充吞吐量达6751 tok/s,比社区mlx-lm实现快约20倍。
推荐理由:原文展示了K-Search如何将NVIDIA生态积累的CUDA内核优化知识迁移到Apple Silicon,在Attention和Mamba SSM两个核上分别达到接近专家水平和20倍加速,为非NVIDIA硬件的核优化提供了可参考的方法论。
Hugging Face BlogAI 评分5555 IBM Research 发布 ScarfBench:企业 Java 框架迁移 AI 智能体基准测试
IBM Research 发布 ScarfBench,这是一个开源的企业 Java 框架迁移基准测试,评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间迁移企业应用的能力。
Mistral AI精选AI 评分7272 Mistral 发布 Mistral Medium 3.5:128B 开源模型,支持云端远程编码代理
Mistral 发布新模型 Mistral Medium 3.5,这是一款 128B dense 模型,支持 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:原文给出了模型性能数据(77.6% on SWE-Bench Verified)和价格($1.5/$7.5 per million tokens),读者可以据此判断新模型在编码任务上的能力水平和成本效益。
Mistral AI精选AI 评分7878 Mistral Small 4 发布:首个统一推理、指令和多模态能力的开源混合模型
Mistral 发布新模型 Mistral Small 4,这是首个统一推理(Magistral)、指令(Mistral Small)和多模态(Pixtral)能力的开源混合模型。
推荐理由:Mistral Small 4 首次将推理、指令、多模态能力统一在单一模型中,支持可配置的 reasoning_effort 参数,在基准测试中保持竞争力分数的同时输出更短,延迟降低 40%、吞吐量提升 3 倍。
Mistral AI精选AI 评分7777 Mistral Vibe 2.0 发布
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式等功能。Vibe 现已在 Le Chat Pro 和 Team 计划中可用,Devstral 2 转为付费 API 访问,同时提供企业级微调、强化学习和代码现代化服务。
推荐理由:原文详细列出了 2.0 版本的具体新功能(子智能体、澄清机制、技能系统)和定价信息,读者可据此评估是否值得从旧版本迁移。
Mistral AI精选AI 评分7272 Mistral 推出企业级 AI 编程助手 Mistral Code
Mistral 发布 Mistral Code,这是一款面向企业的 AI 编程助手,整合了 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、本地或空气隙部署,可对底层模型进行微调或蒸馏。私有测试版已开放,支持 JetBrains IDEs 和 VSCode,Abanca、SNCF 和 Capgemini 等企业已开始采用。
推荐理由:原文给出了 Mistral Code 的核心能力(四个模型、企业级安全控制、可本地部署)和解决的四个企业痛点,读者可以据此判断它与企业现有工作流的适配度。
Mistral AI精选AI 评分7777 Mistral AI 与 All Hands AI 合作发布 Devstral
Mistral AI 推出 Devstral,这是一款用于软件工程任务的智能体大语言模型,在 SWE-Bench Verified 基准上达到 46.8%,超越此前开源 SOTA 模型超过 6 个百分点,并超过 GPT-4.1-mini 约 20%。
推荐理由:原文给出了 Devstral 在 SWE-Bench Verified 上的具体得分(46.8%)、可在单张 RTX 4090 上运行的信息以及 API 价格,读者可据此评估该模型的能力和部署门槛。
Cursor BlogAI 评分5252 Supermaven 团队加入 Cursor
Supermaven 正式加入 Cursor,其创建者 Jacob Jackson 在 2019 年发明了 Tabnine 并在 OpenAI 开展开创性工作。Cursor 将在不久后推出新的 Tab 模型,主打快速、上下文感知和强大的长序列修改能力。Supermaven 插件将继续维护,但 Cursor 将是核心工作重点。
Cursor BlogAI 评分5050 Cursor 影子工作区:让 AI 在后台迭代代码的设计与实现
Cursor 实现了影子工作区(shadow workspace)机制,让 AI 能够在隐藏的 Electron 窗口中进行代码迭代,获取 lint 结果和 LSP 交互能力,同时不影响用户当前的编码体验。该设计通过将 AI 操作与用户工作区解耦,在满足独立性、隐私、并发等要求下,实现了完整的语言服务器功能;未来计划演进为内核级文件夹代理以支持可运行性。
Cursor BlogAI 评分3737 Cursor 列出 AI 编程下一阶段的关键挑战:动作预测、完美编辑与无限上下文
Cursor 团队发布后续博文,列出 AI 编程下一阶段的多个关键挑战:动作预测方面正在研究预测用户下一步光标位置、切换的文件和终端命令,并推出 Cursor Flow 功能;完美编辑方面探索通过增加推理计算生成更大修改,同时保持异步执行与代码连贯性。团队还在研究基于检索、递归和长上下文注意力的"无限上下文引擎",以及多跳推理、Bug 检测与调试等方向。
Cursor BlogAI 评分3939 Cursor 列举当前需要解决的问题
Cursor 团队分享了正在攻克的技术难题,包括更好的上下文处理(从50万token筛选出8k相关token)、面向编辑的copilot、受约束的流内Agent、主动找Bug、更大规模编辑等。截至2023年10月,Cursor已索引14亿个向量和15万个代码库,并计划在年底前增长10倍。
Cursor Blog精选AI 评分6060 Cursor 技术博客:Llama-2-70B 推理特性分析
Cursor 分析了 Llama-2-70B 自托管推理的成本和延迟。实验表明,在 prompt 场景下 Llama 比 GPT-3.5 便宜约 3-4 倍($0.00042 vs $0.0015/1K tokens),但在 completion 场景下成本高达 $0.066/1K tokens,远高于 GPT-3.5。
推荐理由:原文给出了 Llama-2-70B 与 GPT-3.5 在成本和延迟上的详细对比实验数据,读者可据此判断自托管与 API 调用的取舍。
Cursor BlogAI 评分5757 Cursor 团队发布 Priompt v0.1:基于 JSX 的提示词设计库
Cursor 团队成员 Arvid 提出应将 prompting 称为"prompt design"(提示词设计)而非"prompt engineering",并将其类比为网页设计——二者都追求清晰沟通、需要响应动态内容、需要适配不同"尺寸"(上下文窗口)。