跳到正文

#编码

今日 7 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
9月28日周一
  1. OpenAI News22

    你是 Codex Original 吗?

    OpenAI 正在征集使用 Codex 的开发者、研究者和创作者的故事,招募对象包括 builders、tinkerers、researchers 和 creators。这些真实案例将用于 Codex Originals 项目的下一章。

9月27日周日
  1. Product Hunt · AI 分类46

    Harness Router:为 AI 编码智能体打造的智能工具路由决策层

    Harness Router 是 AI 编码智能体的工具选择决策层,可在执行前实现更快、更便宜、更可靠的工具调用路由。该产品可作为 Codex hook 自动路由工具调用,也可作为 skill 供智能体显式调用路由。简单决策走快速路径,模糊选择由 Jev 解析,复杂多步决策升级至 MCTS 处理。

  2. Product Hunt · AI 分类50

    Rival Workshop:将仓库技能可视化为书架的 AI 工具

    Workshop 将仓库中的每个技能显示为书架上的一本书,书脊是 Claude Code、Codex 或 Cursor 任务前读取的内容,书挡标记停止位置。支持关闭技能、按需运行、用 Claude Code 重写技能,并可在安全检查后从网络添加技能。包含 150 个可编辑技能和 Brief,现售 $79(2026 年 10 月 31 日后涨至 $149)。

9月26日周六
9月25日周五
  1. Product Hunt · AI 分类40

    Styx 桌面应用:统一开发者工作台

    Styx 是面向开发者的桌面应用,汇聚代码仓库管理、AI 智能体构建和登录凭证集成于单一窗口。核心功能确保所有生产环境变更均需开发者授权确认。目前支持 macOS,Windows 版本即将推出。

  2. GitHub Blog · AI & ML67

    GitHub Security Lab 发布 Taskflow Agent:实现 AI 驱动的自动化模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,这是一个基于 LLM Agent 的 C/C++ 项目自动化模糊测试管道。只需指定一个 GitHub 仓库,Agent 会自动完成入口点识别、构建系统分析、模糊测试用例生成、AFL++ 运行、覆盖率分析、用例优化和漏洞报告编写。

    推荐理由:原文详细给出了自动化模糊测试的完整工作流程,包括覆盖率反馈循环、结构感知变异和语料库演进等具体机制,读者可据此迁移到自己的安全测试中。

9月23日周三
  1. Simon Willison30

    SF 10月14日:AI 智能体工程主题聚会

    Simon Willison 与 Jesse Vincent 将于 10 月 14 日在旧金山举办一场 AI 智能体工程主题聚会,诚邀在 coding agents 领域进行奇怪有趣实验的开发者参加。活动采用非正式展示与交流形式,参与者可分享未公开的项目、奇怪实验或无明确市场的未完成作品。主办方强调这不是产品推介,而是更早期的探索性交流。

  2. AWS Machine Learning Blog72

    GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 正式可用。GPT-6 Sol 面向复杂推理和编码任务,GPT-6 Luna 面向大规模重复性任务如信息提取和分类。

    推荐理由:原文给出了 GPT-6 Sol 和 Luna 的定位差异、价格对比 GPT-5.6 更低、提示词缓存功能,读者可以据此规划自己的模型使用策略。

9月22日周二
  1. Ben's Bites21

    Jev 能做什么:面向构建者的文本处理工具

    Jev 现已向所有人开放,它不同于传统 LLM,专为构建者设计,可嵌入工具内部使用,用户只需输入文本并提出具体问题如"这是广告吗"、"归入哪个文件夹"或"相关性评分"。社区已开发出 YouTube 跳过赞助片段、Gmail 按意图搜索、实时过滤负面评论、Mac 语音控制等多种用例。

9月21日周一
  1. Simon Willison32

    工程师抱怨公司全员被迫“只和 Claude 聊天”,每天工作 12-13 小时仅负责按回车

    某匿名工程师在 Reddit 抱怨入职两周来,公司所有 specs、代码、测试、PRDs、ticket 等全部由 Claude Code 生成,团队无人喜欢这种方式却被强迫尽量多地"产出"代码。管理层认为推代码不是瓶颈,但员工每天工作 12-13 小时仅负责"按回车",从 L1 到 L7 工程师全员都在做同一件事:与 Claude 对话。

9月18日周五
  1. GitHub Blog · AI & ML43

    代码要读吗?RAG死了吗?Skills取代MCP了吗?——GitHub Podcast深度解析五大AI热点观点

    GitHub Podcast最新一期对五个常见AI热点观点进行深度解析,探讨是否需要阅读AI生成的代码、公司招聘是否强制AI技能、Skills是否取代MCP、RAG是否已过时、以及是否需要为代码库微调模型。主持人认为热点观点的价值不在于对错,而在于引发深入思考和问题,从而找到真正有用的 ideas。

9月17日周四
  1. GitHub Blog · AI & ML72

    GitHub Copilot 运行时如何迁移到 Rust

    GitHub Copilot 团队用 AI 智能体将 Copilot 运行时从约 43 万行 TypeScript 原地迁移为约 83 万行 Rust,历时数月完成 128 个 PR 的渐进式迁移。运行时性能提升数个量级,prompt cache 命中率高达 96.22%,单开发者完成了原本需要整个团队一到两年才能完成的工作。

    推荐理由:原文给出了 96% 的 prompt cache 命中率数据和具体的 AI 辅助迁移工作流,读者可以据此评估这种规模化 AI 协作模式的实际效果和可迁移性。

9月12日周六
9月9日周三
  1. Mistral AI71

    Mistral AI 用 AI 智能体将 4 万行 Fortran 77 迁移到 C++

    Mistral 帮助欧洲能源运营商将 4 万行 Fortran 77 迁移到 C++,这是一个物理密集型油藏模拟器。文章介绍了三个核心实践:迁移前先构建 parity harness 验证数值一致性;用调用方-被调用方树梳理代码结构并生成文档;采用结构化智能体工作流(规划→编码→测试→审查),在关键节点加入人工审核。最终证明结构化工作流比完全自主和纯手动都更有效。

    推荐理由:原文给出了具体的代码迁移方法论和工作流设计,读者可以参考这个案例来设计自己的遗留代码现代化方案。

9月8日周二
  1. The Rundown AI41

    OpenAI 智能体研究效率实测:每人类工作1天相当于智能体工作3.1天

    OpenAI 公布其编码智能体处理研究工作的数据,智能体现以 3.1 个人类工作天的产出效率运行,已达成 Sam Altman 原定 9 月实现的"自动化研究实习生"目标。普通研究员日均消耗 600+ 美元 token(第 90 百分位超 7000 美元),自 12 月以来 token 输出增长 124 倍,约 80% 研究员同时使用 4+ 智能体,实验频次达公司历史最高。

9月6日周日
9月3日周四
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google DeepMind发布Gemini 3.8 Flash和3.8 Flash Cyber两款新模型。3.8 Flash在DeepSWE v1.1基准上超越多数更大规模的frontier模型,在HLE-Verified上达54.9%,价格为每百万输入token 0.75美元、输出token 3.75美元。

    推荐理由:原文给出了在软件工程、Agent任务和多步推理方面的具体性能提升数据和成本对比,读者可据此判断模型能力变化。

8月26日周三
  1. Hugging Face Blog70

    使用 Sentence Transformers 训练和微调多向量嵌入模型

    Sentence Transformers v6.0 引入 MultiVectorEncoder 以支持 ColBERT 风格的延迟交互检索,并提供完整训练流程。作者用 100 万条医学问答对在单张 RTX 3090 上训练 14.5 小时后,微调模型在医学检索任务上 NDCG@10 达到 0.9139,比最强的零样本模型高出 0.062,验证了领域微调对多向量模型的显著提升效果。

    推荐理由:原文给出了完整的训练脚本和消融实验数据,读者可以直接复用这个recipe来训练自己的多向量检索模型。

8月21日周五
  1. The Rundown AI66

    Slack 发布 Slack Code:在消息频道内协同开发代码

    Slack 推出 Slack Code 功能,允许用户直接在消息平台内通过共享房间开发代码,AI 智能体在频道中编写软件,团队成员(无论是否为工程师)都可以观看、指导和参与构建过程。部署变更需人工审批,完成的项目留下可搜索的存档频道。所有 Slack 计划均可使用,可连接 ChatGPT、Claude、Devin、Vercel 和 GitHub 等智能体。

8月14日周五
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 推出 Gemini 3.7 Flash,这是其面向编码和智能体任务的工作主力模型。该模型在软件工程任务中实现显著提升,FrontierCode 1.1 Main 得分从 34.4% 提升至 43.6%,DeepSWE v1.1 从 49.0% 提升至 65.3%。

    推荐理由:原文给出了性能基准提升和价格信息,读者可以据此判断新模型是否值得在生产环境中使用。

8月4日周二
  1. Microsoft Research73

    微软发布 Orchard:可扩展智能体 AI 的开源框架

    微软发布 Orchard 开源框架,包含 Orchard Env 运行环境服务和三个领域训练工作流(Orchard-SWE、Orchard-GUI、Orchard-Claw)。

    推荐理由:原文给出了具体性能数据(69.7% on SWE-bench Verified)和三个可复用的训练工作流,读者可以据此判断这个开源框架对自己研究或项目的实用价值。

7月29日周三
  1. Berkeley AI Research65

    K-Search:如何将数十年CUDA内核优化经验迁移到Apple Silicon

    Berkeley和IBM研究团队将K-Search进化内核优化框架扩展支持MLX后端,开发了结构化的CUDA到MLX翻译层,将NVIDIA生态积累的CUDA优化知识迁移到Apple Silicon。实验在M1 Max 64GB上,Attention核达到原生MLX的0.97倍性能,Mamba SSM核预填充吞吐量达6751 tok/s,比社区mlx-lm实现快约20倍。

    推荐理由:原文展示了K-Search如何将NVIDIA生态积累的CUDA内核优化知识迁移到Apple Silicon,在Attention和Mamba SSM两个核上分别达到接近专家水平和20倍加速,为非NVIDIA硬件的核优化提供了可参考的方法论。

7月27日周一
7月1日周三
5月22日周五
5月4日周一
  1. Import AI52

    AI系统或将在2028年前实现自动化研发

    Jack Clark分析认为,基于SWEBench、METR、CORE-Bench等多项benchmark的进展数据,AI系统已能在数小时内独立完成复杂编码任务,并逐步掌握核心AI研发技能如复现论文、构建ML系统、优化kernel等。他预计到2028年底有60%概率实现无人类参与的AI R&D,届时AI系统可能自主训练其后继模型。文章还讨论了自动化研发对AI对齐、经济结构和人类社会的深远影响。

3月17日周二
  1. Mistral AI78

    Mistral Small 4 发布:首个统一推理、指令和多模态能力的开源混合模型

    Mistral 发布新模型 Mistral Small 4,这是首个统一推理(Magistral)、指令(Mistral Small)和多模态(Pixtral)能力的开源混合模型。

    推荐理由:Mistral Small 4 首次将推理、指令、多模态能力统一在单一模型中,支持可配置的 reasoning_effort 参数,在基准测试中保持竞争力分数的同时输出更短,延迟降低 40%、吞吐量提升 3 倍。

1月28日周三
  1. Mistral AI77

    Mistral Vibe 2.0 发布

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式等功能。Vibe 现已在 Le Chat Pro 和 Team 计划中可用,Devstral 2 转为付费 API 访问,同时提供企业级微调、强化学习和代码现代化服务。

    推荐理由:原文详细列出了 2.0 版本的具体新功能(子智能体、澄清机制、技能系统)和定价信息,读者可据此评估是否值得从旧版本迁移。

6月4日周三
  1. Mistral AI72

    Mistral 推出企业级 AI 编程助手 Mistral Code

    Mistral 发布 Mistral Code,这是一款面向企业的 AI 编程助手,整合了 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、本地或空气隙部署,可对底层模型进行微调或蒸馏。私有测试版已开放,支持 JetBrains IDEs 和 VSCode,Abanca、SNCF 和 Capgemini 等企业已开始采用。

    推荐理由:原文给出了 Mistral Code 的核心能力(四个模型、企业级安全控制、可本地部署)和解决的四个企业痛点,读者可以据此判断它与企业现有工作流的适配度。

5月21日周三
  1. Mistral AI77

    Mistral AI 与 All Hands AI 合作发布 Devstral

    Mistral AI 推出 Devstral,这是一款用于软件工程任务的智能体大语言模型,在 SWE-Bench Verified 基准上达到 46.8%,超越此前开源 SOTA 模型超过 6 个百分点,并超过 GPT-4.1-mini 约 20%。

    推荐理由:原文给出了 Devstral 在 SWE-Bench Verified 上的具体得分(46.8%)、可在单张 RTX 4090 上运行的信息以及 API 价格,读者可据此评估该模型的能力和部署门槛。

11月11日周一
  1. Cursor Blog52

    Supermaven 团队加入 Cursor

    Supermaven 正式加入 Cursor,其创建者 Jacob Jackson 在 2019 年发明了 Tabnine 并在 OpenAI 开展开创性工作。Cursor 将在不久后推出新的 Tab 模型,主打快速、上下文感知和强大的长序列修改能力。Supermaven 插件将继续维护,但 Cursor 将是核心工作重点。