跳到正文

#推理

今日 2 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月1日周四
  1. TechCrunch · AI54

    Google 发布 Gemini 4 Argon,称其为最强模型

    Google 母公司 Alphabet 推出 Gemini 4 Argon,专为网络安全防御任务训练,能够自主发现、验证和修补关键软件漏洞,目前仅通过 Fairwind Program 向特定网络安全合作伙伴开放。Google 声称该模型在多项基准测试中显著超越 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Fable 与 Opus 模型,并已用于公司内部日常工作。

  2. Ars Technica · AI49

    Google 宣布 Gemini 4 Argon AI 模型,但尚不可用

    Google 发布新一代前沿模型 Gemini 4 Argon,专注于 coding、knowledge work 和 cybersecurity。Argon 在 DeepSWE v1.1 基准测试中达 77.9%,超越 GPT-6 Astra、Fable 5.1 和 Opus 5.5,并支持 100 万 token 输出限制。由于模型仍在限量测试阶段,Google 未公布 API 价格。

  3. Hacker News · 最佳81

    Google 发布 Gemini 4 Argon 旗舰模型

    Google 正式发布 Gemini 4 Argon 旗舰模型,定价为输入每百万 token 2 美元、输出每百万 token 10 美元,上下文窗口扩展至 100 万 token。

    推荐理由:原文披露了定价、多个基准测试分数和内部应用案例,读者可以据此评估该模型相对于前代和其他竞品的实际能力提升幅度。

  4. The Verge · AI78

    Google 发布 Gemini 4 Argon,称能力太强仅限"可信网络防御者"使用

    Google发布新模型Gemini 4 Argon,定位为前沿性能模型,涵盖软件工程、企业知识工作和网络安全防御领域。该模型基准测试优于OpenAI和Anthropic的竞品,但初期仅向特定"可信网络防御者"开放,Google正与美国政府合作进行发布前审查。Gemini 4 Argon已用于Google内部工作流,如大规模代码库迁移。

    推荐理由:原文给出了模型的能力定位和基准对比,读者可以据此了解Google新模型在行业中的相对位置。

  5. Google DeepMind77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。

    推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。

  6. Reddit · r/MachineLearning50

    RadarScenes 多帧雷达目标分类研究

    作者在 RadarScenes 数据集上构建了多帧雷达目标分类器,将单帧分类器扩展为累积观测的历史序列。单帧 baseline 达到 0.7370 macro F1;20帧点池化提升至 0.8613(+0.1243);因果GRU进一步提升至 0.8895(+0.0282)。

  7. Hacker News · 首页26

    AI 时代,我的家庭被技术取代的最后一次

    作者讲述曾祖父从钉马蹄铁的铁匠转型为汽车修理工的故事,以此反思当代开发者面对 AI 的焦虑。作者认为历史上技术变革曾多次冲击传统职业,但人们总能通过改变方式保留核心 purpose(帮助他人解决问题的初心)。他呼吁开发者放下对"如何做"的执念,紧握"为何做"的本质——真正驱动我们的是创造和解决问题的热情,而非写代码本身。

  8. Hacker News · 首页29

    TLA+ 能检查什么和不能检查什么

    Claude Code 发明者 Boris Cherny 提到 Opus 可用 TLA+ 查找代码竞态条件,引发对形式验证的热议。TLA+ 擅长检查安全属性(不变式、动作属性)和活性属性(<>P、[]<>P 等),但无法表达不可形式化的属性、多步属性、浮点数操作、真实时间,以及"存在某行为满足P"这类可达性属性和超属性。

  9. Reddit · r/artificial44

    Stuart Russell 播客:最安全的 AI 可能是一个不知道我们想要什么的 AI

    加州大学伯克利分校计算机科学教授 Stuart Russell(经典教材《人工智能:现代方法》合著者)探讨 AI 安全问题。他指出,一旦赋予 AI 固定目标且其能力超越人类,这将变得非常危险;更安全的做法是设计一个唯一目标为促进人类利益、但不确定人类具体意图的 AI 系统。该播客还讨论了 AI 如何学习人类真实偏好,以及如何引导日益强大的 AI 走向更安全的发展方向。

9月30日周三
  1. Reddit · r/MachineLearning46

    Google/DeepMind 联合研究提出 CO₂Jump:解决文本与图像联合生成中的不一致问题

    研究团队提出 CO₂Jump 采样器,通过文本置信度和跨模态注意力引导图像更新,允许低置信度 token 被遮蔽并重新生成,从而在生成过程中修正早期决策。该方法无需额外训练,每个去噪步骤仅需一次模型前向传递。在图像编辑、迷宫求解和非ograms 基准测试中,CO₂Jump 是唯一在 8-512 采样步骤内单调提升编辑质量和语义对齐的采样器。

  2. Reddit · r/LocalLLaMA15

    Pi + llama-server 随机卡住的故障排查

    用户在使用 Pi 运行 llama-server 时,偶尔会遇到进程在 tool call 后停止响应的问题;日志显示任务已完成,但 Pi 端仍认为在等待响应,需手动停止并点击"Continue"恢复。该问题概率约 1%,运行 Qwen3.6 35B A3B IQ4_NL_XL 时出现,用户怀疑其他模型也可能存在此问题。

  3. Reddit · r/LocalLLaMA20

    vLLM 批量 API 调用共享前缀的最佳实践

    用户在 agent workflow 中使用 asyncio.gather 并发 10 个 vLLM API 调用,这些调用共享相同 prompt 仅在最后查询/指令处不同,询问处理共享前缀批量请求的最佳实践。用户考虑先发送单个请求让 vLLM 完成 cache block 并开始解码,再发送剩余批量请求,通过 router 确保路由至同一 worker。

  4. Reddit · r/MachineLearning54

    开发者用 Jev 降低游戏搜索引警成本和延迟

    indiex.gg 是一款游戏发现引警,原先用 DeepSeek 将用户的自然语言查询提取为结构化意图(参考游戏、过滤器、标签等),成本高且延迟大。作者将其替换为 OpenRouter Decisions API 的 TypeSafe Jev 模型:Jev 不生成自由形式答案,而是并行回答一组封闭的是/否问题和选择题,再通过正则表达式组合成相同的提取结果。

  5. Reddit · r/MachineLearning32

    AI 行业为何陷入"算力执念":我们是在做研究还是管理硬件?

    AI 领域研究者批评行业过度依赖算力而非算法效率,指出今年发论文必须展示更大参数规模或 loss curve,实质上是把算力当作免费资源而非需要解决的约束。匿名作者提到项目中有人直接使用 QentrixAI 绕过优化瓶颈,感叹行业正在丧失高效设计的工艺,追求"万卡集群"成为衡量成果的标准。

  6. Reddit · r/ChatGPT41

    ChatGPT Plus 与 Claude Pro 20美元订阅对比:GPT-6.1 Sol 能否改变游戏规则?

    一项针对 GPT-6.1 Sol XHigh 与 Claude Opus 5.5 Medium 的对比评测显示,前者每任务消耗配额比后者高约 40%,速度却慢 2.5-6 倍(中位延迟 157s vs 21s)。虽然两者 AA 智能评级相同,但 10% Codex 5 小时配额仅对应约 7.3% Claude 配额。作者最终决定保留 Claude Pro,考虑取消 ChatGPT Plus。

  7. Reddit · r/MachineLearning18

    为什么不在 softmax 前少用一个特征?[D]

    开发者提出一项 softmax 优化方案:利用输出和为1的约束条件,将 N 个输入减少为 N-1 个,让最后一个 logit 等于其他 logits 之和的负值。该方案可移除 softmax 前最后一层的冗余参数,理论上可能加速模型收敛,但实际收益可能微不足道。

  8. Reddit · r/MachineLearning71

    免费开源 AI 工程课程:手把手实现每个算法,已发布 EPUB/PDF 书籍

    AI Engineering from Scratch 是 MIT 许可的课程,共 523 节课分为 20 个阶段,涵盖线性代数、反向传播、Transformer、LLM、智能体和生产部署等内容。代码采用 stdlib 优先方式展示每一步实现。本月更新发布了 6 卷 EPUB 和 PDF 书籍,支持 8 种语言,并修复了测试和数据集问题。

  9. AWS Machine Learning Blog73

    GPT-6.1 Sol 在 Amazon Bedrock 全面可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 全面可用,将更强的推理能力带入编码、计算机使用和专业工作负载。根据 OpenAI 的数据,该模型在 DeepSWE v1.1 上与 GPT-6 Astra 性能相当,但任务成本降低约五分之一;相比 GPT-6 Sol 最高分提升 6.4 个百分点。用户可通过 Amazon Bedrock 控制台或 API 接入使用。

    推荐理由:原文给出了与前代版本的成本和性能对比数据,读者可以据此判断新模型是否值得在生产环境中切换。