跳到正文

#教程/实践

今日 4 条

洞察 · 工具·提示词·论文 三栏速览

每栏 3 / 6 · 直达分类页

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
  1. AWS Machine Learning Blog16

    AWS 发布"AI builder"培养方案:六周结构化项目弥合业务人员 AI 知识与实操能力差距

    AWS 设计了一个六周结构化项目,让日常工作依赖 AI 但无工程背景的业务人员动手搭建 AI 智能体原型,每周三至四小时。试点中四位销售类背景的成员基于 Amazon Bedrock AgentCore、Strands Agents SDK 和 Amazon Nova 模型构建出金融顾问多智能体工具 WealthWise,获得第一名。

10月7日周三
  1. Hugging Face Blog70

    NVIDIA 公布 Nemotron 在 IOI 与 IMO 2026 的金牌级微调与推理方案

    NVIDIA 在 Hugging Face 博客介绍基于 Nemotron 3 微调出的系统在 IOI 2026 与 IMO 2026 均达到金牌线,其中 IOI 由 Nemotron-3-Ultra-CC 配合 GenCorrect 取得 535.4/600 分。

    推荐理由:原文把 IOI 与 IMO 两个金牌结果的训练数据、方法和推理回路整理成可复用的微调配方,读者可直接对照迁移到自己的领域。

  2. Reddit · r/MachineLearning8

    零基础如何从 ML 工程师起步,在 NeurIPS / ACL / ICLR 等 A* 会议发表论文并申请 CS 博士

    一名有两年工作经验的 AI 工程师询问如何从零开始规划学术路径,目标是在 NeurIPS、ACL、ICLR 等 A* 会议发表论文,并在 2028 年秋季申请美国 CS 硕士后进入斯坦福或普林斯顿等顶尖高校读博。原帖给出的初步路线包括学习 Python、机器学习与数学、阅读研究论文、寻找课题并跑实验撰写论文,并征求更具操作性的步骤以及能提升博士申请竞争力的关键因素。

  3. Reddit · r/MachineLearning6

    没有 A* 顶会发表还能申到 ML PhD 吗

    一名美国 top-15 大学的 MS 国际学生在 Reddit 提问:在没有 NeurIPS、ICLR 等顶会接收论文的情况下,是否还值得申请顶级 ML PhD,还是该把时间转向工业界招聘。作者目前有一篇 NeurIPS 一作被拒、另一篇 ICLR 一作在审,因担心国际生身份和 SWE/MLE 招聘竞争而犹豫是否投入申请。该帖主要面向有 ML 研究经历但尚无顶会发表者寻求现实评估。

  4. Reddit · r/artificial11

    完成 CPD 认证的 AI 精通课程后总结:真正值得记住的 5 件事

    一位用户在 Reddit 分享完成 CPD 认证 AI 课程的 5 条心得:提示词技能占整体能力的 80%,工具选择远不如使用方式重要;建议组合使用 ChatGPT、Claude、Midjourney、Lovable 等工具,分别负责起草、生成图像和快速上线。AI 辅助写作的关键在于像编辑一样修改而非被动采用,图像和视频生成则更像"下达创意简报"的能力,效率提升来自工具之间的协同工作流。

  5. Reddit · r/MachineLearning23

    Transformer、RNN 与 SSM 的记忆机制对比:从循环状态、KV cache 到类突触连接

    作者从"工作记忆"视角比较了 RNN、Transformer 与 SSM 三类架构的记忆承载方式:RNN 将记忆压缩为逐步传递的循环隐藏状态,参数规模约 O(N²) 而状态仅 O(N);Transformer 在推理时冻结权重,以不断增长的 KV cache 保存历史键值,更像便利贴式的外部上下文;SSM(如 Mamba)回到定长循环状态,并通过输入依赖机制决定遗忘。

10月6日周二
  1. Reddit · r/LocalLLaMA10

    团队提出用 LoRA 适配器充当 LLM 可切换技能,想验证这是否值得做成产品

    一个团队正在验证一个想法:把 LoRA 适配器当作 LLM 的持久化、可切换的专用技能,按需加载或卸载,以减少上下文占用、复用专项能力并可能降低推理成本。他们希望 LoRA 的创建与管理能像维护知识库一样简单,并询问用户是否会在实际场景中使用该方案,以及该思路在哪些场景下不适用。

  2. Reddit · r/MachineLearning21

    ZhemaIsmayil 曾用神经网络为每个字体生成嵌入向量并以 tSNE 可视化,意外得到花朵状结构

    一名开发者用预训练神经网络为每个字体的字符生成嵌入向量,再用 tSNE 把降维后的嵌入映射为 XYZ 和 RGB 通道并以点云可视化,使视觉相近的字体在位置和颜色上自然聚集。在 Google Fonts 语料上,该可视化呈现出花朵形状,大多数手写体字体集中于花蕊区域。作者另在其字体检索网站上提供了基于全部可搜索字体的类似可视化。

  3. Reddit · r/LocalLLaMA8

    用 FFT 替换 AdamW 优化器状态以削减 VRAM:非量化显存压缩方法的社区探索

    Spectra-Global 团队针对 8B 与 70B 模型在消费级 GPU 上微调时的 OOM 问题,放弃 8-bit 量化方案,转而将 AdamW 优化器状态通过 FFT 变换到频域处理:动态丢弃低能量频率并压缩后逆向重建,VRAM 用量下降约 50%,避免量化带来的收敛退化;代价是 FFT 计算带来单步延迟略增。

  4. Reddit · r/artificial9

    RAG 系统的提示词语言选择:当目标语言与训练语料不同时

    用户在 Reddit 提问:当 RAG 系统的目标语言与 LLM 主要训练语料(英语)不同时,提示词应该直接用目标语言撰写,还是用英语撰写并在提示中要求翻译为目标语言?提问者推测英语提示词可能因训练数据更丰富而获得更好的遵循度,认为语言的常见程度和训练数据量是关键因素,文档内容本身则使用目标语言。

10月5日周一
  1. Reddit · r/LocalLLaMA15

    开发者实验本地 LLM 项目 Neco:让 AI 像"住"在机器上一样持续存在

    开发者围绕 Ollama 和 Open WebUI 构建本地 AI 项目 Neco,通过只读系统层让模型感知主机 uptime、内存占用、负载、电量和温度等状态,并由后台守护进程在无对话时自主生成"闲思"。模型不获得 shell 权限或主机控制权,下一步计划实验情景式记忆与选择性检索,让行为在数周至数月间形成连续性。

  2. Reddit · r/ChatGPT16

    Reddit 用户整理 285 款用 Claude、ChatGPT 等 AI 工具制作的浏览器游戏目录

    Reddit 用户 friuns 发布了一份浏览器游戏目录,收录 285 款由 Claude、ChatGPT 等 AI 工具制作的 AI 编程 demo,每个条目附带可玩链接、截图及源代码或作者出处,并按 Opus、Sonnet、Astra 以及模型未知的"uncertain"分类。目录页面提供浏览与筛选功能,作者开放征集新提交与反馈。