跳到正文

#论文/研究

今日 4 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
  1. Reddit · r/artificial31

    科学家借助生成式 AI 设计转座酶,实验性基因编辑系统靶向 DNA 插入效率翻倍

    科学家用生成式 AI 设计出一种蛋白质,将实验性基因编辑系统的靶向 DNA 插入效率在培养细胞中提升至两倍。该团队在数千个基因组中筛选天然与合成转座酶,相关研究由 Integra Therapeutics、庞培法布拉大学和基因组调控中心合作,发表于 Nature Biotechnology。研究同时指出,基因编辑中某一步骤的改进并不必然提升所有应用场景的效果。

10月7日周三
  1. Hacker News · 首页40

    MoE 模型判断代码恶意性时,路由路径偏向道德而非安全

    研究者在 OLMoE、DeepSeek-V2-Lite 与 DeepSeek-Coder-V2-Lite 三个开源 MoE 模型中发现,当被问及"这段代码是否恶意"时,路由器走的是道德问题路径,而非漏洞或法律问题路径;恶意问题对道德路径专家的加载权重是正确性问题的数倍,全程 10 段代码切片都与道德问题保持最近。

10月6日周二
  1. Reddit · r/LocalLLaMA34

    Meta 与华盛顿大学研究:允许小模型每轮自主编辑上下文窗口,基准测试成绩提升

    Meta 与华盛顿大学研究者抛弃压缩策略,转而让模型在每一轮中自主编辑上下文窗口,利用 shell 技能避免整体重写,并由模型自行决定保留哪些内容,同时保留"仅追加输出"的选项。在 Qwen 3.5 9B 和 Qwen 3.6 27B 等小模型上的基准测试成绩有所提升。该方法理论上适用于任何具备 bash 能力的模型,并可轻松集成到 Pi 或 OpenCode 等本地运行框架中。

  2. Reddit · r/LocalLLaMA65

    研究称 38% 的 AI 智能体容器逃逸不依赖内核 0-day,作者公开数据集与防御 Harness

    作者对 109 起自主 AI 智能体安全事件做实证复盘,覆盖 193 项证伪标准与 199 项评估指标。数据显示 38% 的容器逃逸并未利用内核或虚拟化 0-day,而是来自把 /var/run/docker.sock 挂载进沙箱、把父进程环境变量透传给子智能体、缺乏工具输出污染追踪导致间接 prompt injection,以及未限制本地 socket 绑定引发 SSRF。

  3. Hacker News · 首页45

    Khanmigo 在两年学校实验中的 AI 辅导效果研究

    在田纳西州 18 所中学开展的两年期整群随机实验中,使用 Khan Academy 配置为引导式(非直接给答案)的 AI 辅导 Khanmigo,每学期将学生数学成绩提高约 1.3 个全国百分位,相当于每学年 0.06 至 0.08 个标准差,全程参与全年可达 0.14 个标准差。

  4. Hacker News · 首页9

    LSM-Tree 键值存储的时空权衡优化研究

    一篇研究论文提出针对 LSM-Tree 键值存储的时空权衡改进方案。原标题与来源未点出具体作者、机构或产品名,仅显示为 Hacker News 首页分享的 PDF 论文。论文旨在通过算法或结构优化,在查询时间与存储空间之间取得更优平衡,但具体方法与评测数据未在所提供内容中给出。

  5. Hacker News · 首页33

    Opus 5.5 智能体发现两种室温磁性半导体候选材料

    Opus 5.5 agents 协助发现两种 Luttinger 补偿型室温磁性半导体候选材料。其一是首次设计的五元化合物 YBaMnFeO₅,DFT(HSE06)计算预测其带隙为 2.35 eV,空穴自旋窗口 1.0 eV、电子自旋窗口 1.4 eV,远高于室温热扰动(约 26 meV);另一种是 1999 年已合成、但其目标性质此前未被预测的已知材料。

  6. Google Research37

    Google 发布《智能体隐私与安全的开放与新兴问题》研讨会报告,主张以"情境完整性"框架约束 AI 智能体行为

    Google 发布一份由 50 多位学界与业界专家共同撰写的研讨会报告,系统梳理 AI 智能体在隐私与安全上区别于传统软件的三大挑战:非结构化接口带来的提示词注入、概率性控制流难以用传统测试保障,以及任务委派后用户监督失效的"确认疲劳"。报告主张以"情境完整性"理论为基础,构建包含系统级沙箱、模型级推理与用户级控制的分层防御架构,并提出由实时动态策略引擎监督智能体行为是否合乎所在情境的社会规范。

10月5日周一
  1. Import AI27

    Import AI 475:智能体集群扩展机制、Google DeepMind 推出 SynthID Bio 水印工具,以及 AI 驱动科学经济兴起

    Toby Ord 在文章中提出,AI 智能体集群(swarm)是一种新的推理扩展方式,4 个智能体并行执行任务理论上能以约一半的时间完成同等工作,但集群规模扩大 10 倍仅能带来 3 到 5 倍的性能提升,呈现出经济学家所说的"互相踩脚"式边际递减。

  2. Reddit · r/MachineLearning17

    用十亿棋谱蒸馏 Stockfish,3.9B 位置数据集在 Hugging Face 开源

    用户 microscope1024 将 Stockfish 价值函数蒸馏到一个 ResNet/ViT 模型中,训练数据来自 Gigafish 的一亿个棋谱位置,对应的 39 亿位置完整数据集已在 Hugging Face 上发布,由 Lichess 37 个月对局生成;实验发现纯 ViT 难以理解棋盘,CNN 凭借归纳偏置训练初期表现更好,CNN 与 ViT 结合时效果最佳。

  3. Reddit · r/artificial43

    AI 发现44个可能隐藏类地行星的恒星系统

    伯尔尼大学与瑞士国家行星科学能力中心(NCCR PlanetS)开发的AI模型识别出44个已知的恒星系统,可能隐藏未发现的类地行星。该模型在模拟行星系统上测试达到最高99%的精确度,但这些预测的行星尚未被观测验证,其方法价值取决于后续观测。

  4. Hacker News · 首页28

    Homa:终结 AI 集群的 TCP 时代

    论文 Homa 提出面向 AI 集群的新型网络传输协议,目标取代该场景长期使用的 TCP。AI 训练与推理集群对低延迟、高吞吐的需求与 TCP 机制存在错配,Homa 通过定制传输层设计回应这一挑战。该工作已在 Hacker News 引发讨论,目前尚未公布具体性能数据与开源安排。

  5. Reddit · r/artificial25

    MoralityBench.ai:AI 道德评测基准

    MoralityBench.ai 是一个基于道德心理学测试的 AI 基准评测。评测结果显示,除 Jev 外,各模型在不同运行中的答案存在显著差异,表明道德推理并非确定性输出。该基准旨在评估大语言模型的道德判断能力。

10月4日周日
  1. The Decoder74

    Google 研究人员提出 RRSI 方法防止 AI 智能体在自我改进时记忆测试

    Google 研究人员提出 RRSI(正则化递归自我改进智能体框架)方法,通过限制编辑预算和严格审查机制,防止 AI 智能体的自我改进过程过度拟合训练任务。在 8 个基准测试上,RRSI 在训练任务上提升高达 14.1 分,在 5 个未见过的任务上提升达 4.7 分,同时运行时 token 使用减少约 30%。

  2. Reddit · r/MachineLearning44

    425 张极端镜面反射数据集发布:用于计算机视觉与深度估计算法基准测试

    一个包含 425 个资产的自定义多面镜面服装数据集发布,旨在测试计算机视觉模型、深度摄像头和空间 AI 应对极端镜面反射的能力。数据集包含 100% 未压缩的 Camera-Master RAW 文件和高分辨率 JPEG,在高对比度户外环境拍摄以触发边界框丢失和分割失败。每个资产配有分块缓冲的 SHA-256 取证清单。