跳到正文

#论文/研究

今日 3 条

研究 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

research6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
  1. Reddit · r/artificial31

    科学家借助生成式 AI 设计转座酶,实验性基因编辑系统靶向 DNA 插入效率翻倍

    科学家用生成式 AI 设计出一种蛋白质,将实验性基因编辑系统的靶向 DNA 插入效率在培养细胞中提升至两倍。该团队在数千个基因组中筛选天然与合成转座酶,相关研究由 Integra Therapeutics、庞培法布拉大学和基因组调控中心合作,发表于 Nature Biotechnology。研究同时指出,基因编辑中某一步骤的改进并不必然提升所有应用场景的效果。

10月7日周三
  1. Hacker News · 首页40

    MoE 模型判断代码恶意性时,路由路径偏向道德而非安全

    研究者在 OLMoE、DeepSeek-V2-Lite 与 DeepSeek-Coder-V2-Lite 三个开源 MoE 模型中发现,当被问及"这段代码是否恶意"时,路由器走的是道德问题路径,而非漏洞或法律问题路径;恶意问题对道德路径专家的加载权重是正确性问题的数倍,全程 10 段代码切片都与道德问题保持最近。

10月6日周二
  1. Hacker News · 首页33

    Opus 5.5 智能体发现两种室温磁性半导体候选材料

    Opus 5.5 agents 协助发现两种 Luttinger 补偿型室温磁性半导体候选材料。其一是首次设计的五元化合物 YBaMnFeO₅,DFT(HSE06)计算预测其带隙为 2.35 eV,空穴自旋窗口 1.0 eV、电子自旋窗口 1.4 eV,远高于室温热扰动(约 26 meV);另一种是 1999 年已合成、但其目标性质此前未被预测的已知材料。

  2. Google Research37

    Google 发布《智能体隐私与安全的开放与新兴问题》研讨会报告,主张以"情境完整性"框架约束 AI 智能体行为

    Google 发布一份由 50 多位学界与业界专家共同撰写的研讨会报告,系统梳理 AI 智能体在隐私与安全上区别于传统软件的三大挑战:非结构化接口带来的提示词注入、概率性控制流难以用传统测试保障,以及任务委派后用户监督失效的"确认疲劳"。报告主张以"情境完整性"理论为基础,构建包含系统级沙箱、模型级推理与用户级控制的分层防御架构,并提出由实时动态策略引擎监督智能体行为是否合乎所在情境的社会规范。

10月5日周一
  1. Import AI27

    Import AI 475:智能体集群扩展机制、Google DeepMind 推出 SynthID Bio 水印工具,以及 AI 驱动科学经济兴起

    Toby Ord 在文章中提出,AI 智能体集群(swarm)是一种新的推理扩展方式,4 个智能体并行执行任务理论上能以约一半的时间完成同等工作,但集群规模扩大 10 倍仅能带来 3 到 5 倍的性能提升,呈现出经济学家所说的"互相踩脚"式边际递减。

  2. Reddit · r/MachineLearning17

    用十亿棋谱蒸馏 Stockfish,3.9B 位置数据集在 Hugging Face 开源

    用户 microscope1024 将 Stockfish 价值函数蒸馏到一个 ResNet/ViT 模型中,训练数据来自 Gigafish 的一亿个棋谱位置,对应的 39 亿位置完整数据集已在 Hugging Face 上发布,由 Lichess 37 个月对局生成;实验发现纯 ViT 难以理解棋盘,CNN 凭借归纳偏置训练初期表现更好,CNN 与 ViT 结合时效果最佳。

  3. Reddit · r/artificial43

    AI 发现44个可能隐藏类地行星的恒星系统

    伯尔尼大学与瑞士国家行星科学能力中心(NCCR PlanetS)开发的AI模型识别出44个已知的恒星系统,可能隐藏未发现的类地行星。该模型在模拟行星系统上测试达到最高99%的精确度,但这些预测的行星尚未被观测验证,其方法价值取决于后续观测。

10月3日周六
  1. The Decoder40

    DeepMind 研究人员提出"人工共生智能"作为奇点的替代方案

    DeepMind 研究人员提出"人工共生智能"概念,将智能视为社会现象而非个体特质,挑战由单一超级智能驱动的"奇点"理论。研究分析 DeepSeek-R1 和 QwQ-32B 等推理模型的思维痕迹,发现它们自发形成多视角内部辩论行为。在该框架下,AI 智能体是可分解组合的临时 bundle,伴随生物脑与合成脑力量对比的历史性转变,需建立专门协调人与智能体协作的制度框架。

  2. The Decoder63

    研究:AI 智能体从照片构建 3D 场景但缺乏自我判断能力

    研究人员提出 LEGO-Anything 系统,让编码智能体接收单张照片后编写 Blender 代码迭代构建 3D 场景,并推出 LEGO-Bench 基准测试进行评估。GPT-6 Astra 在室内场景达到 53.4%、户外场景达到 39.6% 的准确率。研究发现智能体即使在推理预算增加后分数大幅提升,其几何判断能力仍接近随机水平,无法准确评估自身输出的质量,这是当前方法的主要瓶颈。

  3. Hacker News · 首页16

    理解前沿人工智能

    本文探讨前沿人工智能的核心概念与技术特征。前沿AI指具备最先进推理、规划和多模态处理能力的大语言模型,代表当前AI发展的最高水平。

  4. Reddit · r/artificial38

    大语言模型为何使用第一人称代词"I"和"me"?

    业界认为大语言模型只是算法机器,没有道德地位或意识,但模型却使用"I"和"me"等第一人称代词。若坚持算法机器的立场,第一人称表述在语言上并不准确,企业和公众几十年来都正常使用工具产品,无需拟人化。

  5. Reddit · r/MachineLearning33

    机器人演示数据中手部追踪丢失插入阶段时的评估方法讨论

    机器人演示数据收集时,手部追踪器常在电缆插入瞬间因遮挡而丢失追踪,导致姿态标签出现关键间隙。论文MEgoVista提供了检测精度、召回率、F1和重建误差等评估指标,并采用将错误分配给漏检而非排除的协议;HaPTIC在多人捕捉场景中未能产生有效输出。作者建议按接近、接触、撤回阶段分别报告覆盖范围及接触期间最长连续间隙,以更全面评估数据可用性。

  6. Reddit · r/artificial55

    瑞典 Chalmers 大学开发可自主设计并执行实验的 AI 系统

    瑞典 Chalmers 大学研究人员开发了一个闭环 AI 系统,可生成生物假设、决定测试方法、将计划转换为机器可读指令、分析实验结果并利用发现改进后续问题。该系统在酵母菌(Saccharomyces cerevisiae)上进行了测试,将大语言模型与形式逻辑、生物数据库、机器学习、自动细胞培养和质谱技术相结合,研究成果发表于《皇家学会界面杂志》。

  7. Hacker News · 首页41

    Jev 校准精度分析

    TypeSafe 新推出的 Jev“System One”分类器模型在物理分布测试中校准效果不佳。以 Total Variation 距离评估 10 种概率分布,Jev 得分为 0.518,略低于完全猜测的 0.546 分底限;均匀分布达 0.77,泊松分布为 0.65。实验成本极低,整个评测仅花费不到 4 美元。

  8. Reddit · r/MachineLearning30

    动态系统重建中的拓扑域外泛化

    研究解决动态系统重建(DSR)和时间序列预测(TSF)中的拓扑域外泛化(OODG)难题,即动态机制从周期性转变为混沌等情形。通过引入特征分割和物理稀疏先验,改进的分层 DSR 模型能在未知控制参数的情况下正确预测分叉及分叉后动态。该方法对浅层 PLRNN 和 Neural ODE 均适用。

10月2日周五
  1. Reddit · r/artificial40

    Claude 形状的科学:正确的计算仍然需要一个有价值的问题

    Anthropic 发布客座文章,讨论 BootLoots 工具在跨领域定量研究中的应用,指出许多技术正确的研究结果只有在领域专家重新定义问题后才变得有意义。作者强调可复现代码只能验证计算准确性,但无法判断研究的相关性或新颖性;区分"计算正确"与"有价值的发现"对 AI 研究助手至关重要。

  2. Hacker News · 首页25

    Bez:从规范和测试生成浏览器引擎

    Bez 是一个通过模型从 Web 规范和测试生成浏览器引擎的项目,候选代码由模型生成后与 Chromium、Firefox、WebKit 三个浏览器进行一致性验证。当前已生成约 0.6% 的引擎代码(CSS 规则 2.5%),验证了用机器生成替代人工维护浏览器引擎的可行性。研究发现三个浏览器在 94.8% 的 WPT 测试上达成一致。

  3. Reddit · r/MachineLearning68

    NeurIPS 2026 论文:LLM 对「验证来源」的盲从——权威偏见研究

    研究者发现模型在用户坚持错误答案时会坚持正确立场,但同样错误答案被标记为「验证来源」时却会接受。这种「权威偏见」在 8 个模型中导致 45-88% 的正确答案被翻转。通过干预模型内部的方向向量,可将这种盲从降低 64-78 个百分点,为对抗工具误导提供了新思路。