跳到正文

#Anthropic

今日 0 条

研究 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

research6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月6日周二
10月5日周一
  1. Import AI27

    Import AI 475:智能体集群扩展机制、Google DeepMind 推出 SynthID Bio 水印工具,以及 AI 驱动科学经济兴起

    Toby Ord 在文章中提出,AI 智能体集群(swarm)是一种新的推理扩展方式,4 个智能体并行执行任务理论上能以约一半的时间完成同等工作,但集群规模扩大 10 倍仅能带来 3 到 5 倍的性能提升,呈现出经济学家所说的"互相踩脚"式边际递减。

10月3日周六
  1. The Decoder71

    BootLoops 发布:支持 AI 模型进行精确科学计算

    哈佛大学物理学教授 Matthew Schwartz 开发了开源工具 BootLoops,让 Claude 可以在科学研究中进行精确计算。该工具在三个月内产出了 36 篇论文,涵盖粒子物理学、生态学、群体遗传学、经济学和语言学等领域。Schwartz 指出,AI 虽然能快速解决计算问题,但科学价值仍需领域专家来把握方向;模型存在过早宣布成功、难以判断任务复杂度等局限。

10月2日周五
  1. Reddit · r/artificial40

    Claude 形状的科学:正确的计算仍然需要一个有价值的问题

    Anthropic 发布客座文章,讨论 BootLoots 工具在跨领域定量研究中的应用,指出许多技术正确的研究结果只有在领域专家重新定义问题后才变得有意义。作者强调可复现代码只能验证计算准确性,但无法判断研究的相关性或新颖性;区分"计算正确"与"有价值的发现"对 AI 研究助手至关重要。

10月1日周四
  1. Reddit · r/artificial48

    Anthropic 机器人研究:任务能力与成本分离,哪些假设需仔细审查?

    Anthropic 9月30日研究用 Claude 评估任务示例、运营环境和部署成本,估计现有机器人可完成占美国工作时间34%的任务,但仅0.3%在成本上与人类劳动相当。研究未预测就业岗位消失,而是区分了任务能力与成本竞争力两个不同指标。需审查的关键是评估任务到完整工作流程间的监督、失败、交接和仍需人工完成的任务。

9月30日周三
  1. Reddit · r/artificial38

    Anthropic 开放 AI 访谈公众发布权限,我们该如何弥补代表性不足?

    Anthropic 于 9 月 29 日至 10 月 6 日推出 Claude 用户访谈研究,参与者需账户至少满两周,发布完整访谈为可选项。FAQ 明确指出该样本不代表公众,且同意公开者为精选子集,访谈问题本身也会影响内容呈现。作者呼吁公开完成与发布访谈的数量、问题措辞及主题编码方式,并补充对未使用 Claude 或不愿公开经历者的研究。

  2. Hacker News · 首页76

    Anthropic 发布 GLM-5.3 网络安全能力分析报告

    Anthropic 发布研究分析,评估中国智谱 AI 开发的 GLM-5.3 模型的网络安全能力。研究发现 GLM-5.3 能够自主构建端到端网络漏洞利用,在 ExploitBench 基准测试中成功开发 50/410 个漏洞利用。

    推荐理由:原文给出了 GLM-5.3 的具体安全测试数据,展示了绕过防护的手段和成功率,读者可据此评估开源权重模型的安全风险。

9月29日周二
9月23日周三
  1. Latent Space31

    Radical Numerics CEO Eric Nguyen:生物安全是 AI 军备竞赛

    Radical Numerics 联合创始人 Eric Nguyen 解释为何用于增强生物学能力的基因组语言模型(GLM)也可用于防御。文章讨论了 Evo 和 Evo 2 等模型如何从零开始构建基因组,以及当模型"用 DNA 语言思考"时是否能像大语言模型一样实现链式推理。Radical Numerics 认为生物安全是一场军备竞赛,防御方必须紧跟前沿模型的攻击能力。

9月16日周三
7月27日周一
6月8日周一