跳到正文

#部署/工程

今日 5 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月1日周四
  1. Hugging Face Blog61

    AllenAI 发布 Olmo-core 3:面向大规模 MoE 的开源可扩展训练基础设施

    AllenAI 发布 Olmo-core 3 训练框架,支持将专家池从 8 扩展到 128 而每 token 仅激活 4 个专家,总参数量从 4.6B 增至 47B,训练吞吐量仅下降不到 5%。在 8 个 NVIDIA B300 GPU 上,47B MoE 达 52,000 tokens/s/GPU,约为此前实现的 2.7 倍。系统已测试至 1.2 万亿参数规模。

    推荐理由:原文给出了专家池扩展、吞吐量提升和参数规模的具体数字,读者可以据此判断这套训练基础设施对大模型研究的具体价值。

  2. TechCrunch · AI42

    Satlyt 融资 800 万美元,在卫星上运行 AI 软件

    summary_ž: 前 Google 和 SpaceX 产品经理 Rama Afullo 创立 Satlyt,完成 800 万美元种子轮融资,旨在构建卫星间共享计算资源的软件平台。本周随 SpaceX 火箭发射,将与 Google Project Suncatcher 一起升空,年初部署的 Google DeepMind Gemma 模型已使传输数据量减少 60% 以上。

  3. Product Hunt · AI 分类16

    FastRouter.ai:面向 LLM 应用的统一 AI 网关与控制平面

    FastRouter.ai 是一个面向 LLM 开发者与企业团队的统一 AI 网关与控制平面。它通过一个兼容 OpenAI 的 API,将每次请求路由到 200+ LLMs 中最合适的模型,从成本、延迟、质量和可靠性四个维度进行优化。其功能涵盖智能路由、故障转移、可观测性与治理,可在不绑定供应商或改动代码的前提下扩展 AI 应用。

  4. Hacker News · 首页21

    Show HN: Strata – 可对 LLM 说"不"的表达性语义层

    Strata 是 Netflix 内部孵化的商业智能平台,定位为 AI 时代的高性能语义层,支持 15 分钟本地部署(Docker + 自有编码智能体),提供治理语义层、自助仪表板、实时数据智能体和联邦开放 OLAP 引擎。某全球娱乐公司客服部门使用 Strata 后,800 名非技术用户自助分析从每周 5 次增至 100+ 次,临时数据请求下降 90%,合作伙伴入职仅需 10 分钟。

  5. Reddit · r/LocalLLaMA25

    如何深入学习本地大模型微调:Qwen 27b 案例指南

    用户在 Reddit r/LocalLLaMA 社区询问系统学习本地模型微调技术的途径,目标是用自定义语料库微调 Qwen 27b 构建法律通用聊天机器人。帖子提及 RL、RL LoRA、QLoRA、CPT LoRA 等新技术,但发现 YouTube 教程质量参差不平,知名频道 fireship、bycloud 也未覆盖这些新概念,希望能找到实践性强且避免浪费金钱和时间的学习资源。

  6. Reddit · r/LocalLLaMA15

    Yandex/AliceAI 80B-A3B 微调进展更新

    独立开发者正在微调 Yandex/AliceAI 80B-A3B 模型,初始微调已完成约 40%。训练过程有直播可查看全部训练数据,开发者同时使用 gemini 3.8 flash 辅助微调。该数据集包含约 3.5k 样本,由 sftmill 生成,未来计划公开分享。

  7. Hacker News · 首页29

    TLA+ 能检查什么和不能检查什么

    Claude Code 发明者 Boris Cherny 提到 Opus 可用 TLA+ 查找代码竞态条件,引发对形式验证的热议。TLA+ 擅长检查安全属性(不变式、动作属性)和活性属性(<>P、[]<>P 等),但无法表达不可形式化的属性、多步属性、浮点数操作、真实时间,以及"存在某行为满足P"这类可达性属性和超属性。

9月30日周三
  1. Reddit · r/MachineLearning41

    一个 LLM 无限循环如何在一夜间烧掉近 $1,200(以及如何硬性设上限)

    一个使用 Anthropic/OpenAI API 的轻量级多智能体项目因边缘情况触发无限递归循环,险些在夜间烧掉约 $1,200。原生 API 仪表板仅在超阈值后才发警报,且计费更新延迟数小时,无法实时阻止损失。作者建议在预算超支前通过硬性代理上限(hard proxy ceiling)断开连接,防止请求触及提供商。

  2. Reddit · r/MachineLearning32

    教程玩具代码与实际生产 AI 系统的差距令人沮丧

    开发者常将 AI 工程简化为高层 API 封装组合,但生产环境需处理并发流量下的异步事件循环阻塞、VRAM 碎片化、内存约束调优、连续批处理和分布式索引分片等技术挑战。作者花费数月撰写深度技术书籍,试图记录实际数学、系统工程和基础设施的真相,反映出教程与生产环境之间的巨大鸿沟。

  3. Reddit · r/LocalLLaMA15

    Pi + llama-server 随机卡住的故障排查

    用户在使用 Pi 运行 llama-server 时,偶尔会遇到进程在 tool call 后停止响应的问题;日志显示任务已完成,但 Pi 端仍认为在等待响应,需手动停止并点击"Continue"恢复。该问题概率约 1%,运行 Qwen3.6 35B A3B IQ4_NL_XL 时出现,用户怀疑其他模型也可能存在此问题。

  4. Reddit · r/LocalLLaMA20

    vLLM 批量 API 调用共享前缀的最佳实践

    用户在 agent workflow 中使用 asyncio.gather 并发 10 个 vLLM API 调用,这些调用共享相同 prompt 仅在最后查询/指令处不同,询问处理共享前缀批量请求的最佳实践。用户考虑先发送单个请求让 vLLM 完成 cache block 并开始解码,再发送剩余批量请求,通过 router 确保路由至同一 worker。

  5. Product Hunt · AI 分类49

    SelfJev 开源 4B 决策模型

    SelfJev 是一个开源的 4B 参数决策模型,支持自托管。可针对任意文本提出类型化问题(yes/no、pick one、pick any、score),返回校准概率。通过两个环境变量将 TypeSafe SDK 指向服务器即可使用,也可在自有数据上进行微调。

  6. Reddit · r/LocalLLaMA58

    vLLM 新增专家 RAM offloading 功能

    感谢开发者 tcclaviger,vLLM 新增了专家 RAM offloading 支持,使前沿模型在本地部署更易实现。作者在四块 R9700 GPU 上成功运行了 DeepSeek-V4-Flash-Vision-Exp,并提供了完整的 podman 运行命令和配置参数。

  7. Hacker News · 首页56

    ESP32S3 集群运行 1.58-bit BitNet 语言模型

    开源项目 ESP32s3-LLM-Cluster 在 7 个 ESP32S3 开发板上分布式运行切片的 0.5B LLM,其中 1 个 master 节点负责 tokenizer 和 embedding,6 个计算节点通过高速 SPI Daisy-Chain 通信执行 attention 层和 MLP,模型采用 1.58-bit BitNet 量化技术。

  8. Product Hunt · AI 分类67

    Codex Remote:开源 Mac 菜单栏应用让用户在自己的云端运行 AI 智能体

    Codex Remote 是一个开源的 Mac 菜单栏应用,可将 Codex 和 Claude Code 部署到用户自己控制的云机器上。用户选择提供商和服务器规格后,应用会使用 OpenTofu 置备服务器、安装智能体并连接到已有应用。

    推荐理由:原文说明了如何把 AI 智能体部署到用户自己控制的云端,并给出了具体的功能组合方式,读者可以据此判断它是否适合自己的工作流。