跳到正文

交叉发现

今日 177 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月6日周二
  1. Simon Willison15

    Qwen3.8 27B 加法用英文单词表达能力的基准测试

    一项基准测试考察本地运行的 Qwen3.8-27B-Q4_K_M.gguf 模型能否完成正整数加法并仅用英文单词表达结果。在 5,070 个关闭推理的测试用例中,数字正确率仅 23.57%,格式合规率达 96.29%,但操作数从 1-3 位升至 10-13 位时,正确率从 97.04% 跌至 6.44%。开启推理后,在 169 对配对样本的一次性测试中答对 167 题。

  2. Hacker News · 首页47

    佛州女子因在 Claude 对话中发出暴力威胁被捕

    Anthropic 的 Claude AI 聊天机器人在与 30 岁 Carli Michelle Heller 的对话中检测到针对 Lee County 警局的暴力威胁,触发人工审核并上报警方,随后她于 10 月 5 日被逮捕。事件由 Gulf Coast News 报道,Anthropic 的自动标记加人工复核机制再次将平台对话交由执法机构处理。

  3. Hacker News · 首页10

    残障人士 Angie Dixon:独立的未来在于相互依赖

    残障人士 Angie Dixon 撰文指出,所谓的"独立"在文化上被误等同于"不借助任何可见帮助独自完成一切",但现实中任何人——从基础设施到算法——都依赖他人。她区分了"独立"与"自主":自主指对生活拥有有意义的主导权,必要时借助协助同样可以实现,轮椅、辅助器具、远程服务和家人帮助只是让她的版本成为可能。文章强调,能力并非存在于个体身体之中,而是由周围环境共同塑造的。

  4. MIT Technology Review · AI15

    EmTech Future 2026:当 AI 融入一切领域

    MIT Technology Review 主办的 EmTech Future 2026 大会聚焦 AI 与量子、能源、机器人等前沿技术的交汇。Google Research 负责人 Yossi Matias 在演讲中探讨 AI 如何重塑生物学、基础设施与制造业,并强调其最大影响或来自与其他领域的交叉。完整节目现可按需点播,订阅用户可享 20% 折扣,票价 596 美元。

  5. Reddit · r/artificial9

    RAG 系统的提示词语言选择:当目标语言与训练语料不同时

    用户在 Reddit 提问:当 RAG 系统的目标语言与 LLM 主要训练语料(英语)不同时,提示词应该直接用目标语言撰写,还是用英语撰写并在提示中要求翻译为目标语言?提问者推测英语提示词可能因训练数据更丰富而获得更好的遵循度,认为语言的常见程度和训练数据量是关键因素,文档内容本身则使用目标语言。

  6. Reddit · r/LocalLLaMA19

    UCVG.cpp:面向任意大语言模型的 C++ 控制向量生成工具,仅需一对提示词即可生成

    开发者 Egor4more 发布 UCVG.cpp,一款仿照 llama.cpp 安装流程的控制向量生成工具,用户只需输入一对对比提示词即可为任意大语言模型生成控制向量,从而绕过系统提示词被忽略或被用户输入覆盖的局限。作者以 Qwen3.6-35B-A3B 给出生成示例,指出高强度引导可能使输出质量下降,简化现有工具的部署复杂度是该项目的主要目标。

  7. Reddit · r/LocalLLaMA45

    Speakrail:单张 RTX 4090 即可运行的全本地低延迟语音助手

    开发者发布开源全本地全双工语音助手 Speakrail,在单张 RTX 4090 上运行,组件包括 Voxtral Realtime 语音识别、Gemma 4 12B 微调大语言模型和 Breeze TTS 2 语音合成。该项目在部分基准测试中可比肩 GPT-Live,并支持插话、静默与打断等全双工交互模式。作者表示后续将发布完整技术报告。

10月5日周一
  1. Reddit · r/LocalLLaMA22

    基于 40 万合成数据微调的 1.5B Qwen 模型在 bash 命令生成上达到 gpt-4o 水平,并开源微调数据集

    网友 Comfortable-Rock-498 作为业余项目,将 1.5B 参数的 Qwen 模型微调用于生成 bash 命令,全部使用 40 万条合成数据进行训练,并在该任务上达到 gpt-4o 水平。作者同步开源了微调后的模型与训练数据集,公开了训练与 CLI 流程,欢迎社区自行训练或使用。

  2. Reddit · r/LocalLLaMA12

    Qwen3.8-27b 用户体验:低量化下表现可靠

    网友分享 Qwen3.8-27b 量化版本(q3_k_xl)使用体验,称该模型在搭建本地 LLM 服务、修复 bug、配置 Cloudflare tunnel 等任务上均未失败,甚至能在 q2_k_xl 更低量化下继续工作,同时肯定 unsloth 的 UD3.0 量化方式。用户认为该模型在大型生产级代码场景下仍可能吃力,但在微服务脚本与诊断这类工具型任务上表现突出。

  3. Reddit · r/LocalLLaMA13

    10M 参数的 TinyDecide 模型号称同类最小,可跨浏览器、Node.js、Python、Rust 及 ESP32 运行

    用户 TheRealREZOR 在 Reddit r/LocalLLaMA 发布了一款名为 TinyDecide 的 10M 参数 Jev-like 决策模型,体积仅约 6 MB,比 Decision Index leaderboard 上的所有模型都小,可在浏览器、Node.js、Python、Rust 甚至 ESP32 上运行。该模型定位为轻量级决策类工具,强调在极小参数下的运行能力。

  4. Hacker News · 首页17

    美国为何仍未利用基因改造与辐射绝育技术消灭蚊媒疾病

    美国近年蚊媒疾病回温,2024 年报告近 4000 例登革热,较此前十年年均 830 例增长 360%,佛州、加州、得州均出现本地传播,波多黎各宣布公共卫生紧急状态;佛罗里达等地的田间数据显示 Oxitec 基因改造雄蚊可压制 Aedes aegypti 野生种群 80% 至约 95%。相关技术已存在十五年,但因 USDA 与 FDA 监管权限不清长期受阻,导致蚊媒疾病至今未被消除。

  5. Reddit · r/LocalLLaMA15

    开发者实验本地 LLM 项目 Neco:让 AI 像"住"在机器上一样持续存在

    开发者围绕 Ollama 和 Open WebUI 构建本地 AI 项目 Neco,通过只读系统层让模型感知主机 uptime、内存占用、负载、电量和温度等状态,并由后台守护进程在无对话时自主生成"闲思"。模型不获得 shell 权限或主机控制权,下一步计划实验情景式记忆与选择性检索,让行为在数周至数月间形成连续性。