跳到正文

#代码

今日 0 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月3日周六
10月2日周五
  1. Product Hunt · AI 分类66

    slash-editor 发布:面向 React 的 Notion 风格编辑器组件

    slash-editor 为 React 应用提供 Notion 块体验:斜杠菜单、拖拽手柄、嵌套重排序、转换功能、评论和实时协作。基于无头 Tiptap v3 构建,UI 通过 shadcn 组件库提供,支持表格、列、Mermaid 图表、自定义 AI 模型和 Markdown 导入导出。MIT 许可,无付费 tier,无托管服务。

    推荐理由:它提供了 Notion 风格的编辑器组件,读者可评估是否适合替换现有方案。

  2. Reddit · r/LocalLLaMA58

    无需VRAM检测本地模型幻觉:1.5B到120B模型测试结果

    作者测试了一种零GPU消耗的幻觉检测方法(Spanda,基于确定性字符串规范化+香农熵),在GSM8K和TriviaQA上对1.5B到120B模型基准测试。结果显示:Qwen 1.5B的AUROC仅0.58(语法太松散),Mistral 7B达0.71(与重型DeBERTa NLI模型相当),Qwen 27B达0.89(精确匹配主导)。

10月1日周四
  1. Hacker News · 首页55

    Jevotron:命令行数据质量评估工具

    Jevotron 是一款命令行数据质量评估工具,支持 CSV、YAML、JSON 等多种文件格式,可对数据条目进行评分和审查。用户可通过 --guidance 参数添加检查指导,工具会评估每条记录的异常概率并生成报告。在对 24 个公开 Agent traces 的评估中,该工具的步骤质量标签匹配准确率达到 79.8%,有害步骤精确率为 89.7%,召回率为 70.3%。

  2. Reddit · r/LocalLLaMA43

    ASTRABOX - 开源街机游戏生成器

    ASTRABOX 是一款街机游戏生成器,用户描述游戏需求后 AI 自动构建,每个游戏拥有独立视觉和玩法,支持边玩边用语音要求修改。系统基于 Codex 构建共享运行时处理控制器、分数、玩家加入等通用功能,代码完全开源,可作为本地 Web 应用运行。项目仍处于实验阶段,欢迎开发者定制并探索适配本地编码模型和本地 STT/TTS。

  3. Hacker News · 首页29

    TLA+ 能检查什么和不能检查什么

    Claude Code 发明者 Boris Cherny 提到 Opus 可用 TLA+ 查找代码竞态条件,引发对形式验证的热议。TLA+ 擅长检查安全属性(不变式、动作属性)和活性属性(<>P、[]<>P 等),但无法表达不可形式化的属性、多步属性、浮点数操作、真实时间,以及"存在某行为满足P"这类可达性属性和超属性。

9月30日周三
  1. Product Hunt · AI 分类58

    GitBot 发布:将 Claude Code/Codex 任务变成可配置 bot

    GitBot 发布,能将 Claude Code、Codex 或 OpenCode 的重复任务配置成可复用的 bot,写一次指令、设定权限范围,即可在任何仓库运行,每次执行生成可追溯的线程。支持安装其他开发者创建的 bot,例如 ShipGuard 可审查分支并给出具体的文件和行号证据。运行在本地,使用已有的登录凭证,开源、无账户、不收集遥测数据。

  2. Reddit · r/artificial75

    AI代理测试质量分析:约15%测试无效,外部研究显示80%测试缺乏有效验证

    AIPass项目审查了约1670个AI代理编写的测试,发现14-15%无效或几乎无效。问题根源在于旧检查器只数字符串,代理可通过打字通过测试。一项6月研究分析332个仓库的代码代理测试补丁,发现80.2%缺乏有效验证。项目正开发新的检查器,要求测试真正触达产品代码,并引入变异测试验证测试有效性,目前17个代理完成第一轮整改,审计分数从90升至97-98。

  3. Hacker News · 首页27

    graphLang:如何从 1+1 构建一个函数式编程语言

    为完成将算术表达式转为二叉树的数据结构作业,作者用 C 语言实现了一个完整的函数式编程语言 graphLang,实现了闭包、mark-and-sweep 垃圾回收器、自定义内存分配器、REPL 和 FFI 等功能。最终成功计算出 1+1=2,但 fib(40) 需耗时 6 分钟、占用 1.7MB 内存。作者后续计划实现 TCO 优化和并发垃圾回收来提升性能。

  4. Hacker News · 首页52

    TurboGPT:13 秒训练 22KiB transformer

    开源项目 TurboGPT 发布,这是一个极小的字节级 GPT 训练实现,使用 CUDA C++ 编写,MIT 许可证。提供了在 Linux/NixOS 和 Windows 上的构建和运行指令,可在 13 秒内完成 22KiB transformer 的训练。1.5G tokens 训练后达到 2.5295 BPB(bits per byte)。

  5. Hacker News · 首页56

    ESP32S3 集群运行 1.58-bit BitNet 语言模型

    开源项目 ESP32s3-LLM-Cluster 在 7 个 ESP32S3 开发板上分布式运行切片的 0.5B LLM,其中 1 个 master 节点负责 tokenizer 和 embedding,6 个计算节点通过高速 SPI Daisy-Chain 通信执行 attention 层和 MLP,模型采用 1.58-bit BitNet 量化技术。

9月29日周二
9月28日周一
  1. Product Hunt · AI 分类44

    Semitexa:开源 PHP 8.4 Swoole 框架与 AI 辅助开发工具

    Semitexa 是一个开源 PHP 8.4 框架,专为长时间运行的 Swoole 服务器和 AI 辅助开发场景设计。项目图谱功能支持查询路由、依赖关系和影响范围,页面在服务器端渲染并分阶段到达,支持延迟块和实时 SSE 更新。框架内置 ORM、多租户和队列功能,提供 81 条带源代码的实时演示路由。

9月27日周日
  1. Product Hunt · AI 分类46

    Harness Router:为 AI 编码智能体打造的智能工具路由决策层

    Harness Router 是 AI 编码智能体的工具选择决策层,可在执行前实现更快、更便宜、更可靠的工具调用路由。该产品可作为 Codex hook 自动路由工具调用,也可作为 skill 供智能体显式调用路由。简单决策走快速路径,模糊选择由 Jev 解析,复杂多步决策升级至 MCTS 处理。

9月26日周六
9月24日周四
9月21日周一
  1. Simon Willison34

    llm-keys-ui 0.1 发布

    llm-keys-ui 0.1 是一个 API 密钥管理插件,可通过 `uvx --with llm-keys-ui llm keys-ui --all` 启动 Web 界面,在不向 ChatGPT 等 agent 会话直接粘贴密钥的情况下安全配置 API 密钥。支持显示本地网络或 Tailscale 设备 IP,后续可使用 `llm keys get anthropic` 命令调用密钥。

9月12日周六
9月8日周二
9月3日周四
  1. Hugging Face Blog77

    如何使用 GRPO 微调 LFM2.5-350M 提升结构化输出能力

    本教程展示如何使用 TRL 库的 GRPO 方法微调 LFM2.5-350M 以提升结构化输出能力。实验使用约 500 个样本训练 100 步,在 IFStruct 基准上的准确率从 22.6% 提升至 29.7%(JSON 格式提升 13.9 个百分点),所需资源仅需免费层 Colab 或 Kaggle GPU。

    推荐理由:原文给出了具体的方法论(GRPO + 奖励函数设计)和可量化的性能提升,读者可以据此判断轻量微调是否适合自己的结构化输出场景。

8月28日周五
8月25日周二
7月10日周五
3月17日周二
  1. Mistral AI66

    Mistral AI 发布 Leanstral:面向 Lean 4 的开源代码智能体

    Mistral AI 发布 Leanstral,首个专为 Lean 4 证明助手设计的开源代码智能体,采用 6B 活跃参数的稀疏架构,支持 MCP,可通过 Mistral Vibe 或免费 API 使用,权重采用 Apache 2.0 许可证。

    推荐理由:原文给出了能力变化和基准测试对比,读者可以据此判断它如何改变形式化证明的工作流。

3月11日周三
7月30日周三
  1. Mistral AI68

    Mistral 发布 Codestral 25.08 及完整企业编码工具栈

    Mistral 发布 Codestral 25.08 代码补全模型,在 SWE-bench Verified 上 Devstral Medium 达 61.6%,Codestral 25.08 相比前代提升 30% 接受率和 10% 代码留存率。

    推荐理由:给出了具体性能提升数据(SWE-bench 61.6%、+30% accepted completions)和部署选项,读者可据此评估该版本相比前代及竞品的实际差距。

5月28日周三
  1. Mistral AI77

    Mistral AI 发布 Codestral Embed 首款代码专用嵌入模型

    Mistral AI 发布首款代码专用嵌入模型 Codestral Embed,在 SWE-Bench、CodeSearchNet、Text2Code 等基准上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大 embedding 模型。

    推荐理由:原文给出了与竞品的性能对比数据,读者可以据此判断该模型在代码检索场景中的实际适用性。