跳到正文

#图像生成

今日 2 条

洞察 · 工具·提示词·论文 三栏速览

每栏 3 / 6 · 直达分类页

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
  1. Simon Willison5

    Ben Affleck 谈 VFX 工作流:从卷积神经网络到 Transformer 的早期实践

    演员 Ben Affleck 在访谈中谈及他从模拟胶片过渡到数字制作时接触计算机的经历,并解释了自己如何用 Python 脚本配合卷积神经网络处理 VFX 中的张量数据,进行边缘检测与特征提取以完成绿幕抠像。他将卷积神经网络视为 Transformer 的前身,指出 Transformer 能同时进行更多并行计算。

  2. Reddit · r/artificial4

    一则 Reddit 用户与 ChatGPT 的"为什么鸡要过马路"图像生成经历:从 1847 年反笑话到 AI 版权拦截、再到意外生成的狐狸

    一位 Reddit 用户为重述"鸡为什么要过马路"这个 1847 年反笑话,让 ChatGPT 生成一幅类似 Road Runner 的图像,反复被版权拦截,最终只得到一只拿箭的狐狸站在鸡旁边。该笑话最早出现在 1847 年 The Knickerbocker 杂志,作者不明。帖子发布于 r/OpenAI 和 r/artificial 后引发讨论。

10月7日周三
  1. Reddit · r/LocalLLaMA27

    EmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行

    EmbeddingGemma 2 将图像和文本映射到同一个 768 维向量空间,支持以文字描述检索图片。开发者将其文本塔与视觉塔移植到 TypeScript 写的 WebGPU 推理库 ruNNtime,并在浏览器中用本地 GPU 完成完整检索流程,原始数据无需上传服务器。ruNNtime 同时兼容多种类视觉模型,可在交互式文档里直接体验。

10月6日周二
  1. Reddit · r/MachineLearning21

    ZhemaIsmayil 曾用神经网络为每个字体生成嵌入向量并以 tSNE 可视化,意外得到花朵状结构

    一名开发者用预训练神经网络为每个字体的字符生成嵌入向量,再用 tSNE 把降维后的嵌入映射为 XYZ 和 RGB 通道并以点云可视化,使视觉相近的字体在位置和颜色上自然聚集。在 Google Fonts 语料上,该可视化呈现出花朵形状,大多数手写体字体集中于花蕊区域。作者另在其字体检索网站上提供了基于全部可搜索字体的类似可视化。

10月4日周日
  1. Hacker News · 首页28

    用 Claude 自动化 35mm 胶片扫描流水线:从驱动扫描仪到负片转正、去尘与编辑

    摄影爱好者 Shan 用 Claude 接管了 35mm 胶片扫描流水线:先用 SANE 驱动扫描仪因方向反转险些损坏机械,改为在 VueScan 扫描后交接给 Claude 处理后续环节。Claude 通过 numpy 做负片密度反转并以片卷空白段为基准统一色彩,再用图像分析定位灰尘、用 LaMa 模型填补并从邻近颗粒补回细节,使原本每卷 36 张需约 4 小时的流程被自动化。