跳到正文

#图像

今日 0 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月3日周六
10月2日周五
  1. The Decoder74

    Black Forest Labs 发布 Flux 3 Image,支持多步骤编辑不影响图片其他部分

    Black Forest Labs 发布 Flux 3 Image 图像模型,支持多步骤编辑且不影响图片其他部分,同时支持文本到图像、图像到图像、文本渲染和逼真图像生成,可通过边界框构图、最多十张参考图像生成,最高输出 4K。免费演示可用,API 半价至 10 月 8 日,商业授权可自建和微调,开源权重版本预计几周内推出。

  2. Product Hunt · AI 分类50

    Anthroposcaper:浏览器端2D图纸自动生成3D场景工具

    Anthroposcaper 是一个基于浏览器的3D场景构建工具,用户可绘制2D平面图或导入DXF文件,标记面和线后将GLB模型沿匹配边缘自动放置成纹理化3D场景,修改标记即可重建场景。通过MCP协议连接AI智能体辅助设置模板和材料,最终导出GLB文件至3D编辑器或游戏引擎。

  3. The Decoder56

    Ideogram 4.5 解决局部图像编辑难题

    Ideogram 发布新模型 Ideogram 4.5,声称可实现图像局部编辑而不破坏其余部分,解决了 AI 图像编辑的核心痛点。该模型支持产品摄影、室内设计、图像修复和文本编辑等场景,提供 0.8-22 美分四个质量档次,均为原生 2K 分辨率。模型现已上线 Ideogram 平台和 API,合作方包括 Picsart、Runway、Pika 和 Leonardo AI,并即将开放权重。

10月1日周四
9月30日周三
  1. Reddit · r/MachineLearning20

    货架审计中 YOLO + 嵌入向量的尺寸变体识别难题如何解决

    作者构建的货架审计工具采用YOLO检测产品后用嵌入向量搜索SKU,但同一品牌、相同瓶子不同尺寸(1.25L vs 2L)的产品容易被误识别。尝试DINOV2、SigLIP2、OpenCLIP等嵌入模型均失败,原因在于图片被letterbox到224x224后小尺寸文字几乎消失,且参考图只有货架照片而非棚拍图。作者询问是否需微调嵌入器增加硬负样本、用OCR作为第二检查,或放弃全局嵌入方案。

9月27日周日
9月8日周二
8月17日周一
4月23日周四
  1. Google Research72

    Google Photos Auto frame 推出视角重制功能,利用 3D 估计和生成式 AI 调整照片角度

    Google 宣布在 Google Photos 的 Auto frame 功能中推出新的视角重制技术。该方法先通过 3D 点云估计和人脸检测重建场景,再使用生成式潜扩散模型填补新视角下缺失的背景内容,从而在保持人物身份的同时自动调整拍摄角度。目前该功能已上线,可自动优化包含人物的肖像照片。

    推荐理由:原文介绍了 3D 场景估计+生成式修复的技术路径,读者可据此了解图像后期视角调整的新方法。