跳到正文

交叉发现

今日 4 条

图像 · 工具·提示词·论文 三栏速览

每栏 2 / 6 · 直达分类页

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
  1. Reddit · r/ChatGPT19

    用 GPT Image 2.5 将普通照片转化为"第二世界"海报的提示词指南

    用户分享了一套基于 GPT Image 2.5 的提示词,可将任意上传照片生成一张"第二世界"竖版海报:上半保留原照主体、姿态与光线,下半以暖米色纸张延续同一结构(如道路、倒影或光线)并加入对应的纸艺互动场景,使两半形成连续画面。该提示词还规定可加入 0–3 个黑色线条小人以及一句手写英文短标题,但禁止脱离原图的插画、水印或装饰。

  2. Reddit · r/artificial6

    Reddit 用户求助:能生成成人向但不裸露图片生成图片模型的 AI 图片生成器推荐

    Reddit 用户发帖询问有没有能根据上传照片生成成人主题但不裸露(如蒙眼、束缚着衣)图片生成图片模型的 AI 工具,称 Grok、ChatGPT 等均拒绝相关请求或仅生成一张后拒绝继续编辑。帖文表示仅用于夫妻间的趣味图片,无意公开发布或售卖,希望社区推荐可用的图片生成图片模型。

  3. Reddit · r/ChatGPT6

    ChatGPT 图像生成为何总把普通人画成"超模"身材

    用户反馈 ChatGPT 图像生成时,无论提示词是否要求普通人物,输出结果普遍偏向超模身材、清晰下颌线、腹肌等理想化男性特征,或妆容精致、面容完美的女性形象。用户推测原因是训练数据以网红、网红风格的影响图居多,模型因此默认将人物美化,除非提示词明确反向指定。

10月7日周三
  1. Reddit · r/ChatGPT17

    开发者用 GPT 生成 1200 多张美术素材,完成类 FTL 飞行艇策略游戏

    一名独立开发者用 GPT 为其类 FTL 飞行艇策略游戏生成了超过 1200 张高质量美术素材,涵盖舰船房间、图标、成就、背景、舰船类型、敌人等内容。开发者表示,按其个人手工速度,这批素材本需数年才能完成,而 GPT 的产出速度快上百倍且质量更高。该游戏计划于数周后登陆 Steam。

  2. Product Hunt47

    Google 发布图像模型 Nano Banana 2.1,支持遮罩编辑与多分辨率 Search grounding

    Google 今日推出图像生成与编辑模型 Nano Banana 2.1,主打更清晰的设计感、基于遮罩的编辑能力、更强的主体一致性以及更自然的成像效果。该模型还优化了文字渲染与多轮一致性,并支持 1K、2K 和 4K 分辨率的 Search grounding。用户可在 Google AI Studio、Gemini 应用、Gemini API 和 Google Cloud 中试用。

  3. Reddit · r/ChatGPT4

    ChatGPT 为 Inktober 素描重新排列彩色铅笔颜色顺序

    用户完成 Inktober 素描后,让 ChatGPT 按色轮渐变规律重新整理颜色顺序。ChatGPT 建议将 Golden Yellow 排在 Yellow 之后作为向橙色的过渡,并把 Mahogany 从红色系移至棕色系,同时提出 Aqua Green → Green → Jade Green → Yellow Green 的渐变排列。

  4. TechCrunch · AI22

    三名前 Ramp 工程师创办 Melius,融资 2500 万美元打造 AI 广告创意生成平台

    由三名 Ramp 前工程师创办的 AI 创意平台 Melius 宣布完成总额 2500 万美元融资,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。团队在首款 AI 营销产品上线六个月后因效果不佳废弃全部代码,转向做生成广告素材与活动的"创意工作智能体实验室",自 7 月走出隐身模式后两个月内年化营收已突破 100 万美元。

10月6日周二
  1. The Decoder24

    Reka AI 发布全能模型 Rho-1,单一网络处理文本、图像、视频与机器人控制

    Reka AI 发布研究预览版全能模型 Rho-1,采用 190 亿参数(19-billion-parameter)单一神经网络,同时处理和生成文本、图像、视频与机器人控制动作,所有模态作为 token 在同一上下文窗口中运行,无需工具调用。模型可实时生成连续视频并即时响应新指令,同一批权重既预测摄像头图像又驱动机器人运动;训练在 320 块 H100 GPU 上历时约三个月完成。

10月3日周六
10月2日周五
  1. Product Hunt · AI 分类50

    Anthroposcaper:浏览器端2D图纸自动生成3D场景工具

    Anthroposcaper 是一个基于浏览器的3D场景构建工具,用户可绘制2D平面图或导入DXF文件,标记面和线后将GLB模型沿匹配边缘自动放置成纹理化3D场景,修改标记即可重建场景。通过MCP协议连接AI智能体辅助设置模板和材料,最终导出GLB文件至3D编辑器或游戏引擎。

10月1日周四
9月30日周三
  1. Google Research59

    Google发布Diffusion Controller:统一并简化AI图像生成控制

    Google Research提出Diffusion Controller框架,将图像生成的去噪过程重新定义为连续控制问题。该框架通过轻量级的“转向阻尼器”网络实现对生成轨迹的动态调整,可在不修改基础模型的情况下控制生成结果。在Stable Diffusion v1.4上的实验显示,灰盒版本在HPS-v2胜率上优于LoRA,白盒版本相较基线模型达到90%胜率。

9月29日周二
9月8日周二
8月28日周五
  1. Google DeepMind76

    Google DeepMind 发布 Gemini Omni 1.1 Flash

    Google DeepMind 发布 Gemini Omni 1.1 Flash,带来场景扩展、首尾帧插值、360p 快速预览和 4K 超分辨率等创意控制功能。新模型支持最长 40 秒视频生成,可在 Google AI Studio 和 Agent Platform API 中使用,也可通过 Google AI Plus、Pro 和 Ultra 订阅在 Google Flow 中访问。

    推荐理由:提供了具体的性能提升数据和可用性信息,读者可以评估新模型对自己工作流的实际价值。

8月17日周一
6月23日周二
4月29日周三
4月23日周四
  1. Google Research72

    Google Photos Auto frame 推出视角重制功能,利用 3D 估计和生成式 AI 调整照片角度

    Google 宣布在 Google Photos 的 Auto frame 功能中推出新的视角重制技术。该方法先通过 3D 点云估计和人脸检测重建场景,再使用生成式潜扩散模型填补新视角下缺失的背景内容,从而在保持人物身份的同时自动调整拍摄角度。目前该功能已上线,可自动优化包含人物的肖像照片。

    推荐理由:原文介绍了 3D 场景估计+生成式修复的技术路径,读者可据此了解图像后期视角调整的新方法。

4月17日周五
2月27日周五
2月11日周三
8月30日周六
  1. Product Hunt · Design15

    Genspark AI Designer:一句话生成设计的 AI 智能体

    Genspark AI Designer 是一款 AI 智能体,用户只需一条提示词即可生成各类设计内容,作为 Genspark Super App 中的 AI 员工角色上线。该工具于 2025 年 9 月 1 日推出,与 GenCode、Genspark for Word 等模块共同构成 Genspark 的 AI 智能体引擎。

6月14日周六
  1. Product Hunt · Design7

    Z3D 发布 Vortex 版本,主打多角度 AI 3D 模型生成

    Z3D 推出 Vortex 版本,定位为 AI 3D 模型生成工具,支持输入文本提示词或参考图像生成专业级 3D 模型与场景,宣称无需专业技能即可在数秒内完成多角度生成。该产品所属类别为 3D & Animation 与 AI Generative Media,于 2025 年 6 月 22 日上线。

6月5日周四
  1. Product Hunt · Design7

    (Not Boring) Camera 上线,主打"认真但不较真"的相机 App

    (Not Boring) Camera 是一款主打摄影的相机 App,定位为"不把自己太当回事的严肃相机",于 2025 年 6 月 8 日在 Product Hunt 上线。产品主打"为热爱摄影的人(For the love of photography)"社区,目前已有 366 名关注者。官方认为相机硬件虽不断升级,但用户拍出的照片并未变得更耐看。

5月21日周三
3月7日周五
  1. Mistral AI75

    Mistral 推出 OCR API,基准测试超越 Google、Azure 和 GPT-4o

    Mistral 发布新的 OCR API Mistral OCR,可处理图像和 PDF 并提取交错文本和图像,在基准测试中超越 Google Document AI、Azure OCR、Gemini 和 GPT-4o。定价为每美元 1000 页,单节点处理速度最高达每分钟 2000 页,支持多语言文档理解,现已在 Le Chat 免费试用,API 已上线 la Plateforme。

    推荐理由:原文给出了具体定价、基准测试对比和可用入口,读者可以据此评估它与现有 OCR 方案的差异。

9月28日周六
  1. Product Hunt · Design4

    Prompt Llama:跨模型同提示词文本生成图像评测工具

    Prompt Llama 是一个用于收集高质量文本到图像 prompt 并用同一 prompt 测试不同模型表现的评测工具,2024 年 9 月 29 日在 Product Hunt 上线。该项目通过统一提示词横向对比各模型生成效果,帮助用户判断不同模型在同一任务下的表现差异。