#图像生成
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#图像生成
今日 5 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/ChatGPTAI 评分1919 用 GPT Image 2.5 将普通照片转化为"第二世界"海报的提示词指南
用户分享了一套基于 GPT Image 2.5 的提示词,可将任意上传照片生成一张"第二世界"竖版海报:上半保留原照主体、姿态与光线,下半以暖米色纸张延续同一结构(如道路、倒影或光线)并加入对应的纸艺互动场景,使两半形成连续画面。该提示词还规定可加入 0–3 个黑色线条小人以及一句手写英文短标题,但禁止脱离原图的插画、水印或装饰。
Simon WillisonAI 评分55 Ben Affleck 谈 VFX 工作流:从卷积神经网络到 Transformer 的早期实践
演员 Ben Affleck 在访谈中谈及他从模拟胶片过渡到数字制作时接触计算机的经历,并解释了自己如何用 Python 脚本配合卷积神经网络处理 VFX 中的张量数据,进行边缘检测与特征提取以完成绿幕抠像。他将卷积神经网络视为 Transformer 的前身,指出 Transformer 能同时进行更多并行计算。
Ars Technica · AIAI 评分3333 Artcraft 用 Claude Opus 5.5 开源克隆 Adobe 七大软件
summary: Artcraft 开发者 Brandon Thomas 本周发布七款开源应用,用 Anthropic Claude Opus 5.5 以 Rust 编写(另提供 WebAssembly 浏览器版本)。
Reddit · r/artificialAI 评分44 一则 Reddit 用户与 ChatGPT 的"为什么鸡要过马路"图像生成经历:从 1847 年反笑话到 AI 版权拦截、再到意外生成的狐狸
一位 Reddit 用户为重述"鸡为什么要过马路"这个 1847 年反笑话,让 ChatGPT 生成一幅类似 Road Runner 的图像,反复被版权拦截,最终只得到一只拿箭的狐狸站在鸡旁边。该笑话最早出现在 1847 年 The Knickerbocker 杂志,作者不明。帖子发布于 r/OpenAI 和 r/artificial 后引发讨论。
The DecoderAI 评分5858 Google 向公众开放 SynthID 检测器,称已有 1800 亿张图片和视频被打水印
Google 将 SynthID 检测器面向公众开放,任何人都可以上传 JPG、PNG、MP4 或 MP3 文件,识别这些内容是否带有 SynthID 隐式水印,覆盖 Gemini、Veo、Lyria 等模型生成的素材。
Reddit · r/LocalLLaMAAI 评分2727 EmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行
EmbeddingGemma 2 将图像和文本映射到同一个 768 维向量空间,支持以文字描述检索图片。开发者将其文本塔与视觉塔移植到 TypeScript 写的 WebGPU 推理库 ruNNtime,并在浏览器中用本地 GPU 完成完整检索流程,原始数据无需上传服务器。ruNNtime 同时兼容多种类视觉模型,可在交互式文档里直接体验。
Product HuntAI 评分4747 Google 发布图像模型 Nano Banana 2.1,支持遮罩编辑与多分辨率 Search grounding
Google 今日推出图像生成与编辑模型 Nano Banana 2.1,主打更清晰的设计感、基于遮罩的编辑能力、更强的主体一致性以及更自然的成像效果。该模型还优化了文字渲染与多轮一致性,并支持 1K、2K 和 4K 分辨率的 Search grounding。用户可在 Google AI Studio、Gemini 应用、Gemini API 和 Google Cloud 中试用。
Reddit · r/ChatGPTAI 评分33 用户分享将个人手绘转化为 AI 生成图的体验
一位 Reddit 用户分享了自己在情绪低落时画的一幅速写,并借助 AI 将其重新生成为一幅完成度更高的作品。该用户表示,看到 AI 生成的版本比自己原画的艺术水平更成熟,令人感到被肯定。该帖同时展示了 AI 辅助创作在个人表达层面的应用价值。
The DecoderAI 评分6060 Google 发布图像模型 Nano Banana 2.1,画质提升且价格近乎减半
Google 发布图像生成与编辑模型 Nano Banana 2.1,取代今年 2 月发布的 Nano Banana 2,基于 Gemini 3.6 Flash,主打 Pro 模型的更高效版本。
Reddit · r/MachineLearningAI 评分1818 AFP-GIC:可控生成式图像压缩框架在 IEEE Access 发表
AFP-GIC 框架发表于 IEEE Access(2026),针对超低码率场景,通过非对称自适应融合先验迁移管道,在不传输融合先验的前提下实现先验引导的纹理重建。
Product Hunt · AI 分类AI 评分3333 开源桌面工具 Scumble 发布,主打本地 ComfyUI 与多模型 API 的 AI 局部重绘编辑
Scumble 是一款免费、开源的桌面端 AI 局部重绘编辑器,用户框选画面区域并用文字描述应替换内容,结果会输出为独立且色彩匹配的图层。它支持在本地 ComfyUI 环境下运行,也可接入用户自己的 FLUX 3、GPT Image、Nano Banana 等 API key 调用。
Reddit · r/MachineLearningAI 评分2121 ZhemaIsmayil 曾用神经网络为每个字体生成嵌入向量并以 tSNE 可视化,意外得到花朵状结构
一名开发者用预训练神经网络为每个字体的字符生成嵌入向量,再用 tSNE 把降维后的嵌入映射为 XYZ 和 RGB 通道并以点云可视化,使视觉相近的字体在位置和颜色上自然聚集。在 Google Fonts 语料上,该可视化呈现出花朵形状,大多数手写体字体集中于花蕊区域。作者另在其字体检索网站上提供了基于全部可搜索字体的类似可视化。
Reddit · r/ChatGPTAI 评分1212 独立开发者一日耗尽 ChatGPT 20x 额度,仅为统一游戏村庄画风
Reddit 用户 AC-Daniel 在开发独立游戏时,为让村庄建筑匹配世界地图的"墨水羊皮纸"风格,在一天内对 ChatGPT 发起了 57 次生成请求,耗尽其 20x 订阅额度的全部 token。该用户最终成功统一了画风并"解决了住房问题"。
TechCrunch · AIAI 评分5050 OpenAI 在 ChatGPT 图片生成结果旁推出可视化广告
OpenAI 在 ChatGPT 的广告产品线中加入可视化展示广告,将与用户生成的图片一同呈现,月底先在美国上线,面向首批测试广告主,并明确标注且不影响回答内容。
NVIDIA BlogAI 评分1818 NVIDIA Inception 成员企业用 AI 缩小乳腺癌诊疗断层:从筛查到治疗方案
NVIDIA Inception 计划的多家初创公司正用 AI 工具覆盖乳腺癌诊疗的关键缺口:iSono Health 的 ATUSA 系统在约两分钟内完成单侧乳腺 3D 定量超声扫描。
Reddit · r/artificialAI 评分1717 用户抱怨 Grok NSFW 故事和图像功能不如 DeepSeek Pro 等竞品
一位 Reddit 用户表示 Grok NSFW 故事模式远比 DeepSeek Pro 弱,且价格更高、速度更慢;Grok 图像功能不支持任何 NSFW,内容质量也明显不如 ChatGPT Image 2、Seedance2、Seedream 和 Minimax H3。该用户表示将不再续订 Grok 订阅。
Hacker News · 首页AI 评分2828 用 Claude 自动化 35mm 胶片扫描流水线:从驱动扫描仪到负片转正、去尘与编辑
摄影爱好者 Shan 用 Claude 接管了 35mm 胶片扫描流水线:先用 SANE 驱动扫描仪因方向反转险些损坏机械,改为在 VueScan 扫描后交接给 Claude 处理后续环节。Claude 通过 numpy 做负片密度反转并以片卷空白段为基准统一色彩,再用图像分析定位灰尘、用 LaMa 模型填补并从邻近颗粒补回细节,使原本每卷 36 张需约 4 小时的流程被自动化。
Reddit · r/ChatGPTAI 评分3333 Oscilloscope Diffusion 发布:用扩散模型重新诠释视频纹理与视觉语言
Oscilloscope Diffusion 是一种通过扩散模型干预现有视频的新方法,可将抽象几何结构转化为折纸、建筑、文艺复兴绘画等不同风格。项目基于 TouchDesigner 音频响应几何系统开发,已更新至 v1.2 版本。用户可选择视频来源、描述处理方式并通过提示词、LoRAs 和可编辑时间线控制结果。目前在 Uisato Studio 可用,即将开源。
Hacker News · 最佳AI 评分7474 BFL 发布 FLUX 3 Image 图像生成模型,支持 bounding box 控制构图
BFL(Black Forest Labs)发布 FLUX 3 Image 图像生成模型。该模型支持通过 bounding box(边界框)控制图像中每个元素的位置和布局,用户可以用坐标精确指定每个元素的位置,也可以用纯提示词生成图像。
Latent SpaceAI 评分7272 AMD 以 82 亿美元收购 World Labs,Atlas 模型解决空间智能稀疏重建难题
AMD 以 82 亿美元收购 World Labs。World Labs 近期发布了 Atlas,这是首个全能模型架构,能够从 2D 图像预测新视角,解决了计算机视觉中长期存在的稀疏重建问题,将生成模型与多视角几何相结合,其性能超越现有专业模型。
AWS Machine Learning BlogAI 评分4848 如何在 SageMaker AI 上用 vLLM-Omni 生成图像和视频(下篇)
在 Amazon SageMaker AI 上使用 vLLM-Omni 容器部署两个端点,通过文本提示词生成静态图像(FLUX.2-klein-4B 实时端点),再将该图像作为条件输入生成视频(Wan2.1-VACE-1.3B 异步端点)。图像直接返回,视频生成完成后从 Amazon S3 检索 MP4 文件,示例包含命令行工作流和 Streamlit 界面。
Product Hunt · AI 分类AI 评分1313 Ari Helper 7 上线,新增 Photo Studio、Film Studio 与 OpenAI 兼容私有服务器
Ari Helper 7 是面向 iPhone、iPad、Mac 和 Apple Watch 的私有 AI 助手,本次更新新增 Photo Studio(修复、降噪、上色、4x 放大,支持端侧及相册内运行)、Film Studio(逐镜头影片与视频修复)、可提问的实时摄像头、端侧图像生成,以及用户自建的 OpenAI 兼容服务器。
Product Hunt · DesignAI 评分6262 谷歌发布图像生成模型 Nano Banana 2
谷歌推出最新图像生成模型 Nano Banana 2,主打更强的世界知识、生产可用规格和主体一致性,并保持 Flash 速度。该产品于 2026 年 2 月 27 日上线 Product Hunt,归类为 AI 生成媒体与基础模型。
Replicate Blog精选AI 评分7676 如何提示 Seedream 5.0
Replicate 团队测试了字节跳动的 Seedream 5.0 图像生成模型,总结了多项关键能力:基于示例的编辑可通过提供前后对比图让模型学习并迁移视觉变换;可理解物理机械结构并生成正确细节;支持多步骤推理和多图像输入;精确遵循复杂指令;具备专业领域知识如建筑可视化、科学插图、营养标注;文本渲染准确且支持多语言;支持批量生成风格一致的多张图像。
推荐理由:原文通过多个实际案例展示了 Seedream 5.0 的核心能力,读者可据此了解模型的实际表现并迁移到自己的使用场景。
Replicate BlogAI 评分7474 Recraft V4:具有设计感的图像生成模型
Recraft 发布 V4 图像生成模型,强调“设计感”——模型在构图、光照、色彩上做出有意的视觉决策。提供四个版本:Raster(WebP)约1024px/10秒/$0.04、Pro Raster约2048px/28秒/$0.25、SVG标准版15秒/$0.08、Pro SVG高清版30秒/$0.30。
Berkeley AI ResearchAI 评分4343 信息驱动的成像系统设计
研究团队开发了一个基于互信息的成像系统直接评估与优化框架,可在不依赖具体任务解码器的情况下量化测量区分物体的信息量。该框架在彩色摄影、射电天文学、无透镜成像和显微镜四个领域验证,信息估计可准确预测下游任务性能。优化该信息指标可产生与端到端神经网络方法相当的设计结果,同时显著降低内存和计算需求。
Replicate BlogAI 评分7272 Black Forest Labs 发布 FLUX.2 图像生成模型,可在 Replicate 运行
Black Forest Labs 发布 FLUX.2 图像生成模型,包含 pro、flex、dev 三种变体。FLUX.2 在图像质量、编辑能力和企业级效率方面有显著提升,支持多参考(最多8张图)保持角色一致性,可生成4MP分辨率的逼真细节,提升了文字渲染、提示词遵循和世界知识能力。pro 版本生成图像需6秒,dev 版本开源并经 Pruna.ai 优化加速至2.5秒。
Replicate BlogAI 评分7474 如何为 Nano Banana Pro 编写提示词
Nano Banana Pro 是一个图像生成模型,与 Gemini 3 Pro 语言模型集成,具备内置逻辑推理能力,可理解并回答图像中的文本信息,同时保持像素级文本准确性和风格灵活性。模型支持最多 14 张参考图像处理,实现跨图像的角色一致性,并可直接渲染代码。通过 Replicate API 可轻松调用该模型。
Replicate BlogAI 评分5454 Retro Diffusion 像素艺术模型上线 Replicate
Retro Diffusion 发布了一套专门用于网格对齐、限定调色板的像素艺术模型,已在 Replicate 平台上线。提供四种模型:rd-fast 侧重快速生成支持15种风格;rd-plus 提供高质量文本到图像生成;rd-tile 专注图块和图集生成;rd-animation 生成风格一致的动画精灵图。大多数模型支持任意宽高、输入图像、调色板图像、背景移除和无缝平铺。
Replicate BlogAI 评分5858 主流图像编辑模型对比评测
Replicate 对六款主流图像编辑模型进行对比评测,涵盖对象移除、视角转换、背景编辑、文字编辑和风格迁移五项任务。
Replicate BlogAI 评分3737 主流 AI 图像模型角色一致性生成能力对比评测
本文对比了 Replicate 上四款主流 AI 图像模型(gpt-image-1、Gen-4 Image、FLUX.1 Kontext、SeedEdit 3)基于单张参考图生成一致角色的能力。
Replicate BlogAI 评分4444 FLUX.1 Kontext [dev] 如何使用 TaylorSeer 优化推理速度
Replicate 详细介绍了 FLUX.1 Kontext [dev] 的 TaylorSeer 优化方法,通过缓存中间图像预测的导数并使用泰勒级数近似来加速图像生成。该方法将扩散模型的推理步骤从约 30 步减少到 10-15 步,同时保持图像质量。TaylorSeer 在生成的首尾步骤计算完整预测,中间步骤使用近似估算,平衡了速度与精度。
Replicate BlogAI 评分7070 Black Forest Labs 发布 FLUX.1 Kontext 图像编辑模型
Black Forest Labs 发布 FLUX.1 Kontext,这是一款文本驱动的图像编辑模型,在文本编辑方面优于 OpenAI 4o,且更便宜、无黄调偏差。
Replicate BlogAI 评分7171 Google Imagen 4 现已在 Replicate 开放使用
Google 最新的旗舰图像生成模型 Imagen 4 现已在 Replicate 平台开放运行,这是预览版本。该模型在精细细节渲染、风格多样性和文字渲染方面有显著提升,并内置了过滤、数据标记和 SynthID 数字水印等安全措施。Replicate 同时预告将推出 Imagen 4 Ultra 和 Veo 3,并已上线 Google 的音乐生成模型 Lyria 2。
Replicate BlogAI 评分6969 Replicate 现支持在 Hugging Face 上运行 30,000+ LoRA
Replicate 宣布其推理服务现已集成到 Hugging Face Hub,用户在 Hugging Face 上选择支持的 LoRA 并将 Replicate 设为推理提供商时。
Replicate BlogAI 评分7373 Ideogram 3.0 现已在 Replicate 上线
Ideogram 发布 3.0 版文本到图像模型,现已在 Replicate 平台上线。该模型提供 Turbo、Balanced、Quality 三个版本,分别针对快速迭代、均衡场景和最高画质需求。主要升级包括更强的图像真实感、风格控制、布局生成能力,以及更精准的排版渲染。
Replicate BlogAI 评分2323 AI 创意工具汇总:语音模型、3D 生成与 LoRA 微调
Google DeepMind 发布 ShieldGemma 2,可高精度检测 NSFW 内容和暴力元素;腾讯推出 Hunyuan3D 2Mini,用于游戏资产和风格化角色创作。
Mistral AIAI 评分5252 Mistral AI 发布全新 le Chat:上线 iOS 与 Android 并推出 Pro/Team 及企业内测
Mistral AI 发布全新 le Chat,覆盖生活与工作场景,并同步登陆 iOS 和 Android App Store / Play Store,以及 chat.mistral.ai。
Replicate BlogAI 评分3737 使用 Replicate playground 生成短视频
Replicate 发布 playground 实验性网页界面,提供类似剪贴簿的 UI 用于测试和比较不同图像/视频模型,并保留实验记录。工作流程分为三步:首先使用 flux-aesthetic-anime 等图像模型生成起始图片,然后通过 minimax/video-01-live 将图片转换为视频,最后利用 zsxkib/mmaudio 模型为视频添加匹配的音乐音效。
Replicate BlogAI 评分7373 AI 视频模型横评:Sora 后的开源浪潮与平台选择
AI 视频正迎来突破时刻。2023 年 AI 视频质量尚差,2024 年 Sora 重新定义期待,随后大量模型涌现。Minimax Video-01 质量接近 Sora 但闭源,Tencent Hunyuan Video 开源可微调,Genmo Mochi 1 已优化至单卡 4090 可运行,Lightricks LTX-Video 仅需 10 秒生成 3 秒视频。