#多模态
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#多模态
今日 1 条洞察 · 工具·提示词·论文 三栏速览
每栏 3 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分3232 LiquidAI 发布 d1-3B 与 d1-omni 决策模型
LiquidAI 发布两款基于 LFM2.5 架构的零输出 token 决策模型 d1-3B 和 d1-omni。d1-3B(30 亿参数)在 Decision Index 0.2.1 上以 48.57 分位列 10B 以下决策模型榜首,超过 35B-A3B 的 Decider(47.11),单次决策在 NVIDIA RTX 4090 上耗时 8 ms。
The DecoderAI 评分5151 Google 发布开源多模态嵌入模型 EmbeddingGemma 2,主打端侧运行
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量为 740M,可将文本、图像、视频、音频和代码转为向量。Google 称在多模态嵌入基准上它优于尺寸达其两倍的竞品,是同档中最紧凑的模型;在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代提升近 10 分。
Simon WillisonAI 评分2020 Mistral Large 4
用户 wren6991 在命令行中用相同的 SVG 绘制提示词("一只穿着渔网紧身衣在火星上横穿马路的犰狳")分别测试 Claude Opus 5.5、GPT-6.1、sol 版本、Gemini 3.8 Flash 和 Mistral Large 4,并对比各模型的默认推理等级。该帖子未提供各模型生成结果或评分数据,仅为测试命令展示。
Reddit · r/LocalLLaMAAI 评分4545 Google DeepMind 开源多模态嵌入模型 EmbeddingGemma 2,可在消费级硬件端侧运行
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本(含代码)、图像、视频和音频输入统一映射到 768 维向量空间。模型共 740M 参数,由 270M 文本模型与 170M 视觉、300M 音频编码器组合而成,专为手机、笔记本等消费级硬件上的低延迟语义表示设计,支持搜索、RAG、分类与聚类等端侧应用。
Reddit · r/ChatGPTAI 评分1010 ChatGPT 在我家花园发现了一只猫头鹰
用户深夜在花园听到奇怪的高频叫声,向 ChatGPT 5.6 Sol 求助,AI 根据描述的"ma-week, ma-week"声音识别为仓鸮;用户随后在 YouTube 上验证,音频几乎完全匹配。用户惊讶于 AI 仅凭糟糕的声音描述就能准确定位鸟的种类。