Google DeepMind·· 2026-09-02精选AI 评分74
Google DeepMind 推出 Gemini 智能体视频理解功能
Introducing agentic video understanding with Gemini
AI 导读
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解功能,该功能将模型核心推理与原生视频工具结合,动态搜索和检查目标视频片段,相比静态处理可降低最多 88% 的 token 消耗和 66% 的成本,同时提升最多 7% 的准确率。
推荐理由
原文给出了 token 消耗降低 88%、成本降低 66%、质量提升 7% 的具体数据,读者可以据此评估该功能对自身工作流的效率提升。
来源:Google DeepMind · deepmind.google
最近 7 天的更新
- OpenAI 向 ChatGPT 免费和 Go 用户推送 GPT-6 Luna,付费用户切换至 GPT-6 Sol量子位 QbitAI·
- Mistral 发布 Mistral Large 4 公开预览,权重将于月底开源Hacker News · 首页·
- Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型Mistral AI·
- Aleph Alpha 发布 Kolibri 主权开放权重模型Hacker News · 首页·
- Singularity:原子化 ticket 驱动的 AI 编码工具Product Hunt · AI 分类·
- eu/jev 发布欧盟版 System One 模型Product Hunt · AI 分类·
- Allen AI 开源 AstaBrief 8B 科学报告生成模型Hugging Face Blog·
- Audionaut 发布:开源多轨音频编辑器,支持 MCP 可被 AI 代理驱动Hacker News · 首页·
相关工具
- Google DeepMind 发布 AlphaGenome Atlas:覆盖人类基因组全部 90 亿单碱基变异的预测图谱82
- Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash81
- Mistral AI 发布 Voxtral TTS 文本转语音模型79
- Google DeepMind 发布 Gemini 3.8 Text-to-Speech78
- Google DeepMind 发布 WeatherNext 3:迄今最先进、最准确的全球天气 AI 模型78
- Mistral 推出 OCR 4:支持 170 种语言的文档解析模型78
- Google DeepMind 发布 Gemini 3.5 Live Translate,实现 70+ 语言实时语音翻译78
- Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber77