多模态ai

科技人工智能

DeepSeek发布V4.1 Flash模型,推进KV缓存压缩技术

DeepSeek推出了V4.1 Flash模型,这是一个拥有552B参数的多模态混合专家模型,能够支持高达1百万tokens的上下文长度。该模型采用Causal Encoder-Decoder架构、CSA2压缩机制和FP4量化等技术手段,在KV缓存存储方面取得显著进展。

科技人工智能

Atlas:用于空间智能的世界模型

World Labs公司推出了名为Atlas的新一代世界模型,这是一个多模态自回归扩散变换器,能够原生处理文本、图像、视频和3D数据 。该模型可执行包括相机控制生成、空间重建、时空模拟和图像生成等多项任务 。

科技人工智能

Gemini Omni 1.1 Flash 发布:带来全新视频生成控制功能

Google 发布了 Gemini Omni 1.1 Flash 更新,为开发者提供生成式视频的新控制功能,该模型已通过 Gemini API 在 Google AI Studio 上线,面向专业创作与部署场景 。在上下文理解方面,新模型可分析最多 10 秒的先前上下文,较此前仅参考最后 1 秒的模型有显著提升 。

科技人工智能

DeepSeek 发布多模态视觉模型 deepseek-v4-flash-vision-exp

DeepSeek 推出新型多模态视觉理解模型 deepseek-v4-flash-vision-exp,已在 DeepSeek API 平台上线。该模型支持图像和文本的多模态输入,可处理 JPEG、PNG、GIF 和 WebP 格式的图像。用户可通过设置 `model='deepseek-v4-flash-visio…