头版Folia Daily Briefing
← 返回头版
科技人工智能

Kimi K3与DeepSeek V4在多模态技术路线上的差异

在大模型发展的竞争中,不同厂商对原生多模态能力的策略选择出现明显分化。Kimi K3采用参数2.8万亿的大模型方案,整合原生多模态、代码开发和Agent能力,支持100万token的上下文窗口,每个token激活约1040亿参数[1]。该模型在约15万亿混合图文token的联合预训练中按固定比例融合文本与视觉数据[1],曾以1679分登顶Arena Frontend Code榜单[1]。

相比之下,DeepSeek V4-Flash采取了截然不同的技术路径[1]。这款模型的总参数仅为2840亿,每个token激活130亿参数,主要通过后训练优化代码能力,暂未加入视觉模态[1]。DeepSeek创始人梁文锋曾表示:"把AI训练做好,并不需要世界模型,甚至不用多模态"[1],体现了该团队对多模态的不同认识。

与此同时,OpenAI1月企业使用报告显示图片上传在ChatGPT最常用工具中排名第三,反映出用户对多模态能力的实际需求[1]。阿里的Qwen3.8-Max总参数为2.4万亿,每个token激活950亿[1],代表了业界在大模型规模设计上的另一种思路。


原生多模态Kimi K3DeepSeek V4大模型Agent能力