DeepSeek 发布多模态模型,“小鲸鱼”长出了眼睛
DeepSeek于近日在API平台上线实验性多模态模型deepseek-v4-flash-vision-exp,首次通过官方接口开放视觉输入能力。该模型支持Chat Completions、Messages、Responses三种调用格式,可处理图文混合输入,图片按token计费,单张最多384 tokens,价格与V4-Flash一致,并支持base64、外部URL及Files API三种图片传入方式。此前V4系列以文本推理、代码生成和Agent能力见长,4月发布的V4-Flash采用混合专家架构,总参数2840亿,每Token激活约130亿参数,默认支持100万Token上下文。7月底的V4-Flash-0731强化了工具调用能力。新版Vision-Exp在七项基准测试中六项发生变化,其中五项提升,Toolathlon提升5.6分、DeepSWE提升4.9分,Cybergym下降1.4分。与Opus 4.8相比,该模型在多数文本Agent测试中稍弱,但DeepSWE得分59.3反超对手,Toolathlon仅低0.3分。目前该模型仍标注为实验性质。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
