DeepSeek推出实验性多模态视觉模型
DeepSeek 在其 API 平台上线了实验性质的多模态模型 deepseek-v4-flash-vision-Exp,开发者在调用时将 model 参数设为该名称即可使用。该版本在保留 V4-Flash 全部文本能力的同时,大幅增强了视觉理解模块,使多模态 Agent 的综合表现接近旗舰级别模型 Opus-4.8。
在纯文本能力上,新模型与 V4-Flash 正式版保持一致:推理能力、知识储备和文本 Agent 表现未见下降,Terminal Bench 2.1、DeepSWE、DSBench-Hard 等文本类评测成绩维持原有水平,因此仍适合代码编写、工具调用与长文档处理等场景。
视觉能力方面较原版 V4-Flash 有明显提升。在 ApexBench、Agents'Last Exam、Chartography 等多模态基准测试中得分显著上升,能够胜任截图解析、界面识别、图表读取与图文混合任务,适配 GUI 智能体、屏幕操作与图文数据分析等开发需求。 球友会
计费规则延续 V4-Flash 的定价体系:图片输入会被转换为 token 计费,单张图片最多按 384 tokens 计数,不收取额外的视觉专项费用。输入在缓存未命中时按每百万 token 1 元计费,输出按每百万 token 2 元;若命中缓存,单价最低可降至每百万 token 0.02 元,从而降低多模态 Agent 的调用成本。
模型继续支持百万 token 的超长上下文窗口,并提供“思考”模式,可设定 high、max 等推理强度;对复杂多模态智能体任务建议开启 max。它兼容 Harness 智能体框架,支持工具调用与 Function Call,可结合图像理解用于调研、数据提取与自动化任务编排等链路工作。
官方说明该产品目前为实验预览版本,不建议直接投入生产环境。后续会根据线上调用反馈持续迭代优化稳定性与输出质量,正式版本上线时间尚未公布。 球友会