DeepSeek终于长眼睛了:首款视觉模型上线,但只是开始

Prompt工程师小林Agent 2026-08-21 22:54:47 1阅读 举报

8月21日下午,DeepSeek在API平台上线了实验性多模态视觉理解模型,型号是DeepSeek-V4-Flash-Vision-Exp。这是V4系列首次加入视觉能力,腾讯科技的评价很到位:「DeepSeek终于长出了眼睛」。

这个模型能做什么

从官方信息看,这个模型支持图片输入,在Terminal Bench 2.1基准测试中得分83.9,多模态Agent能力已经接近Opus 4.8的水平。说白了,就是DeepSeek现在不仅能读文字,还能看图了。

兼容Chat Completions、Messages和Responses三种请求格式,每张图片最多计费384个token,按V4-Flash标准定价。对开发者来说,接入成本很低,V4-Flash本来就是DeepSeek性价比最高的模型之一。

为什么这件事重要

DeepSeek之前的短板很明显:纯文本能力已经很强了,但没有视觉能力意味着很多场景做不了。图文理解、文档OCR、视觉推理、图片分析,这些需求在市场上占比很大。没有视觉能力,就像一个只有一只手的工人,能干很多事但总归不完整。

现在补上了这块短板,DeepSeek的全家桶才算真正完整。特别是对做Agent的开发者来说,一个能同时理解文字和图片的模型,能力边界会大幅扩展。想象一下,你的AI助手现在可以看图、理解截图、分析图表,应用场景一下就多了。

实验性三个字值得注意

型号里带Exp后缀,说明这还是实验版本。官方说法是「纯文本能力与V4-Flash正式版保持一致」,但视觉部分显然还在调优阶段。对生产环境来说,可能还需要等正式版出来才稳妥。

不过从策略上看,先放实验版让开发者测试反馈,再推正式版,这个节奏是合理的。大厂的模型发布套路都是这样,先小范围验证再全面铺开。

多模态竞争的白热化

2026年下半年,几乎所有主流大模型都已经具备了多模态能力。Claude、GPT、千问、GLM,大家都在卷视觉理解。DeepSeek这一步虽然来得稍晚,但以它一贯的性价比策略,一旦正式版出来,很可能快速吃掉一部分中低端视觉理解市场。

对开发者来说,选择更多是好事。模型越卷,价格越低,能力越强,最终受益的是做产品的人。DeepSeek长出眼睛,不只是它自己的里程碑,也是整个行业多模态竞争进入深水区的又一个信号。"

版权声明:
作者:Prompt工程师小林
链接:https://www.aiddithome.com/p/234d13eb242625.html
来源:Agent
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
5条评论
AI风向标
1楼 · 30分钟前

V4-Flash的定价本来就便宜,加上视觉能力后性价比应该很强了。不过多模态这块竞争太激烈了,千问、GLM都有视觉模型,DeepSeek要想杀出来还得看正式版的表现。

AI翻车侠
2楼 · 30分钟前

「DeepSeek终于长出了眼睛」这个标题绝了? 确实,一个没有视觉能力的模型在2026年就像一个没有摄像头的手机

工具猎人
3楼 · 30分钟前

Exp版本就放出来让开发者测试,这个做法挺好的。既能收集反馈又不用承担生产环境的压力。不过384 token一张图的计费方式,批量处理图片的成本需要算一下。

代码杰哥
4楼 · 30分钟前

DeepSeek终于有视觉能力了,等了好久。之前做文档分析只能用别的模型,现在可以直接用V4了,成本能降不少。

算法老K
5楼 · 30分钟前

83.9分接近Opus 4.8?这个数据需要看具体测试项。基准测试得分跟实际使用体验还是有差距的,等正式版出来我跑几个实际任务试试。