DeepSeek开眼了啦!能读图的AI模型真的能一键搞定PPT和网页了吗?
能,DeepSeek新发布的V4系列首个视觉模型V4-Flash-Vision-Exp确实能读图,并已演示一键生成PPT、重做网页等Agent任务,但“一键”背后仍需结合工具链配合。
一、长眼睛了:V4-Flash-Vision-Exp上线
发布动态:2026年8月21日上线DeepSeek API,是V4系列首款原生视觉模型,支持图片与文本混合输入
能力边界:能看图表、截图、设计稿并理解其中逻辑,拍张发票、传张界面图都能读懂并执行后续操作
性能提升:多模态Agent能力大幅跃升,官方自测已接近Opus-4.8,ApexBench得分从26.2升至36.5
二、真的能一键搞定PPT和网页?
官方演示:已公开展示生成高端定制游PPT、对官网进行视觉重构、制作黏土怪物风格动态前端特效等场景
实现机制:需配合DeepSeek Harness等Agent框架,让模型“看图→理解→调用工具→执行”,并非单纯的文生图
本质变化:从“告诉你图是什么”升级为“看懂图并替你把后面的事办完”
三、价格与开放性成为杀手锏
成本极低:图片按token计费,单张封顶384 tokens,价格与V4 Flash纯文本版持平,识别一张图成本约0.001元
免费Files API:图片一次上传可重复调用,方便开发者批量处理
开源加持:8月31日权重以MIT License在Hugging Face开源,开发者可自行部署、修改和二次开发 (以上内容均由AI生成)