跳到主要内容
AI教程

Codex 配置 Deepseek 实现识别图像

Agent · AI 工具实战Codex 配置 Deepseek,装上这个Skill,deepseek也能识图啦让纯文本模型拥有“眼睛”,效率再上一个档次🏆 本文由 AI 方格式 创作上一篇文章介绍了 。现在因各种原因无法使用 Codex家的模型的朋友,也可以用上 Codex 了。1Deepseek 很给力,但有个缺陷这次 Deepseek 很给力啊,价格便宜,加上这次 V4-Flash 正式版发布,性能又是一大提升。而且 据Open…

Codex 配置 Deepseek 实现识别图像

1 Deepseek 很给力,但有个缺陷

这次 Deepseek 很给力啊,价格便宜,加上这次 V4-Flash 正式版发布,性能又是一大提升。而且 据OpenCode 团队披露,Deepseek V4-Flash 在它这个平台单日 Token 消耗达到了8 万亿,创单日历史纪录。

但它有一个唯一的缺陷:它是一个纯文本的模型,不能识图。

但是对于编程开发、Bug 修改、UI 识别等情况下,识图就很重要了。毕竟在这些场景下通过纯文字描述去处理不是很方便,如果能直接通过截图,它能理解的话,那就方便快捷,效率能提升不少。

2 开源识图 Skill:Claude Vision

这里就介绍一个开源的识图 Skill——claude-vision-skill。不要看它本身是给 Claude 使用的,没关系,它可以安装到任何 Agent,Agent 会自动去适配。

https://github.com/asuojun/claude-vision-skill

— Skill 仓库页面

这个 Skill 主要是让没有识图能力的模型获得识图能力。

原理:通过把图片发给有识图能力的模型,然后用文字描述返回,接着 Deepseek 获取这个文字描述进行处理,所以需要配置一个识图的模型。

内置推荐千问(qwen3.5-omni-plus、qwen-vl-max):阿里云百炼,因为新用户 100 万 Token 免费,约 0.02 元/次。

— 内置推荐千问模型

也可以用其他支持 OpenAI 兼容格式的识图模型。

3 如何安装与配置

如何安装?这个很简单,直接把仓库地址丢给 Codex就可以,它会帮你进行安装配置。

— 将仓库地址交给 Codex 自动安装

默认用的是阿里千问的识图模型(qwen3.5-omni-plus),新用户 100 万 Token,差不多可以用7000 次左右的识图。

获取阿里千问 API Key,进入阿里千问工作台,创建 API Key,复制输入即可。

https://platform.qianwenai.com/home/api-keys

— 阿里千问工作台创建 API Key

4 安装成功,实测效果

安装成功之后,就可以直接使用了。

— 安装成功即可使用

测试一下,我现在让它识别一下这张图里的内容。

— 测试识别的图片

效果如下,识别的内容完全对得上。

— 识别结果完全匹配

这下就给 Deepseek 装上了“眼睛”,让它也有了识图能力,效率又提升了一个档次。

总结

通过开源 Skill 给 Deepseek 补上识图能力,成本极低、效果立竿见影。从此编程、调试、UI 识别都能直接上图说话,让纯文本模型真正“看见”世界。

#AI写作#AI办公#AI编程#AI设计#开发平台#开源#效率工具#智能体