工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

liustack/modlens

3,616本周 +809TypeScript

给DeepSeek这类只能读文字的AI装上一双眼睛:粘贴图片就能把内容变成结构化文字数据

ModLens是一个插件,让DeepSeek、GLM等只能处理文字的对话模型也能理解图片。用户把图片粘贴进去后,插件会调用一个视觉引擎对图片进行分析,把结果转换成包含文字转录、版面布局、实体信息的结构化JSON数据交给模型,模型据此作答。安装非常轻量,只需一个插件或一个技能文件夹,还能复用用户已经登录的其他工具账号,而不必额外购买视觉API。

它做什么

  1. 做了什么:DeepSeek、GLM等纯文本模型本身无法读图,ModLens会拦截粘贴进来的图片,交给视觉引擎处理,再把结果以结构化JSON形式(完整文字转录、按阅读顺序排列的版面区域、实体与关系列表)返回给模型,而不是直接把像素图片丢给它。
  2. 怎么做的:一共支持十种视觉来源,包括六个内置提供方(Gemini API、任意OpenAI兼容接口、Anthropic、免费的Antigravity CLI、Claude Code、Kimi Code),以及复用用户本机已登录的另外四个智能体CLI(Codex、OpenCode、Pi、Grok)账号;这些来源串成一条失败自动切换的链条,一个不行就自动试下一个,每次尝试都记录在meta.attempts里。
  3. 安装极其轻量:在DeepSeek Harness上一条命令行即可装好插件,在Claude Code、Codex、OpenCode、Pi等其他工具上只需添加一个技能文件夹,不改动任何现有配置,卸载也只是删掉那个文件夹。
  4. 效果展示:在纯文本DeepSeek-V4-Flash模型上做的演示中,插件准确读出了一张推文截图里的具体互动数据(540万浏览、1600条回复、5700次转发、11.6万点赞),还完整解析了一张比较128个AI模型的密集散点图,包括坐标轴、对数刻度和高亮区域。
  5. 速度和成本因来源而异:内置API提供方通常5到10秒内返回结果,复用的智能体CLI则需要15到45秒;推荐的免费入门方式是申请一个Gemini API密钥。

为什么重要

很多常用的编程或聊天AI模型只能处理文字,粘贴截图、图表或界面设计图原本什么也得不到有用的回答。这个插件不需要更换模型或重建现有的智能体工作流就解决了这个短板,3616个星标的关注度也说明市场对廉价、即插即用的视觉能力确实有需求。

本仓库术语

  • 视觉引擎 · 真正能够分析和理解图片内容的AI服务或模型
  • OCR · 光学字符识别,从图片中提取文字
  • 失败自动切换链 · 一个来源失败后自动尝试下一个备用来源的顺序机制
  • OpenAI兼容接口 · 遵循OpenAI请求格式的API服务器,原本为OpenAI打造的工具可以直接对接
  • 技能/插件文件夹 · 不改动原有配置、独立添加新功能给AI智能体工具的一组文件

仓库简介(英文)

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。

在 GitHub 打开

热门仓库

全部仓库 →

METAL LAB 最新报道