纯文本模型也能看图,ModLens 插件给 DeepSeek Harness 外挂一双眼睛
很多跑 AI 编程工具的人都撞过一堵墙:手里的模型很能写代码,但发截图给它,它说看不了。DeepSeek 的旗舰对话模型和 GLM 的一些主力型号都是纯文本模型,天生没有视觉能力。ModLens 就是补这块短板的:一个开源视觉插件,开发者 Leon Liu(liustack)出品,npm 包 @liustack/modlens,当前版本 3.26.1,在 SkillHub 技能社区插件板块的模型推理分类里是高星热门(近 4000 星)。它的思路很直接——你把图片直接粘贴进对话,插件调用外挂视觉引擎把图转成结构化描述,再交回模型作答,纯文本模型就有了「眼睛」。
它能做什么
- 直接粘贴:截图往聊天框里一贴就行,不用先存成文件再传路径,和平时发图一样自然。
- 给证据不给想象:返回的是结构化内容——完整文字转写、按阅读顺序排好的版面区域、实体和关系列表,模型引用具体细节作答,不是凭空脑补。
- 十路视觉来源:六个内置引擎可选——免费 Gemini API、任意 OpenAI 兼容接口、Anthropic 接口、免密钥的 Antigravity CLI、已登录的 Claude Code 和 Kimi CLI;另外还能复用机器上已有的四个智能体 CLI 登录态。
- 故障转移链:不绑定单一服务,快的 API 引擎先上、CLI 兜底,每次尝试都有记录,切换从不静默。
- 多密钥轮换:API Key 支持逗号分隔写多个,遇到认证失败、限流或配额用尽自动换下一个。
- 轻侵入:不装钩子、不包一层、不起本地代理,不改宿主任何一行配置;卸载就是删一个目录,立刻回到原样。
- 一套多处用:不止 DeepSeek Harness,在 Claude Code、Codex、OpenCode、Pi 等环境里也能以技能形式安装同一套能力。
怎么获取
三个官方渠道:GitHub 上 liustack 的 modlens 官方仓库;npm 官方源 @liustack/modlens 包;SkillHub 技能社区插件板块。在 DeepSeek Harness 里一条命令安装:npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens;其他环境可通过 skills.sh 技能目录安装,装完重启让 AI 跑一次健康检查即可。具体命令以官方安装文档为准。
上手怎么用
- 零配置起步:装好后先跑健康检查,机器上已有任一多模态模型登录态就能直接复用;全是空的就去申请一个免费 Gemini API Key,单次读图 5 到 10 秒。
- 挑视觉条目贴图:模型选择器里选带 (modlens vision) 标记的条目再贴图,缩略图会保留在消息里,体验接近原生。
- 接国产视觉模型:任意 OpenAI 兼容接口都能接——通义千问视觉版、GLM 开放平台、自建的 vLLM 或 Ollama 都行,三个配置项就搞定。
- 粘一次多问:同一张图后续追问不需要重新粘贴,追问成本很低。
- 拿硬图测试极限:官方演示里有读 128 个模型对比散点图的案例——坐标轴、对数刻度、高亮区域全部读出,可以拿类似密度的图表试试自家模型。
适合谁用
用 DeepSeek、GLM 等纯文本模型又需要看图的开发者;经常拿截图排障的运维和 IT 支持人员;想给智能体补上视觉能力的自动化玩家。对做远程运维的团队尤其实用:客户发来报错截图,AI 先读图定位故障点,再决定怎么处理,比电话里「你看看报错写的啥」高效得多。