DeepSeek Harness 插件

dsh-image-mmx

让文本模型(如 DeepSeek)在 DSH 里直接收发图片:图片落盘工作区、模型可见面自动替换为 mmx(MiniMax VLM)识别结果,用户侧照常显示缩略图。(英文原文)

跳到安装方式

来源信息

GitHub 仓库
fengs2021/dsh-image-mmx
最近更新
2026年8月17日
分类
模型与服务商
GitHub stars
1
载体类型
plugin
目录证据
上游声明已找到 dsh.bundle
证据路径
package.json#dsh.bundle
核对版本
0.1.0-rc.8
上游核对日期
2026-08-20

该证据由上游目录提供。本站没有安装、运行或安全审核这个插件。

安装

默认先复制一段 Prompt,让 Agent 读 GitHub 仓库和源码;需要自己装时再切到命令。

复制这段 Prompt,发给 DSH、Codex 或其他 Agent,让它先读 GitHub 仓库和源码。

请先不要安装或执行任何命令。阅读这个插件的 GitHub 仓库、README 和关键源码,然后用清楚、直接的方式回答以下问题,帮助我判断它是否适合我的需求:

1. 这个插件是什么,解决什么问题;
2. 适合哪些用户和典型使用场景;
3. 安装后如何使用,并给出一个最小使用示例;
4. 有哪些已知限制,以及隐私、安全、兼容性或维护风险;
5. 给出“推荐 / 有条件推荐 / 不推荐”的明确建议和理由。

请区分仓库明确说明、根据源码推断和未知信息。证据不足时请明确说明,不要猜测或照抄 README。

GitHub:https://github.com/fengs2021/dsh-image-mmx
插件名:dsh-image-mmx
作者:fengs2021

检查来源文件

安装前先看这个插件目录里的 README 和其他文件。

文件资源管理器3 个文件
README.md来源说明 · 只读预览

dsh-image-mmx

给 DeepSeek Harness 的文本模型装一双眼睛:会话里粘贴/发送图片,自动调用 mmx(MiniMax VLM) 识别,识别结果注入模型上下文——DeepSeek 等纯文本模型也能理解图片内容。

能力

  • 图片收发:文本模型(inputModalities 无 image)也能发送含图消息,不再报「当前模型不支持图片」
  • 自动识别:图片落盘到会话工作区 .attachments/,自动执行 mmx vision describe(MiniMax VLM)
  • 模型可见替换:图片块在模型可见面替换为 [图片N]:"<路径>" + mmx 识别文本(画面元素、布局、报错/代码/界面文字逐字保留)
  • 用户侧不变:人类 transcript 照常渲染原图缩略图(可点击放大)
  • 优雅降级:mmx 未安装/未认证/超时(60s)/格式不支持(gif)时降级为路径文本
  • 原生模型免打扰:本身支持图片输入的模型走原生路径,不做任何处理

配套插件:dsh-file-bridge(📎 附件按钮上传 + send_files 文件下发 + explorer 跳转)。

依赖

本机已安装并认证 mmx-cli(MiniMax 官方 CLI):

npm install -g mmx-cli
mmx auth login --api-key sk-xxxxx   # 或 OAuth
mmx vision describe --image test.png   # 验证可用

安装

前置:DeepSeek Harness 0.1.0-rc.6+、Node.js 18+。

dsh plugin --profile web add 'github:fengs2021/dsh-image-mmx'
systemctl restart dsh-web

使用

1. 在 DSH Web 输入框粘贴/拖入图片(或配合 dsh-file-bridge 的 📎 附件按钮选图) 2. 发送后插件自动:落盘 → mmx 识别 → 模型直接读到识别结果并回复 3. 多图支持:每张图独立并行识别,按 [图片1] [图片2]... 编号

实现

基于 dsh-image-bridge(MIT)机制改造:

1. 包装 llm.resolveModelInfo 为文本模型补 image 模态(放行 api-proxy 预检) 2. agent/pre-step:图片落盘 + 并行调用 mmx vision describe 3. agent/request-error:surface replace 把图片块换成识别文本,retry 重发

License

MIT