deepseek-vision
MCP server that gives text-only LLMs vision capabilities by using a free multimodal model to perceive images, audio, and video, returning text for the main model to reason with.
README
DeepSeek Vision MCP Server
给纯文本主模型做"眼睛"——用免费的 MiMo-V2.5 Free 感知图片/音频/视频,推理由你自己的主模型完成。
What it does
当你的 agent 客户端使用纯文本模型(如 DeepSeek、自定义 baseURL 的模型)时,本 MCP 提供多模态感知能力:
用户发送图片/音频/视频 → MCP 用 mimo-v2.5-free 感知 → 返回文本 → 你的主模型推理回答
不需要切换模型,不需要额外 API,只需要你的 opencode zen API key(免费)。
Prerequisites
- Node.js >= 18(下载:https://nodejs.org)
- opencode zen API key(获取:https://opencode.ai/auth,免费,无需绑定支付方式)
Installation
VS Code
编辑全局 MCP 配置文件 C:\Users\<你的用户名>\AppData\Roaming\Code\User\mcp.json:
{
"servers": {
"deepseek-vision": {
"type": "stdio",
"command": "npx",
"args": ["-y", "deepseek-vision"],
"env": {
"OPENCODE_API_KEY": "sk-你的zen-key"
}
}
}
}
打开方式:
Ctrl+Shift+P→ 输入MCP: Open User Configuration也可以在项目根目录创建
.vscode/mcp.json,内容相同。
或者使用项目级配置,在项目根目录创建 .vscode/mcp.json:
{
"servers": {
"deepseek-vision": {
"type": "stdio",
"command": "npx",
"args": ["-y", "deepseek-vision"],
"env": {
"OPENCODE_API_KEY": "sk-你的zen-key"
}
}
}
}
重启 VS Code。
Cursor
编辑全局 MCP 配置文件 C:\Users\<你的用户名>\.cursor\mcp.json:
{
"mcpServers": {
"deepseek-vision": {
"command": "npx",
"args": ["-y", "deepseek-vision"],
"env": {
"OPENCODE_API_KEY": "sk-你的zen-key"
}
}
}
}
打开方式:
Ctrl+Shift+P→ 输入Cursor: Open Global MCP也可以在项目根目录创建
.cursor/mcp.json,内容相同。
重启 Cursor。
Claude Code
运行以下命令注册 MCP server:
claude mcp add deepseek-vision -- npx -y deepseek-vision
然后在终端中设置环境变量(每次新开终端都需要执行):
set OPENCODE_API_KEY=sk-你的zen-key
或者创建项目根目录 .mcp.json 文件:
{
"mcpServers": {
"deepseek-vision": {
"command": "npx",
"args": ["-y", "deepseek-vision"],
"env": {
"OPENCODE_API_KEY": "sk-你的zen-key"
}
}
}
}
重启 Claude Code。
opencode
编辑全局配置文件 ~/.config/opencode/opencode.json:
{
"mcp": {
"deepseek-vision": {
"type": "local",
"command": ["npx", "-y", "deepseek-vision"],
"enabled": true,
"environment": {
"OPENCODE_API_KEY": "sk-你的zen-key"
}
}
}
}
也可以在项目根目录创建
opencode.json,内容相同。
重启 opencode。
Codex CLI
Codex 使用 TOML 格式配置。编辑 ~/.codex/config.toml(CLI 和 IDE 扩展共享):
[mcp_servers.deepseek-vision]
command = "npx"
args = ["-y", "deepseek-vision"]
env = { OPENCODE_API_KEY = "sk-你的zen-key" }
或者通过 Codex CLI 添加:
codex mcp add deepseek-vision -- npx -y deepseek-vision
然后设置环境变量:
set OPENCODE_API_KEY=sk-你的zen-key
Windsurf
编辑项目根目录 .windsurf/mcp_config.json:
{
"mcpServers": {
"deepseek-vision": {
"command": "npx",
"args": ["-y", "deepseek-vision"],
"env": {
"OPENCODE_API_KEY": "sk-你的zen-key"
}
}
}
}
重启 Windsurf。
Trae
编辑项目根目录 .trae/mcp.json:
{
"mcpServers": {
"deepseek-vision": {
"command": "npx",
"args": ["-y", "deepseek-vision"],
"env": {
"OPENCODE_API_KEY": "sk-你的zen-key"
}
}
}
}
重启 Trae。
Zed
编辑 ~/.config/zed/settings.json,在 context_servers 中添加:
{
"context_servers": {
"deepseek-vision": {
"command": "npx",
"args": ["-y", "deepseek-vision"],
"env": {
"OPENCODE_API_KEY": "sk-你的zen-key"
}
}
}
}
重启 Zed。
Verify
重启客户端后,对 agent 说:
调用 zen_status 检查配置
返回"API 连通正常"即安装成功。
Skill Installation(可选但推荐)
MCP 提供工具能力,Skill 告诉 agent 何时、如何调用这些工具。没有 Skill,agent 可能不知道要调用我们的工具。
opencode
# 项目级
mkdir -p .opencode/skills/deepseek-vision
cp skill/deepseek-vision/SKILL.md .opencode/skills/deepseek-vision/
# 或全局
mkdir -p ~/.config/opencode/skills/deepseek-vision
cp skill/deepseek-vision/SKILL.md ~/.config/opencode/skills/deepseek-vision/
Claude Code
# 项目级
mkdir -p .claude/skills/deepseek-vision
cp skill/deepseek-vision/SKILL.md .claude/skills/deepseek-vision/
# 或全局
mkdir -p ~/.claude/skills/deepseek-vision
cp skill/deepseek-vision/SKILL.md ~/.claude/skills/deepseek-vision/
VS Code
# 项目级
mkdir -p .vscode/skills
cp skill/vscode/deepseek-vision.skill.md .vscode/skills/
# 或全局
mkdir -p ~/.vscode/skills
cp skill/vscode/deepseek-vision.skill.md ~/.vscode/skills/
Cursor
# 项目级
mkdir -p .cursor/rules
cp skill/cursor/deepseek-vision.mdc .cursor/rules/
# 或全局
mkdir -p ~/.cursor/rules
cp skill/cursor/deepseek-vision.mdc ~/.cursor/rules/
Codex / cc-haha / Kilo / WorkBuddy
根目录的 AGENTS.md 已包含全部规则,无需额外安装。
Skill 安装后,agent 会自动发现并加载。重启客户端即可生效。
Usage
VS Code
请分析图片 D:\x\photo.png 的内容
⚠️ VS Code 用户:请提供文件路径,不要直接粘贴图片。VS Code 会把粘贴的图片作为
image_url发给模型,纯文本模型不支持这个格式。
Codex / Claude Code 桌面端
这些客户端支持直接粘贴图片,agent 会自动调用 MCP 工具处理。
所有客户端
agent 会调用 hybrid_analyze 感知媒体,然后用你的主模型推理回答。
Tools
hybrid_analyze(推荐)
万能入口:自动识别图片/音频/视频 → 感知 → 返回文本。
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
source |
string | ✅ | 文件路径、URL 或 data URI |
task |
string | 否 | 用户关注点(聚焦感知) |
hint |
string | 否 | 显式指定类型:image / audio / video |
analyze_image
图片感知:用 mimo-v2.5-free 识别/描述图片内容。
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
source |
string | ✅ | 图片本地路径、URL 或 data URI |
prompt |
string | 否 | 关注点(默认完整描述) |
detail |
string | 否 | 分辨率:auto / low / high |
transcribe_audio
音频感知:转写并理解音频内容。
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
source |
string | ✅ | 音频本地路径(mp3/wav/m4a) |
prompt |
string | 否 | 附加要求 |
analyze_video
视频感知:自动抽帧后描述内容(需 ffmpeg)。
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
source |
string | ✅ | 视频本地路径 |
prompt |
string | 否 | 关注点 |
frames |
number | 否 | 抽帧数量 1-8,默认 4 |
list_models
列出你的 opencode zen 账号可用的全部模型。
zen_status
显示配置(端点、模型、key)并做 API 连通性自检。
Configuration
在客户端配置的 env / environment 字段中设置:
| 变量 | 必填 | 默认值 | 说明 |
|---|---|---|---|
OPENCODE_API_KEY |
✅ | - | 你的 zen key |
MULTIMODAL_MODEL |
否 | mimo-v2.5-free |
感知模型 |
OPENCODE_BASE_URL |
否 | https://opencode.ai/zen/v1 |
感知端点 |
FAQ
Q: npx 报错找不到命令? A: 需要安装 Node.js >= 18。下载:https://nodejs.org
Q: 如何确认 MCP 已生效? A: 对 agent 说 "调用 zen_status 检查配置"。
Q: 我的模型是纯文本的,能用吗? A: 能。MCP 只做感知(把媒体变成文字),推理由你的主模型完成。
Q: 我想换更强的感知模型?
A: 在 env 中加 MULTIMODAL_MODEL: "模型名"。用 list_models 查看可用模型。
Q: 视频分析报错?
A: 需要安装 ffmpeg 并加入 PATH。或用 analyze_image 逐帧分析。
Q: API key 安全吗? A: key 只存在于你本地的客户端配置中,不会上传到任何地方。
License
MIT
Recommended Servers
playwright-mcp
A Model Context Protocol server that enables LLMs to interact with web pages through structured accessibility snapshots without requiring vision models or screenshots.
Magic Component Platform (MCP)
An AI-powered tool that generates modern UI components from natural language descriptions, integrating with popular IDEs to streamline UI development workflow.
Audiense Insights MCP Server
Enables interaction with Audiense Insights accounts via the Model Context Protocol, facilitating the extraction and analysis of marketing insights and audience data including demographics, behavior, and influencer engagement.
VeyraX MCP
Single MCP tool to connect all your favorite tools: Gmail, Calendar and 40 more.
graphlit-mcp-server
The Model Context Protocol (MCP) Server enables integration between MCP clients and the Graphlit service. Ingest anything from Slack to Gmail to podcast feeds, in addition to web crawling, into a Graphlit project - and then retrieve relevant contents from the MCP client.
Kagi MCP Server
An MCP server that integrates Kagi search capabilities with Claude AI, enabling Claude to perform real-time web searches when answering questions that require up-to-date information.
E2B
Using MCP to run code via e2b.
Neon Database
MCP server for interacting with Neon Management API and databases
Exa Search
A Model Context Protocol (MCP) server lets AI assistants like Claude use the Exa AI Search API for web searches. This setup allows AI models to get real-time web information in a safe and controlled way.
Qdrant Server
This repository is an example of how to create a MCP server for Qdrant, a vector search engine.