Local visual interpreter AI — interpreta imágenes con modelos de visión locales via Ollama.
Fork de OpenVist enfocado exclusivamente en la interpretación de imágenes con IA local. OpenVist es el proyecto principal (computer-use + automatización de capturas); local.Visual es solo el intérprete — sin scripts de captura, sin bot de Discord, sin automatización.
vision_analyze.py recibe una imagen, la envía a un modelo de visión local (Ollama), y devuelve una descripción textual. Sin cloud, sin API keys, sin enviar imágenes a terceros.
python3 vision_analyze.py screenshot.png
python3 vision_analyze.py screenshot.png "Busca errores en la pantalla"
python3 vision_analyze.py screenshot.png --json
python3 vision_analyze.py screenshot.png --retry 3- Ollama — servidor de modelos local
- Python 3
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5vl:7bCualquier modelo de visión compatible con Ollama:
| Modelo | Descripción | Comando |
|---|---|---|
qwen2.5vl:7b |
Por defecto — buen balance de velocidad y precisión | ollama pull qwen2.5vl:7b |
qwen2.5vl:3b |
Más rápido, menos preciso | ollama pull qwen2.5vl:3b |
llama3.2-vision:11b |
Mayor precisión, más lento | ollama pull llama3.2-vision:11b |
Incluye plantillas predefinidas en prompts/:
| Plantilla | Descripción |
|---|---|
default |
Describe en detalle lo que ves en la imagen |
errors |
Busca errores, advertencias y mensajes importantes |
code |
Analiza código visible en un editor o terminal |
debug |
Describe el estado de una sesión de debugging |
ui |
Describe el layout de la UI y elementos destacados |
| Variable | Por defecto | Descripción |
|---|---|---|
OLLAMA_URL |
http://127.0.0.1:11434 |
URL de la API de Ollama |
VISION_MODEL |
qwen2.5vl:7b |
Modelo de visión |
VISION_TIMEOUT |
120 |
Timeout en segundos |
VISION_NUM_CTX |
4096 |
Tamaño de la ventana de contexto |
OPENVIST_RETRY |
1 |
Número de intentos |
OPENVIST_COMPARE_IMAGE |
— | Segunda imagen para modo comparación |
OPENVIST_BANNER |
— | Pie de página opcional en la salida |
mkdir -p ~/.config/local-visual
cp config.example.json ~/.config/local-visual/config.json{
"model": "qwen2.5vl:7b",
"resize_target": "1024x1024>",
"timeout": 120,
"ollama_url": "http://127.0.0.1:11434",
"num_ctx": 4096
}python3 vision_analyze.py screenshot.png --json{
"screenshot": "screenshot.png",
"model": "qwen2.5vl:7b",
"prompt": "Describe what you see in detail",
"description": "The image shows a code editor with...",
"timestamp": "2026-08-05T12:00:00Z",
"duration_ms": 3400
}| Característica | OpenVist | local.Visual |
|---|---|---|
| Captura de pantalla (grim/slurp) | ✅ | ❌ |
| Bot de Discord | ✅ | ❌ |
| Automatización / computer-use | ✅ | ❌ |
| Systemd timers | ✅ | ❌ |
| Interpretación Ollama | ✅ | ✅ |
| Plantillas de prompt | ✅ | ✅ |
| JSON output | ✅ | ✅ |
| Comparación de imágenes | ✅ | ✅ |
OpenVist es el proyecto completo: captura + automatización + interpretación. local.Visual es solo el intérprete: dale una imagen y te devuelve una descripción.
- 100% local — modelo de visión en Ollama (127.0.0.1:11434)
- Sin API keys, sin cuentas cloud, sin enviar imágenes a nadie
- Ideal para integrar en otros proyectos que necesiten interpretación visual local
MIT