Skip to content

Repository files navigation

local.Visual

Local visual interpreter AI — interpreta imágenes con modelos de visión locales via Ollama.

Fork de OpenVist enfocado exclusivamente en la interpretación de imágenes con IA local. OpenVist es el proyecto principal (computer-use + automatización de capturas); local.Visual es solo el intérprete — sin scripts de captura, sin bot de Discord, sin automatización.

Qué hace

vision_analyze.py recibe una imagen, la envía a un modelo de visión local (Ollama), y devuelve una descripción textual. Sin cloud, sin API keys, sin enviar imágenes a terceros.

python3 vision_analyze.py screenshot.png
python3 vision_analyze.py screenshot.png "Busca errores en la pantalla"
python3 vision_analyze.py screenshot.png --json
python3 vision_analyze.py screenshot.png --retry 3

Requisitos

  • Ollama — servidor de modelos local
  • Python 3
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5vl:7b

Modelos de visión soportados

Cualquier modelo de visión compatible con Ollama:

Modelo Descripción Comando
qwen2.5vl:7b Por defecto — buen balance de velocidad y precisión ollama pull qwen2.5vl:7b
qwen2.5vl:3b Más rápido, menos preciso ollama pull qwen2.5vl:3b
llama3.2-vision:11b Mayor precisión, más lento ollama pull llama3.2-vision:11b

Plantillas de prompt

Incluye plantillas predefinidas en prompts/:

Plantilla Descripción
default Describe en detalle lo que ves en la imagen
errors Busca errores, advertencias y mensajes importantes
code Analiza código visible en un editor o terminal
debug Describe el estado de una sesión de debugging
ui Describe el layout de la UI y elementos destacados

Variables de entorno

Variable Por defecto Descripción
OLLAMA_URL http://127.0.0.1:11434 URL de la API de Ollama
VISION_MODEL qwen2.5vl:7b Modelo de visión
VISION_TIMEOUT 120 Timeout en segundos
VISION_NUM_CTX 4096 Tamaño de la ventana de contexto
OPENVIST_RETRY 1 Número de intentos
OPENVIST_COMPARE_IMAGE Segunda imagen para modo comparación
OPENVIST_BANNER Pie de página opcional en la salida

Configuración

mkdir -p ~/.config/local-visual
cp config.example.json ~/.config/local-visual/config.json
{
  "model": "qwen2.5vl:7b",
  "resize_target": "1024x1024>",
  "timeout": 120,
  "ollama_url": "http://127.0.0.1:11434",
  "num_ctx": 4096
}

Salida JSON

python3 vision_analyze.py screenshot.png --json
{
  "screenshot": "screenshot.png",
  "model": "qwen2.5vl:7b",
  "prompt": "Describe what you see in detail",
  "description": "The image shows a code editor with...",
  "timestamp": "2026-08-05T12:00:00Z",
  "duration_ms": 3400
}

Diferencia con OpenVist

Característica OpenVist local.Visual
Captura de pantalla (grim/slurp)
Bot de Discord
Automatización / computer-use
Systemd timers
Interpretación Ollama
Plantillas de prompt
JSON output
Comparación de imágenes

OpenVist es el proyecto completo: captura + automatización + interpretación. local.Visual es solo el intérprete: dale una imagen y te devuelve una descripción.

Seguridad

  • 100% local — modelo de visión en Ollama (127.0.0.1:11434)
  • Sin API keys, sin cuentas cloud, sin enviar imágenes a nadie
  • Ideal para integrar en otros proyectos que necesiten interpretación visual local

Licencia

MIT

About

Local visual interpreter AI — interpreta imágenes con modelos de visión locales via Ollama. Fork de OpenVist enfocado en el intérprete.

Resources

Contributing

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages