Ollama и LLaVA: локальный визуальный ИИ от CLI до пакетной обработки
Запускаем мультимодальные LLaVA-модели на своём сервере: CLI, Base64, batch, веб-интеграция. Когда локальный визуальный ИИ выгоднее облака и как встроить его в приложение.
Подборка
5 материал(ов) по теме «выбор-моделей».
Запускаем мультимодальные LLaVA-модели на своём сервере: CLI, Base64, batch, веб-интеграция. Когда локальный визуальный ИИ выгоднее облака и как встроить его в приложение.
Открытая 308M embedding-модель от Google DeepMind: 768-мерные векторы с MRL-усечением до 128, контекст 2048, ~200 МБ RAM. Когда она лучше BGE-M3 и как поднять её локально — Ollama, sentence-transformers и systemd-юнит.
OpenAI-совместимый API китайского провайдера с открытыми моделями V4 Flash и V4 Pro на архитектуре MoE. Подключение через OpenAI SDK, LiteLLM, OpenRouter. Цены в десятки раз ниже GPT-4, контекст до 1M токенов. Tool use, structured outputs, reasoning-модель с цепочкой рассуждений.
Что умеет Kimi K2.6 от Moonshot AI, где она реально выигрывает у закрытых моделей, сколько стоит и что нужно, чтобы запустить её локально.
Справочник: какая модель под какую задачу. Таблицы соответствия, сценарии использования, ограничения и чеклист выбора.