gysga

Библиотека моделей

Запуск ИИ-моделей в один клик

Открытые модели для текста, кода, зрения, изображений, видео, речи и поиска. Выберите модель — мы подберём самую дешёвую подходящую GPU.

Тип
Размер
Мгновенный старт

Qwen3 0.6B

0.6B · Apache-2.0 · мин. VRAM 6 GB

Крошечная модель для классификации, маршрутизации и тестов.

tinyfast

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

Qwen3 1.7B

1.7B · Apache-2.0 · мин. VRAM 8 GB

Маленькая и быстрая: простой чат и извлечение данных.

fast

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

Qwen3 4B Instruct 2507

4B · Apache-2.0 · мин. VRAM 12 GB

Лучшее качество на гигабайт для недорогих GPU.

multilingual

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

SmolLM3 3B

3B · Apache-2.0 · мин. VRAM 10 GB

Открытая модель 3B с длинным контекстом и режимом рассуждений.

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

Phi-4 mini

3.8B · MIT · мин. VRAM 12 GB

Компактная модель Microsoft, сильна в математике и логике.

reasoning

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный стартНужен ваш HF-токен

Llama 3.2 3B

3B · Llama 3.2 · мин. VRAM 12 GB

Малая модель Meta (нужен ваш HF-токен).

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный стартНужен ваш HF-токен

Gemma 3 4B

4B · Gemma · мин. VRAM 12 GB

Малая мультимодальная модель Google (нужен ваш HF-токен).

vision

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

Qwen3 8B

8B · Apache-2.0 · мин. VRAM 24 GB

Сильная универсальная модель с режимом рассуждений, 100+ языков.

reasoningmultilingual

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

gpt-oss 20B

21B MoE · Apache-2.0 · мин. VRAM 24 GB

Открытая модель OpenAI с рассуждениями и вызовом инструментов.

reasoningmoetools

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

Qwen2.5 7B Instruct

7B · Apache-2.0 · мин. VRAM 24 GB

Проверенная чат-модель для ассистентов и RAG.

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

Qwen2.5 Coder 7B

7B · Apache-2.0 · мин. VRAM 24 GB

Автодополнение и генерация кода для IDE-ассистентов.

code

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

Qwen2.5 VL 7B

7B · Apache-2.0 · мин. VRAM 24 GB

Понимает изображения, документы и скриншоты.

visionocr

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

DeepSeek-R1 Distill Qwen 7B

7B · MIT · мин. VRAM 24 GB

Пошаговые рассуждения в стиле R1 в небольшой модели.

reasoning

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

DeepSeek-R1 Distill Llama 8B

8B · MIT · мин. VRAM 24 GB

Рассуждения R1, дистиллированные в Llama 8B.

reasoning

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

Mistral 7B Instruct v0.3

7B · Apache-2.0 · мин. VRAM 24 GB

Быстрая европейская модель с вызовом функций.

tools

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный стартНужен ваш HF-токен

Llama 3.1 8B

8B · Llama 3.1 · мин. VRAM 24 GB

Популярная модель Meta 8B (нужен ваш HF-токен).

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

Qwen3 14B

14B · Apache-2.0 · мин. VRAM 40 GB

Заметно умнее 8B и всё ещё недорогая.

reasoningmultilingual

Рекомендуем: 4× RTX 3060· от $0.32/час

Мгновенный старт

Phi-4 14B

14B · MIT · мин. VRAM 40 GB

Отлично решает математику, код и структурные задачи.

reasoning

Рекомендуем: 4× RTX 3060· от $0.32/час

Мгновенный старт

DeepSeek-R1 Distill Qwen 14B

14B · MIT · мин. VRAM 40 GB

Более глубокие рассуждения, чем у версии 7B.

reasoning

Рекомендуем: 4× RTX 3060· от $0.32/час

Мгновенный старт

Mistral NeMo 12B

12B · Apache-2.0 · мин. VRAM 40 GB

Контекст 128k, сильный многоязычный чат.

multilingual

Рекомендуем: 4× RTX 3060· от $0.32/час

Мгновенный стартНужен ваш HF-токен

Gemma 3 12B

12B · Gemma · мин. VRAM 40 GB

Мультимодальная Gemma (нужен ваш HF-токен).

vision

Рекомендуем: 4× RTX 3060· от $0.32/час

Мгновенный старт

Qwen3 32B

32B · Apache-2.0 · мин. VRAM 80 GB

Флагманская плотная Qwen3 для требовательных ассистентов.

reasoningmultilingual

Рекомендуем: 8× RTX 3060· от $0.64/час

Мгновенный старт

Qwen3 30B-A3B Instruct 2507

30B MoE · Apache-2.0 · мин. VRAM 80 GB

MoE с 3B активных параметров: качество большой модели на высокой скорости.

moefast

Рекомендуем: 8× RTX 3060· от $0.64/час

Мгновенный старт

Qwen3 Coder 30B-A3B

30B MoE · Apache-2.0 · мин. VRAM 80 GB

Модель для агентного программирования: Cline, Roo, Continue.

codeagents

Рекомендуем: 8× RTX 3060· от $0.64/час

Мгновенный старт

Qwen2.5 Coder 32B

32B · Apache-2.0 · мин. VRAM 80 GB

Одна из лучших открытых плотных моделей для кода.

code

Рекомендуем: 8× RTX 3060· от $0.64/час

Мгновенный старт

Qwen2.5 VL 32B

32B · Apache-2.0 · мин. VRAM 80 GB

Сильная визуально-языковая модель для документов и графиков.

visionocr

Рекомендуем: 8× RTX 3060· от $0.64/час

Мгновенный старт

DeepSeek-R1 Distill Qwen 32B

32B · MIT · мин. VRAM 80 GB

Самая сильная дистилляция R1.

reasoning

Рекомендуем: 8× RTX 3060· от $0.64/час

Мгновенный старт

Mistral Small 3.2 24B

24B · Apache-2.0 · мин. VRAM 80 GB

Сбалансированная 24B со зрением и вызовом функций.

visiontools

Рекомендуем: 8× RTX 3060· от $0.64/час

Мгновенный старт

gpt-oss 120B

117B MoE · Apache-2.0 · мин. VRAM 80 GB

Крупнейшая открытая модель OpenAI на одной GPU 80 ГБ.

reasoningmoetools

Рекомендуем: 8× RTX 3060· от $0.64/час

Мгновенный стартНужен ваш HF-токен

Gemma 3 27B

27B · Gemma · мин. VRAM 80 GB

Самая большая Gemma 3 (нужен ваш HF-токен).

vision

Рекомендуем: 8× RTX 3060· от $0.64/час

Мгновенный стартНужен ваш HF-токен

Llama 3.3 70B

70B · Llama 3.3 · мин. VRAM 160 GB

Открытая модель класса GPT-4; 2×80 ГБ (нужен ваш HF-токен).

Рекомендуем: 4× A40· от $1.60/час

Мгновенный старт

GLM-4.5 Air

106B MoE · MIT · мин. VRAM 320 GB

MoE для агентов; 4×80 ГБ.

agentscodemoe

Рекомендуем: 8× A40· от $3.20/час

Мгновенный старт

Qwen3 235B-A22B FP8

235B MoE · Apache-2.0 · мин. VRAM 320 GB

Модель передового уровня; 4×80 ГБ (Hopper, FP8).

moefrontier

Рекомендуем: 8× A40· от $3.20/час

Мгновенный старт

Qwen3 Coder 480B FP8

480B MoE · Apache-2.0 · мин. VRAM 640 GB

Лучший открытый агентный кодер; 8×80 ГБ (Hopper, FP8).

codeagentsfrontier

Рекомендуем: 8× A100 80GB· от $8.80/час

Мгновенный старт

DeepSeek-R1 0528 (671B)

671B MoE · MIT · мин. VRAM 1000 GB

Полная DeepSeek-R1; 8×H200.

reasoningfrontier

Рекомендуем: 8× H200 141GB· от $20.80/час

Мгновенный старт

DeepSeek-V3.1 (671B)

671B MoE · MIT · мин. VRAM 1000 GB

Полная DeepSeek-V3.1 с гибридным мышлением; 8×H200.

frontiertools

Рекомендуем: 8× H200 141GB· от $20.80/час

Мгновенный старт

Qwen3 Embedding 0.6B

0.6B · Apache-2.0 · мин. VRAM 6 GB

Быстрые многоязычные эмбеддинги для поиска и RAG.

multilingual

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

Qwen3 Embedding 8B

8B · Apache-2.0 · мин. VRAM 24 GB

Эмбеддинги высшего качества (уровень лидеров MTEB).

multilingual

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

BGE-M3

568M · MIT · мин. VRAM 6 GB

Плотные и разреженные многоязычные эмбеддинги.

multilingual

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

Multilingual E5 Large

560M · MIT · мин. VRAM 6 GB

Классические многоязычные эмбеддинги для поиска.

multilingual

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

BGE Reranker v2 M3

568M · Apache-2.0 · мин. VRAM 6 GB

Реранкер для точного RAG (/v1/rerank).

rerank

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

Stable Diffusion XL 1.0

3.5B · OpenRAIL++ · мин. VRAM 8 GB

Классическая SDXL: огромная экосистема LoRA, работает на 8 ГБ.

photoart

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

Juggernaut XL v9

3.5B · CreativeML OpenRAIL-M · мин. VRAM 8 GB

Фотореалистичная SDXL, отлично для портретов.

photorealism

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

Lumina Image 2.0

2.6B · Apache-2.0 · мин. VRAM 12 GB

Эффективная генерация изображений с точным следованием промпту.

art

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

FLUX.1 schnell (FP8)

12B · Apache-2.0 · мин. VRAM 16 GB

Изображения топ-качества за 4 шага, коммерческое использование разрешено.

phototext-in-imagefast

Рекомендуем: RTX 4060 Ti 16GB· от $0.12/час

Мгновенный старт

HiDream-I1 Fast (FP8)

17B · MIT · мин. VRAM 24 GB

Передовая открытая модель изображений, лицензия MIT.

photoart

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

Qwen-Image (FP8)

20B · Apache-2.0 · мин. VRAM 40 GB

Лучший рендер текста на изображениях: постеры, интерфейсы.

text-in-imageposters

Рекомендуем: 4× RTX 3060· от $0.32/час

Мгновенный старт

Wan 2.1 Text-to-Video 1.3B

1.3B · Apache-2.0 · мин. VRAM 12 GB

Генерация видео даже на картах 12 ГБ (480p).

text-to-videolight

Рекомендуем: RTX 3060· от $0.08/час

Мгновенный старт

Wan 2.2 TI2V 5B

5B · Apache-2.0 · мин. VRAM 24 GB

Видео 720p из текста и изображения на одной GPU 24 ГБ.

text-to-videoimage-to-video

Рекомендуем: 2× RTX 3060· от $0.16/час

Мгновенный старт

Wan 2.2 Text-to-Video 14B (FP8)

14B MoE · Apache-2.0 · мин. VRAM 40 GB

Кинематографичное видео 720p; LoRA на 4 шага для скорости.

text-to-videocinematic

Рекомендуем: 4× RTX 3060· от $0.32/час

Мгновенный старт

Wan 2.2 Image-to-Video 14B (FP8)

14B MoE · Apache-2.0 · мин. VRAM 40 GB

Оживите любое изображение в ролик 720p.

image-to-video

Рекомендуем: 4× RTX 3060· от $0.32/час

Мгновенный старт

Mochi 1 Preview (FP8)

10B · Apache-2.0 · мин. VRAM 24 GB

Видео с плавным движением от Genmo.

text-to-video

Рекомендуем: 2× RTX 3060· от $0.16/час

Speech-to-text & TTS · OpenAI API

мин. VRAM 6 GB

Распознавание речи faster-whisper и синтез речи с OpenAI-совместимым аудио-API.

Whisper large-v3 API

мин. VRAM 8 GB

Сервис распознавания речи (faster-whisper, large-v3) со Swagger UI.

Kokoro TTS · OpenAI API

мин. VRAM 4 GB

Быстрый естественный синтез речи (82M) с OpenAI-совместимым /v1/audio/speech.

Нет моделей с такими фильтрами.

Объединяйте несколько GPU для больших моделей

Арендуйте 2, 4 или 8 GPU в одном сервере и используйте их как одну:

Тензорный параллелизм для инференса

vLLM и SGLang делят модель между всеми GPU сервера, и их память суммируется: Llama 3.3 70B на 2×A100 80GB, Qwen3 235B на 4×H100, DeepSeek-R1 671B на 8×H200.

Распределённое обучение

Шаблоны PyTorch видят все GPU: используйте torchrun с DDP, FSDP или DeepSpeed ZeRO, чтобы обучать быстрее или помещать большие модели.

Почему в одном сервере

GPU объединяются внутри одной машины через NVLink/PCIe. Делить модель между компьютерами через интернет в десятки раз медленнее, поэтому мы так не делаем.

Шаблоны

Готовые окружения

Каждый сервер запускается из шаблона. Шаблоны с моделью загружают её автоматически, остальные дают чистое окружение с доступом по SSH.

Серверы LLM

vLLM · OpenAI API

Высокопроизводительный LLM-сервер с OpenAI-совместимым API. Вызывайте из своего кода с API-ключом Gysga.

Несколько GPU: тензорный параллелизм

SGLang · OpenAI API

Быстрый LLM-сервер с RadixAttention и OpenAI-совместимым API.

Несколько GPU: тензорный параллелизм

Open WebUI + Ollama

Интерфейс в стиле ChatGPT со встроенной Ollama. Скачивайте любые модели из библиотеки Ollama в один клик.

Ollama API

Сервер Ollama: Llama, Qwen, Gemma, DeepSeek и сотни других моделей через простой API.

Text Generation WebUI

Веб-интерфейс oobabooga для общения и тестирования моделей (GGUF, EXL2, Transformers).

Изображения и видео

ComfyUI

Генерация изображений и видео на нодах: SDXL, FLUX, Wan, LTX-Video. ComfyUI-Manager в комплекте.

Речь

Speech-to-text & TTS · OpenAI API

Распознавание речи faster-whisper и синтез речи с OpenAI-совместимым аудио-API.

Whisper large-v3 API

Сервис распознавания речи (faster-whisper, large-v3) со Swagger UI.

Kokoro TTS · OpenAI API

Быстрый естественный синтез речи (82M) с OpenAI-совместимым /v1/audio/speech.

Дообучение

LLaMA-Factory

Дообучение 100+ LLM через LoRA/QLoRA или полное обучение из веб-интерфейса.

Несколько GPU: torchrun / DeepSpeed

Axolotl

Инструмент дообучения по YAML-конфигу (LoRA, QLoRA, full, DPO). Подключитесь по SSH и запустите axolotl train.

Несколько GPU: torchrun / DeepSpeed

Unsloth

Дообучение в 2 раза быстрее и с меньшим расходом памяти. Подключитесь по SSH и запускайте скрипты Unsloth.

Несколько GPU: torchrun / DeepSpeed

Разработка

PyTorch 2.8

PyTorch 2.8 с CUDA 12.8 и cuDNN 9. Подключайтесь по SSH и работайте в /workspace.

Несколько GPU: torchrun / DeepSpeed

Jupyter Lab + PyTorch

Jupyter Lab поверх PyTorch 2.8. Откройте через SSH-туннель с токеном из панели подключения.

Несколько GPU: torchrun / DeepSpeed

TensorFlow + Jupyter

TensorFlow с поддержкой GPU и Jupyter.

Несколько GPU: torchrun / DeepSpeed

Ubuntu 24.04 + CUDA 12.8

Чистая Ubuntu 24.04 с CUDA 12.8 и cuDNN. Устанавливайте всё, что нужно.

Несколько GPU: torchrun / DeepSpeed

Custom Docker image

Запустите любой публичный Docker-образ с доступом к GPU. Используется его команда по умолчанию.

Несколько GPU: torchrun / DeepSpeed

Поиск и RAG

Embeddings · OpenAI API

Модели эмбеддингов (BGE-M3, E5) для поиска и RAG через /v1/embeddings.