Qwen3 0.6B
0.6B · Apache-2.0 · мин. VRAM 6 GB
Крошечная модель для классификации, маршрутизации и тестов.
Рекомендуем: RTX 3060· от $0.08/час
Библиотека моделей
Открытые модели для текста, кода, зрения, изображений, видео, речи и поиска. Выберите модель — мы подберём самую дешёвую подходящую GPU.
0.6B · Apache-2.0 · мин. VRAM 6 GB
Крошечная модель для классификации, маршрутизации и тестов.
Рекомендуем: RTX 3060· от $0.08/час
1.7B · Apache-2.0 · мин. VRAM 8 GB
Маленькая и быстрая: простой чат и извлечение данных.
Рекомендуем: RTX 3060· от $0.08/час
4B · Apache-2.0 · мин. VRAM 12 GB
Лучшее качество на гигабайт для недорогих GPU.
Рекомендуем: RTX 3060· от $0.08/час
3B · Apache-2.0 · мин. VRAM 10 GB
Открытая модель 3B с длинным контекстом и режимом рассуждений.
Рекомендуем: RTX 3060· от $0.08/час
3.8B · MIT · мин. VRAM 12 GB
Компактная модель Microsoft, сильна в математике и логике.
Рекомендуем: RTX 3060· от $0.08/час
3B · Llama 3.2 · мин. VRAM 12 GB
Малая модель Meta (нужен ваш HF-токен).
Рекомендуем: RTX 3060· от $0.08/час
4B · Gemma · мин. VRAM 12 GB
Малая мультимодальная модель Google (нужен ваш HF-токен).
Рекомендуем: RTX 3060· от $0.08/час
8B · Apache-2.0 · мин. VRAM 24 GB
Сильная универсальная модель с режимом рассуждений, 100+ языков.
Рекомендуем: 2× RTX 3060· от $0.16/час
21B MoE · Apache-2.0 · мин. VRAM 24 GB
Открытая модель OpenAI с рассуждениями и вызовом инструментов.
Рекомендуем: 2× RTX 3060· от $0.16/час
7B · Apache-2.0 · мин. VRAM 24 GB
Проверенная чат-модель для ассистентов и RAG.
Рекомендуем: 2× RTX 3060· от $0.16/час
7B · Apache-2.0 · мин. VRAM 24 GB
Автодополнение и генерация кода для IDE-ассистентов.
Рекомендуем: 2× RTX 3060· от $0.16/час
7B · Apache-2.0 · мин. VRAM 24 GB
Понимает изображения, документы и скриншоты.
Рекомендуем: 2× RTX 3060· от $0.16/час
7B · MIT · мин. VRAM 24 GB
Пошаговые рассуждения в стиле R1 в небольшой модели.
Рекомендуем: 2× RTX 3060· от $0.16/час
8B · MIT · мин. VRAM 24 GB
Рассуждения R1, дистиллированные в Llama 8B.
Рекомендуем: 2× RTX 3060· от $0.16/час
7B · Apache-2.0 · мин. VRAM 24 GB
Быстрая европейская модель с вызовом функций.
Рекомендуем: 2× RTX 3060· от $0.16/час
8B · Llama 3.1 · мин. VRAM 24 GB
Популярная модель Meta 8B (нужен ваш HF-токен).
Рекомендуем: 2× RTX 3060· от $0.16/час
14B · Apache-2.0 · мин. VRAM 40 GB
Заметно умнее 8B и всё ещё недорогая.
Рекомендуем: 4× RTX 3060· от $0.32/час
14B · MIT · мин. VRAM 40 GB
Отлично решает математику, код и структурные задачи.
Рекомендуем: 4× RTX 3060· от $0.32/час
14B · MIT · мин. VRAM 40 GB
Более глубокие рассуждения, чем у версии 7B.
Рекомендуем: 4× RTX 3060· от $0.32/час
12B · Apache-2.0 · мин. VRAM 40 GB
Контекст 128k, сильный многоязычный чат.
Рекомендуем: 4× RTX 3060· от $0.32/час
12B · Gemma · мин. VRAM 40 GB
Мультимодальная Gemma (нужен ваш HF-токен).
Рекомендуем: 4× RTX 3060· от $0.32/час
32B · Apache-2.0 · мин. VRAM 80 GB
Флагманская плотная Qwen3 для требовательных ассистентов.
Рекомендуем: 8× RTX 3060· от $0.64/час
30B MoE · Apache-2.0 · мин. VRAM 80 GB
MoE с 3B активных параметров: качество большой модели на высокой скорости.
Рекомендуем: 8× RTX 3060· от $0.64/час
30B MoE · Apache-2.0 · мин. VRAM 80 GB
Модель для агентного программирования: Cline, Roo, Continue.
Рекомендуем: 8× RTX 3060· от $0.64/час
32B · Apache-2.0 · мин. VRAM 80 GB
Одна из лучших открытых плотных моделей для кода.
Рекомендуем: 8× RTX 3060· от $0.64/час
32B · Apache-2.0 · мин. VRAM 80 GB
Сильная визуально-языковая модель для документов и графиков.
Рекомендуем: 8× RTX 3060· от $0.64/час
32B · MIT · мин. VRAM 80 GB
Самая сильная дистилляция R1.
Рекомендуем: 8× RTX 3060· от $0.64/час
24B · Apache-2.0 · мин. VRAM 80 GB
Сбалансированная 24B со зрением и вызовом функций.
Рекомендуем: 8× RTX 3060· от $0.64/час
117B MoE · Apache-2.0 · мин. VRAM 80 GB
Крупнейшая открытая модель OpenAI на одной GPU 80 ГБ.
Рекомендуем: 8× RTX 3060· от $0.64/час
27B · Gemma · мин. VRAM 80 GB
Самая большая Gemma 3 (нужен ваш HF-токен).
Рекомендуем: 8× RTX 3060· от $0.64/час
70B · Llama 3.3 · мин. VRAM 160 GB
Открытая модель класса GPT-4; 2×80 ГБ (нужен ваш HF-токен).
Рекомендуем: 4× A40· от $1.60/час
106B MoE · MIT · мин. VRAM 320 GB
MoE для агентов; 4×80 ГБ.
Рекомендуем: 8× A40· от $3.20/час
235B MoE · Apache-2.0 · мин. VRAM 320 GB
Модель передового уровня; 4×80 ГБ (Hopper, FP8).
Рекомендуем: 8× A40· от $3.20/час
480B MoE · Apache-2.0 · мин. VRAM 640 GB
Лучший открытый агентный кодер; 8×80 ГБ (Hopper, FP8).
Рекомендуем: 8× A100 80GB· от $8.80/час
671B MoE · MIT · мин. VRAM 1000 GB
Полная DeepSeek-R1; 8×H200.
Рекомендуем: 8× H200 141GB· от $20.80/час
671B MoE · MIT · мин. VRAM 1000 GB
Полная DeepSeek-V3.1 с гибридным мышлением; 8×H200.
Рекомендуем: 8× H200 141GB· от $20.80/час
0.6B · Apache-2.0 · мин. VRAM 6 GB
Быстрые многоязычные эмбеддинги для поиска и RAG.
Рекомендуем: RTX 3060· от $0.08/час
8B · Apache-2.0 · мин. VRAM 24 GB
Эмбеддинги высшего качества (уровень лидеров MTEB).
Рекомендуем: 2× RTX 3060· от $0.16/час
568M · MIT · мин. VRAM 6 GB
Плотные и разреженные многоязычные эмбеддинги.
Рекомендуем: RTX 3060· от $0.08/час
560M · MIT · мин. VRAM 6 GB
Классические многоязычные эмбеддинги для поиска.
Рекомендуем: RTX 3060· от $0.08/час
568M · Apache-2.0 · мин. VRAM 6 GB
Реранкер для точного RAG (/v1/rerank).
Рекомендуем: RTX 3060· от $0.08/час
3.5B · OpenRAIL++ · мин. VRAM 8 GB
Классическая SDXL: огромная экосистема LoRA, работает на 8 ГБ.
Рекомендуем: RTX 3060· от $0.08/час
3.5B · CreativeML OpenRAIL-M · мин. VRAM 8 GB
Фотореалистичная SDXL, отлично для портретов.
Рекомендуем: RTX 3060· от $0.08/час
2.6B · Apache-2.0 · мин. VRAM 12 GB
Эффективная генерация изображений с точным следованием промпту.
Рекомендуем: RTX 3060· от $0.08/час
12B · Apache-2.0 · мин. VRAM 16 GB
Изображения топ-качества за 4 шага, коммерческое использование разрешено.
Рекомендуем: RTX 4060 Ti 16GB· от $0.12/час
17B · MIT · мин. VRAM 24 GB
Передовая открытая модель изображений, лицензия MIT.
Рекомендуем: 2× RTX 3060· от $0.16/час
20B · Apache-2.0 · мин. VRAM 40 GB
Лучший рендер текста на изображениях: постеры, интерфейсы.
Рекомендуем: 4× RTX 3060· от $0.32/час
1.3B · Apache-2.0 · мин. VRAM 12 GB
Генерация видео даже на картах 12 ГБ (480p).
Рекомендуем: RTX 3060· от $0.08/час
5B · Apache-2.0 · мин. VRAM 24 GB
Видео 720p из текста и изображения на одной GPU 24 ГБ.
Рекомендуем: 2× RTX 3060· от $0.16/час
14B MoE · Apache-2.0 · мин. VRAM 40 GB
Кинематографичное видео 720p; LoRA на 4 шага для скорости.
Рекомендуем: 4× RTX 3060· от $0.32/час
14B MoE · Apache-2.0 · мин. VRAM 40 GB
Оживите любое изображение в ролик 720p.
Рекомендуем: 4× RTX 3060· от $0.32/час
10B · Apache-2.0 · мин. VRAM 24 GB
Видео с плавным движением от Genmo.
Рекомендуем: 2× RTX 3060· от $0.16/час
мин. VRAM 6 GB
Распознавание речи faster-whisper и синтез речи с OpenAI-совместимым аудио-API.
мин. VRAM 8 GB
Сервис распознавания речи (faster-whisper, large-v3) со Swagger UI.
мин. VRAM 4 GB
Быстрый естественный синтез речи (82M) с OpenAI-совместимым /v1/audio/speech.
Нет моделей с такими фильтрами.
Арендуйте 2, 4 или 8 GPU в одном сервере и используйте их как одну:
vLLM и SGLang делят модель между всеми GPU сервера, и их память суммируется: Llama 3.3 70B на 2×A100 80GB, Qwen3 235B на 4×H100, DeepSeek-R1 671B на 8×H200.
Шаблоны PyTorch видят все GPU: используйте torchrun с DDP, FSDP или DeepSpeed ZeRO, чтобы обучать быстрее или помещать большие модели.
GPU объединяются внутри одной машины через NVLink/PCIe. Делить модель между компьютерами через интернет в десятки раз медленнее, поэтому мы так не делаем.
Шаблоны
Каждый сервер запускается из шаблона. Шаблоны с моделью загружают её автоматически, остальные дают чистое окружение с доступом по SSH.
vLLM · OpenAI API
Высокопроизводительный LLM-сервер с OpenAI-совместимым API. Вызывайте из своего кода с API-ключом Gysga.
Несколько GPU: тензорный параллелизм
SGLang · OpenAI API
Быстрый LLM-сервер с RadixAttention и OpenAI-совместимым API.
Несколько GPU: тензорный параллелизм
Open WebUI + Ollama
Интерфейс в стиле ChatGPT со встроенной Ollama. Скачивайте любые модели из библиотеки Ollama в один клик.
Ollama API
Сервер Ollama: Llama, Qwen, Gemma, DeepSeek и сотни других моделей через простой API.
Text Generation WebUI
Веб-интерфейс oobabooga для общения и тестирования моделей (GGUF, EXL2, Transformers).
ComfyUI
Генерация изображений и видео на нодах: SDXL, FLUX, Wan, LTX-Video. ComfyUI-Manager в комплекте.
Speech-to-text & TTS · OpenAI API
Распознавание речи faster-whisper и синтез речи с OpenAI-совместимым аудио-API.
Whisper large-v3 API
Сервис распознавания речи (faster-whisper, large-v3) со Swagger UI.
Kokoro TTS · OpenAI API
Быстрый естественный синтез речи (82M) с OpenAI-совместимым /v1/audio/speech.
LLaMA-Factory
Дообучение 100+ LLM через LoRA/QLoRA или полное обучение из веб-интерфейса.
Несколько GPU: torchrun / DeepSpeed
Axolotl
Инструмент дообучения по YAML-конфигу (LoRA, QLoRA, full, DPO). Подключитесь по SSH и запустите axolotl train.
Несколько GPU: torchrun / DeepSpeed
Unsloth
Дообучение в 2 раза быстрее и с меньшим расходом памяти. Подключитесь по SSH и запускайте скрипты Unsloth.
Несколько GPU: torchrun / DeepSpeed
PyTorch 2.8
PyTorch 2.8 с CUDA 12.8 и cuDNN 9. Подключайтесь по SSH и работайте в /workspace.
Несколько GPU: torchrun / DeepSpeed
Jupyter Lab + PyTorch
Jupyter Lab поверх PyTorch 2.8. Откройте через SSH-туннель с токеном из панели подключения.
Несколько GPU: torchrun / DeepSpeed
TensorFlow + Jupyter
TensorFlow с поддержкой GPU и Jupyter.
Несколько GPU: torchrun / DeepSpeed
Ubuntu 24.04 + CUDA 12.8
Чистая Ubuntu 24.04 с CUDA 12.8 и cuDNN. Устанавливайте всё, что нужно.
Несколько GPU: torchrun / DeepSpeed
Custom Docker image
Запустите любой публичный Docker-образ с доступом к GPU. Используется его команда по умолчанию.
Несколько GPU: torchrun / DeepSpeed
Embeddings · OpenAI API
Модели эмбеддингов (BGE-M3, E5) для поиска и RAG через /v1/embeddings.