Физический сервер + единая защищённая основа для всех агентов. Новые агенты подключаются быстрее — не переписывают одно и то же с нуля. Данные не покидают ваш контур.
Три фактора совпали одновременно. Компании, внедрившие сейчас, получат преимущество на 18–24 месяца.
ИИ-агенты на open-source моделях только что стали реально работоспособными. Первые 15–20% рынка, внедрившие сейчас, получат операционное преимущество, которое конкурентам будет дорого нагонять.
📅 Внедрение за 30 дней · Окупаемость от 2 недельКаждый новый агент PRAXIS не переписывает одно и то же с нуля — он подключается к общей платформе, где уже решены лимиты, мониторинг, секреты и отказоустойчивость к сбоям LLM-провайдеров. Поэтому внедрение следующего агента быстрее и дешевле первого.
Это про устойчивость приложений к сбоям LLM-провайдера и про честный мониторинг — не про гарантию восстановления при аппаратном отказе сервера целиком.
Событие в системе → агент запускается → готовый артефакт без участия сотрудника. Human-in-the-loop: агент готовит, человек одобряет.
Точка входа — 1 агент. Стартовый — 3 агента под ваши процессы. Полный — все 6 агентов каталога.
1 агент на выбор. Внедрение 30 дней.
3 агента, подобранных под вашу отрасль и процессы. Qwen 3 235B.
Все 6 агентов каталога. Приоритетная поддержка 24/7.
Лизинг 36 мес.: от 18 000 ₽/мес (Точка входа) · от 52 000 ₽/мес (Стартовый) · от 145 000 ₽/мес (Полный). Партнёры: Сбербанк Лизинг, ВТБ Лизинг, Балтийский лизинг.
Пример расчёта: компания 55 сотрудников, B2B-консалтинг, Стартовый пакет (3 агента). Ставки по ролям — 400–1 200 ₽/час (hh.ru/SuperJob, 2026), не единая ставка для всех должностей.
| Критерий | A: Собственный сервер | B: Подписка / Лизинг | C: Аренда GPU |
|---|---|---|---|
| TCO 3 года | ~1,4 млн ₽ | ~2,3 млн ₽ | ~5,4 млн ₽ |
| Тип затрат | CAPEX разовый | OPEX фиксированный | OPEX переменный |
| Данные внутри контура | ✓ Да | ✓ Да | ✗ Нет |
| Соответствие 152-ФЗ / КИИ | ✓ Полное | ✓ Полное | ⚠ Условно |
| Vendor Lock-in | ✓ Нет | ⚠ Контракт | ✗ Высокий |
| Работа без интернета | ✓ Да (Air Gap) | ✓ Да | ✗ Нет |
| Срок запуска | 4–6 недель | 4–6 недель | 1–3 дня (пилот) |
| Налоговый эффект | Амортизация CAPEX | OPEX + НДС к вычету | OPEX снижает налог |
| Слой | Компонент | Лицензия | Версия |
|---|---|---|---|
| LLM Inference | Ollama / vLLM | MIT Apache 2.0 | Ollama 0.4+ |
| Базовая модель | DeepSeek R1 / Qwen 3 | MIT Apache 2.0 | R1-0528 / Q3-2026 |
| Оркестрация | n8n (self-hosted) | Sustainable Use | n8n 1.x |
| Агентный фреймворк | LangGraph / CrewAI | MIT | LG 0.2+ |
| Векторная БД | Qdrant | Apache 2.0 | 1.9+ |
| Embeddings | BAAI/bge-m3 | MIT | bge-m3 |
| Транскрипция | Whisper large-v3 | MIT | large-v3 |
| UI (чат) | Open WebUI | MIT | 0.5+ |
| Реверс-прокси | NGINX / Caddy | BSD / Apache | Stable |
| Мониторинг | Langfuse + Grafana | MIT | Langfuse 2.x |
| VPN | WireGuard / Headscale | GPL / BSD | Stable |
Суммарная стоимость лицензий ПО: 0 ₽/мес. Все компоненты — open-source, self-hosted.
| Параметр | Точка входа | Стартовый | Полный |
|---|---|---|---|
| GPU | 1× RTX 4090 24 GB | 2× RTX 4090 48 GB | 4× RTX A40 48 GB (192 GB) |
| CPU | AMD Ryzen 9 7950X (16c) | AMD EPYC 7443 (24c, 2P) | 2× AMD EPYC 7713 (128c) |
| RAM | 96 GB DDR5-5200 | 256 GB ECC DDR4-3200 | 512 GB ECC DDR4 |
| Хранилище | 2 TB NVMe + 4 TB NVMe | 4 TB RAID-1 + 8 TB NVMe | 8 TB RAID-10 + SAN 20 TB |
| Сеть | 1 GbE | 2× 10 GbE | 4× 25 GbE + IPMI |
| Питание | 1 200 W 80+ Gold | 2× 1 600 W redundant | 4× 2 000 W redundant |
| Форм-фактор | Tower / 4U rack | 2U rack | 4U rack |
| ОС | Ubuntu 22.04 LTS | Ubuntu 22.04 LTS | Ubuntu 22.04 + k3s |
| LLM модель | DeepSeek R1 32B / Qwen 3 30B | Qwen 3 235B / DeepSeek R1 70B | Несколько моделей одновременно |
| Concurrent users | 3–5 | 10–20 | 50+ |
| Резервный узел | — | — | — (на дорожной карте) |
# Ubuntu + обновление + драйверы NVIDIA
sudo apt update && sudo apt upgrade -y
sudo ubuntu-drivers autoinstall && sudo reboot
nvidia-smi # Проверка: RTX 4090, CUDA 12.4+
# Docker
curl -fsSL https://get.docker.com | sh
sudo usermod -aG docker $USER && newgrp docker
# Установка Ollama
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable ollama && sudo systemctl start ollama
# Загрузка моделей
ollama pull deepseek-r1:32b # ~19 GB
ollama pull qwen3:30b # ~17 GB (MoE)
ollama pull deepseek-r1:14b # ~9 GB
ollama pull bge-m3 # ~570 MB
# Развёртывание сервисов
git clone https://[supplier-repo]/apk-start.git /opt/apk
cd /opt/apk && cp .env.example .env && nano .env
docker compose up -d
docker compose ps # Все сервисы: Up (healthy)
# Загрузка базы знаний
python3 /opt/apk/scripts/ingest.py \
--source /path/to/documents \
--collection company_kb \
--embedding bge-m3
Это время реакции и решения обращений в поддержку — не гарантия аптайма сервера. Разворачивается один физический сервер без резервного узла: при аппаратном отказе восстановление идёт через резервные копии и новое оборудование, а не автоматическое переключение на резерв. Резервный узел пока не входит ни в один тариф.
Пошаговый процесс без сюрпризов. Ваш ИТ-администратор тратит 4 часа в неделю на координацию.
2 интервью с SDR, HR, бухгалтером. Определяем, какие агенты внедряем первыми и в каком порядке.
✓ Чёткий план внедренияUbuntu + n8n + Ollama + Qdrant, подключение к сети клиента. Проверка: Open WebUI доступен.
✓ Сервер работаетИнтеграция с amoCRM / Битрикс24. Тест на 20 реальных лидах. SDR видит первые автозаполненные карточки.
✓ Первый агент в работеPDF, регламенты, договоры → индексация в Qdrant. Сотрудники задают первые вопросы через RAG-чат.
✓ База знаний в работеВсе агенты протестированы, команда обучена. Подписание акта приёмки. Переход на контракт поддержки.
✓ Система в боевом режимеДемонстрация 45 минут. Показываем живой сервер, реального агента на реальных данных (анонимизированных).
Условия пилотного внедрения (1–2 агента) — уточняются, требуют данных от PRAXIS перед публикацией.
* Данные анонимизированы по NDA. Результаты зависят от масштаба и сценариев внедрения.