кейс

Ассистент, живущий на этом сайте, — не обёртка над API. Это моя собственная дообученная модель, self-hosted на скромном ARM-сервере, отвечающая с живым поиском — и существует она именно как доказательство, что такой класс систем реально построить и потянуть.

  • Модель Gemma 4, дообучена QLoRA
  • Железо 4-ядерный ARM-сервер, без GPU
  • Первый ответ полный ответ 30–45 с, первые слова — с ~20 с
  1. Задача

    Каждое предложение «приватного ИИ-ассистента» упирается в одно и то же подозрение покупателя: это правда работает без OpenAI за кулисами, и сколько это реально стоит в эксплуатации? Единственный честный ответ — работающая система, которую может потыкать посторонний человек. Так ассистент студии стал кейсом: дообученный, self-hosted, публичный — прямо на этой странице.

  2. Ограничение

    Один небольшой арендованный сервер, без ускорителя — и поверх него сознательно положены все ограничения, с которыми приходит реальный клиент: малая открытая модель (класс Gemma, а не frontier-API), двуязычные ответы EN/RU, факты из реальной базы знаний студии, а не из воображения модели, и деградация без драмы — сайт обязан полностью работать, когда ИИ-машина выключена.

  3. Что построено

    Gemma 4, дообученная методом QLoRA на специально написанном датасете: поведение и голос — из файнтюна, факты — из поиска (RAG) по курируемой базе знаний. Тюнинг — для формы, поиск — для правды. Обслуживает её llama.cpp за туннелем, вход через Google и лимит сообщений защищают дорогой путь. История чатов живёт дважды — IndexedDB в браузере, SQLite на сервере — синхронизированно, так что диалог переживает закрытие вкладки. А когда сама машина недоступна, фронтенд тихо деградирует к скриптованному моку вместо сломанного виджета: автономность заложена в архитектуру, а не добавлена потом.

  4. Что это стоило

    Время, а не строка в счёте. Месяцы итераций ушли на специально написанный обучающий датасет, который вырос через несколько поколений, прежде чем модель, отвечающая вам сейчас, получила право выйти в прод; на приёмочные гейты, которые обязан был пройти каждый кандидат; и минимум на одно полное переобучение, которое не прошло свой же гейт и было отложено, а не задеплоено. Здесь ничто не отвечает живому посетителю, пока не пройдёт тот же приёмочный тест, что и клиентский пилот, — эта дисциплина и есть настоящая цена, и в счёте она не значится отдельной строкой.

  5. Что это делает сегодня

    На четырёх ARM-ядрах полный первый ответ занимает 30–45 секунд, первые слова появляются на границе двадцатой секунды. Следующие реплики в том же диалоге быстрее, потому что контекст уже прочитан. Эта цифра опубликована, а не спрятана — это честная цена CPU-суверенитета на минимально возможном бюджете. Клиентское развёртывание подбирает железо под нужную задержку; та же архитектура на скромной GPU-машине отвечает за секунды.

  6. Что делает плохо

    Три честных ограничения. Она медленная по конструкции — CPU-модель такого размера никогда не обгонит frontier-API, и это чувствуется уже на первой реплике. Она узкая, а не универсальная — спросите что-то за пределами базы знаний студии, и поиску нечего подать модели, так что она честно скажет об этом, а не начнёт угадывать. И голос сегодня работает в одну сторону: ответить голосом через Google TTS она может, а вот распознавание вашей речи — та часть, которая ещё не подключена; пока приходится печатать вместо того, чтобы говорить.

Что это доказывает для вашего проекта

Что дообученная малая модель плюс RAG дают доменного ассистента без счетов за каждый токен и без утечки данных с вашей инфраструктуры — и работает это на одном арендованном сервере, а не на GPU-кластере. И что человек, предлагающий построить такого вам, уже построил своего — в продакшне, публично, с опубликованными компромиссами. Кликните по мозгу на главной и допросите его сами. Если вашим документам нужно то же самое — начните с RAG-пилота — фиксированного трёхнедельного проекта; если комплаенс требует, чтобы модель жила на железе, которым владеете вы, — это self-hosted AI-развёртывание . Обе ступени — часть полной лестницы цен .

Готов, когда готовы вы

Напишите два предложения о том, что вы пытаетесь сделать. Получите прямой ответ — включая «для этого я вам не нужен», если это правда.

Договор и NDA до начала работ (кроме аудита) · оплата по этапам, обычно 30/40/30 · 30 дней гарантии · зарегистрированный ИП, Армения · GMT+4, часы ЕС · Доверие и процесс