Останні два роки я майже щотижня розмовляю з керівниками, які хочуть використовувати штучний інтелект, але не можуть дозволити собі відправити свої дані в чужу хмару. Лікарня з медичними картками, банк із транзакціями, юридична фірма з матеріалами справ, оператор енергомережі зі схемами підстанцій. У SystemOne ми щодня працюємо з хмарою, DevOps і безпекою, і я бачу, як змінилося саме питання. Раніше воно звучало «чи використовувати ШІ». Тепер — «де саме він працює і хто має доступ до всього, що він бачить».
Для критичних даних моя відповідь дедалі частіше однакова: відкрита модель, яка працює на вашому власному обладнанні, в ізольованому від інтернету контурі. Це і є суверенний ШІ в практичному, а не декларативному сенсі.
Що я маю на увазі під суверенним ШІ
Суверенність — це не гасло в презентації, а три конкретні умови:
- Відкриті ваги. Модель можна завантажити й запускати самостійно, без API постачальника. Важливо розрізняти: «відкриті ваги» (open weights) ще не означають «відкритий код і дані». Ліцензії суттєво відрізняються, а навчальні дані повністю розкривають лише одиниці.
- Власне обладнання. Інференс відбувається на серверах організації або країни — у власному дата-центрі чи в приватній або національній хмарі під вашою юрисдикцією.
- Ізоляція. У найсуворішому варіанті контур повністю відрізаний від інтернету (air-gapped): запити, документи, відповіді та журнали ніколи не залишають периметр.
Чому це важливо: незалежність, контроль, безпека
- Незалежність. Ви не залежите від цінової політики, змін умов використання, санкцій, геополітики чи рішення постачальника вивести модель з обігу. Модель, яку ви завантажили й перевірили, працюватиме стільки, скільки вам потрібно.
- Повний контроль і врядування. Ви вирішуєте, яку версію використовувати, коли оновлювати, які інструменти дозволено викликати моделі і що записується в журнал. Для аудиту це принципова різниця: ви показуєте не обіцянку постачальника, а власну конфігурацію.
- Безпека даних. Модель бачить те саме, що й ваші найчутливіші системи: персональні дані, комерційну таємницю, технічну документацію. Якщо обробка відбувається лише локально, зникає цілий клас ризиків — від витоку через третю сторону до доступу іноземних органів до даних.
- Безпека самої моделі. Ваги — теж актив, який можна підмінити чи «отруїти». У власному контурі ви контролюєте цілісність моделі так само, як цілісність будь-якого іншого критичного програмного забезпечення.
- Стійкість. Для України це не теорія: система, яка не залежить від зовнішнього каналу, продовжує працювати під час збоїв зв’язку чи атак на інфраструктуру.
Від держави до одного відділу
Рівень держави. Україна створює національну мовну модель «Сяйво». Розробку ведуть WINWIN AI Center of Excellence при Мінцифрі та «Київстар», в основі — відкрита модель Gemma 3 від Google. За даними DOU, у червні 2026 року зменшена версія перейшла до закритого тестування, повноцінну тестову модель очікують наприкінці року, а після валідації її планують відкрити. Інший показовий приклад — швейцарська Apertus від EPFL, ETH Zurich та CSCS: повністю відкрита модель (ваги, дані, рецепти навчання) під ліцензією Apache 2.0, яку автори прямо позиціонують як основу для суверенного ШІ.
Рівень союзу держав. ЄС розбудовує спільну обчислювальну інфраструктуру: зараз створюються 19 AI Factories та 13 пов’язаних із ними «антен», а 30 липня 2026 року EuroHPC оголосив тендер на створення до семи AI Gigafactories (пропозиції приймають до 12 листопада 2026 року). Паралельно консорціум OpenEuroLLM працює над відкритими багатомовними моделями. Логіка проста: спільні обчислення під європейською юрисдикцією і відкриті моделі, які можна розгорнути будь-де в цьому просторі.
Рівень організації чи відділу. Саме тут, на мою думку, найбільший практичний ефект. Кілька типових сценаріїв:
- лікарня, де модель на локальному сервері допомагає структурувати виписки й шукати по клінічних протоколах, а медичні дані не залишають мережу закладу;
- банк або страхова компанія, що аналізує договори та звернення клієнтів без передавання персональних даних у сторонні API;
- юридична фірма, яка будує пошук по власному архіву справ і зберігає адвокатську таємницю;
- оператор енергетики чи водоканалу, де асистент працює зі схемами, регламентами та журналами інцидентів в ізольованому сегменті технологічної мережі;
- міська рада, що опрацьовує звернення громадян і внутрішні документи на власній інфраструктурі;
- оборонні структури, для яких ізоляція — базова вимога, а не опція.
Як це побудувати: ключові підходи
1. Ізольований інференс на власному обладнанні
Базова схема — сервери з GPU у власному периметрі без вихідного доступу в інтернет. Модель, сервер інференсу, векторна база, застосунки та журнали живуть усередині. Якщо повна ізоляція не потрібна, альтернатива — приватна суверенна хмара або національні обчислювальні центри з чіткою юрисдикцією й договірним контролем.
2. Правильний розмір і квантизація
Найбільша модель — не завжди найкраща. Квантизація (FP8, FP4, 4–8-бітні формати) у рази зменшує вимоги до пам’яті з помірною втратою якості, а архітектури Mixture-of-Experts дають сотні мільярдів параметрів, з яких на кожен токен працює лише невелика частина. Починайте із задачі: для пошуку по документах і класифікації часто достатньо моделі на одному GPU, для складного аналізу й агентних сценаріїв потрібен сервер із кількома GPU.
3. Стек інференсу
Для серверного навантаження стандартом стали vLLM і SGLang, в інфраструктурі NVIDIA — також TensorRT-LLM. Для робочих станцій, ноутбуків і edge-пристроїв — llama.cpp та Ollama. Усі вони вміють надавати API, сумісний із поширеними клієнтами, тож застосунки не прив’язуються до конкретної моделі.
4. RAG над локальними даними
Найчастіше цінність дає не «розумніша модель», а доступ до ваших документів. Пошук із доповненням (RAG) з локальною векторною базою і локальною моделлю ембедингів дає відповіді на основі внутрішніх джерел. Критично важливо, щоб пошук ураховував права доступу: модель не повинна показати користувачу документ, який він не має права бачити.
5. Донавчання на власних даних
Коли потрібна специфічна термінологія чи формат, допомагає донавчання (наприклад, LoRA) на власних даних — теж усередині контуру. Але я раджу спочатку вичерпати можливості RAG і добрих інструкцій: це дешевше і простіше в супроводі.
6. Ланцюг постачання ваг
Ваги моделі — це програмне забезпечення з усіма ризиками ланцюга постачання. Мінімум перевірок: завантаження лише з офіційних репозиторіїв розробника (серед популярних моделей на Hugging Face вистачає модифікованих копій зі знятими обмеженнями), звірка контрольних сум і, де доступно, цифрових підписів, безпечний формат safetensors замість форматів, що можуть виконувати код, аналіз ліцензії та походження моделі, фіксація версій у внутрішньому реєстрі.
7. Доступ, журналювання, red teaming
Модель — це ще один привілейований сервіс. Потрібні вхід через корпоративні облікові записи, розмежування ролей, журналювання запитів і відповідей з урахуванням вимог до захисту даних, обмеження інструментів, які модель може викликати. І регулярне тестування на стійкість: prompt injection через документи, спроби витягнути дані, обхід політик. Корисні орієнтири — OWASP Top 10 для LLM-застосунків і MITRE ATLAS.
8. Оновлення в офлайн-середовищі
Ізоляція не означає «встановили й забули». Потрібен процес: окрема зона з доступом до інтернету для завантаження й перевірки нових моделей, контейнерів і залежностей; сканування та тестування на власному наборі задач; контрольоване перенесення в закритий контур через затверджений канал; можливість швидкого відкату. Тобто той самий дисциплінований change management, що й для будь-якої критичної системи.
Найсильніші відкриті моделі станом на початок жовтня 2026 року
Нижче — моделі, які на початку жовтня очолюють відкриті рейтинги LMArena (Text Arena, фільтр відкритих моделей) та Artificial Analysis (Intelligence Index, відкриті ваги), а також помітні компактні моделі з цих самих рейтингів. Розміри наведено за даними Artificial Analysis і карток моделей, ліцензії — за LMArena та картками моделей. Це орієнтир, а не рекомендація: перед вибором перевірте актуальний стан, повний текст ліцензії і результати на ваших задачах.
Рівень frontier: GPU-кластер або кілька найпотужніших серверів
- Kimi K3 (Moonshot AI) — 2,8 трлн параметрів, із них 104 млрд активних; власна ліцензія з окремими умовами для великих комерційних сервісів.
- MiMo-V2.6-Pro (Xiaomi) — близько 1 трлн / 42 млрд активних; MIT.
- GLM-5.3 (Z.ai) — 753 млрд / 40 млрд активних; MIT.
- DeepSeek V4 Pro — 1,6 трлн / 49 млрд активних; MIT.
- Qwen3.8-2.4T-A95B (Alibaba) — 2,4 трлн / 95 млрд активних; власна ліцензія, не Apache 2.0.
Середній рівень: один сервер із кількома GPU
- GLM-5.3 Flash (Z.ai) — 320 млрд / 18 млрд активних; MIT.
- DeepSeek V4.1 Flash — 552 млрд / 16 млрд активних; MIT.
- MiniMax-M3 — 428 млрд / 23 млрд активних; MiniMax Community License.
- Qwen3.5-397B-A17B (Alibaba) — Apache 2.0.
- NVIDIA Nemotron 3 Ultra — 550 млрд / 55 млрд активних; OpenMDW-1.1.
- Mistral Medium 3.5 (128 млрд; модифікована MIT) і Mistral Small 4 (119 млрд / 6,5 млрд активних; Apache 2.0) — європейські варіанти.
- gpt-oss-120b (OpenAI) — 117 млрд / 5,1 млрд активних; Apache 2.0. Не лідер рейтингів, але дуже економна в ресурсах.
Компактний рівень: один GPU, робоча станція, ноутбук, edge
- Qwen3.8 27B (Alibaba) — щільна модель на 27 млрд; Apache 2.0. Найсильніша компактна модель за Artificial Analysis.
- Gemma 4 (Google) — 31B, 26B A4B, 12B, а також E4B і E2B для пристроїв; Apache 2.0. Gemma 4 31B — найвища серед компактних моделей на LMArena.
- gpt-oss-20b (OpenAI) — Apache 2.0.
- NVIDIA Nemotron 3 Nano (30B A3B) — NVIDIA Open Model License.
- IBM Granite 4.2 (30B, 8B, 3B) — Apache 2.0.
- Apertus (8B і 70B) та Olmo 3.1 (Ai2, 32B) — Apache 2.0 і відкритість навчальних даних та процесу. Не лідери за якістю, але цінні там, де важлива прозорість походження.
Ще одне спостереження: значна частина лідерів відкритих рейтингів походить від китайських лабораторій. В ізольованому контурі модель не передає дані розробнику, але питання походження, вбудованих упереджень і регуляторних обмежень вашої галузі варто оцінити окремо й задокументувати.
Рейтинги змінюються щомісяця
За оцінкою Epoch AI, з початку 2026 року найкращі відкриті моделі відстають від найкращих закритих у середньому приблизно на чотири місяці. Лідери відкритих рейтингів змінюються буквально щомісяця: частини моделей зі списку вище ще пів року тому не існувало. Тому архітектуру варто будувати так, щоб модель можна було замінити без переписування застосунків: стандартизований API, власний набір тестових задач, відпрацьований процес перевірки й перенесення. Переглядати рейтинги й переоцінювати вибір я раджу щонайменше раз на квартал.
Про ширший контекст ризиків я писав у текстах про AI-загрози для бізнесу та колективний кіберзахист.
Де почитати більше
- LMArena — Text Arena, рейтинг відкритих моделей
- Artificial Analysis — порівняння відкритих моделей та загальний рейтинг
- Hugging Face — популярні моделі для генерації тексту
- Epoch AI — наскільки відкриті моделі відстають від закритих
- DOU — на якому етапі українська LLM «Сяйво»
- Apertus — повністю відкрита швейцарська модель
- Європейська комісія — AI Factories та тендер EuroHPC на AI Gigafactories
- OpenEuroLLM
- OWASP Top 10 для LLM-застосунків та MITRE ATLAS
- Документація стеку інференсу: vLLM, SGLang, llama.cpp, Ollama, TensorRT-LLM
Замість висновку
Якщо ви відповідаєте за критичну організацію — лікарню, банк, енергетичну компанію, державний орган чи громаду, — зверніть увагу на цю архітектуру вже зараз. Не тому, що хмарний ШІ поганий, а тому, що для певних даних ціна помилки занадто висока, щоб залежати від чужої інфраструктури. Почати можна з малого: одна задача, одна модель на одному сервері, власний набір тестів і чіткі правила доступу. Якщо знадобиться допомога з оцінкою чи архітектурою, буду радий допомогти — напишіть мені або в LinkedIn.