Sovereign AI Platform este un cluster de inferență LLM multi-node self-hosted, asociat cu o interfață web chat multi-user. Aceeași creștere de productivitate ca asistenții de chat publici — fără ca un singur prompt, atașament sau cunoștință internă a firmei să părăsească vreodată infrastructura voastră. În utilizare productivă activă.
Cazul pentru AI self-hosted nu este despre a replica fiecare funcție cloud. Este despre faptul simplu că fiecare prompt pe care echipa voastră îl tastează într-un asistent găzduit de furnizor este o bucată de context de business predată unei terțe părți — discuții strategice, muncă specifică clienților, cod în dezvoltare, drafturi de contract. Pentru cele mai multe organizații e acceptabil; pentru unele nu este.
| Caracteristică | Valoare |
|---|
| Hosting | Self-hosted pe un cluster de inferență multi-node, pe hardware-ul vostru |
| Modele | Modele open-weights best-in-class (instruction following, coding, multilingv). Comutabile din UI; operatorul decide ce modele sunt disponibile. |
| Interfață chat | UI web multi-user cu login, istoric de conversații, șabloane de prompt, comutare modele, upload de fișiere, chat retrieval-augmented pe propriul corpus de documente |
| API | API HTTP compatibil OpenAI — uneltele și integrările existente funcționează out of the box |
| Scalare | Orizontală: adaugi noduri de inferență pentru capacitate; nodurile împart storage-ul de modele |
| Disponibilitate | Load-balanced; fiecare nod poate prelua întregul trafic în timpul mentenanței |
| Model de cost | Hardware fix + curent electric — fără taxe per token, per utilizator sau per lună |
| Status | În producție |
flowchart LR
A[Utilizator] --> B[UI web self-hosted]
B --> C(("Load balancer"))
C --> D[Nod inferență A]
C --> E[Nod inferență B]
C --> F[Nod inferență C]
B <--> G[(DB vectorială · RAG)]
D <--> H[(Storage de modele partajat)]
E <--> H
F <--> H
B -.->|SSO| I[Identity provider]
Despre ce este vorba
Generația actuală de asistenți AI din cloud — ChatGPT, Claude, Gemini, Copilot — a schimbat felul în care se face munca de cunoaștere. Dar este și prin design un canal continuu de exfiltrare pentru tot ce introduce echipa acolo: prompt-uri, documente inserate, snippets de cod, date de clienți, drafturi de contract.
Termenii furnizorilor variază. Unii promit să nu antreneze pe date; unii oferă niveluri enterprise cu angajamente mai puternice; unii folosesc datele oricum, în mod curent, sub un alt nume. Chiar și acolo unde promisiunile de privacy sunt etanșe, conținutul continuă să trăiască pe infrastructura furnizorului — și este astfel accesibil prin ordin judecătoresc, cerere oficială, scurgere de date, pivot al furnizorului sau simplă greșeală de operare.
Sovereign AI Platform elimină acest canal. Inferența se întâmplă pe mașinile voastre; UI-ul de chat rulează în rețeaua voastră; indexul de documente pentru chat retrieval-augmented trăiește în storage-ul vostru de date. Creșterea de productivitate este aceeași; expunerea de date este zero.
Caracteristici operaționale
- 💬 Interfață chat multi-user. Login, istoric de conversații per utilizator, șabloane de prompt, model picker, upload de atașamente, input vocal, syntax highlighting pentru blocurile de cod. Aceeași experiență modernă pe care echipa o cunoaște din asistenții de chat publici.
- 🤖 Modele open-weights best-in-class. Un set curat de modele open-weights actuale pentru instruction following, coding, muncă multilingvă și raționament. Operatorul decide ce modele sunt expuse în UI. Modele noi pot fi adăugate după release.
- 📚 Chat retrieval-augmented pe documentele voastre. Încărcați documente interne, contracte, baze de cunoștințe, manuale — platforma le indexează local și oferă răspunsuri retrieval-augmented. Documentele rămân în storage-ul vostru; modelul de embedding este local; baza de date vectorială este locală.
- 🔌 API compatibil OpenAI. Endpointul expune același API HTTP ca și serviciul public OpenAI. Integrările existente (pluginuri IDE, instrumente proprii, aplicații interne) funcționează prin schimbarea unui URL.
- 🌐 Cluster de inferență multi-node. Două sau mai multe noduri de inferență în spatele unui load balancer. Fiecare nod poate servi sarcina completă; rolling restarts și update-uri de model rulează fără downtime vizibil pentru utilizatori.
- 🔐 Autentificare și separare de roluri. SSO prin LDAP, SAML sau OIDC către identity providerul existent. Acces bazat pe roluri — cine vede ce modele, cine are voie să încarce documente în corpusul partajat, cine are voie să administreze.
- 📝 Audit trail al conversațiilor. Istoric de conversații per utilizator conform politicii voastre de retenție. Audit log opțional pe partea de admin pentru cazuri de compliance.
- 🚦 Rate limits și quote. Quote per utilizator, per echipă sau per model — împiedică un utilizator zgomotos sau o integrare să monopolizeze clusterul.
- 🔄 Management de ciclu de viață al modelelor. Operatorii pot pula, testa și rola noi versiuni de model fără downtime. Rollback instantaneu, când o nouă versiune regresează pe benchmark-urile interne.
- 📊 Observability. Latență per model, debit, consum de token, utilizare GPU ca metrici. Exportere Prometheus; dashboard-uri Grafana, gata de conectat la monitoringul existent.
Clusterul rulează active/active: mai multe noduri de inferență sunt accesibile prin un singur endpoint load-balanced; fiecare nod ține o copie a modelului activ în memorie; cererile noi sunt rutate către nodul cel mai puțin încărcat.
- Scalare de capacitate. Adaugi noduri pentru a crește debitul de utilizatori / token-uri simultane. Debitul scalează aproape liniar cu numărul de noduri, până când intervin limitele de încărcare a modelelor și de bandwidth de memorie.
- HA. Fiecare nod poate fi drenat pentru patch-uri OS, update-uri de driver GPU sau mentenanță hardware, fără a întrerupe utilizatorii. Load balancerul rutează în jur.
- Storage de modele. Modelele stau pe storage partajat (NFS, S3 sau cluster filesystem), astfel încât toate nodurile văd același catalog. Adăugarea unui nou model în store-ul partajat îl face disponibil cluster-wide.
- Vector store pentru RAG. Un nod de bază de date dedicat separat ține embedding-urile de documente pentru chat retrieval-augmented. Replicat pentru HA; doar citire de la nodurile de inferență.
- Independent de API-uri cloud. Fără dependență externă pentru inferență. Clusterul rulează mai departe prin orice cădere de internet, întrerupere de furnizor sau eveniment de reglementare care lovește furnizorii cloud AI.
Cazuri tipice de utilizare
- 🏢 Înlocuirea asistenților chat publici pentru utilizare internă. Aceeași creștere de productivitate pentru echipă — drafturi, rezumate, ajutor de codare, traducere, cercetare — fără ca contextul de business să părăsească perimetrul.
- ⚖️ Muncă privilegiată. Drept, M&A, audit, drafturi executive — muncă ce pur și simplu nu are voie să treacă prin infrastructura unui furnizor, din motive de confidențialitate, privilegiu sau reglementare.
- 🩺 Sectoare reglementate. Sănătate, consultanță financiară, asigurări — sectoare în care discuția de audit despre „unde merg datele?" devine trivială imediat ce răspunsul este „nicăieri".
- 🔐 Cod sensibil IP. Echipe de engineering care au nevoie de asistență AI dar nu au voie să-și trimită codul proprietar către un asistent de la o terță parte. Inferența self-hosted oferă aceeași capabilitate „sugerează linia următoare" pe propriul codebase, fără exfiltrare.
- 📚 Asistent intern de cunoștințe. Indexează wiki-ul, sistemul de ticketing, runbook-urile și un deceniu de procese-verbale de board — și oferă o interfață chat în care orice angajat poate pune întrebări și primește răspunsuri citate, fără ca acest conținut să părăsească firma.
- 🤝 Funcții AI orientate către client. Construirea unui asistent pentru clienți sau a unei funcții AI in-product fără a plăti per token, fără a trimite date de clienți la o terță parte și fără ca roadmap-ul vostru să fie legat de schimbările de preț sau politică ale unui furnizor.
- 🌍 Medii constrânse geopolitic. Acolo unde utilizarea unui furnizor AI cu sediul în SUA sau China nu este acceptabilă juridic sau politic, sovereign self-hosted este singura opțiune.
De ce este o temă de CEO
- 💰 Traiectoria de cost. Asistenții AI din cloud facturează per utilizator per lună (20–60 €) plus taxe API per token. La 200 de angajați care folosesc instrumente AI zilnic, costurile anuale sunt 60–200 k € și cresc odată cu adopția. Self-hosted este o investiție fixă în hardware (20–80 k € în funcție de mărimea clusterului) plus curent — break-even tipic sub 18 luni.
- 🛡️ Suveranitatea prompt-urilor. Fiecare prompt pe care echipa voastră îl tastează într-un asistent cloud este business intelligence predat acelui furnizor. Termenii furnizorului nu sunt problema — existența canalului este problema. Eliminarea canalului elimină clasa de riscuri pe care o generează.
- 📋 Vânt regulator în spate. RGPD, regulamentul UE privind AI, guvernanță AI sectorială — toate se reduc la întrebarea ce date sunt trimise către ce furnizor AI? Răspunsul „niciuna" este singurul răspuns care scalează peste jurisdicții.
- 🔓 Vendor lock-in rezolvat. Furnizorii cloud AI deprezează curent modele, schimbă prețuri, restricționează use case-uri sau pivotează strategic. Capabilitatea voastră AI nu trebuie să depindă de cum cade una dintre aceste decizii. Self-hosted permite să alegi, testezi și schimbi modele după propriul calendar.
- 🤝 Încrederea clientului. Dacă integrați funcții AI în produsul vostru, „datele voastre nu părăsesc niciodată infrastructura noastră" este un avantaj comercial material pe piețe reglementate.
- 🔗 Integrare cu restul stack-ului. Același identity provider, același monitoring, aceleași garanții de data residency ca restul ansamblului de platforme suverane — fără relație separată de furnizor cu obligații separate de compliance.
- ⏱️ Continuitate. Căderile și schimbările de politică la marii furnizori cloud AI au paralizat repetat în ultimele 24 de luni workflow-uri ale clienților. Un cluster self-hosted elimină acest risc sistemic.
Fundament tehnologic
Construit pe ecosistemul matur de inferență AI open source, cu disciplină operațională în jurul clusteringului, observability și ciclului de viață al modelelor.
| Strat | Realizare |
|---|
| Motor de inferență | llama.cpp — inferență open source rapidă, auditată, larg utilizată pentru LLM-uri open-weights. CPU, CUDA, ROCm, Apple Silicon susținute. |
| Inferență alternativă | vLLM pentru servire batched de mare debit, când sunt disponibile noduri GPU-dense |
| Interfață web chat | OpenWebUI — multi-user, istoric conversații, upload fișiere, șabloane prompt, comutare modele |
| API gateway | API HTTP compatibil OpenAI, expus de stratul de inferență; clienții existenți funcționează neschimbat |
| Modele | Modele open-weights din catalogul actual best-in-class — Llama, Mistral, Qwen, DeepSeek, Gemma. Operatorul alege ce este expus. |
| Model de embedding | Model sentence embedding local pentru indexul de documente — fără apeluri de embedding către servicii externe |
| Bază de date vectorială | Qdrant, Weaviate sau pgvector — alegerea voastră pe baza stack-ului de storage existent |
| Load balancer | nginx sau HAProxy în fața nodurilor de inferență; rutare least-conn |
| Storage de modele | NFS partajat sau object store S3-compatibil, accesibil tuturor nodurilor de inferență |
| Integrare identity | Bridge LDAP / SAML / OIDC către identity providerul existent |
| Observability | Exportere Prometheus pentru latența inferenței, debitul de token-uri, utilizarea GPU, adâncimea cozii, utilizarea per model. Dashboard-uri Grafana. |
| Container runtime | Podman sau Docker — fiecare nod de inferență rulează aceeași imagine; nodurile sunt interschimbabile. |
Scrie-ne și schițăm un deployment potrivit cu volumul vostru tipic de utilizatori simultani, cerințele de mărime a modelelor și nevoile de integrare cu restul ansamblului de platforme.