AI Visibility Lab · Articole
Cuvânt-cheie vs frază în AI Search: query rewriting, tokenizare și ce putem spune corect despre limba română
Cum rescriu ChatGPT Search și Google AI Search interogările, ce este query fan-out, cum funcționează tokenizarea și de ce diferențele dintre limbi trebuie măsurate cu tokenizerul real, nu estimate din octeți.
Alex Matescu · Fondator și coordonator AI Visibility Lab
Publicat: · Actualizat: · Ultima verificare factuală:
În AI Search, formularea tastată de utilizator nu este neapărat interogarea trimisă mai departe către un motor de căutare. OpenAI documentează că ChatGPT Search poate rescrie promptul într-una sau mai multe interogări țintite, iar Google documentează pentru AI Overviews și AI Mode tehnica de query fan-out, prin care modelul poate genera mai multe căutări conexe. Asta nu înseamnă însă că există o nouă regulă de tip „optimizează pentru query-ul intern". Din perspectiva publisherului, strategia robustă rămâne să acoperi intenția utilizatorului, să folosești terminologia clară și canonică atunci când este relevantă și să construiești conținut suficient de explicit pentru a putea fi regăsit prin mai multe formulări.123
Acest articol separă trei lucruri care sunt ușor de confundat:
- cum este formulată cererea de utilizator;
- cum poate fi rescrisă sau descompusă pentru retrieval;
- cum este tokenizat textul de model.
Sunt mecanisme diferite și nu trebuie folosite unul ca dovadă pentru altul.
Cuvânt-cheie, frază și sens
Un index inversat este un mecanism fundamental al regăsirii lexicale: pentru termeni sau unități indexate, sistemul poate identifica documentele în care apar.
Dar motoarele moderne nu sunt doar motoare de exact matching.
Google documentează sisteme precum BERT, neural matching și RankBrain, folosite pentru înțelegerea relației dintre cuvinte, concepte și intenția interogării. RankBrain permite Google să returneze conținut relevant chiar și atunci când pagina nu conține toate cuvintele exacte introduse în căutare.4
Așadar, opoziția corectă nu este:
„SEO clasic = cuvinte exacte; AI = sens."
Mai corect este:
sistemele moderne combină mai multe forme de reprezentare și regăsire, iar exact matching-ul rămâne util în anumite contexte fără să fie singurul mecanism.
Această distincție dintre ce rămâne valabil din SEO clasic și ce se schimbă complet este tratată separat, în detaliu, în SEO vs GEO.
Când contează termenul exact
Termenii exacți sunt deosebit de utili pentru:
- nume proprii;
- modele de produs;
- coduri;
- acronime;
- denumiri tehnice;
- entități a căror formulare trebuie dezambiguizată.
Dar „termen exact util" nu înseamnă „termen exact obligatoriu pentru ranking".
Ce face ChatGPT Search cu interogarea
OpenAI publică astăzi o informație care înainte trebuia doar presupusă.
În documentația ChatGPT Search, OpenAI spune că atunci când Search lucrează cu furnizori de căutare, sistemul rescrie de regulă promptul într-una sau mai multe interogări țintite. OpenAI oferă inclusiv exemple în care o întrebare conversațională mai lungă este transformată într-un query mai focalizat, după care pot urma alte interogări mai specifice.1
Asta confirmă query rewriting.
Nu confirmă însă că:
- fiecare prompt este rescris;
- query-ul intern este întotdeauna mai scurt;
- query-ul este întotdeauna mai tehnic;
- publisherul poate cunoaște din exterior formularea exactă;
- există o formulă stabilă după care ChatGPT rescrie orice prompt.
Ce face Google: query fan-out
Google documentează explicit pentru AI Overviews și AI Mode o tehnică numită query fan-out.
În ghidul său pentru AI features, Google spune că sistemele pot emite mai multe căutări relaționate pe subiecte și surse de date diferite pentru a construi răspunsul.2
În ghidul publicat în 2026 pentru optimizarea în Search cu AI generativ, Google definește query fan-out drept un set de interogări concurente și relaționate, generate de model pentru a obține informații suplimentare.3
Google nu publică un număr universal de sub-interogări.
Prin urmare, afirmații precum „AI Mode generează între 8 și 16 subqueries" nu trebuie tratate drept specificație Google dacă nu există o sursă oficială pentru interval.
Un model conceptual al traseului
Pentru a înțelege fenomenul, putem folosi un model conceptual, fără a pretinde că descrie codul intern al tuturor providerilor.
1. Cererea utilizatorului
Utilizatorul formulează o problemă în limbaj natural.
2. Interpretarea
Sistemul identifică intenția, constrângerile și contextul relevant.
3. Query rewriting / fan-out, dacă este necesar
În produsele care folosesc search, sistemul poate genera una sau mai multe interogări auxiliare.
4. Retrieval
Sunt recuperate documente sau fragmente candidate.
5. Selecție și ranking/reranking
Sistemul poate ordona și filtra candidații folosind mecanisme proprii. Semnalele de încredere, structură și autoritate care influențează această selecție sunt tratate separat în cum aleg motoarele AI ce citează.
6. Generare
Modelul compune răspunsul pe baza contextului disponibil și, în suprafețele care oferă citări, poate afișa sursele relevante.
Important: pașii de mai sus sunt o schemă explicativă. Implementările exacte ale ChatGPT Search, Google AI Mode, Perplexity, Claude sau Gemini nu sunt publicate integral.
Promptul utilizatorului și query-ul de search nu au o lungime fixă
Două studii comerciale sunt utile pentru a arăta că există diferențe între tipurile de interacțiune, dar cifrele lor nu trebuie transformate în constante ale produsului.
Semrush — clickstream, 2025
Semrush a publicat în februarie 2025 o analiză bazată pe peste 80 de milioane de înregistrări clickstream din a doua jumătate a lui 2024.8
În acel dataset:
- prompturile fără SearchGPT aveau în medie 23 de cuvinte;
- interacțiunile cu SearchGPT aveau în medie 4,2 cuvinte.
Aceste valori descriu comportamentul utilizatorilor observat de Semrush în perioada respectivă, nu query-urile interne generate de OpenAI.
Mai mult, un studiu Semrush mai nou, publicat în aprilie 2026, arată că lungimea prompturilor s-a schimbat substanțial în timp: pentru ianuarie-februarie 2026, prompturile care declanșau search aveau în medie 8,7 cuvinte, iar cele fără search 13,5 cuvinte în datasetul lor din SUA.9
Asta arată de ce nu trebuie construită o regulă GEO pe o medie dintr-un singur moment.
Nectiv — queries observate, 2025
Nectiv a publicat un studiu comercial pe peste 8.500 de prompturi din nouă industrii.10
În datasetul lor:
- 31% dintre prompturi au declanșat cel puțin o căutare;
- media a fost 2,17 căutări pentru prompturile care au declanșat search;
- query-urile observate aveau în medie 5,48 cuvinte;
- 77% aveau cel puțin cinci cuvinte.
Aceste cifre sunt utile ca observație industrială, nu ca documentație oficială a arhitecturii ChatGPT.
Concluzia pentru conținut: nu optimiza pentru un query intern pe care nu îl vezi
Versiunea inițială a acestui articol spunea:
„optimizezi pentru interogarea generată, nu pentru cea tastată."
Formularea este prea puternică.
Google avertizează explicit împotriva producerii de pagini separate pentru fiecare posibilă variație de search sau fan-out query doar pentru a manipula rankingul sau răspunsurile generative.3
O recomandare mai robustă este:
nu optimiza exclusiv pentru formularea literală a promptului. Acoperă intenția, termenii canonici ai subiectului, entitățile relevante și formulările naturale prin care aceeași problemă poate fi descrisă.
Astfel, documentul are șanse să rămână relevant indiferent dacă retrieval-ul pornește de la query-ul original, de la o rescriere sau de la mai multe fan-out queries.
Ce este un token
Un token nu este sinonim cu „un cuvânt" și nici cu „un caracter".
OpenAI descrie tokenii drept secvențe comune de caractere, iar pentru numărare programatică publică biblioteca open-source tiktoken.56
tiktoken folosește Byte Pair Encoding (BPE). Pentru encodingul o200k_base, textul este pre-segmentat prin reguli Unicode-aware, apoi secvențele de bytes sunt combinate conform vocabularului și rangurilor BPE.6
Aceasta are două consecințe:
- aceeași lungime în caractere nu garantează același număr de tokeni;
- același text poate avea un număr diferit de tokeni în encodings diferite.
În repository-ul oficial tiktoken, OpenAI mapează în prezent gpt-5, gpt-4.1, gpt-4o, o1, o3 și alte familii moderne la o200k_base, în timp ce modele GPT-4/GPT-3.5 mai vechi folosesc cl100k_base.7
Experimentul de tokenizare: metoda corectă
Versiunea inițială a articolului folosea octeții UTF-8 drept proxy pentru costul în tokeni și concluziona că româna ar „costa" aproximativ 19% mai mult decât engleza.
Acea concluzie este retrasă.
Numărul de bytes nu este numărul de tokeni și nu reprezintă o limită inferioară a numărului de tokeni. BPE poate combina mai mulți bytes într-un singur token. OpenAI oferă tocmai tiktoken pentru numărarea efectivă a tokenilor.65
Corpusul de test
Pentru ca experimentul să fie reproductibil, trebuie publicate textele efective, nu doar rezultatul agregat.
Setul propus pentru această revizie este:
Perechea 1 — local search
Română:
Caut un service auto în Sibiu care poate verifica astăzi martorul de motor aprins la un Volkswagen Golf.
Engleză:
I am looking for a car service in Sibiu that can check the illuminated engine warning light on a Volkswagen Golf today.
Perechea 2 — business
Română:
Compania noastră produce componente industriale în România și caută clienți noi în Germania prin canale digitale.
Engleză:
Our company manufactures industrial components in Romania and is looking for new customers in Germany through digital channels.
Perechea 3 — AI Visibility
Română:
Vreau să aflu de ce site-ul companiei apare în Google, dar este citat rar în răspunsurile sistemelor de inteligență artificială.
Engleză:
I want to understand why the company website appears in Google but is rarely cited in artificial intelligence system responses.
Traducerile sunt semantic echivalente, nu identice ca structură. Asta este o limită inevitabilă a comparației între limbi.
Scriptul reproductibil
import tiktoken
samples = {
"ro_1": "Caut un service auto în Sibiu care poate verifica astăzi martorul de motor aprins la un Volkswagen Golf.",
"en_1": "I am looking for a car service in Sibiu that can check the illuminated engine warning light on a Volkswagen Golf today.",
"ro_2": "Compania noastră produce componente industriale în România și caută clienți noi în Germania prin canale digitale.",
"en_2": "Our company manufactures industrial components in Romania and is looking for new customers in Germany through digital channels.",
"ro_3": "Vreau să aflu de ce site-ul companiei apare în Google, dar este citat rar în răspunsurile sistemelor de inteligență artificială.",
"en_3": "I want to understand why the company website appears in Google but is rarely cited in artificial intelligence system responses."
}
for encoding_name in ("o200k_base", "cl100k_base"):
enc = tiktoken.get_encoding(encoding_name)
print(f"\n{encoding_name}")
for name, text in samples.items():
print(
name,
"tokens=", len(enc.encode(text)),
"chars=", len(text),
"bytes=", len(text.encode("utf-8"))
)
De ce nu public aici o cifră neverificată
În mediul în care a fost făcută această revizie nu a fost disponibil local pachetul tiktoken împreună cu assetul o200k_base, iar accesul de rețea necesar descărcării lui nu a fost disponibil.
Prin urmare, nu introduc în articol rezultate de tokenizare pe care nu le-am executat și verificat efectiv.
Aceasta este o schimbare deliberată față de versiunea precedentă: mai bine un experiment complet reproductibil fără o cifră inventată decât un procent precis obținut dintr-un proxy greșit.
Pentru publicarea unei versiuni cu rezultate numerice, scriptul de mai sus trebuie rulat cu versiunea tiktoken notată în metodologie, iar outputul brut trebuie păstrat alături de articol.
Ce putem spune deja despre tokenizarea multilingvă
Fără să inventăm o cifră pentru română în o200k_base, există câteva concluzii mai generale bine susținute.
OpenAI spune că encodings diferite pot tokeniza diferit același text și oferă o200k_base ca encoding modern pentru mai multe familii recente.57
Cercetarea multilingvă arată de asemenea că eficiența tokenizării poate varia semnificativ între limbi și între tokenizatoare. Aceasta nu este o proprietate simplă de tipul „non-engleza costă întotdeauna mai mult", ci depinde de tokenizer, vocabular, script și textul concret.
Pentru română există cercetări care arată că tokenizatoarele specializate pot reduce fragmentarea față de unele modele multilingve, dar aceste rezultate nu pot fi transferate automat către o200k_base.11
Concluzia corectă este:
dacă vrei să afli dacă româna folosește mai mulți tokeni decât engleza într-un anumit model, măsoară texte paralele cu tokenizerul exact al acelui model.
Octeții UTF-8 și diacriticele
Măsurarea octeților poate fi păstrată doar ca observație despre encodingul UTF-8.
Caractere ASCII precum a folosesc un byte în UTF-8, în timp ce multe caractere românești precum ă, â, î, ș, ț sunt reprezentate prin mai mulți bytes.
Asta poate face versiunea română a unui text mai mare în bytes.
Dar:
mai mulți bytes nu implică automat mai mulți tokeni în aceeași proporție.
Un token BPE poate reprezenta mai mulți bytes.
Prin urmare, formulările „diacriticele adaugă X% cost" sau „româna are X% cost suplimentar" nu trebuie folosite fără măsurătoare directă de tokens și, dacă discutăm bani, fără pricingul efectiv al modelului.
Ș versus ş: problema reală este consistența Unicode
În româna modernă, forma corectă este:
ș— U+0219, LATIN SMALL LETTER S WITH COMMA BELOW;ț— U+021B, LATIN SMALL LETTER T WITH COMMA BELOW.
Formele legacy sunt:
ş— U+015F, LATIN SMALL LETTER S WITH CEDILLA;ţ— U+0163, LATIN SMALL LETTER T WITH CEDILLA.
Unicode explică explicit că variantele cu virgulă dedesubt sunt reprezentările preferate pentru limba română și că formele cu sedilă apar în multe date legacy.12
La nivel de codepoint și bytes, ele sunt diferite.
Dar de aici nu rezultă că Google sau un sistem AI creează două „jumătăți de semnal" sau două indexuri SEO independente.
Mai mult, Unicode recomandă ca implementările care procesează date românești să trateze variantele legacy și moderne ca echivalente în contextul procesării limbii române.12
Recomandarea practică
Normalizează conținutul către:
ș;ț.
Motivul este:
- consistența datelor;
- search intern;
- deduplicare;
- procesare downstream;
- copiere/lipire;
- calitatea editorială.
Nu pentru că există o penalizare Google documentată pentru sedilă.
Flexiunea românească
Româna are mai multe forme de suprafață pentru același lexem:
- consultant;
- consultantul;
- consultantului;
- consultanți;
- consultanții;
- consultanților.
Aceasta este o proprietate lingvistică relevantă pentru search, dar nu trebuie transformată într-o regulă de keyword stuffing.
Google spune că RankBrain și neural matching pot relaționa cuvintele cu concepte și pot returna pagini relevante chiar fără toate cuvintele exacte.4
De aceea:
nu este necesar să introduci mecanic toate formele unui substantiv într-o pagină.
Mai util este să scrii natural și complet. Într-un text bun, variația morfologică apare firesc atunci când contextul o cere.
Nu există în acest articol o bază pentru afirmația că lematizarea Google este „mai slabă în română decât în engleză", așa că această afirmație a fost eliminată.
Exemple practice
Service auto
Query scurt:
service auto Sibiu
Cerere conversațională:
Mi s-a aprins martorul de motor la un Golf și sunt în Sibiu. Unde îl pot verifica astăzi?
Un sistem de AI Search poate rescrie sau descompune această cerere în una sau mai multe căutări despre:
- service auto;
- locație;
- model;
- simptom;
- disponibilitate.
Nu știm însă din exterior exact ce query va genera pentru fiecare execuție.
Contabilitate
Query scurt:
contabil SRL Sibiu
Cerere conversațională:
Am un SRL cu angajați și vreau să înțeleg ce obligații fiscale se schimbă anul acesta și când am nevoie de ajutorul unui contabil.
Consultanță B2B
Query scurt:
consultant marketing industrial
Cerere conversațională:
Avem o firmă de producție din România, vindem în Germania și vrem să înțelegem de ce clienții noi nu ne găsesc online.
Diferența utilă nu este „keyword versus sentence" ca două lumi separate.
Este:
categorie versus situație contextualizată.
Un document bun poate acoperi ambele fără să creeze câte o pagină pentru fiecare posibil fan-out query.
Ce faci concret
Folosește terminologia canonică atunci când este relevantă
Dacă explici un concept cu un nume consacrat, folosește numele explicit.
Nu pentru că exact match-ul este obligatoriu, ci pentru claritate și dezambiguizare.
Explică situațiile în care conceptul devine relevant
Un articol despre „canonical URL" poate conține și întrebarea reală:
„De ce Google indexează homepage-ul în locul paginii mele interioare?"
Asta leagă termenul tehnic de problema utilizatorului.
Nu construi pagini pentru fiecare query imaginabil
Google recomandă people-first content și avertizează împotriva producerii de volume de pagini pentru variații de query sau fan-out doar pentru manipularea rankingului.3
Folosește heading-uri descriptive
Un heading bun spune ce problemă rezolvă secțiunea.
De exemplu:
„Cum verific dacă pagina mea are canonical greșit?"
este mai informativ decât:
„Canonical".
Asta îmbunătățește structura pentru utilizator și face secțiunea mai ușor de identificat.
Nu garantează citarea AI.
Normalizează Unicode
Folosește formele românești moderne ș și ț în conținut și în datele pe care le controlezi.
Măsoară tokenii cu tokenizerul exact
Nu folosi:
- bytes;
- caractere;
- cuvinte;
ca substitut pentru token count atunci când costul sau context window-ul depind de tokeni. Termenii folosiți în acest articol (query rewriting, query fan-out, tokenizare, entitate) sunt explicați și în glosarul GEO/AEO.
Întrebări frecvente
ChatGPT Search caută exact promptul pe care îl scriu?
Nu neapărat. OpenAI spune că ChatGPT Search poate rescrie promptul într-una sau mai multe interogări țintite atunci când lucrează cu furnizori de search.1
Google AI Mode folosește mai multe căutări pentru aceeași întrebare?
Poate. Google documentează query fan-out pentru AI Mode și AI Overviews: modelul poate genera multiple interogări relaționate pentru a recupera informații suplimentare.23
Trebuie să optimizez pagina pentru query-urile generate intern?
Nu ca listă de keywords sau pagini separate. Google recomandă conținut util și people-first și avertizează împotriva producerii de pagini pentru fiecare variație posibilă de query fan-out.3
Româna folosește mai mulți tokeni decât engleza?
Nu există o cifră universală. Rezultatul depinde de tokenizer, model, text și traducere. Pentru OpenAI, comparația trebuie măsurată cu encodingul relevant, de exemplu o200k_base pentru familiile mapate oficial la el.7
Mai mulți bytes în UTF-8 înseamnă mai mulți tokeni?
Nu. Tokenizarea BPE combină secvențe de bytes în tokeni. Byte count și token count sunt măsuri diferite.6
Este greșit să folosesc ş și ţ în loc de ș și ț?
Pentru româna modernă, Unicode preferă ș și ț, cu virgulă dedesubt. Formele cu sedilă apar în date legacy și sunt codepoint-uri distincte, dar Unicode recomandă echivalarea lor în procesarea datelor românești.12
Surse și metodologie
Surse primare
Pentru mecanismele produselor au fost folosite cu prioritate:
- OpenAI Help Center pentru ChatGPT Search;
- repository-ul oficial OpenAI
tiktoken; - OpenAI Tokenizer;
- Google Search Central pentru query fan-out și ranking systems;
- Unicode Standard pentru caracterele românești.
Studii comerciale
Semrush și Nectiv sunt folosite numai pentru observații asupra propriilor dataseturi.
Cifrele lor nu sunt prezentate drept specificații OpenAI.
Experimentul de tokenizare
Versiunea veche bazată pe UTF-8 bytes este retrasă ca măsurătoare de cost în tokeni.
Noua metodă:
- publică textele efective;
- folosește
o200k_baseșicl100k_base; - păstrează outputul brut;
- compară perechi semantic echivalente;
- raportează separat caractere, bytes, words și tokens;
- nu extrapolează rezultatul din trei perechi la întreaga limbă română.
În această revizie nu sunt publicate token counts neexecutate. Mediul de revizie nu a avut disponibil local assetul o200k_base necesar pentru rularea tiktoken, iar accesul necesar descărcării lui a fost indisponibil. Scriptul de reproducere este inclus tocmai pentru ca rezultatul numeric să poată fi adăugat numai după o rulare reală, nu estimat.
Surse
- OpenAI Help Center — „ChatGPT Search", verificat la 19 august 2026. OpenAI documentează că, atunci când folosește furnizori de search, ChatGPT Search rescrie de regulă promptul în una sau mai multe interogări țintite și poate trimite queries suplimentare: help.openai.com/…/chatgpt-search
- Google Search Central — „AI Features and Your Website", verificat la 19 august 2026. Google documentează folosirea query fan-out în AI Overviews și AI Mode — interogări multiple, relaționate, pe subiecte și surse de date diferite: developers.google.com/…/ai-features
- Google Search Central — „Optimizing your website for generative AI features on Google Search", 2026, verificat la 19 august 2026. Definește query fan-out ca set de interogări concurente și relaționate, generate de model; avertizează că producerea de pagini pentru fiecare variație posibilă de query, doar pentru manipularea rankingului sau a răspunsurilor generative, încalcă politica anti-abuz de conținut la scară a Google: developers.google.com/…/ai-optimization-guide
- Google Search Central — „A Guide to Google Search Ranking Systems", verificat la 19 august 2026. Documentează BERT, neural matching și RankBrain; Google spune explicit că RankBrain ajută la găsirea conținutului relevant chiar când nu conține toate cuvintele exacte ale query-ului: developers.google.com/…/ranking-systems-guide
- OpenAI Platform — „Tokenizer", verificat la 19 august 2026. Descrie tokenii drept secvențe comune de caractere și trimite spre
tiktokenpentru numărare programatică: platform.openai.com/tokenizer - OpenAI — „tiktoken", repository oficial GitHub, verificat la 19 august 2026. Biblioteca open-source BPE folosită pentru tokenizarea modelelor OpenAI; pentru
o200k_base, pattern-ul de pre-tokenizare folosește clase Unicode (\p{L},\p{N},\p{M}) înainte de aplicarea merge-urilor BPE: github.com/openai/tiktoken - OpenAI
tiktoken— „model.py", verificat la 19 august 2026. Mappingul curent asociază familii precumgpt-5,gpt-4.1,gpt-4o,o1șio3cuo200k_base, iar familiilegpt-4/gpt-3.5-turbomai vechi cucl100k_base: github.com/openai/tiktoken/…/model.py - Semrush — „New Semrush Study Reveals ChatGPT Search Trends: Insights from 80 Million Clickstream Records", 3 februarie 2025. Studiu comercial pe peste 80 de milioane de linii clickstream din a doua jumătate a lui 2024; 23 cuvinte medie fără SearchGPT și 4,2 cuvinte cu SearchGPT în datasetul analizat: semrush.com/news/…/80-million-clickstream-records
- Semrush — „ChatGPT traffic analysis: Insights from 17 months of clickstream data", 7 aprilie 2026. Studiu comercial pe peste un miliard de linii de clickstream din SUA, octombrie 2024–februarie 2026. Pentru ianuarie-februarie 2026 raportează 8,7 cuvinte pentru prompts care au declanșat search și 13,5 pentru cele fără search: semrush.com/blog/chatgpt-search-insights
- Nectiv / date relatate de Search Engine Land — „ChatGPT performs a search in 31% of prompts, new data reveals", octombrie 2025. Studiu comercial pe 8.500+ prompts din nouă industrii; 31% dintre prompturi au declanșat cel puțin o căutare, 2,17 căutări medie pentru cele care au declanșat search, 5,48 cuvinte/query și 77% cu minimum cinci cuvinte în datasetul analizat: searchengineland.com/chatgpt-search-prompts-data-463407
- Dumitrescu et al. / literatura Romanian BERT, discutată și în „A Lite Romanian BERT: ALR-BERT", Computers 2022. Raportează diferențe de fertility între tokenizatoare românești și multilingve pe corpusurile evaluate; nu este o măsurătoare
o200k_base: mdpi.com/2073-431X/11/4/57 - Unicode Standard, Chapter 7 — „European Alphabetic Scripts", verificat la 19 august 2026. Documentează U+0219/U+021B pentru română, formele legacy U+015F/U+0163 și recomandarea de a le trata echivalent la procesarea datelor românești: unicode.org/…/chapter-7
Notă de volatilitate
Query rewriting, query fan-out, mappingul modelelor către encodings și comportamentul produselor AI se pot modifica. Afirmațiile despre OpenAI și Google descriu starea documentată la 19 august 2026 — dată la care sursele de mai sus au fost reverificate live, fără schimbări față de starea consemnată inițial la 11 august 2026.
Articol publicat de AI Visibility Lab, proiect independent de cercetare aplicată și documentare în AI Visibility, GEO și AEO, fondat și coordonat de Alex Matescu. Ultima verificare factuală și a surselor: 19 august 2026.