Articole

    AI Visibility Lab · Articole

    Public nu mai înseamnă accesibil: de ce fiecare sistem AI vede un internet diferit

    De ce ChatGPT, Claude, Gemini, Grok și alte sisteme AI pot recupera informații diferite din același internet. Explicăm crawling, training, retrieval, acces nativ, conectori și o metodă exploratorie de Source Accessibility Mapping.

    · Fondator și coordonator AI Visibility Lab

    Publicat: · Ultima verificare factuală:

    Faptul că o informație este publică nu garantează că fiecare sistem AI o poate găsi, recupera sau folosi într-un răspuns. ChatGPT, Claude, Gemini, Grok sau un agent conectat la aplicațiile unei companii pot ajunge la surse diferite, pe căi diferite, în momente diferite. Diferența nu este doar între modele; este și între infrastructurile prin care informația ajunge la ele.

    În primul articol al seriei, am introdus machine accessibility: capacitatea sistemelor AI de a descoperi, accesa, interpreta, verifica și utiliza informația despre o entitate. Acum restrângem problema la o întrebare esențială: accesibilă pentru cine, prin ce mecanism și în ce condiții?

    Unde se încadrează în serie: din modelul în șapte niveluri propus în primul articol (Presence → Discoverability → Accessibility → Understanding → Verifiability → Recommendability → Actionability), acest articol tratează nivelurile 2 și 3, Discoverability și Accessibility: dacă și prin ce mecanism poate ajunge un anumit sistem AI la o sursă. Nivelurile următoare depind de acestea, dar nu sunt garantate de ele.

    Articolul în 7 idei

    1. Public înseamnă accesibil pentru AI? Nu. Publicarea, permisiunea de crawling, recuperarea la cerere și citarea sunt etape diferite.
    2. De ce sisteme AI diferite pot recupera surse diferite? Pentru că folosesc infrastructuri de căutare, crawlere, acorduri de date, instrumente și permisiuni diferite.
    3. Cum ajung postările sociale în AI? Prin căi care trebuie separate: antrenare, căutare la cerere, acces nativ sau furnizare prin API; una nu o dovedește pe cealaltă.
    4. Cine decide dacă un agent are voie să acceseze informația? Proprietarii surselor, platformele, operatorii infrastructurii și utilizatorii, în limitele mecanismelor tehnice și contractuale aplicabile.
    5. De ce contează conectorii și API-urile? Permit acces autorizat la informații care nu trebuie să fie publice sau indexate.
    6. Cum măsurăm accesibilitatea unei surse fără să inventăm certitudini? Prin Source Accessibility Mapping, separând documentația, testul de acces și utilizarea observată în răspuns.
    7. Ce poate face concret un business? Să își inventarieze sursele, să testeze căile relevante și să documenteze limitele, fără să confunde o setare tehnică cu promisiunea unei recomandări AI.

    1. Public înseamnă accesibil pentru AI?

    Nu. O informație poate fi vizibilă pentru un om și totuși indisponibilă unui crawler, absentă dintr-un index sau inaccesibilă unui agent care nu are autorizația necesară.

    Să presupunem că o companie publică pe site o nouă ofertă. Un utilizator îi poate deschide pagina în browser. De aici însă nu rezultă că pagina a fost descoperită sau indexată de toate motoarele de căutare, că un anumit sistem AI o poate recupera în timp real ori că o va utiliza în răspuns. Fiecare etapă are propriile condiții. Chiar și același URL poate arăta diferit pentru un om, pentru un crawler și pentru un instrument de audit, cum am documentat în Paradoxul site-ului terminat.

    O reprezentare utilă, nu o succesiune obligatorie pentru toate arhitecturile, este:

    Published
       ↓
    Technically reachable
       ↓
    Permitted / authorized
       ↓
    Discoverable or directly addressable
       ↓
    Retrievable in a specific context
       ↓
    Selected and interpreted
       ↓
    Possibly cited or used

    Unele sisteme sar peste indexarea web: primesc date prin API sau accesează direct un document conectat. Altele folosesc un index anterior, astfel încât sursa poate apărea într-un răspuns chiar dacă o nouă solicitare către site nu reușește. Ordinea și mecanismul trebuie identificate, nu presupuse.

    Distincția este documentată chiar de operatorii AI. OpenAI separă OAI-SearchBot pentru căutarea în ChatGPT, GPTBot pentru colectarea de conținut potențial utilizat la antrenare și ChatGPT-User pentru anumite solicitări inițiate de utilizator. Documentația precizează că aceste categorii au roluri diferite, că ChatGPT-User nu este folosit pentru crawling automat și că, fiind inițiate de utilizator, acestor acțiuni regulile robots.txt pot să nu li se aplice.1

    Și Anthropic documentează separat ClaudeBot, Claude-SearchBot și Claude-User. A permite sau a restricționa unul dintre aceste trasee nu este echivalent cu a decide toate modalitățile prin care un răspuns AI ar putea conține informații despre site.2

    Prima regulă a măsurării: nu folosim „AI-ul are acces” ca propoziție completă. Numim sistemul, instrumentul, sursa, versiunea sau configurația testată și data observației.


    2. De ce sisteme AI diferite pot recupera surse diferite?

    Pentru că „AI” nu este un browser universal: fiecare produs combină modele cu propriile instrumente, indecși, reguli și integrări. Chiar două sesiuni ale aceluiași asistent pot avea acces diferit atunci când una folosește căutarea web, iar cealaltă are acces la un conector autorizat.

    Exemplele documentate arată variația mecanismelor:

    Ecosistem sau produsMecanism documentat relevantCe demonstrează și ce nu demonstrează
    OpenAI / ChatGPTCrawlere separate pentru search, training și solicitări ale utilizatorilor.1Demonstrează că există căi distincte; nu garantează că o pagină permisă va fi citată.
    Anthropic / ClaudeClaudeBot, Claude-SearchBot și Claude-User, cu funcții distincte.2Documentează moduri de acces, nu vizibilitatea efectivă pentru fiecare întrebare.
    GoogleGooglebot pentru Search și controlul Google-Extended pentru utilizări specificate ale conținutului în Gemini.3Google-Extended nu elimină automat o pagină din Google Search; nici indexarea nu garantează recuperarea într-un răspuns Gemini.
    xAI / Grok pe XDocumentația X declară că Grok poate decide să caute postări publice X și pe web în timp real.4Indică o cale de căutare în postările X, nu faptul că fiecare postare este consultată sau citată.
    OpenAI / RedditParteneriatul anunțat în 2024 descrie acces la Reddit Data API pentru conținut structurat și actualizat.5Demonstrează existența unei căi contractuale declarate; nu permite deducerea selecției fiecărui rezultat.

    Aceste exemple nu formează o clasificare a produselor și nici un clasament al accesului. Ele arată că întrebarea „poate AI să vadă pagina?” nu are un singur răspuns fără a preciza produsul și calea de acces.

    Există și o problemă temporală. Sursa poate fi accesibilă astăzi, dar răspunsul poate utiliza o versiune mai veche, un index intermediar sau o sursă terță care a preluat informația. Accesul documentat la o sursă și proveniența efectivă a unei afirmații sunt două lucruri diferite.


    3. Cum ajung postările sociale în AI?

    Nu există un singur traseu. Antrenarea, căutarea la cerere și accesul contractual prin API sunt căi diferite, iar una nu o dovedește pe cealaltă.

    Meta a anunțat în aprilie 2025 folosirea în UE a conținutului public distribuit de adulți pentru antrenarea modelelor, cu posibilitatea exprimării opoziției,6 documentația X spune că Grok poate căuta postări publice X în timp real,4 iar OpenAI și Reddit au anunțat în mai 2024 un parteneriat de acces la Reddit Data API.5 Niciuna dintre aceste căi nu transformă automat o postare de pe Facebook, X sau Reddit într-o „sursă AI”. Trebuie să întrebăm: pentru ce produs, prin ce traseu și cu ce dovadă de utilizare? Mecanismele sunt analizate în detaliu în ultimul articol al seriei.

    Mai este un aspect: o informație socială poate fi preluată de presă, de un blog ori de un site oficial. Un asistent poate cita articolul intermediar fără să fi accesat postarea originală. Pentru verificarea adevărului factual, traseul până la sursa primară contează adesea mai mult decât popularitatea canalului prin care informația a circulat.


    4. Cine decide dacă un agent are voie să acceseze informația?

    Controlul este distribuit între proprietarul conținutului, platforma care îl găzduiește, infrastructura care gestionează traficul, operatorul sistemului AI și, când sunt implicate date personale sau private, utilizatorul care autorizează accesul. Niciun actor nu controlează singur întregul traseu.

    Pe web, robots.txt este un mecanism standardizat de comunicare a preferințelor pentru crawleri. RFC 9309 precizează însă o limită esențială: nu este un sistem de securitate și nu înlocuiește autentificarea sau alte controale de acces.7

    În septembrie 2026, Cloudflare a anunțat controale mai granulare, descriind trei comportamente: Search, Training și Agent. Un proprietar poate dori să rămână descoperibil în căutare, dar să exprime preferințe diferite pentru utilizarea conținutului la antrenare. Cloudflare explică și faptul că există crawleri cu utilizări mixte, astfel încât simpla blocare a unui bot poate produce efecte colaterale asupra vizibilității în căutare. Capacitățile și angajamentele diferă însă între operatori și trebuie verificate pentru fiecare implementare.8

    Separat de regulile crawlerelor apar autentificarea, permisiunile unui cont, limitele API, acordurile comerciale și restricțiile platformelor sociale. O pagină publică poate fi inaccesibilă unui anumit instrument automat, iar o bază de date privată poate fi perfect accesibilă unui agent autorizat de proprietarul ei.

    Aceasta este o distincție importantă pentru business: accesibilitatea maximă nu este întotdeauna obiectivul corect. Unele informații trebuie să fie publice, altele trebuie expuse controlat, iar datele confidențiale trebuie să rămână protejate.


    5. De ce contează conectorii și API-urile?

    Pentru că oferă o altă cale de acces decât căutarea și crawling-ul web: sistemul AI poate interoga direct o aplicație sau un set de date, în limitele permisiunilor acordate. Această cale poate expune informații actualizate care nu există într-o pagină publică.

    În octombrie 2025, OpenAI a prezentat aplicații integrate în ChatGPT și un SDK construit pe Model Context Protocol (MCP), conceput pentru conectarea instrumentelor și datelor externe. Anunțul ilustrează diferența dintre a citi ce a publicat o companie pe web și a interacționa, cu autorizare, cu un serviciu al companiei.9

    Imaginează-ți un service auto. Site-ul public spune că face revizii și reparații pentru anumite mărci. Un sistem de programări poate furniza intervalele libere dintr-o anumită zi, durata estimată a lucrării și opțiunea concretă de programare. Primul traseu ține de publicare și recuperarea informației. Al doilea depinde de accesul operațional și de permisiunile serviciului respectiv.

    Pagină publică ── crawl / index / search ─────┐
                                                  ├──> Asistent sau agent AI
    Sistem de programări ── API / autorizare ─────┘

    Aceasta nu înseamnă că fiecare companie are nevoie de propriul API sau de un agent. Înseamnă că evaluarea vizibilității trebuie adaptată obiectivului real, temă dezvoltată în al patrulea articol al seriei.


    6. Cum măsurăm accesibilitatea unei surse fără să inventăm certitudini?

    Separând ceea ce declară documentația, ceea ce reușim să testăm tehnic și ceea ce observăm în răspunsurile generate. Propunerea exploratorie pe care o numim aici Source Accessibility Mapping urmărește diferența dintre cele trei, fără să pretindă acces la infrastructura internă a furnizorilor AI.

    Un inventar minimal pentru fiecare sursă ar putea cuprinde:

    CâmpÎntrebareTip posibil de dovadă
    source_idCare este sursa exactă?URL, identificator API sau document.
    source_typeEste site propriu, social, registru, presă sau sistem privat?Clasificare documentată.
    target_systemCe produs și configurație testăm?Nume, instrumente active, stare autentificare, dată.
    access_pathPrin ce mecanism ar putea ajunge la sursă?Crawler, web search, API, conector, acces nativ.
    declared_accessCe permite sau descrie furnizorul?Documentație oficială, arhivată și datată.
    technical_observationCe putem observa din exterior?Răspunsuri HTTP, reguli publice, jurnale proprii, teste autorizate.
    answer_observationA folosit efectiv sursa în răspuns?Răspuns complet, citare, extras, timestamp și condițiile testului.
    limitationsCe rămâne necunoscut?Index intermediar, cache, integrare internă, selecție opacă.

    Conform convenției de lucru AI Visibility Lab, lanțul probatoriu trebuie păstrat explicit:

    Raw Evidence
         ↓
    Indexed Evidence
         ↓
    Observation
         ↓
    Measurement
         ───────── graniță metodologică ─────────
         ↓
    Interpretation

    De exemplu, dacă documentația OpenAI descrie OAI-SearchBot, avem dovada unui mecanism declarat. Dacă observăm în propriile loguri o solicitare verificată de la acel crawler, avem o observație a accesării unui URL, nu dovada că URL-ul a fost inclus într-un index sau utilizat ulterior într-un răspuns. Dacă un test datat în ChatGPT arată o citare, avem o observație despre acel răspuns, nu o garanție pentru toate interogările viitoare.1

    În plus, instrumente precum AI Performance din Bing Webmaster Tools raportează citări agregate pentru experiențele suportate, inclusiv Microsoft Copilot, rezumatele AI din Bing și anumite integrări partenere. Microsoft precizează că datele nu sunt un jurnal complet al fiecărei situații în care conținutul a fost folosit și că nu indică ranking, autoritate sau rolul unei pagini într-un răspuns.10 Prin urmare, raportul este util pentru observații comparative, nu pentru atribuirea automată a cauzalității.

    Source Accessibility Mapping nu este prezentat aici drept un standard consacrat sau un protocol AVL validat. Este o ipoteză de instrument metodologic care necesită definiții operaționale, experimente repetate și documentarea erorilor.


    7. Ce poate face concret un business?

    Să trateze accesibilitatea ca pe o proprietate verificabilă a fiecărei surse și a fiecărui traseu relevant, nu ca pe o simplă bifă „suntem online”. Obiectivul nu este să ofere tuturor sistemelor acces la orice informație, ci să poată decide informat ce publică, cui permite accesul și cum verifică rezultatul.

    Un punct de pornire practic este inventarierea surselor care descriu compania: site propriu, pagini sociale, profiluri comerciale, documentații, informații despre produse, mențiuni în presă și eventual sisteme accesibile prin API. Pentru fiecare, merită notate sursa originală, data actualizării și orice neconcordanță importantă.

    Urmează separarea mecanismelor. Se verifică dacă paginile esențiale sunt accesibile utilizatorilor și crawlerelor relevante, dacă regulile de acces sunt intenționate și dacă informațiile care necesită autorizare sunt protejate. Nu recomandăm dezactivarea controalelor de securitate pentru a obține presupuse beneficii GEO.

    Abia apoi vin testele de răspuns: aceeași întrebare, aceeași entitate și aceleași condiții pe cât posibil, documentate separat pentru fiecare produs. O absență dintr-un singur răspuns nu dovedește inaccesibilitatea; o menționare fără citare nu dovedește recuperarea directă a sursei originale.

    Un business local poate descoperi astfel că programul de lucru este corect pe site, diferit într-un profil terț și absent din răspunsul unui anumit asistent. Acestea sunt trei observații diferite, care cer intervenții diferite. Mai mult conținut nu rezolvă automat problema unui traseu de acces blocat sau a unor date contradictorii.


    Concluzie: nu există un singur „internet văzut de AI”

    Există o pluralitate de trasee prin care sistemele AI întâlnesc informația. Unele pornesc de la crawling și căutare, altele de la fluxuri de date negociate, conectori sau aplicații autorizate. Rețelele sociale adaugă mecanisme native și condiții de acces proprii. Rezultatul este că două sisteme pot construi răspunsuri diferite fără ca diferența să poată fi explicată exclusiv prin modelul lingvistic.

    Pentru AI Visibility Lab, consecința este metodologică: înainte de a interpreta o menționare sau absența ei, trebuie să înțelegem ce surse erau potențial accesibile, prin ce mecanisme și ce dovadă avem că au fost efectiv utilizate.

    Publicarea produce o urmă. Accesul îi stabilește traseele posibile. Recuperarea și selecția determină dacă acea urmă participă la un răspuns. Între aceste etape se află diferența dintre a fi prezent pe internet și a fi reprezentat corect de un sistem AI.

    În articolul următor vom privi această schimbare din perspectiva site-ului propriu: „Site-ul nu dispare. Își schimbă clientul.”


    Seria „Machine accessibility și agentic web”

    1. De la web visibility la machine accessibility
    2. Public nu mai înseamnă accesibil: de ce fiecare sistem AI vede un internet diferit (acest articol)
    3. Site-ul nu dispare. Își schimbă clientul
    4. De la menționare la tranzacție: ce înseamnă Agentic Visibility
    5. Social media devine strat informațional pentru AI

    Surse și metodologie

    Sursele oficiale de produs documentează funcții și politici declarate, nu demonstrează independent performanța sau comportamentul fiecărei execuții. Exemplele comparative sunt descriptive, nu evaluări ale furnizorilor. Pe 1 octombrie 2026 au fost reverificate existența, data și formularea fiecărei surse. Paginile X, OpenAI (Reddit, Apps SDK) blochează accesul automat și au fost confirmate prin indexul de căutare și relatări de presă, nu prin citire directă; pagina Microsoft își încarcă dinamic conținutul, iar formularea limitărilor a fost confirmată tot prin indexul de căutare. Termenii machine accessibility și Source Accessibility Mapping sunt folosiți aici ca termeni de lucru AI Visibility Lab; nu sunt prezentați ca standarde industriale validate. Nu se introduc rezultate experimentale neefectuate și nu se transformă lipsa unei citări în dovadă a blocării accesului.

    1. OpenAI, Overview of OpenAI Crawlers, documentație oficială, consultată la 1 octombrie 2026. developers.openai.com/api/docs/bots
    2. Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler?, Claude Help Center, consultat la 1 octombrie 2026. support.claude.com/en/articles/8896518
    3. Google, Google's common crawlers (Googlebot, Google-Extended), documentație oficială, consultată la 1 octombrie 2026. developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
    4. X, About Grok, documentație oficială, consultată prin indexul de căutare la 1 octombrie 2026 (pagina blochează accesul automat). help.x.com/en/using-x/about-grok
    5. OpenAI și Reddit, OpenAI and Reddit Partnership, 16 mai 2024 (pagina blochează accesul automat; conținutul a fost confirmat la 1 octombrie 2026 prin indexul de căutare și prin relatări de presă din ziua anunțului). openai.com/index/openai-and-reddit-partnership/
    6. Meta, Making AI Work Harder for Europeans, 14 aprilie 2025; pagină actualizată la 27 martie 2026, conform paginii oficiale. about.fb.com/news/2025/04/making-ai-work-harder-for-europeans/
    7. IETF, RFC 9309: Robots Exclusion Protocol, septembrie 2022, secțiunea 3 (Security Considerations). rfc-editor.org/rfc/rfc9309.html
    8. Cloudflare, Have it both ways: stay discoverable in search while disallowing AI training, 15 septembrie 2026. blog.cloudflare.com/accountable-mixed-use-ai-crawlers/
    9. OpenAI, Introducing apps in ChatGPT and the new Apps SDK, 6 octombrie 2025 (pagina blochează accesul automat; confirmată la 1 octombrie 2026 prin indexul de căutare și relatări de presă). Pagina descrie lansarea inițială; disponibilitatea actuală a integrărilor se verifică separat. openai.com/index/introducing-apps-in-chatgpt/
    10. Microsoft, AI Performance in Bing Webmaster Tools, documentație oficială (conținut încărcat dinamic; existența paginii verificată direct, iar formularea limitărilor confirmată prin indexul de căutare la 1 octombrie 2026). bing.com/webmasters/help/ai-performance-9f8e7d6c

    Notă de volatilitate

    Lista crawlerelor, rolurile lor, controalele de acces oferite de infrastructură, acordurile de date dintre platforme și disponibilitatea conectorilor se schimbă rapid. Numele user-agent-urilor, regulile de respectare a robots.txt și disponibilitatea regională pot fi diferite la data lecturii. Afirmațiile despre produse au fost verificate la 1 octombrie 2026.

    Articol publicat de AI Visibility Lab, proiect independent de cercetare aplicată și documentare în AI Visibility, GEO și AEO, fondat și coordonat de Alex Matescu. Ultima verificare factuală și a surselor: 1 octombrie 2026.