---
title: "Kako izmeriti vidnost v UI: velikost vzorca in poštena izhodišča"
description: "Delež citatov 9,5 % proti 6,0 % je videti kot zmaga, dokler se intervala zaupanja ne prekrijeta. Koliko ponovitev v resnici potrebujete za meritev."
lang: sl
canonical: https://upgradepro.eu/sl/blog/measure-ai-visibility
published: 2026-07-16
tags: ["GEO", "meritve"]
---

# Kako izmeriti vidnost v UI: velikost vzorca in poštena izhodišča

> Delež citatov 9,5 % proti 6,0 % je videti kot zmaga, dokler se intervala zaupanja ne prekrijeta. Koliko ponovitev v resnici potrebujete za meritev.

Merjenje vidnosti v UI pomeni vzorčenje porazdelitve, ne odčitavanje instrumenta. Če ChatGPT, Geminiju ali Perplexity dvakrat zastavite isto vprašanje, dobite različna odgovora, ki citirata različne vire. Zato je vsaka številka iz ene same izvedbe — vaš share of voice, vaš delež citatov — ocena s pasom napake, in ta pas je širok. Praktično delo je odločitev, koliko ponovitev potrebujete, preden razlika sploh kaj pomeni.

## Zakaj isto vprašanje vsakič da drugačen odgovor?

Ker je nedeterminizem vgrajen v to, kako ti sistemi tečejo, in ne v nastavitev, ki bi jo lahko izklopili. Thinking Machines Lab je pri temperaturi 0 iz modela Qwen3-235B-A22B-Instruct-2507 vzorčil 1.000 dokončanj s pozivom "Tell me about Richard Feynman", vsako po 1.000 žetonov.

> "Surprisingly, we generate 80 unique completions, with the most common of these occuring 78 times."
> — Thinking Machines Lab, Horace He, september 2025

Osemdeset različnih odgovorov, vsi se razhajajo od 103. žetona naprej. [Temeljni vzrok, ki ga prepoznajo](https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/) (september 2025), ni temperatura, temveč pomanjkanje invariantnosti glede na velikost paketa: obremenitev strežnika se nepredvidljivo spreminja, to spremeni vrstni red seštevanja v plavajoči vejici, to pa spremeni izhod. Tega od zunaj ne morete nadzorovati. Lahko le večkrat vzorčite.

Ponudniki to tiho priznavajo. [Lastna dokumentacija OpenAI](https://developers.openai.com/api/docs/guides/advanced-usage) (dostopano 16. julija 2026) obljublja le "(mostly) deterministic outputs", ko določite seme, in opozarja, da spremembe konfiguracije na njihovi strani spremenijo rezultate. Akademska študija — [arXiv:2408.04667](https://arxiv.org/abs/2408.04667) (avgust 2024), pet modelov, med njimi GPT-4o in Llama-3-70B-Instruct, osem nalog MMLU in BBH, po deset ponovitev pri temperature=0, top-p=1 in fiksnem semenu — ni našla modela, ki bi ohranil stoodstotno doslednost. Razlike v točnosti med identičnimi izvedbami so dosegle 5-15 točk, v skrajnem primeru pa do 70 točk (Mixtral pri visokošolski matematiki: 75 % v najboljši izvedbi, 3 % v najslabši).

Google isto dokumentira za iskanje. Po [Google Search Central](https://developers.google.com/search/docs/appearance/ai-features): "AI Mode and AI Overviews may use different models and techniques, so the set of responses and links they show will vary." Spremenljivost je dokumentirano vedenje, ne napaka, ki bi minila, če dovolj dolgo čakate.

## Zakaj je ena sama meritev skoraj vedno zavajajoča?

Ker so vaše metrike vzorčne ocene, panoga pa jih objavlja kot dejstva. Najjasnejši objavljeni dokaz prihaja iz študije [Quantifying Uncertainty in AI Visibility](https://arxiv.org/abs/2603.08924) Ronalda Sielinskega (arXiv:2603.08924v2, junij 2026): 200 poizvedb na temo pri treh temah in treh platformah, vzorčenih devet zaporednih dni, ter 25 vzorcev v desetminutnih intervalih — 374.052 citatov v dnevnem naboru.

> "These findings show that single-run visibility metrics provide a misleadingly precise picture of domain performance in generative search."
> — Sielinski, Quantifying Uncertainty in AI Visibility, junij 2026

Njegov primer s tekaško opremo na SearchGPT si velja zapomniti. Pri 200 poizvedbah je tomsguide.com dosegel 9,5 % deleža citatov, runnersworld.com pa 6,0 % — navidezna prednost 3,5 odstotne točke. A 95-odstotna bootstrap intervala zaupanja — približno 5,5-12,5 % in 4,0-8,0 % — se občutno prekrivata. To je statistično izenačenje, preoblečeno v vodstvo.

Kako spolzka so tla, povesta še dve številki. Ponovitev identične poizvedbe vrne večinoma druge vire: mediano prekrivanje po Jaccardu na ravni domene znaša 0,29-0,31 na Geminiju, 0,33-0,40 na SearchGPT in 0,50 na Perplexity, delež identičnih citatov pa 0,01-0,10 % na Geminiju ter 3-8 % pri drugih dveh. Velika je tudi sama nihajnost: logaritemski standardni odklon 0,5 (povprečja po platformah: 0,504 Gemini, 0,421 Perplexity, 0,417 SearchGPT) pomeni, da delež citatov posamezne domene tipično niha med približno 60 % in 165 % svoje osrednje vrednosti.

Sielinski ob sklicevanju na Hu et al. navaja tudi 33-odstotno stopnjo nedoslednosti pri tem, ali se pregled z UI za dano poizvedbo sploh pojavi. Te številke v izvirnem viru nismo mogli preveriti, zato jo obravnavajte kot poročano in ne kot izmerjeno — implikacija pa drži: prvi vir variance ni to, kaj odgovor pove, temveč ali odgovor UI sploh obstaja.

**Pravilo, ki si ga velja zapomniti:** vsako razliko v deležu citatov pod 5-7 odstotnimi točkami med dvema znamkama obravnavajte kot izenačenje. Prekrivajoči se intervali v tem razponu so, po Sielinskijevih besedah, prej pravilo kot izjema.

## Koliko ponovitev v resnici potrebujete?

Toliko, da bo interval ožji od razlike, ki vas zanima — in članek te številke objavi, česar skoraj noben blog ponudnika ne stori.

| Metrika | Ciljni interval (95-odstotni IZ) | Gemini | Perplexity | SearchGPT |
|---|---|---|---|---|
| Delež citatov | širina 5 točk (≈ ±2,5 o. t.) | ~40-50 poizvedb | ~100 poizvedb | ≥150 poizvedb |
| Razširjenost citatov | širina 15 točk | ~140-150 poizvedb | ~140-150 poizvedb | ~60-80 poizvedb |

Vir: [Sielinski](https://arxiv.org/abs/2603.08924), §5.7, junij 2026.

S to tabelo pride ključno opozorilo. Ne vzorčite, dokler interval ni videti ozek, in takrat nehajte. Na SearchGPT konvergenca ni monotona: širina intervala se zoži in nato spet razširi. Kdor neha na srečno ozki točki, poroča o manjši negotovosti, kot je resnica. Vnaprej se zavežite fiksni velikosti vzorca glede na platformo in temo — tekočega intervala nikoli ne uporabljajte kot merilo za ustavitev.

## Ali lahko ChatGPT merite prek API OpenAI?

Lahko, a ne boste merili tega, kar vidijo vaše stranke. [Surfer SEO](https://surferseo.com/blog/llm-scraped-ai-answers-vs-api-results/) (februar 2026) poroča, da se med rezultati API in rezultati ChatGPT, zajetimi s scrapingom, prekriva le 24 % znamk, pri citiranih virih pa prekrivanje zdrsne na 4 %. Na Perplexity je prekrivanje virov med API in vmesnikom 8-odstotno.

**Metodološka opomba, ker je pomembna:** Surfer opisuje "1.000 izvedb pozivov", ne da bi navedel, ali gre za edinstvene pozive ali ponovitve, katere različice modelov so bile uporabljene in ali je bilo pri klicih API omogočeno spletno iskanje. Delo ni recenzirano, ponudnik pa ima komercialni interes pri sklepu. Objavljamo ga kot usmerjevalen dokaz, ne kot izmerjeno številko.

Surferjevi lastni strukturni podatki kažejo v isto smer, čeprav prihajajo od istega ponudnika in iz iste nerecenzirane študije: API ChatGPT v povprečju vrne 406 besed proti 743 pri vmesniku, zajetem s scrapingom, približno 23 % klicev API nikoli ne sproži spletnega iskanja (vmesnik ga vedno), okoli 25 % odgovorov API ne citira nobenega vira (kadar ga, jih je v povprečju 7, v vmesniku pa 16), API pa znamke ne zazna v približno 8 % primerov.

## Katere metrike v resnici nekaj pomenijo?

Začnite z ločnico med omembo in citatom: omemba je, ko model zapiše vaše ime; citat je, ko model postavi povezavo do vas kot vira. Različna mehanika, različni popravki. Onkraj tega Sielinski formalizira tri:

1. **Število citatov** — absolutni citati vaše domene. Med platformami ni primerljivo.
2. **Delež citatov** — vaši citati, deljeni s skupnim številom citatov. Normaliziran, primerljiv.
3. **Razširjenost citatov** — delež odgovorov, ki vsebujejo vsaj en citat vaše domene. Meri širino pokritosti, ne globine.

Vse tri so vzorčni ocenjevalniki in ne stalne lastnosti sistema. Za izpostavljenost znotraj odgovora [članek o GEO](https://arxiv.org/abs/2311.09735) (Aggarwal et al., KDD 2024, GEO-bench z 10.000 poizvedbami) ponuja Position-Adjusted Word Count — besede, pripisane vašemu viru, eksponentno diskontirane glede na mesto — in Subjective Impression, ki oceni sedem razsežnosti, med njimi relevantnost, vpliv, edinstvenost in verjetnost klika.

Eno trdo pravilo: surovih števil nikoli ne primerjajte med platformami. Mediano število citatov znaša 5-7 na odgovor na SearchGPT in 36-40 na Geminiju. Število, ki je na Geminiju videti impresivno, je tam lahko pod povprečjem, na SearchGPT pa odlično. Naša [primerjava orodij za vidnost v UI](/sl/blog/ai-visibility-tools) podrobneje obravnava, katera platforma poroča katero metriko.

## Kako zgraditi brezplačno izhodišče, korak za korakom?

Za začetek ne potrebujete korporativne programske opreme, Google Search Console pa vam ne bo pomagal: po [Google Search Central](https://developers.google.com/search/docs/appearance/ai-features) promet iz funkcij UI ni prikazan ločeno — vključen je v vrsto iskanja "Web". Prav ta vrzel je razlog, da vzorčite sami.

1. **Določite 30-50 resničnih vprašanj z nakupnim namenom.** Primerjave, "najboljši X za Y", "alternative za Z" — tista, ki jih vaše stranke zares zastavljajo, ne tista, ki bi si jih želeli.
2. **Izvajajte brez prijave.** Personalizacija onesnaži vzorec.
3. **Število ponovitev določite vnaprej.** Uporabite zgornjo tabelo; številko zapišite, preden začnete.
4. **Na vsako izvedbo zabeležite štiri polja.** Ali se pojavite? Na katerem mestu? Ob katerih konkurentih? Vas citirajo ali zgolj omenjajo?
5. **Primerjajte po intervalu, ne po točki.** Če je razlika pod 5-7 točkami, ste izenačeni. Povejte to.

Vredno je vedeti še tole: Google navaja, da za pojavljanje v pregledih z UI (AI Overviews) ali v načinu AI Mode ni dodatnih zahtev niti posebnega označevanja — nobenih besedilnih datotek za UI, nobene sheme po meri. Kdor vam prodaja čarobno datoteko, vam ne prodaja ničesar. Če ste v tej disciplini novi, naš uvod v to, [kaj je GEO](/sl/blog/what-is-geo), najprej pokrije temelje.

## Koliko vzorčenje prek API v resnici stane?

Nekaj deset dolarjev, ne nekaj tisoč — prevladuje pa orodje za spletno iskanje in ne žetoni. Po [uradnih cenah OpenAI](https://developers.openai.com/api/docs/pricing) (preverjenih 16. julija 2026): gpt-5.4-mini stane 0,75 $ na milijon vhodnih žetonov in 4,50 $ na milijon izhodnih; gpt-5.4-nano 0,20 $ in 1,25 $; gpt-5.6-luna 1,00 $ in 6,00 $. Orodje za spletno iskanje se zaračuna posebej po 10,00 $ na 1.000 klicev, pridobljena vsebina pa po ceniku modela.

**IZRAČUNANO** — izhodišče s 50 pozivi × 30 ponovitev = 1.500 klicev z omogočenim iskanjem. Orodje za iskanje: 1,5 × 10,00 $ = 15,00 $. Ob predpostavki (**PREDPOSTAVLJENO**, ne izmerjeno) približno 5.000 vhodnih žetonov na klic pri gpt-5.4-mini — številka, ki naj bi zajela poziv *in* pridobljeno vsebino iskanja, ki se zaračuna po ceniku modela — ter približno 800 izhodnih žetonov: 7,5 M vhodnih × 0,75 $ = 5,63 $ in 1,2 M izhodnih × 4,50 $ = 5,40 $. Skupaj ≈ 26 $. Cene znova preverite na dan izvedbe; imena modelov in tarife v tej družini se pogosto spreminjajo. In ne pozabite, kaj ste kupili: to meri API, ne ChatGPT.

## Kaj premakne iglo, ko imate izhodišče?

Korelacijski dokazi kažejo na prepoznavnost znamke in ne na to, koliko objavljate. [Ahrefs](https://ahrefs.com/blog/ai-brand-visibility-correlations/) (december 2025) je preučil 75.000 domen z DR nad 40 v ChatGPT, načinu AI Mode in pregledih z UI:

| Dejavnik | Korelacija z omembami v UI |
|---|---|
| Omembe na YouTubu | ~0,737 |
| Omembe znamke na spletu | 0,656-0,709 |
| Sidra z imenom znamke | 0,511-0,628 |
| Obseg iskanj po znamki | 0,352-0,466 |
| Domain Rating | 0,266-0,326 |
| Obseg vsebine (število strani na spletnem mestu) | ~0,194 ("almost no relationship") |

To je korelacija, ne vzročnost. Odprtje kanala na YouTubu ne bo pripravilo ChatGPT, da vas citira; verjetnejše branje je, da omembe na YouTubu in omembe v UI merijo isto temeljno prepoznavnost znamke. Drugega vam ne bomo obljubljali in tega ne bi smel nihče. Za občutek, kako hitro te površine rastejo, si oglejte našo zabeležko o [prevzemanju iskanja z UI](/sl/blog/ai-search-adoption).

## Kdaj plačati orodje in kaj od njega zahtevati?

Prag je aritmetičen: pozivi × ponovitve × platforme ÷ razpoložljivi čas ene osebe. Pod njim zmaga preglednica. Nad njim kupite — a ponudnika prej zaslišite:

- Ali meri pravi izdelek ali API? (Spomnite se tistih 24 %.)
- Ali poroča intervale zaupanja ali zgolj številko?
- Ali je velikost vzorca navedena?
- Kakšna je pogostost ponovnega vzorčenja in ali je določena vnaprej?

Če vam ponudnik izroči share of voice brez pasu napake, vam prodaja šum z decimalko.

## Kaj naj malo podjetje naredi ta teden?

Izberite svojih 30-50 vprašanj, število ponovitev določite, preden pogledate katerikoli rezultat, izvedite jih brez prijave v ChatGPT, Perplexity in Googlu ter ločeno beležite omembo in citat. Nato isti fiksni vzorec ponovite mesečno in primerjajte intervale, ne točk. Vse, kar se premakne za manj kot 5-7 točk, je vreme in ne podnebje.

Če želite, da vam izhodišče zgradimo in zagovarjamo mi, je to točno tisto, kar počne naša [storitev vidnosti v UI](/sl/services/ai-visibility) — naša [metoda](/sl/method) pa vsako številko označi kot izmerjeno, izračunano ali predpostavljeno, tako da vedno veste, katera je katera.

## Pogosta vprašanja

### Kolikokrat moram ponoviti isto poizvedbo, da vidnost v UI izmerim pravilno?

Odvisno od platforme in metrike, objavljene številke pa obstajajo. Po članku Ronalda Sielinskega (arXiv:2603.08924, junij 2026) 95-odstotni interval zaupanja širine približno pet odstotnih točk pri deležu citatov, kar pomeni odstopanje približno plus ali minus 2,5 točke, zahteva okoli 40-50 poizvedb na Google Geminiju, približno 100 na Perplexity ter 150 ali več na OpenAI SearchGPT. Za razširjenost citatov z intervali širine petnajst točk SearchGPT potrebuje 60-80 poizvedb, Gemini in Perplexity pa skoraj dvakrat toliko, okoli 140-150. Razlog je, da ponovitev iste poizvedbe vrne večinoma druge vire: mediano prekrivanje na ravni domene med dvema identičnima izvedbama znaša le 0,29-0,31 na Geminiju in 0,50 na Perplexity. Ena sama meritev ni meritev. Je en vzorec iz porazdelitve.

### Zakaj isto vprašanje v ChatGPT da drugačen odgovor, čeprav nastavim temperaturo na nič?

Ker temperatura nadzoruje samo korak vzorčenja žetonov, ne pa preostanka sistema. Thinking Machines Lab je septembra 2025 pokazal, da je vzorčenje 1.000 dokončanj pri temperaturi 0 z istim pozivom dalo 80 edinstvenih dokončanj. Temeljni vzrok, ki ga prepoznajo, ni temperatura, temveč pomanjkanje invariantnosti glede na velikost paketa: obremenitev strežnika se nepredvidljivo spreminja in spremeni vrstni red seštevanja v plavajoči vejici. Lastna dokumentacija OpenAI obljublja le večinoma deterministične izhode, tudi kadar nastavite parameter seed. Akademska študija (arXiv:2408.04667) pa je potrdila, da pri temperature=0, top-p=1 in fiksnem semenu nobeden od petih preizkušenih modelov ni ohranil stoodstotne doslednosti. Spremenljivosti se ne odpravi. Izmeri se jo.

### Ali lahko svojo vidnost v ChatGPT merim prek API OpenAI?

Lahko, a ne boste merili tega, kar vidijo vaše stranke. Surfer SEO je februarja 2026 objavil, da se med odgovori API in odgovori ChatGPT, zajetimi s scrapingom, prekriva le 24 % znamk, pri citiranih virih pa prekrivanje pade na 4 %. Pojasnijo ga strukturne razlike: API v povprečju vrne 406 besed proti 743 v vmesniku, približno 23 % klicev API sploh ne sproži spletnega iskanja, medtem ko ga vmesnik vedno, in okoli 25 % jih ne vrne nobenega vira. Ta študija ne objavi različic modelov ne konfiguracije spletnega iskanja, zato jo obravnavajte kot usmerjevalno in ne kot natančno. Smer ostaja skladna: pravi izdelek nosi plasti, kot so iskanje, sistemski pozivi in personalizacija, ki jih API ne reproducira.

### Katere metrike naj spremljam: omembe, citate, mesto ali sentiment?

Najprej ločite omembo od citata. Omemba je, ko UI zapiše vaše ime. Citat je, ko UI nanjo poveže povezavo do vas kot vira. To sta različni stvari in optimizirata se različno. Literatura formalizira tri metrike citatov (Sielinski, 2026): število citatov, ki med platformami ni primerljivo; delež citatov, torej vaš del vseh citatov, ki primerljiv je; ter razširjenost citatov, torej delež odgovorov, v katerih se pojavite vsaj enkrat. Akademski članek o GEO, predstavljen na KDD 2024, dodaja izpostavljenost znotraj odgovora z metrikama Position-Adjusted Word Count in Subjective Impression, ki pokriva sedem razsežnosti, med njimi relevantnost, vpliv in verjetnost klika. Sentiment je ločena plast: ne spremeni vašega deleža, spremeni vrednost posamezne pojavitve. Za malo podjetje zadošča začeti z razširjenostjo in deležem.

### Ali lahko izhodišče postavim brezplačno ali moram plačati orodje?

Začnete lahko brezplačno in za marsikatero malo podjetje je to razumna izbira. Metoda: določite nabor 30-50 resničnih vprašanj z nakupnim namenom, ki jih zastavljajo vaše stranke, vnaprej se odločite, koliko ponovitev boste izvedli, izvedite jih v ChatGPT, Perplexity in Googlu ter v preglednico zabeležite, ali se pojavite, na katerem mestu in ob katerih konkurentih. Dve opozorili z dokazi za sabo. Prvič, ne uporabljajte pravila, da ponavljate, dokler se številka ne ustali, in takrat nehate. Sielinski pokaže, da se na SearchGPT širina intervala zoži in nato spet razširi, zato se vsakdo, ki neha na ugodni točki, vara. Drugič, izvajajte brez prijave, da personalizacija ne onesnaži vzorca. Orodje plačate, ko pozivi krat ponovitve krat platforme ne gredo več v čas ene osebe, prej ne.

### Koliko stane vzorčenje prek API in kako pogosto naj merim znova?

Uradne cene OpenAI (preverjene 16. julija 2026) omogočajo izračun: gpt-5.4-mini stane 0,75 dolarja na milijon vhodnih žetonov in 4,50 na milijon izhodnih, gpt-5.4-nano pa 0,20 in 1,25. Prevladujoč strošek niso žetoni, temveč orodje za spletno iskanje, ki se zaračuna posebej po 10 dolarjev na 1.000 klicev, plus žetoni pridobljene vsebine. Izhodišče s 50 pozivi in 30 ponovitvami, torej 1.500 klicev z omogočenim iskanjem, zato pristane pri nekaj deset dolarjih in ne pri nekaj tisoč, a ne pozabite, da meri API in ne pravega izdelka. Glede pogostosti: referenčna študija kaže nihajnost iz dneva v dan in celo v desetminutnih intervalih, zato dnevno ponovno vzorčenje brez intervalov zaupanja proizvaja le šum, ki je videti kot trend. Za malo podjetje je zagovorljiv mesečni cikel s fiksno velikostjo vzorca, primerjan po intervalih in ne po točki. Tedensko le, če se vaša panoga hitro premika.

## Viri

Vsaka trditev v tem članku je povezana z virom, iz katerega izhaja, skupaj z datumom objave.

- [Sielinski, Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement (arXiv 2603.08924v2)](https://arxiv.org/abs/2603.08924) — 2026-06-09
- [Thinking Machines Lab — Horace He, Defeating Nondeterminism in LLM Inference](https://thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference/) — 2025-09-10
- [Atil, Aykent, Passonneau, Baldwin et al., Non-Determinism of Deterministic LLM Settings (arXiv 2408.04667)](https://arxiv.org/abs/2408.04667) — 2024-08-08
- [OpenAI — API docs, Advanced usage (Reproducible outputs)](https://developers.openai.com/api/docs/guides/advanced-usage) — 2026-07-16
- [OpenAI — API Pricing](https://developers.openai.com/api/docs/pricing) — 2026-07-16
- [Surfer SEO — Jakub Sadowski, Scraped AI Answers vs. API Results from LLMs](https://surferseo.com/blog/llm-scraped-ai-answers-vs-api-results/) — 2026-02-03
- [Ahrefs — Top Brand Visibility Factors in ChatGPT, AI Mode, and AI Overviews (75k Brands Studied)](https://ahrefs.com/blog/ai-brand-visibility-correlations/) — 2025-12-12
- [Google Search Central — AI Features and Your Website](https://developers.google.com/search/docs/appearance/ai-features) — 2026-07-16
- [Aggarwal et al., GEO: Generative Engine Optimization (arXiv 2311.09735), KDD 2024](https://arxiv.org/abs/2311.09735) — 2024-06-28
