Umelá inteligencia nám dnes radí prakticky so všetkým, no pri online nakupovaní by sme jej nemali veriť naslepo. Dátový tím zo spoločnosti Product.ai podrobil popredné jazykové modely dôkladnému testu a zistil zásadné rozdiely v ich spoľahlivosti. Najhoršie z porovnania vyšiel Gemini od Googlu, ktorý vykazuje najvyššiu chybovosť, zatiaľ čo suveréne najpresnejšie výsledky ponúka Perplexity.
Výskumníci v rámci testovania položili bezplatným aj predplateným verziám štyroch známych platforiem (ChatGPT, Claude, Gemini a Perplexity) presne 220 otázok ohľadom nakupovania z 9 rôznych kategórií. Každú jednu požiadavku pritom zopakovali 5-krát, aby overili stabilitu a konzistentnosť odpovedí.
Do porovnania zaradili bezplatný model gemini-3.6-flash spolu s plateným gemini-3.1-pro-preview, ďalej gpt-5.6-luna a gpt-5.6-sol od OpenAI, bezplatný claude-sonnet-5 s prémiovým claude-opus-5 od Anthropicu a agentové API od Perplexity na oboch úrovniach.
Gemini nás často ťahá za nos
Výsledky ukazujú, že nakupujúci podstupujú najväčšie finančné riziko pri používaní Gemini. Platená verzia gemini-3.1-pro-preview si vymyslela nepravdivé informácie o produkte, ako sú parametre, zloženie či samotný názov, až v 21 percentách prípadov. Ešte horšie vyzerá štatistika finančných prešľapov. Pri 54 percentách otázok obsahovali odpovede chybu, ktorá by spotrebiteľa stála reálne peniaze, napríklad nesprávne uvedenú cenu alebo úplne pomiešaný tovar.
Bezplatná verzia Gemini dopadla veľmi podobne, keďže vymyslené tvrdenia priniesla v 20 percentách prípadov a drahé omyly v 56 percentách odpovedí.
Google má navyše vážny problém udržať jednotnú líniu. V teste si bezplatný Gemini protirečil voči svojej vlastnej odpovedi spred 5 minút až v 29 percentách otázok, zatiaľ čo platený variant zmenil názor v 27 percentách prípadov. Claude v bezplatnej verzii vykazoval vymyslené fakty v 22 percentách a drahé chyby v 44 percentách prípadov, pričom sám sebe odporoval pri 26 percentách otázok. Platený Claude tieto čísla skresal na 12 percentách pri výmysloch, 21 percentách pri finančných chybách a 17 percentách pri protirečeniach.
Najlepšie sú na tom ChatGPT a Perplexity
Modely od OpenAI predviedli v teste oveľa stabilnejší výkon. Bezplatný ChatGPT si vymýšľal údaje len v 6 percentách prípadov a drahé omyly urobil v 19 percentách odpovedí, pričom sám sebe protirečil pri 22 percentách otázok. Jeho platená verzia mala vymyslené fakty v 7 percentách a finančné chyby v 17 percentách prípadov. Drahú zmenu názoru analytici zaznamenali pri 18 percentách otázok.

Jednoznačným víťazom celého porovnania sa stalo Perplexity, ktoré generovalo najpresnejšie dáta pri oboch verziách. Bezplatná možnosť si vymyslela fakt iba v 4 percentách prípadov, zatiaľ čo chybné údaje, ktoré by mohli viesť k finančnej strate, mala v 15 percentách odpovedí. Vlastným tvrdeniam protirečila v 17 percentách otázok. Prémiové Perplexity stlačilo vymyslené informácie na 3 percentá a drahé omyly na 14 percentá, pričom odchýlku od predošlej odpovede vykázalo len v 13 percentách prípadov.
AI vie poradiť, no nepodceňujte na fact-checking
Dakota Nunley zo spoločnosti Product.ai upozorňuje, že aj keď sú jazykové modely zo svojej podstaty pravdepodobnostné, neschopnosť zhodnúť sa so sebou samým po pár minútach je obrovskou červenou vlajkou. Špeciálne to platí pri fakte, že test prebiehal na najnovších verziách a samotné otázky boli pomerne priamočiare.
Spotrebitelia by preto mali presne vedieť, ako tieto nástroje fungujú a kde majú slabiny, aby ich dokázali využívať vo svoj prospech a neurobili zlú kúpu.
Umelá inteligencia výborne poslúži pri hľadaní inšpirácie, objavovaní nových produktov alebo ako partner na premýšľanie o nákupoch. Ak vám však záleží na presnej cene, konkrétnych špecifikáciách či zložení, vždy si tieto údaje radšej skontrolujte priamo na oficiálnej stránke výrobcu.
Pri hľadaní najlepších zliav zatiaľ stále nie je lepšia alternatíva než poctivé ručné porovnávanie, hoci vývoj modelov napreduje rapídnym tempom.
| Model / Úroveň | Vymyslené tvrdenie (aspoň 1) | Nákladná chyba pre zákazníka | Protirečenie vlastnej odpovedi |
| Gemini (free) | 20 % | 56 % | 29 % |
| Gemini (paid) | 21 % | 54 % | 27 % |
| Claude (free) | 22 % | 44 % | 26 % |
| Claude (paid) | 12 % | 21 % | 17 % |
| ChatGPT (free) | 6 % | 19 % | 22 % |
| ChatGPT (paid) | 7 % | 17 % | 18 % |
| Perplexity (free) | 4 % | 15 % | 17 % |
| Perplexity (paid) | 3 % | 14 % | 13 % |
