Godinama je AI industrija poslovala na temelju udobne pretpostavke: ako se podaci nalaze na otvorenom webu, slobodno ih je skupljati i uvrstiti u skup za treniranje. Nije potrebna privola, nije potrebna obavijest — podaci su „javno dostupni", pa je sve u redu.

8. srpnja 2026. Europski odbor za zaštitu podataka (EDPB) zauvijek je zatvorio tu rupu. Uz nove smjernice o anonimizaciji i blockchainu, usvojio je svoje Smjernice o web scrapingu u kontekstu generativne umjetne inteligencije — a poruka je nedvosmislena: GDPR se oduvijek primjenjivao na osobne podatke prikupljene scrapingom weba koji se koriste za treniranje UI-ja, a regulatorna tijela sada precizno propisuju što usklađenost zahtijeva.

Što se zapravo promijenilo

Smjernice su u javnom savjetovanju do 30. listopada 2026., no smjer je već jasan, a očekuje se da će tijela za zaštitu podataka u EU-u prema njima provoditi nadzor. Ističu se tri zahtjeva.

Legitimni interes ne može se pretpostaviti — mora se procjenjivati svaki put. Razvijatelji više ne mogu tretirati „podaci su bili javni" kao samostalnu pravnu osnovu. Svaka operacija scrapinga zahtijeva stvarnu procjenu legitimnog interesa, od slučaja do slučaja, koja odmjerava interes razvijatelja za podatke naspram prava i razumnih očekivanja osoba koje ti podaci opisuju.

Minimizacija podataka mora se dogoditi prije početka scrapinga, ne nakon njega. Filtriranje nevažnih ili prekomjernih podataka nakon što su već usisani u skup za treniranje nije dovoljno dobro. Smjernice očekuju da minimizacija bude ugrađena u sam proces prikupljanja — scraping samo iz pouzdanih, prepoznatljivih izvora, vremensko označavanje prikupljenog te izostavljanje posebnih kategorija podataka (zdravlje, politička stajališta, seksualna orijentacija i slično) od samog početka, umjesto njihova naknadnog uklanjanja.

Stari skupovi podataka nemaju propusnicu. Ovo je pojedinost koja najviše iznenađuje ljude. Tvrtke se ne mogu pozvati na podatke prikupljene prije godina i tvrditi da pravila tada nisu postojala. Test odmjeravanja mora odražavati okolnosti u trenutku prikupljanja — što znači da razvijatelji bez čvrste dokumentacije o tome kako i zašto su prikupili starije skupove podataka sada se suočavaju s propustom u usklađenosti koji ne mogu lako naknadno popuniti.

8. srp. 2026.
EDPB usvaja smjernice o web scrapingu za generativnu UI
3
Nova zahtjeva za zakonit scraping podataka za treniranje
30. lis. 2026.
Rok javnog savjetovanja
0
Prijelazno razdoblje za skupove podataka prikupljene prije smjernica

Zamka anonimizacije

Neki su razvijatelji tvrdili da, jednom kad su osobni podaci ugrađeni u istrenirani model, oni postaju učinkovito anonimni i da se GDPR više ne primjenjuje. Prateće EDPB smjernice o anonimizaciji zatvaraju i ta vrata, postavljajući strog test u tri dijela: podaci se smatraju anonimnima samo ako se nijedna osoba ne može izdvojiti, nijedan podatak ne može povezati s drugim informacijama o njoj, i nijedna osoba ne može identificirati zaključivanjem.

To je visoka ljestvica — vjerojatno previsoka s obzirom na to kako veliki jezični modeli zapravo funkcioniraju. Istraživači su ponovljeno pokazali da modeli mogu „podrignuti" doslovne isječke svojih podataka za treniranje, uključujući osobne podatke, uz odgovarajući upit. Izvještavanje o smjernicama bilo je izravno u pogledu posljedice: malo koji, ako ijedan, AI sustav trenutačno može zadovoljiti ovaj standard anonimizacije. U praksi to znači da velik dio podataka unutar današnjih velikih modela vjerojatno i dalje predstavlja osobne podatke prema GDPR-u — sa svim obvezama koje to podrazumijeva.

Koga se to tiče

Svakoga tko izgrađuje ili fino podešava modele na temelju javnih web podataka. To uključuje najveće laboratorije — OpenAI, Meta i Google izrijekom se spominju u izvještavanju o smjernicama — no obveze se ne smanjuju za manje aktere. Startup koji fino podešava model otvorenog koda na scrapanim objavama s foruma ili istraživački tim koji izgrađuje manji, domenski specifičan model suočava se s istim zahtjevima legitimnog interesa, minimizacije i dokumentacije kao i vodeći laboratorij. Ako išta, manje su organizacije izloženije, jer obično imaju manje resursa za izgradnju procesa dokumentacije i procjene učinka koje će regulatori očekivati vidjeti.

💬
GDPRGard proizvod
Izgrađeno na vašem vlastitom sadržaju, ne na scrapanim podacima trećih strana

GDPRChat je AI widget za razgovor s korisnicima treniran na FAQ-ovima, politikama i informacijama o proizvodu vaše vlastite tvrtke — a ne na scrapanim web podacima nejasnog podrijetla. Kad korisnik (ili regulator) pita odakle dolaze podaci za treniranje, imat ćete odgovor.

Pogledajte GDPRChat →

Zašto je ovo važno čak i ako sami ne trenirate modele

Većina malih i srednjih poduzeća ne izgrađuje temeljne modele — no mnoga ih fino podešavaju, uvode AI alate trećih strana ili ugrađuju AI značajke dobavljača u vlastite proizvode. To vas ne stavlja izvan dosega. Ako je model dobavljača treniran na neprikladno prikupljenim podacima, rizik usklađenosti ne ostaje ograničen na dobavljača. Od tvrtki koje uvode AI alate sve se više očekuje da provedu osnovnu dubinsku analizu o tome kako su ti alati izgrađeni — koji su podaci korišteni za treniranje, postoji li dokumentirana pravna osnova i može li dobavljač odgovoriti na jednostavna pitanja o podrijetlu podataka.

To je vrlo drugačije pitanje od „radi li ovaj AI alat dobro", i vrijedi ga postaviti prije potpisivanja ugovora, a ne nakon što ga postavi regulator.

Što učiniti sada, u praksi

Tri stvari vrijedne poduzimanja sada, bilo da trenirate modele ili kupujete alate koji su trenirani:

  1. Izravno pitajte AI dobavljače koja je pravna osnova korištena za njihove podatke za treniranje i mogu li to dokumentirati.
  2. Budite skeptični prema tvrdnjama o „anonimiziranim" podacima za treniranje — EDPB-ova ljestvica je visoka, a nejasno umirivanje nije zamjena za pravi odgovor.
  3. Tretirajte „trenirano prije nego što su smjernice postojale" kao neprihvatljivu obranu, jer to neće prihvatiti ni regulatori.

Akt o UI privlači više pažnje jer je nov. No GDPR je već bio u potpunosti na snazi, a EDPB je upravo detaljno potvrdio da je oduvijek pokrivao način na koji se UI izgrađuje — ne samo način na koji se koristi.

To je i razlog zašto je GDPRGard izgradio GDPRChat na ovaj način: treniran na sadržaju vaše vlastite tvrtke — vašim FAQ-ovima, politikama i informacijama o proizvodu — umjesto na scrapanim podacima trećih strana nejasnog podrijetla. Ako birate AI alat za svoju tvrtku, „odakle dolaze podaci za treniranje i možete li to dokazati?" sada je opravdano pitanje za bilo kojeg dobavljača.

Rezervirajte besplatne konzultacije s GDPRGardom →

Izvori

Pročitajte i:

Podijeli ovaj članak
⚠️ Ovaj članak služi isključivo informativno i ne predstavlja pravni savjet. Za složene situacije usklađenosti obratite se kvalificiranom stručnjaku za zaštitu podataka. Zahtjevi GDPR-a i EU AI Acta podložni su stalnim regulatornim smjernicama — provjerite trenutne obveze sa svojim pravnim savjetnikom.