Priprema baze podataka za statističku analizu i SPSS
OBRADA ISTRAŽIVAČKIH PODATAKA

Priprema baze podataka – od sirovih odgovora do uredne baze spremne za analizu

Imate podatke iz ankete, Excel tabelu ili SPSS fajl, ali niste sigurni da li je baza pravilno napravljena? Da li svaki ispitanik treba biti u posebnom redu? Šta ide u kolone? Kako označiti nedostajuće vrijednosti, provjeriti duplikate i pronaći nelogične unose? Upravo tu počinje priprema baze podataka.

Dobra baza nije samo uredna tabela. Ona mora imati jasnu strukturu, pravilno definisane varijable, dosljedno kodirane vrijednosti i podatke koji se mogu pouzdano koristiti u daljoj analizi. Greške napravljene u ovoj fazi kasnije mogu uticati na statističke rezultate, tabele i interpretaciju.

🧩

Imate podatke, ali baza izgleda kao haos?

To je čest slučaj. Jedan ispitanik je upisan u dva reda, negdje piše „Da“, negdje „DA“, negdje „1“, a prazna polja su popunjena nulama. Statistički program će sve to prihvatiti, ali rezultat može biti pogrešan ako struktura baze nije prethodno provjerena i sređena.

Šta je priprema baze podataka?

Priprema baze podataka obuhvata organizovanje, provjeru i uređivanje prikupljenih podataka prije njihove statističke ili druge analize. Cilj je napraviti bazu u kojoj je jasno šta predstavlja svaki red, svaka kolona i svaka vrijednost.

U kvantitativnim istraživanjima to najčešće znači da jedan red predstavlja jednog ispitanika ili jednu jedinicu posmatranja, dok kolone predstavljaju varijable. Kod longitudinalnih ili drugih složenijih dizajna struktura može biti drugačija.

Šta ide u redove, a šta u kolone?

U najčešćem obliku baze za anketno istraživanje redovi predstavljaju ispitanike, a kolone varijable.

ID Pol Godine Zaposlenje Zadovoljstvo
001 1 24 0 4
002 2 29 1 5
003 1 22 0 3

Ovakva struktura omogućava da svaki ispitanik ima jedinstveni zapis, a svaka varijabla jasno definisano mjesto u bazi.

Zašto je ID ispitanika važan?

Jedinstveni identifikacioni broj pomaže da se svaki zapis razlikuje od ostalih. ID ne mora sadržavati ime ili drugi lični podatak. Može biti jednostavan broj poput 001, 002, 003…

Dobar ID olakšava provjeru duplikata, povezivanje različitih tabela i naknadno pronalaženje zapisa bez oslanjanja na podatke koji mogu biti osjetljivi ili nejedinstveni.

Provjera naziva varijabli

Nazivi varijabli treba da budu kratki, razumljivi i dosljedni. Umjesto dugog naziva pitanja, u bazi se mogu koristiti oznake poput pol, godine, zaposlenje, q1, q2, zadovoljstvo ili drugi sistem koji je unaprijed definisan.

Ako baza ima mnogo varijabli, korisno je imati codebook ili knjigu kodova u kojoj piše šta svaka varijabla znači i koje vrijednosti koristi.

Provjera raspona vrijednosti

Jedna od prvih provjera jeste da li se u bazi pojavljuju vrijednosti koje nisu moguće. Ako je Likertova skala definisana od 1 do 5, vrijednost 7 zahtijeva provjeru. Ako ispitanik ima 250 godina, vjerovatno je riječ o grešci pri unosu.

✓ ISPRAVNO

Likert skala: 1, 2, 3, 4, 5

⚠ PROVJERITI

Likert skala: 1, 2, 3, 4, 8

Kako provjeriti duplikate?

Duplikati mogu nastati kada ista anketa bude unesena dva puta, kada ispitanik više puta pošalje online obrazac ili kada se spajaju različite baze. Duplikat ne treba automatski obrisati bez provjere.

Prvo treba utvrditi da li su dva reda zaista isti zapis ili dvije različite osobe koje slučajno imaju slične odgovore. U tome posebno pomaže jedinstveni ID ili drugi relevantni identifikacioni podaci.

Nedostajući podaci – prazno polje nije uvijek greška

U istraživanju se često pojavljuju nedostajući podaci. Ispitanik može preskočiti pitanje, pitanje možda nije bilo primjenjivo na njega ili je podatak izgubljen tokom prikupljanja.

Takve vrijednosti treba jasno razlikovati od stvarnih odgovora. Na primjer, nula ne treba automatski koristiti kao oznaka za missing ako 0 već ima značenje u skali ili varijabli.

⚠️

Najopasnija baza je ona koja izgleda uredno, a nije provjerena

Excel tabela može vizuelno izgledati savršeno, ali sadržavati pogrešno kodirane varijable, nelogične vrijednosti, duplikate ili nedostajuće podatke koji nisu pravilno označeni. Zato vizuelni pregled nije dovoljan.

Provjera logičke konzistentnosti podataka

Neke vrijednosti pojedinačno mogu biti dozvoljene, ali njihova kombinacija može biti nelogična. Na primjer, ispitanik označi da nije zaposlen, a zatim odgovori na pitanje o broju godina rada kod trenutnog poslodavca.

Takve situacije treba pregledati u odnosu na logiku upitnika i pravila preskakanja pitanja.

Treba li provjeravati outliere prije analize?

Ekstremne vrijednosti mogu biti stvarni podaci ili greške pri unosu. Zato ih ne treba automatski brisati. Prvo treba provjeriti izvor podatka, raspon varijable i metodološki kontekst.

Odluka o tretiranju outliera zavisi od vrste varijable i statističke analize koja će se koristiti.

Priprema podataka za SPSS

Kod pripreme podataka za SPSS važno je da varijable imaju jasne nazive, pravilno definisane vrijednosti i odgovarajuće kodiranje. Potrebno je provjeriti numeričke i tekstualne varijable, value labels i nedostajuće vrijednosti.

Ako baza dolazi iz Excel-a, korisno je pregledati strukturu prije uvoza kako bi se izbjegli problemi sa formatima ćelija, praznim kolonama, miješanim tipovima podataka i pogrešnim zaglavljima.

Priprema baze podataka za master rad

Kod pripreme baze podataka za master rad važno je uskladiti strukturu baze sa upitnikom, hipotezama i planiranom analizom. Prije testiranja hipoteza treba provjeriti da li su sve potrebne varijable unesene i pravilno kodirane.

Ako je baza napravljena bez unaprijed definisanog plana, često je potrebno vratiti se na originalni upitnik i provjeriti značenje svake kolone.

Priprema baze podataka za doktorsku disertaciju

Kod složenijih doktorskih istraživanja baza može sadržavati više grupa, više mjerenja, veliki broj konstrukata ili podatke iz različitih izvora. Tada je posebno važna jasna dokumentacija strukture podataka.

Potrebno je znati kako su varijable formirane, kako su kodirane, koje transformacije su urađene i na koji način su različiti izvori podataka povezani prije naprednijih analiza.

💡

Imate Excel ili SPSS bazu i niste sigurni da li je spremna za analizu? Prije testiranja hipoteza treba provjeriti kodiranje, raspon vrijednosti, duplikate, nedostajuće podatke, nelogične kombinacije i strukturu varijabli. Tek tada baza postaje pouzdana osnova za dalju statističku obradu.

KONTROLA BAZE PODATAKA

Šta treba provjeriti prije statističke analize?

Baza može izgledati uredno, a ipak sadržavati greške koje se primijete tek tokom analize. Zato prije rada u SPSS-u, Excelu ili drugom statističkom programu treba sistematski provjeriti strukturu podataka, kodove, nedostajuće vrijednosti i logičku povezanost odgovora.

🏗️
STRUKTURA

Redovi i kolone

Prvo provjeravamo da li je baza organizovana prema dizajnu istraživanja. Kod tipične ankete jedan red najčešće predstavlja jednog ispitanika, a kolone pojedinačne varijable.

👤 Red → ispitanik 📊 Kolona → varijabla
✓ Struktura mora odgovarati načinu na koji će podaci biti analizirani.
🏷️
VARIJABLE

Nazivi i značenje varijabli

Naziv svake varijable mora biti povezan sa konkretnim pitanjem, mjerenjem ili podatkom. Posebno kod velikih upitnika lako se izgubi značenje oznaka poput Q1, Q2 ili Q15_3.

PRIMJER Q1 → Pol ispitanika Q2 → Starost Q3_1 → Prva tvrdnja skale
✓ Codebook znatno olakšava kontrolu većih baza.
🔢
KODOVI

Da li su vrijednosti dosljedno kodirane?

Ista kategorija ne bi smjela na jednom mjestu biti označena brojem, a na drugom tekstom ili drugačijim kodom.

DOBRO 1 = Da 0 = Ne
PROBLEM 1 / DA / Da 0 / NE / Ne
✓ Jedno značenje = jedan dosljedno korišten kod.
📏
RASPON VRIJEDNOSTI

Tražimo nemoguće i nelogične vrijednosti

Za svaku varijablu treba znati koje vrijednosti su dozvoljene. Vrijednost izvan očekivanog raspona može ukazivati na grešku pri unosu ili problem prilikom uvoza podataka.

LIKERTOVA SKALA 1–5 ✓ 1   2   3   4   5 ⚠ 7 → zahtijeva provjeru
✓ Ne brišemo sumnjivu vrijednost prije provjere izvornog podatka.
MISSING VALUES

Nedostajući podaci

Prazno polje, „ne znam“, odbijanje odgovora i pitanje koje nije primjenjivo ne moraju imati isto značenje. Način njihovog evidentiranja treba definisati prije statističke analize.

VAŽNO prazno ≠ automatski 0 0 može biti stvarna vrijednost
✓ Missing values moraju biti jasno razlikovani od stvarnih odgovora.
👯
DUPLIKATI

Da li je isti zapis unesen više puta?

Duplikati mogu nastati ručnim unosom, ponovnim slanjem online ankete ili spajanjem više izvora podataka. Slični odgovori sami po sebi nisu dovoljan dokaz da je riječ o duplikatu.

PROVJERITI ID ispitanika vrijeme unosa • ključne varijable
✓ Duplikat se ne briše automatski bez provjere.
🧠
LOGIČKA KONTROLA

Jesu li odgovori međusobno mogući?

Ponekad pojedinačne vrijednosti izgledaju potpuno ispravno, ali njihova kombinacija otkriva problem.

PRIMJER „Da li ste zaposleni?“ → NE „Godine kod trenutnog poslodavca“ → 8
✓ Provjeravamo skip-logiku i povezana pitanja.
↔️
REKODIRANJE

Obrnuto kodirane stavke

Kod skala sa pozitivno i negativno formulisanim tvrdnjama treba provjeriti zahtijevaju li pojedine stavke obrnuto kodiranje prije formiranja ukupnog rezultata.

1 → 5 2 → 4 3 → 3 4 → 2 5 → 1
✓ Rekodiranje zavisi od konkretnog instrumenta i načina bodovanja.
📈
EKSTREMNE VRIJEDNOSTI

Outlier nije automatski greška

Ekstremna vrijednost može predstavljati stvarnog ispitanika ili stvarno mjerenje. Prije bilo kakvog isključivanja potrebno je utvrditi njen izvor i procijeniti značaj za planiranu analizu.

✓ Provjeriti → objasniti → tek onda odlučivati o tretmanu.
🛠️
PRIMJER IZ PRAKSE

Greška → provjera → ispravka

01 · GREŠKA ⚠️ U koloni „Pol“ nalazimo:

1, 2, 1, Ž, 2, Žensko, 1…

02 · PROVJERA 🔍 Vraćamo se na codebook

Definisano je:
1 = muškarac
2 = žena

03 · ISPRAVKA Standardizujemo vrijednosti

1, 2, 1, 2, 2, 2, 1…

📌

Poenta: problem nije u tome što SPSS ne može pročitati podatke, već što analiza zahtijeva dosljedno definisane varijable. Računar ne može sam zaključiti da „Ž“, „Žensko“ i broj 2 predstavljaju istu kategoriju ako baza nije pravilno pripremljena.

BRZA PROVJERA

Da li je vaša baza spremna za analizu?

✓ Svaki zapis ima jasnu jedinicu posmatranja ✓ Varijable imaju razumljive nazive ✓ Kodovi su dosljedni ✓ Provjeren je raspon vrijednosti ✓ Nedostajući podaci su definisani ✓ Provjereni su mogući duplikati ✓ Provjerena je logika povezanih pitanja ✓ Obrnute stavke su identifikovane ✓ Ekstremne vrijednosti su pregledane ✓ Sačuvana je originalna verzija sirovih podataka
ČESTA PITANJA

Česta pitanja o pripremi baze podataka

Priprema baze podataka često djeluje jednostavno dok se ne pojave duplikati, nedostajući podaci, pogrešno kodirane vrijednosti, nelogični odgovori ili problemi pri uvozu u SPSS. Izdvojili smo najčešća pitanja koja se pojavljuju prije statističke analize.

🗃️ Šta znači priprema baze podataka?
Priprema baze podataka obuhvata organizovanje, provjeru i uređivanje prikupljenih podataka prije statističke ili druge analize. Cilj je da svaki red, kolona i vrijednost imaju jasno značenje i da baza bude spremna za pouzdanu obradu.
📋 Kako treba izgledati baza podataka za anketu?
Kod tipične ankete jedan red najčešće predstavlja jednog ispitanika, dok kolone predstavljaju varijable ili pitanja. Svaki ispitanik treba imati jedan jasno definisan zapis, a vrijednosti u kolonama moraju biti kodirane prema unaprijed utvrđenim pravilima.
👤 Da li svaki ispitanik treba imati svoj ID?
Preporučljivo je koristiti jedinstveni ID koji omogućava razlikovanje zapisa bez oslanjanja na ime ili druge lične podatke. ID olakšava provjeru duplikata, povezivanje tabela i naknadnu kontrolu podataka.
🏷️ Kako imenovati varijable u bazi podataka?
Nazivi varijabli treba da budu kratki, razumljivi i dosljedni. Mogu se koristiti oznake poput pol, godine, zaposlenje, q1 ili q2. Kod većih baza korisno je imati codebook u kojem je zapisano šta svaka varijabla predstavlja.
🔢 Kako provjeriti da li su podaci pravilno kodirani?
Potrebno je pregledati dozvoljene vrijednosti svake varijable i provjeriti da se isto značenje svuda koristi pod istim kodom. Frekvencije i raspon vrijednosti često brzo pokažu da li postoji neočekivana ili pogrešno unesena vrijednost.
Kako se evidentiraju nedostajući podaci?
Nedostajući podatak treba jasno razlikovati od stvarne vrijednosti. Prazno polje, odbijanje odgovora i pitanje koje nije primjenjivo ne moraju imati isto značenje. Način evidentiranja treba definisati prije statističke obrade.
0️⃣ Da li prazno polje mogu zamijeniti nulom?
Ne automatski. Ako nula već predstavlja stvarni odgovor ili numeričku vrijednost, zamjena praznog polja nulom može promijeniti rezultate analize. Prvo treba definisati šta predstavlja nedostajući podatak u konkretnoj varijabli.
👯 Kako pronaći duplikate u bazi podataka?
Duplikati se mogu provjeravati pomoću jedinstvenog ID-a, vremena slanja, ključnih varijabli ili drugih podataka relevantnih za istraživanje. Dva slična reda ne treba automatski smatrati duplikatom bez dodatne provjere.
📏 Šta znači provjera raspona vrijednosti?
Za svaku varijablu provjerava se da li su unesene vrijednosti moguće. Ako Likertova skala ima raspon od 1 do 5, vrijednost 8 zahtijeva provjeru. Isto važi za godine, prihode, broj zaposlenih i druge numeričke podatke.
🧠 Šta su logičke greške u bazi?
Logička greška nastaje kada pojedinačne vrijednosti mogu biti dozvoljene, ali njihova kombinacija nema smisla. Na primjer, ispitanik navede da nije zaposlen, a zatim unese deset godina rada kod trenutnog poslodavca.
↔️ Da li treba provjeriti obrnuto kodirane stavke?
Da, ako instrument sadrži stavke formulisane u suprotnom smjeru. Prije formiranja ukupnog rezultata skale treba provjeriti pravila bodovanja originalnog instrumenta i utvrditi koje stavke zahtijevaju rekodiranje.
📈 Šta su outlieri i da li ih treba brisati?
Outlieri su vrijednosti koje značajno odstupaju od većine podataka. Mogu biti greška, ali mogu predstavljati i stvaran slučaj. Zato ih ne treba automatski brisati. Prvo se provjerava izvor vrijednosti i njen značaj za planiranu analizu.
🧹 Šta znači čišćenje baze podataka?
Čišćenje baze podataka uključuje provjeru pogrešnih unosa, raspona vrijednosti, duplikata, missing values, nelogičnih kombinacija i drugih problema koji mogu uticati na kvalitet analize.
💻 Kako pripremiti Excel bazu za SPSS?
Prije uvoza treba provjeriti da su zaglavlja jasna, da nema nepotrebnih praznih redova i kolona, da su vrijednosti dosljedno kodirane i da u istoj koloni nisu pomiješani različiti tipovi podataka. Nakon uvoza u SPSS dodatno se definišu varijable, labels i missing values.
📊 Kako znam da je baza spremna za statističku analizu?
Baza je spremna kada su struktura i varijable jasne, kodovi dosljedni, rasponi vrijednosti provjereni, nedostajući podaci definisani, duplikati pregledani i eventualne logičke greške riješene ili dokumentovane.
💾 Treba li sačuvati originalnu bazu prije čišćenja?
Da. Preporučljivo je sačuvati originalnu verziju sirovih podataka i uređivanje raditi na kopiji. Tako se uvijek možete vratiti izvornim podacima ako kasnije treba provjeriti neku izmjenu ili grešku.
🎓 Kako pripremiti bazu podataka za master rad?
Bazu treba uskladiti sa upitnikom, istraživačkim pitanjima, hipotezama i planiranim analizama. Potrebno je provjeriti da su sve potrebne varijable unesene, pravilno kodirane i dovoljno jasno dokumentovane.
🔬 Kako izgleda priprema baze za doktorsku disertaciju?
Kod složenijih istraživanja može biti potrebno povezati više izvora podataka, više mjerenja ili različite grupe ispitanika. Posebno je važna dokumentacija transformacija, kodiranja, deriviranih varijabli i pravila prema kojima je konačna baza formirana.
📎 Šta treba poslati za provjeru baze podataka?
Pošaljite bazu u Excel, SPSS ili drugom dostupnom formatu, originalni upitnik, codebook ako postoji, metodologiju i planirane hipoteze ili analize. Ako mentor ima posebne komentare, korisno je poslati i njih.
💡

Imate gotovu bazu, ali niste sigurni da li je spremna za SPSS? Prije prvog statističkog testa treba provjeriti strukturu, kodiranje, raspon vrijednosti, nedostajuće podatke, duplikate i logiku povezanih varijabli. Nekoliko minuta kontrole može spriječiti mnogo problema kasnije.