Statistiek & Data-analyse: verschil tussen versies

Uit Chemika Examenwiki
Naar navigatie springen Naar zoeken springen
R1039801 (overleg | bijdragen)
R1097154 (overleg | bijdragen)
 
(3 tussenliggende versies door een andere gebruiker niet weergegeven)
Regel 15: Regel 15:


==Examenvragen==
==Examenvragen==
===23 januari 2026===
#Beoordeel elk van de volgende uitspraken: is ze altijd juist, nooit, of enkel onder bepaalde voorwaarden? Verklaar je antwoorden.                          Uit de centrale limietstelling volgt dat:
#*we de verdeling van elke toevalsvariabele kunnen benaderen met een normale verdeling.
#*we de verdeling van elke binomiale verdeling kunnen benaderen met een normale verdeling.
#*we de verdeling van elke toevalsvariabele kunnen benaderen met de standaardnormale verdeling als de steekproef voldoende groot is.
#*we de verdeling van het populatiegemiddelde van een binomiaalverdeling kunnen benaderen met de normale verdeling indien de steekproef voldoende groot is.
#*we een hypothesetest omtrent het populatiegemiddelde steeds mogen uitvoeren met behulp van de teststatistiek T = X-µ0/(S/sqrt(n))indien de steekproef voldoende groot is.
#Duidt voor elke van de 3 scatterplots aan in welk interval de Spearman correlatiecoëfficiënt en Pearson correlatiecoëfficiënt ligt en verklaar.
#Raf, data-analyst bij De Lijn, onderzoekt de efficiëntie van de verbindingen tussen de Campus en het Centrum. De txoevalsvariabele X stelt het aantal haltes voor dat een student meerijdt op bus 2 richting het centrum. Op basis van historische data is de volgende kansverdeling voor X opgesteld:
{| class="wikitable" style="margin:auto"
! Aantal haltes (x) !! Kans f(x)
|-
| 1 || 0.05
|-
| 2 || 0.20
|-
| 3 || 0.12
|-
| 4 || 0.45
|-
| 5 || 0.15
|-
| 6 || 0.02
|-
| 7 || 0.01
|}
#*Teken de dichtheidsfunctie en de verdelingsfunctie van X.       
#*Raf wil weten hoeveel haltes deze lijn minimaal moet behouden, zodat hij voor minstens 95% van de studenten garandeert dat ze hun eindhalte bereiken.
#*Uit eerder onderzoek blijkt dat de wandelafstand van de eindhalte naar de woonplaats (toevalsvariabele Y) gemiddeld 0.7 km bedraagt. De afstand tussen twee opeenvolgende bushaltes is 0.5 km. Raf definieert de totale afstand van de campus naar de woonplaats als de toevalsvariabele Z. Geef de vergelijking van Z. Wat is de gemiddelde afstand dat een student aflegt van campus tot woonplaats?
#In een ziekenhuislaboratorium wordt het cholesterolgehalte van 10 patiënten gemeten met twee verschillende analysetoestellen (toestel A en toestel B). Om na te gaan of beide toestellen gemiddeld hetzelfde resultaat opleveren, worden bij elke patiënt beide metingen uitgevoerd. De gemeten waarden (in mg/dL) zijn:
{| class="wikitable" style="margin:auto"
! Patiënt !! Toestel A !! Toestel B
|-
| 1 || 114 || 1116
|-
| 2 || 109 || 102
|-
| 3 || 100 || 95
|-
| 4 || 124 || 110
|-
| 5 || 90 || 94
|-
| 6 || 106 || 100
|-
| 7 || 100 || 96
|-
| 8 || 95 || 102
|-
| 9 || 100 || 90
|-
| 10 || 110 || 104
|}
Is er bij een significantieniveau van α = 1% voldoende bewijs om aan te nemen dat er geen significant verschil is tussen de gemiddelde cholesterolmetingen van beide toestellen? (R-code gegeven over gemiddelde, variantie en Shapiro test maar deze vraag is ook zonder deze code oplosbaar, je hebt dan gewoon iets meer rekenwerk)
#*Welke hypotheses worden getest om een antwoord te bieden op de gestelde vraag? Formuleer zoveel mogelijk in symbolen en verklaar de gebruikte notatie indien van toepassing.
#*Geef de formule van de teststatistiek en de (eventueel benaderende) verdeling ervan onder H0 waarmee je de hypotheses kan testen. Leg uit waarom aan de voorwaarden van de gekozen teststatistiek voldaan is.
#*Bereken de testwaarde en de P-waarde. Geef zowel de uitdrukking met de kans als de waarde ervan.
#*Wat is de betekenis van de bekomen P-waarde? Formuleer zo specifiek mogelijk.
#*Formuleer een zo volledig mogelijk inhoudelijk besluit.
#*Leg uit of en hoe je conclusie eventueel verandert als het significantieniveau verhoogt.
#*Veronderstel dat de metingen nu genoteerd worden in mmol/L (millimol per liter). Als je weet dat voor cholesterol mg/dL = mmol/L × 38.67, hoe veranderen de teststatistiek en de P-waarde dan?
#Een farmaceutisch bedrijf test een nieuw medicijn ("Medicijn X") dat het herstel na een knieoperatie zou moeten versnellen. In een klinische studie worden 160 patiënten willekeurig verdeeld over 2 groepen: een groep die een placebo krijgt en een groep die Medicijn X krijgt. Na 6 weken wordt het herstel geëvalueerd als "Traag", "Normaal" of "Snel". De onderzoekers willen nagaan of er een verband bestaat tussen de behandeling en de herstelsnelheid. Ze voeren de analyse uit in R.
{| class="wikitable"
|-
! scope="col"|
! scope="col"| Traag
! scope="col"| Normaal
! scope="col"| Snel
|-
! scope="row"| Placebo
| 24
| 32
| 24
|-
! scope="row"| Medicijn X
| 12
| 28
| 40
|}
X-squared = 8.2667, df = (a), p-value = (b)
#*Welke hypotheses worden hier getest? Formuleer in woorden of symbolen.
#*Vul de waarden voor (a) en (b) aan in de R-output.
#*Maak een schets waarbij je de testwaarde en de P-waarde horend bij de hypothesetest aanduidt.
#*Wat is het besluit van de hypothesetest op significantieniveau α = 5%? Leg ook uit wat dit concreet in deze situatie betekent. Indien je besluit dat er een verband is tussen de behandeling en de herstelsnelheid, geef dan ook aan op welke manier.
#*Maak je hier mogelijk een type I fout of een type II fout? Leg uit wat dit concreet betekent in deze situatie.
===2 september 2025===
===2 september 2025===
#van LN(0,1) wordt een genormaliseerd quantielplot gemaakt, je krijgt 4 opties en moet de juiste kiezen en uitleggen waarom deze juist is.
#van LN(0,1) wordt een genormaliseerd quantielplot gemaakt, je krijgt 4 opties en moet de juiste kiezen en uitleggen waarom deze juist is.

Huidige versie van 5 feb 2026 om 12:18

Vakinformatie

Vanaf 2022: Hoorcolleges worden gegeven door Mia Hubert (medeauteur van het handboek). Examen bestaat 90% uit oefeningen, er kunnen kleine deeltjes theorie gevraagd worden als bijvraag. Dit wordt duidelijk aangegeven in het hoorcollege. Hoofdstuk 1 en 2 worden niet behandeld in de hoorcolleges (zelfstudie). Er zijn 7 oefenzittingen van 2 uur, waarbij de eerste en de laatste op computer (werken met statistisch programma R). R-code moet niet zelf kunnen geschreven worden, wel geïnterpreteerd. Tijdens de oefenzittingen wordt het bij sommige oefeningen op geoefend. Over H1, H2 en H7 worden geen oefeningen gemaakt. Oefeningen op examen zijn gelijkaardig met die vanuit de oefeningenzitting. Op het examen mag je een rekenmachine meenemen (geen grafisch of symbolisch), alsook het formularium en statische tabellen. DEZE MOETEN ONBESCHREVEN ZIJN!

(mening en info academiejaar 2022-2023) Vak werd gegeven door Mia Hubert

  • Aanpak vak
    • Vooral oefeningen op het examen, volg dus zeker de oefenzittingen!
  • Kwaliteit cursus
    • Staat op zich in wat er moet instaan
  • Examenvragen
    • Prof blijft zeggen dat de theorie vragen meerkeuze zijn (met verklaar, dus is sowieso al niet geweldig), maar bij ons was er ineens een hele open vraag, ik zou de theorie grotendeels negeren (gewoon genoeg weten voor de oefeningen) want dit staat sowieso maar op 4 punten en de vragen zijn ook enorm willekeurig naar mijn gevoel
    • Oefeningen zijn op zich gelijkaardig aan de oefenzittingen, maar ik blijf er van overtuigd dat dit examen voor een groot deel geluk hebben is, dus zelfs als de oefeningen thuis niet lukken, zou ik gewoon proberen en misschien heb je geluk

Examenvragen

23 januari 2026

  1. Beoordeel elk van de volgende uitspraken: is ze altijd juist, nooit, of enkel onder bepaalde voorwaarden? Verklaar je antwoorden. Uit de centrale limietstelling volgt dat:
    • we de verdeling van elke toevalsvariabele kunnen benaderen met een normale verdeling.
    • we de verdeling van elke binomiale verdeling kunnen benaderen met een normale verdeling.
    • we de verdeling van elke toevalsvariabele kunnen benaderen met de standaardnormale verdeling als de steekproef voldoende groot is.
    • we de verdeling van het populatiegemiddelde van een binomiaalverdeling kunnen benaderen met de normale verdeling indien de steekproef voldoende groot is.
    • we een hypothesetest omtrent het populatiegemiddelde steeds mogen uitvoeren met behulp van de teststatistiek T = X-µ0/(S/sqrt(n))indien de steekproef voldoende groot is.
  2. Duidt voor elke van de 3 scatterplots aan in welk interval de Spearman correlatiecoëfficiënt en Pearson correlatiecoëfficiënt ligt en verklaar.
  3. Raf, data-analyst bij De Lijn, onderzoekt de efficiëntie van de verbindingen tussen de Campus en het Centrum. De txoevalsvariabele X stelt het aantal haltes voor dat een student meerijdt op bus 2 richting het centrum. Op basis van historische data is de volgende kansverdeling voor X opgesteld:
Aantal haltes (x) Kans f(x)
1 0.05
2 0.20
3 0.12
4 0.45
5 0.15
6 0.02
7 0.01
    • Teken de dichtheidsfunctie en de verdelingsfunctie van X.
    • Raf wil weten hoeveel haltes deze lijn minimaal moet behouden, zodat hij voor minstens 95% van de studenten garandeert dat ze hun eindhalte bereiken.
    • Uit eerder onderzoek blijkt dat de wandelafstand van de eindhalte naar de woonplaats (toevalsvariabele Y) gemiddeld 0.7 km bedraagt. De afstand tussen twee opeenvolgende bushaltes is 0.5 km. Raf definieert de totale afstand van de campus naar de woonplaats als de toevalsvariabele Z. Geef de vergelijking van Z. Wat is de gemiddelde afstand dat een student aflegt van campus tot woonplaats?
  1. In een ziekenhuislaboratorium wordt het cholesterolgehalte van 10 patiënten gemeten met twee verschillende analysetoestellen (toestel A en toestel B). Om na te gaan of beide toestellen gemiddeld hetzelfde resultaat opleveren, worden bij elke patiënt beide metingen uitgevoerd. De gemeten waarden (in mg/dL) zijn:
Patiënt Toestel A Toestel B
1 114 1116
2 109 102
3 100 95
4 124 110
5 90 94
6 106 100
7 100 96
8 95 102
9 100 90
10 110 104

Is er bij een significantieniveau van α = 1% voldoende bewijs om aan te nemen dat er geen significant verschil is tussen de gemiddelde cholesterolmetingen van beide toestellen? (R-code gegeven over gemiddelde, variantie en Shapiro test maar deze vraag is ook zonder deze code oplosbaar, je hebt dan gewoon iets meer rekenwerk)

    • Welke hypotheses worden getest om een antwoord te bieden op de gestelde vraag? Formuleer zoveel mogelijk in symbolen en verklaar de gebruikte notatie indien van toepassing.
    • Geef de formule van de teststatistiek en de (eventueel benaderende) verdeling ervan onder H0 waarmee je de hypotheses kan testen. Leg uit waarom aan de voorwaarden van de gekozen teststatistiek voldaan is.
    • Bereken de testwaarde en de P-waarde. Geef zowel de uitdrukking met de kans als de waarde ervan.
    • Wat is de betekenis van de bekomen P-waarde? Formuleer zo specifiek mogelijk.
    • Formuleer een zo volledig mogelijk inhoudelijk besluit.
    • Leg uit of en hoe je conclusie eventueel verandert als het significantieniveau verhoogt.
    • Veronderstel dat de metingen nu genoteerd worden in mmol/L (millimol per liter). Als je weet dat voor cholesterol mg/dL = mmol/L × 38.67, hoe veranderen de teststatistiek en de P-waarde dan?
  1. Een farmaceutisch bedrijf test een nieuw medicijn ("Medicijn X") dat het herstel na een knieoperatie zou moeten versnellen. In een klinische studie worden 160 patiënten willekeurig verdeeld over 2 groepen: een groep die een placebo krijgt en een groep die Medicijn X krijgt. Na 6 weken wordt het herstel geëvalueerd als "Traag", "Normaal" of "Snel". De onderzoekers willen nagaan of er een verband bestaat tussen de behandeling en de herstelsnelheid. Ze voeren de analyse uit in R.
Traag Normaal Snel
Placebo 24 32 24
Medicijn X 12 28 40

X-squared = 8.2667, df = (a), p-value = (b)

    • Welke hypotheses worden hier getest? Formuleer in woorden of symbolen.
    • Vul de waarden voor (a) en (b) aan in de R-output.
    • Maak een schets waarbij je de testwaarde en de P-waarde horend bij de hypothesetest aanduidt.
    • Wat is het besluit van de hypothesetest op significantieniveau α = 5%? Leg ook uit wat dit concreet in deze situatie betekent. Indien je besluit dat er een verband is tussen de behandeling en de herstelsnelheid, geef dan ook aan op welke manier.
    • Maak je hier mogelijk een type I fout of een type II fout? Leg uit wat dit concreet betekent in deze situatie.

2 september 2025

  1. van LN(0,1) wordt een genormaliseerd quantielplot gemaakt, je krijgt 4 opties en moet de juiste kiezen en uitleggen waarom deze juist is.
  2. wat zijn de voorwaarden voor lineaire regressie en hoe kan je deze checken
  3. er is een spel waar je 3 staafjes hebt en in je hand een hoeveelheid staafjes moet hebben (0-3), neem aan dat je als speler willekeurig de hoeveelheid kiest. Het doel van het spel is gokken hoeveel staafjes er in totaal gekozen zijn
    • wat is de verwachte waarde en de variantie van 1 speler.
    • je speelt met 3 dit spel, waarom is de kans dat er 4 staafjes worden gekozen 0.1875 (antw is omdat dit 2*3!*(1/4)^3 is)
    • wat is de kans dat de eerste persoon 3 staafjes heeft als je weet dat er in totaal 4 staafjes gekozen worden.
  4. Elon Musk heeft veel mensen ontslaan van Twitter. Je denkt dat dit te maken heeft met de lengte van de achternaam, je krijgt R-code van een X-squared, met lengte achternaam <5, 5-10, <10 karakters en hoeveel ontslagen en niet ontslagen uit een steekproef.
    • welke voorwaarden zijn er en is hieraan voldaan
    • wat is de hypothese die je test
    • geeft te teststatistiek onder H0 (is al uitgerekend door R dus enkel formule) geef ook de vrijheidsgraden
    • wat besluit je op het 1% significantieniveau, en wat besluit je dan
    • teken de p-waarde
    • stel je vraagt het aan 100x meer mensen en hebt dezelfde vondsten gwn met 00 achter. Heeft dit invloed op je besluit en op de berekening? leg uit
  5. Twee mensen denken dat na het inschaffen van een 9-euro-ticket voor Duitse treinen de mensen van Keulen 150km of meer, meer afleggen. Testen dit door 100 mensen aan de spreken op station. Je krijgt R-code over wat er gevonden werd.
    • welke hypotheses stel je op, doe dit met zoveel mogelijk symbolen
    • mag je de test uitvoeren. wat zijn de voorwaarden? (je kreeg boxplots van Km voor het ticket en na, en na-voor)
    • welke test ga je doen, schrijft de teststatistiek en verdeling onder H0
    • reken dit uit (je krijgt van R de 'mean' en 'var' van voor en na het ticket)
    • geef de p-waarde, zowel het percentage als geschatte waarde
    • wat beslis je op 5% significantieiveau
    • extra man geeft zijn mening met een interval, beslis op welk significantieniveau het bezig is.
    • is de man akkoord op respectievelijk significantieniveau met het koppel

26 januari 2024

  1. Meerkeuze vraag over verband lognormale verdeling, e^x, toevalsvariabele, X, normaal verdeling. Alle mogelijke oplossingen aanduiden + verklaar.
    • Als… normaal verdeeld is dan is… lognormaalverdeeld of omgekeerd
    • Verwachtingswaarde, mediaan etc.
  2. Meerkeuze vraag: gegeven= determinantenmatrix waaruit je de covariantie en de variantie uit kan halen. Gegeven zijn 4 scatterplots, welke scatterplot past het best bij de determinantenmatrix en verklaar.
  3. Vraag over kansen-> Regel van Bayes, wet van totale kans, complementaire regel. De vraag was iets in de aard van 24,2% van de jongeren haalt een onvoldoende voor wiskunde. 6% Van de kwart meest bevoorrechte jongeren haalt een onvoldoende, 42% van de kwart minst bevoorrechte jongeren haalt een voldoende.
    • Wat is de kans dat je bevoorrecht bent als je een voldoende haalt?
    • Wat is de kans dat de kwart minste of kwart meeste een voldoende haalt?
  4. Een pendelstudent heeft over 25 dagen vastgesteld dat zijn bus 10/25 te laat komt en zijn trein 6/25. Kan hij hieruit besluiten de kans dat de bus te laat komt groter is dan dat de trein te laat komt?
    • Hypothese test uitvoeren
    • Type I of II fout? (+Waarom?)
    • Meerkeuze vraag
    • 90% betrouwbaarheidsinterval opstellen en vergelijken of het overeenkomt met je besluit uit de hypothese test.
  5. Definitie van P-waarde
  6. Een winkelmedewerker merkt over 10 dagen op dat de klanten vriendelijk naar hem lachen terwijl hij de radijzen opruimt. Hebben de 2 een verband met elkaar? (De gegevens waren iets anders maar het was iets in die aard)
    • Hypothese test uitvoeren (R-output is gegeven, je kan rho daaruithalen en de voorwaarde voor de normale verdeling (Shapiro-Wilk test))
    • Type I of II fout? (+Waarom?)

27 januari 2023

  1. Meerkeuze: geg: 4 grafieken, welke is een genormaliseerd kwantielplot? (+ Waarom?)
  2. Staafspel: 3 spelers met elk 3 stokken, ieder houdt x/3 stokken achter zn rug, dan proberen ze te raden hvl stokken er in totaal achter iedereen zn rug zijn
    1. Kans 4 stokken in totaal?
    2. Kans 3 stokken bij 1 persoon als je weet dat er 4 in totaal zijn?
  3. Twee R-vragen: R data gegeven, geef hypothese en voorwaarden voor die hypothese

19 januari 2022

  1. enkele meerkeuzevragen, hierbij verklaren waarom je dit antwoord hebt gekozen.
  2. onbekende µ vinden, bij normale verdeling van gewichten van studenten. Daarbij subvraag over juiste R-code kiezen om een binomiale verdeling te doen.
  3. hypothesetest met 1 groep. over berekenen gemiddelde kost kerstdiner. Enkele gegevens gegeven via R-code.
  4. hypothesetest met 2 groepen (chi-kwadraattest). Bepaalde gegevens gegeven met R-code. Hierbij vragen beantwoorden, ontbrekende waarden invullen. weinig rekenwerk.

https://p.cygnus.cc.kuleuven.be/bbcswebdav/pid-35776108-dt-content-rid-337499823_2/courses/B-KUL-G0N11a-2223/20220128_modeloplossing.pdf

18 januari 2022 VM

  1. 2 Meerkeuzevragen met meerdere mogelijke antwoorden. 1 over bivariate normale verdeling en 1 over een betrouwbaarheidsinterval. Keuze uitleggen.
  2. 80% van de fietsers in Leuven zonder werkend achterlicht draagt geen helm. 15% van de fietsers waarbij het achterlicht wel werkt, draagt een helm. 95% van de fietsers die een helm dragen hebben een werkend achterlicht.
    • Toon aan dat de kans dat het achterlicht van een willekeurige fietser in Leuven werkt 96,2% is.
    • Wat is de kans dat een fietser in Leuven een helm draagt?
    • Is de kans op een werkend achterlicht afhankelijk van de kans dat een fietser een helm draagt?
  3. Een luchtvaartmaatschappij publiceerde in een rapport dat 83% van zijn reizigers de luchtvaartmaatschappij aanraadt aan hun vrienden. Een kritisch persoon denkt dat dit een overschatting is en doet een steekproef. 160 van de 200 bevraagde mensen zeggen dat ze de luchtvaartmaatschappij aanraden aan hun vrienden. Ga na met een hypothesetest:
    • Wat zijn de hypotheses?
    • Ga na of de voorwaarden voldaan zijn en wat dit betekent.
    • Geef de teststatistiek en de testwaarde.
    • Bepaal de P-waarde en schrijf deze in symbolen en in waarde. Duid de P-waarde aan op een grafiek en leg uit wat een P-waarde is.
    • Geef zo volledig mogelijk het besluit op significantieniveau alfa=1% en leg uit wat dit betekent voor deze steekproef.
    • Welke fout maak je mogelijks? Leg uit wat dit betekent voor deze steekproef.
  4. Gegeven R-output over een steekproef over de hoofdlengte en de totale lengte van een buideldier.
    • Leg uit hoe je de totale lengte van een buideldier kan schatten als je de hoofdlengte weet.
    • Vul waarden (a), (b) en (c) aan. (ANOVA tabel in R-code)
    • Is het gebruikte model zinvol? Ga dit na met een hypothesetest en ga ervan uit dat aan alle voorwaarden is voldaan.
    • Een hoofdlengte is gegeven, wat is de verwachte waarde van de totale lengte van dit buideldier? Geef het betrouwbaarheidsinterval voor deze specifieke hoofdlengte.

18 januari 2021 NM

  1. 1) (Op 9 ptn) Gegeven is een tabel met 2 primaat groepen (controle & een groep die behandeling onderging) met de percentages herkenning van een object op kort & lange termijn geheugen. Alles op significantieniveau 0,05 bewijzen en varianties gelijk.
    • 1. Is de gemiddelde som van precentage herkenning op korte termijn bij behandelde groep significant kleiner dan die van de controle? a) Geef weer in grafiek. b) Stel hypotheses op en verklaar symbolen. c) T-verdeling en voorwaarden. d) Teststatistiek, P-waarde & schets de grafiek. e) Conclusie
    • 2. Is er een lineair verband tussen de herkenning op korte & lange termijn bij behandelde groep. Dezelfde deelvragen (b tot e).
  2. 2) (Op 4 ptn) R output gegeven.
    • a) Welk regressiemodel wordt er gebruikt en wat zijn de schattingen van de parameters uit het model?
    • b) Welke modelveronderstellingen worden er gemaakt? Ga na of deze voldaan zijn.
    • c) Vul de ontbrekende waarden (1) t.e.m. (3). Deze waren: teststatistiek bij B, MSE & F.
    • d) e_22/s_e berekenen.
  3. 3) (Op 4 ptn) Enkele kansen gegeven.
    • a) Voorwaardelijke kans berekenen.
  4. 4) (Op 4 ptn) Exponentiële verdeling met Sn = T1+T2+T3+...+Tn
    • a) Als n=100 lamdba=1/5 a=600. Wat is P(Sn > 600)?
    • b) Wat is de mediaan met dezelfde gegevens als a.

17 januari 2020 (voormiddag)

    • A) Bewijs E(1/n * sommatieteken (xi + xgem)^2 = (n/n+1)* σ^2
    • B) toevalsvariabele X exponentieel verdeeld met parameter 4 en toevalsvariabele Y is normaal verdeeld met gemiddelde -5 en standaardafwijking 2. De toevalsvariabelen zijn onafhankelijk. Bereken E(2X-3Y) en Var(2X-3Y)
  1. Je hebt een groep mails. Gegeven: kans spam, kans mail bevat 'dringend' wanneer spam, kans mail bevat 'dringend' wanneer geen spam, kans mail bevat 'dit is geen spam' wanneer spam, kans mail bevat 'dit is geen spam' wanneer geen spam, kans mail bevat 'garantie' wanneer spam, kans mail bevat 'garantie wanneer geen spam. Ook gegeven: kans mail bevat garantie én dringend wanneer spam en kans mail bevat garantie én dringend wanneer geen spam.
    • Schrijf alle kansen in symbolen
    • Wat is de kans dat je mail spam is als 'dit is geen spam' in je mail voorkomt.
    • Bereken de kans dat het 'garantie' alleen in een mail voorkomt (zonder het derde woord en zonder 'geen spam').
    • Kans mail spam wanneer gegeven 'dringend' en geen 'garantie'
  2. Gegeven X aantal examens moeten afleggen voor behalen rijbewijs (1,2,3 of 4) en Y aantal uren les gevolgd (5,10,15 of 20).
    • Geef de marginale kansdichtheden
    • Kans dat men slaagt voor de eerste keer bij 5 uur les gevolgd en bij 15 uur les gevolgd
    • Welk pakket moet men kiezen om zeker voor de eerste keer te slagen
    • Bereken Cov(X,Y) en zijn de toevalsvariabelen afhankelijk? Verklaar
  3. Rookmelders verpakt in pakketten van 4. Kans rookmelder kapot is 0,01.
    • Toon aan dat kans pakket wordt teruggebracht 0,039 is.
    • Wat is de kans dat men 6 pakketten koopt en er exact 1 moet terugbrengen?
    • Wat is de kans dat men maximaal 20% van de pakketten moet terugbrengen als men er 130 koopt?
  4. Proportietest. Zelf P-waarde kunnen aanduiden op de normaal-curve. Het betrouwbaarheidsinterval uitrekenen.
  5. Waardes aflezen uit een R-script (bv. gemiddelde, ...) van een F-test. Vanuit deze waardes testen of de gemiddeldes van de 2 groepen gelijk zijn.
  6. Gegeven anova-tabel aanvullen (zie oefenzitting)

28 januari 2019

  1. Bewijs dat S² een onvertekende schatter is van sigma².
    • Betekend dit dat S ook een overtekende schatter is van sigma? Verklaar kort.
  2. Oefening over bivariate variabelen, oa. covariantie berekenen en zeggen of X en Y onafhankelijk zijn + verklaar.
  3. Een deel van het Lam gods was gestolen vroeger en enkele jaren geleden is het teruggevonden. De kans dat het om een authentiek deel gaat is 70%. 2 experts bekijken dit om na te gaan of het om een authentiek deel gaat of niet. De 1ste expert is correct in 80% van de gevallen en de 2de expert in 90% van de gevallen.
    • Wat is de kans dat de 1ste expert zegt dat het om een authentiek deel gaat en de 2de expert zegt dat het om een vals deel gaat.
    • Wat is de kans dat het schilderij echt is als de 1ste expert zegt dat het om een authentiek deel gaat en de 2de expert zegt dat het om een vals deel gaat.
  4. Een bepaald soort hond wordt geboren in 1 kleur maar tegen dat het volwassen is, heeft het witte vlekken gekregen. 98% van de volwassen honden hebben een witte punt aan hun staart. Er zijn net 12 pups geboren.
    • Wat is de kans dat hoogstens 10 van de 12 pups, later een witte punt aan hun staart gaan hebben?
    • Als er 1300 pups geboren worden, wat is de kans dat minstens 1280 pups later een witte punt aan hun staart krijgen?
  5. Het koopgedrag is onderzocht tijdens de feestperiode. Er is een gemiddelde en standaarddeviatie gegeven. Kan men besluiten, met een hypothesetest, of het gemiddelde uitgegeven bedrag minder dan 50 euro is.
  6. Nog iets...
  7. Anova script gegeven, zoals in de oefeningen de lege plaatsen opvullen. Regressievergelijking opstellen, hypothesetest of een regressie zinvol is. R² berekenen. Aantonen met een hypothesetest of er een monotoon verband is tussen X en Y.

19 JANUARI 2018

    • Bewijs de geheugenloosheid van de exponentiële verdeling.
    • Bewijs E[k(x)l(y)] waarbij x en y onafhankelijk en continu zijn.
    • Bereken E[(x)(y^2)] waarbij x exponentieel verdeeld is met verwachte waarde 0.5 en y~N
  1. De kans dat Anke naar statestiek gaat is 0.8 en de kans dat Bruno naar statestiek gaat is 0.6.
    • Bereken de kans dat minstens 1 van de 2 naar statestiek gaat wanneer deze variabelen onafhankelijk zijn.
    • De veriabelen zijn toch afhankelijk. De kans dat Anke aanwezig is en Bruno niet is 0.65. Bereken de kans dat Anke niet aanwezig is als gegeven dat Bruno aanwezig is.
    • Er zijn dubbel zoveel hoorcolleges dan oefenzittingen. Wat is de kans dat je willekeurig naar statestiek gaat en dit een hoorcollege is?
    • Bruno gaat naar elke oefenzitting. Wat is de kans dat hij aanwezig is tijdens een hoorcollege?
  2. Y-X is bivariaat normaal verdeeld met X de lengte van vrouwen in cm en Y de lengte van mannen in cm. Het gemiddelde van X is 165 en van Y is 175. Ze hebben beiden een variantie van 4 en de covariantie is 8.
    • Welke verdeling is dit? Bereken het gemiddelde en de variantie van de verschilfunctie.
    • Bereken de kans dat in een willekeurig koppel de vrouw groter is dan de man.
    • Bereken de kans dat in een willekeurig koppel de man en de vrouw groter zijn 170 cm.
  3. Een experiment wordt een 27 keer herhaald. Er is een gemiddelde en een standaardafwijking gegeven.
    • Bereken het betrouwbaarheidsinterval met alfa=0.05 en welke voorwaarden gelden er?
    • Bereken het betrouwbaarheidsinterval in het geval de standaardafwijking onbekend is en leg uit of dit breder wordt.
    • Bereken het betrouwbaarheidsinterval met alfa=0.01.
    • Hoevaak moet het experiment herhaald worden om een maximale foutenmarge van 0.001 te bekomen?
  4. 20 Cavia's krijgen 0.5 mg Calcium toegevoegd en 20 andere cavia's krijgen 2 mg Calcium toegediend.
    • Test of de hoeveelheid Calcium een invloed heeft op de lengte van de tanden waarvoor een gemiddelde en variantie voor beiden groepen gegeven is. Hier moet een volldedige hypothesetest uitgevoerd worden.
  5. Een examen bestaat uit 10 meerkeuzenvragen met 3 opties waarvan er telkens 1 juist is.
    • Wanneer je elke vraag gokt is de kans om te slagen gelijk aan 0.2131, toon dit aan.
    • Bepaal deze kans ook benaderend met een discrete verdeling en verklaar of dit een goede benadering is.
    • 200 studenten gokken bij elke vraag. Bereken de kans dat er strikt meer dan 50 geslaagd zijn.
  6. Er is een ANOVA-script gegeven.
    • Bepaal de regressierechte. Voor alfa was de t-waarde en de standaard fout gegeven. Voor beta niet, dit moest volgens mij met het gemiddelde van x en y die wel gegeven waren.
    • Test of dit een zinvolle regressierechte is met berekening teststatistiek, P-waarde en besluit.
    • R^2 berekenen en uitleggen.
    • Y berekenen met x=90.

20 JANUARI 2017

  1. eerste vraag waren 4 juist/fout vragen
    • als X en Y normaal verdeeld zijn, is de som dan altijd normaal verdeeld
    • iets me benadering van steekproefgem en populatiegem
    • iets me E(X) of da bij toevalsvariabele gelijk is aan het gem
    • ... weet ik ni meer exact, ge moet gewoon juist of fout aanduiden, ni uitleggen
  2. tweede vraag waren twee bewijzen (me Var(a+bX+cY) en E(a+bX+cY) en dan altijd zo bijvragen van a-e zo Var en E uitrekenen en mediaan berekenen, cumulatieve frequentie tekenen.. en dan iets me X+Y en kansen daarvan berekenen beetje vaag haha
  3. dan twee vragen op kansen ook met altijd zo deelvraagjes, eerste was over dat er verschillende sets van 20 stuks zijn en ge ga na hoeveel defecte er zijn, ge hebt enkele gegevens gegeven vb. Kans op geen defecte elementen in uw set van 20 is 70%, kans op juist 1 defect element is 20% enz. Daar dan allemaal kans vragen op, vb. Wat is de kans da als ge willekeurig een lot van 20 neemt, en ge weet da er exact 1 defect is, wa is dan de kans da als ge er twee willekeurige uitneemt da die ni defect zijn enzovoort..
  4. Dan een kansoefening met een kind da 10 keer me een dobbelsteen mag gooien en elke keer als die 6 gooit krijgt die een cadeau, wa is dan de kans da die meer als 3 cadeaus krijgt enzovoort, welke kansverdeling is da en bereken ook benaderend en zo van die deelvragen, ook nog als ze die traditie 35 jaar zouden doen en die jongen mag elke keer gooien op zijn bday wa is dan de kans da die meer dan 55 cadeaus krijgt
  5. en dan nog twee hypothesetesten waarvan ene met R output. De ene vraag was over herseninhoud, ze willen zien of de herseninhoud van een 75 jarige persoon gekropen is tov een 25 jarige persoon, ge hebt dan een lijst gekregen me gegevens en een R output waarin t waarde, P waarde, df ontbreken en aan de hand van die output moet ge dan dingen berekenen mbv hypothesetesten, ook output van een betrouwbaarheidsinterval en da interpreteren. De andere ging over het feit da er ooit gezegd is geweest da er dobbelstenen bestaan die "niet gelijk" zijn dus die ni eerlijk zijn, ge krijg een tabel me kansen en moet dan hypothesetesten uitvoeren om te zien of die dobbesltaan vervalst was of ni, weer Teststatistiek opstellen, testwaarde berekenen, interpreteren... en dan een tabel me ietske andere waardes van die dobbelstaan me de vraag of die P waarde dan hetzelfde blijft
  6. en nog een oefening over laatste hoofdstuk met die lineaire regressie ook me allemaal deelvraagjes ; de lineaire regressie opstellen en dan s^2 uitrekenen, ge hebt sx sy sxy enzo gegeven, en dan moet ge daar hypothese en teststatistiek ook doen dacht ik (bij elke hypothesetest vraagt ze teststatistiek, testwaarde , P waarde interpreteren etc) en dan geeft ze ook nog een R^2 waarde die ge moet interpreteren..

Ik denk da het zoiets ongeveer was haha, en ge had 3u30min tijd :)

15 januari 2016

  1. Juist/fout, Var(bx)=b²Var(x) aantonen
  2. rekenen met kansen
  3. Exponentiele verdeling, laptop heeft een gemiddelde leeftijd van 4 jaar, geef verdelingsfunctie, bepaal kans dat laptop langer leeft...
  4. Hypothesetesten
  5. R script van ANOVA tabel, ontbrekende waardes aanvullen

6 januari 2015

  1. Beschouw twee toevalsvariabele X en Y = g(X) met g een monotone functie dan is:
    1. E(Y) = g (E (X)) ?
    2. Med(Y) = g ( Med (X)) ?
    3. Med(Y) = g( E (X)) ?
    4. IQR (Y) = g (IQR (X)) ?
  2. In Vlaanderen verspreid de groothandel 2000 porties everzwijnsvlees over 15 restaurants. Neem aan dat exact 11 porties hiervan besmet zijn met een virus. In leuven leverde de groothandel 250 (onafh.) porties vlees:
    1. hoeveel besmette porties vlees verwacht men in Leuven?
    2. Hoe groot is de kans dat minstens 2 porties vlees in Leuven besmet zijn met het virus?
      1. Bereken deze kans exact
      2. Bereken een benadering van deze kans
      3. Is de benaderde kans die je vond een goede benadering voor de kans die je vond? Waarom wel/niet?
  3. Mannelijke radiologen worden blootgesteld aan straling. Onderzoekers beweren dat deze frequente blootstelling de kans op mannelijke nakomelingen zou beïnvloeden. Uit een studie van 31 radiologen, bleek dat 30 van de 87 nakomelingen mannen waren. Kan je op basis van deze studie besluiten dat een frequente blootstelling aan straling een significante invloed heeft op de kans op mannelijke nakomelingen voor een man? α = 0.05, normale omstandigheden de kans op mannelijke omstandigheden 50% bedraagt.
    1. Formuleer een geschikte H0 en H1 op deze vraag
    2. Geef de teststatistiek, de (benaderde) verdeling ervan onder H0 en de testwaarde voor deze steekproef.
    3. Bereken de (benaderde) P-waarde. Geef de formule en de waarde ervan in deze steekproef.
    4. Formuleer een zo volledig mogelijk besluit op basis van de P-waarde.
    5. Bepaal ook het 98% BI voor de kans op mannelijke nakomelingen. Wat besluit je?
    6. Wat is de betekenis van een type 2 fout bij deze hypothese test in deze situatie?
    7. R-script gegeven met ontbrekende gegevens. Deze worden gevraagd + andere vraagjes

25 januari 2016 (VM)

Hier missen nog bijna gegarandeerd enkele deelvraagjes, dus als je dit examen ook gemaakt hebt (en je weet er nog iets van), vul dan aan a.u.b.

  1. Enkele vragen i.v.m. verdelingen, hun kenmerken, proporties en kansen.
  2. Zij (X, Y) een bivariate normaalverdeling met mu = (2, 2) en sigma = ((1, 0.4), (0.4, 1)). Is dan Var(2X - Y) = 3.4?
  3. Zij X een continu verdeelde variabele met frequentie f(x). Zij a en b reëele getallen, bewijs dan dat: E(a + bX) = a + b*E(X) en Var(a + bX) = b^2 * E(X)
  4. We hebben thuis een alarm geïnstalleerd. Bij inbraak gaat het met 96% zekerheid af, maar op andere nachten is er ook een kans van 0.3% dat het afgaat vanwege storingen. In onze buurt is er een kans van 3% dat er op een gegeven nacht in een gegeven huis wordt ingebroken. Vannacht gaat het alarm af, hoe groot is de kans dat er werkelijk een inbraak is?
  5. Gegeven: een 2x3 relatieve frequentietabel. Aan de ene kant: mannen en vrouwen, aan de andere kant of de groep een slecht, middelmatig of goed oriëntatievermogen heeft. Rij van de mannen = (1/10, 1/20, 1/2), rij van de vrouwen = (1/5, 1/10, 1/20). Waar of fout:
    1. De kans dat een willekeurige vrouw een goed oriëntatievermogen heeft is 1/7.
    2. De verwachte waarde voor mannen en vrouwen zijn gelijk.
  6. Gegeven: de gemiddelde Belgische vrouw heeft een lengte van 168.1cm, met een standaardafwijking van 5.3cm.
    1. Clara is 180.3cm groot. Hoeveel percent van de Belgische vrouwen is kleiner dan Clara?
    2. Stella is kleiner dan 95% van de Belgische vrouwen. Wat is haar maximale hoogte?
    3. Hier aan de faculteit zijn er 354 vrouwen. Hoe groot is de kans dat exact twee vrouwen kleiner zijn dan haar (neem hiervoor Stellas maximale mogelijke lengte). Bereken deze exact.
    4. Bereken de kans op benaderende wijze. Is dit een goede benadering?
  7. Gegeven: de uitslagen van de verkiezingen van mei 2014 en een peiling van 2013. Beiden zijn lijsten van zeven partijen en "Overige", elk met een corresponderend percentage. Bepaal op significantieniveau 0.05 of deze peiling de verkiezingsresultaten kan voorstellen.
    1. Kies gepaste hypothesen voor je test uit te voeren.
    2. Geef de teststatistiek, verdeling en testwaarde van je test.
    3. Geef de P-waarde.
    4. Vorm een besluit.
  8. In een fabriek worden er dagelijks 5000 dozen pralines geproduceerd. Elke doos beweert 250g te wegen. Een nieuwe kwaliteitscontroleur ("een jonge snaak" zoals zij het verwoordden) neemt op een dag lukraak 20 dozen uit de productie voor inspectie. Het gemiddelde van deze steekproef is 243.7g met een variantie van 6.91 g^2. Test op significantieniveau 0.05 of de fabriek systematisch te lichte dozen maakt.
  9. Kies gepaste hypothesen voor je test uit te voeren.
    1. Geef de teststatistiek, verdeling en testwaarde van je test.
    2. Geef de P-waarde.
    3. Vorm een besluit.
  10. Geef het 95%-betrouwbaarheidsinterval voor het gemiddelde van de dagproductie. Geef de definitie van het 95%- betrouwbaarheidsinterval en leg uit wat dit concreet betekent in deze situatie.
  11. Leg uit wat een type-I en type-II fout concreet betekenen in deze situatie.
  12. Gegeven: output van summary en anova in R.
    1. Vul aan: SSM, MSM, MSE, F-waarde, P(F > f) en voor de slope: t-waarde en P(T > t).
    2. Voer een hypothesetest uit omtrent H0: alfa = 0 versus H1: alfa != 0
    3. Geef de regressierechte.
    4. Geef R^2 en leg uit wat deze waarde betekent.

26 Januari 2015 (nieuwe prof?)

  1. Duid aan welke stellingen kloppen en verantwoord: Van een kwantielplot kan je aflezen of:
    1. 2 variabelen afhankelijk zij van elkaar.
    2. er een lineair verband is tussen 2 variabelen
    3. een variabale uit een bepaalde verdeling komt
    4. 2 variabelen bivariaat normaal verdeeld zijn
  2. Duid aan welke stellingen kloppen en verantwoord: Indien (X,Y) bivariaatnormaal verdeelde toevalsvariabelen met populatiecorrelatiecoëfficiënt p en:
    1. H0: p=0 vs H1:p=/=0
    2. Een p-waarde <alfa oplevert kan je op significantieniveau alfa:
    3. besluiten dat er een lineair verband is tussen X en Y, mogelijks monitoon
    4. besluiten dat er een monotoon verband is tussen X en Y
    5. niet verwerpen dat er een lineair verband is tussen X en Y, mogelijks lieair
    6. niet verwerpen dat er een monotoon verband tussen X en Y.
  3. Levensduur van een laptop is exponentieel verdeeld. Verwacht wordt dat een laptop 3 jaar meegaat. Kans dat een laptop langers dan 3jaar meegaat voor een voorzichtige student is 55%, voor een slordige student is dit 30%.
    1. Toon aan dat de kans dat een laptop langer als 3jaar meegaat, zonder rekening te houden met voorzichtigheid = 36.79%
    2. Hoeveel % van de studenten is slordig?
    3. Jan heeft 3 jaar zijn laptop, wat is de kans dat hij er voorzichtig mee omgaat?
  4. Het aantal vogels dat voederplaatsen bezoekt wordt verwacht op 35 door Natuurpunt. Dit jaar werden in 100 tuinen gemiddeld 41 vogels per tuin waargenomen met een standaarddeviatie van 24. Is het gemiddeld aantal vogels per tuin dit jaar groter dan verwacht door Natuurpunt?
    1. H0 en H1?
    2. Welke teststatistiek gebruik je? Wat is de verdeling ervan onder H0?
    3. Welke veronderstellingen maak je om deze test te mogen uitvoeren?
    4. Bereken de testwaarde
    5. Bereken de (benaderende) p-waarde, geef de formule en de (benaderende) waarde ervan.in deze steekproef.
    6. Maak een schets en duid er de testwaarde en p-waarde op aan.
    7. Wat besluit je op basis van de p-waarde?
    8. Maak je hierbij mogelijk een type I of type II fout?
  5. De ontkieming van zaden werd onderzocht bij licht en schemerdonker. 86 van de 100 zaden ontkiemden bij licht, 60 van de 80 zaden ontkiemden bij schemerdonker. 4.1 Onderzoek als er meer zaden ontkiemen bij licht dan schemerdonker, formuleer besluit op significantieniveau 0.05.
    1. H0 en H1?
    2. Teststatistiek, benaderende verdeling onder H0 en testwaarde
    3. p-waarde? Geef uitdrukking met kans als de (benaderende) waarde.
    4. Formuleer een zo volledig mogelijk besluit.
  6. Stel een 80% betrouwbaarheidsinterval op voor de proportie van zaden die bij licht ontkiemen.
    1. Wat is de betekenis van dit betrouwbaarheidsinterval?
    2. Vraagjes met R-output (gegevens van ANOVA kunnen berekenen, R² kunnen geven + betekenis,...)

27 januari 2014

  1. Juist of fout. Leg uit en indien nodig verbeter.
  2. een exp (λ) met λ>0 geeft Σxi ~ N(n/λ , n/λ²)
  3. als X en Y normaal verdeeld zijn, dan is X - Y eveneens normaal verdeeld
  4. (weet ik niet meer)
  5. een symmetrische histogram is een grafische voorstelling van normaal verdeelde resultaten.
  6. Een kansberekeningsvraag: in een winkel geven klanten gemiddeld 70euro uit met een standaardeviatie van 20euro.
  7. Wat is de kans dat iemand in de winkel meer dan 40euro uitgeeft?
  8. Er staan 10 klanten in de rij aan te schuiven van de kassa. Wat is de kans dat 3 klanten minder dan 40euro uitgeven?
  9. Er staan nu 100 klanten in de rij van de kassa aan te schuiven. Wat is de kans dat minstens 30 klanten minder dan 40euro uitgeven?
  10. Betrouwbaarheidsinterval vraag:Er wordt een onderzoek gedaan naar de voorkeur van lezers, welke soort drager (papier, e-book, ...) zij verkiezen om te lezen. Er werden 1000 mensen ondervraagd, waarvan 93% zei dat ze het liefst papier als drager gebruiken om te lezen. 62% leest een krant het liefste met papier als drager. 8 op 10 zegt dat ze boeken het liefst lezen als papier de drager is.
  11. Zoek het 95% BI voor de mensen die het liefste lezen met papier als dragen
  12. Zoek het 99% BI voor de mensen die kranten het liefste lezen met papier als drager.
  13. Leg de betekenis van het laatste BI zo grondig mogelijk uit.
  14. Hypothesevraag met α= 0,05:Een schoenenverkoopster beweert dat vrouwen met een kleine schoenmaat schoenen kopen waarvan de hak gemiddeld hoger is dan de hak van vrouwen met een grote schoenmaat. De schoenverkoopster schrijft van 70 vrouwen die elk 1 paar schoenen kopen, de schoenmaat en de haklengte op. De schoenmaten worden onderverdeeld in kleine en grote schoenmaten. 31 vrouwen met kleine schoenmaat kopen schoenen met een gemiddelde haklengte van 4,39cm met een standaardvariantie van 3,14cm² en 39 vrouwen met grote schoenmaat kopen schoenen met een gemiddelde haklengte van 3,45cm en een standaardvariantie van 5,16cm².
    1. Stel een goede H0 en H1 op
    2. Welke veronderstellingen maak je en hoe kom je hieraan?
    3. Geeft de correcte test-statistiek
    4. Zoek de P-waarde
    5. Concludeer je resultaten en formuleer een goed antwoord.
    6. Welke fout wordt hier gemaakt, type I of type II en waarom?
  15. Hypothesevraag met α= 0,05: Tijdens de solden wordt een onderzoekbureau belast met de taak om te onderzoeken of er een verband bestaat tussen de gemiddelde kortingspercentages die worden gegeven door de winkels en het aantal dagen dat de solden al bezig zijn (van 3 januari tot 31 januari).(hier worden een aantal R - scripten en resultaten en grafieken van een aantal test gegeven: Pearson en Shapiro-Wilk test dacht ik. Er zijn 4 scripten gegeven: deze van de gemiddelde kortingspercanteges, van de aantal dagen dat de solden al bezig zijn, eentje waarin de 2 vorige gecombineerd zijn in een Pearson correlatie test en eentje waar ze gecombineerd zijn in een Shapiro - Wilk test)
    1. Vul de R-scripten aan door de juiste waarde in te vullen bij a) en b) (==> a) was een getal bij df en b) was het getal bij p-value)
    2. Stel een goede H0 en H1 hypothese op
    3. Welke test statistiek gebruik je?
    4. Zoek de p-waarde aan de hand van de gegeven R-scripten
    5. Concludeer je resultaten en formuleer een goed antwoord.

17 Januari 2014

  1. Juist of fout. Leg uit en indien nodig verbeter.
    1. Als je 2 steekproeven hebt met dezelfde grote n en een gemiddelde kans p. Dan is het betrouwbaarheidsinterval van 90% het breedste bij de steekproef met de grootste p.
    2. Je hebt twee continue, afhankelijke toevalsvariabe X en Y met f(x,y) de gezamelijke dichtheid en f(x) en f(y) de marginale dichtheid voor respectievelijk X en Y. Dan geldt f(x,y) =/ f(x)f(y) voor elke mogelijke (x,y). (=/ staat voor: is niet gelijk aan)
    3. Als de whiskers van een boxplot ongeveer even groot zijn, dan is de variabele normaal verdeeld
    4. Je hebt kansmodel Exp(2). dan is P(x>7|x>3) = P(x>4)
  2. Er werdt een onderzoek gedaan bij 3400 bestuurders die betrokken zijn geweest bij een ongeval. Van deze bestuurders waren 26.7% onder invloed van drugs en  29.1% hadden overmatig alchol gebruikt. Men wil nagaan hoe correct de alcohol en drugtest zijn. Als je weet dan 65% positief test als ze drugs gebruikt hebben  en 80% test positief als ze overmatig alcohol gebruik. Je weet ook dat 40% negatief test en geen alchol en drugs gbruikt heeft. We nemen aan dat het samen gebruiken van alchol en drugs niet voor komt.
    1. Toon aan dat de kans dat men positief test gelijk is aan 44.8%
    2. Wat is de kans dat iemand die positief test drugs heeft gebruikt?
    3. Wat is de kans dat iemand niets gebruikt heeft indien die negatief test?
  3. Er werd een onderzoek uitgevoerd bij 5 cafégangers. Ze kregen elk 2 pijlen. De eerste keer mochten ze smijten met hun voorkeurs hand, de tweede keer moesten ze smijten met de andere hand. (Gegeven een tabel met scores) Onderzoek of de gemiddelde score met hun voorkeurshand hoger ligt dan de gemiddelde score met de andere hand.
    1. stel de hyphotheses op
    2. welke veronderstellingen maak je?
    3. welke teststatistiek gebruik je?
    4. wat is de T-waarde?
    5. wat is de P-waarde?
    6. Wat is het resultaat van deze test? Leg uit voor dit voorbeeld
    7. maak een voortstelling van de P-waarde
    8. stel dat je veronderstelling niet klopt. Welke teststatistiek gebruik je dan?
      1. Voer deze test uit:
      2. wat is de T-waarde
      3. wat is de P-waarde?
      4. Wat is het resultaat van deze test? Leg uit voor dit voorbeeld
    9. je hebt output gekregen in verband met regressie en daar wat vragen bij.

20 Januari 2012

  1. 3 Meerkeuzevragen & uitleggen waarom
    1. X1,...,X100 is Poisson verdeeld met n=51, variantie=4 --> wat is E(X) en Var(X) van gemiddeldeXn bij normale verdeling.
    2. i.v.m. gemiddelde van steekproefgemiddelde als benadering van populatiegemiddelde --> enkel bij normale verdeling of bij elke verdeling waar; is steekproefgemiddelde evengoed een benadering van populatiegemiddelde; ...
    3. X is niet normaal verdeeld, Y= sqrt(X) is wel normaal verdeeld: welke hypothesetesten kan je uitvoeren: H0:µ(X)=3 vs H1:µ(X)≠3 en/of H0:µ(Y)=sqrt(3) vs H1:µ(Y)≠sqrt(3) en/of H0:Med(X)=3 vs H1:Med(X)≠3 en/of H0:Med(Y)=sqrt(3) vs H1:Med(Y)≠sqrt(3) + teststatiestiek geven + zijn besluiten van beide testen equivalent
  2. Oefening 1: berekenen van een kans (binomiaal) exact en benaderend met continuiteitscorrectie
  3. Oefening 2: Hypothesetest vergelijken gemiddelden van 2 groepen (ongepaard, sigma's verschillend, ..)=> De vragen hierbij waren:
    1. Formuleer de nulhypothese en de alternatieve hypothese.
    2. Welke teststatistiek gebruik je, wat is zijn waarde en welke verdeling volgt hij
    3. Bereken de p-waarde + definitie
    4. Teken deze p-waarde op een grafiek
    5. Besluit
    6. Welke aannames deed je voor deze hypothese en wordt er aan deze voldaan?
    7. Indien niet: wat zou je dan kunnen toepassen
    8. Wat betekenen type 1 en type 2 fout bij deze hypothese.
  4. Oefening 3: Je krijgt een heleboel statistica - output en een hoop vragen.
    1. Geef het regressiemodel
    2. Dan 5 vragen ivm anova tabellen, SSM SSE SST, ...
    3. Is de correlatie nuttig? stel een hypothese op
    4. BI berekenen van de rico
    5. definitie BI
    6. Aannames + nagaan modelveronderstellingen

18 Januari 2013 (VM)

  1. Thomas Van Den Spiegel is 214 cm groot. Leg uit hoe men kan bepalen hoe groot (of hoe normaal) dit is.
  2. Gegeven een tabel met daarin de absolute frequenties van een steekproef naar het spijbelgedrag van leerlingen uit het ASO, BSO en TSO: nooit, soms, vaak. Dit is dus een 3x3 tabel.
  3. Test: meer dan 50% van de leerlingen uit het ASO spijbelt nooit.
    1. Geef H0.
    2. Geef de teststatistiek onder H0 en de testwaarde.
    3. Geef de P-waarde.
    4. Besluit.
  4. Ga na of er een verband is tussen de waarden.
    1. Geef H0.
    2. Geef de teststatistiek onder H0 en de testwaarde.
    3. Geef de P-waarde.
    4. Besluit
  5. Gegeven de functie als en anders 0. Deze stelt de tijd voor die ik nodig heb om op mijn werk te geraken.
    1. Ik moet om 9u op mijn werk zijn, wat is de kans dat ik te laat kom als ik om 7u40 vertrek?
    2. Over 200 dagen gezien als ik opnieuw om 7u40 vertrek: wat is de kans dat ik hoogstens 20 keer op die 200 dagen te laat kom?
  6. Voor een nieuw soort roomijs hebben 9 mensen geproefd en een score tussen 1 en 20 (kan ook tussen 0 en 20 zijn, ik hoop van niet). Er waren 2 scores onder 10 en 7 scores boven 10.
    1. Bepaal met een teststatistiek of het ijs lekker is (dus een score groter dan 10).
      1. Geef H0.
      2. Geef de teststatistiek onder H0 en de testwaarde.
      3. Geef de P-waarde.
      4. Besluit.
    2. Wat is het 95% betrouwbaarheidsinterval van de mediaan? Wat betekent dit interval concreet voor dit voorbeeld?
  7. Een lineair verband tussen de maandelijkse productie van windmolens en de hoeveelheid wind, gezien over 32 maanden. Gegeven de output van de lm-functie uit R, een paar Shapiro-Wilk tests, enkele QQ-plots en de residuplot.
    1. Is het een goed model? (of zoiets)
    2. Vul de ANOVA tabel in (enkel 1 en F zijn gegeven)
    3. Wat betekent Std. Error in die lm-functie