총 100문항 · 문제·정답·해설·개념 무료 학습
이 회차는 100문항입니다. 자료를 읽고 푸는 문항이 46문항입니다. 풀이가 붙은 문항이 100문항입니다.
▶ CertLab에서 풀어보기두 지역 A , B 의 소득에 대한 상자 그림(box plot)은 다음과 같다. 이에 대한 설명으로 옳은 것만을 모두 고르면?
ㄱ. 최솟값은 A 지역이 B 지역보다 크다.
ㄴ. 중앙값은 A 지역이 B 지역보다 크다.
ㄷ. 범위는 A 지역이 B 지역보다 작다.
정답 1번
상자그림에서 A 지역은 최솟값과 중앙값이 모두 B 지역보다 위에 있고 수염 끝 사이가 더 넓어 범위도 크다. 따라서 ㄱ과 ㄴ만 옳으므로 정답은 1번이다.
다음 제시된 두 변수 X 와 Y 에 대한 산점도 중 X 와 Y 의 표본상관계수(피어슨의 표본상관계수)가 가장 큰 것은?
정답 3번
표본상관계수는 부호까지 포함해 견주는 값이고 3번 산점도가 왼쪽 아래에서 오른쪽 위로 뚜렷하게 모여 있어 가장 큰 양의 값을 가지므로 3번이 해당한다.
통계적 가설검정에서 제1종 오류확률에 대한 설명으로 옳은 것은?
정답 1번
제1종 오류는 귀무가설이 참인데도 기각해 버리는 잘못이므로 참일 때 기각할 확률이라고 한 1번이 옳다.
단순선형회귀모형 Y_i = β_0 + β_1 x_i + ε_i , (i = 1, 2, ⋯ , 22) 에서 최소제곱법으로 회귀식을 추정한 후 잔차제곱합을 구하였더니 2,100이었다. 이때 오차항 분산( σ^2 )의 불편추정값은? (단, ε_i 는 N (0, σ^2) 를 따르고 서로 독립이다)
정답 2번
단순선형회귀에서 오차항 분산의 불편추정값은 잔차제곱합을 표본 수에서 2 를 뺀 자유도로 나눈 값이므로 2,100 을 20 으로 나눈 105 인 2번이 해당한다.
코로나바이러스 감염 상황과 진단키트의 진단 확률이 다음과 같을 때, 한 사람의 진단키트 결과가 음성이라면 이 사람이 실제 음성일 확률은?
○ 전체 인구 중 코로나바이러스 양성은 20 %이다.
○ 진단키트에서 실제 음성인 사람을 음성으로 판단할 확률이 70 %이다.
○ 진단키트에서 실제 양성인 사람을 양성으로 판단할 확률이 80 %이다.
정답 3번
음성으로 판정받은 사람 가운데 실제 음성인 비율은 실제 음성이면서 음성 판정인 0.8 곱하기 0.7 을 음성 판정 전체인 0.56 과 0.04 의 합으로 나눈 14/15 이므로 3번이 해당한다.
두 연속형 확률변수 X 와 Y 가 독립일 때, 이에 대한 설명으로 옳지 않은 것은?
정답 4번
두 확률변수가 독립이면 X 가 주어졌을 때 Y 의 조건부밀도는 Y 자신의 주변밀도와 같아지는데 X 의 주변밀도와 같다고 한 4번이 옳지 않다.
다음은 단순선형회귀모형을 적합하여 얻은 분산분석표이다. 요인제곱합자유도평균제곱F -값회귀540(가)(다)잔차200(나)계74011 이에 대한 설명으로 옳지 않은 것은?
정답 4번
결정계수는 회귀제곱합을 총제곱합으로 나눈 값이라 540 을 740 으로 나눈 값인데 200 을 740 으로 나눈다고 한 4번이 옳지 않다.
다음은 시장조사에서 세탁기 색에 대한 선호도를 알아보기 위해 최근 판매된 세탁기의 색을 조사한 결과이다. 색 흰색 검은색 상아색 회색 합계 빈도 40 24 10 6 80 선호하는 색이 4 : 4 : 1 : 1의 비율로 분포한다는 가설을 검정하려 할 때, 이에 대한 설명으로 옳은 것만을 모두 고르면?
ㄱ. 검정통계량은 5이다.
ㄴ. 검정통계량의 자유도는 4이다.
ㄷ. 검은색의 기대도수는 32이다.
정답 2번
기대도수는 80 에 비율을 곱해 32, 32, 8, 8 이고 검정통계량은 5 이며 자유도는 범주 수 4 에서 1 을 뺀 3 이다. 따라서 ㄱ 과 ㄷ 만 옳으므로 정답은 2번이다.
분포에 대한 설명으로 옳지 않은 것은?
정답 4번
중심극한정리는 표본 수가 충분히 커야 쓸 수 있는데 표본이 다섯 개뿐인 경우를 근사적으로 표준정규분포라고 한 4번이 옳지 않다.
세 가지 필터의 성능을 비교하기 위해 일원배치 분산분석법(one-way analysis of variance)을 실시하여 얻은 분산분석표의 일부가 다음과 같을 때 (가)의 값은?
요인제곱합자유도평균제곱F -값처리50(가)오차206계70
정답 3번
처리 자유도는 세 필터이므로 2 이고 처리 평균제곱은 50 을 2 로 나눈 25, 오차 평균제곱은 20 을 6 으로 나눈 값이라 F 값은 7.5 이므로 3번이 해당한다.
다음은 어느 확률변수의 확률밀도함수이다. 이에 대한 설명으로 옳은 것만을 모두 고르면? (단, 함수는 0을 기준으로 좌우 대칭이다)
ㄱ. 평균은 0이다.
ㄴ. 중앙값은 0이다.
ㄷ. 최빈값의 절댓값은 중앙값보다 크다.
정답 4번
그림이 0 을 골짜기로 두고 좌우에 봉우리가 선 쌍봉이라 평균과 중앙값은 모두 0 이고 최빈값은 0 이 아닌 두 점이므로 절댓값이 중앙값보다 크다. 따라서 ㄱ, ㄴ, ㄷ 이 모두 옳으므로 정답은 4번이다.
어느 지역에서 20대 남자의 몸무게는 평균이 μ 이고 표준편차가 8 인 정규분포를 따른다고 한다. 이 지역에서 임의추출한 20대 남자 64명의 평균 몸무게가 66일 때, 모평균 μ 에 대한 95 % 신뢰구간은? (단, 단위는 kg이며, 표준정규분포를 따르는 확률변수 Z 에 대하여 P(Z ≥ 1.96) = 0.025 , P(Z ≥ 1.645) = 0.05 이다)
정답 1번
모표준편차 8 을 표본 수 64 의 제곱근 8 로 나누면 표준오차가 1 이고 여기에 1.96 을 곱해 표본평균 66 의 양쪽에 더하고 빼면 64.040 과 67.960 이 되므로 1번이 해당한다.
다중선형회귀모형 Y_i = β_0 + β_1 x_i1 + β_2 x_i2 + ε_i , (i = 1, 2, ⋯ , n) 에서 최소제곱법으로 구한 분산분석표의 F -값에 대한 p -값(유의확률)이 0.05보다 작다. 유의수준 5 %에서 내릴 수 있는 결론으로 옳은 것은? (단, ε_i 는 N(0, σ^2) 를 따르고 서로 독립이다)
정답 2번
분산분석표의 F 검정은 기울기 계수들이 모두 0 이라는 가설을 한꺼번에 검정하므로 기각하면 적어도 하나가 0 이 아니라는 뜻이라 2번이 옳다.
확률변수 X 에 대하여 Var(3X + 9) = 36 , E(X(X + 1)) = 10 을 만족할 때, E(X) 의 값은? (단, E(X) > 0 이다)
정답 2번
Var(3X+9) 은 9 곱하기 Var(X) 이므로 분산은 4 이고 E(X 제곱)+E(X)=10 에 E(X 제곱)=4+E(X) 제곱을 넣으면 이차식의 양수 해가 2 가 되므로 2번이 해당한다.
독립인 두 모집단 1과 2에 대한 확률분포는 각각 다음과 같다. 구분 x 0 1 2 모집단 1 P (X_1 = x) 2/3 1/3 0 모집단 2 P (X_2 = x) 0 1/3 2/3 모집단 i 에서 임의로 추출한 100개의 확률변수의 평균을 X̄_i 라 할 때, X̄_1 + X̄_2 의 근사분포는?
정답 2번
모집단 1 의 평균은 3 분의 1 이고 모집단 2 의 평균은 3 분의 5 라 합의 평균은 2 이며 두 분산이 모두 9 분의 2 라 표본평균의 분산을 더하면 900 분의 4 가 되므로 2번이 해당한다.
모평균과 모분산이 알려지지 않고 서로 독립인 두 개의 정규모집단에서 각각 25개씩 표본을 임의추출한 후, 두 모집단의 모분산을 비교할 때 사용하는 분포는?
정답 4번
두 정규모집단의 모분산을 견줄 때는 두 표본분산의 비가 F 분포를 따르고 각 자유도는 표본 수 25 에서 1 을 뺀 24 이므로 4번이 해당한다.
성별과 와인 생산지의 선호도가 관련이 있는지를 알아보기 위해 100명을 임의추출한 후 성별과 와인 생산지 선호도를 조사하여 작성한 분할표가 다음과 같다. 프랑스칠레미국행의 합남x_11x_12x_13R(1 ·)여x_21x_22x_23R(2·)열의 합C(·1)C(· 2)C(· 3) 성별과 와인 생산지 선호도가 관련이 있는지를 검정하는 카이제곱검정통계량의 값은?
정답 3번
독립성 검정의 카이제곱통계량은 관측도수에서 기대도수를 뺀 값을 제곱한 뒤 기대도수로 나누어 모두 더한 것이므로 분자만 제곱한 3번이 해당한다.
다음은 서로 독립인 두 지역 A 와 B 에서 실시하는 복지 프로그램 수혜자의 평균연령을 비교하기 위하여 두 지역의 복지 프로그램 수혜자 중에서 A 지역에서 100명, B 지역에서 200명을 임의추출하여 연령을 조사한 결과이다. A 지역B 지역표본평균3841표본표준편차810 A 지역에서 복지 혜택을 받는 사람의 평균 연령을 μ_A 라고 하고, B 지역에서 복지 혜택을 받는 사람의 평균 연령을 μ_B 라고 할 때, 가설 H_0 : μ_A = μ_B 대 H_1 : μ_A ≠ μ_B 를 검정하기 위한 p -값(유의확률)은? (단, Z 는 표준정규분포를 따르는 확률변수이다)
정답 1번
대립가설이 두 평균이 다르다는 양측이라 유의확률은 표준정규변수의 절댓값이 검정통계량의 절댓값보다 클 확률이므로 1번이 해당한다.
다음은 두 인자 A 와 B 에 대하여 이원배치법을 적용한 실험 결과의 분산분석표 일부이다. 실험에서 인자의 수준조합에 대한 반복실험수는 동일하다. 이에 대한 설명으로 옳지 않은 것은?
요인제곱합자유도평균제곱F -값p -값인자 A70010.011인자 B90030.040교호작용 A × B1,200(가)(나)0.034오차8008
정답 2번
오차 자유도 8 은 수준조합 여덟에 반복수에서 1 을 뺀 값을 곱한 것이라 반복수가 2 이고 자료 수는 2 와 4 와 2 를 곱한 16 개인데 15 개라고 한 2번이 옳지 않다.
정규분포로부터 임의추출한 자료의 정규확률그림(정규분포 분위수대분위수 그림, normal probability plot)은?
정답 3번
정규확률그림은 자료의 분위수와 표준정규분포의 분위수를 짝지어 찍은 것이라 자료가 정규분포를 따르면 점들이 한 직선 위에 놓이므로 직선인 3번이 해당한다.
두 자료 A, B의 줄기-잎 그림에 대한 설명으로 옳지 않은 것은?
AB095915 865 824 4 4 8 8 874 4 4 8 8 832 582 54191
정답 1번
B 는 A 의 모든 값에 50 을 더한 자료라 퍼진 정도를 재는 범위·사분위수범위·표준편차는 같지만 평균이 달라 변동계수는 같지 않으므로 옳지 않은 것은 1번이다.
두 확률변수 X 와 Y 의 결합확률분포가 다음과 같을 때, 이에 대한 설명으로 옳은 것은?
<div class="tbl-wrap"><table class="jtbl"><thead><tr><th>X Y</th><th>0</th><th>2</th></tr></thead><tbody><tr><td>0</td><td>{1 / 8}</td><td>{1 / 8}</td></tr><tr><td>2</td><td>{3 / 8}</td><td>{3 / 8}</td></tr></tbody></table></div>
정답 4번
P(X+Y=2) 는 (0,2) 와 (2,0) 의 확률 1/8 과 3/8 을 더한 1/2 이고 E(X)=3/2, Var(X)=3/4, E(X+Y)=5/2 라서 옳은 것은 4번이다.
정규분포를 따르는 확률변수 X 에 대하여 P (X ≤ 2) = 0.2 이고 P (X ≤ 12) = 0.8 일 때, P (2 ≤ X ≤ 7) 의 값은?
정답 2번
정규분포는 평균에 대해 좌우 대칭이라 P(X≤2)=0.2 와 P(X≤12)=0.8 이 서로 대칭인 점이므로 평균은 7 이고 P(2≤X≤7)=0.5−0.2=0.3 이므로 2번이 옳다.
두 확률변수 X 와 Y 가 각각 성공의 확률이 0.3 과 0.7 인 베르누이 분포를 따르고 서로 독립일 때, P (X ! = Y) 의 값은?
정답 4번
X 와 Y 는 독립이라 X=1·Y=0 의 확률 0.3×0.3=0.09 와 X=0·Y=1 의 확률 0.7×0.7=0.49 를 더한 0.58 이 P(X≠Y) 이므로 4번이 옳다.
어느 회사에서 경력에 따라 연봉에 차이가 있는지 알아보기 위해 1 년 미만, 1 년 이상 3 년 미만, 3 년 이상의 경력을 가진 직원을 각각 100 명씩 임의추출하여 연봉(단위: 만 원)을 조사한 결과 다음과 같은 분할표를 얻었다. 연봉 경력3,000 미만3,000 이상 4,000 미만4,000 이상 5,000 미만5,000 이상1 년 미만30502001 년 이상 3 년 미만203040103 년 이상10103050 “경력에 따른 연봉에 차이는 없다.”라는 가정하에서 구한 기대도수에 대한 설명으로 옳지 않은 것은?
정답 3번
연봉 열의 합계가 60, 90, 90, 60 이라 기대도수의 최솟값은 20 이고 10 이 아니므로 기대도수의 최솟값이 10 이라는 3번이 옳지 않다.
정규분포를 따르는 두 모집단 N (μ_X , σ_X^2) 과 N (μ_Y , σ_Y^2) 에서 각각 독립표본 X_1 ,X_2 , ..., X_5 와 Y_1 ,Y_2 , ..., Y_6 을 임의추출하여 구한 표본분산을 순서대로 24 와 9 라고 하자. 확률변수 W 는 분자와 분모의 자유도가 각각 4 와 5 인 F 분포를 따를 때, 가설 H_0 : σ_X^2/σ_Y^2 = 1 대 H_1 : σ_X^2/σ_Y^2 > 1 에 대한 검정에서 유의확률과 같은 것은?
정답 2번
H₁ 이 σ_X²/σ_Y² > 1 이라 표본분산비 24/9=8/3 이 클수록 기각하므로 유의확률은 오른쪽 꼬리의 P(W≥8/3) 이며 2번이 옳다.
고혈압 환자 20 명 중에서 임의추출한 10 명으로 이루어진 집단 A에는 신약을 처방하고 나머지 10 명으로 이루어진 집단 B에는 기존 약을 처방한 뒤 4 주 후에 혈압을 측정하였다. 다음은 두 집단의 혈압이 각각 동일한 분산을 갖는 정규분포를 따른다고 가정하고 분석한 결과이다. 공통분산의 추정량의 자유도는 k 이고 t(0.025) (k) = 2.1 이라고 할 때, 두 집단의 평균 혈압 차에 대한 95% 신뢰구간은 (-12.2, -3.8) 이다. 공통분산의 추정량을 S_p^2 이라고 할 때, k 와 S_p^2 의 값을 바르게 연결한 것은? (단, t(α) (k) 는 자유도가 k 인 t 분포의 제 100 × (1-α) 백분위수이다)
k S_p^2
정답 4번
신뢰구간의 반폭 4.2 는 2.1×표준오차이므로 표준오차가 2 이고 표준오차²=S_p²(1/10+1/10)=4 에서 S_p²=20 이며 자유도는 10+10−2=18 이라 (18, 20) 인 4번이 옳다.
자료 (x_i, y_i) (i = 1,2, … ,6) 에 단순선형회귀모형 y_i = β_0 + β_1 x_i + ε_i 를 최소제곱법으로 적합하여 다음 값을 얻었다. Σ(i = 1~6) (y_i - ŷ_i)^2 = 150 , Σ(i = 1~6) (y_i - ȳ)^2 = 270 , Σ(i = 1~6) (x_i - x̄)^2 = 30 x 와 y 의 표본상관계수가 음수일 때, β_1 의 추정값은? (단, ŷ_i 는 y_i 의 적합값이다)
정답 2번
회귀제곱합 270−150=120 을 Sxx=30 으로 나눈 4 가 기울기의 제곱이고 상관계수가 음수이므로 β₁=−2 이며 2번이 옳다.
다음 표는 세 학생 집단 A, B, C의 시험성적을 비교하기 위해 각 집단에서 4 명씩 임의추출하여 작성한 분산분석표의 일부이다. 요인제곱합자유도평균제곱F -값처리(가)오차(나)계(다)(라) 집단 A와 B의 시험성적의 모평균이 동일하다고 가정하고 하나의 집단으로 묶어서 집단 C와 비교하기 위한 분산분석표를 다시 작성한다고 할 때, (가) ~ (라) 중에서 변하지 않는 것만을 모두 고르면?
정답 4번
두 집단 A 와 B 를 하나로 묶어도 자료 12 개의 총제곱합 (다) 와 총자유도 11 인 (라) 는 그대로이고 처리제곱합 (가) 와 오차제곱합 (나) 는 표본평균이 다르면 달라지므로 변하지 않는 것은 (다), (라) 이고 정답은 4번이다.
어느 영업사원에게 걸려오는 전화통화 수는 한 시간에 평균 6 인 포아송분포를 따른다. 두 확률변수 U 와 V 는 각각 평균이 2 와 6 인 포아송분포를 따른다고 할 때, 오전 9 시 이후 이 영업사원에게 처음 걸려오는 전화가 같은 날 오전 9 시 20 분 이후일 확률과 같은 것은?
정답 1번
오전 9 시 이후 첫 전화가 20 분 뒤에 오려면 처음 20 분 동안 전화가 0 통이어야 하고 20 분의 평균은 6×1/3=2 라 그 확률은 평균 2 인 포아송의 P(U=0) 이므로 1번이 옳다.
자료의 퍼진 정도를 나타내는 측도 중에서 원자료와 같은 측정 단위를 갖는 것만을 모두 고르면?
ㄱ. 표준편차
ㄴ. 사분위수범위
ㄷ. 분산
ㄹ. 변동계수
정답 1번
표준편차와 사분위수범위는 원자료와 같은 단위이고 분산은 단위의 제곱, 변동계수는 단위가 없으므로 원자료와 같은 단위를 갖는 것은 ㄱ, ㄴ 이고 정답은 1번이다.
동전 한 개를 연속해서 10 번 던질 때, 처음 6 번의 시행에서는 뒷면이 2 번 나오고 나머지 4 번의 시행에서는 앞면이 2 번 나올 확률은?
정답 3번
처음 6 번 중 뒷면이 2 번 나오는 경우는 C(6,2)=15 가지, 나머지 4 번 중 앞면이 2 번 나오는 경우는 C(4,2)=6 가지이고 전체가 2^10 이라 90/2^10=45/2^9 이므로 3번이 옳다.
다음 표는 단순선형회귀모형 y_i = β_0 + β_1 x_i + ε_i (i = 1,2, … ,26) 에 대한 분산분석표의 일부이다. 이 모형의 결정계수의 값은? (단, ε_i 는 N (0, σ^2) 을 따르고 서로 독립이다)
요인제곱합자유도평균제곱F -값회귀5잔차120계25
정답 2번
F 값 5 와 잔차 평균제곱 120/(25−1)=5 에서 회귀제곱합은 25 이고 총제곱합이 25+120=145 라 결정계수는 25/145=5/29 이므로 2번이 옳다.
두 확률변수 X 와 Y 가 이변량 정규분포를 따르고 상관계수가 ρ 일 때, 가설 H_0 : ρ = 0 대 H_1 : ρ > 0 을 검정하고자 한다. 표본의 크기가 n 이고 표본상관계수가 r 일 때, 위 가설을 검정하기 위한 검정통계량 T = √(n-2) r/(√(1-r^2)) 는 H_0 하에서 자유도가 (n-2) 인 t 분포를 따른다고 한다. n = 11 이고 r = 0.6 일 때, 유의수준 5% 에서 검정 방법에 대한 설명으로 옳은 것은? (단, t(α) (k) 는 자유도가 k 인 t 분포의 제 100 × (1-α) 백분위수를 나타낼 때, t(0.025) (9) = 2.26 , t(0.05) (9) = 1.83 이다)
정답 3번
검정통계량 T=√9×0.6/√(1−0.36)=2.25 이고 H₁ 이 ρ>0 인 단측검정이라 기각값은 t(0.05)(9)=1.83 이며 T 가 이보다 커서 귀무가설을 기각하므로 3번이 옳다.
수준 수가 4 인 인자 A와 수준 수가 3 인 인자 B의 각 수준조합에서 3 회씩 반복 실험을 하였다. 다음 표는 인자 A와 B의 교호작용(interaction)이 유의하지 않아서 교호작용을 오차항에 포함한 후 작성한 분산분석표의 일부이다. 요인제곱합자유도평균제곱F -값인자 A54인자 B72오차계396 유의수준 5% 에서 검정할 때, 인자 A와 B의 유의성에 대한 설명으로 옳은 것은? (단, F_α (k_1 , k_2) 는 분자와 분모의 자유도가 각각 k_1 , k_2 인 F 분포의 제 100 × (1- α) 백분위수를 나타낼 때, F(0.05) (2, 30) = 3.32 , F(0.05) (3,30) = 2.92 이다)
정답 3번
오차제곱합은 396−54−72=270 이고 오차자유도는 35−5=30 이라 오차 평균제곱이 9 이고 F_A=18/9=2.0 은 2.92 보다 작고 F_B=36/9=4.0 은 3.32 보다 커서 A 는 유의하지 않고 B 는 유의하며 3번이 옳다.
다음은 평균은 같고 분산이 서로 다른 정규분포의 누적분포함수 F (x) (- ∞ < x < ∞) 의 그림이다. 분산이 가장 큰 것은?
정답 4번
평균이 같은 정규분포에서 분산이 클수록 누적분포함수가 완만하게 올라가므로 가장 완만한 4번 그림이 분산이 가장 큰 것이다.
자료 (x_i, y_i) (i = 1,2, … ,10) 로부터 다음 결과를 얻었을 때, 이 자료를 최소제곱법으로 적합한 단순선형회귀식은?
x̄ = 2 , ȳ = 3 , r = 1/3 , Σ(i = 1~10) (x_i - x̄)^2 = 1 , Σ(i = 1~10) (y_i - ȳ)^2 = 36 (단, r 는 x 와 y 의 표본상관계수이다)
정답 1번
기울기는 r√(Syy/Sxx)=(1/3)√36=2 이고 절편은 3−2×2=−1 이므로 회귀식 ŷ=−1+2x 이며 1번이 옳다.
어느 사과 농장에서 수확한 사과의 평균 무게 μ 에 대한 가설 H_0 : μ = 350 대 H_1 : μ ! = 350 을 검정하려고 한다. 이 농장에서 수확한 사과 49 개를 임의추출하여 구한 μ 에 대한 95% 신뢰구간이 (349, 361) 일 때, 이에 대한 설명으로 옳지 않은 것은?
정답 4번
표준오차 약 3.06 에서 검정통계량이 약 1.63 이라 유의확률은 약 0.10 으로 0.03 보다 작지 않으므로 유의확률이 0.03 보다 작다는 4번이 옳지 않다.
알코올 중독자와 비중독자 간에 질병 A의 유병률이 차이가 있는지 알아보기 위해 어느 지역의 알코올 중독자와 비중독자 중에서 각각 76 명과 109 명을 임의추출하여 질병 A의 유무에 대한 다음과 같은 분할표를 얻었다. 중독 여부 질병 A의 유무중독자비중독자계있음532881없음2381104계76109185 분석 목적과 표집 과정을 고려할 때, 이 지역에 대한 설명으로 옳은 것은?
정답 3번
중독자 76 명과 비중독자 109 명을 각각 따로 추출했으므로 표본의 중독자 비율은 설계로 정해진 값이고 각 집단 안의 유병률 53/76 만 추정할 수 있어 3번이 옳다.
어느 지역 남성의 흡연율 p 를 추정하기 위해 이 지역 남성 n 명을 임의추출하여 구한 흡연자의 표본비율을 p̂ 라고 하자. 정규근사를 이용할 때, 모든 p 에 대하여 부등식 P (| p̂ -p | ≤ 0.098) ≥ 0.95 를 만족하기 위한 n 의 최솟값은? (단, 표준정규분포를 따르는 확률변수 Z 에 대하여 P (Z ≥ 1.96) = 0.025 이다)
정답 2번
P(|p̂−p|≤0.098)≥0.95 가 모든 p 에서 성립하려면 p(1−p)≤1/4 이므로 1.96×0.5/√n≤0.098 이고 n≥100 이라 최솟값은 100 이며 2번이 옳다.
다음은 대통령 선거 출구 조사 방법에 대한 설명이다. 이에 해당하는 표본 추출 기법은?
모든 투표자를 대상으로 조사하는 것이 아니라, 투표자들이 나오는 것을 조사원이 출구 근처에서 보다가 일정 간격으로 투표자를 추출해 조사합니다. 간격이 너무 넓은 경우에는 조사원의 집중력 저하로 조사해야 할 투표자를 놓칠 가능성이 큽니다. 반대로 간격이 좁으면 조사원이 너무 바빠 응답자를 정확하게 선정하지 못할 수 있습니다. 16대 대선의 경우는 간격이 6이었고, 19대 대선은 5로 정해 조사했습니다.
정답 2번
출구 근처에서 일정 간격(5번째, 6번째)으로 투표자를 뽑는 방식은 모집단 목록에서 처음 하나를 정한 뒤 같은 간격으로 뽑는 계통추출이므로 2번이 해당한다.
세 사건 A , B , C 가 서로 독립이고 P (A) = 1/4 , P (B) = 3P (C) , P (A ∩ B^c ∩ C) = 1/48 일 때, P (B ∩ C^c) 는?
정답 2번
P(A)=1/4, P(B)=3c, P(C)=c로 두고 독립이므로 (1/4)(1−3c)c=1/48에서 c=1/6, P(B)=1/2이며 P(B∩Cᶜ)=(1/2)(5/6)=5/12이므로 2번이 옳다.
확률변수 X , Y 에 대하여 E [X (Y + 1)] = 9 , E [Y (X + 1)] = 10 , E (X + Y) = 7 일 때, 공분산 Cov(X ,Y) 의 값은?
정답 1번
E[XY]+E[X]=9, E[XY]+E[Y]=10, E[X]+E[Y]=7에서 E[Y]−E[X]=1이므로 E[X]=3, E[Y]=4, E[XY]=6이고 Cov(X,Y)=6−12=−6이어서 1번이 옳다.
‘두 확률변수 X , Y 의 상관계수가 0 ’, 즉 ‘ Corr(X ,Y) = 0 ’과 동치가 아닌 것은?
정답 4번
공분산이 0이면 상관계수가 0이다. Cov(X+Y,X−Y)=Var(X)−Var(Y)=0은 두 분산이 같다는 조건이라 Cov(X,Y)=0과 같은 뜻이 아니므로 4번이 동치가 아닌 것이다.
두 연속확률변수 X , Y 의 상관계수에 대한 설명으로 옳지 않은 것은?
정답 1번
상관계수 0은 선형관계가 없다는 뜻일 뿐 독립을 뜻하지 않는다(예: X가 표준정규이고 Y=X²이면 상관계수는 0이지만 독립이 아니다). 따라서 독립이라고 한 1번이 옳지 않다.
정규분포 N (μ , σ^2) 에서 표준편차 (σ) 를 이용하여 사분위수범위를 나타낸 것으로 옳은 것은? (단, z_α 는 표준정규분포의 제 100 × (1- α) 백분위수이다)
정답 4번
정규분포에서 제1사분위수는 μ−z_{0.25}σ, 제3사분위수는 μ+z_{0.25}σ이므로 사분위수범위는 2z_{0.25}σ(≈1.349σ)이며 4번이 옳다.
미지의 모평균이 μ 이고 모분산이 σ^2 인 모집단으로부터 확률표본 X_1 , X_2 , X_3 , X_4 를 추출하여 μ 에 대한 점추정량을 다음과 같이 정의하였다. 이 점추정량 중에서 μ 에 대한 불편추정량이면서 그중 최소분산을 갖는 것은? (단, σ^2 > 0 이다)
[eq]○ μ̂_1 = {1 / 5} (X_1 + X_2 + 2X_3 + X_4)
○ μ̂_2 = {1 / 4} (X_1 + X_2 + 2X_3 + X_4)
○ μ̂_3 = {1 / 5} (2X_1 + X_2 + X_3 + 2X_4)
○ μ̂_4 = {1 / 4} (2X_1 + X_2 + X_3)[/eq]
정답 1번
불편추정량은 계수의 합이 1이어야 하므로 μ̂₁(합 1)과 μ̂₄(합 1)이 후보이고, 분산은 μ̂₁이 (1+1+4+1)/25σ²=0.28σ², μ̂₄가 (4+1+1)/16σ²=0.375σ²라 μ̂₁이 최소이므로 1번이 옳다.
확률변수 X 의 확률분포가 다음과 같다. x -1 0 1 계 P (X = x) (가) (나) 0.25 1 다음 항목 중 옳은 것만을 모두 고르면?
ㄱ. (가)+(나) = 3/4
ㄴ. E (X) = 1/8 일 때, (나) = 3/8
ㄷ. E (X) = 1/12 일 때, 위 모집단에서 크기가 2인 확률표본을 추출한다면 표본평균 X̄ 의 분산은 Var(X̄) = 59/144 이다.
정답 1번
(가)+(나)=1−0.25=3/4이므로 ㄱ은 옳다. E(X)=1/8이면 (가)=1/8, (나)=5/8이라 ㄴ은 틀리고, E(X)=1/12이면 Var(X)=59/144이므로 Var(X̄)=59/288이라 ㄷ도 틀린다. 정답은 1번이다.
독립변수 X 와 종속변수 Y 를 갖는, 절편이 있는 단순선형회귀모형에서 최소제곱법을 적용했을 때, 결정계수에 대한 설명으로 옳은 것은?
정답 3번
결정계수는 단순회귀에서 표본상관계수의 제곱과 같아 표본상관계수로 구할 수 있으므로 3번이 옳다.
어느 도시의 고등학생 중 남학생 100명과 여학생 100명을 무작위추출한 뒤 수학과 영어 과목에 대한 선호도를 조사하여 다음과 같은 분할표를 얻었다. “성별에 따라 과목 선호도에 차이가 없다.”라는 귀무가설을 검정하기 위한 카이제곱검정통계량의 값이 8 일 때, (가)의 값과 귀무가설 하에서의 이 검정통계량의 근사적인 분포를 바르게 연결한 것은? (단, (가) ≥ 50 이다)
과목 성별수학영어계남학생(가)100여학생100계100100200 (가) 근사적인 분포
정답 3번
남학생 중 수학을 선호하는 수를 a라 하면 주변합이 모두 100이라 기대도수가 각 칸 50이고 χ²=4(a−50)²/50=8에서 a=60이며 2×2 표라 자유도는 (2−1)(2−1)=1이므로 3번이 옳다.
어느 도시에서 하루에 발생하는 교통사고 건수를 지난 200일 동안 조사하여 다음 표와 같이 정리하였다. 교통사고 건수01234계해당일 수9050302010200 이 자료에서 구한 하루 발생 교통사고 건수의 통계량의 값으로 옳지 않은 것은?
정답 4번
발생 건수 분포 90·50·30·20·10(총 200일)에서 평균은 210/200=1.05, 중앙값은 100·101번째 값이 모두 1, 최빈값은 0이고 제3사분위수는 150번째 값이 2이므로 3이라고 한 4번이 옳지 않다.
분산이 같은 두 정규모집단 A와 B로부터 크기가 각각 8인 확률표본을 독립적으로 추출하였더니 표본분산이 각각 19와 13이었다. 두 모평균의 차 μ_A - μ_B 에 대한 95 % 신뢰구간의 길이는? (단, t_α (k) 는 자유도가 k 인 t 분포의 제 100 × (1-α) 백분위수를 나타내고, t(0.025) (7) = 2.365 , t(0.025) (14) = 2.145 이다)
정답 3번
공통분산은 (19+13)/2=16이고 표준오차는 √(16×(1/8+1/8))=2이며 자유도 14의 t(0.025)=2.145를 쓰면 구간의 길이는 2×2.145×2=8.58이므로 3번이 옳다.
앞면이 나올 확률이 p 인 동전에 대해 가설 H_0 : p = 1/2 , H_1 : p > 1/2 을 검정하려고 한다. 이 동전을 다섯 번 던져 보니 앞면이 네 번 나왔다면, 유의확률( p -value)은?
정답 3번
동전 다섯 번 중 앞면이 4번 이상 나올 확률은 (5+1)/32=3/16이므로 유의확률은 3/16이며 3번이 옳다.
다음은 연령대별로 스마트폰 과의존 위험군 비율을 조사한 것이다. 연령대 10대 이하 20 ~ 30대 40 ~ 50대 60대 이상 위험군 비율 28 % 37 % 22 % 16 % 표본 크기 50명 100명 100명 50명 이 자료를 바탕으로 다음의 가설을 검정하고자 한다.
○ H_0 : 연령대에 따라 과의존 위험군 비율에 차이가 없다.
○ H_1 : 연령대에 따라 과의존 위험군 비율에 차이가 있다. 귀무가설 H_0 가 참일 때 구한, 위험군에 속하는 사람 수의 추정된 기대도수와 관측도수 간에 차이가 존재한다. 이 차이의 절댓값이 가장 큰 연령대는?
정답 2번
위험군 수 관측도수는 14, 37, 22, 8이고 전체 위험군 비율 81/300=0.27로 구한 기대도수는 13.5, 27, 27, 13.5라 차이의 절댓값이 0.5, 10, 5, 5.5이므로 20~30대가 가장 크다.
어느 마트에서 특정 상품에 대한 진열대의 높이와 폭이 매출액에 영향을 주는지 알아보기 위해, 진열대 높이( A )를 상, 중, 하 3수준으로, 폭( B )을 대, 소 2수준으로 하여 실험하였다. 다른 조건들이 동일한 12일 동안 6개의 실험조건을 무작위 순서로 2일씩 적용하여 매출액을 조사한 후 얻은 분산분석표가 다음과 같다. 이에 대한 설명으로 옳지 않은 것은?
요인제곱합자유도평균제곱F -값인자 A1,544인자 B12교호작용 A × B24오차62계
정답 4번
분산분석표에서 총제곱합은 1544+12+24+62=1642, B의 자유도 1·A×B의 자유도 2라 평균제곱이 모두 12이며 오차 자유도는 11−2−1−2=6이다. F는 인자 A가 74.7, 교호작용이 1.16이라 A의 유의확률이 더 작으므로 유의확률이 더 크다고 한 4번이 옳지 않다.
다음은 자료 (x_1i, x_2i , y_i) (i = 1, 2, ⋯ , 23) 에 다중선형회귀모형 y_i = β_0 + β_1 x_1i + β_2 x_2i + ε_i 를 최소제곱법으로 적합하여 얻은 분산분석표이다. 이에 대한 설명으로 옳은 것만을 모두 고르면? (단, ε_i 는 N (0, σ^2) 을 따르고 서로 독립이다)
요인제곱합자유도평균제곱F -값p -값회귀420(가)(다)< 0.001잔차(나)계480
ㄱ. 결정계수는 0.875이다.
ㄴ. 유의수준 1 %에서 이 모형이 유의하다.
ㄷ. (가) + (나) + (다) = 283이다.
정답 4번
n=23, 회귀 자유도 2, 잔차 자유도 20이고 잔차제곱합은 480−420=60이다. 결정계수는 420/480=0.875(ㄱ 옳음), p<0.001이라 1 %에서 유의(ㄴ 옳음), (가)=210, (나)=3, (다)=70이라 합이 283(ㄷ 옳음)이므로 정답은 4번이다.
다음 설명 중 옳지 않은 것은?
정답 2번
t 분포의 상위 5 % 점은 자유도가 커질수록 작아지므로 모든 n에서 t(n)<t(n+1)이라는 2번이 옳지 않다.
다음은 자료 (x_i, y_i) ( i = 1, 2, ⋯, n )에 단순선형회귀모형 y_i = β_0 + β_1 x_i + ε_i 를 적합하여 구할 수 있는 값들이다.
○ x̄ = 1/n Σ(i = 1~n) x_i ○ ȳ = 1/n Σ(i = 1~n) y_i
○ e_i = y_i - β̂_0 -β̂_1 x_i ○ SSE = Σ(i = 1~n) e_i^2
○ S_xx = Σ(i = 1~n) (x_i -x̄)^2 ○ S_xy = Σ(i = 1~n) (x_i -x̄) (y_i -ȳ)
○ S_yy = Σ(i = 1~n)(y_i -ȳ)^2 다음 식 중 옳은 것은? (단, β̂_0 , β̂_1 은 각각 β_0 , β_1 의 최소제곱추정값이다)
정답 2번
단순회귀에서 SSE=Syy−β̂₁Sxy로 쓸 수 있으므로 2번이 옳다. β̂₁=Sxy/Sxx, r²=Sxy²/(SxxSyy)이며 Σyᵢeᵢ=SSE이므로 나머지 셋은 옳지 않다.
두 이산확률변수 X , Y 의 결합확률질량함수가 다음과 같을 때, P (Y = 2X) 의 값은? (단, c 는 상수이다)
f(x, y) = {x + y / c} , x = 1, 2, 3 , y = 1, 2, 3, 4
정답 3번
Σ(x+y)=54이므로 c=54이고 Y=2X를 만족하는 (x,y)=(1,2),(2,4)의 확률은 (3+6)/54=1/6이므로 3번이 옳다. (3,6)은 y의 범위 밖이다.
수준이 3개이고 반복수가 각각 n_1 = 5 , n_2 = 10 , n_3 = 15 인 일원배치법으로부터 얻은 자료를 y_ij (i = 1, 2, 3, j = 1, 2, ⋯ , n_i) 라 하고, i 번째 수준에서의 평균을 ȳ(i.) = 1/n_i Σ(j = 1~n_i) y_ij 라 하자. ȳ(1.) = 6 , ȳ(2.) = 3 , ȳ(3.) = 2 일 때, 분산분석표에서 처리제곱합은?
정답 1번
전체 평균이 (5×6+10×3+15×2)/30=3이고 처리제곱합은 Σnᵢ(ȳᵢ−ȳ)²=5×9+10×0+15×1=60이므로 1번이 옳다.
다음 설명 중 옳지 않은 것은?
정답 2번
변동계수는 표준편차를 평균으로 나눈 비율이라 단위가 없는 수이고 표준편차만 자료와 같은 단위를 가지므로 두 단위가 같다는 설명이 옳지 않다. 정답은 2번이다.
자료 (x_i , y_i) (i = 1,2,…, n) 에 단순선형회귀모형 y_i = β_0 + β_1 x_i + ε_i 를 적합하여 분석하고자 한다. 다음 산점도 중 단순선형회귀모형의 결정계수가 가장 큰 것은?
정답 2번
결정계수는 단순선형회귀에서 상관계수의 제곱이라 점들이 직선 둘레에 가장 좁게 모인 그림이 가장 크며 2번 산점도가 그렇다. 정답은 2번이다.
컴퓨터 부품의 품질은 두 인자 A, B에 따라 달라질 수 있다고 한다. 다음은 인자 A의 3 가지 수준과 인자 B의 6 가지 수준의 가능한 18 가지 실험 조건에서 무작위 순서로 한 개씩 부품을 생산한 후, 부품의 품질을 수치화하여 얻은 분산분석표의 일부이다. 인자 A의 수준에 따라 부품의 품질에 차이가 있는지를 검정하기 위한 F -검정통계량의 값은?
요인제곱합자유도평균제곱F -값인자 A540인자 B400오차100계1,040
정답 3번
인자 A 의 평균제곱은 제곱합 540 을 자유도 2 로 나눈 270 이고 오차의 평균제곱은 100 을 자유도 10 으로 나눈 10 이므로 F 값은 27 이다. 정답은 3번이다.
가설검정에 대한 설명으로 옳지 않은 것은?
정답 4번
가설은 자료를 보기 전에 세워야 하고 결과를 본 뒤에 세우면 결과에 맞춰 가설을 고르게 되므로 4번이 옳지 않다. 정답은 4번이다.
어느 회사에서 남성 150 명과 여성 150 명을 임의추출한 후 세 종류의 신상품 A, B, C에 대한 선호도를 조사하여 다음과 같은 분할표를 얻었다. “성별에 따른 신상품 선호도에 차이가 없다.”라는 귀무가설을 검정하기 위한 카이제곱검정통계량의 값과 유의수준 5 %에서 검정한 결과를 바르게 연결한 것은? (단, χ(α)^2 (k) 는 자유도가 k 인 카이제곱분포의 제 100 × (1-α) 백분위수를 나타내고, χ(0.05)^2 (2) = 5.99 , χ(0.05)^2 (6) = 12.59 이다)
신상품 성별ABC계남성604050150여성406050150계100100100300 카이제곱검정통계량의 값 검정 결과
정답 1번
기대도수는 열 합계 100 에 성별 합계 150 을 곱해 300 으로 나눈 50 이라 카이제곱 값은 여섯 칸의 편차 제곱합 400 을 50 으로 나눈 8 이고 자유도는 (2−1)(3−1)=2 라 5.99 보다 크므로 기각한다. 정답은 1번이다.
세 자료 A, B, C의 변동계수를 각각 a , b , c 라 할 때, 옳은 것은?
○ 자료 A: 10 , 20 , 30 , 40 , 50
○ 자료 B: 5 , 15 , 25 , 35 , 45
○ 자료 C: 5 , 10 , 15 , 20 , 25
정답 1번
세 자료의 변동계수는 표준편차를 평균으로 나눈 값으로 a 와 c 는 약 0.527 로 같고 b 는 약 0.632 라 더 크므로 a=c 이고 a<b 인 1번이 옳다. 정답은 1번이다.
두 확률변수 X 와 Y 의 결합확률분포가 다음 표와 같다. X 의 기댓값이 0 일 때, 옳은 것은?
<div class="tbl-wrap"><table class="jtbl"><thead><tr><th>X Y</th><th>-1</th><th>1</th></tr></thead><tbody><tr><td>-1</td><td>{3 / 8}</td><td>( )</td></tr><tr><td>0</td><td>{1 / 8}</td><td>{1 / 4}</td></tr><tr><td>1</td><td>( )</td><td>{1 / 8}</td></tr></tbody></table></div>
정답 4번
X+Y=0 인 칸은 (1,−1) 과 (−1,1) 이고 E(X)=0 과 확률의 합 1 로 두 빈칸이 1/8 과 0 이라 P(X+Y=0)=1/8 이 되므로 옳은 것은 4번이다. 정답은 4번이다.
확률변수 X 에 대한 누적 확률 P (X ≤ x) 가 다음과 같을 때, 옳지 않은 것은?
P (X ≤ x) = {0 (x < 0), {1 / 6} x (0 ≤ x < 2), {1 / 2} (2 ≤ x < 4), {1 / 6} x (4 ≤ x < 6), 1 (x ≥ 6)}
정답 3번
P(X≥5)=1−P(X<5)=1−5/6=1/6 이므로 2/3 이라는 3번 설명이 옳지 않다. 정답은 3번이다.
확률변수의 성질에 대한 설명으로 옳은 것만을 모두 고르면?
ㄱ. 확률변수 X 가 정규분포를 따를 때 5X + 100 은 정규분포를 따른다.
ㄴ. 확률변수 X 가 평균이 1 이고 분산이 1 인 정규분포를 따를 때 (X-1)^2 은 자유도가 1 인 카이제곱분포를 따른다.
ㄷ. 확률변수 X 와 Y 가 서로 독립이고 표준정규분포를 따를 때 X/Y 는 분자와 분모의 자유도가 각각 1, 1 인 F 분포를 따른다.
정답 2번
ㄱ 은 정규분포의 일차변환이라 옳고 ㄴ 은 표준화한 값의 제곱이라 자유도 1 인 카이제곱분포를 따르므로 옳으며 ㄷ 은 X/Y 가 t 분포(코시분포)이고 F(1,1) 은 X²/Y² 라 옳지 않다. 정답은 2번이다.
어떤 방송사의 저녁 뉴스 시청률을 알아보기 위해 400 가구를 조사했다. 이 방송사 저녁 뉴스를 시청하는 비율 p 에 대한 가설 H_0 : p = 0.1 대 H_1 : p > 0.1 에 대한 검정에서 Z -검정통계량의 값이 2 일 때, 조사한 400 가구 중 이 방송사 저녁 뉴스를 시청한 가구 수와 유의확률을 바르게 연결한 것은? (단, 확률변수 Z 가 표준정규분포를 따를 때 P (Z ≤ 2) = 0.9772 이다)
시청한 가구 수 유의확률
정답 3번
Z=2 이면 표본비율이 0.1+2×0.015=0.13 이라 400×0.13=52 가구이고 단측 검정의 유의확률은 1−0.9772=0.0228 이므로 정답은 3번이다.
다음은 자료 (x_i , y_i) (i = 1,2, … , n) 에 단순선형회귀모형 y_i = β_0 + β_1 x_i + ε_i 를 최소제곱법으로 적합하여 얻은 결과이다. 이 단순선형회귀모형의 잔차제곱합(SSE)은? (단, β̂_1 은 β_1 의 최소제곱추정량이다)
Σ(i = 1~n) (x_i - x̄)^2 = 30 , Σ(i = 1~n) (y_i - ȳ)^2 = 360 , β̂_1 = 2
정답 3번
회귀제곱합은 β̂₁ 의 제곱 4 에 Sxx 30 을 곱한 120 이고 잔차제곱합은 총제곱합 360 에서 120 을 뺀 240 이므로 정답은 3번이다.
자료 (x_i , y_i) (i = 1,2, … ,20) 에 절편이 없는 단순선형회귀모형 y_i = β x_i + ε_i 를 적합하려고 한다. β 에 대한 최소제곱추정량은? (단, x_i 는 서로 다르다)
정답 1번
절편이 없는 모형에서 잔차제곱합 Σ(y_i−βx_i)² 을 β 로 미분해 0 으로 놓으면 β̂=Σx_i y_i/Σx_i² 이므로 정답은 1번이다.
다음은 자료 (x_i , y_i) (i = 1,2,… ,12) 에 단순선형회귀모형 y_i = β_0 + β_1 x_i + ε_i 를 최소제곱법으로 적합하여 얻은 분산분석표의 일부이다. 이 단순선형회귀모형에서 잔차제곱합의 자유도와 결정계수의 합은? (단, ε_i 는 정규분포 N (0, σ^2) 을 따르고 서로 독립이다)
요인제곱합자유도평균제곱F -값회귀10잔차13계
정답 3번
F=10 이고 잔차의 평균제곱이 13 이라 회귀의 평균제곱은 130 이고 회귀의 자유도가 1 이라 회귀제곱합 130, 잔차제곱합 13×10=130 이므로 결정계수는 1/2 이고 잔차의 자유도 12−2=10 과 합해 21/2 이라 정답은 3번이다.
주사위 한 개를 던져서 나온 눈의 수를 N 이라고 하자. 1 부터 N 까지의 자연수가 하나씩 적힌 공 N 개를 주머니에 넣은 후 임의로 한 개를 뽑을 때, 뽑힌 공에 적힌 숫자가 4 일 확률은? (단, 각 공에는 숫자가 하나만 적혀 있다)
정답 2번
N 이 4, 5, 6 일 때만 4 가 뽑히므로 확률은 1/6×(1/4+1/5+1/6)=1/6×37/60=37/360 이라 정답은 2번이다.
어느 도시 직장인 1,500 명을 임의추출하여 성별과 출근 교통수단은 해당 항목을 선택하게 하고, 출근 거리와 소요 시간은 직접 작성하도록 하는 다음과 같은 설문조사를 실시했다. 성별: (가) 남성 (나) 여성 교통수단: (가) 대중교통 (나) 자가용 (다) 기타 출근 거리: ( ) km 소요 시간: ( ) 분 이에 대한 설명으로 옳지 않은 것은?
정답 1번
세 교통수단 집단 사이에 소요 시간의 평균 차이를 보려면 일원배치 분산분석이 필요하고 일표본 t 검정은 한 집단의 평균을 특정 값과 견줄 때 쓰므로 1번이 옳지 않다. 정답은 1번이다.
다음은 반복 수가 같은 일원배치법으로부터 얻은 분산분석표의 일부이다. 처리 효과가 없다는 귀무가설을 유의수준 5 %에서 검정하는 방법으로 옳은 것은? (단, F_α (k_1 , k_2) 는 분자와 분모의 자유도가 각각 k_1 , k_2 인 F 분포의 제 100 × (1-α) 백분위수를 나타내고, F(0.95) (3, 20) = 0.12 , F_0.95 (20, 3) = 0.32 , F_0.05 (20, 3) = 8.66 이다)
요인제곱합자유도평균제곱F -값처리340F_0오차1,00020계
정답 4번
평균제곱은 처리가 40, 오차가 1,000÷20=50 이라 F₀=40/50=4/5 이고 기각역은 F_0.05(3,20)=1/F_0.95(20,3)=1/0.32 인데 4/5 가 이보다 작아 기각하지 못하므로 정답은 4번이다.
모평균과 모분산 σ^2 이 알려지지 않은 정규모집단에서 추출한 13 개의 확률표본 X_1,X_2 ,…, X_13 의 표본분산을 S^2 이라 하자. 가설 H_0 : σ^2 = 4 대 H_1 : σ^2 > 4 에 대한 검정에서 기각역으로 S^2 > 6 을 사용하고자 한다. 확률변수 V 는 자유도가 12 인 카이제곱분포를 따를 때, 이 검정에서 제 1 종 오류의 확률과 같은 것은?
정답 3번
S²>6 의 제1종 오류 확률은 σ²=4 일 때 V=12S²/4 가 자유도 12 인 카이제곱을 따르므로 S²>6 이 V>12×6/4=18 과 같아 P(V>18) 이라 정답은 3번이다.
어떤 회사에서 생산하는 건전지의 평균 수명은 300 일이라고 알려져 있다. 이를 확인하기 위하여 건전지 15 개를 임의추출하여 구한 평균 수명(단위: 일)에 대한 95 % 신뢰구간은 (296, 308) 이었다. 귀무가설 “건전지의 평균 수명은 300 일이다.”와 대립가설 “건전지의 평균 수명은 300 일이 아니다.”에 대한 검정에서 t -검정통계량의 값과 같은 것은? (단, 건전지의 수명은 정규분포를 따른다고 하며, t(α) (k) 는 자유도가 k 인 t 분포의 제 100 × (1- α) 백분위수를 나타낸다)
정답 1번
신뢰구간 (296, 308) 의 중심은 302 이고 반폭 6 이 t_0.025(14) 곱하기 표준오차이므로 표준오차는 6/t 이고 검정통계량은 (302−300)/(6/t)=t/3 이라 정답은 1번이다.
정규분포 N (μ , σ^2) 을 따르는 모집단에서 추출한 25 개의 확률표본 X_1 ,…,X_25 의 표본평균을 X̄ 라고 하자. X_1 이 다음 조건을 만족한다. P (X_1 ≤ 4) + P (X_1 ≤ 6) = 1 , E (X_1^2) = 34 다음 중 옳은 것만을 모두 고르면?
ㄱ. P (X̄ ≤ 4) = P (X̄ ≥ 6)
ㄴ. P (X̄ ≥ 6) = P (X_1 ≥ 10)
ㄷ. P (X_1 ≥ 8) + P (X̄ ≥ 4.4) = 1
정답 4번
P(X₁≤4)+P(X₁≤6)=1 은 4 와 6 이 평균 5 에 대칭이라는 뜻이고 E(X₁²)=34 에서 분산 9 이므로 표본평균의 표준편차는 0.6 이다. ㄱ, ㄴ, ㄷ 이 모두 옳아 정답은 4번이다.
어느 극장에서 월요일부터 금요일까지 관람객 수의 비율이 1 : 1 : 1 : 1 : 2 인지를 검정하고자 평일 관람객 1,200 명을 조사하여 다음 표와 같이 정리했다. 요일월화수목금계관람객 수170210220a600-a1,200 카이제곱검정에서 a 의 값이 0 부터 600 까지 증가할 때, 유의확률에 대한 설명으로 옳은 것은?
정답 1번
검정통계량은 a 가 0 에서 200 으로 늘 때 307 에서 7 로 줄고 200 에서 600 으로 늘 때 7 에서 1207 로 커져 a=200 에서 최소이며 유의확률은 그 반대로 증가하다가 감소하므로 정답은 1번이다.
다음 상자그림에 대한 설명으로 옳은 것만을 모두 고르면?
ㄱ. 자료의 평균은 4 이다.
ㄴ. 사분위수범위는 2 보다 크다.
ㄷ. 2 이상이고 5 이하의 값을 갖는 자료는 전체의 50 % 이상이다.
정답 3번
상자그림에는 평균이 나타나지 않으므로 ㄱ 은 알 수 없고, 제1사분위수 약 2.6 과 제3사분위수 5 에서 사분위수범위가 약 2.4 로 2 보다 크며(ㄴ), 2 이상 5 이하는 상자 전체를 덮어 50 % 이상이다(ㄷ). ㄴ 과 ㄷ 만 옳으므로 정답은 3번이다.
다음 히스토그램에 대한 설명으로 옳지 않은 것은?
정답 4번
히스토그램은 오른쪽으로 긴 꼬리를 가져 평균이 중앙값보다 크고 왜도가 양수이며 범위는 50 보다 크다. 중앙값은 26 개가 몰린 첫 계급에 있어 제1사분위수에 더 가까우므로 4번이 옳지 않다.
두 사건 A , B 가 서로 독립이고 P(A) = 1/2 , P(B) = 1/3 일 때, P(A cupB^C) 은?
정답 3번
A 와 B 가 독립이면 A 의 여집합과 B 도 독립이다. A ∪ B^c 의 여사건은 A^c ∩ B 이므로 P(A ∪ B^c) = 1 − P(A^c)P(B) = 1 − (1/2)(1/3) = 5/6 이며 3번이 해당한다.
확률변수 X , Y 와 Z , W 간의 관계가 다음과 같다. X 와 Y 의 분산이 각각 9 , 25 이고 Z 와 W 의 상관계수가 0.4 일 때, X 와 Y 의 공분산은?
Z = 5X + 2 , W = 6Y + 5
정답 2번
일차변환에서 양의 배율은 상관계수를 바꾸지 않으므로 X 와 Y 의 상관계수도 0.4 이고 Cov(X, Y) = 0.4 × 3 × 5 = 6 이다. 표준편차는 분산 9 와 25 의 양의 제곱근인 3 과 5 이므로 2번이 해당한다.
자료 (x_i , y_i) (i = 1,2, ⋯ ,32) 에 단순선형회귀모형 y_i = β_0 + β_1 x_i + ε_i 를 최소제곱법으로 적합하여 얻은 분산분석표의 일부가 다음과 같을 때, 추정된 회귀직선의 결정계수는? (단, ε_i 는 정규분포 N(0, σ^2) 을 따르고 서로 독립이다)
요인제곱합자유도평균제곱F -값회귀12010잔차30계
정답 1번
회귀 자유도 1 과 회귀 평균제곱 20 에서 회귀제곱합은 20 이고 F 값 10 으로 오차 평균제곱은 2 이므로 잔차제곱합은 2 × 30 = 60 이다. 총제곱합 80 에서 결정계수는 20/80 = 1/4 이므로 1번이 해당한다.
어느 기관에서 성인 60 명을 임의추출한 후, 네 종류의 마스크 A , B , C , D 에 대한 선호도를 조사하여 다음과 같은 분할표를 얻었다. “마스크 종류에 따라 성인들의 선호도에 차이가 없다.”라는 귀무가설을 검정하기 위한 카이제곱 검정통계량의 값은?
마스크ABCD계빈도2015101560
정답 3번
귀무가설에서 네 마스크의 기대도수는 60 을 4 로 나눈 15 로 같다. 검정통계량은 (20−15)²/15 + 0 + (10−15)²/15 + 0 = 50/15 = 10/3 이므로 3번이 해당한다.
지난 1 년간 측정된 일별 풍속과 미세먼지에 대한 자료를 분석하려고 할 때, (가), (나)에 알맞은 방법을 바르게 연결한 것은? (단, 일별 자료는 서로 독립이라고 가정한다)
(가) 풍속이 미세먼지 농도에 미치는 영향을 선형관계로 분석하고자 함 (나) 사계절에 따라 미세먼지 농도의 평균에 차이가 있는지를 검정하고자 함 (가) (나)
정답 2번
(가)는 풍속이라는 연속 설명변수가 미세먼지에 주는 영향을 선형식으로 보는 것이므로 회귀분석이고, (나)는 네 계절의 평균이 같은지를 견주는 것이므로 분산분석이다. 따라서 2번이 해당한다.
이산확률변수 N 의 확률질량함수가 다음과 같을 때, E(N) + Var(N) 은? (단, c 는 상수이다)
P(N = k) = c/(k!(10-k)!) (1/2)^10 , k = 0,1, ⋯ ,10, 0, 그 외
정답 2번
확률질량함수는 C(10,k)(1/2)^10 꼴이므로 N 은 n=10, p=1/2 인 이항분포를 따른다. E(N) = 10 × 1/2 = 5 이고 Var(N) = 10 × 1/2 × 1/2 = 5/2 이므로 E(N)+Var(N) = 15/2 이고 2번이 해당한다.
어느 단체에서 고등학생의 평균 인터넷 사용 시간이 10 년 전보다 증가했는지를 검정하기 위해 고등학생 64 명을 임의추출하여 하루 인터넷 사용 시간을 조사한 결과 표본평균이 5.2 시간, 표본표준편차는 1 시간으로 나타났다. 10 년 전 고등학생의 하루 평균 인터넷 사용 시간이 5 시간이었을 때, 이 검정의 유의확률과 같은 것은? (단, Z 는 표준정규분포를 따르는 확률변수이다)
정답 2번
대립가설이 증가했는지를 묻는 단측이므로 검정통계량은 (5.2 − 5)/(1/√64) = 1.6 이고 유의확률은 P(Z ≥ 1.6) 이다. 따라서 2번이 해당한다.
이산확률변수 X 의 확률분포는 다음과 같다. E(X^2) = 3/2 일 때, Var(X) 는?
x 0 1 2 계 P(X = x) 1/4 ( ) ( ) 1
정답 2번
P(X=1)=a, P(X=2)=b 라 하면 a+b=3/4 이고 E(X²)=a+4b=3/2 이므로 b=1/4, a=1/2 이다. E(X)=1/2+2/4=1 이고 Var(X)=3/2−1²=1/2 이므로 2번이 해당한다.
(가), (나)에 들어갈 내용을 바르게 연결한 것은?
학생 100 명 중 무작위로 선택된 50 명에게는 교수법 Ⅰ을, 나머지 50명에게는 교수법 II를 적용한 후, 평가 결과를 4 개 등급으로 나눈 표가 다음과 같다. 등급 교수법ABCD계I1311161050II911141650 “두 교수법의 효과가 동일하다.”라는 귀무가설을 검정하기 위해 계산된 카이제곱 검정통계량의 값은 2.25 이다. 유의수준 α = 0.05 에서 검정할 때, 검정통계량의 값이 (가) 보다 작으므로 두 교수법의 효과에 차이가 (나) . (단, χ_α^2 (k) 는 자유도가 k 인 카이제곱분포의 제 100 × (1-α) 백분위수를 나타내고, χ(0.05)^2 (3) = 7.81 , χ(0.05)^2 (7) = 14.07 이다) (가) (나)
정답 1번
2×4 분할표의 자유도는 (2−1)(4−1)=3 이므로 기각역의 경계는 χ²_0.05(3)=7.81 이다. 검정통계량 2.25 는 7.81 보다 작아 귀무가설을 기각하지 못하므로 효과에 차이가 없다고 볼 수 있고 1번이 해당한다.
서로 독립인 두 확률변수 X , Y 가 표준정규분포를 따른다고 할 때, 옳은 것만을 모두 고르면? (단, 확률변수 Z 가 표준정규분포를 따를 때 P(Z ≥ 0.6) = 0.2743 , P(Z ≤ 1) = 0.8413 이다)
ㄱ. E (X^2 Y^2) = 1
ㄴ. Cov(X, Y) = 0
ㄷ. P (-3 ≤ 3X-4Y ≤ 5) = 0.5670
정답 4번
ㄱ 은 독립이라 E(X²Y²)=E(X²)E(Y²)=1 이고 ㄴ 은 독립이라 공분산이 0 이며, ㄷ 은 3X−4Y 가 N(0, 25) 를 따라 P(−0.6 ≤ Z ≤ 1)=0.8413−0.2743=0.5670 이다. 셋 다 옳으므로 정답은 4번이다.
어느 제품의 무게는 표준편차가 2 인 정규분포를 따른다고 한다. 임의추출한 n 개 제품 무게의 표본평균을 X̄ , 모집단의 평균을 μ 라고 할 때, P (| X̄ - μ | ≤ 0.2) ≥ 0.9544 를 만족하는 n 의 최솟값은? (단, 확률변수 Z 가 표준정규분포를 따를 때 P(|Z | ≤ 2) = 0.9544 이다)
정답 4번
정규분포의 표본평균은 표준편차가 2/√n 이므로 P(|X̄−μ| ≤ 0.2)=P(|Z| ≤ 0.2√n/2) 이고 이것이 0.9544 이상이려면 0.1√n ≥ 2 이어야 한다. 따라서 √n ≥ 20 이라 n 의 최솟값은 400 이며 4번이 해당한다.
단순선형회귀모형에서 기울기에 대한 100(1-α) % 신뢰구간을 설명한 것으로 옳은 것은?
정답 3번
평균제곱오차 MSE 가 커지면 기울기의 표준오차 √(MSE/Sxx) 가 커져서 신뢰구간의 폭이 넓어지므로 3번이 해당한다. 추정값은 폭에 들어가지 않고 α 나 Sxx 가 커지면 폭이 좁아진다.
다음과 같은 일원배치 분산분석표에 대한 설명으로 옳지 않은 것은?
요인제곱합자유도평균제곱F -값p -값처리SSA(가)MSA(다)(라)오차SSE(나)MSE계SST
정답 4번
p 값 (라)는 귀무가설 아래에서 F 값 (다)보다 큰 값이 나올 확률 P(X > (다)) 여야 하는데 4번은 P(X < (다)) 라고 적었으므로 4번이 옳지 않다.
다음 그림은 모평균 μ 에 대한 가설 H_0 : μ = μ_0 대 H_1 : μ < μ_0 의 검정에서, 모평균이 μ 일 때 귀무가설을 기각할 확률( γ(μ) )을 나타낸다. 제1종 오류를 범할 확률과 μ = μ_1 에서 제2종 오류를 범할 확률을 바르게 연결한 것은? (단, μ_1 < μ_0 이다)
제1종 오류를 범할 확률 제2종 오류를 범할 확률
정답 1번
제1종 오류의 확률은 귀무가설의 경계 μ=μ0 에서 기각할 확률 γ(μ0)=0.1 이다. μ=μ1 에서 제2종 오류의 확률은 1−γ(μ1)=1−0.8=0.2 이므로 1번이 해당한다.
다음은 자료 (x_1i , x_2i , y_i) (i = 1,2,⋯,12) 에 다중선형회귀모형 y_i = β_0 + β_1 x_1i + β_2 x_2i + ε_i 를 최소제곱법으로 적합하여 얻은 결과이다. 귀무가설 H_0 : β_1 = β_2 = 0 을 검정할 때, 유의확률이 포함되는 구간은? (단, ε_i 는 정규분포 N(0, σ^2) 을 따르고 서로 독립이며, F_α (k_1 , k_2) 는 분자와 분모의 자유도가 각각 k_1 , k_2 인 F 분포의 제 100 × (1-α) 백분위수를 나타내고, F_0.1 (2 , 9) = 3.01 , F_0.05 (2 , 9) = 4.26 , F(0.01) (2, 9) = 8.02 이다)
Σ(i = 1~12) (y_i -ȳ)^2 = 180 , Σ(i = 1~12) (y_i - ŷ_i)^2 = 54 (단, ŷ_i 은 y_i 의 적합값이다)
정답 1번
회귀제곱합은 180−54=126 이고 F=(126/2)/(54/9)=63/6=10.5 이다. F_0.01(2, 9)=8.02 보다 크므로 유의확률은 0.01 보다 작아 1번이 해당한다.
각 수준조합에서의 반복수가 일정한 이원배치법으로부터 얻은 분산분석표의 일부가 다음과 같을 때, 옳은 것은?
요인제곱합자유도평균제곱F -값p -값인자 A310.08310.0810.850.017인자 B42.0021.000.730.518교호작용 A × B57.332.010.215오차28.58계638.2511
정답 4번
교호작용 A×B 의 p 값 0.215 는 유의수준 0.05 보다 커서 귀무가설을 기각하지 못하므로 유의하지 않아 4번이 해당한다. 수준수와 반복수는 자유도를 채워 보면 각각 2, 3, 2 이다.
모분산이 알려진 정규분포를 따르는 모집단에서 임의추출한 표본으로부터 구한 모평균 μ 에 대한 95 % 신뢰구간이 (90, 110) 일 때, 옳지 않은 것은?
정답 3번
신뢰구간은 표본으로 구해진 뒤에는 고정된 수 구간이라 모평균이 그 안에 있을 확률이 0.95 라고 말하지 못하고 95% 는 구간을 만드는 방법의 성질이다. 따라서 3번이 옳지 않다.
두 이산확률변수 X 와 Y 의 결합확률분포가 다음과 같을 때, X^2 과 Y^2 의 공분산은?
<div class="tbl-wrap"><table class="jtbl"><thead><tr><th>Y X</th><th>0</th><th>1</th></tr></thead><tbody><tr><td>0</td><td>{1 / 8}</td><td>{1 / 4}</td></tr><tr><td>1</td><td>{1 / 4}</td><td>{3 / 8}</td></tr></tbody></table></div>
정답 2번
X 와 Y 는 0 또는 1 이라 X²=X 이고 Y²=Y 이다. P(X=1)=P(Y=1)=1/4+3/8=5/8 이고 E(XY)=3/8 이므로 Cov(X², Y²)=3/8−(5/8)²=−1/64 이며 2번이 해당한다.