高普考題庫
104 年 104年公務人員高等考試三級考試暨普通考試

迴歸分析

本卷皆為申論題,點「看答案與解析」查看擬答。

申論 1若考慮配適一簡單線性迴歸模型y=α+βx+ε,其中α、β 為參數,ε 為隨機誤差,且假設其為具均數0,標準差σ之常態分配。今於配適模型後,繪出殘差對自變數x的分析圖。請分別針對圖(a)-(c)的結果,說明迴歸模型是否恰當?若模型不恰當時,請指出對於參數估計值是否會有偏差(bias)之影響,對於有關參數的假設檢定是否正確,另外也請提出修正的方法。(18 分)(a) (a)(b)(b)(c) (c)ResidualResidual1Residualx x xxxx
申論 2根據下列3 變數,6 個觀察值的資料Y 1 0 1 1 0 0X1 1 -2 1 0 0 0X2 0 1 2 2 1 0㈠令Y、X1、X2 分表各變數觀察值所形成的向量,另定義X0 為長度等於6 且元素均等於1 的向量。在以向量表示法的迴歸模型M:Y=βX0+βX1+βX2+ε 中,如何將βX0+βX1+βX2 更精簡的以矩陣與參數向量表示?另外,在一般情形下,此時ε 之機率分佈為何?(4 分)㈡計算迴歸模型M 中之參數向量的最小平方估計量及估計其變異數共變異數矩陣(variance-covariance matrix)。(8 分)Yˆ 6MYfitted values㈢令為長度等於 的向量,其元素為迴歸模型 對 的配適值(),HYˆ =HYH4則存在一矩陣 使得,計算此矩陣。( 分)㈣計算迴歸模型M 中的變異數膨脹因子(variance inflation factor, vif)vif(X1)與vif(X2)。(4 分)(請接第二頁)104年公務人員高等考試三級考試試題 代號:22050第二頁類 科: 統計科 目: 迴歸分析
申論 3三高(高血壓、高血糖、高血脂)與許多重大慢性病皆有重要關係。為了解個人體質、生活習慣等對於三高的影響因子,並對社會大眾提出建議與注意事項。因此,研究人員由臺灣數個醫學中心,採用隨機抽樣法蒐集了10000 個就診慢性病者的資料進行調查分析。該資料測量每個人的血壓(以收縮壓為例,單位為mmHg)及其他相關變數如下:性別(男性為1,女性為0),年齡(25-85 歲),身體質量指數BMI(定義為身高/體重2,單位為m/kg2),量血壓習慣(有量血壓習慣者為1,反之為0),量血糖習慣(有量血糖習慣者為1,反之為0),量血脂習慣(有量血脂習慣者為1,反之為0),喝酒習慣(平均每天喝1 瓶600c.c.啤酒或相當之酒類以上者為1,反之為0),抽煙習慣(有抽煙習慣者為1,反之為0),外食頻率(每週外食次數),運動習慣(有運動習慣者為1,反之為0),睡眠品質(睡眠品質佳者為1,反之為0)。研究者建立血壓(y)對所有解釋變數的迴歸模型,得到如下表(LM1)之結果,其殘差分析也無明顯瑕疵。㈠模型LM1 之所有變數的解釋力為多少?一般來說,此解釋力算是高、中或低?並解釋表中「F-statistic:4961 on 11 and 9988 DF, p-value:<2.2e-16」之意義。(4 分)㈡在模型LM1 下,以兩人之不同的性別、年齡及BMI 解釋參數估計值所代表之意義。(6 分)㈢為了去蕪存菁,研究人員去除兩個非常不顯著的變數並得到下表模型LM2 之結果。根據LM1 及LM2,請就下面1.或2.擇一回答(兩項均答者不予評分)。(10 分)1. 說明LM1 與LM2 何者較佳或差不多,並建議大眾那些變數為三高影響因子應儘量避免或注意?2. 此分析結果不適合用來推薦三高影響因子(說明原因及提出改進方法,此結論是否與題㈠結論矛盾?)。模型LM1 Estimate Std. Errort valuePr(>|t|)模型LM2 EstimateStd. Errort valuePr(>|t|)(Intercept) 97.487 0.627155.3650.0000(Intercept) 97.5510.624156.4140.0000性別 19.564 0.113173.7860.0000性別 19.5700.111176.7800.0000年齡 0.452 0.00586.8940.0000年齡 0.4520.00586.9120.0000身體質量指數BMI 1.249 0.4582.7290.0064身體質量指數BMI 1.2470.4572.7260.0064量血壓習慣 2.070 0.10819.0840.0000量血壓習慣 2.0700.10819.0810.0000量血糖習慣 0.557 0.1005.5450.0000量血糖習慣 0.5560.1005.5320.0000量血脂習慣 3.012 0.3119.6970.0000量血脂習慣 3.0130.3119.7020.0000喝酒習慣 -0.741 0.294-2.5220.0117喝酒習慣 -0.7460.294-2.5390.0111抽煙習慣 0.046 0.0490.9360.3494外食頻率 -1.8360.979-1.8760.0607外食頻率 -1.827 0.979-1.8660.0621運動習慣 2.9340.8583.4200.0006運動習慣 2.933 0.8583.4180.0006Residual standard error:4.923 on 9990 degrees of freedom睡眠品質 -0.005 0.019-0.2840.7764Multiple R-squared:0.8453, Adjusted R-squared:0.8451Residual standard error:4.923 on 9988 degrees of freedomF-statistic:6064 on 9 and 9990 DF, p-value:< 2.2e-16Multiple R-squared:0.8453, Adjusted R-squared:0.8451F-statistic:4961 on 11 and 9988 DF, p-value:< 2.2e-16(請接第三頁)104年公務人員高等考試三級考試試題 代號:22050第三頁類 科: 統計科 目: 迴歸分析
申論 4一個學習效果評量相關分析的報告裏,資料內容由20 人(男女各半)的4 個變數(y,x1,x2,x3)所構成。其中y 為學習效果(其平均值96.2 且標準差為24.47),x1=1或0 表男性及女性,x2(其平均值83.6 且標準差為5.9)與x3(其平均值65 且標準差為10.3)分別表某性向測驗的兩種分數。下圖為資料之4 個變數間的散佈圖;此外,下表也列出配適學習效果y 與不同解釋變數之迴歸模型的R2。y y100VariablesModelR280in modelM1 x1 0.3970.8M2 x2 0.4130.6x1 x1M3 x3 0.4870.2M4 x2, x3 0.504M5 x1, x2 0.67690M6 x1, x3 0.697x2x285M7 x1,x2, x30.69770x3x3㈠考慮模型M1,完成下面的分析表,說明填入之F value 及t value 的值所代表意義。(12 分)Analysis of Variance Table:Response:yDf Sum Sq Mean Sq F valuex1ResidualsTotalCoefficients:Estimate Std. Errort valueInterceptx1㈡考慮模型M1,計算y 在x1=1 之信心水準為90%的預測區間。(5 分)㈢在M1-M7 模式中,給定進入模式水準(entry level)α=0.1,採用F 檢定法,列出前進選取(forward selection)程序與其最終選定之模式。(10 分)㈣根據準則Akaike Information Criterion(AIC),依序列出M1-M7 模式中的最佳3個模型。(10 分)㈤針對M7 模式,在顯著水準α=0.1 下,檢定x2 與x3 之係數是否同時等於0。(5 分)