2011年5月28日 星期六

單向度之驗證-revised

單向度之驗證,較常見之方法為試題反應理論(item response theory)及驗證性因素分析(confirmatory factor analysis, CFA)
一、試題反應理論,可區分為參數試題反應理論及非參數性試題反應理論兩大類:
      1.  參數試題反應理論可以根據其所包含的試題參數數目來分,分為單參數的Rasch模式、二參數模式與三參數模式。Rasch為單參數模式(只有題目難易度一個參數)Rasch分析主要是在評估量表項目是否符合Rasch模式,若符合模式預期則可以宣稱量表符合單向度假設。此外,如量表項目均能符合 Rasch 模式的預期,則Rasch模式利用對數函數(logit function)針對答題機率進行計算得到客觀等距量尺。單參數模式並不把試題鑑別度(discrimination)指數考慮在內,也就是假設所有試題的鑑別度都是相等的。單參數模式對試題特性及個案作答反應有較嚴格的要求,其對資料是否能符合基本模式假設也較嚴苛,易排除某些可能如使用非參數性分析法來驗證可以被保留下來的題目。
2.   Mokken 模式為非參數性 (non-parametric) 的分析方法,相較於Rasch分析,Mokken分析基於較寬鬆的假設,但同樣可用來評估測驗單一向度性。在分析方法上,Mokken模式包含了兩個模型的驗證:Monotonously Homogeneous (MH)模型與Doubly Monotone (DM)模型。在MH模型中有主要三個假設: (1)潛在特質為單向度; (2) 題目局部獨立(local independence); (3)題目之項目特徵曲線(Item Characteristic Curve, ICC)呈現單調遞增(monotonically non-decreasing)特質; 即能力越高,答對每一題的機率越大。並使用scalability 係數 H檢測題目是否符合MH模型的基本假設。Scalability 係數 H數值介於0-1之間。系數越低表示題目愈不吻合模型假設。一般以係數H大於或等於0.50為量表符合單向度的可接受標準。如果題目符合MH模型,單向度的假設也會得到支持。至於DM模型,除了MH模型三個假設外,還須具備項目特徵值(ICC)沒有交叉,即項目順序不變假設 (invariant item ordering)DM模型主要目的除驗證單向度外,並可檢驗項目是否呈現階層排序(例如從簡單到難)如項目呈現階層排序,我們才能有信心說對所有能力水平的受試者而言,答對第一題的機率,永遠都大於答對第二題,而它也永遠大於答對第三題的機率。換句話說,對所有能力水平的人而言,第一題最簡單,第二題其次,第三題最難。瞭解項目難易階層性可協助定位個案能力,讓個案都接受適合於自己能力的題目。 “Rest score” “P matrix”為檢測DM的兩種方法。Mokken模式雖然不參數試題反應理論那樣受參數限制,但卻只適用於次序量表。

二、因素分析法:
驗證性因素分析運用於單向度驗證,主要假設是為所有項目都落在單一因素。驗證性因素分析使用因素模型適合度分析法檢視測驗的內在結構。但目前用來驗證CFA適合度指標種類繁多。較為常見的是為卡方檢定,樣本與模型越適配,卡方值越小。卡方檢定易受樣本數(或題目數)影響,樣本數大時即使模型適配度好,容易拒絕虛無假設。CFA分析方法要求資料必須具備等距量尺特性,此假設並不見得能符合大多數試題的分數或測驗的總分並不具有等距的資料。並且大部份個案自陳量表其資料大致都為偏態分配,較難符合CFA的基本假設。基於以上幾點,對於CFA是否適用於單向度的驗證,造成不少學者的質疑。因此,Cook等作者認為可採用Reise 等學者所提出使用双因子(bifactor )模型來驗證單向度。双因子模型中每個題目不僅在特殊因子上有負荷,所有題目在一般因子上也存有負荷,所有因子之間正交。Resise指出双因子模型,限制較少,可以直接由通過特殊因子負荷直接判斷作用大小,並且如有第二因子存在時易顯現出來。

2011年5月26日 星期四

三篇IRT文獻閱讀心得

三篇IRT文獻中,首先閱讀的重點是:檢驗單向度的重要性。文章中所評量的能力或特質,像是手功能或是生活品質,都是不能實際測量(:血壓計測量血壓)而得到一個數值來判斷好壞,所以藉由評估的項目或是問卷的題目來估計手功能或生活品質的高低。理想上,希望只用一個題目就可看出手功能或生活品質的高低,因為一個題目比較單純,就只是單純測量手功能或生活品質。然而,這樣做就會有評量誤差的風險,而題目多一些則可以降低這樣的風險。只不過,題目一多,就不一定確定都是測量手功能或是生活品質,也就是不確定所有的題目是否具單向度。若所有的題目皆是測量手功能或生活品質,即這些題目具有單向度,其每題分數就可以相加而得到一個總分,而此總分就可代表個案的手功能或生活品質。


而一般檢驗項目是否具單向度,可使用驗證性因素分析(confirmatory factor analyses, CFA)或試題反應理論(item response theory, IRT)中的Rasch analysisMokken scale analysis。其中,兩篇文章都使用Mokken scale analysis來驗證單向度。Mokken scale analysisRasch analysis的假設寬鬆,屬於無母數分析,針對有些手功能或生活品質的評估工具或問卷,常是以順序尺度(ordinal scale)的方式來評量,以Mokken scale analysis來驗證單向度,則可以檢驗這類的資料是否也具單調遞增之特質。而關於CFAIRT之比較,由文章中閱讀到的重點是:CFA對資料的分佈和題目的數量較為敏感,可能會過度刪題,一般似乎是以這個分析來做為驗證單向度的標準,看資料是否具足夠單向度可進一步做IRT的分析。

2011年5月25日 星期三

文獻閱讀彙整

單向度之驗證,較常見之方法為試題反應理論(item response theory, IRT)及驗證性因素分析(confirmatory factor analysis, CFA)
一、試題反應理論,可區分為參數反應性理論及非參數性反應性理論兩大部分:
1.      參數反應性理論又以Rasch模式使用最多Rasch參數模式(只有題目難易度一個參數)Rasch分析主要是在評估量表項目是否符合Rasch模式,若符合模式預期則可以宣稱量表符合單向度假設。此外,如果量表項目均能符合 Rasch 模式的預期,Rasch模式利用對數函數(logit function)針對答題機率進行計算得到客觀等距量尺。Rasch 模式假設較為嚴格,所以題目較不易符合單向度。
2.      Mokken 模式為非參數性 (non-parametric)的分析方法,相較於Rasch分析,Mokken分析基於較寬鬆的假設,但同樣可用來評估測驗單一向度性。在分析方法上,Mokke模式包含了兩個模型的驗證:Monotonously Homogeneous (MH)模型與Doubly Monotone(DM)模型。在MH模型中有主要三個假設: (1)潛在特質事為單向度; (2) 題目局部獨立(local independence); (3)可用一條連續單調遞增(monotonically non-decreasing)的項目特徵曲線(ICC)來解釋。並使用scalability 係數 H檢測題目是否符合MH模型的基本假設。scalability係數H是為一總體數值,其用來檢視將預試個案的能力的強弱納入考量後,選答反應符合一致的程度。Scalability 係數 H數值介於0-1之間。系數越低表示題目愈不吻合模型假設。一般以係數H大於或等於0.40為量表符合單向度的可接受標準。如果題目符合MH模型,單向度的假設也會得到支持。至於DM模型,除了MH模型三個假設外,還須具備項目特徵值(ICC)沒有交叉。DM模型主要目的除驗證單向度外,並可檢驗項目是否呈現階層排序(例如: 從簡單到難) Rest score P matrix檢測DM的兩種方法。
二、因素分析法:
    驗證性因素分析(CFA):具有驗證假設之優點。CFA運用於單向度驗證,主要假設是為所有項目都落在單一因素。驗證性因素分析檢視測驗的內在結構。目前用來驗證CFA適合度指標種類繁多。較為常見的是為卡方檢定,樣本與模型越適配卡方值越小。卡方檢定易受樣本數(或題目數)影響,樣本數大時即使模型適配度好,也是容易拒絕虛無假設。CFA分析方法要求資料必須具備等距量尺特性,此假設並不見得能符合大多數試題的分數或測驗的總分並不具有等距的資料,這對單向度的驗證具有不小挑戰性。因此,Cook等作者認為可採用Reise 等學者所提出使用雙因素(bifactor )模型來驗證單向度。雙因素模型中每個題目不僅在特殊因子上有負荷,所有題目在一般因子上也存有負荷,所有因子之間正交。Resise指出雙因素模型,限制較少,可以直接由通過特殊因子負荷直接判斷作用大小,理論上更利於統計識別。


1.Cook K, Kallen M, Amtmann D. Having a fit: impact of number of items and distribution of data on traditional criteria for assessing IRT’s unidimensionality assumption. Quality of Life Research. 2009;18(4):447-460.
2. Koh CL, Hsueh IP, Wang WC, et al. Validation of the action research arm test using item response theory in patients after stroke. J Rehabil Med. Nov 2006;38(6):375-380.
3. Reise SP, Morizot J, Hays RD. The role of the bifactor model in resolving dimensionality issues in health outcomes measures. Qual Life Res. 2007;16 Suppl 1:19-31.
4. van der Heijden PGM, van Buuren S, Fekkes M, Radder J, Verrips E. Unidimensionality and reliability under Mokken scaling of the Dutch language version of the SF-36. Quality of Life Research. 2003;12(2):189-198.

姿誼的IRT文獻閱讀心得

這三篇文章當中,有兩篇於去年底層讀過,但是無法理解文章中的概念。上過IRT與因素分析的課程之後再看,覺得好懂許多,雖然仍不太清楚每個統計指標發展的意涵,但大致上可以理解使用這些方法的原因與目的。為了方便理解,因此將文章中提到的三個檢驗單一面向性(unidimensionality)的方法(Rasch analysis, Mokken model, Confirmatory Factor Analysis)整理出下表。

單向度文獻彙整

單向度 (unidiemnsionality)意指,一組題目測量同樣的特質或概念,假如呈現單向度的結果,即表示此組題目的總分可以代表某一特質。單向度的測量方法有3種:(1) 線性共同因素分析(linear common factor analysis)(2) 參數試題反應模式(parametric item response model)(3) 非參數試題反應模式(non-parametric item response model)。第二和第三種模式都隸屬於項目反應理論(item response theory)
線性共同因素分析
測量觀察值和期望值的共變矩陣之間的差異,以確定項目是否符合模式。此分析方法的假設為,項目的分數需要是等距尺度(interval scale),潛在特質和觀察值會呈現線性關係。
參數試題反應模式
為非線性的模式,此模式會把順序尺度(ordinal scale)的分數轉換為等距尺度。參數試題反應模式分為二點計分(binary data)模式、多點計分(polytomous data)模式。二點計分模式,包括有羅序模式(Rasch model、一參數)、二參數和三參數模式。多點計分模式,包括評等量尺模式(rating scale model)、等級反應模式(graded response model)、部分計分模式(partial credit model)。這些模式都是在計算潛在特質的對數平均數,以獲得項目發生的機率。此類模式的假設較為嚴格,所以要達到單向度,較不容易。
非參數試題反應模式
摩根模式(Mokken model)的假設較為寬鬆,為非參數模式。摩根模式對單向度的定義為,一組項目的真實分數,是否可以為一個單調遞增函數(monotonic increasing function)。摩根模式為計算個體間原始總分的順序,以決定是否為單向度。摩根模式使用的原始總分為順序尺度,非為等距尺度,順序尺度分析結果,並不能確實地測量出個人能力。另外,在摩根模式中,會保留在參數模式中刪除的項目(於參數模式中不符合單向度,但在摩根模式裡,卻符合單向度)

2011年5月11日 星期三

IRT作業的問題討論


以下兩個問題是我從業太的修改建議發現的疑問,
老師說請大家在下週三之前把對這兩題的想法張貼上來喔,謝謝。
1.      PCA的結果,應該報告empirical或是報告 modeled的數值?
2.      Local independency與單一面向性的關係為何?

2011年5月10日 星期二

IRT問題討論

老師要我們討論以下的問題,請同學們在此寫下你/妳的看法,謝謝。
問題:項目分數等級之適用性的檢驗,是在單向度驗證之前,還是之後?