重複測量混合模型
重複測量混合模型(MMRM):原理、應用與方法比較
重複測量混合模型(Mixed Models for Repeated Measures, MMRM)是分析連續型重複測量結果的常用方法。本文介紹的常見 MMRM 設定可估計各組在各次訪視的平均結果。依研究問題設定比較後,可以評估同一時間點的組間平均差異,也可以評估兩組在指定兩個時間點之間的平均變化量是否不同。模型同時考慮同一位受試者多次測量之間的相關性,並在適當的模型與缺失資料假設下,使用不完整的追蹤資料。[1, 2]
本文分為兩部分。第一部分介紹 MMRM 的原理、適用情況、使用方式,以及報告時應說明的設定與結果;第二部分比較 MMRM 與重複測量變異數分析、含個體隨機效應的線性混合模型、ANCOVA 及 GEE。全文以臨床案例說明,公式與較細的技術內容放在附錄。
一、MMRM 的原理與應用
1.1 MMRM 如何分析重複測量資料?
假設新藥試驗招募了 300 位受試者,分為試驗組與對照組,預計在第 2 週、第 4 週、第 8 週與第 12 週測量症狀改善程度。主要研究問題是:「在第 12 週,兩組的平均改善量相差多少?」
同一位受試者被重複測量了 4 次,他在不同時間點的測量值通常彼此相關,這稱為「個體內相關性」。因此,分析需要同時估計各組在每個時間點的平均改善量,並考慮同一人多次測量之間的相關性。
平均數模型:估計各組的平均結果,並設定要比較的差異
常見的 MMRM 設定將訪視視為類別,並加入治療組別與訪視的交互作用。以本例而言,模型可分別估計試驗組與對照組在第 2、4、8、12 週的平均改善量,再比較每一週兩組之間的差異。
一種比較是同一時間點的組間差異。例如,第 12 週的組間差異是「第 12 週試驗組的平均改善量」減去「第 12 週對照組的平均改善量」。
另一種比較是兩組在兩個時間點之間的平均變化量是否不同。例如,分別計算試驗組與對照組從第 4 週到第 12 週的平均變化量,再比較這兩個變化量之差。這也等同於比較「第 12 週的組間差異」與「第 4 週的組間差異」是否不同。
加入組別與訪視的交互作用後,各週的組間差異可以不同,也能依研究問題設定上述兩類比較。兩個指定訪視間的變化量比較屬於模型估計值的線性對比(contrast),需明確指定所比較的組別與時間點;納入交互作用不代表軟體會自動檢定所有可能的比較。將訪視設為類別,也不必假設各組的平均改善量沿直線變化。[10]
若納入基準線症狀分數,模型可在指定的基準線設定下,估計各組在每次訪視的調整後平均改善量,再依研究問題計算同一次訪視的組間平均差異,或兩個時間點之間平均變化量的組間差異。這些調整後平均數常稱為最小平方平均數(Least Squares Means, LSMEANS)或估計邊際平均數,可能不同於直接對實際測量值取平均。[2]
共變異數結構:描述同一人的測量相關性
共變異數結構描述各次測量的變異程度,以及同一位受試者不同時間點的測量值之間的相關性。例如,同一人在第 2 週與第 4 週的測量值可能相關。這項設定用來處理同一人的重複測量資料;同一時間點的組間差異,以及兩組在兩個時間點之間的平均變化量差異,則由平均數模型及相應的比較來估計。
非結構化(Unstructured, UN)是常用選項之一。它分別估計各次訪視的變異數與各對訪視的共變異數,不預設特定的相關性遞減形式;但參數較多,樣本較少或資料稀疏時,估計可能不穩定。MMRM 也可以使用其他共變異數結構,並不以 UN 為必要條件。各結構的定義與參數個數見附錄 C。[6]
概似估計與缺失資料假設
MMRM 以概似為基礎,利用已觀察到的資料,估計各組在每次訪視的平均結果,以及描述同一人測量變異與相關性的共變異數參數。若受試者在第 4 週後退出,一般分析可以使用已取得的追蹤結果,不必先為缺失的第 8 週與第 12 週結果逐筆填入數值。若沒有可用的追蹤結果,或必要共變項缺失,則仍須另行處理。
這類分析通常依賴隨機缺失(Missing at Random, MAR)假設:考慮模型中的已知資料後,缺失機率不再額外取決於尚未觀察到的結果。若退出與先前已記錄的症狀分數有關,而且模型適當考慮了這些資料,MAR 可能是可討論的假設;若尚未記錄的病情惡化仍影響退出機率,則可能涉及非隨機缺失(Missing Not at Random, MNAR)。[1](見遺漏值類型)
完全隨機缺失(Missing Completely at Random, MCAR)是較強的假設:在此分析情境下,缺失機率不依賴已觀察到或未觀察到的結果。這與隨機分派治療組別是不同的概念。
MMRM 提供的是依模型與假設得到的估計,無法直接得知退出者後來的病況。MAR 是否合理也不能僅靠已觀察到的資料就確定;若 MNAR 是合理的可能性,需規劃敏感度分析,評估改變缺失假設後,主要結論是否會改變。[1]
1.2 MMRM 適用於哪些情況?
本文介紹的常見 MMRM 設定,適合在數次預定訪視測量連續型結果,並希望比較同一時間點的組間平均差異,或比較兩組在兩個時間點之間平均變化量的研究。[2, 10]
| 需要確認的條件 | 可以考慮 MMRM 的情況 | 對研究的意義 |
|---|---|---|
| 結果變項 | 結果是適合以連續型變項分析的測量值,例如本例的症狀分數。 | 模型估計各組在每次訪視的平均數,再依研究問題比較組間平均差異或平均變化量;需先確認量表或數值適合這種分析。 |
| 測量方式 | 同一批受試者在數個預定訪視接受測量。 | 分析需要考慮同一人各次測量之間的相關性。 |
| 主要研究問題 | 比較同一次訪視的組間差異,或兩組在指定期間的平均變化量是否不同。 | 常見設定將訪視視為類別,不必假設平均結果沿直線變化。 |
| 資料完整性 | 資料完整,或部分追蹤結果缺失,但仍有可用的測量資料。 | 不必等到有人中途退出才使用;有缺失時,需另外評估缺失原因與假設。 |
以本例而言,研究已在數次訪視取得症狀分數,主要目標是比較試驗組與對照組在第 12 週的平均改善量,MMRM 就是可考慮的分析方法。即使所有資料完整,也可以使用;它的用途包括處理測量間的相關性,並不限於有受試者中途退出的研究。
若結果是是否住院、事件次數或存活時間,需使用適合二元、計數或存活資料的方法。若主要問題是個體變化速率,或測量時間高度不規則,也需評估其他混合模型設定。這些情況與 MMRM 的比較,見第二部分。
1.3 使用 MMRM 時,如何規劃分析?
先定義要估計的結果與主要比較
研究團隊應先決定分析原始測量值或相較於基準線的變化量,並明確定義主要比較的組別、時間點與差異方向。本例的主要比較是「第 12 週試驗組的平均改善量」與「第 12 週對照組的平均改善量」之間的差異。模型也可估計第 2、4、8 週各自的組間差異,或比較兩組從第 4 週到第 12 週的平均變化量。哪些比較屬於主要、次要或探索性分析,應事先在分析計畫中說明。
也需分清楚停止治療與失去追蹤。受試者停藥後仍可能取得測量值;這些結果如何使用,應依研究想估計的治療效果決定。研究要說明所關心的效果是否包含停藥情況,以及哪些觀察值對應這個問題,再據此規劃資料收集與分析。[3]
整理資料並指定模型
資料通常整理為「每列一位受試者的一次訪視」,包含受試者識別碼、治療組別、訪視、結果值、基準線值與其他必要共變項。缺失的結果值與缺失的共變項,可能需要不同的處理方式,應分別確認。
以下以本例的基準線變化量為結果,說明常見設定。每項設定都應對應研究問題,並非所有研究都需採用完全相同的模型。
| 模型項目 | 本例的設定 | 設定的用途 |
|---|---|---|
| 結果變項(應變數) | 各次追蹤相較於基準線的變化量(Change from Baseline, CFB)。 | 對應症狀改善量的研究問題;也可依分析計畫使用各次追蹤的原始測量值。 |
| 基準線數值(Base) | 納入基準線症狀分數。 | 調整研究開始時的差異。 |
| 基準線與訪視交互作用(Base | 允許基準線數值與結果的關係隨訪視改變。 | 不要求基準線的關係在每次訪視都相同。 |
| 治療組別(Trt)與訪視(Visit) | 納入治療組別與類別訪視。 | 估計試驗組與對照組各自在每次訪視的平均改善量。 |
| 治療與訪視交互作用(Trt | 讓不同訪視的組間差異可以不同。 | 可比較同一次訪視的組間差異,也可比較兩組在兩個時間點之間的平均變化量。 |
| 重複測量設定 | 辨認同一受試者的不同訪視,並指定共變異數結構。 | 將同一人的測量相關性納入分析。 |
平均數模型與共變異數結構是兩類需要分別指定的設定:前者用來估計各組在各次訪視的平均改善量,後者用來描述同一人多次測量之間的相關性。只寫「採用 MMRM」不足以重現分析,還需說明使用哪些效應、共變項與相關性結構。模型公式見附錄 B,SAS 設定對照見附錄 D。
指定估計方法、小樣本推論與替代方案
MMRM 可使用最大概似或限制最大概似(Restricted Maximum Likelihood, REML)等估計方式,分析計畫應說明所採用的方法。[2]
樣本較少時,估計變異數所帶來的不確定性可能影響檢定與信賴區間。Kenward 與 Roger(1997)提出的 Kenward–Roger(KR)調整,會修正固定效應估計的共變異數與檢定自由度,是常用的推論選項之一。[7]
KR 所計算的分母自由度(Denominator Degrees of Freedom, ddf)可能不是整數。另有 Satterthwaite 等方法,應在分析計畫中說明採用哪一種推論方式。[2]
UN 的參數較多,在小樣本或資料稀疏時可能收斂失敗。統計分析計畫書(Statistical Analysis Plan, SAP)應預先說明主要共變異數結構、收斂判定及替代分析方案。原稿所列順序可作為討論的示例:
- 主要結構:非結構化矩陣(UN)。
- 第一個替代結構:異質托普利茨矩陣(TOEPH)。
- 第二個替代結構:異質一階自回歸矩陣(ARH(1))。
- 第三個替代結構:複合對稱矩陣(CS)。
這個順序不是通用規範;替代結構及其順序需依研究設計與資料特性決定。任何事後變更都須記錄理由、決定時的盲態狀況,以及對結果解讀的影響。[1]
檢視缺失資料並規劃敏感度分析
研究團隊應整理各組在各次訪視的缺失情況、缺失原因及退出模式,評估 MAR 是否合理,並規劃對應的敏感度分析。模型能使用不完整資料,仍不減少持續追蹤與記錄缺失原因的重要性。[1]
1.4 使用 MMRM 後,如何報告設定與結果?
報告有兩個重點:讓讀者知道分析如何進行,以及讓分析結果清楚回答研究問題。方法段不能只列軟體或模型名稱,結果段也不能只有是否達統計顯著。
方法段:說明足以重現分析的設定
| 報告項目 | 應說明的內容 |
|---|---|
| 分析對象與結果定義 | 分析納入哪些受試者與觀察值;結果是原始測量值或基準線變化量,其單位與方向為何。 |
| 固定效應與共變項 | 治療組別、訪視、交互作用及基準線等共變項;訪視是否設為類別。 |
| 重複測量設定 | 如何辨認同一受試者的測量值,以及採用哪一種共變異數結構。 |
| 估計與推論方法 | 採用最大概似或 REML;自由度與標準誤是否使用 KR 或其他調整;分析軟體與版本。 |
| 主要比較與多重性 | 主要比較的組別與時間點;若有多個需要檢定的比較,如何處理多重性。 |
| 缺失資料與分析變更 | 缺失資料假設、敏感度分析、收斂情況、採用的替代方案及任何事後變更。 |
若同時檢定多個訪視的組間差異,需區分預先指定的主要比較與其他比較,並說明是否需要及如何處理多重性。將多次訪視放入同一個 MMRM,並不等於自動完成多重比較調整。[9]
結果段:報告差異大小、方向與不確定性
結果應先交代各組在各次訪視的可用樣本數與缺失情況,再呈現模型估計的結果。若同時列出觀察平均數與調整後平均數,需清楚標示,避免讀者混淆。
| 閱讀項目 | 需要看清楚的內容 |
|---|---|
| 分析結果的定義 | 分析的是第 12 週的原始症狀分數,還是相較於基準線的變化量? |
| 各組調整後平均數 | 試驗組與對照組在第 12 週的調整後平均結果各是多少?採用了哪些共變項設定? |
| 組間差異 | 第 12 週兩組的調整後平均結果相差多少?差異是否定義為「試驗組減對照組」? |
| 信賴區間 | 組間差異的估計有多少不確定性?區間包含哪些可能具有臨床意義的差異? |
| 臨床意義 | 量表上數值增加或減少代表改善還是惡化?差異大小是否具有臨床重要性? |
主要比較應呈現第 12 週試驗組與對照組的調整後平均差異、信賴區間及對應的檢定結果,並註明差異方向。若報告其他訪視的比較,也應逐一標示時間點與所比較的組別。若比較兩組在指定期間的平均變化量,則應報告起訖時間點、變化量的計算方向、兩組變化量之差及其信賴區間。若模型納入基準線,還應說明調整後平均數採用哪些共變項設定。[2]
例如,症狀分數愈低代表病況愈好,而差異定義為「試驗組減對照組」,負的平均差異就代表估計結果偏向試驗組較好。若使用改善量,則需先確認改善量如何計算,再解讀正負。
統計顯著性與臨床重要性是不同的判斷。應結合差異大小、信賴區間及量表的臨床意義解讀,而不是只根據是否達顯著作結。也應報告敏感度分析是否支持主要結論;若不同合理假設得到不同結果,需說明這項不確定性。[1]
二、MMRM 與其他方法的比較
MMRM 的定位可以從三個面向理解:研究想比較什麼結果、如何描述時間與個體差異,以及如何處理不完整的資料。分析模型與缺失資料處理方式需分開比較。
2.1 與含個體隨機效應的 LMM 比較
MMRM 可放在線性模型與混合模型的共同架構下理解,因此它與線性混合模型(Linear Mixed Model, LMM)不是互斥的類別。這裡比較的是常見 MMRM 設定,以及含個體隨機截距或斜率的 LMM 設定。
常見 MMRM 直接設定同一人的測量共變異數,並可估計各組在各次預定訪視的平均結果,再比較同一次訪視的組間差異,或兩組在兩個時間點之間的平均變化量。含隨機效應的 LMM 則可以描述個體間的差異,例如用隨機截距描述各人的起始程度不同,或用隨機斜率描述變化速率不同,也可以另設殘差相關結構。[4]
LMM 的時間可設為類別或連續變項。若研究關心變化速率,可以使用連續時間並指定合適的平均變化形式;若關心同一次訪視中不同組別的差異,也可以將時間設為類別。模型誤設的疑慮來自設定是否適合資料,不能僅以「使用連續時間」判定。兩種設定的公式見附錄 B。
2.2 與重複測量 ANOVA 比較
重複測量變異數分析(Repeated Measures ANOVA, RM-ANOVA)也分析同一人的多次測量。傳統 RM-ANOVA 的常見實作只使用所有訪視都有測量值的受試者,也就是完全病例分析(Complete Case Analysis, CCA)。
CCA 會減少可用樣本;若留下來的人與資料缺失者有系統性的差異,結果也可能產生偏誤。MMRM 可以在適當假設下使用已取得的追蹤結果,並指定測量間的共變異數結構。這是兩者在分析不完整追蹤資料時的重要差異。[1]
2.3 與基準線校正 ANCOVA 比較:另看缺失資料如何處理
共變數分析(Analysis of Covariance, ANCOVA)可比較兩組在同一指定終點的結果,並調整基準線值。若研究主要關心單一追蹤終點,它是可以考慮的選項;MMRM 則在同一模型中使用數次訪視的資料,可估計每次訪視各自的組間差異,也可設定兩個訪視之間平均變化量的組間比較。ANCOVA 的公式見附錄 A。
ANCOVA 是分析模型,CCA 與最後觀察值前推法(Last Observation Carried Forward, LOCF)是處理缺失資料的方式。因此,基準線校正 ANCOVA 不等於 LOCF ANCOVA,也不只適用於完全沒有缺失值的研究。
LOCF 會把最後一次可用的測量值填入後續缺失結果。沿用本例,受試者在第 4 週後退出,便用第 4 週數值代表第 8 週與第 12 週的結果。病況可能繼續改善或惡化,這種填補未必反映後續變化;若把填補值當成實際測量值,也沒有充分反映填補的不確定性。
LOCF 對組間差異、標準誤與檢定的影響,取決於疾病變化與兩組退出情況,不能一概認定必然保守或必然增加假陽性。即使符合 MCAR,也不足以單獨保證 LOCF 合理。[1]
2.4 與 GEE 比較
廣義估計方程式(Generalized Estimating Equations, GEE)也是群體平均分析方法,可以在適當設定下分析連續型、二元或計數等重複測量結果。它使用工作相關矩陣描述相關性,並常搭配穩健變異數估計。[5]
本文的 MMRM 使用概似式連續型結果模型;GEE 則以估計方程式進行推論。傳統 GEE 通常在完整資料或 MCAR 假設下使用;加權 GEE 在適當的權重模型與假設下,可處理部分 MAR 情境。穩健標準誤本身不會解決缺失資料的偏誤問題。[5]
2.5 方法比較總覽
| 方法 | 主要分析問題 | 時間與測量相關性的設定 | 缺失資料的考量 |
|---|---|---|---|
| MMRM | 比較同一次訪視的組間平均差異,或兩組在兩個時間點之間的平均變化量。 | 常將訪視設為類別,直接設定同一人的測量共變異數。 | 在 MAR 與合適的模型設定下,使用已取得的追蹤結果。 |
| 含個體隨機效應的 LMM | 描述平均變化、個體差異或變化速率。 | 時間可設為類別或連續;可使用隨機效應、殘差相關結構,或兩者共同描述相關性。 | 概似式分析在 MAR 與合適的模型設定下,可使用不完整的追蹤結果。 |
| 重複測量 ANOVA | 分析各組在各次訪視的平均結果,以及同一次訪視的組間差異。 | 依指定的重複測量分析形式處理時間與測量相關性。 | 傳統常見實作採 CCA,需評估樣本減少與選擇偏誤。 |
| 基準線校正 ANCOVA | 比較各組在同一指定終點的結果,並調整基準線。 | 通常每人分析一個終點結果,不直接描述整段追蹤過程。 | 依另外採用的缺失資料處理方式與假設判斷,不等同 LOCF 或 CCA。 |
| GEE | 分析群體平均的重複測量結果,可處理多種結果類型。 | 時間可設為類別或連續;設定工作相關矩陣,並常搭配穩健變異數估計。 | 傳統 GEE 通常在完整資料或 MCAR 下使用;MAR 下可考慮適當的加權 GEE。 |
以本例而言,MMRM 使用第 2、4、8、12 週的可用資料建立模型;主要比較則是第 12 週試驗組與對照組的平均改善量之差。納入模型的時間點與主要檢定的時間點,應在分析與報告中分別說明。若改成研究個體變化速率、二元結果或單一追蹤終點,適合的模型也可能改變。方法選擇應對應研究問題、結果類型、時間設定與缺失資料條件。
附錄 A. 基準線校正 ANCOVA 的公式
以第
其中,
若使用 LOCF,缺失的
附錄 B. MMRM 與隨機效應 LMM 的公式
MMRM 可放在線性模型與混合模型的共同架構下理解。含個體隨機截距或斜率的 LMM,可寫為:
其中,
本文所指的常見 MMRM 設定,不另外加入個體隨機截距或斜率,即令
這是邊際多變量常態模型的設定;
附錄 C. 共變異數結構的定義與參數個數
共變異數結構描述兩件事:各次測量的變異程度,以及同一受試者不同時間點的測量值有多相關。非結構化(Unstructured, UN)是常用選項之一,並非 MMRM 的必要條件。
下表中的
| 共變異數結構 | 參數個數( | 設定方式 | 使用時的考量 |
|---|---|---|---|
| 非結構化(Unstructured, UN) | 各次訪視有各自的變異數 | 彈性較大,但矩陣仍須對稱且正定。參數較多,樣本較少或資料稀疏時,估計可能不穩定。 | |
| 異質一階自回歸(ARH(1)) | 各次訪視可有不同變異數;相關性依訪視順序間隔呈幾何遞減: | 可作為預先規劃的替代結構之一;需評估間隔與相關性設定是否合理。 | |
| 一階自回歸(AR(1)) | 各次訪視有相同變異數 | 假設較 ARH(1) 強,需評估共同變異數與相關性遞減的設定是否合理。 | |
| 異質托普利茨(TOEPH) | 各次訪視有不同變異數 | 可表達相關性與訪視間隔有關、但不採幾何遞減形式的設定。 | |
| 複合對稱(Compound Symmetry, CS) | 各次訪視有相同變異數 | 參數較少,但假設較強,需評估是否適合資料。 |
共變異數結構的設定會影響統計推論。Mallinckrodt 等人(2004)比較四種模擬臨床試驗情境,發現 MMRM 的共變異數結構若設定錯誤,可能提高型一錯誤率(實際沒有組間差異,卻判定有差異的機率),也會影響檢定力(偵測實際差異的能力)。在該研究所有模擬情境中,不論資料的真實相關結構為何,採用 UN 的 MMRM 對型一錯誤率的控制均優於 LOCF 分析。[8]
這項結果支持將 UN 列為常用的共變異數結構選項,但不能據此保證它在所有研究中都能將型一錯誤率維持於預定水準。UN 需要估計較多參數,實際使用時仍應考量樣本量、資料稀疏程度與模型是否收斂。
附錄 D. SAS 設定對照
以下名稱是軟體設定,與上述統計概念相對應;它們不代表其他軟體必須使用相同語法。
| 統計概念 | SAS 設定示例 |
|---|---|
| 受試者識別碼 | 在重複測量設定中,以受試者 ID 指定SUBJECT=。 |
| 預定訪視 | 以Visit 辨認各次訪視,並將其設為類別變項。 |
| 非結構化共變異數 | 在重複測量設定中指定TYPE=UN。 |
| Kenward–Roger 推論 | 在模型設定中指定ddfm=kr。 |
這張表是概念與語法的對照,不是完整分析程式;固定效應、共變項、主要比較與其他選項仍需依分析計畫設定。[4]
參考資料
- European Medicines Agency. Guideline on Missing Data in Confirmatory Clinical Trials. EMA/CPMP/EWP/1776/99 Rev. 1. 指引全文。用於缺失資料假設、分析預先規劃與敏感度分析的說明。
- OpenPharma. Mixed Models for Repeated Measures — mmrm. 官方文件。用於本文所指 MMRM 的模型範圍、調整後平均數與推論選項。
- U.S. Food and Drug Administration / ICH. E9(R1) Statistical Principles for Clinical Trials: Addendum: Estimands and Sensitivity Analysis in Clinical Trials. 指引全文。用於研究問題、停藥、失去追蹤與分析目標的區分。
- SAS Institute. Linear Mixed Models. 官方文件。用於固定效應、隨機效應及殘差共變異數的共同模型架構。
- SAS Institute. Overview: PROC GEE. 官方文件。用於傳統 GEE 與加權 GEE 的缺失資料條件。
- OpenPharma. Covariance Structures. 官方文件。用於各共變異數結構的定義與參數個數。
- Kenward, M. G., & Roger, J. H. (1997). Small sample inference for fixed effects from restricted maximum likelihood. Biometrics, 53(3), 983–997. 論文書目與摘要。
- Mallinckrodt, C. H., Kaiser, C. J., Watkin, J. G., Molenberghs, G., & Carroll, R. J. (2004). The effect of correlation structure on treatment contrasts estimated from incomplete clinical trial data with likelihood-based repeated measures compared with last observation carried forward ANOVA. Clinical Trials, 1(6), 477–489. DOI: 10.1191/1740774504cn049oa. 論文書目與摘要。用於共變異數結構與型一錯誤率的說明;本文依原論文摘要概述研究結果。
- U.S. Food and Drug Administration. Multiple Endpoints in Clinical Trials: Guidance for Industry. October 2022. 指引全文。用於主要比較與多重性處理的說明。
- OpenPharma. Details of Hypothesis Testing. 官方文件。用於模型估計值的線性對比與假設檢定說明。