2 X 3テーブルで複数の事後カイ2乗検定を実行する方法


9

私のデータセットは、沿岸、ミッドチャネル、オフショアの3つのサイトタイプでの生物の全死亡率または生存率で構成されています。下の表の数字は、サイトの数を表しています。

              100% Mortality            100% Survival
Inshore             30                       31 
Midchannel          10                       20 
Offshore             1                       10

100%の死亡率が発生したサイトの数がサイトのタイプに基づいて重要かどうかを知りたいです。2 x 3カイ2乗を実行すると、重要な結果が得られます。実行できる事後的なペアワイズ比較はありますか、または実際にロジスティックANOVAまたは二項分布の回帰を使用する必要がありますか?ありがとう!

回答:


7

分割表には、両方の軸で相互に排他的なすべてのカテゴリが含まれている必要があります。沿岸/ミッドチャネル/オフショアは問題なく見えますが、この生物学的設定で「100%未満の死亡率」が「100%生存」を意味しない限り、観察されたすべてのケースを説明するテーブルを作成するか、分析を極端に制限する理由を説明する必要がありますサンプルの終わり。

100%の生存率は0%の死亡率を意味するため、列が100%=死亡率/ 100%>死亡率> 0%/死亡率= 0%の表を作成できます。この場合、これ以上パーセンテージを比較する必要はありませんが、3つのサイトタイプのカテゴリ間で順序死亡率測定値を比較します。(カテゴリーの代わりに元のパーセンテージ値を使用するのはどうですか?)ここでは、適切な関係を考慮したKruskal-Wallis検定(順列検定)のバージョンが適切な場合があります。

クラスカル・ウォリス検定のためにそこに確立されている事後テスト:1、2、3。(リサンプリングアプローチは、絆との取り組みに役立つ場合があります。)

ロジスティック回帰および二項回帰は、p値だけでなく、効果サイズの有用な推定値および信頼区間も提供するため、さらに優れている場合があります。ただし、これらのモデルを設定するには、100%>死亡率> 0%のサイトに関する詳細が必要になります。


4

「100%生存」とは、サイトに含まれる生物が1つだけであることを意味します。したがって、30は30の生物が死亡したことを意味し、31は31の生物が死亡しなかったことを意味します。これに基づいて、カイ二乗は問題ないはずですが、データによってサポートされない仮説のみが通知されます。2つの合理的な仮説が優れているかどうかは通知されません。この情報を抽出する確率分析を提示します。これはカイ2乗検定と一致しますが、カイ2乗検定よりも多くの情報を提供し、結果を提示するためのより良い方法を提供します。

モデルは、「死」のインジケータのベルヌーイモデルであり、(iはのセル表す2 × 3テーブルを、そしてjは、セル内の個々のユニットを表します) 。Y私j〜B私ん(1、θ私j)私2×3j

カイ二乗検定の根底にある2つのグローバルな仮定があります。

  1. テーブルの所与のセル内に、である、全て等しくθ I J = θ I K = θ Iθ私jθ私j=θ私k=θ私
  2. 与えられ、統計的に独立していますθ I。確率パラメータはあなたについてのすべて伝えることをこれは意味Y I jは、あなたが知っていれば他のすべての情報は無関係です- θ IをY私jθ私Y私jθ私

をY i jの合計として表し(つまり、X 1 = 30 、X 2 = 10 、X 3 = 1)、N iをグループサイズとします(つまり、N 1 = 61 、N 2 = 30 、N 3とします) = 11)。これで、テストする仮説があります。バツ私Y私jバツ1=30、バツ2=10、バツ3=1N私N1=61、N2=30、N3=11

Hあ:θ1=θ2、θ1=θ3、θ2=θ3

しかし、代替案は何ですか?私は等しいか等しくない他の可能な組み合わせを言うでしょう。

H B 2:θ 1 ≠ θ 2、θ 1 = θ 3、θ 2 ≠ θ 3 H B 3:θ 1 = θ 2、θ 1 ≠ θ 3、θ 2 ≠

HB1:θ1≠θ2、θ1≠θ3、θ2=θ3
HB2:θ1≠θ2、θ1=θ3、θ2≠θ3
H C:θ 1 ≠ θ 2、θ 1 ≠ θ 3、θ 2 ≠ θ 3
HB3:θ1=θ2、θ1≠θ3、θ2≠θ3
HC:θ1≠θ2、θ1≠θ3、θ2≠θ3

上記の「グローバルな」仮定を考えると、これらの仮説の1つは真でなければなりません。ただし、これらのどれもレートの特定の値を指定していないことに注意してください。したがって、それらを統合する必要があります。ここでが真であり、パラメーターは1つしかなく(すべて等しいため)、均一な事前分布は控えめな選択であり、これとグローバルな仮定をI 0で示します。だから私たちは:Hあ私0

P(バツ1、バツ2、バツ3|N1、N2、N3、Hあ、私0)=∫01P(バツ1、バツ2、バツ3、θ|N1、N2、N3、Hあ、私0)dθ
=(N1バツ1)(N2バツ2)(N3バツ3)∫01θバツ1+バツ2+バツ3(1−θ)N1+N2+N3−バツ1−バツ2−バツ3dθ
=(N1バツ1)(N2バツ2)(N3バツ3)(N1+N2+N3+1)(N1+N2+N3バツ1+バツ2+バツ3)

HB1

P(バツ1、バツ2、バツ3|N1、N2、N3、HB1、私0)=∫01P(バツ1、バツ2、バツ3、θ1θ2|N1、N2、N3、HB1、私0)dθ1dθ2
=(N2バツ2)(N3バツ3)(N1+1)(N2+N3+1)(N2+N3バツ2+バツ3)

他の人のパターンを見ることができます。例えばオッズを計算できますHあvsHB14HあHB14

Hypothes私sprobab私l私ty(Hあ|D)0.018982265(HB1|D)0.004790669(HB2|D)0.051620022(HB3|D)0.484155874(HC|D)0.440451171

あ


1

以下は、カイ二乗検定を実行し、さまざまな検定統計量を生成するコードです。ただし、ここでは、テーブルマージンの関連付けの統計テストは役に立ちません。答えは明白です。夏が冬より暑いかどうかを確認するための統計的検定は誰も行いません。

Chompy<-matrix(c(30,10,1,31,20,10), 3, 2)
Chompy
chisq.test(Chompy)
chisq.test(Chompy, simulate.p.value = TRUE, B = 10000)
chompy2<-data.frame(matrix(c(30,10,1,31,20,10,1,2,1,2,1,2,1,2,3,1,2,3), 6,3))
chompy2
chompy2$X2<-factor(chompy2$X2) 
chompy2$X3<-factor(chompy2$X3)
summary(fit1<-glm(X1~X2+X3, data=chompy2, family=poisson))
summary(fit2<-glm(X1~X2*X3, data=chompy2, family=poisson)) #oversaturated
summary(fit3<-glm(X1~1, data=chompy2, family=poisson)) #null
anova(fit3,fit1)
library(lmtest)
waldtest(fit1)
waldtest(fit2) #oversaturated
kruskal.test(X1~X2+X3, data=chompy2)
kruskal.test(X1~X2*X3, data=chompy2)

3
あなたが与えたさまざまなR構文(および基礎となるテスト)の詳細、特に対数線形モデルと比較したクラスカル・ワリス検定の方法を提供できれば、読者(およびOP)にとって興味深いでしょう。
— ch

これを確認するには、コードをコピーしてRコンソールに貼り付けます。
— Patrick McCann、

1
承知しました。もちろん、応答はコードを実行することによって自分自身から送信されます。
— chl

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.