処置効果:ATE・CATE・ITEの整理

Data analysis
目次

イントロダクション

「新しい施策には効果があったのか?」——マーケティング、医療、政策評価など、あらゆる分野でこの問いに答えるために使われるのが処置効果(Treatment Effect)という考え方である。ここでいう処置は薬の投与に限らず、クーポンの配布、広告の表示、研修プログラムの実施など、対象に対して行う何らかの介入全般を指す。

処置効果には粒度の異なるいくつかの捉え方があり、それぞれITE(個別処置効果)、ATE(平均処置効果)、CATE(条件付き平均処置効果)と呼ばれる。本記事では、これらの基本用語とその関係、そしてデータから推定するために必要な仮定を整理する。

呼び方こそ違えど、これらはすべて同じ問い、「ある施策(処置)は結果にどれだけの差をもたらすか」を、対象の粒度を変えながら扱っているに過ぎない。この粒度の違いを理解しておくことは、因果推論やデータ分析の議論についていく上での土台になる。

潜在的結果とITE(個別処置効果)

出発点は「潜在的結果(Potential Outcomes)」という考え方である。ある個体 $i$ について、処置を受けた場合の結果を $Y_i(1)$、処置を受けなかった場合の結果を $Y_i(0)$ とする。この2つの値の差が、個体 $i$ の個別処置効果(Individual Treatment Effect, ITE)である。

$$
\tau_i = Y_i(1) – Y_i(0)
$$

理屈の上ではこれが最も知りたい量である。しかし、ここに因果推論最大の壁が立ちはだかる。個体 $i$ は実際には処置を受けるか受けないかのどちらか一方しか経験できないため、$Y_i(1)$ と $Y_i(0)$ を同時に観測することは原理的に不可能である。

図1: 紫は処置群($W=1$)、緑は対照群($W=0$)。各個人について、実際に起きた方の結果しか観測できず、もう一方は観測不可である。

ATE(平均処置効果)

個々人のITEは観測できないが、集団全体で平均を取ると推定できるようになる。これが平均処置効果(Average Treatment Effect, ATE)である。

$$
\tau_{\mathrm{ATE}} = \mathbb{E}\left[Y(1)-Y(0)\right] = \mathbb{E}\left[\tau_i\right]
$$

ランダム化比較試験(RCT)のように、処置群・対照群への割り当てが完全にランダムであれば、それぞれの群の平均結果の差がそのままATEの推定値になる。

$$\widehat{\tau}_{\mathrm{ATE}} = \overline{Y}_{W=1} – \overline{Y}_{W=0}$$

図1の例で単純に平均を取ると、処置群の平均は $(120+95)/2=107.5$、対照群の平均は $(60+75)/2=67.5$ なので、ATEの推定値は $107.5-67.5=40$ となる。ATEは「施策全体としてどれだけの効果があったか」である。

CATE(条件付き平均処置効果)

しかしATEは一つの数字に集約してしまうため、「誰に効果があったか」という情報が失われる。そこで、属性 $X$(年齢、購買履歴、顧客セグメントなど)で条件づけた上で平均を取るのが条件付き平均処置効果(Conditional Average Treatment Effect, CATE)である。

$$
\tau(x) = \mathbb{E}\left[Y(1)-Y(0) \mid X=x\right]
$$

CATEを個人(あるいは細かい属性の組)ごとに推定できれば、「誰に施策を打つべきか」という実務上の意思決定に直結する。例えば同じクーポン施策でも、休眠顧客には強い効果があり、常連客にはほとんど効果がない、といった違いをCATEは捉えることができる。近年の機械学習を使った因果推論の研究の多くは、このCATEをいかに精度よく推定するかに焦点を当てている。

ITE・CATE・ATEの関係

3つの概念は対立するものではなく、集約の粒度が異なるだけの関係にある。個々人のITEを、属性 $X$ が同じ人たちの中で平均すればCATEになり、CATEをさらに属性の分布全体で平均すればATEになる。

$$
\tau_{\mathrm{ATE}} = \mathbb{E}_X\left[\tau(X)\right]
$$

図2: バラバラな個人のITE(円)を属性 $X$ で束ねるとCATE(中段の箱)になり、CATEをさらに全体で平均するとATE(下段の箱)になる。

ATT:もう一つの関連概念

ATEやCATEと並んでよく登場するのが、処置群における平均処置効果(Average Treatment Effect on the Treated, ATT)である。

$$
\tau_{\mathrm{ATT}} = \mathbb{E}\left[Y(1)-Y(0) \mid W=1\right]
$$

ATEが「もし全員に処置をしたら/しなかったら」という仮想的な集団全体を対象にするのに対し、ATTは「実際に処置を受けた人たちの中で、その処置がどれだけ効果があったか」を問う。例えば就労支援プログラムの評価では、プログラムに参加していない人にまで仮想的に参加させた効果より、「実際に参加した人にとって参加は意味があったか」の方が政策的に重要な場合が多く、ATTが好んで使われる。

推定のために必要な仮定

これらの量は、定義しただけでは観測データから計算できない。データから推定するには、いくつかの仮定を置く必要がある。

  • SUTVA(安定的個体処置価値仮定):ある個体への処置が、他の個体の結果に影響しない(干渉がない)こと、また同じ「処置あり」でもやり方がぶれないこと。
  • 無視可能性:属性 $X$ を条件づければ、処置の割り当て $W$ は潜在的結果 $Y(1), Y(0)$ と独立であること。

$$
\left(Y(1),Y(0)\right) \perp W \mid X
$$

ランダム化比較試験ではこれは自動的に満たされるが、観測データでは「交絡因子をすべて $X$ に含められているか」という強い前提になる。

  • 共通サポート:どんな属性 $x$ の人にも、処置を受ける確率と受けない確率がともに0より大きいこと。

$$
0 < P(W=1 \mid X=x) < 1
$$

この確率 $e(x)$ は傾向スコア(propensity score)と呼ばれ、観測データから処置効果を推定する多くの手法で重要な役割を果たす量である。

まとめ

  • ITE:個人ごとの処置効果。定義できるが直接は観測できない。
  • CATE:属性 $X$ で条件づけた平均処置効果。「誰に効果があるか」を捉えたいときの中心的な量。
  • ATE:集団全体での平均処置効果。RCTがあれば単純な群間比較で推定できる。
  • ATT:実際に処置を受けた人たちに限定した平均処置効果。
  • これらを観測データから推定するには、無視可能性や共通サポートといった仮定が必要であり、それが崩れている場合への対処として傾向スコアやメタ学習器が使われる。
CTA
  • URLをコピーしました!
  • URLをコピーしました!
この記事を書いた人
目次