機械学習のFairness: Group Robustnessとの違いと評価指標

2026年10月の再サーベイ: 研究史・重要文献・最近の進展を整理した新版を追加しました(2026年10月3日基準)。以下は従来のメモです。定義・適用条件の訂正は新版を参照してください。

TLDR

Fairnessは単なるdistribution shiftの部分集合ではありません。group別の性能差を測る数理は subpopulation shiftやworst-group robustnessと共有できますが、何を「公平」とするかは、対象となる 人々、配分される利益・負担、社会的・法的文脈を含む規範的な選択です。動物画像のbackground correlationはgroup robustnessの有用なbenchmarkですが、それだけで社会的fairness問題にはなりません。

FairnessとGroup Robustnessを分ける

random variablesを、sensitive/group attribute $A$、true outcome $Y$、prediction $\hat Y$ とします。 代表的な統計条件には次があります。

条件 数式 何を揃えるか
demographic parity $\hat Y\perp A$ prediction rate
equalized odds $\hat Y\perp A\mid Y$ 各true labelでTPR/FPR
equal opportunity $P(\hat Y=1\mid A,Y=1)$ がgroup間で等しい TPR
sufficiency $Y\perp A\mid R$ 同じscoreでのoutcome分布をgroup間で揃える
group calibration(二値$Y$、確率score) $\mathbb E[Y\mid R=r,A=a]=r$ 各groupでscoreをoutcome確率として校正する

ここでsufficiencyはgroup間の条件付き分布の一致であり、それだけではscore値 $r$ が実際の確率に 等しいとは要求しません。group calibrationはさらに $R$ を確率予測として解釈する条件です。

Hardt, Price & Srebro (NeurIPS 2016) はequalized odds / opportunityを定式化しています。ただし、複数の望ましい条件はbase rateが異なる 一般の設定で同時に満たせない場合があります。metricの選択自体が文脈依存です。

group robustnessは、事前定義したgroups $g\in\mathcal G$ のworst risk

\[\min_f\max_{g\in\mathcal G}R_g(f), \qquad R_g(f)=\mathbb E[\ell(f(X),Y)\mid G=g]\]

を小さくする問題として書けます。Sagawa et al.は overparameterized networkでnaive group DROだけではworst-group generalizationが改善しない場合があり、 regularizationやearly stoppingが重要だと報告しました。これは定義済みgroup上のrobustness結果であり、 fairness全体を解決するものではありません。

評価チェックリスト

  1. groupを誰が、何の目的で定義したか。intersectional groupを落としていないか。
  2. average accuracyとgroup別sample数、error、confidence intervalを併記したか。
  3. false positiveとfalse negativeが人へ与える影響を区別したか。
  4. dataset上のmetricだけでなく、deployment processとhuman decisionを評価したか。
  5. mitigationが別groupや別metricへ害を移していないか。

NIST SP 1270 もfairnessを動的・社会的・application-specificな課題として扱い、社会技術的な評価を求めています。

Introduction

機械学習の世界では、まだ見たことのないデータに対してもうまく汎化できるモデルを構築するという課題に常に取り組んでいます。分布シフト、つまりモデルが現実世界で遭遇するデータが学習データと異なる場合、一般的な障害となります。しかし、時には分布シフトがもう一つの重要な懸念事項、つまり公平性と絡み合ってきます。この関係性を、Waterbirds dataset の事例を使って以下に説明する。

The Waterbirds Conundrum

Waterbirds dataset は、画像分類、特に水鳥と陸鳥を区別するために設計されています。 このデータセットには潜在的なバイアスがあります。水鳥の画像には「水」の背景が頻繁に写っており、一方、陸鳥の画像には「陸」の背景がよく見られる。 この強い相関関係は、鳥そのものに固有のものではなく、むしろ画像の収集方法による人工的なものである。

Waterbirdsで測っているもの: Group Robustness

一見すると、これは単純な分布シフトのケースのように思えるかもしれません。 もしモデルがこれらの背景バイアスのある画像で学習され、 その後、陸にいる水鳥(または水辺にいる陸鳥)に遭遇した場合、誤分類する可能性があります。 このbenchmarkで直接測っているのは何か?

背景バイアスは、データ内に暗黙のグループを作ります。 次のシナリオを考える。

重要なのは、これらのグループ間の性能格差です。 モデルは一様に失敗しているのではなく、鳥の種類と背景の特定の組み合わせに対してより頻繁に失敗しているのです。 この不均一な性能は、spurious correlationとworst-group generalizationを研究する動機になります。 ただし鳥と背景のgroupは、社会的に保護される人間集団や権利・資源配分を自動的には表しません。 Waterbirdsをfairnessの数理的toy modelとして流用する場合も、この違いを明記します。

Distribution Shift・Group Robustness・Fairnessの違い

Fairness は通常の分布シフトの問題と何が違うのでしょうか? 両者は失敗原因だけで機械的に分けられません。distribution shiftは訓練時と運用時の分布差を表す 統計的な記述であり、fairnessは、誰がどの利益・負担を受けるかという規範的・制度的な問いを含みます。 shiftがなくても歴史的なラベルや意思決定過程に不公平があり得ますし、一般的なshiftが既存の 社会集団へ不均衡な影響を与えることもあります。

When Distribution Shift Isn’t a Fairness Problem: Some Examples

分布シフトが必ずしも公平性の懸念を引き起こさない例を以下に示す。

これらは社会集団との対応がない限り、通常はrobustness問題として分析できます。ただし夜間撮影や 低品質カメラが、地域・所得・アクセシビリティなどと相関する運用環境では、同じ技術的劣化が 特定の人々へ不均衡な不利益を与え得ます。入力変化の種類だけでfairness問題ではないと断定しません。

社会的Fairnessにつながる例

次の三つは関連しますが、同じ概念ではありません。性能格差は統計的な 観測結果、代表不足はその候補原因の一つ、fairness上の問題はその格差が人々の権利・ 機会・負担にどう結びつくかという評価です。分布シフトの有無だけからは決まりません。

具体例

Other Materials

Computer Vision

Screenshot 2022-07-03 at 11 01 42 PM Screenshot 2022-07-03 at 11 01 53 PM Screenshot 2022-07-03 at 11 01 02 PM

Reference