機械学習のFairness: Group Robustnessとの違いと評価指標
2026年10月の再サーベイ: 研究史・重要文献・最近の進展を整理した新版を追加しました(2026年10月3日基準)。以下は従来のメモです。定義・適用条件の訂正は新版を参照してください。
TLDR
Fairnessは単なるdistribution shiftの部分集合ではありません。group別の性能差を測る数理は subpopulation shiftやworst-group robustnessと共有できますが、何を「公平」とするかは、対象となる 人々、配分される利益・負担、社会的・法的文脈を含む規範的な選択です。動物画像のbackground correlationはgroup robustnessの有用なbenchmarkですが、それだけで社会的fairness問題にはなりません。
FairnessとGroup Robustnessを分ける
random variablesを、sensitive/group attribute $A$、true outcome $Y$、prediction $\hat Y$ とします。 代表的な統計条件には次があります。
| 条件 | 数式 | 何を揃えるか |
|---|---|---|
| demographic parity | $\hat Y\perp A$ | prediction rate |
| equalized odds | $\hat Y\perp A\mid Y$ | 各true labelでTPR/FPR |
| equal opportunity | $P(\hat Y=1\mid A,Y=1)$ がgroup間で等しい | TPR |
| sufficiency | $Y\perp A\mid R$ | 同じscoreでのoutcome分布をgroup間で揃える |
| group calibration(二値$Y$、確率score) | $\mathbb E[Y\mid R=r,A=a]=r$ | 各groupでscoreをoutcome確率として校正する |
ここでsufficiencyはgroup間の条件付き分布の一致であり、それだけではscore値 $r$ が実際の確率に 等しいとは要求しません。group calibrationはさらに $R$ を確率予測として解釈する条件です。
Hardt, Price & Srebro (NeurIPS 2016) はequalized odds / opportunityを定式化しています。ただし、複数の望ましい条件はbase rateが異なる 一般の設定で同時に満たせない場合があります。metricの選択自体が文脈依存です。
group robustnessは、事前定義したgroups $g\in\mathcal G$ のworst risk
\[\min_f\max_{g\in\mathcal G}R_g(f), \qquad R_g(f)=\mathbb E[\ell(f(X),Y)\mid G=g]\]を小さくする問題として書けます。Sagawa et al.は overparameterized networkでnaive group DROだけではworst-group generalizationが改善しない場合があり、 regularizationやearly stoppingが重要だと報告しました。これは定義済みgroup上のrobustness結果であり、 fairness全体を解決するものではありません。
評価チェックリスト
- groupを誰が、何の目的で定義したか。intersectional groupを落としていないか。
- average accuracyとgroup別sample数、error、confidence intervalを併記したか。
- false positiveとfalse negativeが人へ与える影響を区別したか。
- dataset上のmetricだけでなく、deployment processとhuman decisionを評価したか。
- mitigationが別groupや別metricへ害を移していないか。
NIST SP 1270 もfairnessを動的・社会的・application-specificな課題として扱い、社会技術的な評価を求めています。
Introduction
機械学習の世界では、まだ見たことのないデータに対してもうまく汎化できるモデルを構築するという課題に常に取り組んでいます。分布シフト、つまりモデルが現実世界で遭遇するデータが学習データと異なる場合、一般的な障害となります。しかし、時には分布シフトがもう一つの重要な懸念事項、つまり公平性と絡み合ってきます。この関係性を、Waterbirds dataset の事例を使って以下に説明する。
The Waterbirds Conundrum
Waterbirds dataset は、画像分類、特に水鳥と陸鳥を区別するために設計されています。 このデータセットには潜在的なバイアスがあります。水鳥の画像には「水」の背景が頻繁に写っており、一方、陸鳥の画像には「陸」の背景がよく見られる。 この強い相関関係は、鳥そのものに固有のものではなく、むしろ画像の収集方法による人工的なものである。
Waterbirdsで測っているもの: Group Robustness
一見すると、これは単純な分布シフトのケースのように思えるかもしれません。 もしモデルがこれらの背景バイアスのある画像で学習され、 その後、陸にいる水鳥(または水辺にいる陸鳥)に遭遇した場合、誤分類する可能性があります。 このbenchmarkで直接測っているのは何か?
背景バイアスは、データ内に暗黙のグループを作ります。 次のシナリオを考える。
- グループ 1:水辺の背景を持つ水鳥: モデルはこれらの画像に対して高い性能を発揮。
- グループ 2:陸の背景を持つ水鳥: モデルの性能は大きく劣化。
- グループ 3:陸の背景を持つ陸鳥: モデルはここでも高い性能を発揮。
- グループ 4:水辺の背景を持つ陸鳥: モデルの性能は大きく劣化。
重要なのは、これらのグループ間の性能格差です。 モデルは一様に失敗しているのではなく、鳥の種類と背景の特定の組み合わせに対してより頻繁に失敗しているのです。 この不均一な性能は、spurious correlationとworst-group generalizationを研究する動機になります。 ただし鳥と背景のgroupは、社会的に保護される人間集団や権利・資源配分を自動的には表しません。 Waterbirdsをfairnessの数理的toy modelとして流用する場合も、この違いを明記します。
Distribution Shift・Group Robustness・Fairnessの違い
Fairness は通常の分布シフトの問題と何が違うのでしょうか? 両者は失敗原因だけで機械的に分けられません。distribution shiftは訓練時と運用時の分布差を表す 統計的な記述であり、fairnessは、誰がどの利益・負担を受けるかという規範的・制度的な問いを含みます。 shiftがなくても歴史的なラベルや意思決定過程に不公平があり得ますし、一般的なshiftが既存の 社会集団へ不均衡な影響を与えることもあります。
-
分布シフト(一般的): 夏の風景で学習されたモデルは、視覚的な特徴が異なるため、冬の風景に対して性能が低下する可能性があります。 これはshiftの例ですが、影響を受ける利用者や用途との対応を調べるまではfairness上の含意を判断できません。
-
group robustnessに関連する分布シフト(Waterbirds のような): モデルの失敗は、単に背景が異なるというだけではありません。 モデルがshortcut feature、つまり背景と鳥の種類の間のスプリアスな相関関係を学習していることが原因。 このshortcut featureは、この相関関係によって定義される特定のサブグループに対して、より低い性能になる。
When Distribution Shift Isn’t a Fairness Problem: Some Examples
分布シフトが必ずしも公平性の懸念を引き起こさない例を以下に示す。
-
季節による画像認識の変動: 昼間の画像で学習されたモデルは、夜間の画像で劣化。 これは照明の変化による分布シフトであり、「夜間の物体」に対する不公平な扱いとは必ずしも言えません。
-
カメラ品質の違いによる物体検出: 高解像度画像で学習されたモデルは、低解像度画像では性能が低下します。 これは画像品質による分布シフトであり、ぼやけた物体に対する不公平さではありません。
これらは社会集団との対応がない限り、通常はrobustness問題として分析できます。ただし夜間撮影や 低品質カメラが、地域・所得・アクセシビリティなどと相関する運用環境では、同じ技術的劣化が 特定の人々へ不均衡な不利益を与え得ます。入力変化の種類だけでfairness問題ではないと断定しません。
社会的Fairnessにつながる例
次の三つは関連しますが、同じ概念ではありません。性能格差は統計的な 観測結果、代表不足はその候補原因の一つ、fairness上の問題はその格差が人々の権利・ 機会・負担にどう結びつくかという評価です。分布シフトの有無だけからは決まりません。
-
グループ間の性能格差の増幅: 平均性能が似ていても、group別のerror率やworst-group性能は異なり得ます。 その格差は分布シフトがない評価でも、シフト後にも生じ得ます。 spurious correlationは候補機構の一つですが、格差の観測だけで原因と断定はできません。
-
少数派グループへの影響: 学習・評価データで少数のgroupは推定誤差が大きくなりやすく、代表不足や ラベル品質の差が性能差に関与する場合があります。一方、「少数であること」だけが 原因とは限らないため、sample数、data collection、labeling、modelの失敗パターンを分けて調べます。
-
倫理的・社会的な影響: worst case の性能悪化が特定の社会的属性(人種、性別、性的指向など)を持つグループに集中する場合、それは差別や不利益といった深刻な倫理的・社会的な問題につながる可能性。 例えば、顔認識システムにおいて、特定の肌の色のグループに対して worst case の認識精度が低い場合、そのグループの人々が不当な扱いを受けるリスクが高まります。
具体例
-
顔認識システム: 学習データにおいて、特定の肌の色のグループのデータが少ない場合、そのグループの認識精度が低くなる(少数派グループへの影響)。 これが、他の肌の色を持つグループとの性能格差を増幅させる(グループ間の性能格差の増幅)。
-
融資審査モデル: 過去のデータにおいて、特定の地域に住む人々の返済能力が低く評価されていた場合、その地域に住む人々に対して融資が通りにくくなる(少数派グループへの影響)。 これが、他の地域に住む人々との融資成功率の格差を増幅させる(グループ間の性能格差の増幅)。
Other Materials
Computer Vision
