IN DATA · ISSUE 542
● 12 SEC「名前を消したから、もう匿名のデータだ」。顧客名簿やアンケートを扱うとき、そう考えたくなります。この号は、プライバシーを守って活かす話を6点で確かめます。5点は、名前を外したデータと再識別をめぐる研究、1点は日本の個人情報保護委員会の解説頁と、個人情報保護法の条文です。
先に向きを言うと、研究が描いたのは、少数の手がかりで個人が戻りうる姿でした。この号は、どのデータなら渡してよいかを勧めることも、欧米の数字を日本の小さな店に当てはめることも、法律を解釈して適法かを判断することもしません。
ここでの匿名化は、名前や番号など、それだけで人が分かる手がかりを外すことです。再識別は、外した後のデータを外の情報と照らし合わせ、個人に戻すことを指します。2008年の査読つき会議論文は、映画レンタル会社がコンテスト用に公開した約50万人分の匿名の評価データで、8件の評価(うち2件は全く違っていてもよく、日付は14日ずれてもよい)が分かれば、記録の99%が一つに絞れると報告しました。

同じ論文は、映画の口コミサイトの公開の評価と照らし合わせ、評価データの中から何人かの利用者の記録を特定しました。ただしこの照合は約50人の小さな標本で、著者らは “proof of concept”(できることの実証)と位置づけています。では、手がかりは何個あれば足りるのでしょうか。以下の三つは、同じ研究者を共著に含む、データの違う別々の研究です。
01欧州の携帯電話150万人・15か月の記録では、4つの時と場所の点で95%が一人に絞れた。2013年の論文(査読誌)は、欧州の小さな国の約150万人の記録で、居場所が1時間ごと・基地局の範囲の細かさで分かる場合、4つの時と場所の点で95%が一意に定まると報告しました。時間や場所を粗くしても一意さは緩やかにしか下がらず、著者らは粗いデータでも匿名性は小さいと書きます。
02カードの記録110万人・3か月では、4件の取引で90%が絞れ、金額が分かると危険は平均22%上がった。2015年の論文(査読誌)は、ある国の1万店での取引の記録で、店と日の4点から90%が一意に特定できると報告しました。金額の目安が加わると再識別の危険は平均で22%上がり、店・日・金額をどれも粗くしても匿名性はほとんど増えませんでした。女性は男性より、所得の高い人は低い人より特定されやすかったとも書きます。
03米国の人口では、15の属性で99.98%が正しく再識別されると、モデルで推定された。2019年の論文(査読誌)は、一部しか公開されていないデータでも、特定の人が正しく再識別される確からしさを見積もる統計モデルを提案しました。210の集団で予測の当たり方を確かめたうえで、15の人口統計上の属性があれば米国人の99.98%が正しく再識別されると推定しています。実測ではなく、モデル上の値です。

2002年の査読誌の論文は、「k-匿名性」という守りのモデルを提案しました。公開するデータのどの人も、少なくともほかのk-1人と見分けがつかないようにする考え方です。論文は、名前を除いた医療記録が郵便番号・生年月日・性別で有権者名簿と結びつく例から始め、推論の余地をすべて消すことは “typically impossible to guarantee”(たいてい保証できない)と書きます。以下の三つは、この論文と日本の法律が添えている条件です。
01k-匿名性の論文は、モデルに運用の方針を添え、守られなければ破れる攻撃を挙げた。論文は、モデルに導入時の方針を添え、方針が守られなければk-匿名性を満たしていても再識別が成り立つ攻撃を3通り挙げました。行の並び順をそのまま出す、同じ元データから別の版を出す、時期を変えて出し直す、の三つです。アルゴリズムの外にある方針・法律・契約が守りを補いうる、とも論じています。
02個人情報保護法は匿名加工情報を定義し、作った事業者に照合による識別を禁じた。2条6項は、特定の個人を識別できず、元の個人情報に戻せないように加工した情報を匿名加工情報と定めます。43条5項は、それを作って自ら扱う事業者に、本人を識別するために他の情報と照合することを禁じています。委員会の頁は「個人データを単にマスキングしただけで、法令に定める適切な加工を行っていない場合は、匿名加工情報ではなく、個人データです。」と解説します。
03受け取った事業者にも識別を禁じ、委員会がその運用を解説している。45条は、匿名加工情報を受け取って扱う事業者にも、加工の方法に関する情報を得ることや、他の情報と照合することを、本人を識別する目的で禁じています。委員会の頁は、照合が禁じられる「他の情報」に限定はなく、どんな技術や手法で照合するかも問わないと解説しています。

どの研究も、日本の小さな店の顧客名簿やアンケートを調べたものではありません。携帯電話は欧州の小さな国、カードはある国の1万店、人口の推定は米国、映画の評価はコンテスト用の公開データです。数字はそれぞれの標本と細かさの条件つきです。カードの研究の性別や所得の差について、著者らは原因の分析はこの論文の範囲外だと断っています。
法令は、2026年7月17日施行の個人情報保護法で読みました。定義は2条6項、識別行為の禁止は43条5項と45条です。2028年7月16日に46条の2が新たに施行される予定で、まだ効力はありません。条文を定めるのは法律で、委員会は運用を解説する側です。この号は、手元のデータが匿名加工情報に当たるか、適法かを判断しません。研究の5点はすべて全文まで読め、残る1点は公的な頁と条文を読みました。
カードの記録では、
4回の買い物で、
9割が一人に絞れた。
シラバス側の看板は、「少数の手がかりで個人は戻る。匿名化は絶対でなく、加工に契約と管理を重ねる」です。前半は4本の研究が支えます。後半の「加工+契約+管理」という重ね方はALIFEの整理で、その効果を検証した研究は6点にありません。近い論点は、k-匿名性の論文が方針・法律・契約による補いを論じたことです。カードの研究の著者らは、データの大きな可能性を活かすには “the right balance between privacy and utility”(プライバシーと有用性の釣り合い)を見つけることが欠かせないと結んでいます。
TRY IT TODAY
- 01DATE
今日の日付と、自分の商いで「名前を消したから大丈夫」と思って扱っている、または共有しようとしているデータの種類を一つ書く(購買の記録、来店の記録、アンケートなど)。中身や個人の名前は書き写さない。
- 02LOG
そのデータに残っている手がかりの項目を書き出す(日付、時刻、金額、地域、買った品、年代や性別など)。
- 03SORT
項目を「それだけで人が分かりそう」「外の情報と合わせると絞れそう」「どちらとも言えない」の三つに分けて書く。実際に照らし合わせて試すことはしない。良し悪しや適法かは決めない。
この号が運べたのは四段です。映画の評価、携帯電話、カードの記録で、少数の手がかりから記録が一つに絞れたこと。一部しかないデータでも15の属性で再識別されるとモデルが見積もったこと。守りのモデルに運用の方針が添えられていること。日本の法律が、作った側にも受け取った側にも照合による識別を禁じていること。どこまで加工すれば安全かを、この6点は一つの数では示していません。次の号は、現場をデータ好きにする道を確かめます。
SECOND LAYER · FULL SYLLABUS「プライバシーを守って活かすには?」を、もっと深く学ぶ。→