IN EMPLOYMENT · ISSUE 090
● 12 SEC何が仕事ぶりと重なるのか。順位表があります。1998年の「85年ぶんの研究知見」の表には、11の手続きと仕事ぶりの相関が並びます(相関——0なら関連なし、1に近いほど強く一緒に動く関連です)。この並びは四半世紀、研修資料に載り続け、2022年に書き換わります。書き換えたのは選考方法ではなく、数字にかける補正の手続きでした。
扱うのは人を見抜くコツではなく、採用で使われる材料が仕事ぶりとどれだけ重なるかという推定値と、それが動いた理由です。ここに出てくる一般知能の検査の係数を、人の頭の良さの順位表として読まないでください。検査の点と評価の点の重なり具合で、人の格付けの精度ではありません。
適合性の統合判断力(Integrative Judgment of Fit)が指すのは、不揃いな材料を一つの判断に畳むところまでです。何を材料にし、どれだけ当てになり、どう合わせるか——厚く測られたのは主に二つめ、つまり手続きの点数とあとから測った仕事ぶりの評価がどれだけ一緒に動くかという妥当性です。以下の .54 や .31 は、すべて補正後の値です。

「一般知能の検査が最強」は、いまも研修資料に生きています。その表が2022年に再推定されました。まず測られたのは、この3つです。
011998年の表が、順位として引かれた。並びはワークサンプル .54、一般知能の検査 .51、構造化面接 .51 を頭に、11の手続き。そのまま順位として引かれ続けました。注意が二つ。誠実性テスト(.41)と誠実性(.31)は別々の行で、前者は正直さや規範からの逸脱を測る検査、後者は性格の特性。そして85年ぶんを集計した表で、個々の研究の結果が一様だったという意味ではありません。
022022年、5つの補正のやり方が問われた。再推定はこう結論します。これまでの5つのやり方には、いずれもしばしば大幅な過補正をもたらす重大な問題があり、多くの選考手続きの妥当性は大幅に過大評価されてきた。上位の顔ぶれはおおむね変わらないが、平均妥当性の推定値は .10 から .20 ポイント下がり、構造化面接が最上位の選考手続きとして浮上した。選ばれて入った人だけを追う研究では得点の散らばりが狭くなる。それを戻すのが範囲制限の補正で、問題は補正の大きさの出どころでした。補正係数はふつう、採用時に検査を受けさせあとから仕事ぶりを測る予測的妥当性の研究から作られます。ところがメタ分析に入る研究の約80%は、すでに働く人に受けさせた同時的妥当性の研究です。前者の補正を後者に当てれば、値は膨らみます。
03下がった9つ、上がった2つ、新しく入った1つ。改訂後の値は、同じ著者らが2023年に再掲した対比表から引きます(2022年の論文本体の表には到達できていません)。下がったのは9つ——構造化面接 .51→.42、職務知識テスト .48→.40、ワークサンプル .54→.33、一般知能の検査 .51→.31、誠実性テスト .41→.31、アセスメントセンター .37→.29、誠実性 .31→.21、非構造化面接 .38→.19、職務経験年数 .18→.07。上がったのは2つ、経験的キー式のバイオデータ .35→.38 と興味 .10→.24。順位そのものが入れ替わりました。加えて2022年に新しく収録された行が1つ。場面を限定して測る「文脈化した誠実性」で、1998年の表にこの行はありません。ρ = 0.25(ρ=測定の誤差や標本の偏りを見込んで推定し直した相関)、研究間のばらつきの標準偏差はほぼゼロ(値の散らばりの目安。この項目の報告です)。下がった行ではなく、新しく入った行です。

ここで止めると、「では構造化面接をやればいい」に着地します。検算しておきます。手がかりは3つ。
01係数を、人の順位だと思っている。.42 と .31 の差は、人の優劣の差ではなく二つの点数の重なり具合の差です。係数が高いほど人を正しく格付けできる、という読み方は定義から出てきません。同じ手続きの同じデータでも、補正の入れ方だけで値は変わります。訊けるのはひとつ、それは補正前と補正後のどちらの値ですか。
02未公刊と撤回を、同じことだと思っている。同じ範囲制限をめぐって、正反対を向いた数字もあります。2016年10月付の「100年ぶんの研究知見」と題した文書は、一般知能の妥当性を .65 としました。理由はやはり範囲制限の補正、ただし向きが逆で、古い手続きが大幅に過小評価していた、と。この .65 は8つのメタ分析的推定の平均です。表紙に「……我々はこの論文の版を後日公刊するつもりである」とあります。撤回されたのではありません。査読誌に載らないまま流通しています。2023年の反論は範囲制限の程度はむしろ過小に見積もられていると論じ、応答は「補正に必要な情報が手に入る場合には補正を支持すると強調している」と返します。どちらが正しいかは、この号では決まりません。
03健康と行動の結果を、採用の話に持ち込んでいる。畳み方そのものを比べた研究もあります。2000年のメタ分析は、人の総合判断(臨床的予測)と決まった式による合算(機械的予測)を突き合わせ、機械的な予測は平均しておよそ10%正確、機械的が臨床的を実質的に上回ったのは検討した研究の33%から47%、臨床的が同程度に正確なことも多いが実質的に上回ったのはごくわずか(6%から16%)と報告しました。ただしこれは人の健康と行動についての予測を集めたメタ分析で、採用に限った研究ではありません。言えるのは、そこまでです。

六つは矛盾していません。1998年の表も、2022年の再推定も、2016年の未公刊の版も、すべて補正後の値。違うのは補正の手続きだけです。動いたのは、選考の中身ではありません。推定は米国と欧州の職場で採られたものが大半で、日本の採用を対象にした査読研究はごく少ない。大半は、すでにその仕事に就く人にあとから測ったものです。もともと選択肢の多い人ほど複数の選考を受け比べられるという逆向きも、排除できません。何を材料にしたかを数えた記録だけが、どこにも無い——というのが、この号の読み筋です。
補正の手続きが違うだけで、
.31 にも .51 にも .65 にもなった。
次の3手も、研究が命じた順番ではありません。材料を先に決めれば判断がよくなる、と確かめた研究は、この号では扱っていません。ここからは、ALIFEが提案する実践の入口です。
TRY IT TODAY
- 01PICK
直近で自分が何かを評価した場面、または評価された場面を1つ思い出す。仕事でなくてよい——習い事の発表でも、家族での相談でも。
- 02LIST
その場面で材料として使われたものを、思い出せるだけ書き出す。書くのは材料の名前だけ(何を見たか、どの記録を見たか)。人物評は書かない。
- 03COUNT
件数を数える。そのうち「見る前から見ると決めていた材料」が何件かを書き添える。残るのは数字が二つ。
確かめられたのは四つ。1998年の11手続きの表が、四半世紀のあいだ順位として引かれてきたこと。2022年の再推定で平均妥当性の推定値が .10 から .20 ポイント下がり、構造化面接が最上位に立ったこと。その理由が、補正係数の出どころと、当てられる先の約80%を占める同時的妥当性の研究とのずれであること。一般知能を .65 とする未公刊のワーキングペーパーが、撤回されないまま流通していること。正しい順位表も、良い判断も、研究は約束していません。——今日残るのは、使った材料の件数と、先に決めていた件数。数字が二つ、増えるだけです。
SECOND LAYER · FULL SYLLABUS適合性の統合判断力を、もっと深く学ぶ。→HOW TO READ THE NUMBERS数字の読み方+
この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。
- メタ分析
- 同じテーマの研究をたくさん集めて統合し、平均的な効き目を推定する方法。1本の研究より安定しますが、集めた研究の質と偏りに左右されます。
- 標準偏差
- ばらつきの大きさを表す値。大きいほど、人によって結果がばらばらだったことを意味します。

