IN PEOPLE SYSTEMS · ISSUE 435

(仮ビジュアル)縦に3分割された写真。左は乱れた寝具のベッド、中央は窓の外へ目を向ける女性、右は玄関の床に脱ぎ置かれたコートと鍵● 12 SEC
Visual: ALIFE Editorial

「評価が曖昧だ」と言われると、求める行動を書き出して一覧にすれば、誰が見ても同じ評価になるはずだ、と考えたくなります。けれど「基準を書けば明確になる」という前提そのものが、読めた範囲ではまだ決着していない論争の途中にあります。

この号は、基準の書き方の手本を出しません。出すのは、書いた基準が本当に効くのかを確かめた研究が、どこまで言えて、どこで止まっているかです。全文まで読めたのは6点のうち2点。読めていないものについては書きません。

コンピテンシーとは、仕事で成果を出す行動の特性のこと。予測妥当性とは、その基準が将来の成果をどれだけ言い当てられるかの度合いです。つまり基準が明確であるとは、読みやすいことではなく、測ったものが成果とつながっていることを指します。ここを取り違えると、きれいに整った一覧を「明確な基準」と呼んでしまいます。

(仮ビジュアル)暗い室内の黒い壁ぎわに立ち、窓ガラスに自分の後ろ姿が映りこんでいる、黒いニットの女性
明確とは読みやすさではなく、測ったものが成果とつながっていること。 Visual: ALIFE

この考えの起点は1973年、ある心理学の学術誌の巻頭論説にあります。知能や適性の検査ではなく、仕事で成果を生む「できること」を直接測れ——原文は “The best testing is criterion sampling.”(いちばんよい検査は、基準となる行動そのものを取ってくることだ)。ただし同じ論説には、基準に寄せすぎると検査がその基準に特化しすぎる危険がある、と著者自身の但し書きも付いています。

01起点の主張は、18年後に洗い直された。1973年の主張は5つの論点にまとめられます。成績は職業上の成功を予測しない、検査も予測しない、予測は社会的地位の反映にすぎない、検査は少数派に不公平、そしてコンピテンシーのほうがよく予測する。1991年、同じ学術誌がこれを文献で洗い直した結論が “only limited support for these claims”(これらの主張に限られた支持しか)でした。新しい実験ではなく、文献の再検討です。

02妥当性は、上司の評定に対して0.20〜0.44。汎用の8領域の枠組みについて、妥当性研究29本・のべ4,861人を統合した報告があります。性格と能力の検査を合わせたときの運用上の妥当性係数(補正をかけた相関。0なら関連なし、1に近いほどよく言い当てる)は、8領域それぞれで0.20〜0.44。予測側と基準側をそれぞれ束ねた推定は0.53。ただし物差しは直属の上司による評定で、売上や離職ではありません。

0320の実務は、3つの領域に分かれていた。設計の実務をまとめた論文は、20のベストプラクティスを3領域——情報を分析する、整理して示す、使う——に分けて並べました。効果を測った研究ではなく、応用・学術・専門職の経験から整理された指針です。書くことは工程の入口で、残りは分析と運用の側にあります。順位はついていません。

(仮ビジュアル)ベージュの空間で、黒い石の細長い天板を、灰青のガラス・銀の金属・赤い漆の3本の脚が支えているコンソールテーブル
起点への再検討、上司の評定を物差しにした妥当性、20の実務の構成。まず読めたのは、この3つ。 Visual: ALIFE

自分の基準づくりが、いまどこで止まっているのか。手がかりは、言葉の選び方よりも、どこを探しているかのほうに出ます。

01「読みやすくなった」で、話が終わっている。一覧が整った時点で、作業が完了したように見えるとき。読めた範囲で確かめられていたのは、妥当性を言うには成果という外の物差しと突き合わせる作業が要る、という側でした。

02ばらつきの原因を、書きぶりの側だけで探している。言葉が足りないから揃わないのだ、と考えているとき。評点を要素に分けた報告では、評定者ひとりひとりの癖が最も大きな成分でした。書きぶりの外側にも、探す場所があります。

03言い換えがすぐ出る言葉ばかり並べている。「主体性」「協調性」のように、具体的な行動に降ろそうとすると詰まる言葉があります。どの語で詰まるかを数えるのが、この号の実践です。詰まりの記録は、評価の正しさを判定するものではありません。

(仮ビジュアル)縦に3分割された写真。左は乱れた寝具のベッド、中央は窓の外へ目を向ける女性、右は玄関の床に脱ぎ置かれたコートと鍵
止まっているサインは、言葉の選び方より、どこを探しているかに出る。 Visual: ALIFE

評点のばらつきを要素に分けた報告があります。育成目的の多面評定を受けた管理職n=2,350とn=2,142の2組で、1人につき7人(上司2・同僚2・部下2・本人)が3つの次元を評定しました。評定者ひとりひとりの癖が占めたのは62%と53%——どちらも評点のばらつきの半分超です。被評定者の出来ばえ(全般と次元の合計)は21%と25%、測定誤差は11%と18%でした。

ただし、これは様式を比べた研究ではありません。行動で目盛りを定めた尺度を磨けば揃うのか、という問いを最初に総括したのは1980年の総説ですが、この号はその中身に届いていません。だから「様式を磨いても無駄だ」とは書きません。読めた範囲で言えるのは、同じ人を見た評点のばらつきの半分以上が、見る側に由来していたという、ひとつの分解結果までです。

号令は、深く影響した。
裏づけは、限られたままだった。

これは、基準を書く人を責める話ではありません。努力の向かう先が言葉の精密化に寄りやすい、という構造の話です。冒頭で「まだ決着していない」と書いたのは、1991年の再検討そのものが “What is not yet determined is whether competency testing has the potential to make a unique contribution”(独自の貢献をなしうるかは、まだ決まっていない)と結んでいるからです。言葉を足す作業は机の上で終わりますが、同じ場面を見て「これは主体性に当たるか」を突き合わせる作業は、そこには含まれていません——というのが、この号の読み筋です。

TRY IT TODAY

  1. 01LIST

    自分が人を評価するときに使う言葉を、思いつくまま書き出す。

  2. 02REPHRASE

    各語について「どんな行動を見てそう言ったのか」を、一つの場面に書き換える。

  3. 03COUNT

    すぐ言い換えられた語の数と、詰まった語の数だけを数えて書き添える。

10分。誰かを評価し直したり、本人に確かめたりする必要はありません。これは研究結果そのものではなく、自分の使う言葉を記録してみるためにALIFEが提案する入口です。人事・労務の取り扱いや制度の判断は、社会保険労務士・弁護士といった専門家の領分です。

「知能ではなく能力を測れ」という号令は、分野にも一般の見方にも深く影響した——と書いたのは、18年後にそれを洗い直した側でした。見つかったのは限られた支持で、論争はそこで閉じていません。妥当性を言うには成果という外の物差しが要り、評点のばらつきの半分以上は見る側に由来していた。読めた範囲で確かめられたのは、その3つです。きれいに書けたかどうかは、そのどれも決めていません。

SECOND LAYER · FULL SYLLABUS評価基準を明確にするには?を、もっと深く学ぶ。→

Next in people systems

VIEW ALL
ISSUE 434上を見せると増え、横を見せると減った。ISSUE 436甘さは減り、真ん中が増えた。
ALIFE · ISSUE 435

本コンテンツは学習目的であり、診断や治療の代替ではありません。