IN PEOPLE SYSTEMS · ISSUE 437
● 12 SEC評価者訓練——評価する人に、何を・どう見るかを教える研修です。訓練すれば、目は揃う。評価のまわりで、いちばん期待を集める言い方かもしれません。
この号が読むのは、1978年の研究で訓練を受けた群と受けなかった群に差が出たのが最初の測定期だけだったこと。そして2017年の別の研究が、2週間後にも正の効果があったと報告していることです。研修を入れれば評価が公正になる、という話は書きません。
評価者訓練(rater training)とは、評価する人に、何を見て、どの行動にどの評点をつけるかを教える研修のことです。なかでも名前が出てくるのがFOR訓練(frame-of-reference訓練=「この行動なら、この評点」という共通のものさしを、あらかじめ頭に入れる訓練)。1994年に出た定量レビュー(複数の研究を数量的にまとめるメタ分析)は、この領域を、訓練の4つの型と、ハロー・寛大化・評価の正確さ・観察の正確さという4つの測り方に整理しました。効果の大きさを表す数値は、読めた抄録に印字がありません。

読めた抄録の範囲では、話は三つに分かれます。正確さが高まるという向き。「限定的」と言われるときの、限定の中身。そして、効果がどれだけもつか。三つめだけは、研究によって報告が違っていました。
01更新されたメタ分析は、正確さが高まると報告した。2011年に出たFOR訓練の更新メタ分析は、“frame-of-reference (FOR) training is an effective method of improving rating accuracy”(FOR訓練は、評価の正確さを高める有効な方法である)と書いています。この更新は1994年のレビューの4倍を超える研究を含むとも述べていますが、研究数の内訳と効果の大きさの数値は、読めた抄録に印字がありません。1994年のレビューとは著者が重なり、あとのほうが前のほうを含む入れ子なので、別々の証拠には数えていません。
02「限定的」とは、小ささではなく測り方の違いだった。同じ2011年の更新メタ分析は、“not all operationalizations of accuracy are equally improved by FOR training”(正確さをどう定義して測るかによって、FOR訓練による改善の幅は同じではない)と続けます。改善がいちばん大きかったのは、評価される人どうしの違いを見分けられているかを測る指標と、行動をそのとおりに捉えられているかを測る指標だ、とも書かれています。効果が小さいという意味ではなく、どの測り方で見るかで答えが変わるという意味です。
03差が出たのは、最初の測定期だけだった。1978年の研究は、学部生80名(20名ずつ4群)が担当教員を、1〜3回の評価期にわたって評価したものです。手厚い訓練を受けた群の評点の質がいちばん良く、2つの訓練群はどちらも、最初の測定期では対照群より良かった。ただし “No differences were found between any groups in later comparisons.”(その後の比較では、どの群のあいだにも差は見つからなかった)と書かれています。職場の上司と部下の評価ではありません。

自分がいま、どちら側にいるのか。手がかりは、研修の中身より、そのあとの時間のほうに出ます。三つとも、制度の大きさではなく、手元の評点の話です。
01研修を受けたのがいつだったかを、思い出せない。1978年の研究で、訓練群と対照群の差が見えたのは最初の測定期でした。その後の比較では、どの群のあいだにも差は見つかっていません。学部生が担当教員を評価した研究なので、職場の評価にそのまま移せる結果ではありませんが、受けた時期を思い出せないという事実のほうは、手元で確かめられます。
02効いたかどうかを、一致率だけで見ている。2011年の更新メタ分析が報告したのは、正確さをどう定義して測るかによって、改善の幅が違うということでした。他人と評点が揃ったかどうかは、そのうちの一つの見方にすぎません。どの測り方を選ぶかで、効いたという答えにも、変わらなかったという答えにもなります。
03もう薄れているはずだ、と決めている。2017年の研究は、候補者を多面的に見る場(アセスメントセンター)の評価者訓練を、訓練の直後と、2週間その訓練を使わない期間を置いたあとの2回で測りました。報告されたのは、2週間後にも正の効果があったということです。薄れる側の報告だけを持って、いつでも薄れると決めることはできません。

「訓練の効果は薄れる」という言い方の出どころは、1978年の研究です。原著はこれを “the diminishing effect of rater training over rating periods”(評価期を重ねるにつれて、訓練の効果が薄れていくこと)として論じました。対象は学部生80名が担当教員を評価したもので、期間も1〜3回の評価期。職場の評価者訓練の持ちを測ったものではありません。
2017年の研究は、別の設定です。“FOR training also had positive effects on ratings and performance schema accuracy assessed two weeks after training.”(FOR訓練は、訓練の2週間後に測った評点と枠組みの正確さにも、正の効果を持っていた)。ただし2つの時点のあいだで効果の大きさが縮んだかどうかは、本文まで読めていないので分かりません。1978年と2017年は、別の研究・別の場面・別の期間です。ひとつの「持ち」の話には束ねられません。
1978年の研究で差が出たのは、
最初の測定期だけだった。
正確さが高まるという向きのほうは、複数の研究が同じ方向を向いていました。2009年の研究は、訓練を受けた評価者が手本に近いものさしを持つようになり、そのものさしの正確さが評点の正確さと結びついている、という仮説が支持されたと報告しています。2017年の研究は、同じ2人がこの2009年の研究を引き継いで広げたもので、別々の証拠には数えていません。
ばらつきの主な源は評価者の側に根ざす、という見方の由緒として1980年の総説が置かれますが、この号が到達したのは書誌の情報まで。中身も数値も引いていません。読めたのは6点のうち5点が公式の抄録までで、読めていないものについては書きません。
TRY IT TODAY
- 01LIST
自分が過去につけた評点や、人について書いたメモを、手元の記録から数件並べる。
- 02PAIR
似た行動・似た成果どうしを組にして、つけた評点や使った言葉が同じかどうかを見る。
- 03RECORD
日付・見返した件数・ずれていた組の数を書く。良し悪しの判定はしない。
効くか効かないか、ではありませんでした。読めた範囲にあったのは、正確さが高まるという向きと、測り方によって幅が違うという但し書きと、持ちについての食い違う二つの報告です。だとすれば、他人と揃っているかを気にする前に、自分の評点が時間の中で一定かどうかを手元で見ておく——というのが、この号の読み筋です。ここで言えるのはそこまでで、効果が確かめられた手順ではありません。
SECOND LAYER · FULL SYLLABUS「評価者の目を鍛えるには?」を、もっと深く学ぶ。→HOW TO READ THE NUMBERS数字の読み方+
この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。
- メタ分析
- 同じテーマの研究をたくさん集めて統合し、平均的な効き目を推定する方法。1本の研究より安定しますが、集めた研究の質と偏りに左右されます。

