IN LEARNING & GROWTH · ISSUE 205

(仮ビジュアル)暗い背景の石の台に、白い発酵乳の瓶と、切り漬けを詰めた低いグラスと、琥珀色の発酵茶が入った細長い容器が、三つ横に並んでいる静物写真● 12 SEC
Visual: ALIFE Editorial

「チームは個の総和を超える」は比較の文です。超えられた側の数字が、どこかに要ります。2021年の実験は、その相手を4本立てました——名目集団〔同じ人数が、ばらばらに働いた場合〕の無作為の一人・最も高い点の一人・最も速い一人・最も効率のよい一人。「一人でやった場合」の一人が、四人いる。

この分野は2本の線を引いてきました。逐語は"interacting groups often outperform the average member of a nominal group (weak synergy), they rarely outperform the best member (strong synergy)"(平均的な一人を上回ることは多いが〈弱い相乗〉、最も良かった一人を上回ることはまれ〈強い相乗〉)。

結果は、どの一人を相手にするかで割れました。得点では無作為の一人・最も速い一人・最も効率のよい一人を上回り(P = 0.013 / 2つともP < 0.001)、最も高い点の一人には、どの複雑さでも届きませんでした(P = 0.047、95%信頼区間 −0.159 から −0.001)。速さと効率は複雑さで動き、単純な課題では効率がかなり低く、最も複雑なところで四人すべてを上回ります。

事前登録された2段階の実験です。第1段階は1,200人が一人で解き、第2段階は同じ1,200人のうち条件を満たした先着828人が、区画のなかで無作為に2条件へ——話し合う集団591人(3人組197組・有効196組)と、一人で解く237人(有効234人)。10分で打ち切りです。

いっぽう、集団の成績そのものを1つの量として測ろうとしたのが「集合知」です。出発点の2010年の研究では、699人が2人から5人の集団で働き、広範な課題の成績を説明する一般的な因子(c)が見いだされました。

原典は第1因子〔複数の課題に共通して効く1本の軸。説明できた散らばりを%で書く〕を研究1で43%以上・研究2で44%とします。ただし同じ論文に、抽出後の値があります。——"a first factor explaining 31% of the variance in Study 1 and 35% of the variance in Study 2"(研究1で31%、研究2で35%を説明する第1因子)。43%/44%は初期固有値、抽出後は31%/35%です。

(仮ビジュアル)ベージュの空間で、黒い石の細長い天板を、灰青のガラス・銀の金属・赤い漆という3本の異なる脚がそれぞれ支えているコンソールテーブル
同じ人数の個人をばらばらに働かせた名目集団に、無作為の一人・最も速い一人・最も効率のよい一人・最も高い点の一人。比べる一人は、四人いた。 Visual: ALIFE

では、この語のもとで何が測られ、何が測り直されてきたのか。まず測られたのは、この3本です。

012010年、699人。軸は出た。ただし個人の知能との相関は、2つの研究を合わせた値。個人を無作為に集団へ割り付けた研究です。研究1は3人集団40組・最大5時間、研究2は2〜5人の152組。研究1単独では平均知能・最高知能とcの相関は有意でなく(r = 0.19 / 0.27、ns)、2研究を合わせるとr = 0.15(P = 0.04)・0.19(P = 0.008)で、原典はこれを中程度と書きます。結びついた3つも条件つき——気持ちを読む課題0.26、発言のばらつき−0.41(バッジを着けた一部の集団のみ)、女性比率0.23。回帰に同時に入れて有意に達したのは社会的感受性だけ(b = 0.33、P = 0.05)。

022017年、312人を測り直すと差の8割は個人のIQ。同じ年の再解析は「根拠が不十分」。同じ設計で3研究——英国の学生72人、インドのチェンナイ120人、英国エディンバラ120人(計312人)。一般因子そのものは3研究すべてで検出。抄録は312人でおよそ80%と書きますが、81%の回帰は研究2と3を合わせた240人・80組のもので、構造方程式モデルでは潜在因子の100%。女性比率と発言の交代の2仮説は支持されていません。同じ年の再解析は既発表6標本を読み直し、締めは"insufficient support for the existence of a collective intelligence construct"(集合知という構成概念を支える根拠は不十分だと示唆する)。

032021年、22件5,279人を統合すると因子は残った。ただし平均分散抽出は44%から19.6%へ訂正。提唱した側による22標本の二次解析(5,279人・1,356集団・2人から7人)。そこに2022年5月3日付の訂正が付きます——ソフトウェアの誤りで、平均分散抽出〔軸が各課題の散らばりを平均でどれだけ説明したか〕は44%ではなく19.6%。著者らは主要な結論は変わらないと付記。課題で比重が逆転するとも報告します(数独は個人の技能51%超、単語の並べ替えは集団の過程55%)。2014年の研究はボストン一帯の272人・68組を対面32組とオンライン36組へ無作為に割り付け、第1因子は49%と41%。女性比率はオンライン.41(p = .01)、対面は.20で有意ではありません。

(仮ビジュアル)暗い背景の石の台に、白い発酵乳の瓶と、切り漬けを詰めた低いグラスと、琥珀色の発酵茶が入った細長い容器が、三つ横に並んでいる静物写真
699人の2つの研究・312人の3つの研究と既発表6標本の再解析・22件5,279人の統合と272人のオンライン。まず測られたのは、この3本。 Visual: ALIFE

数字そのものは動きません。動くのは、要約されていく途中のほうです。

01「集合知の存在は確かめられた」と読む。軸の大きさの印字は四つ——2010年の43%以上と44%、主軸抽出後の31%と35%、2021年の統合の44%、その訂正の19.6%。ただし「根拠が不十分」と書いた再解析はあっても、因子そのものが出なくなったわけではありません。44%が19.6%になったのもソフトウェアの誤りの訂正です。書けるのは「存在しない」ではなく、同じ設計で測り直すと残るものが変わった、まで。

02「賢い人を集めればいい」とも「個人の知能は関係ない」とも読める。この論争は、両方向に読み間違えられます。2010年の原典は、cが個人知能と強くは相関していないと書きましたが、無関係とは書いていません。基準課題の予測ではcの係数0.51(P=0.001)、研究2では0.36(P=0.0001)で、個人知能の係数はどちらも有意ではありません。もう片方。2017年の追試は分散の81%を個人のIQで説明し、"Smart groups are (simply) groups of smart people"(賢い集団とは、〈単に〉賢い人たちの集団である)と書きました。ただしこれは著者らの結論で、決着ではありません。2021年の統合は協働の過程のほうが重要と報告し、食い違いは課題の選び方で説明できると推測します——推測であって、測定の結果ではありません。

03「チームでやったほうがいい」と読む。2021年の実験は、この一文を得点・速さ・効率の三つに割りました。三つを分けないと「複雑ならチームが全部勝つ」と読めてしまう。落ちやすい層がもう一つ。2017年の追試では、発言時間を均等にする条件と最も点の高い一人に決めさせる条件が40組(対照14・共感14・権威12)へ無作為に割り付けられ、差は検出されませんでした(F(2, 34) = 1.14、p = 0.33)。著者自身が天井効果を理由に重く扱わないと断っています。

(仮ビジュアル)3つの縦長の区画に分かれた写真。左は薄暗い寝室の乱れた寝具(壁に採光)、中央は窓の外を見ている女性の横顔、右は玄関の床に置かれた上着と鍵
確かめられたと読む・賢い人を集めればと読む・チームでやったほうがいいと読む。言い落とすのは、この三か所。 Visual: ALIFE

測られたのは、数時間の課題です。2010年は最大5時間、2014年は90分の1回きり、2021年は10分で打ち切り。集団は2人から7人、実施は対面とオンラインの両方。企業や部署の成績を測ったものは1本もありません。追試の著者自身が——"much smaller than those assembled in human innovations such as companies, cities, nations, and armed forces"(企業、都市、国家、軍隊といった営みよりは、はるかに小さい)。

全文まで読めたのは6点のうち5点。読めていないものについては書きません。読めた範囲に、日本の職場を対象にした記述はありません。無作為な割り付けは4本にありますが、答えているのは条件どうしの差まで。因子と個人の知能・社会的感受性・女性比率の関係は、どれも相関。2010年・2014年・2021年は同じ研究者2人が入る連作。独立した6件ではなく、互いを引き合う1つの論争の系列です。

話し合った集団196組と、一人で解いた234人。
比べる相手は、四人ぶん置かれていた。

次の3手も、研究が命じた順番ではありません。研究が測ったのは、数時間の課題の成績です。判定はしません。良し悪しも付けません。

TRY IT TODAY

  1. 01PICK

    紙かメモアプリに、**直近の話し合いで自分の考えが変わった場面を1つだけ**、1行で書く。仕事でも家族との相談でも。

  2. 02MARK

    その下に2つ書き、**どちらか一方にだけ印を付ける**。(A)知らなかった情報だった。(B)同じことを言う人の数だった。迷うなら「まだ分けていない」と書いて終わり。

  3. 03SORT

    印を付けたら終わりです。**どちらが良い印かの判定はしません。**残すのは、場面の1行・2つの選択肢・印の3つだけ。

3分。採点はありません。**これは、あなたの判断力を測る課題ではありません。**誰かを評価しない。相手に確かめない。会議の進め方に口を出さない。誰にも見せず、提出もしません。つらくなるなら、先に相談先や専門家へ。

確かめられたのは四つ。2021年の実験が集団196組と単独234人を四つの相手と比べ、得点ではどの複雑さでも最も高い点の一人に届かず、最も複雑な課題の効率で初めて四人を上回ったこと。2010年の原典が699人で第1因子を43%以上と44%(抽出後は31%と35%)とし、個人の知能との0.15・0.19は2研究を合わせた値だったこと。

2017年の追試が英国とインドの312人で81%と報告しつつ(240人・80組の回帰)、発言を均等にさせても一人に決めさせても差が出なかったこと。同じ年の再解析が6標本で「根拠は不十分」と書いたこと。2021年の統合が22件で因子は残るとしつつ、平均分散抽出を19.6%へ訂正したこと。「集合知は存在しない」とは書きません。同じ設計で測り直すと、残るものが変わった——ここまでです。記録が1件、残るだけです。

SECOND LAYER · FULL SYLLABUSチーム学習と集合知を、もっと深く学ぶ。→
HOW TO READ THE NUMBERS数字の読み方

この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。

相関係数 r
2つのものが連動する強さ。−1〜+1で、0は関連なし。一般的な目安では ±.10=弱い、±.30=中くらい、±.50=強い関連とされます。関連があっても、原因と結果の関係とは限りません。
95%信頼区間
推定値の「ばらつきを見込んだ幅」。同じ研究を何度もやり直したら、結果の多くがこの幅に収まると期待できます。幅が0(差なし)をまたぐときは、明確な差とは言い切れません。
統計的に有意
「偶然だけでは説明しにくい」という意味の専門用語。効果が大きい・重要だという意味ではありません。ごく小さな差でも、人数が多ければ有意になります。
p値
差がないと仮定したとき、偶然でこの結果以上が出る確率の目安。小さいほど偶然では説明しにくいことを表しますが、効果の大きさは表しません。

Next in learning & growth

VIEW ALL
ISSUE 204船は同じ、帳簿が違った。ISSUE 206索引に、その語は無かった。
ALIFE · ISSUE 205

本コンテンツは学習目的であり、診断や治療の代替ではありません。