IN DATA · ISSUE 540

(仮ビジュアル)夜の高層階の窓辺に立ち、暗いガラスに自分の姿を映しながら街の明かりのほうを見ている、黒いスーツの女性● 12 SEC
Visual: ALIFE Editorial

「AIにはもう何でも任せられる」「いや、まだ任せられない」。生成AIをめぐる声は両極端になりがちです。この号は、AIに仕事を任せる話を6点で確かめます。4点は人とAIの組み合わせを調べた実験、1点は同じAIサービスの挙動を時期で比べた研究、1点は国のAI事業者ガイドラインです。

先に向きを言うと、どちらの断定も研究の姿とは違いました。AIは効くが課題によって凸凹で、頼りすぎは条件で動き、振る舞いも時期で変わっていました。元の実験は専門職の文章課題、コンサルティングの課題、迷路の課題などです。この号は、AIに任せてよいかを勧めることも、実験の数字を日本の小さな店に当てはめることも、ガイドラインを解釈することもしません。

生成AIは、大量の文章から言葉のつながりを学び、指示に応じて文章や答えを作る仕組みです。2023年の事前登録のオンライン実験は、大卒の専門職453人に職種に合わせた報酬つきの文章課題を割り当て、半数を無作為に対話型AIを使える側にしました。全員の平均で所要時間は40%減り、仕上がりの質は18%上がり、働き手の間の差も縮みました。

(仮ビジュアル)薄暗い部屋の黒枠の大きな鏡の前で、黒いローブ姿の女性が鏡に映った自分と静かに向き合っている写真
文章の課題では、時間が減り、質が上がった。 Visual: ALIFE

では、効くなら何でも任せられるのでしょうか。2023年に作業論文として公開され、2026年に経営学の学術誌で刊行された実験は、AIの得手不得手を “jagged technological frontier”(ぎざぎざの技術の境界)と呼びました。一見同じくらいの難しさでも、AIが楽にこなす課題と、力の及ばない課題が入り組む、という意味です。

01コンサルタント758人の実験で、境界の外の課題では正解の割合が19ポイント低かった。参加者はAIなし・AIあり・AIあり+使い方の説明の3組に無作為に分けられました。境界の内側の18課題では、AIありの組は平均12.2%多くの課題を、25.1%速くこなしました。外側に選んだ1課題の正解の割合は、AIなしの約85%に対し60%と70%でした。

02考えさせる仕掛けは過信を減らしたが、最も効いた設計ほど好まれなかった。2021年の実験(199人)は、AIの説明に考えて向き合わせる3つの仕掛けを、説明を添えるだけの2つの方式やAIなしと比べました。AIが誤っても提案を受け入れる「過信」は説明だけの方式より減り、考えることを好む人ほど効果が大きい傾向でした。

03ある対話型AIの素数の判定は、3か月のあいだに正答84%から51%へ変わった。2024年の研究は、同じサービスの2つのモデルの2023年3月版と6月版を、数学やコード作成など7種の課題で比べました。一方のモデルは素数の判定が84%から51%に下がり、もう一方は同じ課題で6月のほうがずっと良くなりました。変化は課題によって上下両方向でした。

(仮ビジュアル)ベージュの空間で、黒い石の細長い天板を、灰青のガラス・銀の金属・赤い漆の3本の脚が支えているコンソールテーブル
境界の外・考えさせる仕掛け・時期による変化。三つの研究が扱ったこと。 Visual: ALIFE

過信は、避けられない心の癖なのでしょうか。2023年の論文は、人はAIの説明に付き合うかどうかを、確かめる手間と得を比べて選んでいると論じ、模擬のAIと迷路の出口を探す課題で、5つの研究(計731人)を重ねました。以下の三つは、その要旨が報告した点です。

01出発点は、説明を添えても過信は減らない、という知見だった。論文は “Surprisingly, overreliance does not reduce when the AI produces explanations for its predictions”(意外にも、AIが予測に説明を添えても過信は減らない)という知見から出発します。2021年の実験の要旨も、説明だけでは減らないようだと書いていました。

02課題の難しさと説明の分かりにくさを動かすと、過信の度合いが変わった。研究1は課題の難しさを、研究2と3は説明の分かりにくさを動かし、どちらも過信を左右しました。著者らは、説明が確かめる手間を十分に下げる場面では過信が減りうることを、実際に示したと書きます。

03報酬という得の大きさも、頼り方を動かした。研究4は金銭の報酬を動かし、これも過信に影響しました。著者らは、先行研究で説明の効果が見えなかったのは、説明が確かめる手間を十分に下げていなかったことも一因かもしれない、と推測しています。

(仮ビジュアル)縦に3分割された写真。左は乱れた寝具のベッド、中央は窓の外へ目を向ける女性、右は玄関の床に脱ぎ置かれたコートと鍵
出発点・手間の条件・得の大きさ。頼りすぎを動かしたもの。 Visual: ALIFE

どの研究も、日本の小さな店の文章づくりや問い合わせ対応を調べたものではありません。文章の実験は職種に合わせた課題、境界の実験はコンサルティングの課題、過信の2本は用意された判断の課題で、使われたAIも当時のものや模擬のものです。時期の研究も2023年の2つの版の比較です。境界の実験の数字は作業論文の版で、刊行版の要旨は「19%」低いと書きます。

公的文書は、経済産業省と総務省のAI事業者ガイドラインです。2024年4月の第1.0版が初版で、いまの版は2026年3月の第1.2版。本編は「Living Document として」内容を「適宜更新を行っている」と書き、AIを作る側・提供する側・業務で使う側に分けて留意点を解説しています。効果の証拠ではありません。全文まで読めたのは6点のうち2点で、読めていないものについては書きません。

AIの得意の外では、
コンサルタントの
正解が減った。

シラバス側の看板は、「任せられる」も「任せられない」も俗説で、効くが凸凹、人は頼りすぎ、振る舞いも変わる、というものです。この向きを支えるのは、文章と経営の課題の実験2本、過信を調べた実験2本、時期で挙動を比べた研究1本で、ガイドラインは公的な枠組みとして並びます。

TRY IT TODAY

  1. 01DATE

    今日の日付と、AIに任せた、または任せてみたい自分の作業を一つ書く(メールの下書き、長い文章の要約、言い換え、アイデア出しなど)。

  2. 02LOG

    その作業のうち、AIが得意そうな部分(下書き・要約・言い換えなど)と、外しそうな部分(固有名詞や数字、自分の事情、最新の事実など)を書き分ける。

  3. 03SORT

    任せた出力のどこを、どうやって自分で確かめるかを一行で書き、全部任せる・全部自分でやる、のあいだのどこに線を引いたかを一言添える。良し悪しは決めない。

10分。自分の作業だけで完結させる記録のメモです。これは研究結果そのものではなく、記録の単位を決めてみるためにALIFEが提案する実践入口です。従業員や客の個人データは書かず、AIにも渡さない形にしてください。

この号が運べたのは四段です。文章の課題で、AIを使えた側の時間が減り質が上がったこと。コンサルティングの課題で、境界の内では多く速くこなし、外では正解が減ったこと。過信は考えさせる仕掛けや確かめる手間で動き、効く設計ほど好まれなかったこと。同じサービスの振る舞いが数か月で上下に変わったこと。どこまで任せてよいかを、この6点は一つの答えでは示していません。次の号は、データの持ち主を決めます。

SECOND LAYER · FULL SYLLABUS「AIに仕事を任せるには?」を、もっと深く学ぶ。→

Next in Data

VIEW ALL
ISSUE 539実験では、人より当たる計算も、外れるのを見ると、選ばれにくくなった。ISSUE 541統治の活動を書いた31本は、「決める」に偏っていた。
ALIFE · ISSUE 540

本コンテンツは学習目的であり、診断や治療の代替ではありません。