AIに企画案を10本出してもらう。

速い。文章は整っている。どの案にも、それなりの理由があり、それなりに使えそうだ。

しかし10本を横に並べると、妙な既視感がある。

問いかけから始まり、意外な対比を置き、三つの要点を示し、前向きな一文で終わる。題材は違っても、呼吸が同じだ。弱い案は減ったのに、遠くまで飛んだ案も減っている。

生成AIの評価で見落としやすいのは、ここだ。

私たちは一案ずつ「良くなったか」を見る。しかし、ブランドやメディアが蓄積するのは一案ではない。記事、広告、提案、商品説明が並んだ作品群である。

一つひとつの平均点と、全体としての多様性は、別の指標だ。

SOURCE|個人の創造性は上がり、集団の作品は似た

2024年、Anil R. DoshiとOliver P. Hauserは、生成AIが短編執筆に与える影響を調べた事前登録済み実験を Science Advances に発表した。

英国の参加者293人は、三つの条件のいずれかに無作為に割り当てられた。

• AIの助けを使わずに書く

• GPT-4が出したアイデアを一つまで使える

• GPT-4が出したアイデアを五つまで使える

参加者は指定された題材について、英語で8文の物語を書いた。AIが返すのは3文の筋書き案で、参加者はそのままコピーするのではなく、自分で物語を完成させた。

完成した293作品を、別の600人が評価した。評価は合計3,519件。評価者は当初、各作品がどの条件で書かれたかを知らされていなかった。

AIを使える二条件を合わせると、人間だけで書いた条件に比べ、評価者がつけた新規性は6.7%、有用性は6.4%高かった。もともとの創造性テストの得点が低い書き手ほど、支援の効果は大きかった。一方、創造性の高い書き手の上限をさらに押し上げたという証拠は得られなかった。

ここまでは「AIは創作を助ける」という話に見える。

しかし研究者が作品同士の意味的な近さを調べると、AIのアイデアを使える条件の物語は、同じ条件内のほかの物語とより似ていた。AIが個々の書き手を平均以上へ引き上げる一方で、集団全体では似た方向へ寄せる可能性が示された。

論文の価値は、AIを「良い/悪い」で裁かなかったことにある。

個人レベルの改善と、集合レベルの画一化が同時に起こりうる。

「10案ください」は、多様性を生む指示とは限らない

生成数を増やすと、選択肢も増えたように見える。だが、同じモデルに、同じ背景情報を渡し、同じ評価基準で続けて尋ねれば、それは一つの探索範囲を細かく掘っているだけかもしれない。

表現が10通りあることと、前提が10通りあることは違う。

たとえば新商品の訴求を考えるとき、「キャッチコピーを10案」と頼めば、言葉は変わっても、便利さや速さという同じ価値軸に集まることがある。本当に必要なのは、顧客の不安から見る案、現場の失敗から見る案、使わない理由から見る案、競合が言えないことから見る案など、探索の出発点そのものを分けることだ。

AIの出力数ではなく、探索経路の独立性を増やさなければならない。

反証|画一化は、AIの避けられない宿命ではない

ここで「AIを使えば必ず作品が似る」と断定するのも誤りだ。

2026年の別研究は、意図的に異なる10のAIペルソナから計300の筋書き案をつくり、その中から参加者へ案を提示する修正版の実験を行った。分析対象となった97作品について、先行研究と同じ中心値ベースの比較では、人間のみ、AI案一つ、AI案最大五つの条件間に有意差は見つからなかった。別の混合効果モデルでは、AI案一つの条件が人間のみより有意に多様で、AI案最大五つの条件は有意差なしだった。

この研究は規模が小さく、著者自身もより大きな追試が必要だとしている。ペルソナを変えれば常に多様性が守られると証明したわけではない。

それでも重要な示唆がある。最初の研究と矛盾するというより、AIが多様性へ与える影響は、モデルの有無だけでなく、どのようなアイデア群を供給するかで変わりうるということだ。

画一化は運命ではない。だが、放っておけば避けられるものでもない。

FORWARD BASIS VIEW|品質管理に「縦」と「横」を持つ

AIを使う制作現場には、二つの品質管理が必要になる。

縦の品質は、一つの成果物を深く見る。事実は正しいか。論理は通っているか。読者に役立つか。表現は明確か。

横の品質は、複数の成果物を並べて見る。同じ導入が続いていないか。同じ比喩、同じ構成、同じ結論、安全な価値観ばかりになっていないか。ブランドの中で、異なる声や観察が残っているか。

人が一案ずつレビューすると、縦の品質には気づきやすい。横の重複は、担当者や公開日が分かれるほど見えにくくなる。

ここに編集の新しい仕事がある。

AI時代の編集者は、誤字を直し、文章を整えるだけでは足りない。生成された作品群を俯瞰し、平均点を上げる過程で失われた距離を見つける必要がある。

それは、人間らしい不完全さを無条件に残すことではない。体験、現場観察、少数意見、言い切れない違和感など、モデルが安全に平均化しやすい材料を、意図して制作工程へ戻すことだ。

どこまで言える研究か

最初の実験は、短い英語のフィクション、固定された題材とプロンプト、当時のGPT-4を使ったものだ。参加者はプロ作家ではなく、ブランド戦略、報道、長文記事、映像制作を直接検証した研究ではない。

したがって、「AIを使った記事はすべて似る」とは言えない。6.7%と6.4%という改善幅も、この実験条件での評価値であり、ほかの制作物へそのまま移せない。

一方で、一案の評価だけでは作品群の変化を見落とす、という測定上の問題は幅広い現場に持ち込める。これはAIへの賛否ではなく、評価単位の話だ。

TRY THIS|次の企画会議で「10案」ではなく「5本の探索線」をつくる

次にAIを使って案を出すときは、一度に10案を求めない。先に、互いに重ならない探索線を人が決める。

例:

1. 顧客が実際に口にした不満から始める

2. 現場で起きた失敗から始める

3. 業界の常識を一つ反転させる

4. 最も使わなそうな人の視点から考える

5. 数字ではなく、具体的な一場面から考える

各探索線は、別々の入力資料と質問で進める。AIを開く前に、人が一つだけ仮説を書く。最後に候補を匿名で横に並べ、次の四点を確認する。

• 問いの立て方が違うか

• 根拠にしている材料が違うか

• 構成と比喩が重なっていないか

• 少し危うくても、そのブランドにしか言えない案が残っているか

AIが一案を良くしたかどうかだけで終わらない。

10案を並べたとき、それぞれが別の場所から来たように見えるか。そこまで見て初めて、速さがブランドの輪郭を削っていないかを判断できる。

SOURCES

• Anil R. Doshi & Oliver P. Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances 10, eadn5290 (2024). 論文 / 著者公開版

• 上記研究のデータ・分析コード:Dryad

• Yun Wan & Yoram M. Kalman, “Diverse AI Personas Can Mitigate the Homogenization Effect in Human-AI Collaborative Ideation,” Computers in Human Behavior: Artificial Humans (2026).DOI / 著者公開版

SOURCE / 原典

この記事の出典

本文の事実確認に使用した原典です。FORWARD BASIS独自の解釈・整理は本文内で区別しています。

  1. 論文Doshi & Hauser — Generative AI enhances individual creativity but reduces the collective diversity of novel content (Science Advances, 2024)
  2. 補足Doshi & Hauser — 著者公開版 (arXiv)
  3. 補足同研究のデータ・分析コード (Dryad)
  4. 論文Wan & Kalman — Diverse AI Personas Can Mitigate the Homogenization Effect in Human-AI Collaborative Ideation (2026)
  5. 補足Wan & Kalman — 著者公開版 (arXiv)