生成AIを業務に入れた企業がつまずく場所は、生成そのものではなく「出てきたものが使えるかどうかの判定」です。株式会社電通・株式会社電通デジタル・SB Intuitions株式会社の3社は2026年9月1日、コピーライター64名による11万6,532件の評価データを使い、生成AIに広告コピーの良し悪しを採点させる検証結果を公表しました。学習させた業種では人の評価と相関した一方、学習していない業種では相関が低下しています。AI出力の品質評価は買ってくる仕組みではなく、自社の基準とデータで組み立てるものだ、という現実的な線引きがここにあります。
電通・SB Intuitionsが公表した「AIがコピーを採点する」検証結果
電通・電通デジタル・SB Intuitionsの3社は2026年9月1日、日本語コピーライティング特化型の生成AI開発に向けた共同研究の成果を公表しました。中心は、生成AIが書いた広告コピーを生成AI自身に評価させる自動評価手法の検証です。
検証の土台になったのは、電通に所属するコピーライター64名が共通の基準で採点した11万6,532件の評価データセットです。評価観点として「ファースト・インパクト」「インサイトの深さ」「言葉選びの妥当性」などが整理されました(電通の2026年9月1日付リリース)。
基盤となる生成AIは、ソフトバンク株式会社のAI計算基盤の上でSB Intuitionsが開発する国産大規模言語モデル「Sarashina(さらしな)」です。共同研究そのものは2025年9月25日に開始され、電通が生成コピーの評価、電通デジタルが学習用データの提供、ソフトバンクが計算基盤、SB Intuitionsが開発を担う分担で進められてきました。
研究成果は、2026年9月2日から4日に北九州学術研究都市で開催された第25回情報科学技術フォーラム(FIT2026)で「日本語キャッチコピー評価のためのLLM-as-a-Judgeの検証」として発表すると、3社のリリースで予告されています。

何が新しいのか ― 「作る側」ではなく「評価する側」をAIにした
この検証の新しさは、生成AIを文章を書く道具ではなく採点者として使った点にあります。手法はLLM-as-a-Judge(大規模言語モデルに評価者の役割を与え、出力の良し悪しを自動で判定させる方式)と呼ばれます。
3社の公表で押さえるべき所見は2つです。
| 所見 | 公表内容 | 実務上の意味 |
|---|---|---|
| 学習した領域では機能する | 学習・最適化を行った業種・商材では、AIの評価とコピーライターの評価に「一定程度の正の相関」を確認 | 自社の基準を学ばせれば、人の判断をある程度まで代替できる |
| 領域を越えると落ちる | 検証対象以外の業種・商材では相関が低下し、「プロンプト調整のみでは幅広い分野への適用が難しい」 | 評価の仕組みは他部門・他業種へそのままコピーできない |
2つ目の所見は、SB Intuitionsのリリースが「プロンプト調整のみでは幅広い分野への適用が難しい」と明記している点が重要です。評価用のプロンプトを1枚書いて全社に配れば品質管理が完成する、という発想が成立しないことを、11万件規模の検証で確かめた報告だと読めます。
なお、相関係数の具体的な数値、評価が何段階のスケールだったか、検証した業種・商材の具体名は、3社のリリースいずれにも記載がありません。「相関があった」という定性的な所見までが現時点で確認できる事実です。
経営・DX担当者への示唆 ― AI導入の隠れコストは「採点」にある
生成AI導入の実質的なコストは、ツールの利用料ではなく「出てきた出力を誰がどの基準で確認するか」という採点の運用にあります。今回の検証は、その採点を自動化するために何が要るかを示しました。
導入検討ではつい、月額いくらのツールを何席配るかという費用に目が向きます。しかし現場で時間を食うのは、生成された文章を一件ずつ読んで使えるかどうか判断する工程です。
決めるべきことは3つあります。
- 評価基準を言葉にする:電通の事例では「ファースト・インパクト」「インサイトの深さ」「言葉選びの妥当性」という観点が先に整理されています。基準が言語化されていない業務は、人でもAIでも安定して採点できません。
- 自社ドメインの評価データを貯める:64名・11万6,532件は広告コピーという極めて主観的な領域での規模です。自社の定型業務ならこの桁は不要ですが、「誰かが良し悪しを付けた記録」がゼロのまま自動評価は始められません。
- 適用範囲を明示する:学習外の業種で相関が落ちたという所見は、評価の仕組みに有効範囲があることを意味します。「この評価器は◯◯業務にのみ有効」と範囲を書き、範囲外は人が見る運用に戻す設計が要ります。
自社でAI出力の品質評価を設計する4ステップ
AI出力の品質評価は、いきなり自動化から入ると失敗します。人の判断を可視化してから機械に渡す順序が現実的です。
| ステップ | やること | 完了の目安 |
|---|---|---|
| ① 判定者を1人決める | その業務のAI出力について、最終的に良し悪しを決める人を明示する | 名前と役割が業務フロー図に書かれている |
| ② 評価観点を3〜5個に絞る | 「正確さ」「自社トーン」「禁止表現の有無」など、落ちたらやり直す観点だけを残す | 観点ごとに合格・不合格の例文が各1つある |
| ③ 人手で採点し記録する | 数十〜数百件を①の判定者が採点し、点数と理由をセットで残す | 不合格の理由が観点のどれかに必ず紐づく |
| ④ 自動評価を試し、範囲を書く | 記録を使ってAIに採点させ、人の判定とどれだけ一致するかを測り、有効な業務範囲を明記する | 「この業務では人の確認を減らす/この業務では減らさない」が文書化されている |
重要なのは④で、一致率を測らずに自動評価を本番投入しないことです。今回の共同研究も、学習した領域と学習外の領域で結果が分かれることを実測して公表しています。同じ確認を自社の規模で行うのが、最も安価な失敗回避策になります。

具体的な活用シーン
評価の自動化が効きやすいのは、出力の量が多く、判定基準が比較的はっきりしている業務です。
- 営業メール・提案文の下書きチェック(BtoB営業):禁止表現・価格の記載ミス・自社トーンからの逸脱という観点は言語化しやすく、機械的な一次チェックに向きます。最終判断は営業責任者が持つ形が現実的です。
- 社内問い合わせ回答の下書き(情報システム・総務):社内規程という正解文書が存在するため、「規程のどこに基づく回答か」を評価観点にできます。根拠を示せない回答を自動で差し戻す運用が組めます。
- 議事録・レポートの要約(全社):欠落した決定事項の有無を観点にすると採点しやすくなります。一方で「読みやすさ」のような主観的観点は、今回の広告コピーの検証が示すとおり大量の評価データを要するため、当面は人が見る範囲に残すのが安全です。
自社に近い業務でAI活用がどう進んでいるかは、「AI導入成功事例の読み方|自社に効くか見抜く5項目」で事例の読み解き方を整理しています。効果測定の観点は「AI投資の55%が「効果不明」|ROIが見えない3つの落とし穴と対策」が参考になります。
よくある質問
- LLM-as-a-Judgeとは何ですか。
-
大規模言語モデルに評価者の役割を与え、AIが生成した文章などの出来映えを自動で採点させる手法です。人のレビュー工数を減らす目的で使われますが、評価基準を学ばせる作業が前提になります。
- 評価をAIに任せれば人の確認は不要になりますか。
-
なりません。電通・SB Intuitionsの2026年9月1日の公表では、学習した業種では人の評価と相関した一方、学習外の業種では相関が低下しました。有効範囲を決め、範囲外は人が確認する運用が必要です。
- 自社でAI出力の品質評価を始めるには何件のデータが必要ですか。
-
必要量は業務の主観性によって変わり、一律の目安はありません。広告コピーのように判断が分かれる領域では11万件規模の評価データが使われた一方、判定基準が明確な定型業務はより小規模から検証できます。
まとめ
2026年9月1日に電通・電通デジタル・SB Intuitionsが公表した検証は、生成AIの品質評価について2つの事実を示しました。自社の基準を学ばせれば人の評価と相関する採点は可能であること、そしてその仕組みは学習していない領域へそのまま移せないことです。
AI導入の議論はツール選定から始まりがちですが、成果を分けるのは「出力を誰がどう採点するか」を先に決められるかどうかです。まずは対象業務を1つ選び、判定者と評価観点3〜5個を紙に書き出すところから始めてください。評価基準が書けない業務は、AIに任せる準備がまだ整っていない業務だと判断できます。
AI導入の進め方全体は「AI導入支援|中小企業の進め方と支援会社の選び方」、発注前に確認する具体的な基準は「AI導入支援会社の選び方|発注前に確認する7つの基準」で解説しています。
自社の業務でAI出力の評価基準をどう設計するか整理したいという方は、AI導入相談フォームからお気軽にご相談ください。
出典・参考資料
- 電通: 『日本語コピーライティング特化型生成AI』の開発に向けた共同研究成果を公表 ()
- SB Intuitions: 『日本語コピーライティング特化型生成AI』の開発に向けた共同研究成果を公表 () (「プロンプト調整のみでは幅広い分野への適用が難しい」の記述元)
- 電通デジタル: 『日本語コピーライティング特化型生成AI』の開発に向けた共同研究成果を公表 ()
- 電通: 『日本語コピーライティング特化型生成AI』の開発に向けた共同研究を開始 ()



