Skip to content

合成データ

読み方:ごうせいでーた英語表記:Synthetic Data

カテゴリ
AI・生成AIデータ・分析
用途
AI活用データ整理・分析
一覧へ戻る
アイペンちゃんが用語の本から知識を整理し、確認しているイラスト

この用語の意味

合成データ(Synthetic Data)は、ルール、シミュレーション、生成モデルなどを使って特定の目的に合わせて人工的に作るデータです。売上の表、問い合わせ文、製品画像など、形式はさまざまです。実データの傾向を学習して作る方法も、実在の記録を使わず条件から作る方法もあります。

単に氏名を別名へ置き換えたデータとは異なります。また「人工的に作った」という説明だけでは、個人を推測できないことや、実際の業務を正しく再現することは保証されません。何を再現し、何を再現しないのかを用途ごとに決める必要があります。

何ができるか

例えば受注システムの改修では、架空の注文を作り、通常注文、取消、返品、数量の上限などを試せます。社員研修用に架空の問い合わせを用意したり、画像認識の学習で撮影条件の異なる画像を補ったりする使い方もあります。

ソフトの入力チェックに使うなら、形式や境界値を満たすことが重要です。一方、需要予測の学習に使うなら、季節性や商品間の関係が現実に近いかが重要になります。見た目が自然な表を大量に作るだけでは、後者の目的は達成できません。

実際に使うために必要なもの

まず用途、項目定義、許される値、項目間の関係、必要な例外を整理します。受注なら「取消済みなのに出荷済み」「合計金額と明細が不一致」などを正常データと混ぜるのか、不正入力テストとして別管理するのかを決めます。生成担当者に加え、業務ルールを確認する担当者が必要です。

少量の入力テストなら表計算や簡単な生成処理で足りる場合があります。統計的な特徴を学ぶ方法では専用ライブラリや計算環境、学習用データ、品質評価が必要です。費用には生成の計算量だけでなく、条件設計、例外の追加、妥当性確認、更新の工数が含まれます。

単一の開発元や統一製品規格を持つ技術ではありません。実装例にはDataCeboが開発する表形式データ向けのSDVがあります。製品によって利用許諾や利用できる機能が異なるため、商用利用条件と実行環境を確認します。実データを使う場合は、利用権限・保管先・外部送信の可否を先に確定します。

小さく試す運用例

架空の卸売会社の受注画面を想定し、本物の顧客情報を使わず100件の注文を作ります。通常注文70件、返品10件、取消10件、入力不備10件など、試したい処理を先に配分します。この配分は試験用であり、実際の返品率や取消率を表しません。

受注ID、商品区分、数量、単価、状態を定義し、担当者が「正常なら登録できる」「数量が上限を超えれば止まる」などの期待結果を付けます。生成後に重複ID、合計計算、日付の前後関係を検査してからテストへ渡します。

合格条件は「必須の処理分岐をすべて試せる」「正常データの項目間矛盾が0件」「不正データが期待どおり拒否される」といった業務上の条件に置きます。機械学習に転用する場合は、合成データとは別に確保した、適切に利用できる実データで性能を検証する工程が必要です。

人が確認すること・注意点

生成元のデータに偏りがあれば、その偏りを再現・強調する可能性があります。現実には少ない組み合わせを不自然に増やすと、学習後の判断もずれます。平均値だけでなく、分布、項目間の関係、まれなケース、用途別の性能を確認します。

実データを学習した生成器が元の記録に似たデータを出す可能性も考慮します。合成という名称を理由に外部公開を決めず、生成方法と漏えいリスクを評価します。顧客の機密情報を未加工でクラウドAIに渡して作る運用は避けます。

保存時は「合成」「生成条件」「作成日」「使用可能な目的」を明示し、実績データや経営報告へ混入させないようにします。合成データだけで試して良い結果が出ても、実運用での性能確認を済ませたことにはなりません。

関連する事例・テンプレート

学習と評価が混ざる問題はデータリーケージ、生成元や条件の記録はデータの来歴を参照してください。試験用には「項目/生成条件/正常・異常の区分/期待する処理/確認結果」を記録します。

参考情報