社内AIの回答が遅い、利用量が増えている。その原因は、AIの性能だけとは限りません。毎回同じ長い指示を送り、共有フォルダの資料を広く探し、不要な会話履歴を抱えたまま、長い回答を作らせている運用が影響している場合があります。

トークン使用量を減らす基本は、AIに短く答えさせることだけではありません。質問に必要な資料を先に絞り、同じ情報を何度も読ませない運用へ変えることです。
ファイルが多いだけではトークンを使わない
共有フォルダに1万件のファイルがあっても、AIが中身を読まなければ、その本文すべてが入力トークンになるわけではありません。一方で「このフォルダを全部読んで分析して」と依頼し、多数の本文をAIへ渡せば、入力は大きくなります。
- ファイル名の一覧だけ確認する:比較的少ない入力
- 検索で候補を絞り、必要な3件だけ読む:対象資料分の入力
- 部署全体の資料を読み、関係性を判定する:大きな入力
- 同じ大きな資料を会話のたびに送り直す:重複した入力
- 詳細な回答を毎回求める:出力トークンも増える
トークンは文字数や単語数と同じではありません。利用量を確認するときは、入力、出力、キャッシュ済み入力など、利用サービスが表示する内訳を確認します。
速度と使用量は同じ指標ではない
入力を減らすと、処理開始までの待ち時間や費用が改善する可能性があります。ただし、速度はモデル、混雑、検索、ファイル変換、ネットワーク、外部ツールなどにも左右されます。使用量が減っても必ず同じ割合で速くなるとは限りません。
| 確認する指標 | 分けて測る理由 |
|---|---|
| 入力トークン | 資料、指示、履歴をどれだけ渡したかを見る |
| 出力トークン | 回答の長さを把握する |
| 回答開始までの時間 | 入力処理や検索の待ち時間を確認する |
| 完了までの時間 | 長い生成や外部ツールの時間も含める |
| 人の確認・修正時間 | 短いが使えない回答になっていないかを見る |
運用案1 全部読む前に検索する
質問を受けたら、まず資料名、要約、キーワード、更新日、状態を持つインデックスを検索します。候補が出てから本文を読みます。
質問 ↓ 文書インデックスを検索 ↓ 現行・権限内の候補を3~5件に絞る ↓ 必要な箇所だけ取得 ↓ AIが回答案と参照資料を提示
この方法はRAG(検索拡張生成)に近い考え方ですが、最初はCSVやスプレッドシートの台帳でも始められます。
運用案2 現行資料と旧資料を分ける
- current:通常の回答で優先する
- draft:作成途中として回答根拠にしない
- archive:過去の経緯を確認するときだけ使う
- obsolete:原則としてAIへ渡さない
旧版まで毎回比較すると入力が増えるだけでなく、誤った回答の原因にもなります。過去との比較を求められたときだけ、archiveを追加します。
運用案3 会話を目的ごとに分ける
長い会話には、以前の指示、添付資料、試行錯誤の結果が残ります。続きの仕事に必要な履歴なら有効ですが、別の目的へ移ると不要な情報になります。
- 議事録の要約と就業規則の確認を同じ会話で続けない
- 完了した調査は短い引継ぎメモへまとめる
- 次の会話には、目的、確定事項、未解決事項、必要資料だけを渡す
- 同じ添付ファイルを意味なく重複して送らない
運用案4 出力の長さと形式を指定する
「詳しく説明して」だけでは、必要以上に長い回答になる場合があります。利用目的に合わせて、件数、文字数、表の列、判断項目を指定します。
次の規程について、申請前に確認する点を5項目で示してください。 各項目は60文字以内にし、最後に参照した資料名と更新日を付けてください。 判断できない項目は推測せず「担当部署へ確認」としてください。
短さだけを優先せず、仕事の完了に必要な情報は残します。短い回答を何度も聞き直すと、合計の利用量と時間が増える場合があります。
運用案5 変わらない指示を安定させる
AI APIを使った社内システムでは、毎回共通する規程や出力形式を入力の前半へ固定し、質問や対象資料を後半へ置く設計があります。対応するサービスでは、同じ入力の前半を再利用するプロンプトキャッシュにより、入力処理の費用や待ち時間を下げられる場合があります。
OpenAIの公式資料でも、同じプロンプト接頭辞の処理を再利用することで、入力処理の計算、キャッシュ対象入力の費用、回答開始前の時間を減らせると説明されています。ただし、対応モデルや料金、条件は変わるため、導入時に最新のOpenAI公式のPrompt caching資料と利用サービスの仕様を確認してください。
運用案6 要約は原文の代わりではなく入口にする
長い資料の要約を保存すると、候補選びには役立ちます。しかし、要約だけで契約条件、人事判断、会計処理、安全手順を確定してはいけません。
- 要約で読むべき資料を選ぶ
- 回答に使う箇所は原文で確認する
- 資料名、版、更新日、該当箇所を残す
- 判断責任のある担当者が最終確認する
運用案7 部署別・用途別に利用量を測る
全社の合計だけでは、どの業務を直すべきか分かりません。利用サービスで取得できる場合は、プロジェクト、部署、用途、モデルなどの単位で入力・出力を集計します。OpenAI APIには、入力、出力、キャッシュ済み入力などの利用内訳を確認する管理用の仕組みがあります。実際に保存するログは、本文や個人情報ではなく、用途、件数、利用量、時間など必要最小限にします。
4週間で試す改善手順
| 期間 | 実施内容 | 確認すること |
|---|---|---|
| 1週目 | 対象業務を1つ選び、現状の入力・出力・時間を記録 | 基準値を作る |
| 2週目 | 文書インデックスを作り、候補を絞ってから読む | 参照資料数と検索時間 |
| 3週目 | 出力形式、会話分割、現行資料優先を統一 | 再質問と修正の回数 |
| 4週目 | 入力・出力・時間・品質を導入前と比較 | 削減と品質の両立 |
減らしてはいけないもの
- 安全や法令に必要な条件
- 回答の根拠となる原文確認
- 例外や禁止事項
- 人による最終判断
- 機密区分とアクセス権限の確認
最小の入力で最短の回答を作ること自体が目的ではありません。必要な仕事を、確認可能な根拠を保ったまま、少ない探索と重複で完了することが目的です。
関連記事
- 社内資料を整理してAIの読込量を減らす 文書インデックス作成テンプレート:CSVやスプレッドシートで始める項目と手順
- NASと社内Webアプリでつくる文書管理・AI検索の構築ガイド:権限、監査ログ、AI検索を含む専用システムの考え方
- コンテキストウィンドウ:AIが一度に参照できる情報量の考え方
- トークンコスト:入力・出力の利用量と費用の見方
まとめ
社内AIのトークン使用量と待ち時間を減らすには、資料、会話、出力を一律に短くするのではなく、必要な情報へ早く到達する流れを作ります。まず1つの業務で、全文探索からインデックス検索へ変え、入力・出力・時間・修正率を測ってください。効果を確認できた運用だけを、他部署へ広げるのが現実的です。