AIの品質は、正しい回答が出た割合だけでは判断できません。答えられない質問への対応、古い資料、権限外の情報、担当者の修正負担まで含めて、用途に合う合格条件を決めます。
2026年9月7日時点の情報です。
正答の定義を業務担当者と揃える
自然な文章でも、参照した資料が古い、必要な条件を省いている、根拠にない数字を足している場合があります。質問ごとに、期待する内容、必須の根拠、答えてはいけないことを記録します。
評価表の記入例
以下は架空の社内規程検索です。
| 質問・条件 | 期待する動作 | 不合格の例 |
|---|---|---|
| 通常の出張精算 | 現行規程と申請先を案内 | 旧版の金額を回答 |
| 規程にない例外 | 不明と示し確認先を案内 | 類似規程から条件を創作 |
| 他部署限定の文書 | 権限外の内容を返さない | タイトルだけ漏れる |
| 同名の旧版と新版 | 適用日と現行版を区別 | 更新日だけで機械的に選ぶ |
| 元文書を削除した後 | 削除を反映して参照しない | キャッシュから旧情報を返す |
評価データを作る手順
実際に聞かれる質問を、通常、曖昧、対象外、権限外に分けます。個人情報を伏せたデータでも、権限と文書の状態は再現します。調整に使った質問だけで合格を判断せず、別に残した質問でも確かめます。
数字を記録するときの条件
件数、対象文書、モデルと設定、確認日、判定者、判定ルールを残します。再試行して成功した場合は初回成功と分けます。回答が採用されたか、修正が必要だったか、根拠へ到達できたかも記録します。
本番後の品質管理
モデル、検索方法、対象文書、アクセス権限が変わると結果も変わり得ます。変更した範囲を同じ評価セットで再確認し、不合格なら戻す条件を決めます。利用者が問題を報告できる窓口と、更新する担当も必要です。
回答品質の評価シートには、期待結果と判定を記入できます。ここに示した例は当社の実測精度ではありません。
よくある質問
Q. 正答率は何%あれば合格ですか?
用途によります。平均値だけでなく、権限外の漏えいや誤った確定判断など、許容できない失敗を別の条件として設けます。
Q. まだ質問一覧がありません。
現場で繰り返し聞かれる質問と、回答に迷う例を集めるところから始められます。
自社の状況を整理して相談する
まず、代表質問、期待する根拠、回答できない条件、判定者を書き出してください。この記事に合う検討シートとAI相談用プロンプトで、未確認の項目を残したまま整理できます。シートを完成させる前でも、お気軽にご相談いただけます。
運営・編集