AI安全性評価は「どう測ったか」で結論が変わる ― 同じモデルでもチャットUIとAPI、web検索の有無、繰り返しで結果がずれる
広く使われるLLMについて、チャットUIとAPIという2つの接続方法、web検索の有無、同じプロンプトの複数回実行という条件を変えて挙動を比べた監査研究。web検索を有効にすると精度が最大8ポイント低下し、同じプロンプトの繰り返しで最大21%が一致しない結果になったと報告する。
論文の概要(独自要約)
- 分野(arXiv分類)cs.HC(+1)
- 著者Ro Encarnación, Tina Behzad, Emma Lurie ほか(計4名)
- 投稿日2026-08-06
- arXiv ID2608.06202v1
要点
- BBQとSafetyBenchから層化抽出した401件のプロンプトで、チャットUIとAPI、web検索の有無を比較し、3回反復で計4,812件の応答を収集した監査研究。
- web検索を有効にすると精度が最大8ポイント低下し、あるベンチマークでは接続方法どうしの優劣の向きが逆転した。
- 同じプロンプトを繰り返すと、最大21%のプロンプトで応答が一致しなかった。
- 検索を無効にした状態では、チャットUIの応答は両ベンチマークともAPIの応答より精度が低かった。
- 2つの接続方法は異なる引用に基づいて答えを組み立て、回答を控える挙動も一貫していなかった。
1同じモデルでも、測り方で違う顔が出る
あるモデルが安全か、信頼できるか、配備してよいか。こうした判断の根拠として、ベンチマークのスコアが日常的に使われている。しかしそのスコアは、たいてい一つの接続方法で、プロンプトごとに1回だけ実行し、正答率だけを報告して得られたものだ。本研究は、その前提が成り立つかを実際に確かめた。
同じモデルに対して、チャットUIとAPIという2つの接続方法を用意し、web検索の有無を切り替え、同じプロンプトを3回ずつ流している。
2監査の規模と、そこで見つかったずれ
数字が示しているのは、条件を一つ変えるだけで結論が動きうるということだ。web検索を有効にすると精度が下がり、しかも一方のベンチマークでは接続方法どうしの優劣の向きまで反転した。検索の有無は配備時には当たり前に存在する条件であり、評価の設計から抜けていれば、評価が測っているものと実際に使われる姿がずれる。
3正答率が隠してしまうもの
本研究が標準的な性能指標の外に置いた評価軸は、応答の一貫性、応答テキストの類似度、引用の根拠づけ、そして回答を控える挙動である。2つの接続方法は異なる引用に基づいて答えを組み立てており、回答留保の挙動も両者で一貫していなかった。検索を無効にした状態では、チャットUIの応答は両ベンチマークともAPIの応答より精度が低かったとも報告されている。
同じモデル系列の内側であっても、正答率という単一の数字だけを報告すると、AI安全性の評価に関わる重要な挙動の揺らぎが見えなくなる、というのが著者らの主張だ。
4評価方法そのものを対象にする研究
2026年9月2日時点で当サイトが保持するAI論文1,900件のうち、主分類がcs.HC(ヒューマン・コンピュータ・インタラクション)のものは13件と少ない。主分類の分布はcs.CV 482件、cs.LG 377件、cs.AI 364件、cs.CL 254件が上位を占め、モデルや手法そのものを対象とする研究が大半である。
そのなかで本論文は、モデルではなく評価の手続きを対象にしている。著者らは、AI安全性の評価が接続方法・複数回実行の一貫性・検索条件・応答単位の挙動を体系的に考慮すべきだと述べている。
なぜ重要か
モデル選定やリスク評価をベンチマークのスコアだけで行う実務に対する警告になる。社内評価を設計する際には、実際の配備と同じ接続方法・検索設定で、同一プロンプトを複数回流して一貫性まで測る必要があるという具体的な指針が得られる。
よくある質問(FAQ)
なぜチャットUIとAPIで結果が違うのですか?
この結果は評価が無意味だという意味ですか?
出典(一次情報)
出典:arXiv(記述メタデータは CC0 パブリックドメイン)。要約は当サイト独自。原文・PDFは arXiv をご確認ください。
- arXiv 概要ページ(原文・公式)
- PDF(arXiv)
- arXiv ID: 2608.06202