コードを書かせると特定の言語に偏る ― 選んだ理由を後から作ってしまう「幻の根拠」という失敗の型
プロジェクト単位でコードを生成させると、モデルは特定の言語を過剰に選ぶ。本研究はその偏りを測る基盤を作り、選択の理由が要件の検討ではなく容易さによることが多いこと、さらに理由そのものを作り出す場合があることを示している。
論文の概要(独自要約)
- 分野(arXiv分類)cs.SE(+1)
- 著者Lukas Twist, Twm Stone, Helen Yannakoudakis ほか(計4名)
- 投稿日2026-08-06
- arXiv ID2608.06041v1
要点
- プロジェクト単位のコード生成における特定の言語への偏りを測るための基盤を提示した研究。
- その言語が既定の選択として適切でないことが多い七つの領域から28のプロジェクトを集め、25のモデルを評価した。
- 当該言語が過剰に選ばれること、推奨と実装の一致度が低いこと、小規模なオープンウェイトのモデルほど偏りが強いことが分かった。
- 9,826件の推論の記録の分析から、多くの選択が要件の検討ではなく自動的または容易さによるものであった。
- モデルが選択の文脈上の裏づけを作り出す失敗が確認され、著者らはこれを「幻の根拠」と呼んでいる。
1既定の選択が適切でない場面
コードを書かせるとき、モデルは何らかの言語を選びます。多くの場面では妥当な選択になりますが、常にそうとは限りません。本研究は、その言語が既定の選択として適切でないことが多い七つの領域から28のプロジェクトを集め、25のモデルを評価しました。
測ったのは三つです。特定の言語への偏り、推奨と実装の一致度、そして言語の多様性。単に何を選んだかだけでなく、推奨した言語と実際に書いたコードが一致しているかまで見ている点が特徴です。
2理由をたどる
- 1多くの選択自動的なもの、あるいは主に容易さによるもの
- 2本来期待される選択プロジェクトの要件を明示的に検討した結果
- 3少数だが重要な失敗選ぶための文脈上の裏づけを作り出す(幻の根拠)
- 4同じく自らの推論で選んだ言語と矛盾するコードを生成する
9,826件の推論の記録を調べた結果、多くの選択は要件の検討によるものではなかったとされます。さらに一部では、その言語を選ぶ理由になる文脈が存在しないにもかかわらず、あたかも存在するかのように書かれていました。著者らはこれを「幻の根拠」と呼んでいます。
3理由が書いてあることと、理由があること
この失敗の型が重要なのは、出力を読むだけでは見分けがつきにくいためです。理由が添えられていれば、判断は妥当に見えます。しかしその理由が入力に裏づけられているかどうかは、別に確かめなければ分かりません。説明が付いていることは、説明が正しいことを意味しないという点が、この研究の実務的な含意です。
4小さいモデルほど偏る
小規模なオープンウェイトのモデルほど当該言語への偏りが強く、言語の多様性が低い傾向も報告されています。自前で動かせる小さなモデルを選ぶ場合、この傾向を前提に置く必要があります。当サイトでは評価の設計が結論を左右するという論点を別の記事でも扱っています。
なぜ重要か
出力に理由が添えられていても、その理由が入力に裏づけられているかは別に確かめなければ分からない。自前で動かす小規模なモデルほど選択の偏りが強い傾向も、選定時の前提になる。
よくある質問(FAQ)
「幻の根拠」とは何ですか?
理由が書かれていれば信用できますか?
出典(一次情報)
出典:arXiv(記述メタデータは CC0 パブリックドメイン)。要約は当サイト独自。原文・PDFは arXiv をご確認ください。
- arXiv 概要ページ(原文・公式)
- PDF(arXiv)
- arXiv ID: 2608.06041