arXiv Papers

注目のAI研究論文を、要点で読む

研究プレプリントサーバ arXiv の AI・機械学習分野(cs.AI / cs.LG / cs.CL ほか)の論文から注目分を選び、独自要約・要点・出典つきで整理します。本サイトは arXiv 公式ではありません。

本ページは公開研究情報の一般的な整理です。要約は当サイト独自のもので、内容の正確性・最新性は必ず原論文(arXiv)でご確認ください。査読前のプレプリントを含みます。

収集データを全件ブラウズ(一覧・絞り込み・検索)→

ピックアップ

ピックアップ

注目のAI/ML論文を、独自要約・要点・FAQ・出典つきで解説。

cs.CR 2026/08

AIモデルの検査ツールを比べる ― 判断が当たっているかと、そもそも判断を出せたかは別々に測るべきだという指摘

機械学習の成果物に危険な内容が含まれていないかを調べる静的な検査ツール3種を比較した研究。一方のツールは判断を下せた範囲では完璧な成績だが、対象の半分では判断そのものを出せていなかった。従来の指標はこの差を隠してしまう。

詳しく読む
cs.CV 2026/08

視覚と言語をつなぐ役割は、注意ヘッドの2%弱に集中していた ― 上位20個を止めると接地の精度が最大80ポイント落ちる

視覚言語モデル(VLM)が、テキストで指し示された画像の領域を見つけて出力へ結びつける仕組みを内部から調べた研究。全体の約1.7〜2.6%にあたる少数の注意ヘッドが接地に因果的に効いており、上位20個をマスクすると接地精度が最大80ポイント低下する一方、同数のランダムなヘッドではほとんど影響がなかった。

詳しく読む
cs.CV 2026/08

崩壊を防ぐための足場を外す ― 動画の事前学習を単純にして、計算量を5分の1から20分の1にする「LeVJEPA」

動画から表現を学ぶ自己教師あり学習は、答えが一点に潰れる崩壊を避けるために、複雑な足場を組んできた。本研究は、崩壊しないことが保証された目的関数を使ってその足場を外し、エンコーダと射影器だけの構成にする。同じ条件で従来手法に並びながら、事前学習の計算量が大きく下がったと報告する。

詳しく読む
cs.CR 2026/08

エージェントの安全対策は「合成できない」― 証拠が反復をまたぐ攻撃に対し、1回の軌跡だけを見る監視は真陽性率と偽陽性率が一致してしまう

自律的に回り続けるLLMエージェントについて、現在広く使われている安全策が「1回の軌跡(トラジェクトリ)」を単位に定義され、次の周回で状態が初期化されることを問題として定式化した研究。証拠が複数の反復に分散する攻撃に対しては、どれほど表現力の高い監視でも真陽性率が偽陽性率と等しくなる、という分離結果を示す。

詳しく読む
cs.SE 2026/08

コーディングエージェントが読んでいるのは技術文書ではなかった ― 557セッション・3,033回の参照を追うと、6割は指示ファイルと作業メモ

自律的なコーディングエージェントが、どの文書をいつ参照し、その後に何が起きるかを、557のエージェント作業セッションと33,097件のエージェント発のプルリクエストから実測した研究。ドキュメント操作の60.5%は指示ファイルや作業メモといったエージェント向けの成果物で、古典的な技術文書は10.6%、APIリファレンスは1.3%だった。

詳しく読む
cs.RO 2026/08

放送映像からプロのテニスの「型」を学ぶヒューマノイド ― 計画と追従を分け、実機で崩れる分を速度の適応で埋める

ヒューマノイドロボットに、プロのテニスのサーブとラリーの動きの「型」を放送映像から直接学ばせる枠組みAdaPTの研究。動きを作る計画側と、それを実行する追従側を階層に分け、実機で必ず生じる追従性能の劣化を、速度をランダム化して学習することと動き速度の適応器で補う。

詳しく読む
cs.CV 2026/08

教師が未来を見ていた ― 生成しながら流す動画モデルの蒸留で、教師と生徒の見える範囲を揃える「CMD」

動画を先頭から順に生成しながら操作できるモデルを速くするために、少ないステップで済む生徒を蒸留する。ところが従来の教師はクリップ全体を見てから採点していた。生徒が生成した時点では存在しない未来のフレームや操作に採点が依存する、という不整合を正す研究である。

詳しく読む
cs.CV 2026/08

捨ててよい計算は、時間ではなく視点の側にあった ― 3Dテクスチャ生成を学習なしで2.21倍にする「GeoCache」

3Dモデルの表面に色や質感を付ける生成では、視点ごとにノイズ除去を繰り返すため計算量が大きい。従来の高速化は反復の途中を飛ばしていたが、それでは視点どうしを揃える働きまで失われる。本研究は、幾何的に対応する点の更新を他の視点へ運ぶことで、学習なしに高速化する。

詳しく読む
cs.CY 2026/08

規範データでの微調整が、モデルの「言い訳の型」を変える ― 安全順守から道具的な自己利益へ、ただしシステムプロンプトで上書きできる

AIの訓練や整合に使われる規範データセットは、中立な道徳知識ではなく行動を導く型として働きうる、という視点から行われた実験。規範に反する側で微調整すると、モデルが示す正当化の型が安全順守から道具的な自己利益へ体系的に移り、システムプロンプトはその型を抑えることも引き出すこともできると報告する。

詳しく読む
cs.HC 2026/08

AI安全性評価は「どう測ったか」で結論が変わる ― 同じモデルでもチャットUIとAPI、web検索の有無、繰り返しで結果がずれる

広く使われるLLMについて、チャットUIとAPIという2つの接続方法、web検索の有無、同じプロンプトの複数回実行という条件を変えて挙動を比べた監査研究。web検索を有効にすると精度が最大8ポイント低下し、同じプロンプトの繰り返しで最大21%が一致しない結果になったと報告する。

詳しく読む
cs.CV 2026/08

増え続ける衛星画像に追従しながら、過去の順位を崩さない ― アダプタと順位の蒸留で継続学習する検索「DARAD」

地球観測のアーカイブは増え続けるため、画像と文章を結ぶ検索モデルは新しい概念を学び足す必要がある。ところが学び足すと過去の対応づけが歪む。本研究は、視覚側と文章側にそれぞれアダプタを足し、凍結した以前のモデルを教師にして「順位の構造」を保つ枠組みを示す。

詳しく読む
cs.SE 2026/08

コードを書かせると特定の言語に偏る ― 選んだ理由を後から作ってしまう「幻の根拠」という失敗の型

プロジェクト単位でコードを生成させると、モデルは特定の言語を過剰に選ぶ。本研究はその偏りを測る基盤を作り、選択の理由が要件の検討ではなく容易さによることが多いこと、さらに理由そのものを作り出す場合があることを示している。

詳しく読む
cs.CV 2026/07

見た目が合っていても、形は合っていない ― 観測した時間の外側の表面を測るベンチマーク「FutureSurf」

動く場面の3次元復元は、ほぼ常に撮影された時間の内側で評価されてきた。だが実際の用途が必要とするのは、撮影より後の時刻の形である。本研究は、その将来の表面を正確な正解付きで測る診断用のベンチマークを作り、見た目の良さと形の正しさが統計的に切り離されていることを示す。

詳しく読む
cs.CV 2026/07

610万パラメータでゼロショット単眼深度推定 ― どんなデバイスでも動く軽量モデル「ZipDepth」(ECCV 2026)

単眼深度推定は基盤モデルの登場で頑健なゼロショット汎化を達成したが、計算負荷が大きく組込み・モバイルには載らない。一方、軽量モデルは単一ドメインの自己教師ありに偏り、ドメインシフトで静かに壊れる。ZipDepthは、再パラメータ化可能な効率的エンコーダ・デコーダに、基盤モデルからの大規模マルチドメイン知識蒸留を組み合わせた610万パラメータの小型網。サーバGPUから省電力デバイスまで実時間で動き、5ベンチマークで軽量モデル中最良の精度・効率トレードオフを達成した。ECCV 2026採択・コード公開。

詳しく読む
cs.CL 2026/07

能動エージェントを「本物のDockerコンテナ」で試すベンチマーク ― 5能力・400課題の UniClawBench

日常のツールを操作しユーザーを助ける「能動的(proactive)エージェント」が増えたが、既存ベンチはサンドボックス・単ターン評価に頼り、失敗の根本原因を切り分けにくい。UniClawBenchは、スキル利用・探索・長文脈推論・マルチモーダル理解・クロスプラットフォーム連携の5つの基礎能力を軸に設計した初の能力駆動ベンチ。400の二言語実課題を稼働中のDockerコンテナで段階的チェックポイント評価し、実行者・隠れ監督者・ユーザーの3エージェントで多ターンの人間フィードバックを模擬する。

詳しく読む
cs.AI 2026/07

「アイデアにはゲノムがある」 ― 科学的系譜の推論とアイデア生成を測るベンチ IG-Bench

科学的アイデアは白紙から始まらず、機構を継承し・既知の限界を修理し・過去の断片を組み替える——生物のゲノムのように。既存ベンチはAIがこの継承構造をたどれるかをほとんど測れていない。IG-Benchは、各論文を最小・型付き・根拠づき「アイデアゲノム」の集合で表し、継承・変異・喪失・外部導入・新規挿入を記録するGenomeDiffで整理。1,961の系譜トレース等を10分野で収録。最強システムでも系譜推論の正確一致は27.3%にとどまり、構成的なボトルネックを露呈した。

詳しく読む
cs.AI 2026/07

7.7万人の実ログでみる高等教育のAI学習アシスタント ― 利用実態の大規模記述分析

高等教育のAI学習アシスタント「Syntea」について、通信制課程の学生77,543人の客観的ログデータに基づく大規模な記述分析。従来の教育チャットボット研究は小規模サンプルや自己申告調査に依存し、実際の利用行動の大規模な証拠は乏しかった。分析の結果、Synteaはすでに多くの学習者の学習ルーチンに組み込まれている一方、性別・年齢層・専攻クラスタ・学位・学習モードによって利用パターンが異なることが示された。

詳しく読む
cs.AI 2026/07

ドラレコ映像で「事故を推論できるか」を測る ― 自動運転向けVQAベンチ AUTOPILOT-VQA(CVPR 2026)

視覚言語モデル(VLM)は自動運転のシーン理解や意思決定を改善したが、安全に関わるインシデントを確実に推論できるかの評価は難しい。AUTOPILOT-VQAは、ドラレコ映像理解のためのインシデント中心の視覚質問応答(VQA)ベンチ。実世界の事故・ニアミスを軸に構造化した質問で、天候・照明・交通環境・路面状態・標識・関与主体・事故発生・衝突位置・回避可能性などの安全カテゴリを網羅。物体認識を超えて、時間的に根拠づけられた安全志向の推論を要求する。CVPR 2026コンペの一部として公開。

詳しく読む
cs.AI 2026/07

量子化したLLMは「同じモデル」ではない ― 精度が保たれても挙動が変わる「等価性の幻想」

LLMの量子化(8bit〜2bit)は資源制約下の配備に広く使われるが、評価は精度とパープレキシティに偏っている。本研究は、ベースモデルと量子化版の「正解予測の重なり」を測る決定レベル指標 correctness agreement を導入。タスク性能が保たれて見える中程度の量子化でも挙動の乖離が生じることを示し、Attention重みへの構造的作用として層別に歪みを分析。低ビットで非線形な破断点があり、query/key射影がvalue/outputより一貫して敏感だと報告した。

詳しく読む
cs.LG 2026/07

LLMの「超重要パラメータ」だけを鍛えても失敗する ― 重要さは訓練可能性を意味しない(COLM 2026)

LLMには除去すると性能が桁違いに落ちる個別パラメータ「Super Weights」が知られる。本研究はまず、この劣化が全LLMに一様には起きないことを示す。そして「重要なら選んで鍛えれば効くはず」という直観に反し、Super Weightsを単独で訓練すると精度がランダム当てずっぽうまで落ちることを実証。同数のランダム位置を訓練すると逆にベースラインを上回り、崩壊はスパース性でなくSuper Weight座標を狙ったこと自体に起因する。LoRAは全位置を低ランクで更新して成功。「重要さ≠単独での訓練可能性」を確立した。

詳しく読む
cs.AI 2026/07

「必要な時だけ思い出させる」AI ― 長期タスクエージェントの能動メモリ「Proactive Memory Agent」

長期タスクでは、判断に必要な情報(要件・環境の事実・過去の試行・診断・未完了サブゴール)が伸び続ける軌跡に散らばり、文脈窓に埋もれ・押し出されて判断に効かなくなる(behavioral state decay)。本研究は、行動エージェントを改変せず並走する別の「メモリエージェント」が構造化メモリバンクを更新し、必要な時だけリマインダを注入する枠組みを提案。Terminal-Bench 2.0で+8.3pt、τ2-Benchで+6.8ptのpass@1改善を示した。

詳しく読む
cs.CL 2026/07

引用検証に最高級モデルは要らない ― ディープリサーチの出典検証を行う「審判LLM」の較正

強化学習の報酬モデルとして、評価基準(ルーブリック)を採点する「審判LLM」への依存が高まっている。信頼する前に、審判はどれほど有能である必要があり、どんな偏りを持つかを知る必要がある。本研究は、ディープリサーチ系の引用品質(各主張に出典を付ける課題)でこの較正を検証。人手レビュー済み1,248判断で8つの既製審判を評価し、安価なモデルでも競争力を保つと示した。ただし同じF1でも合格率のドリフトや偽陽性・偽陰性率は大きく異なり、その方向性の偏りこそ強化学習ループが増幅すると警告する。

詳しく読む
cs.SE 2026/07

コードを「手続きの似かた」で検索するリポジトリ級コード生成 ― ProjAgent

リポジトリ級のコード生成は、複雑なファイル間依存とプロジェクト固有の慣習を踏まえて目標関数を実装する必要がある。既存の検索は字句・構造・意味の類似に頼り、識別子や応用領域は違うが「似た手続きロジック」を実装する関数を見落としがち。ProjAgentは手続き的類似(procedural similarity)を明示的な検索信号として導入。目標関数を中間推論ステップに分解し、各ステップで似た手続き挙動の関数をエージェント的に検索、意味検索と統合して豊かな文脈を構築する。静的解析フィードバックで反復修正し、REPOCODで41.14% Pass@1を達成した。

詳しく読む
cs.CY 2026/07

人とAIを組ませると成績はどうなるか ― 平均ではなく個人ごとに見ると、結果が三つの型に分かれた

人とAIの協働の効果は、多くの場合ひとつの平均値として報告される。本研究は個人ごとに見ることで、結果が三つの型に分かれること、そしてどの型に至るかを分けたのがモデルの成績でも認知能力でもなかったことを示す予備的な報告である。

詳しく読む
cs.CY 2026/07

AI監査を実際に動かすための分類 ― リスクの一覧は74以上あるが、ほとんどが「名前を付ける」ところで止まっている

AIのリスクを整理した分類は数多く存在するが、その多くはリスクを列挙するにとどまり、実際にどう測って等級を付けるかまでは示していない。本研究は、一つのリスクを具体的な試験と測定値と等級に落とす層を示し、そのうえで規模を拡げるための分類を公開している。

詳しく読む
分野で見る

AI/ML の分野から探す

arXiv の分類(cs.LG=機械学習・cs.CV=コンピュータビジョン ほか)ごとに、収集済みの論文を新着順で一覧できます。数字は収集件数です。

最新フィード

最近のAI/ML論文 直近40件

AI関連カテゴリの新着論文を投稿日の新しい順に。各論文は arXiv の原文ページへリンクします。

  1. 1
    2026/09/17
  2. 2
    2026/09/17
  3. 3
    2026/09/17
  4. 4
    2026/09/17
  5. 5
    2026/09/17
  6. 6
    2026/09/17
  7. 7
    2026/09/17
  8. 8
    2026/09/17
  9. 9
    2026/09/17
  10. 10
    2026/09/17
  11. 11
    2026/09/17
  12. 12
    2026/09/17
  13. 13
    2026/09/17
  14. 14
    2026/09/17
  15. 15
    2026/09/17
  16. 16
    2026/09/17
  17. 17
    2026/09/17
  18. 18
    2026/09/17
  19. 19
    2026/09/17
  20. 20
    2026/09/17
  21. 21
    2026/09/17
  22. 22
    2026/09/17
  23. 23
    2026/09/17
  24. 24
    2026/09/17
  25. 25
    2026/09/17
  26. 26
    2026/09/17
  27. 27
    2026/09/17
  28. 28
    2026/09/17
  29. 29
    2026/09/17
  30. 30
    2026/09/17
  31. 31
    2026/09/17
  32. 32
    2026/09/17
  33. 33
    2026/09/17
  34. 34
    2026/09/17
  35. 35
    2026/09/17
  36. 36
    2026/09/17
  37. 37
    2026/09/17
  38. 38
    2026/09/17
  39. 39
    2026/09/17
  40. 40
    2026/09/17

出典:arXiv(記述メタデータは CC0 パブリックドメイン)。要約は当サイト独自。原文・PDFは arXiv をご確認ください。

免責: 本サイトは各公式データソースをもとに独自に要約・分類したものです。最新・正確な情報は必ず公式ソースをご確認ください。金融・医療・法務・セキュリティに関する内容は情報整理であり、助言ではありません。本サイトは米国政府の公式サイトではありません。