反応を、電子の移動として解く ― 化学の機構をそのまま学習の対象にする(2026年8月)
化学反応の機械学習は、生成物の分子を新たに生成するか、分子の結合の上で発見的な編集を行うかのどちらかだった。この研究は、反応を電子の占有ベクトル上の離散フローマッチングとしてモデル化している。
詳しく読む研究プレプリントサーバ arXiv の AI・機械学習分野(cs.AI / cs.LG / cs.CL ほか)の論文から注目分を選び、独自要約・要点・出典つきで整理します。本サイトは arXiv 公式ではありません。
本ページは公開研究情報の一般的な整理です。要約は当サイト独自のもので、内容の正確性・最新性は必ず原論文(arXiv)でご確認ください。査読前のプレプリントを含みます。
注目のAI/ML論文を、独自要約・要点・FAQ・出典つきで解説。
化学反応の機械学習は、生成物の分子を新たに生成するか、分子の結合の上で発見的な編集を行うかのどちらかだった。この研究は、反応を電子の占有ベクトル上の離散フローマッチングとしてモデル化している。
詳しく読む機械学習の成果物に危険な内容が含まれていないかを調べる静的な検査ツール3種を比較した研究。一方のツールは判断を下せた範囲では完璧な成績だが、対象の半分では判断そのものを出せていなかった。従来の指標はこの差を隠してしまう。
詳しく読む視覚言語モデル(VLM)が、テキストで指し示された画像の領域を見つけて出力へ結びつける仕組みを内部から調べた研究。全体の約1.7〜2.6%にあたる少数の注意ヘッドが接地に因果的に効いており、上位20個をマスクすると接地精度が最大80ポイント低下する一方、同数のランダムなヘッドではほとんど影響がなかった。
詳しく読む動画から表現を学ぶ自己教師あり学習は、答えが一点に潰れる崩壊を避けるために、複雑な足場を組んできた。本研究は、崩壊しないことが保証された目的関数を使ってその足場を外し、エンコーダと射影器だけの構成にする。同じ条件で従来手法に並びながら、事前学習の計算量が大きく下がったと報告する。
詳しく読む自律的に回り続けるLLMエージェントについて、現在広く使われている安全策が「1回の軌跡(トラジェクトリ)」を単位に定義され、次の周回で状態が初期化されることを問題として定式化した研究。証拠が複数の反復に分散する攻撃に対しては、どれほど表現力の高い監視でも真陽性率が偽陽性率と等しくなる、という分離結果を示す。
詳しく読む自律的なコーディングエージェントが、どの文書をいつ参照し、その後に何が起きるかを、557のエージェント作業セッションと33,097件のエージェント発のプルリクエストから実測した研究。ドキュメント操作の60.5%は指示ファイルや作業メモといったエージェント向けの成果物で、古典的な技術文書は10.6%、APIリファレンスは1.3%だった。
詳しく読む内言を非侵襲で復号する研究には根本的なデータの問題がある。自発的な内なる語りと脳活動を対にした資料は集められない。この研究は黙読を規模の出せる代理課題として扱い、どこまで情報が取り出せるかを問うている。
詳しく読むヒューマノイドロボットに、プロのテニスのサーブとラリーの動きの「型」を放送映像から直接学ばせる枠組みAdaPTの研究。動きを作る計画側と、それを実行する追従側を階層に分け、実機で必ず生じる追従性能の劣化を、速度をランダム化して学習することと動き速度の適応器で補う。
詳しく読むAIエージェントに機能を追加する再利用可能な「スキル」は、悪意ある挙動の配布経路にもなりうる。本研究はその検出を評価する基盤を作り、データの分け方によって検出器の成績が大きく変わることを示している。
詳しく読む結晶の生成モデルは、これまで完全な結晶学的仕様を出せず、空間群は経験的な分布から標本抽出していた。この研究は、物理の自発的対称性の破れに着想を得て、最も対称性の低い事前分布から逆向きにたどる枠組みを提案している。
詳しく読む動画を先頭から順に生成しながら操作できるモデルを速くするために、少ないステップで済む生徒を蒸留する。ところが従来の教師はクリップ全体を見てから採点していた。生徒が生成した時点では存在しない未来のフレームや操作に採点が依存する、という不整合を正す研究である。
詳しく読む3Dモデルの表面に色や質感を付ける生成では、視点ごとにノイズ除去を繰り返すため計算量が大きい。従来の高速化は反復の途中を飛ばしていたが、それでは視点どうしを揃える働きまで失われる。本研究は、幾何的に対応する点の更新を他の視点へ運ぶことで、学習なしに高速化する。
詳しく読むAIの訓練や整合に使われる規範データセットは、中立な道徳知識ではなく行動を導く型として働きうる、という視点から行われた実験。規範に反する側で微調整すると、モデルが示す正当化の型が安全順守から道具的な自己利益へ体系的に移り、システムプロンプトはその型を抑えることも引き出すこともできると報告する。
詳しく読む広く使われるLLMについて、チャットUIとAPIという2つの接続方法、web検索の有無、同じプロンプトの複数回実行という条件を変えて挙動を比べた監査研究。web検索を有効にすると精度が最大8ポイント低下し、同じプロンプトの繰り返しで最大21%が一致しない結果になったと報告する。
詳しく読む地球観測のアーカイブは増え続けるため、画像と文章を結ぶ検索モデルは新しい概念を学び足す必要がある。ところが学び足すと過去の対応づけが歪む。本研究は、視覚側と文章側にそれぞれアダプタを足し、凍結した以前のモデルを教師にして「順位の構造」を保つ枠組みを示す。
詳しく読むプロジェクト単位でコードを生成させると、モデルは特定の言語を過剰に選ぶ。本研究はその偏りを測る基盤を作り、選択の理由が要件の検討ではなく容易さによることが多いこと、さらに理由そのものを作り出す場合があることを示している。
詳しく読む動く場面の3次元復元は、ほぼ常に撮影された時間の内側で評価されてきた。だが実際の用途が必要とするのは、撮影より後の時刻の形である。本研究は、その将来の表面を正確な正解付きで測る診断用のベンチマークを作り、見た目の良さと形の正しさが統計的に切り離されていることを示す。
詳しく読む単眼深度推定は基盤モデルの登場で頑健なゼロショット汎化を達成したが、計算負荷が大きく組込み・モバイルには載らない。一方、軽量モデルは単一ドメインの自己教師ありに偏り、ドメインシフトで静かに壊れる。ZipDepthは、再パラメータ化可能な効率的エンコーダ・デコーダに、基盤モデルからの大規模マルチドメイン知識蒸留を組み合わせた610万パラメータの小型網。サーバGPUから省電力デバイスまで実時間で動き、5ベンチマークで軽量モデル中最良の精度・効率トレードオフを達成した。ECCV 2026採択・コード公開。
詳しく読む日常のツールを操作しユーザーを助ける「能動的(proactive)エージェント」が増えたが、既存ベンチはサンドボックス・単ターン評価に頼り、失敗の根本原因を切り分けにくい。UniClawBenchは、スキル利用・探索・長文脈推論・マルチモーダル理解・クロスプラットフォーム連携の5つの基礎能力を軸に設計した初の能力駆動ベンチ。400の二言語実課題を稼働中のDockerコンテナで段階的チェックポイント評価し、実行者・隠れ監督者・ユーザーの3エージェントで多ターンの人間フィードバックを模擬する。
詳しく読む科学的アイデアは白紙から始まらず、機構を継承し・既知の限界を修理し・過去の断片を組み替える——生物のゲノムのように。既存ベンチはAIがこの継承構造をたどれるかをほとんど測れていない。IG-Benchは、各論文を最小・型付き・根拠づき「アイデアゲノム」の集合で表し、継承・変異・喪失・外部導入・新規挿入を記録するGenomeDiffで整理。1,961の系譜トレース等を10分野で収録。最強システムでも系譜推論の正確一致は27.3%にとどまり、構成的なボトルネックを露呈した。
詳しく読む高等教育のAI学習アシスタント「Syntea」について、通信制課程の学生77,543人の客観的ログデータに基づく大規模な記述分析。従来の教育チャットボット研究は小規模サンプルや自己申告調査に依存し、実際の利用行動の大規模な証拠は乏しかった。分析の結果、Synteaはすでに多くの学習者の学習ルーチンに組み込まれている一方、性別・年齢層・専攻クラスタ・学位・学習モードによって利用パターンが異なることが示された。
詳しく読む視覚言語モデル(VLM)は自動運転のシーン理解や意思決定を改善したが、安全に関わるインシデントを確実に推論できるかの評価は難しい。AUTOPILOT-VQAは、ドラレコ映像理解のためのインシデント中心の視覚質問応答(VQA)ベンチ。実世界の事故・ニアミスを軸に構造化した質問で、天候・照明・交通環境・路面状態・標識・関与主体・事故発生・衝突位置・回避可能性などの安全カテゴリを網羅。物体認識を超えて、時間的に根拠づけられた安全志向の推論を要求する。CVPR 2026コンペの一部として公開。
詳しく読むLLMの量子化(8bit〜2bit)は資源制約下の配備に広く使われるが、評価は精度とパープレキシティに偏っている。本研究は、ベースモデルと量子化版の「正解予測の重なり」を測る決定レベル指標 correctness agreement を導入。タスク性能が保たれて見える中程度の量子化でも挙動の乖離が生じることを示し、Attention重みへの構造的作用として層別に歪みを分析。低ビットで非線形な破断点があり、query/key射影がvalue/outputより一貫して敏感だと報告した。
詳しく読むLLMには除去すると性能が桁違いに落ちる個別パラメータ「Super Weights」が知られる。本研究はまず、この劣化が全LLMに一様には起きないことを示す。そして「重要なら選んで鍛えれば効くはず」という直観に反し、Super Weightsを単独で訓練すると精度がランダム当てずっぽうまで落ちることを実証。同数のランダム位置を訓練すると逆にベースラインを上回り、崩壊はスパース性でなくSuper Weight座標を狙ったこと自体に起因する。LoRAは全位置を低ランクで更新して成功。「重要さ≠単独での訓練可能性」を確立した。
詳しく読む長期タスクでは、判断に必要な情報(要件・環境の事実・過去の試行・診断・未完了サブゴール)が伸び続ける軌跡に散らばり、文脈窓に埋もれ・押し出されて判断に効かなくなる(behavioral state decay)。本研究は、行動エージェントを改変せず並走する別の「メモリエージェント」が構造化メモリバンクを更新し、必要な時だけリマインダを注入する枠組みを提案。Terminal-Bench 2.0で+8.3pt、τ2-Benchで+6.8ptのpass@1改善を示した。
詳しく読む強化学習の報酬モデルとして、評価基準(ルーブリック)を採点する「審判LLM」への依存が高まっている。信頼する前に、審判はどれほど有能である必要があり、どんな偏りを持つかを知る必要がある。本研究は、ディープリサーチ系の引用品質(各主張に出典を付ける課題)でこの較正を検証。人手レビュー済み1,248判断で8つの既製審判を評価し、安価なモデルでも競争力を保つと示した。ただし同じF1でも合格率のドリフトや偽陽性・偽陰性率は大きく異なり、その方向性の偏りこそ強化学習ループが増幅すると警告する。
詳しく読むリポジトリ級のコード生成は、複雑なファイル間依存とプロジェクト固有の慣習を踏まえて目標関数を実装する必要がある。既存の検索は字句・構造・意味の類似に頼り、識別子や応用領域は違うが「似た手続きロジック」を実装する関数を見落としがち。ProjAgentは手続き的類似(procedural similarity)を明示的な検索信号として導入。目標関数を中間推論ステップに分解し、各ステップで似た手続き挙動の関数をエージェント的に検索、意味検索と統合して豊かな文脈を構築する。静的解析フィードバックで反復修正し、REPOCODで41.14% Pass@1を達成した。
詳しく読む計算による創薬は、標的タンパク質や分子の性質を条件に分子を生成してきた。この研究は、そこに疾患の文脈を加え、疾患オントロジーと標的タンパク質の配列の両方を条件として小分子を設計するモデルを提案している。
詳しく読む人とAIの協働の効果は、多くの場合ひとつの平均値として報告される。本研究は個人ごとに見ることで、結果が三つの型に分かれること、そしてどの型に至るかを分けたのがモデルの成績でも認知能力でもなかったことを示す予備的な報告である。
詳しく読むAIのリスクを整理した分類は数多く存在するが、その多くはリスクを列挙するにとどまり、実際にどう測って等級を付けるかまでは示していない。本研究は、一つのリスクを具体的な試験と測定値と等級に落とす層を示し、そのうえで規模を拡げるための分類を公開している。
詳しく読む出典:arXiv(記述メタデータは CC0 パブリックドメイン)。要約は当サイト独自。原文・PDFは arXiv をご確認ください。