文脈に応じたルーブリック報酬による交互強化学習:スカラー化戦略を超えて
多次元のルーブリック報酬をスカラー化せず、交互に最適化する新しい強化学習フレームワークが提案されま…
多次元のルーブリック報酬をスカラー化せず、交互に最適化する新しい強化学習フレームワークが提案されま…
強化学習エージェントが制御できる観測空間の次元を、介入的境界発見(IBD)という手法で特定しました。
連続空間における後続表現学習で、時間的抽象化がスペクトル不整合を緩和するメカニズムとして機能するこ…
長尺動画の質問応答において、入力フレーム数を最適化する新しいフレーム選択手法が提案されました。
主要な大規模言語モデルが、誤った情報を生成する際に最も高い自信を示すことが判明しました。
大規模言語モデルの圧縮時に生じる誤差の伝播メカニズムを解明し、効率的な圧縮戦略を提案しました。
LLMの推論能力を向上させる「P^2O」という新しい学習手法が開発されました。
ニューラルネットワークの訓練における相転移現象が、パラメータ更新のグラム行列のスペクトルギャップに…
小規模なGPT-2モデルを使い、多言語環境での言語習得をシミュレートする研究が行われました。
新しい言語モデルアーキテクチャ「Multiscreen」が、従来のTransformerよりも効率的で安定した性能を示し…
MAT-Cellは、LLMとマルチエージェント推論を組み合わせ、単一細胞の自動アノテーション精度を向上させるフ…
フローモデルと拡散モデルの報酬ベース微調整手法を「報酬スコアマッチング(RSM)」という共通フレームワ…