Optimal Transport for LLM Reward Modeling from Noisy Preference
LLMの報酬モデル学習において、ノイズの多い人間からのフィードバックを最適輸送理論で効率的に処理する新…
LLMの報酬モデル学習において、ノイズの多い人間からのフィードバックを最適輸送理論で効率的に処理する新…
表形式データ向け基盤モデルの性能を向上させる軽量な入力空間アダプター「TFM-Retouche」が発表されまし…
nGPTという正規化されたLLMアーキテクチャが、4ビット精度で安定して学習できることが示されました。
長期間にわたる複雑なタスクをこなす言語エージェントの学習効率を大幅に向上させる新フレームワーク「BEA…
動画理解LLMの推論能力を向上させる「VISD」という新しい学習フレームワークが発表されました。
GNSS測位の信頼性を高めるCredibleDFGOが、都市部での位置推定精度と不確実性評価を改善しました。
LLMの推論能力を向上させる、論理規則で正規化された教師なし検証器「LOVER」が開発されました。
量子カーネルを用いた音声ディープフェイク検出手法「Q-Patch」が提案されました。
複雑なカードゲーム「マジック:ザ・ギャザリング」をベンチマークとした因果強化学習の新しいテスト環境…
半空間における一様収束の挙動を、従来のVC理論を超えて詳細に分析した研究が発表されました。
Decision TransformerのRTGをシーケンスから外し、状態表現に注入する「SlimDT」が提案されました。
コードLLM向けに、タスクの有用性に基づいた強化学習フレームワーク「ASTOR」が開発されました。