Leviathan: 言語モデルにおける入力と出力表現の分離
言語モデルの入力埋め込みと出力射影を分離する新しいTransformerアーキテクチャ「Leviathan」が発表され…
言語モデルの入力埋め込みと出力射影を分離する新しいTransformerアーキテクチャ「Leviathan」が発表され…
LLMが標準アメリカ英語以外の英語方言を認識し、自然な対話を生成する能力を向上させるフレームワークが開…
勾配降下法がニューラルネットワークの理論的容量をタスクに適合する実効容量に削減するメカニズムが解明…
トランスフォーマーがパリティ問題を解くために必要な最小層数が2層であることを証明しました。
自律型機械学習エンジニアリングにおいて、エージェントの行動停滞を克服する新しい強化学習フレームワー…
マルチモーダルLLMが複雑な推論タスクで生成する情報の信頼性を評価する新しいベンチマークが発表されまし…
Visual Para-Thinkerは、画像理解において並列推論を導入する初のマルチモーダルLLMフレームワークです。
大規模言語モデルの報酬モデルにおいて、CAMELという新しいフレームワークが開発されました。
PPG波形と自然言語を結びつける大規模なPPG-テキスト質問応答データセット「PulseLM」が公開されました。
医療分野の質問応答において、大規模言語モデルが事実と異なる情報を生成するハルシネーションの発生率が…
大規模言語モデルの知識編集において、精度と編集性の両立を改善する新手法「MetaKE」が提案されました。
LLMが臨床文書から病名コード(ICDコード)を割り当てる際、その根拠となるテキスト証拠を効率的に学習す…