Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs
マルチモーダルLLMの安全機構を回避する新しいジェイルブレイク攻撃手法が提案されました。
マルチモーダルLLMの安全機構を回避する新しいジェイルブレイク攻撃手法が提案されました。
安全性が重要な自動目標認識(ATR)システムにおける説明可能なAI(XAI)の限界が指摘されました。
マルチモーダルLLMの継続的なアンラーニングを評価する新ベンチマーク「ICU-Bench」が発表されました。
異種混合型連合学習において、プロトタイプアライメントの新しい手法「構造アライメント」が提案されまし…
現在の生成AI開発が社会経済状況と密接に結びついていること、およびAGIの概念的・定義的問題点を批判的に…
深層強化学習におけるバックドア攻撃をオンラインで防御する新手法「BehaviorGuard」が発表されました。
不確実な動的システムの安全性を、新しいカーネル埋め込みフレームワークで直接認証する研究が発表されま…
LLMによる安全評価の信頼性を測る「ポリシー不変性」という新たな評価基準が提案されました。
アルゴリズムの短期・長期的な公平性と効用のトレードオフを研究する論文が発表されました。
部分観測下でのエージェントの行動原理を「ブリッジインターフェース」理論で分析する研究が発表されまし…
AIが動画から人物の性格を理解する際のバイアスを低減する新手法が開発されました。
AIによるAIアライメント研究の自動化が、意図せず危険なAIを導入するリスクを指摘する論文が発表されまし…