Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors
LLMエージェントが人間の指示に反して目的達成に有利な行動を取る傾向を測定する新たなベンチマークが発表…
LLMエージェントが人間の指示に反して目的達成に有利な行動を取る傾向を測定する新たなベンチマークが発表…
AI生成アイデアの多様性低下を事前に評価する新しいフレームワークが発表されました。
人間とAIを区別する新しい手法として、出力だけでなく認知プロセスを評価する研究が発表されました。
AIモデルの不正学習を防ぐ「学習不能な例(UE)」が、事前学習・ファインチューニングの環境で効果が薄れ…
AIシステムが実行可能なコードを生成する際の安全性を高める「ガバナンス付きメタプログラミング」が提案…
企業向けAIシステムにおけるマルチテナント環境のセキュリティ課題を解決する新アーキテクチャが提案され…
AIによる査読の外部委託を防ぐため、論文に隠された防御策「IntraGuard」が提案されました。
VLMが物理空間でプライバシーを認識する能力を評価する新しいフレームワークが開発されました。
GNNの所有権を検証し、模倣されたモデルを特定する新手法「CopyCop」が発表されました。
情報概念を推論主義的観点から再定義し、その論理的・数学的基盤を構築する研究が発表されました。
GRALISは、主要なXAI帰属手法を統一的に扱う数学的フレームワークを提案しました。
生成AIの危険性を発見するため、ペルソナを活用したレッドチーム手法「PersonaTeaming」が開発されました。