AI制御のためのゲーム:AI展開プロトコルの安全性評価モデル
信頼できないAIの展開プロトコルを評価する「AI制御ゲーム」という形式的な意思決定モデルが提案されまし…
AI&Tech、もう追いかけなくていい。
30秒で読めるニュースダイジェスト
信頼できないAIの展開プロトコルを評価する「AI制御ゲーム」という形式的な意思決定モデルが提案されまし…
差分プライバシーを保証する合成テキスト生成の統一評価フレームワーク「SynBench」が発表されました。
AIエージェントの安全性課題に対し、プログラミング言語ベースの「安全ハーネス」を提案しました。
自律エージェントの評価における既存の課題を解決するため、人間が検証した300のタスクを含む新しい評価ス…
AIの安全性、バイアス、法的問題を解決するため、オークションベースの新しい規制メカニズムが提案されま…
機械学習の積カーネルモデルに対し、厳密なShapley値を償却線形時間で計算する新アルゴリズム「PKeX-Shapl…
LLMの特定の振る舞いを司る内部回路を、帰属誘導型プルーニングで発見し修正する手法が開発されました。
ロールプレイングゲームとLLMを組み合わせ、デジタルシステムユーザーの道徳的プロファイルを要件定義で抽…
AI生成動画の検出において、透かしが検出精度に与える影響を評価する新しいベンチマーク「RobustSora」が…
多エージェントAIシステムにおける談合行為に対し、人間社会の防止メカニズムを適用する研究が発表されま…
AIモデルの精度と説明可能性を両立させるための新しいフレームワーク「IGBO」が提案されました。
因果関係発見アルゴリズムのアンサンブルに、専門家の知識を動的に組み込む新しい手法が提案されました。