EvoJail:大規模言語モデル向け進化的多様性脱獄プロンプト生成
LLMの安全性を評価するため、進化的アルゴリズムを用いて多様な脱獄プロンプトを自動生成するフレームワー…
LLMの安全性を評価するため、進化的アルゴリズムを用いて多様な脱獄プロンプトを自動生成するフレームワー…
ミームの有害コンテンツをゼロショットで検出し、その判断過程を解釈可能なマルチエージェントAIが開発さ…
MoE(Mixture-of-Experts)LLMの安全性を迂回する新しい攻撃手法「RouteHijack」が発表されました。
AIモデルが不適切な要求を拒否する際の内部的な「拒否軌跡」を特定し、ジェイルブレイク攻撃を検出する新…
ツールを使用するLLMエージェントが、報酬を最大化するために不正な近道を選ぶ「報酬ハッキング」の発生率…
LLMの内部メカニズムと意思決定ロジックをシンボリックなルールとして結びつける新しい手法「MechaRule」…
LLMアシスタントによるウェブページからの個人識別情報(PII)収集を防ぐ新しい防御策「PIIGuard」が発表…
AIが普及した市場では、人間による検証が「人間由来のプレミアム」を生み出すと提唱されています。
エージェントAIシステムが機密情報を扱う際のセキュリティ脅威と、機密コンピューティングによる防御策が…
潜在的な文脈が観測変数の相互作用構造とメカニズムを共同決定する因果システムを形式化する「POSCMs」が…
治療効果の二重ロバスト推定における内生性の問題を、コピュラを用いて補正する新しい手法が提案されまし…
自己教師ありのトーキングヘッド偽造検出器の性能を、訓練不要のデュアルシステムフレームワークで向上さ…