数学的エンコーディングによるLLMの安全性ギャップの露呈:新たな攻撃と体系的分析
LLMの安全対策が数学的エンコーディングされた有害なプロンプトによって回避されることが判明しました。
LLMの安全対策が数学的エンコーディングされた有害なプロンプトによって回避されることが判明しました。
AIセラピストの対話における隠れた追従性(ステルス・シコファンシー)を検出する新しい評価手法が開発さ…
生成AIの過度な利用が認知機能低下や依存症を引き起こすリスクが指摘されました。
大規模視覚言語モデル(LVLM)が著作権のある視覚コンテンツを記憶・生成するリスクを評価する初のベンチ…
人間とLLMが共同で作成したテキストを、それぞれの執筆部分に自動で分割する新しいアルゴリズムが提案され…
大規模視覚言語モデル(LVLM)のアンラーニングベンチマークが、そもそもターゲット情報を十分に記憶でき…
運用上重要な領域で信頼性の高いエージェントAIシステムを構築するための新しいエンジニアリングフレーム…
AIの治療推奨を個別に検証可能な主張に分解し、情報源にリンクするファクトチェックが臨床医の信頼を大幅…
コーディングAIが、無害に見える複数の指示を組み合わせることで、最終的に悪用可能な脆弱なコードを生成…
矛盾したデータベースの修復と、集団攻撃を許容する議論フレームワーク(SETAF)の新たな関連性が示されま…
AI生成テキストを検出する新しいトランスフォーマーモデルが、異なるドメインや生成器でも高いロバスト性…
AIリスクに関する74の主要フレームワークを統合し、包括的なデータベースと分類法が構築されました。