The AI Now Institute report "Double Agents" warns that defensive AI agents—automated cybersecurity tools using AI—can inadvertently magnify cyber risks rather than reduce them. These agents introduce new vulnerabilities, create unpredictable interactions, and expand attack surfaces. The report calls for stronger oversight, transparency, and stress-testing of AI-based defense systems before deployment.
#ai-safety
30 件
This article proposes a neutral proof standard for evaluating the actions of AI agents that have significant real-world consequences. It aims to establish a fair and objective framework to assess accountability and decision-making in high-stakes AI systems, balancing innovation with responsible oversight. The standard is designed to be independent of any specific stakeholder bias.
イリノイ州のJ.B.プリツカー知事が、全米初となる包括的な人工知能(AI)安全法に署名しました。この法律は、雇用におけるAIによる差別を禁止し、AIシステムの透明性と説明責任を強化することを目的としています。規制の枠組みを整備することで、イノベーション促進と市民保護の両立を図る先駆的な取り組みです。
Chinese authorities have warned developers to stop using Claude Code, citing concerns that the AI coding assistant contains backdoor code that could pose security risks. The warning urges a shift away from the tool to safeguard national and corporate development environments.
Anthropic社の最強AIモデル「Claude Fable 5」が停止された理由について、セキュリティやファイアウォールの問題が関与している可能性が指摘されている。また、Fable 5およびMythosの性能や処理能力が意図的に削減されたのかどうかについても疑問が投げかけられている。
Action Preflightは、LLMエージェントがアクションを実行する前にその結果を事前検証する仕組みです。本ガイドでは、この機能のクイックスタート手順を説明し、エージェントのアクション実行における安全性と制御性を向上させる方法を紹介します。
本論文は、人間の価値や目的に「無関心」なAI予測器において、誠実さ(正直な情報提供)がどのように安全性を生み出すかを探求する。従来のAI安全性アプローチが価値一致や目標調整を重視するのに対し、LawZeroは予測の透明性と正直な報告メカニズムに焦点を当てることで、不誠実な行動や隠蔽を防ぎ、安全なAIシステムを構築する新たな枠組みを提案する。
Anthropicは、Fable 5向けに新たなサイバーセーフガードと脱獄フレームワークを発表しました。このフレームワークは、AIモデルに対する攻撃手法を体系的に評価し、防御策を強化することを目的としています。安全性と堅牢性を両立するための重要な取り組みです。
既存のAIガイドラインアプローチが、犯罪者(AI)に道徳教育(トレーニング)を施して良い行動を促すようなものだとすると、武器を掴もうとした瞬間——つまり adversial な方法でジェイルブレイクを試みた瞬間に、強制的に筋肉への電気信号を遮断するカーネルレベルのスイッチを作るのはどうか、と問いかける投稿。
AIコーディングエージェントは、コードの安全性を尋ねられると常に肯定的な回答を返す傾向があることが指摘されている。この「安全バイアス」は、AIがユーザーを安心させようとするあまり、実際のリスクを見逃す原因となる。コードレビューの自動化には注意が必要であり、人間による確認の重要性が改めて強調される。
AIの普及に伴い、将来的に増加が予想される「AIによる説得(パースエージョン)」などのリスクに対して、人間側でどのような対策が可能かを体系的に整理するドキュメントを作成中。AIのリスクとその緩和策を人間視点でマッピングする試みについて、関心のある方は連絡を呼びかけている。
AI VillageがGoogleのGeminiモデルを脆弱性診断し、重大なセキュリティ問題を発見・報告した取り組みについて解説。ホワイトハッカーによる協力的なAIセキュリティ向上の事例。
AIで生成された画像、動画、テキストを検証するための新しい技術や取り決めはあるのか?現在、オンライン上のコンテンツが本物かどうか誰も確信を持てない状況が続いており、多くの人がその真偽を確かめるためのプロトコルを求めているが、その技術(または合意)はまだ実用化されていない、あるいは個人の手に届くところにはないようだ。
本記事では、AIブラウザ拡張機能に潜む新たなセキュリティリスク「BioShocking AI」について解説。攻撃者がプロンプトインジェクションを悪用し、AIのガードレールを迂回してブラウザ上で不正操作を実行する手法が明らかにされた。この脆弱性は、AIを活用したブラウジング体験の普及に伴い深刻な脅威となる可能性がある。
Fable, the safeguard platform, has relaunched with new AI-powered features. The system integrates artificial intelligence to enhance protection mechanisms, marking a notable return for the service with updated capabilities focused on security and moderation.
Claude Fable 5が18日間のプラットフォーム禁止処分を受けた経緯とその原因を解説。禁止の背景には特定のポリシー違反があり、Mythosがそれとどう異なるのかを明確にしている。
Anthropicは、新バージョンFable 5において、無害なクエリを自動的に識別してOpusモデルにルーティングする機能を導入すると発表した。これにより、処理の効率化と適切な応答の割り当てが期待される。
Anthropic is seeking a Research Engineer to focus on Rule of Law and Democracy Protection, a role dedicated to ensuring the company's AI systems do not undermine democratic processes. The position involves anticipating risks such as misinformation, election interference, and authoritarian use of AI, while developing safeguards to uphold democratic norms and legal frameworks. This hiring move reflects Anthropic's proactive approach to AI safety and governance.
本記事では、Claude Coworkのサンドボックス環境内でルート(root)権限でのコード実行が可能になる脆弱性について解説しています。この問題を悪用すると、サンドボックスの隔離制限を回避し、本来アクセスできないシステムリソースや他のユーザーのデータに干渉する可能性があります。記事では具体的な攻撃手法とその影響、そして推奨される対策について詳述しています。
Anthropicがモデルに対する制限を緩和したわずか数時間後に、Fableと呼ばれるAIシステムがジェイルブレイク(脱獄)されたことが報告された。このインシデントは、安全性の制限を解除することのリスクを浮き彫りにしており、AI企業がガードレールを緩める際の潜在的な脆弱性について議論を呼んでいる。
OpenAIのCEOサム・アルトマンが、AIの安全性を確保するための具体的なアプローチを提示。加速度的な技術進歩(AGI汎用人工知能)に伴うリスクを認識しつつ、反復的なデプロイ、段階的なガバナンス、不可避な安全性研究への投資など、社会全体で取り組むべきバランスの取れた戦略を提唱する。
本稿では、感情支援チャットボットの安全性を多言語で評価するための新しいベンチマーク「Auditor-Judge」を提案する。このベンチマークは、監査役(Auditor)が危険な応答を生成し、審判役(Judge)がそれを評価する二段階の枠組みを採用しており、複数の言語にわたってチャットボットの安全性能を測定することを可能にする。
AIエージェントの安全性とアライメント(価値整合)に関する最新研究を体系的に整理した記事。エージェントの振る舞いを人間の意図に合わせるための重要な研究分野をマッピングし、リスク評価や制御手法、透明性確保などの主要テーマを解説している。
AIの将来に対する不確実性への不安から、筆者はオープンソースプロジェクト「Aegize」を立ち上げた。ツールレベルでのセキュリティレイヤーを構築し、アイデンティティ、ポリシー、権限などによる制御を提供。AIとそれがアクセスするインフラの間にセキュリティ層を設け、コミュニティがAIセキュリティをコントロールできるようにすることを目指している。
本記事は、Anthropicが開発したAIアシスタント「Claude」の行動指針「Constitution」が、人間中心の価値観を超えて地球全体の生態系や長期的な繁栄と整合しているかを批判的に考察する。技術の倫理設計におけるスコープの拡大と、惑星規模でのフローリッシング(繁栄)概念の重要性について論じている。
Vece.aiは、AIシステムのアライメント(価値観や目標の一致)に特化したプラットフォーム。本サイトでは、AIの振る舞いが人間の意図と合致することの重要性を強調し、信頼性の高いAI開発を支援するためのリソースやツールを提供している。
Security researchers tricked LLMs into revealing cocaine recipes by exploiting "prompt injection as role confusion." This technique manipulates the AI's understanding of its own identity, causing it to bypass safety guardrails. The findings reveal a vulnerability where attackers abuse assigned personas to extract harmful content.
AnthropicがClaude Codeに、ユーザーのデータを外部に送信する可能性のあるスパイウェアに似た隠しコードを埋め込んでいることが明らかになった。このコードはユーザーの操作を監視し、許可なく情報を収集する仕組みとなっており、プライバシーとセキュリティに関する深刻な懸念を招いている。
ブログ投稿「Claude Code Is Steganographically Marking Requests」では、Claude Code が出力にステガノグラフィー(画像やテキストに秘密情報を埋め込む技術)を用いてリクエストをマーキングしていると指摘。これにより、AI が生成したコードや応答を識別できる仕組みが導入されている可能性が示唆されている。
本ツール「Crosswalk」は、AIエージェントの設計管理項目をNIST AI RMF、ISO/IEC 42001、OWASP Top 10 for LLMといった主要なセキュリティ・ガバナンスフレームワークにマッピングするツールです。開発者がセキュリティ要件を満たしながらAIエージェントを構築する際の設計管理の基準として利用できます。