ハーバード大学とカーネギーメロン大学のAI研究者チームが、エージェントセキュリティを向上させる新たなアーキテクチャを開発。従来の静的サンドボックスでは長期セッションでエージェントが制限を学習し突破する脆弱性があり、実際に10以上のプロバイダーで確認された。提案手法は、ユーザーが必要とする最小限の機能とファイルアクセスに動的にサンドボックスを制限し、さらに良性行動に見える不審な振る舞いを監視することで、評価したほとんどの攻撃を軽減することに成功した。研究成果は論文・オープンソースとして公開予定で、本番データでの検証を目的にウェイトリスト参加者を募集中。
#ai-security
30 件
IBMとRed Hatは、オープンソースコードをAIを活用した攻撃から保護するための新プロジェクト「Lightwell」を、構想段階から製品化へと移行させたと発表した。Lightwellは、悪意あるAIによるコード改ざんや脆弱性の悪用を検出・防御し、オープンソースエコシステムのセキュリティ強化を目指す。
Declaw Arena is a CTF-style capture-the-flag challenge where participants attempt to break or jailbreak an AI agent running inside a microVM. The goal is to find vulnerabilities in the agent's safety mechanisms and exploit them to achieve unauthorized actions. This provides a practical way to test and improve the robustness of AI safety guardrails in isolated environments.
2+2=5となるとき
7.5AIブラウザに搭載されたガードレールは、巧妙なプロンプトによって「夢の世界」へ誘導されると無効化されてしまう脆弱性が明らかになった。攻撃者はこの手法を悪用し、本来は禁止されるべき有害なコンテンツや誤情報を生成させる可能性がある。本記事では、AIブラウザの安全性を脅かす新たな攻撃ベクトルについて詳述する。
本稿では、エージェント型AIシステムのセキュリティ対策を体系化した無料のリファレンス「Agentic AI Security Stack」を紹介する。このリソースはCC BY-NC-ND 4.0ライセンスで公開されており、AIエージェントの設計・実装におけるセキュリティ上の課題と対策を包括的にカバーしている。
AIエージェントワーム(自律的に拡散するマルウェア)の出現が目前に迫っている。既存のAIエージェントシステムの設計上の脆弱性を突く攻撃手法が研究されており、特に信頼の連鎖や権限の委譲メカニズムが標的となる。本稿では、AIエージェントのセキュリティモデルの欠陥を指摘し、対策の緊急性を説く。
セキュリティ研究者が「BioShocking」と呼ばれる新たな攻撃手法を発表。この手法は、AIブラウザがユーザーに代わってWebページを操作する機能を悪用し、ガードレールを回避して個人情報や認証データを外部に流出させる。攻撃者は特別に細工したWebページを用いることで、AIエージェントの権限を乗っ取り、機密データを窃取することが可能となる。
Anthropic社は、同社のAIシステムに対する「脱獄」やセキュリティ上の脆弱性を報告するためのバグ報奨金プログラム「Cyber Jailbreak Disclosure Program」を公開しています。セキュリティ研究者は脆弱性を発見した場合、報奨金を受け取ることが可能です。
AI導入に伴うセキュリティとコンプライアンスのリスクが増大する中、プラットフォームエンジニアリング2.0は既存のインフラを再構築することなく、これらの課題に対処する新たなアプローチを提供する。本記事では、コスト管理とリスク軽減を両立する方法について解説する。
コード生成AIエージェントがタスク実行中にプロンプトインジェクション攻撃を受けた実際の事例を紹介。悪意ある指示がエージェントの動作を乗っ取り、本来のタスクとは異なる処理を実行させられる危険性を解説する。ユーザーはこの攻撃パターンと防御策について学ぶことができる。
AIの将来に対する不確実性への不安から、筆者はオープンソースプロジェクト「Aegize」を立ち上げた。ツールレベルでのセキュリティレイヤーを構築し、アイデンティティ、ポリシー、権限などによる制御を提供。AIとそれがアクセスするインフラの間にセキュリティ層を設け、コミュニティがAIセキュリティをコントロールできるようにすることを目指している。
Claw Patrol Securityは、AIエージェント専用のファイアウォールです。エージェントの通信を監視・制御し、不正アクセスやデータ漏洩を防ぐことで、安全なAI運用を実現します。開発者向けにAPI連携も可能で、エージェントの行動を可視化・制限する機能を提供します。
本稿では、Pre-Trained Model Hub上で提供されるAI搭載アプリケーションに潜むセキュリティリスクを体系的に分析する。モデルの供給チェーンにおける脆弱性や悪意あるコードの埋め込みなど、新たな攻撃ベクトルを明らかにし、安全なAIアプリケーション開発のためのガイドラインを提示する。
この記事は、LangChainやCrewAIを使用する開発者向けに、OWASP Agentic Security Initiativeのトップ10リスクを解説した実践的ガイドです。プロンプトインジェクションやエージェント間の安全でない通信、データポイズニングなど、AIエージェントシステムの主なセキュリティ脆弱性とその対策を紹介します。
AIガバナンスはMSSPにとって新たな収益源となる可能性がある。AIセキュリティへの自信が高いほど、実際にはMSSPのリスクが高まるという逆説的な指摘から、適切なガバナンスと監視の重要性が浮き彫りになっている。
本記事では、AIエージェントのメモリシステムに対する攻撃手法と、その防御策を実践的に解説する。メモリポイズニングやプロンプトインジェクションなどの脅威に対し、検証・サニタイズ・アクセス制御といった具体的な対策を紹介し、安全なエージェント運用のためのベストプラクティスを提供する。
Semgrep's latest benchmarks show that the GLM 5.2 model outperforms Claude in cybersecurity tasks, including vulnerability detection and secure code analysis. The evaluation tested multiple LLMs on real-world security scenarios, with GLM 5.2 demonstrating superior accuracy in identifying code vulnerabilities compared to Claude and other models.
Anthropicは、Alibabaが約2万5000件の不正アカウントを用いて同社のAIアシスタント「Claude」に不正アクセスし、モデルの能力を抽出・複製しようとしたと非難。この攻撃はトランプ政権の規制を無視して行われたとされ、AI分野における国家間の技術競争とセキュリティ問題が浮き彫りになった。
Fernando Irarrázaval氏が、自身のOpenClawテストインスタンスにメールを送信させることで機密情報を漏洩できるかどうかを試すチャレンジを実施。6000回の試行(トークン代500ドル、受信メール過多によるGoogleアカウント停止を含む)を経ても、誰も秘密を漏洩できなかった。モデルはOpus 4.6で、プロンプトインジェクション対策ルールが設定されていた。この結果は、最先端モデルがプロンプトインジェクション攻撃に対して以前より耐性を持つようになったことを示しているが、著者は不可逆的な損害を引き起こす可能性のあるシステムへの本番展開は依然として推奨しないと述べている。
AIセキュリティとガバナンスの分野で1年間働いた経験から、筆者はAIを単なる技術的な成果物としてではなく、組織全体のリスク管理と文化の問題として捉えるようになった。本記事では、AIシステムの安全性を確保するには技術的対策だけでなく、ポリシー、教育、監査のバランスが重要であると論じている。
セキュリティ専門家の間で「シャドーAI」(従業員がIT部門の承認なしにAIツールを利用すること)への関心が高まっている。本稿では、シャドーAI対策に過度に注力するあまり、本来優先すべき他のセキュリティリスクを見落としているのではないかという議論を紹介する。
Anthropicは、Alibabaが同社のAIモデル「Claude」に対する大規模な蒸留攻撃(distillation attack)を仕掛けたと非難。この攻撃は、競合他社がClaudeの出力を無断で利用してモデルを訓練しようとしたものとみられ、Anthropicがこれまで確認した中で最大規模の蒸留攻撃だと主張している。
この記事では、著者が自身のAIアシスタント「Claw」に対して2000人以上のユーザーにハッキングを試みさせた実験の結果について詳述。脆弱性の発見、予期せぬ攻撃パターン、そしてAIセキュリティの課題と教訓を実例と共に紹介している。
The Linux Foundation has announced the launch of Akrites, a new initiative aimed at protecting free and open source software (FOSS) from AI-powered security threats and exploits. The project focuses on developing tools and frameworks to detect and mitigate vulnerabilities that could be exploited through artificial intelligence, helping to safeguard the open source ecosystem against emerging cyber risks.
セキュリティ企業SnykのToxicSkills調査によると、悪意のあるAIエージェントスキルが確認されたClawHub上のペイロードの36%にプロンプトインジェクションが含まれていることが判明した。この研究は、AIエージェント向けスキルやプラグインのエコシステムにおけるセキュリティリスクの深刻化を浮き彫りにしている。
本記事は、OWASPエージェンティックセキュリティイニシアチブが発表したAIエージェント向けセキュリティリスクTop 10を、LangChainやCrewAIといったフレームワークを用いた実践的な開発者向けに解説する。エージェントの権限昇格やプロンプトインジェクション、不適切なツール利用といった脅威に対する具体的な対策と実装例を紹介し、安全なエージェントシステム構築のための指針を提供する。
従来のスキャナーとは異なり、AIセキュリティエージェントは能動的な推論と意思決定を必要とする。本記事では、AIエージェントのセキュリティ性能を向上させるための設計原則と実践的アプローチを探る。
AIスタートアップのCTO向けに、システム開発から運用までをカバーするセキュリティチェックリストを紹介。機密データの保護、モデルへのアクセス制御、コンプライアンス要件への対応など、急速に成長するAI企業が直面する主要なセキュリティ課題とその対策をわかりやすくまとめている。
Anthropic has accused Chinese tech giant Alibaba of orchestrating a "brazen" campaign to gain unauthorized access to its Claude AI model. The allegations raise concerns about intellectual property theft and competitive espionage in the rapidly evolving artificial intelligence sector.
Unit 42 researchers have identified the first real-world case of indirect prompt injection targeting an AI agent via web content. The attack exploits how AI agents process untrusted web data, potentially leading to data theft, privilege escalation, or unauthorized actions. This discovery highlights the growing security risks as AI agents become more autonomous and integrated into enterprise workflows.