概ね事実
OpenAIのシステムに対し、AnthropicのClaudeを活用して脆弱性を特定し、72時間以内に侵入することに成功した手法が明らかになった。関係する推薦文書はHTMLとスクリーンショットの形式で証憑が保存され、sha256による記録が残されているという。
明らかになったのは、大規模言語モデル(LLM)であるClaudeを解析ツールとして使い、対象システムの弱点を探し出し、発見から72時間以内に侵入を完了させるという手順だ。OpenAIの環境が標的とされ、この一連の流れを示す内容が文書の形で残されている。
本件に関するDiscourseの推薦文書は、HTMLとスクリーンショットの形式で証憑が採取され、sha256による記録が残されている。この文書が、攻撃手法と侵入までの経緯を裏付ける資料として位置づけられている。ただし、侵入の詳細な技術的手順や影響範囲については、現時点で公表されている情報は限られている。
AI事業者間でセキュリティ診断や脆弱性検証を目的としたAIモデルの利用が広がる中、本件のような事例が商用モデルの安全性を巡る議論にどう影響するかが注目される。OpenAI側の対応や、類似手法への対策が示されるかについては、現時点では確認されていない。
結論として、本件は一次資料12件に基づき検証された結果、概ね事実と判定された。