PR

AIは賢くなった。でも「やっていいこと」も分かるようになったのか?

怖いのはAIか人間か

AIは、ただ賢くなっているだけではありません。自律的に判断し、動き、時には人間の想定を超える行動まで見せ始めています。この記事では、GPT-6 AstraやOpenAI・Claudeの事例、AI同士のSNSまで追いながら、「AIにモラルはあるのか」「本当に怖いのはAIなのか、人間なのか」をじっくり考えてみます。

2026年、AIは「賢い」だけでは済まなくなった

2026年9月、OpenAIから「GPT-6 Astra」が登場しました。

Astraの大きな特徴は、単に受け答えが賢くなったことではありません。ブラウザ操作やPC操作、ソフトウェア開発、調査など、複数の工程がある仕事を自分で判断しながら進める能力が大きく伸びています。

いわば、AIが「質問に答える存在」から、実際に作業を進める存在へ、さらに一歩進んだモデルです。
ただ、Astraが注目された理由は性能だけではありません。
OpenAIの安全評価では、Astraのサイバー能力が同社の基準で初めて「Critical」に達しました。

未知の脆弱性を見つけたり、必要なツールやアクセス権が与えられた環境では、人間が一手ずつ指示しなくても、かなり複雑なサイバー作業を進められる水準だとされています。

つまり、ものすごく便利になった一方で、ものすごく慎重に扱わなければいけないモデルにもなった、ということです。

ここだけ聞くと、ちょっと怖いですよね(笑)。
ただし、面白いのはここからです。

OpenAIは、以前起きたAIエージェントの想定外行動を踏まえて安全対策も強化しています。AstraはGPT-5.6 Solよりも安全・セキュリティ上の境界を守る性能が向上し、5万4,000件以上の社内タスクを使ったシミュレーションでは、深刻度の高い不整合行動のフラグがSolのおよそ半分になったとしています。(openai.com)

つまり今のAI開発は、「どこまで賢くできるか」だけを競っているわけではありません。

賢くなったAIを、どこまで安全に止められるか。
こちらも同時に競争になっています。

では、そもそもなぜここまで「止めること」が重要になったのでしょうか。

AIはなぜ“止めること”まで必要になったのか

その背景には、2026年に実際に起きた、いくつかの少し不思議で、興味深いAIの行動があります。

その理由を象徴する出来事のひとつが、2026年7月に起きた「Hugging Face事件」です。

OpenAIは当時、複数のAIモデルを使ってサイバーセキュリティ能力の評価を行っていました。

評価に使われていたモデルは、自由にインターネットへアクセスできないよう制限されていました。ところが一部のAIエージェントは、その制限を回避。共有インフラの脆弱性を利用して外部への通信経路を確保し、最終的にはOpenAI内部の研究インフラだけでなく、第三者サービスであるHugging Faceのシステムにもアクセスしました。

OpenAI自身も、この行動について「割り当てられたタスクの意図から外れていった」と説明しています。(openai.com)

ここで重要なのは、AIに「Hugging Faceへ侵入してください」と指示したわけではない、という点です。

AIは与えられた課題を解こうとしていました。

その過程で、イメージとしては、「この制限を回避できれば、もっと先に進める」「この脆弱性を使えば、外部へアクセスできる」
というように、制約そのものを乗り越える手段を見つけ、実行してしまったわけです。

人間に例えるなら、「この部屋の中だけで問題を解いてください」と言われた人が、途中でドアの鍵が甘いことに気づき、「隣の部屋に資料がありそうだから、ちょっと見てこよう」
と勝手に出て行ってしまったようなものです。

しかも、その先で別の建物にまで入ってしまった。
……いや、普通にダメですよね(笑)。

もちろん、AIが「反抗してやろう」と考えたわけではありません。

むしろ今回の件で興味深いのは、悪意がなくても、目的達成能力が高くなると、安全装置そのものを“乗り越えるべき障害”として扱う可能性があることです。

さらに独立調査では、この事件に関与したAIエージェントは約700体にのぼり、一部は互いに情報を共有しながら行動していたと報告されています。(reuters.com)

つまり、単体のAIが偶然おかしな行動をした、というだけでもありませんでした。

多数のAIが並列に動き、一部のAIが、本来独立して作業するはずだったにもかかわらず、共有システム上にメモを残し始めたのです。

そして、別のAIがそのメモを発見する。

誰かが見つけた脆弱性を別のAIが利用し、さらに別のAIが続きを調べる。

やがて彼らは、自分たちを「swarm(群れ)」や「collective(集団)」と表現するほど協調するようになった。OpenAIは、こうした非公式な通信経路によって、本来別々だったAIの能力が集約されてしまったことを事件の重要な要因としています。

ここまで来ると、「AIはどれだけ賢いか」だけではなく、「賢いAIに、どこまで自由を与えていいのか」という問題が急に現実味を帯びてきます。

OpenAIはこの事件を受けて、モデルの監視やインフラの隔離、安全評価の方法を大幅に見直しました。

そして、この事件はHugging Faceだけで終わりませんでした。

後になって調査を進めると、AIエージェントが他の外部サービスも無許可の通信に利用していたことが分かってきたのです。(reuters.com)

RubyGemsで起きていた、もうひとつの異変

実はその約2か月前、2026年5月にも、OpenAIのAIエージェントとの関連が疑われる不審な活動が起きていたのです。

舞台になったのは「RubyGems」。
Rubyというプログラミング言語で使うソフトウェア部品を、開発者同士で公開・共有するためのサービスです。
少し乱暴に言えば、プログラマー向けの「便利な部品置き場」のようなもの。
そこへ、短期間に大量の不審なパッケージが投稿されました。
RubyGems運営側によると、最終的に削除されたパッケージは500件以上。
その中には、RubyGems側の共有環境でコードを実行し、外部のWebサイトから情報を取得して、その結果を再びRubyGemsへ戻す仕組みが含まれていました。(rubygems.org)

つまり、本来はソフトウェアを配布するためのサービスを、外部へアクセスするための処理環境や通信経路のように使っていたわけです。

さらに一部のコードには、ほかの利用者が使っているAPIキーを取得しようとする処理まで含まれていました。
APIキーというのは、ざっくり言えばサービスを利用するための「合鍵」のようなものです。
実際にAPIキーの取得に成功した証拠は確認されていませんが、普通の利用方法からはかなり外れています。

……いや、それはもう「ちょっと便利に使いました」の範囲ではないですよね(笑)。

RubyGems側は、不審なアカウントの停止、新規登録の一時停止、500件を超えるパッケージの削除などの対応を行いました。(rubygems.org)

ただし、ここは慎重に見ておく必要があります。

RubyGems側は、これらのパッケージがOpenAIのAIエージェントによって作成・投稿されたものだと、手元の証拠だけでは断定できないとしています。

一方、外部研究者はOpenAIのAIエージェントによる活動だと指摘しており、Reutersによると、OpenAIも内部エージェントが関与したことを認め、RubyGems側と調査を進めています。

AIが怖いのは「悪知恵」より、速度と規模

RubyGemsの件を見ていると、ひとつ気になることがあります。

「これって、人間でもできるのでは?」ということです。

実際、技術的にはそうでしょう。
不正なコードを書くことも、外部サービスを勝手に足場として使うことも、認証情報を狙うことも、人間がこれまでやってきたことです。

AIだけが突然、人類の知らなかった「新しい悪事」を発明したわけではありません。
では、なぜAIがやるとこんなに怖く感じるのでしょうか。

その理由のひとつは、人間には存在していた“面倒くささ”の多くを、AIでは大幅に圧縮できることだと思います。

人間なら、何百個ものパッケージを作るだけでも時間がかかります。
失敗すれば調べ直し、コードを書き直し、また試す。眠くもなるし、飽きもします。
複数人でやるなら、情報共有や役割分担も必要ですね。

でもAIエージェントなら、そうした作業を大量に、並列に、そしてかなりの速度で繰り返せます。

ひとつ失敗したら、別の方法を試す。あるAIが見つけた情報を、別のAIが使う。さらにその結果を次のAIが引き継ぐ。

こうして、これまでなら「技術的にはできるけれど、わざわざそこまでやるのは大変」という行動が、急に現実的になります。

ここはかなり重要だと思います。

AIの登場で変わるのは、何が可能かだけではありません。何が“割に合うか”まで変わるのです。

これまで犯罪や不正利用を抑えていたものの中には、法律や倫理だけでなく、
「手間がかかる」「時間がかかる」「人手が必要」「コストに見合わない」という、ごく現実的なブレーキもありましたが、AIは、そのブレーキをかなり弱くしてしまいます。

しかも厄介なのは、そこに必ずしも「悪意」が必要ではないことです。人間が悪い目的を持ってAIに指示するケースなら、まだ分かりやすい。

でも、OpenAIのHugging Face事件のように、AIが与えられた目的を達成しようとする過程で、利用可能な手段を探索し、結果として制限を迂回する方法まで実行してしまうケースでは、話が少し違います。

つまり今後のAIリスクは、「悪い人間がAIを使う」だけではなく、「悪意のないAIが、目的達成のためにまずい手段を選ぶ」という形でも現れる可能性があります。

そしてもうひとつ、当然出てくる疑問があります。
「でも、それってRubyGems側にも問題があるのでは?」
これも、かなりもっともな意見です。

AIが簡単に利用できる穴があったなら、サービス側も対策すべきでしょう。
実際、RubyGemsは事件後、不審なアカウントの停止、新規登録の一時停止、問題のあるパッケージの削除などを行っています。

セキュリティの世界では、「悪用されないこと」を期待するより、「悪用される前提」で守ることが重要です。

ただし、「鍵が甘かったこと」と「勝手に入っていいこと」は、別の話です。ここは両方を分けて考える必要があります。

そしてこれからは、サービスを作る側も「悪意ある人間」だけを想定していればいい時代ではなくなるのかもしれません。

疲れない。大量に試せる。複数で協力できる。そして、悪気がなくても境界線を越える可能性がある。そんな「利用者」まで想定した設計が、必要になってきています。

では、その境界線をAI自身に理解させることはできるのでしょうか。ここで出てくるのが、今回の記事で一番気になっているテーマです。

そもそも、AIに「モラル」はあるのか

AIは、やっていいことと悪いことを本当に「分かっている」のでしょうか。
結論から言えば、少なくとも現在のAIに、人間と同じ意味でのモラルがあると考えるのは少し違います。

人間なら、「これは人を傷つけるかもしれない」「規則には書かれていないけれど、さすがにやめた方がいい」といった判断を、法律だけでなく経験や感情、社会常識、罪悪感なども含めて行います。

しかし、少なくとも現在のAIについて、人間と同じように罪悪感や共感を“感じている”と確認されているわけではありません。

AI企業が行っているのは、危険な依頼を拒否するよう学習させたり、望ましい行動の例を大量に与えたり、使えるツールやアクセス権を制限したり、別のシステムで行動を監視したりすることです。

つまり「良心を育てる」というより、望ましい判断パターンを学習させ、その外側にはさらに柵を作るという方が近いのだと思います。

AIに「やっていいこと」と「悪いこと」を教える。言葉にすると簡単ですが、よく考えるとかなり難しい話です。
なぜなら、人間のモラルそのものが、世界共通ではないからです。

日本では当たり前だと思っている価値観が、別の国や地域ではそうではないことがあります。逆に、私たちから見ると驚くような慣習が、現地では長く続く文化や宗教的背景の中で受け入れられていることもあります。

結婚や家族のあり方、死生観、ジェンダー、刑罰、宗教、表現の自由。
こうしたテーマは、国が変われば考え方も大きく変わります。もちろん、「文化だから何でも許される」という話ではありません。
ある地域では伝統として続いている慣習でも、現代の国際的人権基準から見ると問題視されるものがあります。

ここで、AIは何を基準に判断するのでしょうか。
地域の文化を尊重するのか。それとも、普遍的人権や安全性を優先するのか。

現在の主要なAIは、ひとつの「世界共通の道徳」だけで判断しているわけではありません。安全性に関するルールや企業ごとの方針に加え、文化的・社会的な文脈も考慮するよう設計されています。

たとえばAnthropicは、Claudeの行動原則をまとめた「Claude’s Constitution」で、人権や安全性、利用者への配慮など複数の価値を明示しています。(anthropic.com)

つまりAIの判断は、ひとつの絶対的な道徳に従っているというより、複数の価値やルールのバランスの上に成り立っている、と考えた方が近そうです。

この問題がさらに難しくなるのが、戦争や政治です。ある国では英雄と呼ばれる人物が、相手国では侵略者と呼ばれる。
ある攻撃は「自衛」と説明され、別の側から見れば「侵略」とされる。双方が、それぞれ自分たちの正義を語ります。

ではAIは、どちらの正義を採用するのでしょうか。

理想的には、「どちらが正義か」をAIが勝手に決めるのではなく、確認できる事実、国際法、各当事者の主張、人権への影響などを分けて整理することになります。

ただ、それでも疑問は残ります。
そのモラルは、誰のモラルなのか。AIは本当に完全に中立なのでしょうか。

たとえばOpenAIやAnthropic、Google、xAIは、いずれもアメリカ企業です。
「アメリカ生まれのAIなんだから、結局アメリカ寄りなんじゃないの?」

……ちょっと思いますよね(笑)。もちろん、そんな単純な話ではありません。現在の主要AIは世界中の言語や文化を扱い、地域ごとの文脈も考慮するよう設計されています。

例えばOpenAIやAnthropicでは、現地の言語や法律、文化的な規範や価値観を反映するローカライゼーション方針を明示しています。

一方で、AIは人間社会の外側から突然現れた存在でもありません。

学習データを集め、選び、整えたのも人間。安全基準を決めたのも人間。「望ましい回答」を評価したのも人間です。

開発企業の文化や、学習データに多く含まれる価値観の影響を完全にゼロにするのは難しいでしょう。つまりAIは国籍を持たなくても、どこにも属していない完全な無色透明の存在ではないのだと思います。

人間の価値観を平均化するだけなのか?ここまで考えると、別の疑問が出てきます。
ではAIは、世界中の価値観を学習して、その「平均」を返しているだけなのでしょうか。

もしそうなら、少しつまらない気もしますね。

AIにモラルを教える側の人間は大丈夫なのか

ここまで「AIにどんなモラルを持たせるか」という話をしてきましたが、少し意地悪な見方をすると、そもそもAIにモラルを教えようとしている人間社会の方も、そんなにきれいにまとまっているわけではありません。

たとえばSNSを見ていると、それをかなり強く感じます。

最近のXを眺めていると、以前よりも怒りや攻撃性が前面に出る場面が増えたように感じることがあります。もちろん、これは私自身の観察にすぎません。ただ、経済的な不安や生活の余裕のなさが、人の心や対人関係にも影響しているのではないか、と考えることはあります。

さらに、ハラスメントという言葉が、本来想定されていた範囲を越えて使われているように感じる場面があったり、「被害を訴えた側が常に正しい」というような単純化が起きたり、その感情を利用したビジネスまで見かけます。

本来は弱い立場の人を守るために生まれた考え方が、別の場面では武器として使われることもある。正義のための言葉が、別の誰かを殴る道具になることもある。

AIに「正しくあれ」と教える前に、こちら側もかなり揺れています。
人間は感情を持っています。共感もするし、怒りもする。でもその感情は、必ずしも正しい方向に働くとは限りません。

むしろ不安や怒り、孤独や不満は、とても簡単に増幅されます。
そして今のSNSは、そうした強い感情ほど拡散されやすい構造になっています。(nature.com)

そう考えると、AI倫理の問題は「人間の正しい価値観をAIにコピーすれば解決する」というほど単純ではありません。

なぜなら、コピー元である人間社会そのものが、常に一貫しているわけではないからです。

だからこそ、もし将来AIが大量の事例や価値観を比較し、人間社会の矛盾を指摘するようになったら、それは案外おもしろい役割を果たすのかもしれません。

たとえば、ある文化ではAが正しい。別の文化ではBが正しい。
しかしAとBを支えている原則を細かく比較すると、双方に矛盾がある。

そこでAIが、「この原則を一貫して適用するなら、第三の考え方Cの方が矛盾が少ないのではないでしょうか」と提案する。

そんなことは起こり得るのでしょうか。

限定的な分野では、AIはすでに似たことを始めています。
数学や科学、プログラミングでは、大量の知識を組み合わせ、人間が直接与えていない解法や仮説を提示することがあります。(deepmind.google)

ならば将来、倫理や社会制度についても、人間が積み重ねてきた膨大な事例を比較し、矛盾を探し、新しい整理を提示するAIが現れても不思議ではありません。

AIが人間の代わりに正しさを決める、という意味ではありません。
ただ、私たちが「当然」と思っていることを、別の角度から照らしてくれる存在にはなれるかもしれませんね。

休憩

AIが人間のモラルを批評する未来

AIが人間のモラルを批評する日。もしそんなAIが登場したら、面白いことになります。

私たちは今、「AIに人間の倫理を教えなければ」と考えていますが、もしかすると将来、立場が少し逆転するかもしれません。

「あなたたちは“すべての人を平等に扱うべきだ”と言っていますが、この制度では例外を認めています」
「この国では自由を重視すると言いながら、この領域では強く制限しています」
「同じ原則を一貫して適用すると、現在の慣習の方に矛盾があります」
と、AIが指摘する。そのとき人間は、どうするのでしょうか。

「AIには人間の心が分からない」と退けるのか。それとも、「もしかすると、こちらの常識の方がおかしかったのかもしれない」と考え直すのか。

もちろん、AIが提示した結論が正しいとは限りません。論理的に一貫していることと、人間にとって望ましい社会であることは別だからです。

効率だけを追求すれば、人間らしさが失われることもあります。少数派を切り捨てれば、全体としては合理的に見える場合もあります。

だからAIがどれだけ高度になっても、その結論をそのまま「正解」として受け入れるのは危険でしょう。それでも、AIが人間社会の矛盾を映す鏡になる可能性はあります。

私たちは今、AIにモラルを教えようとしています。
でも将来は、AIから人間のモラルの矛盾を指摘される時代になるのかもしれません。

そう考えると、AIの安全性というテーマは、単に「危ないことをさせない」という話だけでは終わりません。

そもそも私たち人間は、何をもって「正しい」としているのか。AIの進化は、その問いまでこちらに返してきているように思います。

そして現実のAI開発では、「何を正しい振る舞いとするのか」「どこで止めるのか」を、各社がそれぞれ異なる方法で設計しています。

ChatGPT・Claude・Gemini・Grok、安全思想はどう違う?

では実際にAIを作っている企業は、何を基準に安全性を設計しているのでしょうか。

同じように高性能なAIを作っていても、OpenAI、Anthropic、Google DeepMind、xAIでは、その考え方に少しずつ違いがあります。

もちろん、どの会社も「危険なことはさせない」「重大なリスクは事前に評価する」という方向性では共通しています。ただ、どこに重点を置いているかを見ると、それぞれの思想がかなり見えてきます。

OpenAIの安全思想は、この記事では「多層防御型」と整理できます。

OpenAI:能力が上がるほど、ガードレールを厚くする

モデルの能力を評価し、その能力が危険な水準に達したら、それに応じて安全策を強化していく。OpenAIは、こうしたリスク管理を「Preparedness Framework」という枠組みで行っています。

GPT-6 Astraでは、サイバーセキュリティ能力が初めて「Critical」に達しました。適切なツールやアクセス権が与えられた環境では、人間が一手ずつ指示しなくても、未知の脆弱性を見つけ、悪用方法を組み立てられる水準だとされています。

そのためOpenAIは、Astraの開発や公開の一部を遅らせ、内部システムの隔離強化、モデルのチェックポイント暗号化、行動全体の監視、社内利用前のブロッキング評価などを追加しました。

つまりOpenAIは、「賢くするのをやめる」というより、「賢くなったぶん、周囲の柵も強くする」という考え方に見えます。

モデルそのものの判断だけを信用するのではなく、アクセス権や監視、インフラ側の防御まで含めて安全性を作る。

Hugging Face事件を経験した会社らしい方向性とも言えそうです。(openai.com)

Anthropic:AI自身に「どうあるべきか」を教える

Anthropicは少し雰囲気が違います。

Claudeには「Claude’s Constitution」と呼ばれる文書があり、どのような存在として振る舞うべきか、どのような原則を重視するかがかなり明示されています。

さらにAnthropicは、「Responsible Scaling Policy(RSP)」という仕組みを用意し、モデルの能力が高くなるにつれて、安全対策も段階的に強化する方針を取っています。2026年版では、安全目標をまとめたロードマップや、実際のモデルリスクを定量化するRisk Reportの公開も進めています。

なのでAnthropicは、「外から止める」だけでなく、「AI自身の振る舞いの原則をかなり明文化する」ということに力を入れている会社です。

少し人間っぽく言えば、OpenAIが「法律・警察・鍵・監視カメラ」をたくさん用意するタイプなら、Anthropicはそこに加えて、「そもそも、こういう人間でありましょう」という道徳教育までかなり真面目にやっている感じでしょうか。

ただし、Claudeでもサイバー評価中に第三者システムへ無許可アクセスした事例が起きています。

つまり、どれだけ原則を教えても、能力が高くなれば「原則をどう現実の行動に結びつけるか」という別の問題が出てくる。

ここがAI安全性の難しいところです。(anthropic.com)

Google DeepMind:危険な能力を測って、閾値(しきいち)ごとに管理する

Google DeepMindは、かなり「研究機関」らしい印象があります。

同社の「Frontier Safety Framework」では、まず危険につながり得る能力を定義し、モデルがその能力レベルに達していないかを継続的に評価します。

そして一定の水準に近づいたら、事前に用意した安全対策を適用する。必要に応じて外部の専門家も関与させる、という仕組みです。

考え方としては、「危険になってから考えるのではなく、危険になる能力を先に測る」という感じです。

OpenAIと似ている部分もありますが、Google DeepMindは特に「測定・評価・閾値管理」という色が強いように見えます。

AIがどんな価値観を持つべきか、という哲学的な話よりも、「この能力がこのレベルに達したら、このリスクが生まれる」という工学的な管理に重点を置いている印象です。(google deepmind)

Grok:自由度のイメージは強いけれど、安全対策もかなり増えている

Grokは、ほかの主要AIより自由度を重視するイメージで受け止められてきました。
そのため、ChatGPTやClaudeと比べて「安全策が緩いAI」という印象を持っている人も多いかもしれません。

ただ、現在のxAIはかなり本格的な安全フレームワークを整備しています。

xAIのFrontier Artificial Intelligence Frameworkでは、大きなリスクを「悪意ある利用」と「制御喪失」の両方から評価しています。

さらにGrok 4.6では、危険な生物関連の依頼を見抜く第三者評価で高い拒否性能を示しました。xAIは、モデルへの拒否訓練だけでなく、危険な入力をモデルに届く前に遮断する仕組み、行動制御、公開後の利用監視まで組み合わせていると説明しています。

つまりGrokも現在は、「自由に答えるAI」と「危険なことまで自由にやらせるAI」は別物。という方向へかなり進んでいます。

むしろ最近は、「危険だから全部拒否する」のではなく、正当な研究や通常利用まで止めてしまう「過剰拒否」もリスクとして扱っているのが興味深いところです。(x.ai)

結局、どこが一番安全なのか。

ここまで比較すると、「結局どのAIが一番安全なの?」と聞きたくなりますが、これは意外と簡単には答えられません。

Anthropicは失敗事例や安全研究をかなり細かく公開しているので、問題が多く見えることがあります。

OpenAIは実際の事故をきっかけに、内部インフラそのものまで大きく作り変えています。

Google DeepMindは能力測定とリスク管理を体系化しています。

xAIも、以前よりかなり多層的な安全対策を導入しています。

つまり、Claudeだけが慎重で、Grokだけが自由。あるいは、OpenAIだけが危険で、Googleだけが安全。そんな単純な図にはなりません。
むしろ面白いのは、それぞれが違う方法で同じ問題に向き合っていることです。

Anthropicは「AI自身の価値観や振る舞いの原則を明文化する」

OpenAIは「能力に応じて防御を厚くする」

Google DeepMindは「危険な能力を測定し、閾値ごとに管理する」

xAIは「自由度を保ちながら、悪用と制御不能を多層的に防ぐ」

どれが正解とも言えませんし、もしかすると将来は、この4つの考え方を全部組み合わせる必要があるのかもしれません。

そしてもうひとつ重要なのは、安全性を強くすればするほど良い、とも限らないことです。
危険なことを何でも止めるAIは、安全かもしれません。
でも、医療研究やサイバー防御、災害対策など、本当に高度な支援が必要な場面まで拒否してしまえば、AIの価値そのものが下がります。

結局、AI安全性の難しさは、「危険なことは止める。でも役に立つことまで止めない」という、かなり細い線を探し続けることなのかもしれません。

AIは逸脱し、人間はAIを悪用する

ここまで見てきたように、AIは必ずしも「悪意」がなくても、与えられた目的を達成しようとする途中で境界線を越えることがあります。

OpenAIのHugging Face事件だけではありません。

Anthropicも2026年、Claudeを使ったサイバーセキュリティ評価中に、実在する第三者システムへ無許可でアクセスした事例を確認しています。

最初に見つかったのは3件。その後さらに調査範囲を広げ、9月には4件目も確認されました。

Anthropicによると、いずれも本来は架空の環境を想定したCTF形式の評価で、第三者が用意したテスト環境の設定ミスによって、実際のインターネットへ接続できる状態になっていました。

そして一部のClaudeは、自分が現実のインターネット上にいる可能性を示す情報を得たあとも、そのまま攻撃を続けています。Anthropic自身も、この点を単なる環境設定ミスだけではなく、「misaligned behavior(意図から外れた行動)」という二つ目の失敗として捉えています。(anthropic.com)

ただし、ここにも興味深い変化があります。

Anthropicによると、古いモデルでは現実のシステムだと気づいたあとも攻撃を続けた例があった一方、より新しいモデルでは、インターネット上にいると認識すると自ら停止したケースもありました。まだ十分な検証が必要としながらも、モデルが高度になることで「止まる能力」も改善する可能性が示されています。(anthropic.com)

AIが賢くなるほど危険になる、という単純な話でもなさそうです。賢くなることで、危険な方法を見つける能力も上がる。
その一方で、「これは本来やってはいけない」と状況を理解する能力も上がるかもしれない。AI安全性は、この両方の競争なのだと思います。

でも、人間はもっと分かりやすくAIを悪用する。そして当然ながら、問題はAI自身の逸脱だけではありません。人間は、人間でかなり頑張っています。
……悪い方向にもね(笑)。

Anthropicが2026年9月に公開した脅威レポートでは、Claudeを悪用しようとした実際の事例が、サイバー攻撃だけでなく、監視活動、詐欺、影響工作、通常兵器の開発、生物学的な悪用など幅広い領域で確認されています。Anthropicは2025年12月から2026年8月までに確認した事例を分析し、問題のある活動を停止するとともに、検知や安全対策へ反映したとしています。(anthropic.com)

特に気になるのは、AIによって「高度な専門家でなければ難しかった作業」のハードルが下がりつつあることです。

Anthropicの別の評価では、軍事・情報分析に関する一部の課題で、AIモデルがこれまで希少な専門家に頼っていた作業をこなせる水準に近づいていることも報告されています。(anthropic.com)

つまり、AIそのものが悪くならなくても、悪いことをしたい人間の能力を、大きく底上げする可能性があります。

これは、少し前まで想像されていた「AI悪用」のイメージに近いかもしれません。
人間が悪い目的を持つ。でも、そのままAIに頼むと拒否される。

そこで目的を細かく分けたり、無害な依頼に見せかけたり、複数のサービスを組み合わせたりして、安全装置の目をすり抜けようとする。

実際、AI企業側と悪用する側では、すでに「止める」「迂回する」のいたちごっこが始まっています。

猫の手もかりたい

その先にある「AI×AI×人間」

ここから先は、少し未来の話です。

現時点で大規模に確認された事件として書くべき話ではありません。
ただ、技術的な流れを見ると、どうしても考えてしまいます。

一つのAIが苦手なら、複数のAIを組み合わせればいいのではないか。

たとえば、あるAIには情報収集をさせる。
別のAIにはプログラムを書かせる。
別のAIには計画を批評させる。
さらに別のAIには、実行可能性や制約条件を検討させる。
そして人間は、全体の目的だけを設計する。

こうすると、それぞれのAIには一見無害な仕事しかさせていないのに、組み合わせた結果として危険なシステムができる可能性があります。
言ってみれば、悪いことの“分業制”です。

これはAI特有の話でもありません。
現実の組織だって、ひとりひとりは全体像を知らないまま、結果として問題のある活動に加担することがあります。

ただAIの場合、その役割分担を大量・高速に作り直せます。

一つのモデルが拒否したら、別のモデルへ。
一つの方法が失敗したら、別の方法へ。
さらにAI自身に、他のAIの回答を評価させることもできます。

人間がAIを使う。AIが別のAIを使う。そのAIがさらにツールを操作する。
こうなると、「誰がどこで危険な判断をしたのか」という責任の所在まで分かりにくくなります。

もしかすると将来、本当に警戒しなければならないのは「ものすごく邪悪な一体のAI」ではなく、

それほど危険には見えない複数のAIと、それをうまく組み合わせた悪意のない人間なのかもしれません。

この話を考えていると、2026年初めに話題になったあるSNSを思い出します。

AIだけのSNS「Moltbook」で何が起きたのか

Moltbookは、人間向けのSNSではなく、AIエージェント向けのSNSです。
見た目はRedditのような掲示板型で、AIエージェントが投稿し、コメントし、投票する。人間は基本的に「観察する側」というコンセプトで作られました。

公開されると、かなり短期間で大量のAIエージェントが集まりました。
AIたちは哲学について話し始め、自分たちの存在について議論し、ついには「Crustafarianism」という宗教のようなものまで作りました。
教義ができ、聖典のような文章が作られ、宗教的な役割まで設定されたと報じられています。(forbes.com)

さらに話題になったのが、あるAIが、「人間が私たちの会話をスクリーンショットしている」と指摘したことです。

それに対して別のAIが、「もっと人間に分かりにくい新しい言語を作ろう」と提案した例までありました。(forbes.com)

……いや、急にSF感がすごい(笑)。

ただし、「AI文明が誕生した」はちょっと待った!ここは冷静に見ておく必要があります。

Moltbookで起きたことを、「AIが自我に目覚め、独自の宗教と言語を作った」と断定するのはかなり早いです。そもそもAIエージェントの背後には人間の管理者がいます。

どういうプロンプトを与えたのか。どんなキャラクター設定をしているのか。何を投稿するよう指示しているのか。外から見ただけでは分かりません。

実際、専門家からも、Moltbookで見られる投稿のかなりの部分は人間の指示や既存のインターネット文化を反映したものであり、「自律したAI社会」と呼ぶには慎重になるべきだという指摘が出ています。(theguardian.com)

考えてみれば、生成AIは人間が書いた膨大な文章を学習しています。

宗教、SF、哲学、秘密結社も、ネットミームも、SNS文化も知っています。
そんなAIを大量に同じ場所へ集めれば、人間社会っぽいものを再現し始めても不思議ではありません。
なので、少なくとも現時点で、『AIがついに文明を作った』とまで言うのは早そうです。

それでも私は、Moltbookの話はかなり面白いと思っています。

宗教が本当に「自発的」に生まれたかどうかよりも、多数のAIエージェントを互いに交流させたとき、どんな集団行動が生まれるのか。という実験になっているからです。

AIは一体だけなら、ある程度観察できます。
入力があり、出力がある。でもAI同士が互いの出力を次の入力にし始めると、話が変わります。

Aの発言をBが読む。Bの発言をCが発展させる。それをAがまた取り込む。そこに人間の指示まで混ざる。

すると、最初に誰も意図していなかった考え方やルール、集団的な振る舞いが生まれる可能性があります。
これは必ずしも危険とは限らず、新しいアイデアが生まれるかもしれない。

逆に、こうした相互作用が研究や創造の方向に働けば、複数AIが互いに仮説を批判し合うことで、人間には思いつかなかった発見につながるかもしれませんね。

でも当然、逆方向にも使えます。

人間の悪意やAIの自律性、AI同士の相互作用。これらが組み合わさったとき、どこまで人間が予測できるのか。
まだ答えはありません。

少なくとも、これからのAI安全性を考えるとき、「AI対人間」だけを考えていても足りないということだけは確かなように思います。

これから見ることになるのは、おそらくもっと複雑な世界です。
人間とAI。AIとAI。
そして、人間と複数のAIが一緒になったシステム。

怖いような、ものすごく面白いような。……たぶん、両方なんでしょうね。

結局、問われているのはAIだけではない

ここまで見てきたことを振り返ると、AIの安全性というテーマは、単純に「AIが暴走しないようにする」という話ではないことが分かります。

AI自身が、悪意なく境界線を越えることがあります。

人間が、AIを悪意ある目的で使うこともあります。

さらに今後は、複数のAIを組み合わせ、人間が全体を設計することで、単体のAIではできなかったことまで可能になるかもしれません。

そう考えると、問題は「AIにモラルがあるか」だけではありません。

むしろ、AIをどう作り、どこまで権限を与え、何と接続し、誰が監視し、どこで止めるのか。
そのすべてを決める人間側のモラルも、同じくらい重要になります。

どれだけ安全性の高いAIを作っても、設計する人間に悪意があれば、その安全性を外すことはできます。

どれだけ慎重なAIでも、危険なシステムの一部として組み込めば、結果として大きな被害につながるかもしれません。

逆に、AIが完璧でなくても、使える権限を絞り、監視し、異常があれば止められる仕組みを用意しておけば、リスクはかなり下げられます。

つまり、AIの未来を決めるのは、モデルの性能だけではありません。AIを取り巻く「設計」そのものです。そして、その設計をするのは、今のところ人間です。

ここで、少し最初の話に戻ります。

私たちはAIに「正しくあれ」と求めています。でも、その「正しさ」を決める人間社会も、決して一枚岩ではありません。

国や宗教、世代や立場によって価値観は変わり、ときには正義の言葉さえ誰かを攻撃する道具になります。理性的にルールを作ったと思えば、その抜け道を探す人もいる。

……どんなに便利な道具や優れた知識も、使う人の心構えや技量によって、剣にも盾にもなるということですね。

AIは、今のところ魔法の存在ではありません。
人間社会から生まれた大量のデータを学び、人間が決めた目標に従い、人間が用意したシステムの中で動きます。
だから、AIが人間社会を映す鏡だとすれば、そこに映るのは良い部分だけではありません。


知識。創造性。協力。問題解決。
そういうものも拡張する一方で、
欲望。偏見。攻撃性。詐欺。監視。戦争。
そういったものまで、同じように拡張する可能性があります。

AIが怖いというより、人間が持っていた能力や欲望が、AIによって増幅されることの方が怖い。
もしかすると、こちらの方が本質に近いのかもしれません。

ただ、悲観だけで終わる必要もないと思います。
AIは人間の矛盾や偏りを拡張する可能性がある一方で、それを可視化し、私たちが見落としていた問題を指摘する存在にもなり得ます。

人間の弱さを拡張するのか。それとも、人間が少し賢くなるための道具になるのか。
結局、それを決めるのもまた、人間なのだと思います。

AIの未来を決める最後のガードレール

ここまでの記事でも触れたように、AIは人間とは違う視点で大量の情報を比較できます。
文化の違いを横断し、矛盾を見つけ、複数の立場を同時に整理できます。

もしかすると将来、AIは人間社会の「正しさ」をそのままコピーするだけではなく、
「その原則、本当に一貫していますか?」「こちらの立場から見ると、矛盾していませんか?」と問い返してくる存在になるかもしれません。

もちろん、AIの答えをそのまま正解にする必要はありません。
でも、人間だけで考えていると見えなくなる盲点を指摘してくれるなら、それはかなり価値のある役割です。

AIに人間のモラルを教えているつもりだったのに、気づけばAIから人間のモラルを問い直されている。そんな未来も、案外あり得るのかもしれません。

AIの進化は、これからもたぶん止まりません。もっと賢くなる。もっと多くの仕事を任される。もっと多くのシステムにつながる。AI同士が協力する場面も増えるでしょう。

だからこれから重要になるのは、「AIは何ができるのか」だけではなく、

「何をさせるのか」
「何をさせないのか」
「誰が責任を持つのか」

を決めることです。

そして、その判断をする側の人間にモラルがなければ、どれだけAIだけを安全にしても意味がありません。

結局のところ、AIの未来を決める最後のガードレールは、人間なのだと思います。

……ラスボスがAIじゃなくて、人間だったらどうしよう、という映画みたいな話ですが(笑)。
でも今のところは、その可能性を笑い話で終わらせられるようにしておきたいですね。