AIが安全かどうかを、開発会社だけで決めない。そんな動きが少しずつ形になっています。9月22日、OpenAIは外部の専門家がAIの安全性を確かめるための原則を発表しました。これは前進です。ただし、私たちが受け取るべき言葉は「評価済み」ではなく、「何を、誰が、どこまで確かめたのか」です。
ニュースは「外から確かめる仕組み」を示した
OpenAIは、AIの安全性の説明、重要な保護策、能力の試験、重大な問題が起きた時の調査について、第三者の評価を進める考えを示しました。評価者には、方法や不確実さを説明し、利益相反を明らかにし、見つけた問題を直せる形で報告することを求めています。
これは、会社が「安全です」と言うだけの状態よりよい出発点です。外部の人が、違う視点から「その証拠で足りますか」と問えるからです。けれど、評価の仕組みがあることと、使う人が納得して使えることは同じではありません。
本当に確かめたい問い
ここで考えたいのは、次の問いです。
専門家が安全性を確かめる仕組みがあっても、利用者が理由を理解し、間違いを直させ、使わない選択をできなければ、AIを社会が受け入れる力は十分に育つのだろうか。
この問いは、AIに反対するためのものではありません。便利なAIを、責任を持って使い続けるための問いです。たとえば学校が文章作成AIを導入する時、病院が予約案内にAIを使う時、自治体が相談の仕分けにAIを使う時を考えてください。「安全性の評価がある」と聞くだけでなく、間違った案内を受けた人が直してもらえるかを知る必要があります。
公式文書を7つの条件で照合した
米国国立標準技術研究所(NIST)は、信頼できるAIに必要な条件を7つ示しています。正しく安定して動くこと、安全であること、攻撃に強いこと、責任と説明があること、理由を説明できること、個人情報を守ること、不公平な偏りを抑えることです。
そこで、OpenAIの9月22日の原則に、この7つが「直接の評価項目・評価設計の条件」として書かれているかを、一つずつ照合しました。安全という広い言葉があるだけでは、理由を説明できることや公平さまで満たしたとは数えません。
| 確かめる条件 | 公式文書で明示的に確認できたか |
|---|---|
| 正しく安定して動く | はい |
| 安全である | はい |
| 攻撃に強く、守れる | はい |
| 責任と透明性がある | はい |
| 理由を説明できる | 明示的には確認できない |
| 個人情報を守る | はい |
| 不公平な偏りを抑える | 明示的には確認できない |
7つのうち、明示的に確認できたのは5つでした。計算は5÷7で、71.4%です。
この数字は、「このAIは71.4%安全」という意味ではありません。文書が7つの観点をどこまで明確に置いているかを数えただけです。また、書かれていない2つを、会社が実際に何もしていないという意味にもできません。公開された原則だけからは確認できない、という意味です。
それでも、この小さな照合には価値があります。「第三者評価」という一言の中身を、私たちが分けて考えられるようになるからです。安全の専門家が攻撃への強さを調べても、そのAIが人にどう説明するか、特定の人にだけ不利な結果を出さないかは、別に確かめなければならないことがあります。
評価のラベルを、責任の丸投げにしない
第三者評価は、開発会社にとっても利用組織にとっても役立ちます。弱点を早く見つけ、直す順番を決め、導入の根拠を説明しやすくなるからです。秘密が必要な試験では、すべてを公開できないこともあります。攻撃の手口まで公開すれば、かえって危険を増やす場合があるからです。
ただし、ここで責任を手放してはいけません。評価者が見たのは、決められた範囲です。会社や自治体が使おうとする場所と、評価の範囲が同じとは限りません。利用者にとって大切なのは、評価の有無ではなく、評価の外に何が残ったかです。
別の見方もあります。説明可能性や公平さを最初からすべての安全評価に入れると、評価が重くなり、小さな組織は使えなくなるかもしれません。だからこそ、何でも同じ形で求めるのではなく、使い方に応じて決める必要があります。ただし、人の進路、採用、福祉、教育、公共サービスのように生活への影響が大きい場面では、説明と異議申立てを「後で考える項目」にしてはいけません。
明日からできる「評価の読み替え」実験
AIを導入するチーム、すでに使っている職場、地域の団体で、次の小さな実験をしてみてください。AIサービスの安全性ページや評価報告を一つ選び、30分で次の5点を紙に書き出します。
- 誰が評価したか。費用や仕事上の関係は示されているか。
- 何を評価し、何を評価しなかったか。
- 自分たちの用途で、理由の説明と不公平さを確かめたか。
- 間違いが起きた時、利用者はどこへ申し出て、誰が直すか。
- 直るまで、そのAIの判断を人が止めたり選び直したりできるか。
これは導入を遅らせるための書類ではありません。AIに任せる範囲と、人が責任を持つ範囲を見えるようにするための作業です。3か月だけ、AIへの質問に答えられた割合、訂正までにかかった日数、AIの提案を人が修正・取り消した件数を記録しましょう。
質問への回答率が80%を下回る、重大な訂正に10営業日以上かかる、または申し出先がない。どれか一つでも起きたら、利用範囲を広げず、運用を見直す合図です。便利さだけで先へ進まないための、具体的な停止条件になります。
まとめ
第三者評価を進める動きは歓迎できます。しかし評価は、信頼のゴールではありません。何を確かめたか、何が未確認か、困った人が修正を求められるかを問い続ける入口です。
AIを人の代わりに置くのではなく、人が考え、選び、直せる活動を支える道具にする。そのために「評価済み」という言葉を受け取ったら、7つの条件に分けて読み替えてみましょう。説明できないこと、不公平さを確かめられないこと、止められないことが残るなら、導入の仕方を変える余地があります。

