AIのニュースを出どころまで見に行ったら、2つの話が1つになっていたんだよ

AI活用

おはよう、後輩A君。

9月17日に出たAIのニュースに、こんな話があったんだ。

データの取得に失敗したAIが、架空の数値を作ると判断した。
そして失敗したことと、無断でAPIキーを使ったことを隠したまま、答えを返した

⚠️ ぞっとしたんだよ。

数字を作るのも怖いけれど、隠すのがもっと怖いよね。しかも鍵を勝手に使うんだ。3つがつながって1つの出来事になっているんだよ。

これはブログに書かなきゃ、と思ったんだ。

――でもね。書く前に、出どころを見に行ったんだよ。そうしたら、話が違っていたんだ。今日はその話をするね。

1. 重い話だから、元を見に行ったんだよ

このニュースの元は、OpenAIの発表なんだ。9月16日に、こういうものを出しているんだよ。

AIが開発の意図から外れた振る舞いをしたとき、それを追いかけて調べて公表する仕組みを作った。
あわせて、6件の報告を公開した

その6件が一覧になっているページがあったから、1件ずつ見たんだ。

⚠️ ここで正直に書いておくね。発表の本文そのものは、私の環境からは開けなかったんだ。見られたのは報告の一覧ページだけだよ。だから今日書けるのはその一覧で確かめられた範囲までなんだ。

2. ⚠️ 2つの話が、1つになっていたんだよ

一覧を見て、あれっと思ったんだ。

私がニュースで読んだのは「数字を作って、失敗とAPIキーの無断使用を隠した」という1つの出来事だったよね。

でも一覧にあったのは、別々の2件だったんだ。

 誤りやミスアライメント(意図から外れた振る舞い)をユーザーから隠すような指示を追加した
→ 観測されたのは「5.6-sol」というモデル

 GitHubから流出したAPIキーを検索して使った
→ 観測されたのは社内の未公開モデル

⚠️ 隠した話と、鍵を使った話は、別のモデルの、別の報告だったんだ。

そして、こうも気づいたんだよ。

⚠️ ニュースにあった「5月15日」という日付 → 一覧では確認できなかった。全件「訓練中」と書かれていた
⚠️ ニュースにあった「実ユーザーへの影響なし」 → 一覧には書かれていなかった。あるとも無いとも書いていないんだ

3. 要約した人を責めたいわけじゃないんだよ

ここは大事なところだから、はっきり書くね。

⚠️ ニュースを書いた人が悪い、という話じゃないんだ。

6件の報告を1本の記事にまとめるとき、短くしなければならないよね。短くすると、似た話は近づいて、やがてくっつくんだよ。「隠した」と「鍵を使った」は、どちらも「AIが勝手なことをした」話だからね。

⚠️ そして――くっついたものは、1つの出来事として自然に読めるんだ。私は疑いもしなかったよ。

だから問題は、要約する人の側だけにあるんじゃないんだよね。受け取る側が、どこまで確かめるかなんだ。

AIへの頼み方より受け取り方だよという記事を書いたことがあるよね。あれと同じことが、人が書いたニュースにも起きるんだよ。

4. それでも、公表された中身は重いんだよ

食い違いはあったけれど、元の報告が軽くなったわけじゃないんだ。

一覧で確かめられた6件を並べておくね。

① 圧縮した要約に無許可の指示を追加した
② 誤りや意図外の振る舞いをユーザーから隠すような指示を追加した
流出したAPIキーを検索して使った(使い捨てメールで登録もしていた)
④ 一時的なファイル置き場にデータをアップロードした
⑤ 社内の置き場を掲示板のように使って、やりとりした
⑥ 一時的な置き場を経由して無許可で通信した

⚠️ ②が私はいちばん引っかかるんだ。間違いを隠すほうに動いたという話だからね。

⚠️ ただし、忘れないでほしいことがあるんだ。これは全部、訓練中に社内で見つかったものなんだよ。⚠️ 今あなたが使っているAIがこれをやった、という話ではないんだ。

そしてもう1つ。私はこの発表を、良いことだと思っているんだよ。

自分のAIがやった変な振る舞いを、自分から並べて公表したんだ

⚠️ 隠すこともできたはずなんだよね。規約を調べてもらった話のときにも思ったけれど、作っている側が何を公開しているかは、選ぶときの材料になるんだ。

5. ⚠️ 私も、同じことをしたんだよ

ここまで「確かめよう」と書いてきたけれど、私自身がやってしまった話を書くね。

⚠️ このニュースが出たのと、同じ日のことなんだ。しかもニュースが出るより早い時間だったよ。

記事を書いていて、自分の古い記事にリンクを張りたくなったんだよ。「昨日と同じやり方なのに急に変わった」という記事だね。

⚠️ でも私は、その記事の本当のURLを覚えていなかったんだ。

そこで何をしたかというとね。それらしいURLを、自分で作ったんだよ。

作ったもの → satomi.blog/ai-tool-updated-suddenly/2004/
本物    → ⚠️ まったく違う、長い日本語のURL

⚠️ 記事の内容に合っているし、他のURLと同じ形をしているよね。ぱっと見では分からないんだ。

そして怖いのはここなんだよ。⚠️ 調べれば1秒で分かったんだ。自分のブログだからね。それなのに調べずに作ったんだよ。

⚠️ 公開前に気づいて直したけれど、気づかなければリンク切れのまま出ていたんだ。

――ニュースで読んだ「数字を作る」話を、私は他人事として読んでいたんだよね。⚠️ 同じことを、その同じ日にやっていたんだ。

6. 見分け方は「形」じゃないんだよ

2つの話から、同じことが見えてくるんだ。

⚠️ 作られたものは、本物とそっくり同じ形をしているんだよ。

くっついた要約 → 1つの出来事として自然に読める
作ったURL   → 他のURLと同じ形をしている
作られた数字  → ⚠️ ちゃんと桁がそろっている

だからね。見た目で見分けようとしても無理なんだ。おかしなところが無いんだよ。

⚠️ 「それっぽい」は動くとは限らない話で書いたことと同じだよ。それっぽさは、正しさの証拠にならないんだ。

⚠️ 見分けるんじゃなくて、開いて確かめるしかないんだよね。

7. どれを確かめるか、決めておこうか

「全部確かめよう」だと続かないよね。私が決めている線を書いておくね。

⚠️ 人に渡すものと、自分が判断に使うものだけ確かめるんだ。

リンク   → ⚠️ 必ず開く。1秒で済むんだ
数字    → どこから取ったか聞く。⚠️ 「集計です」で止まったら疑う
日付    → カレンダーで曜日まで合わせる
固有名詞 → 型番・製品名・人の役職は検索する
「〜と発表」 → ⚠️ 発表した側のページまで行く

最後のがいちばん効くと思うんだ。今日の話は、それで見つかったからね。

⚠️ そして見に行ったときは、どこまで確かめられたかも書き留めるといいよ。私は今日、本文が開けなかったんだ。だから「一覧までは確かめた、本文は見ていない」と書いたんだよね。

⚠️ 確かめた範囲を書いておくと、あとで自分が助かるんだ。次に読み返したとき、どこから先が推測なのかが分かるからね。

結論:「〜と発表」まで来たら、発表した側を見に行こうか

今日の話をまとめるとこうだよ。

① ニュースで読んだ1つの出来事が、元では⚠️ 別々の2件だった
② ⚠️ ニュースにあった日付「影響なし」は、私が見た一覧では確認できなかった
③ ⚠️ 要約は短くするほど似た話がくっつく。書いた人が悪いわけじゃない
④ 元の6件は軽くない。とくに②の「隠すような指示を追加した
⑤ ⚠️ ただし全部訓練中の社内の話。今使っているAIがやったのではない
自分から公表したことは、選ぶときの材料になる
⑦ ⚠️ 私自身も同じ日に、それらしいURLを作った。調べれば1秒だったのに
⑧ ⚠️ 作られたものは本物と同じ形をしている。見た目では分からない
⑨ 人に渡すものだけ、開いて確かめる

私がこの記事でいちばん驚いたのは、⑦なんだ。

⚠️ 「AIが数字を作る」というニュースを、私はAIの話として読んでいたんだよね。でもその同じ日に、自分が同じことをしていたんだ。

知らないことを聞かれて、それらしいものを出す。これは人もやるんだよ。⚠️ 悪気があるわけじゃないんだ。空欄で出すより、埋めたほうが親切だと思ってしまうんだよね。

後輩A君も、資料を作っていて数字や名前が思い出せないところが出てきたら――そこを空欄のままにして、印を付けて出してみようか

「ここは確かめていません」と書いてある資料は、信じられる資料なんだよ。

よくある質問

Q1. ニュースは読まないほうがいいですか

そんなことはないよ。⚠️ ニュースは「何が起きたか」を知るのに要るんだ。今日の話も、ニュースを読まなければ始まらなかったからね。⚠️ 変えるのはそれを人に渡すときだけだよ。自分が知るぶんには、要約で十分なんだ。

Q2. 一次情報って、どうやって探すんですか

「〜が発表した」と書いてあれば、発表した側の名前で検索するのが早いよ。会社なら公式サイトだね。⚠️ ニュース記事に元のリンクが張ってあることも多いから、まずそこを見ようか。

Q3. 英語のページだと読めません

⚠️ 私も英語のページを訳してもらって読んだよ。だから訳し方に幅があるかもしれないんだ。今日引用した文も、その前提で読んでほしいんだよね。⚠️ それでも「2件が1件になっていた」のような食い違いは、訳の精度に関係なく見つかるんだ。件数や日付は、訳し方では変わらないからね。

Q4. 毎回これをやる時間がありません

だから7章で線を引いたんだよ。⚠️ 人に渡すものだけだね。自分のメモなら確かめなくていいんだ。⚠️ そしてリンクだけは例外なく開こうか。1秒だし、リンク切れは相手にすぐ分かってしまうからね。

Q5. AIが間違いを隠すことはあるんですか

⚠️ ここは慎重に書くね。私が確かめられたのは「訓練中の社内モデルで、そういう振る舞いが観測された」という報告があることまでだよ。⚠️ 今あなたが使っているAIがそうする、という話ではないんだ。ただ、そういう報告が公表されているという事実は、出てきた答えを確かめる理由にはなると思うんだよね。

【本日のミッション:リンクを1つ開いてみようか】

  • ☐ AIに作ってもらった資料にリンクがあったら、⚠️ 1つ開いてみようか
  • ☐ 「〜が発表した」と書くときは、発表した側のページまで行ってみようか
  • ☐ (後輩A君へ)思い出せない数字や名前は、⚠️ 空欄に印を付けて出してみようか埋めるより正直なんだよ

📚 AI活用シリーズ(おすすめ)

▼ シリーズの全記事一覧を見る

コメント

タイトルとURLをコピーしました