AIニュースを自動で記事にする仕組みを作った。間違いを載せないための工夫【96NEKO LAB開発記録 #3】
- #Claude Code
- #AIニュース
- #自動化
はじめに
AnthropicやOpenAI、GoogleなどのAI関連の新しい情報を、自動で集めて記事にしたいと考えていました。
ただ、AIに記事を書かせるときに一番心配なのが、
「間違った情報や、噂レベルの情報を載せてしまわないか」
という点です。
そこで、Claude Codeと相談しながら「確度の高い情報だけを載せる」仕組みを作りました。
ルール① 情報源は公式発表だけ
まず、情報を集める先を各社の公式発表だけに絞りました。
- Anthropic の公式ニュース
- Claude のリリースノート
- OpenAI の公式ニュース
- Google DeepMind の公式ブログ
- Google の AI 公式ブログ
- GitHub の公式の更新情報
SNSの投稿や噂、まとめサイトは最初から集めません。曖昧な情報をあとから見分けるより、入り口で入れないほうが確実だからです。
ルール② AIの要約を、原文と照らし合わせる
記事ができるまでの流れはこうです。
公式発表を集める
↓
ニュースとして載せるべきか選ぶ
↓
AIが日本語で要約する
↓
要約の内容ごとに、根拠になる原文の一文を付ける
↓
その一文が原文に本当にあるか、機械的にチェック
↓
要約の数字が原文にあるかもチェック
↓
全部通ったものだけ公開ポイントは、AIの判断だけに頼らず、
「根拠の一文」と「数字」を機械でもチェックする
ところです。AIがそれっぽい根拠を作ってしまっても、原文になければはじかれます。
また、企業の導入事例やイベント告知などは「ニュースではない」として見送るようにしました。
テストで見つかった問題
実際に動かしてみると、いくつか問題が見つかりました。
OpenAIの記事ページが読めない
OpenAIの記事ページは、プログラムからのアクセスが拒否されていました。
ブラウザのふりをして読み込むような回避はせず、公式の更新情報(RSS)に入っている短い概要文だけで記事にし、そのことを記事にも書く形にしました。
関連記事の欄を本文だと思って読んでいた
あるページでは、本文ではなくページ下の「関連記事」の欄だけを読み取っていました。
今は、読み取った文章に記事のタイトルや概要が含まれていなければ、本文として使わないようにしています。
Googleが付けたAIの要約が混ざる
Googleのブログには、Google自身がAIで作った要約の欄があります。これは原文ではないので、自動で取り除くようにしました。
いつの情報かも分かるように
ニュースは「いつ出た情報か」が大事なので、各記事に
- 公式に発表された日時(日本時間)
- このサイトが情報を取得した日時
- 出典(公式ページへのリンク)
を表示しています。時刻が公式ページに書かれていないものは、日付だけを表示します。
実際の記事は、記事一覧の「AIニュース」から見られます。
やってみて感じたこと
テストで問題が見つかったときに、ごまかさずに「ここがうまくいっていない」と報告してくれたのが良かったです。
自動化しても、最初のうちは記事を自分でも読んで確認しようと思います。
次の記事では、この仕組みを1日3回、自動で動かすようにした話を書きます。