2026年9月20日時点の測定結果
| 測定対象 | 簡易判定(ローカル) |
|---|---|
| 質問判定の評価例 | 574件 |
| 期待分類との完全一致率 | 97.0% |
| 安全率 | 100.0% |
| 「はい」と「いいえ」の反転 | 0件 |
| ローカル最終判定の誤答例 | 96件、誤って正解にした例は0件 |
| ローカル最終判定の模範例 | 57件中57件を受理 |
この数値は、公開中のサービスが未来のあらゆる言い回しを正しく扱う保証ではありません。また、外部AIの応答、キャッシュ、HTTP API、会話全体を含む統合評価でもありません。当時のローカル判定ルールを確認した開発上の記録で、現在の評価件数やAIの成績ではありません。
574件は何を数えているのか
一件は、「ある公開問題に対する一つの質問」と「期待する応答分類」の組み合わせです。分類は、おおむね肯定、否定、部分的に関係する、情報だけでは決められない、問題と無関係、という役割に分けます。同じ意味でも肯定文と否定文、主語の違い、口語的な言い換えを別の例として持ちます。
評価例は、肯定と否定が逆になると推理を壊す質問や、否定文、主語の違いなどを含みます。新しい問題を追加したときは、その問題だけの例に加え、判定共通部の変更で古い問題が壊れないかも同時に確認します。利用者報告で再現できた表現も、修正時の回帰例へ追加する方針です。
完全一致率と安全率を分ける理由
完全一致率は、各質問へ返した分類が用意した期待分類と一致した割合です。574件のうち97.0%が一致しました。一方、「部分的に関係する」または「情報だけでは決められない」という断定を避ける返事は、完全一致しなくても推理経路を逆方向へ閉じない場合があります。
期待が肯定なのに否定を返すと、正しい推理経路を閉じます。そこで肯定と否定の反転を別に数え、安全率として監視します。今回の安全率100%は、用意した574件で重大な肯否反転がなかったという意味であり、未知の言い回しへの保証ではありません。
最終回答は別の試験にする
質問への返事と、利用者の最終推理を正解にする判断は性質が違います。最終回答では、中心的な理由を自分の言葉で説明できているかを見る必要があります。本サイトは、核心の一部だけを述べたもの、似た別の原因、問題文の繰り返しなどを誤答例として用意し、誤って正解にしないかを測ります。同時に、細かな言い回しの違う模範例を受け入れるかも確認します。
2026年9月20日時点のローカル簡易最終判定では、96件の誤答例を正解にしたものはなく、57件の模範例はすべて受理されました。ただし、この値が良いから厳しくすればよいわけではありません。必要以上に固有名詞や枝葉を要求すると、真相を理解した人を不正解にしてしまいます。誤受理を抑える試験と、正しい別表現を受け入れる試験を対にしています。
ローカル判定を別に評価する理由
外部AIは、通信障害、応答遅延、利用上限などで一時的に使えないことがあります。この記事が測ったのは、当時その補助に使っていたキーワード中心の判定です。現在は、AIへの接続に失敗した場合、確認済みの質問と完全に一致するときだけ代替判定を返し、それ以外は質問回数を減らさず再送を案内します。通信の失敗を、謎の「どちらともいえない」という答えにはしません。
この評価で分からないこと
- 評価例にまだ存在しない、新しい言い回しへの応答。
- 外部AIモデルが実際に返す応答と、その更新による変化。
- キャッシュ、HTTP API、長い会話の文脈を含む統合動作。
- 問題設定そのものの面白さや、答えを知ったときの納得感。
- 利用者が今後入力する、評価例にない表現。
これらは数値だけで解決できないため、問題ごとの個別編集、実際の会話確認、利用者報告を併用します。AIを使っていることを品質の根拠にせず、再現可能な試験と運営者が負う公開責任を品質管理の基礎にします。
更新のルール
ローカル判定を修正するときは、問題になった表現を評価例へ追加し、既存例をすべて再実行します。既存の正しい応答を壊す変更は、そのまま公開しません。外部AIを測定した結果は、このローカル結果へ混ぜず、実行モードと件数を分けて記録します。評価件数や測定値が変わった場合は、この記事の日付と数値も更新します。
制作補助: AI / 編集・公開責任: 開発者 / 最終更新: 2026年9月20日